GPT-6 Astra 在 2026 年 9 月 3 日 GA 后,前几天口碑是"最强模型";到 9 月 11 日左右,X 和 Reddit 上密集出现"变笨了""抽风""额度乱扣"的反馈,有人把它叫"发布后脑叶切除术"。9 月 12 日,OpenAI 的 Tibo 发了一篇事后复盘,明确承认有几个 bug 导致了质量下降。本文只做一件事:把官方复盘讲清楚,并给出开发者能直接用的排障清单。
一、现象:用户到底在抱怨什么
社区反馈的症状高度一致:
- 回答更快了,但质量更差
- 同样的 prompt,发布当天能写好代码,过几天写得像凑数
- 长任务被提前标记完成,实际活还没干完
- 多轮对话里丢失用户意图,不 follow 指令
- 配额掉得离谱,server_is_overloaded 频繁出现
这些不是个例。有开发者用完全相同的 prompt 在发布当天和几天后各跑一次,结果明显变差;也有团队直接切回了上一代模型 GPT-5.6 Sol。
二、官方实锤:9/12 复盘承认的三个 bug
Tibo 的复盘把质量下降归因到具体工程问题,而不是模型被故意削弱:
- 上下文压缩 bug:上下文管理层引入了一个 bug,表现为看似随机、难以复现的质量掉点。
- 配置错误的 engines:一部分长尾流量被路由到了次优的推理配置,导致可测量的质量下降,是部分请求而非全员中断。
- 配额相关 glitch:五小时窗口与周额度窗口的计数异常,导致部分付费用户额度被异常快速消耗,甚至返回 over-capacity 错误。
配套动作是 9 月 12 日又一次额度 reset 补偿。
三、根因:不是变笨,是系统层在调速
最准确的结论是:用户遇到了真实的生产问题,但没有证据显示模型权重被偷偷改弱。真正的原因更像是几件事叠加:
- reasoning effort 实验:OpenAI 承认对推理力度设置做过实验,直接影响模型想多久再答。
- 量化压缩与路由:高负载下,服务层会在精度、路由、后端配置上做取舍,长尾流量容易踩到次优配置。
- 配额系统 glitch:用量计量异常,和模型能力无关,但体验上像被限流。
- 蜜月期效应:一部分变笨其实是发布热度退去后,用户终于认真测,发现了模型本就存在的短板。
四、怎么自查
- 同 prompt 回放:用你 9 月 3 日到 5 日跑过的关键 prompt 再跑一次,观察输出长度、follow 指令程度、代码可运行性是否有变化。
- 看响应速度突变:同样任务从 4 秒变成 1.8 秒且质量同步下降,多半是推理力度被调低或路由到次优配置。
- 看完成信号:复杂任务 30 秒就报完成但明显没做完,是已知的 completion bug 特征。
- 看配额曲线:周额度半小时内掉几十个百分点且非重度任务,属于 glitch 而非你用得多。
五、开发者排障清单
- 把 reasoning effort 调到地板以上:Astra 移除了 temperature 和 top_p,推理力度是主要旋钮,设低了会变懒。
- 长任务拆小加自检:让模型每步输出验证点,别信已完成信号,自己跑测试。
- 监控配额窗口:Work 和 Codex 共用五小时加周额度,重活集中前先看剩余。
- 主备模型切换:Astra 抽风时,把 model 切到 OpenAI 自家的 GPT-5.6 Sol 兜底,调用代码不用改结构。
六、代码:Astra 抽风时切到自家 Sol 兜底
下面这段代码用 OpenAI 官方兼容客户端,Astra 不稳定时把 model 换成 GPT-5.6 Sol,调用结构不变。
import os
from openai import OpenAI
# easy88ai 提供 OpenAI 兼容接口,可调用 GPT-6 Astra 与 GPT-5.6 Sol
client = OpenAI(
api_key=os.environ["OPENAI_API_KEY"],
base_url="https://easy88ai.com/v1",
)
def chat(model: str, prompt: str) -> str:
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
extra_body={"reasoning_effort": "medium"},
)
return resp.choices[0].message.content
# 主用 Astra;异常时切到 OpenAI 自家 GPT-5.6 Sol,业务不中断
PRIMARY = "gpt-6-astra"
FALLBACK = "gpt-5.6-sol"
try:
out = chat(PRIMARY, "用 Python 写一个快速排序并加类型注解")
except Exception:
out = chat(FALLBACK, "用 Python 写一个快速排序并加类型注解")
print(out)
七、小结
GPT-6 Astra 的变笨是真的,但根因在系统层调速和 bug,不是模型被削弱。OpenAI 9/12 的复盘已经把三个 bug 摆上台面。对开发者来说,最稳的做法是:推理力度调到位、长任务加自检、配额盯紧、关键业务配主备模型切换。
