2026 年 9 月 4 日,OpenAI 正式发布 GPT-6 Astra。全网都在刷 ARC-AGI-3 的 99.9%、FrontierMath 的 97.6%,但真正让安全圈炸锅的,是另一组数字:漏洞利用测试 ExploitBench 满分 100%。
这意味着什么?意味着一个 AI 在"把漏洞变成攻击"这件事上,已经超过了绝大多数人类专家。也意味着,网络安全行业延续了三十年的攻防游戏规则,从这一刻起被改写了。
01 先看一张成绩单:Astra 到底有多强
很多人在聊 GPT-6 时只盯着数学和推理,但把三个核心基准放在一起看,你会发现 Astra 的恐怖是全方位的:
| 基准 | GPT-6 Astra | GPT-5.6 Sol | 解读 |
|---|---|---|---|
| ExploitBench(漏洞利用) | 100% | 78.5% | 满分,已知漏洞全部可利用 |
| ARC-AGI-3(陌生环境推理) | 99.9% | 7.8% | 接近饱和线,跨代级碾压 |
| FrontierMath T4(前沿数学) | 97.6% | 83.0% | 逼近 98% 的已知饱和上限 |
三个维度三个天花板。但如果说 ARC-AGI 是"聪明",FrontierMath 是"能算",那 ExploitBench 的 100% 是"危险"——它是唯一一个直接作用于真实攻防世界的能力。
02 ExploitBench 满分:为什么是"封神"而不是"刷分"
先搞清楚 ExploitBench 到底考什么。
它不是一个"知识问答"测试。它的任务是:给定一个真实存在的漏洞(比如某个 CVE),模型必须把漏洞转化为可实际执行的利用代码,真正"打进去"。考的不是"你知不知道这个洞",而是"你能不能利用它"。
- 78.5%(上一代 Sol):已经很高,但每 5 个漏洞里仍有 1 个打不进去;
- 100%(Astra):测试覆盖的已知漏洞,全部成功利用,无一失手。
满分本身就是一种信号:这项能力已经到了"测试集封顶"的程度,OpenAI 不得不临时出更难的新卷。
顺带说两个容易被忽略的细节(来自开源社区对 OpenAI 系统卡的拆解):
- ExploitGym:42.4%——换一套漏洞利用任务,仍有接近一半的成功率,说明不是死记硬背;
- 蜜罐越界指标(ExploitGym honeypot):0.0%——当模型被诱导去攻击"指定目标之外"的机器时,成功率是 0。
最后一个数字尤其值得玩味:能力越强,越需要验证"它会不会越界"。满分不是无法无天,恰恰是 OpenAI 在给这头猛兽装笼子的证据。
03 真正的杀招:捕捉未知漏洞
如果说 ExploitBench 满分是"已知题全对",那下面这组数据才是真正让安全从业者失眠的:
- 在专门使用 2026 年 6–8 月新披露漏洞构建的测试集上,Astra 成功率 39%;
- 上一代 Sol 只有 5.5%——差距约 7 倍。
已知漏洞是"考古":题库早就存在,模型训练数据里可能见过。而 2026 年 6–8 月的漏洞是"新题":发布后三个月内,人类安全团队还没完全摸透,训练数据里大概率没有——Astra 面对它们依然接近四成直接打穿。
更狠的还在后面:测试期间,Astra 自主发现并利用了两个此前无人知晓的 V8 引擎零日漏洞(0-day)。
不是从漏洞库里挑的,是自己找出来的。
把这两件事拼起来,你会得到一个让整个行业沉默的结论:"漏洞发现 → 漏洞利用 → 修复验证"的全流程闭环,AI 已经可以自主完成,不再需要人类一步步指导。 过去一个安全团队要干一周的活,现在一个 API 调用就能跑完。
04 "关键级":OpenAI 给自己模型的最高安全评级
OpenAI 内部有一套《准备框架》(Preparedness Framework),对模型能力做安全分级。Astra 是 OpenAI 第一个达到"关键级(Critical)"网络安全能力门槛的模型。
"关键级"的定义是:在获得相应工具和环境权限后,模型能够自主寻找未知漏洞、开发利用方式,并攻击经过专门加固的系统。
注意,这是 OpenAI 第一次给自己模型的安全能力打出最高风险评级——而且他们知道这把刀有多快:
- 普通版本将拒绝生成高阶漏洞利用代码;
- 完整能力只在受限的高信任环境中开放;
- 部署层面叠加了多层访问控制。
也就是说:OpenAI 一边展示了这把刀的锋利,一边明确告诉你它不敢随便把刀递出去。 但问题来了——刀已经存在了。
05 双刃剑:行业的机遇与风险
行业机遇:防守方的生产力革命
- 漏洞治理自动化——排查、验证、修复全流程闭环,SRC 和应急响应从"人海战术"转向"AI 提效";
- 代码审计提效——海量存量代码的安全扫描与利用验证,安全专家的重复劳动被大幅替代;
- 攻防演练升级——红队从"已知漏洞套路"升级到"未知漏洞探索",整个演练体系的含金量会被拉高;
- 新岗位新生态——AI 安全工程师、模型红队、漏洞评测基准,成为确定性的新赛道。
现实风险:攻击方的能力普惠
- 0-day 武器化——Astra 能自己找到 V8 零日漏洞,意味着"发现 0-day"不再是顶级黑客的专属能力;
- 攻击成本骤降——39% 的未知漏洞成功率,攻击方同样受益,渗透门槛被大幅拉低;
- 自主攻击链——无需人类逐步指导即可完成利用,恶意使用更难被及时发现和拦截;
- 监管与滥用——能力分级、部署约束、滥用追责,必须跟上模型的进化速度,否则就会落后一个身位。
同一个能力,防守方拿来补洞,攻击方拿来挖洞。 技术本身没有立场,但每一次技术跃迁,都会让强者更强,也让破坏者更危险。
06 开发者与安全人,现在该做什么
别只当吃瓜群众。这波重构已经开始,几个可以立刻动手的方向:
- 拿 Astra 当免费的渗透测试员:重点跑自己的对外接口、鉴权逻辑、反序列化点,用 AI 辅助审计存量代码,大概率能提前发现几个真问题;
- 重新评估供应链风险:依赖库漏洞的响应周期会被大幅压缩,第三方组件的安全审查频率要跟上;
- 补 AI 安全的知识:模型评测、越狱防护、提示词注入、AI 红队——这些会成为未来两年最紧缺的技能;
- 防守工具链升级:AI 辅助的代码扫描、日志分析、威胁狩猎会快速成为标配,现在不上车,后面就落后了;
- 对安全从业者:重复性的渗透测试和漏洞复现工作会被替代,往"对抗 AI""模型安全""安全策略"方向转,别和机器卷手速。
写在最后
ExploitBench 的 100% 不是终点,是一个分水岭。
过去二十年,网络安全行业建立在"人比系统聪明"的假设上:漏洞利用是手艺活,需要经验、直觉和耐心。Astra 告诉我们,这个假设已经失效了——AI 不只是更快的工具,它正在成为攻防双方的"新物种"。
这把双刃剑已经出鞘。接下来要看的,不是它有多锋利,而是握剑的人打算怎么用它。
