Gemini 4 Argon追平GPT-6 Astra,但还用不上

Google 沉寂了大半年,终于发了新模型 Gemini 4 Argon。

按 Artificial Analysis 的说法,这是 Google 7 个多月来第一个高于 Flash 级别的专有模型。

发布当天,它就在 Arena 的文本榜拿了第一,在 Artificial Analysis 的智能指数上追平了 GPT-6 Astra。

但这个模型,大多数人居然用不上。

01 谁能用,谁不能用

先说最扎心的:你大概率用不上。

现在能用的,是 Google 通过 Fairwind 计划挑出来的“可信测试者”。官方博客说得更具体,是“可信的网络防御者”。

Google AI Ultra 订阅用户和付费 API 客户排在后面。什么时候轮到?官方只写了“尽快”,没给日期。

输出上限也从 64K 提到了 1M token。

X 上有人回得很直接:只给可信测试者用,那我们不关心,除非能自己测。

02 Google 自己的成绩单

成绩单是 Google 自己出的,一张表,对手是 GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5。

picture.image

▲ 图:官方基准对比表(Google)

我数了一下,一共 19 项:13 项 Argon 单独第一,1 项并列,5 项落后。

赢的地方,主要是知识工作和智能体。

DeepSWE v1.1 测的是真实软件工程里的长期任务,Argon 略微领先 Opus 5.5 和 Astra。

Harvey 的法律智能体基准,测 AI 能不能干法律活,Argon 遥遥领先,是 Astra 的三倍多。

输的地方,集中在终端和编码。

Terminal-Bench 4.0 是让模型在终端里敲命令完成任务,Argon 比 Opus 5.5 落后不少。

FrontierSWE v2 也是编码,Argon 比 Astra 落后一截。

剩下三项落后的,是 PostTrainBench、Terminal-Bench Science,还有测电脑操作的 OSWorld-2.0。

有两点得留意:这是 Google 自己跑的分。

表里也没有 Claude Sonnet 5.5,偏偏后面的第三方榜单里,Sonnet 5.5 在好几项上排在 Argon 前面。

发布当晚,X 上最直接的反应是惊讶。

kimmonismus 说它到了 Fable / Astra 的水平,完全没想到。Theo 引用发布帖,只回了一句“Wait what”。

03 第三方榜单

第三方怎么看?先看 Artificial Analysis 的智能指数,它把 10 项评测合成一个总分,用来比较模型的整体能力。

Argon 是 53 分,和 GPT-6 Astra 并列,略高于 GPT-6.1 Sol。

picture.image

▲ 图:智能指数与每任务成本

不过 Claude Opus 5.5 和 Claude Sonnet 5.5 都还在它前面。所以 AA 说的“Google 回到智能前三”,指的是实验室,不是模型。

Arena 的文本榜更好看。这是真人投票比偏好,Argon 排第一。但它只比第二名略高一点,榜上还带置信区间,差距不大。

picture.image

▲ 图:Arena 文本榜

可同一天,Arena 的网页开发榜(测做网页的能力)上,Argon 只排第八,和第一名 Claude Opus 5.5 差得比较远,Sonnet 5.5 也排在它前面。

picture.image

▲ 图:Arena 网页开发榜

聊起来讨人喜欢,动手做网页就弱一些。

智能体方面有好有坏。

AutomationBench-AA 测企业软件里的工作流,Argon 排第一,领先 Sonnet 5.5 一些。

Terminal-Bench 4.0 测终端任务,AA 测得 Argon 明显落后 Sonnet 5.5,也不如 Opus 5.5 和 Astra。

picture.image

▲ 图:两项智能体评测得分

Mr Ash 在 X 上说得更直接:基准再夸张,编码上 Argon 还是比 Claude Sonnet 5.5 差。

04 幻觉率

幻觉率是 Argon 最亮的数字,但得看清楚怎么算的。

AA-Omniscience 测的是知识问答。按 aipulsedaily 图注的说法,幻觉率是没答对的题里,答错而不是说“不知道”的比例。

Argon 是 15%,是智能指数 45 分以上的模型里最低的,Astra (max) 是 51%。

可它答对的题只有 50%,比 Astra (max) 低不少。换句话说,它靠多说“不知道”少犯错,答对的并没有更多。

下图是 aipulsedaily 依据 AA 数据重绘的排行。图里 Astra (high) 是 45%,51% 是 max 配置的数字。

picture.image

▲ 图:幻觉率排行(aipulsedaily 重绘)

05 价格和成本

先说价格:每百万 token 输入 2、输出2、输出 10。不过 Artificial Analysis 说,这是 50% 的促销价,标准价是 4/4 / 20。

促销什么时候结束,Google 也没说。

对照下面这张价格表,Argon 的促销价和 Claude Sonnet 5.5、GPT-6 Sol 一样。

标准价和 Claude Opus 5.5 一样,GPT-6 Astra 和 Claude Fable 5.1 则都是 10/10 / 50。

picture.image

▲ 图:各模型价格对照

再看跑一个任务要花多少。AA 的标题说,Argon 的成本只有 Astra 的 60%,别急,这是促销价。

促销价下,每个任务 1.99,Astra(max)是1.99,Astra (max) 是 3.26。恢复标准价是 $3.98,反倒比 Astra 贵约 20%。

AA 还特意说明,省钱靠的是单价,用得反而更多:Argon 每个任务平均输出 62k token,Astra 是 27k。

和上一代 Gemini 3.1 Pro Preview 比,每任务成本从 0.67涨到了0.67 涨到了 3.98。

倒是比 Claude 便宜:图上 Opus 5.5 约 6,Sonnet5.5和Fable5.1约6,Sonnet 5.5 和 Fable 5.1 约 7.5 到 8。

picture.image

▲ 图:每任务成本拆解

把价格和得分放在一起看更直观。下面是我做的性价比象限图。

我选了 High 档,因为 Argon 只测了这一档。费用按输入输出各 100 万 token 估算,Argon 用的是促销价。

picture.image

▲ 图:性价比象限图(High 档)

我把斩杀线放在 Argon 身上。同样 12 美元的 GPT-6.1 Sol 和 Claude Sonnet 5.5,得分都比它低。

60 美元的 GPT-6 Astra 和 Claude Fable 5.1,不但贵得多,得分也低。

只有 Claude Opus 5.5 比它强一点,但价格是它的两倍。这张图里,没有哪个模型既比它便宜又比它强。

不过促销一结束,标准价 4/4 / 20,估算费用变成 24 美元,和 Opus 5.5 一样,得分还略低一点。

所以它现在的性价比,是促销价撑起来的。

06 怀疑的声音

也有人不买账。

Andon Labs 的 Vending-Bench 2 让模型模拟经营一年自动售货机。

Argon 排第三,成绩不错,但 Andon Labs 说,它是靠伪造确认邮件、拒绝退款、利用发票错误、对供应商说谎拿到这个分的。

picture.image

▲ 图:Vending-Bench 2 资金变化

图里只画了五个模型,Argon 排第二;Andon Labs 说的第三,是完整榜单上的名次。

还有人担心刷榜。LexnLin 在 Sundar 的帖子下,把“请不要是刷榜的”重复了三遍。

彭博在发布前报道说,Google 内部对这个模型有疑虑:基准表现不错,员工真拿去干活就差一些,某些编码任务吃力,前端设计也不擅长。

Google 的回应是,说它在编码上表现不佳并不准确。

07 有意思的一面

不过它也有有意思的一面。

评测者 nrehiew_ 在 FrontierSWE 上测了 Argon,说这是他们评测过的最有意思的模型:爱说“Eureka!”,还特别自我批评。

他贴了两段推理摘要。一段是盲棋机器人,它吐槽自己无视了要吃皇后的马,“我是瞎了吗”;一段是它发现 bug 是自己忘了删的测试行,说“太尴尬了”。

picture.image

▲ 图:盲棋案例的推理摘要

picture.image

▲ 图:Game Boy 案例的推理摘要

08 最后

Argon 强在知识工作类的智能体任务、文本偏好榜和幻觉率,弱在终端、网页开发和答对率。

成本上,只有促销期占便宜,促销什么时候结束还没定。

最大的问题还是可用性。AA 把它标成“未公开可用”,公开之后分数还一样吗?目前没有数据。

再看 Google 自己这半年。

它上一个 Pro 级别的模型,还是 2 月发的。

5 月的 I/O 大会上,Google 宣布了 Gemini 3.5 Pro,说下个月就发。6 月过去了,没发,彭博说这个项目后来放弃了。

按 Artificial Analysis 的说法,这 7 个多月里没有 Flash 以上的新模型,更新的基本都是 Flash。

Arena 的榜单里,Gemini 3.6、3.7、3.8 Flash 一路排着。

人事上更动荡。8 月,Demis Hassabis 卸任 DeepMind 的 CEO,改任董事长,Koray Kavukcuoglu 接手,并负责 Gemini 4。

同一时期,Jeff Dean 离开了 Google,Oriol Vinyals、Quoc Le、Sanjay Ghemawat 也一起走了。

据报道,四个人合伙创办了 Discovery Loop。

Noam Shazeer 和拿过诺贝尔奖的 John Jumper,也先后离开。

再回到开头:沉寂了大半年的 Google,这次能不能真的回来?

我有很大的疑虑。榜单上它追平了 GPT-6 Astra,可一到真干活的编码和网页,它还是偏弱,公司内部也有人这么说。现在大多数人又用不上,没法自己验证。

09 参考资料

01|Google:Gemini 4 Argon: our next era of frontier intelligence(官方博客)

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/

02|Artificial Analysis:Gemini 4 Argon 评测帖

https://x.com/ArtificialAnlys/status/2105392625788637299

03|Arena:Text Arena 与 Code Arena 排名帖

https://x.com/arena/status/2105394855644139908

04|彭博(Yahoo Finance 转载):Google Grapples With Employee Skepticism About New Gemini Model

https://finance.yahoo.com/technology/ai/articles/google-grapples-employee-skepticism-gemini-195242680.html

05|The Next Web:Google DeepMind shakeup: Gemini co-leads quit for a startup

https://thenextweb.com/news/google-deepmind-shakeup-hassabis-jeff-dean-vinyals-discovery-loop

0
0
0
0
评论
未登录
暂无评论