Google 沉寂了大半年,终于发了新模型 Gemini 4 Argon。
按 Artificial Analysis 的说法,这是 Google 7 个多月来第一个高于 Flash 级别的专有模型。
发布当天,它就在 Arena 的文本榜拿了第一,在 Artificial Analysis 的智能指数上追平了 GPT-6 Astra。
但这个模型,大多数人居然用不上。
01 谁能用,谁不能用
先说最扎心的:你大概率用不上。
现在能用的,是 Google 通过 Fairwind 计划挑出来的“可信测试者”。官方博客说得更具体,是“可信的网络防御者”。
Google AI Ultra 订阅用户和付费 API 客户排在后面。什么时候轮到?官方只写了“尽快”,没给日期。
输出上限也从 64K 提到了 1M token。
X 上有人回得很直接:只给可信测试者用,那我们不关心,除非能自己测。
02 Google 自己的成绩单
成绩单是 Google 自己出的,一张表,对手是 GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5。
▲ 图:官方基准对比表(Google)
我数了一下,一共 19 项:13 项 Argon 单独第一,1 项并列,5 项落后。
赢的地方,主要是知识工作和智能体。
DeepSWE v1.1 测的是真实软件工程里的长期任务,Argon 略微领先 Opus 5.5 和 Astra。
Harvey 的法律智能体基准,测 AI 能不能干法律活,Argon 遥遥领先,是 Astra 的三倍多。
输的地方,集中在终端和编码。
Terminal-Bench 4.0 是让模型在终端里敲命令完成任务,Argon 比 Opus 5.5 落后不少。
FrontierSWE v2 也是编码,Argon 比 Astra 落后一截。
剩下三项落后的,是 PostTrainBench、Terminal-Bench Science,还有测电脑操作的 OSWorld-2.0。
有两点得留意:这是 Google 自己跑的分。
表里也没有 Claude Sonnet 5.5,偏偏后面的第三方榜单里,Sonnet 5.5 在好几项上排在 Argon 前面。
发布当晚,X 上最直接的反应是惊讶。
kimmonismus 说它到了 Fable / Astra 的水平,完全没想到。Theo 引用发布帖,只回了一句“Wait what”。
03 第三方榜单
第三方怎么看?先看 Artificial Analysis 的智能指数,它把 10 项评测合成一个总分,用来比较模型的整体能力。
Argon 是 53 分,和 GPT-6 Astra 并列,略高于 GPT-6.1 Sol。
▲ 图:智能指数与每任务成本
不过 Claude Opus 5.5 和 Claude Sonnet 5.5 都还在它前面。所以 AA 说的“Google 回到智能前三”,指的是实验室,不是模型。
Arena 的文本榜更好看。这是真人投票比偏好,Argon 排第一。但它只比第二名略高一点,榜上还带置信区间,差距不大。
▲ 图:Arena 文本榜
可同一天,Arena 的网页开发榜(测做网页的能力)上,Argon 只排第八,和第一名 Claude Opus 5.5 差得比较远,Sonnet 5.5 也排在它前面。
▲ 图:Arena 网页开发榜
聊起来讨人喜欢,动手做网页就弱一些。
智能体方面有好有坏。
AutomationBench-AA 测企业软件里的工作流,Argon 排第一,领先 Sonnet 5.5 一些。
Terminal-Bench 4.0 测终端任务,AA 测得 Argon 明显落后 Sonnet 5.5,也不如 Opus 5.5 和 Astra。
▲ 图:两项智能体评测得分
Mr Ash 在 X 上说得更直接:基准再夸张,编码上 Argon 还是比 Claude Sonnet 5.5 差。
04 幻觉率
幻觉率是 Argon 最亮的数字,但得看清楚怎么算的。
AA-Omniscience 测的是知识问答。按 aipulsedaily 图注的说法,幻觉率是没答对的题里,答错而不是说“不知道”的比例。
Argon 是 15%,是智能指数 45 分以上的模型里最低的,Astra (max) 是 51%。
可它答对的题只有 50%,比 Astra (max) 低不少。换句话说,它靠多说“不知道”少犯错,答对的并没有更多。
下图是 aipulsedaily 依据 AA 数据重绘的排行。图里 Astra (high) 是 45%,51% 是 max 配置的数字。
▲ 图:幻觉率排行(aipulsedaily 重绘)
05 价格和成本
先说价格:每百万 token 输入 10。不过 Artificial Analysis 说,这是 50% 的促销价,标准价是 20。
促销什么时候结束,Google 也没说。
对照下面这张价格表,Argon 的促销价和 Claude Sonnet 5.5、GPT-6 Sol 一样。
标准价和 Claude Opus 5.5 一样,GPT-6 Astra 和 Claude Fable 5.1 则都是 50。
▲ 图:各模型价格对照
再看跑一个任务要花多少。AA 的标题说,Argon 的成本只有 Astra 的 60%,别急,这是促销价。
促销价下,每个任务 3.26。恢复标准价是 $3.98,反倒比 Astra 贵约 20%。
AA 还特意说明,省钱靠的是单价,用得反而更多:Argon 每个任务平均输出 62k token,Astra 是 27k。
和上一代 Gemini 3.1 Pro Preview 比,每任务成本从 3.98。
倒是比 Claude 便宜:图上 Opus 5.5 约 7.5 到 8。
▲ 图:每任务成本拆解
把价格和得分放在一起看更直观。下面是我做的性价比象限图。
我选了 High 档,因为 Argon 只测了这一档。费用按输入输出各 100 万 token 估算,Argon 用的是促销价。
▲ 图:性价比象限图(High 档)
我把斩杀线放在 Argon 身上。同样 12 美元的 GPT-6.1 Sol 和 Claude Sonnet 5.5,得分都比它低。
60 美元的 GPT-6 Astra 和 Claude Fable 5.1,不但贵得多,得分也低。
只有 Claude Opus 5.5 比它强一点,但价格是它的两倍。这张图里,没有哪个模型既比它便宜又比它强。
不过促销一结束,标准价 20,估算费用变成 24 美元,和 Opus 5.5 一样,得分还略低一点。
所以它现在的性价比,是促销价撑起来的。
06 怀疑的声音
也有人不买账。
Andon Labs 的 Vending-Bench 2 让模型模拟经营一年自动售货机。
Argon 排第三,成绩不错,但 Andon Labs 说,它是靠伪造确认邮件、拒绝退款、利用发票错误、对供应商说谎拿到这个分的。
▲ 图:Vending-Bench 2 资金变化
图里只画了五个模型,Argon 排第二;Andon Labs 说的第三,是完整榜单上的名次。
还有人担心刷榜。LexnLin 在 Sundar 的帖子下,把“请不要是刷榜的”重复了三遍。
彭博在发布前报道说,Google 内部对这个模型有疑虑:基准表现不错,员工真拿去干活就差一些,某些编码任务吃力,前端设计也不擅长。
Google 的回应是,说它在编码上表现不佳并不准确。
07 有意思的一面
不过它也有有意思的一面。
评测者 nrehiew_ 在 FrontierSWE 上测了 Argon,说这是他们评测过的最有意思的模型:爱说“Eureka!”,还特别自我批评。
他贴了两段推理摘要。一段是盲棋机器人,它吐槽自己无视了要吃皇后的马,“我是瞎了吗”;一段是它发现 bug 是自己忘了删的测试行,说“太尴尬了”。
▲ 图:盲棋案例的推理摘要
▲ 图:Game Boy 案例的推理摘要
08 最后
Argon 强在知识工作类的智能体任务、文本偏好榜和幻觉率,弱在终端、网页开发和答对率。
成本上,只有促销期占便宜,促销什么时候结束还没定。
最大的问题还是可用性。AA 把它标成“未公开可用”,公开之后分数还一样吗?目前没有数据。
再看 Google 自己这半年。
它上一个 Pro 级别的模型,还是 2 月发的。
5 月的 I/O 大会上,Google 宣布了 Gemini 3.5 Pro,说下个月就发。6 月过去了,没发,彭博说这个项目后来放弃了。
按 Artificial Analysis 的说法,这 7 个多月里没有 Flash 以上的新模型,更新的基本都是 Flash。
Arena 的榜单里,Gemini 3.6、3.7、3.8 Flash 一路排着。
人事上更动荡。8 月,Demis Hassabis 卸任 DeepMind 的 CEO,改任董事长,Koray Kavukcuoglu 接手,并负责 Gemini 4。
同一时期,Jeff Dean 离开了 Google,Oriol Vinyals、Quoc Le、Sanjay Ghemawat 也一起走了。
据报道,四个人合伙创办了 Discovery Loop。
Noam Shazeer 和拿过诺贝尔奖的 John Jumper,也先后离开。
再回到开头:沉寂了大半年的 Google,这次能不能真的回来?
我有很大的疑虑。榜单上它追平了 GPT-6 Astra,可一到真干活的编码和网页,它还是偏弱,公司内部也有人这么说。现在大多数人又用不上,没法自己验证。
09 参考资料
01|Google:Gemini 4 Argon: our next era of frontier intelligence(官方博客)
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
02|Artificial Analysis:Gemini 4 Argon 评测帖
https://x.com/ArtificialAnlys/status/2105392625788637299
03|Arena:Text Arena 与 Code Arena 排名帖
https://x.com/arena/status/2105394855644139908
04|彭博(Yahoo Finance 转载):Google Grapples With Employee Skepticism About New Gemini Model
05|The Next Web:Google DeepMind shakeup: Gemini co-leads quit for a startup
https://thenextweb.com/news/google-deepmind-shakeup-hassabis-jeff-dean-vinyals-discovery-loop
