Google发布Gemini 4 Argon:独立测试追平GPT-6 Astra,仍落后Claude Opus 5.5
Google七个月来首个前沿模型先向“可信网络防御者”开放,API定价 2 美元/百万输入token、10 美元/百万输出token,但单任务token消耗约为GPT-6 Astra的 2.3 倍。
AI解读:Gemini 4 Argon是Google七个月来首个前沿模型。Artificial Analysis的独立测试显示,它在最高推理档“High”下得分 53,与GPT-6 Astra(max)和Claude Fable 5.1持平,但Claude Opus 5.5(58 分)和Sonnet 5.5(56 分)仍领先。简单说,Google回到了第一梯队,但没坐上头把交椅。
对开发者来说,Argon的宣传期价格确实低:输入 2 美元/百万token、输出 10 美元/百万token,缓存读取约 0.10 美元。但Artificial Analysis发现,完成同一个Intelligence Index任务,Argon平均输出 62,000 token,GPT-6 Astra只用 27,000。
算下来宣传价下每任务 1.99 美元,是Astra(3.26 美元)的六成;折扣结束后涨到 3.98 美元,反而比Astra贵约两成。便宜的是单价,不是总账。
Argon输出上限从 64,000 提高到 100 万token,Google称这是行业首创,并配套Long Decode Continuation功能,让超长回复可以暂停后续传,避免推理超时。代价是模型仍然只输出文本,输入可以接受文字、图片、视频和音频。
普通用户暂时用不上。Argon先给Fairwind项目的“可信网络防御者”和Google内部团队,且不带网络安全护栏。之后才轮到付费API客户和Google AI Ultra订阅者,Google没有给出日期,只说“尽快”。
在人工偏好的Text Arena上,Argon(High)以 1,525 分排第一,领先Claude Opus 4.6(High)20 分,在编程、长查询、创意写作和中文等非英语查询上领先。但WebDev分榜只排第八,Google的模型之外,Gemini应用相比Claude Cowork和ChatGPT Work仍是短板。
Google发布Gemini 4 Argon,这是该公司七个多月来首个前沿模型,此前已经宣布的Gemini 3.5被整体跳过。
独立评测机构Artificial Analysis的早期评估显示,Argon在最高推理档“High”下Intelligence Index得 53 分,与OpenAI的GPT-6 Astra(max)和Claude Fable 5.1持平,比GPT-6.1 Sol(max)高 1 分,但仍落后Anthropic的Claude Opus 5.5(58 分)和Claude Sonnet 5.5(56 分)。
Argon先向Fairwind项目的“可信网络防御者”和Google内部团队开放,且不带网络安全护栏;之后才轮到付费API客户和Google AI Ultra订阅者,Google未给日期,只说“尽快”。
宣传价每百万输入token 2美元,但单任务消耗是Astra的 2.3 倍
Google公布了Argon的入门价格:输入token每百万 2 美元,输出token每百万 10 美元;常规价格将涨到输入 4 美元、输出 20 美元。缓存读取便宜 95%,约合每百万 0.10 美元(Google没有明确写出该数字,而是称缓存比常规输入价便宜 95%)。作为对比,Gemini 3.8 Flash的缓存折扣是 90%。
- Artificial Analysis测得,完成一个Intelligence Index任务,Argon平均消耗 62,000 个输出token,GPT-6 Astra只需 27,000 个。
- 按宣传价,Argon每个任务成本 1.99 美元,是GPT-6 Astra(3.26 美元)的 60%,但比GPT-6.1 Sol贵 2.7 倍。
- 折扣结束后每任务成本升至 3.98 美元,比GPT-6 Astra高约 20%。
- Artificial Analysis指出,Argon的价格优势来自更低的token单价,而非更高的token使用效率。
输出上限提高到 100 万token,新增长回复续传功能
Google将Argon的输出上限从 64,000 token提高到 100 万token,称这是行业首创。Google的解释是,如果模型能在一次轨迹中生成数十万token,就能更彻底地思考难题并一次解决。为支持这一点,Gemini API新增“Long Decode Continuation”功能,可暂停长回复并通过后续请求恢复,避免推理超时。输入上下文窗口保持 100 万token不变。Argon接受文本、图像、视频和音频输入,但只输出文本。
代理任务和低幻觉率是亮点,事实准确率只有 50%
Artificial Analysis称代理任务此前是Gemini模型的弱项,Argon在此有明显提升。在AutomationBench-AA上,Argon以 77.5% 排第一,领先Claude Sonnet 5.5(max)6 个百分点。在Terminal Bench 4上得分 57%,比Gemini 3.1 Pro Preview高出 53 个百分点,但仍落后Claude Sonnet 5.5(64%)、Claude Opus 5.5(60%)和GPT-6 Astra(59%)。
- 在AA-Omniscience基准上,Argon的幻觉率为 15%,远低于GPT-6 Astra(max)的 51% 和GPT-6.1 Sol(max)的 54%。
- 但同一基准的事实准确率只有 50%,比Gemini 3.1 Pro Preview低 5 个百分点,比GPT-6 Astra(max,63%)低 13 个百分点。
- 该基准综合得分Argon为 42 分,与GPT-6 Astra(43 分)、GPT-6.1 Sol(42 分)大致持平。
- Google自家基准显示Argon在多数项目中领先,有时优势明显。Vals AI的Vals Index上Argon以 68.9% 排第一,是首个登顶该指数的Gemini模型,在 22 项测试中 20 项进入前五,金融、法律、编程和安全表现突出。
人工偏好榜排第一,但Web开发只到第八
在Arena.ai的Text Arena人类偏好对比中,Gemini 4 Argon(High)以 1,525 分排第一,领先第二名的Claude Opus 4.6(High)20 分。Arena称Argon在编程、困难提示、指令遵循、较长查询和创意写作上领先,在所有评估的专业领域以及英语、中文、俄语和非英语查询整体上也排名第一。此前的Gemini 3.8 Flash(High)排在第 11 位。
- Code Arena: WebDev分榜上Argon得 1,679 分排第八,比Gemini 3.8 Flash(High)提高 96 分,从第 29 名上升,但未进入前列。
- Arena认为按性价比Argon领先:混合费率每百万token 8美元,是Text Arena排名中当前最具成本效率的模型。
- Arena测试中,中档的Sonnet 5.5也排在Anthropic顶级模型Opus 5.5之前,因此该结果需谨慎看待。
- The Decoder指出,模型表现不仅取决于模型本身,还取决于外围软件,而Gemini应用目前仍落后于Claude Cowork和ChatGPT Work,这是Google当下的弱项。