谷歌发布Gemini 4 Argon:多项评测登顶,先向安全防御团队开放
Argon在DeepSWE v1.1拿到 77.9%、Vals Index 68.90%,每百万输入/输出Token定价 2 美元与 10 美元;目前仅通过Fairwind计划向通过审核的网络安全防御方开放。
AI解读:谷歌发布了新一代旗舰模型Gemini 4 Argon,距离上一代旗舰发布已接近一年。它首批只通过Fairwind计划开放给经过审核的网络安全防御团队,其他订阅用户要一步步来,普通用户暂时用不上。
Argon的定位偏向长期、复杂的深度推理任务,比如软件工程、企业知识梳理和网络安全防御。谷歌给出两个内部案例:在数据中心自主识别并部署内存优化方案,预计释放超 300 TiB内存;围绕视频解码器的Rust移植版本替换 3.2 万行SIMD代码,最终运行速度是原Rust移植版的 2.7 倍。
价格是这次最直接的变化。优惠期间Argon单题成本约比Astra低四成,每百万输入Token 2美元、输出Token 10美元。对于要跑长任务、输出上限可达百万Token的团队,成本结构比跑分更影响能不能日常用起来。
但内部评价并不统一。有接触过Gemini 4的谷歌员工认为实际编程任务没有跑分亮眼,前端界面设计仍是短板,甚至怀疑过度刷榜;另一名熟悉开发工作的员工称内部普遍认为它已达前沿水平,谷歌回应称编程表现不佳的说法不准确。
真正受影响的先是防守方。Argon能在无源代码下实时分析网络系统、发现攻击面并生成概念验证证据,谷歌对受信任防御团队放开针对网络安全任务的部分限制。至于它在真实编程和前端工作里的表现,还需要等更大范围开放后才能判断。
谷歌发布新一代旗舰模型Gemini 4 Argon。据量子位报道,该模型于 2026 年 10 月 1 日发布,目前只开放给部分经过筛选的网络安全团队,其他订阅用户得一步步来。
Argon在多项评测中登顶:衡量长期软件工程任务的DeepSWE v1.1上拿到 77.9%,高于Claude Opus 5.5的 74.2% 和GPT-6 Astra的 74.1%;网络安全漏洞修复测试CWE-bench v1拿到 68%,与GPT-6 Astra并列第一;以 68.90% 登顶Vals Index榜首,RSI指数升至第四,超过GPT-6 Astra。
定价上,优惠期间Argon单题成本约比Astra低四成,每百万输入Token 2美元、输出Token 10美元。模型支持最高百万Token输出上限,面向编程、金融和法律等复杂工作流。
跑分:代码与文本赛道领先,网页开发仍落后
在第三方评测中,Argon于Text Arena以 1525 分位居第一,在代码编写、高难度提示词、指令遵循、长查询以及创意写作赛道优势显著。
在评测网页开发的Code Arena中排名第八,较Gemini 3.8 Flash High提升了 21 个名次,但依旧稍逊于Claude和GPT最新模型。Artificial Analysis测评中,Argon与GPT-6 Astra旗鼓相当,高于GPT-6.1 Sol一分,提升主要来自更少的幻觉和更强的智能体能力。
内部案例:替换 3.2 万行SIMD代码,释放 300 TiB内存
谷歌给出的内部使用案例中,Argon在谷歌各数据中心自主识别并落地内存优化方案,待方案全面部署后,预计可释放超 300 TiB内存。
另一个案例中,Argon Agent围绕视频解码器的Rust移植版本,反复实验并替换了 3.2 万行SIMD代码,最终版本运行速度达到原Rust移植版的 2.7 倍。
网络安全:无源代码下分析系统,只对审核过的防守方开放
谷歌重点强调Argon的防御性网络安全优势。官方称它能自主发现、验证并修补 20 多种语言的关键软件漏洞;在Wiz内部黑箱渗透测试中,模型可在无源代码下实时分析网络系统,发现攻击面、识别漏洞并生成概念验证证据。
为防止滥用,Argon首批进入谷歌的Fairwind计划,面向经过审核的网络安全防御方。对受信任的防御团队,谷歌会放开针对网络安全任务的部分限制,Argon将帮助防守方补洞,以及用来寻找攻击入口。
内部质疑:编程实际表现与前端设计被指不如跑分
有小道消息称,谷歌内部员工对Gemini 4并不完全看好。一些接触过Gemini 4的员工认为,模型在实际编程任务中并没有跑分那么亮眼,网页和应用的前端界面设计仍是短板,甚至存在过度刷榜的嫌疑。
另一名熟悉开发工作的员工则表示,内部普遍认为Gemini 4已达到前沿水平。谷歌回应称,说它编程表现不佳并不准确。模型实际表现仍有待观察。