谷歌发布 Gemini 4 Argon:长周期代码工程测试得分 77.9%,超 Claude Opus 5.5
谷歌 9 月 30 日发布迄今最先进 AI 模型 Gemini 4 Argon,聚焦长流程软件工程、企业知识工作与网络安全防御。其单次输出上限提升至约 100 万 tokens,DeepSWE v1.1 得分 77.9%,超过 Claude Opus 5.5 的 74.2% 和 GPT-6 Astra 的 74.1%,但暂未面向公众全面开放。
谷歌于 9 月 30 日推出 Gemini 4 Argon,并将其定义为公司当前最先进的 AI 模型。该模型并未全面向公众开放,定位集中在三个方向:长流程软件工程、企业知识工作以及网络安全防御。
据谷歌介绍,Gemini 4 Argon 在真实世界软件工程测试中创下纪录,网络安全基准测试并列第一,并在金融、法律等专业任务基准中处于领先位置。谷歌 DeepMind Gemini 产品负责人 Tulsee Doshi 表示,Argon 是一个功能全面的模型,在多个领域都具备前沿能力。
在关键性能指标上,谷歌宣称 Gemini 4 Argon 的 DeepSWE v1.1 得分为 77.9%,高于 Claude Opus 5.5 的 74.2% 和 GPT-6 Astra 的 74.1%。该模型单次输出上限达到约 100 万 tokens,较此前的 64,000 tokens 大幅提升,可处理大型代码库、长文档和多阶段任务。
安全防御方面,谷歌对 Gemini 4 Argon 进行了专门训练,使其在网络安全防御方面能力突出,较 3.8 Flash Cyber 有显著提升。在评估模型修复安全漏洞能力的 CWE-bench v1 测试中,谷歌也给出了相应成绩。
整体来看,Gemini 4 Argon 在编码和知识工作基准中达到最先进水平,在多个方面优于 OpenAI 的前沿模型 GPT-6 Astra。不过,该模型目前仍处于有限开放阶段,尚未面向公众全面推出。