AInspiro
AI工具

Gemini 4 Argon 来了:最强的不只是跑分,是它先把无护栏版本交给了「可信防御者」

AInspiro 编辑部·
部分内容由 AI 辅助创作。

Google 憋了七个月,拿出的不是更快,是更敢给

9月30日,Google 发布 Gemini 4 Argon,这是它七个多月来第一个前沿模型。同一天最值得记的,不是它拿了几个第一,而是发布方式:Google 先把没有网络安全护栏的版本,交给了经过审核的「可信防御者」。

这不是小模型试水。Argon 定位在真实世界的软件工程、法律金融知识工作,以及网络防御。它把输出上限从 6.4 万 token 直接拉到 100 万,输入上下文也维持 100 万。重量级玩法第一次能一次吞下几十万 token 的复杂任务。

先把硬数字摆出来

在长程软件工程基准 DeepSWE v1.1 上,Argon 拿了 77.9%,是已公布的高分。在漏洞修复基准 CWE-bench v1 上它 68%,和 GPT-6 Astra、Grok 4.7 三方并列第一,Anthropic 的 Opus 5.5 只差一个点落在 67%。在 Zapier 的 AutomationBench 上它 51.3% 排第一。最反直觉的一项:面对间接提示注入攻击,Argon 的被攻破率只有 0.7%,是参比模型里最低的。

定价走的是「先便宜后翻倍」的套路。推广期每百万输入 2 美元、输出 10 美元,和 Astra 一个价;推广期结束涨到输入 4、输出 20,正好翻倍。缓存输入享受 95% 折扣。所以现在看着划算,等涨价窗口一到,长期跑的成本会明显抬升。

真正的新闻在发布策略,不在榜单

Argon 通过 Fairwind 计划先放给可信网络防御者,这个计划 9 月初才启动,已经有 650 多个参与伙伴。关键一句:对这批人和 Google 内部团队,Argon 是「不带网络护栏」发放的。也就是说,它能自主发现、验证、修补关键漏洞的能力,先交给了被认为「自己人」的防守方。

Google 的逻辑是双刃剑:同一个能找漏洞的能力,防守者用来补,攻击者用来 Exploit,所以门禁卡在「你是谁」而不是「你问了什么」。Wiz(Google 3月收购的子公司)在它的 Scan for Good 项目里用 Argon 扫到了一个医疗软件里的严重漏洞,能暴露全球医院系统里敏感个人信息。

泼三盆冷水,别被通稿带节奏

第一,68% 是三方并列,不是独赢。Google 自己选的基准、对比模型和设置,独立复现通常会把领先幅度收窄。而且不同模型跑了不同的 agent harness(Argon 走 Antigravity、Astra 走 Codex、Opus 走 Claude Code),比的是「模型加工具」不是纯模型。

第二,那个医疗漏洞是单条 anecdote。Google 没公布发现数量、误报率,也没说涉及什么软件、补丁上了没有。当「 illustrative 例子」看,别当统计结论。

第三,涨价是实打实的。推广期 $2/$10 看着和 Astra 同价,但结束后的 $4/$20 是硬切换,缓存折扣救得了一时救不了一世。长程任务 token 消耗本来就大,账要按翻倍后算。

长上下文是把双刃剑

百万 token 输出听着慷慨,长任务每轮都要重读上下文,token 账单随任务长度线性甚至超线性增长。Google 内部披露,Argon agent 团队释放了 300 多 TiB 内存、把最多 80 万行 C/C++ 迁到 Rust——这些是它能啃的长活,也说明它吃 token 很凶。对接时把单次任务的 token 预算当成硬指标,别只盯标价。

跟你有啥关系

如果你维护关键基础设施、或者管被广泛使用的开源代码,现在就该去问 Google 的 Fairwind 资格,而不是等全面开放。更现实的判断是:攻击者几个月内就会拿到同等能力的模型,防御者拿到提前量只是暂时的窗口。把「能自动找漏洞」当成常态威胁来布防,比盯着榜单名次有用。