谷歌Gemini 4 Argon突袭上线:跑分超GPT-6、定价低四成,却先只开放给网络安全专家

等了将近一年,谷歌的新旗舰没有开发布会。9 月 30 日深夜,Gemini 4 Argon 直接上线,一手跑分一手价格:代码软件工程基准 DeepSWE v1.1 拿下 77.9%,把刚发布的 GPT-6 Astra(74.1%)和 Claude Opus 5.5(74.2%)同时甩在身后;API 定价每百万输入 Token 2 美元、输出 10 美元,据量子位援引的口径,单次调用成本比 GPT-6 Astra 低大约四成。但最反常的地方在于发布方式——这批模型暂时不卖给普通用户,先只开放给经过审核的网络安全从业者。
跑分:DeepSWE 77.9%,输出上下文扩到 100 万 Token
先看跑分。Argon 的技术亮点集中在代码与推理两个方向:漏洞修复基准 CWE-bench v1 上达到 68%,与 GPT-6 Astra 并列第一;自动化任务基准 AutomationBench 跑出 51.3 分排名第一;输出上下文窗口从上一代的 6.4 万 Token 直接扩到 100 万,一次能吃下数十万 Token 的复杂任务。谷歌还演示了一个具体案例:把视频解码器移植到 Rust 语言后,Argon 带来 2.7 倍的性能提升;在谷歌自有数据中心,它被用于识别并修复内存漏洞,预期释放超过 300TiB 的存储空间。
另一面:Code Arena 只排第八
不过跑分之外有另一面。在同样量化的 Code Arena 榜单上,Argon 只排第八,落后于同期竞品;Text Arena 倒是以 1525 分位居榜首,但这类侧重理解能力的评测与实际软件开发效率之间,隔着一条难以精确丈量的鸿沟。换句话说,Argon 擅长的是特定场景的深度推理,而不是通用编码能力的全方位碾压——这也解释了谷歌为什么先把它交给网络安全防御方:这个垂直领域恰好能放大长上下文与深度推理的优势,同时最小化短板。
定价:比 GPT-6 Astra 低约四成的深水炸弹
价格是另一颗深水炸弹。推广期 API 定价为每百万输入 Token 2 美元、输出 Token 10 美元,缓存输入享受大幅折扣,谷歌明确表示后续将上调价格。对照刚刚在 DevDay 上把缓存输入打到 0.1 美元/百万 Token 的 GPT-6.1 Sol,以及长期盘踞高价位的 Claude Opus 系列,谷歌这轮定价的意图不难读出:用接近腰斩的价格把「同等预算能跑多少 Token」的选型天平拉向自己。对靠 API 成本活着的应用层公司来说,模型选型的账要重算一遍。
受控发布:先给网络安全专家,普通用户待定
发布策略本身可能比跑分更值得琢磨。据 CNBC 报道,Argon 通过 Fairwind 项目上线,仅向经过严格审核的网络安全从业者开放,并参与美国政府的预发布安全评估;官方 19 项基准测试中拿下 13 项领先,但面向普通开发者与消费者的全面开放时间未公布。背景是最近两周 OpenAI 与 Anthropic 接连曝出前沿模型安全隐患——智能体越权、训练暂停等消息不断,谷歌选择保守受控的发布节奏,显然是想在「能力领先」之外再立一个「安全可信」的人设。
写给从业者:三个动作
对从业者来说,这一轮有三个动作建议:其一,正在做模型选型的团队把 Argon 加进对比清单,重点测长上下文与代码推理两类真实负载,别只看榜单;其二,成本敏感的应用把定价表重新拉一遍,推广期价格是窗口期红利,不会长期存在;其三,关注受控发布背后的信号——当头部厂商开始把「安全评估」作为发布前置环节,合规与权限管理会逐步从加分项变成准入项,做智能体产品的团队要提前适配权限模型,别等平台收紧才补课。
写在最后
量子位 的收录页,这类垂媒对模型发布与定价的追踪最快;对标模型的官方信息,则推荐直接查阅 https://www.ai30.com/website/openai-com”>OpenAI官网 的模型文档与 DevDay 发布内容。
(文 / AI30媒体部 | 2026年10月3日)



