出品|虎嗅科技组
作者|黄天媛
编辑|苗正卿
头图|AI生成
当OpenAI、Anthropic等公司已经把竞争重心推向Agent,Google的新一代旗舰模型才姗姗来迟。
当地时间9月30日,Google正式发布Gemini 4系列首款旗舰模型Gemini 4 Argon。
按照Google的说法,这是一款面向真实软件工程、企业知识工作和网络安全防御的前沿模型,也是目前Gemini家族能力最强的一款模型。
这距离上一款Gemini旗舰模型已经过去了相当长一段时间。
7月彭博报道称,3.5 Pro已经比原定计划晚了数月,Google当时仍在集中补强它最大的一块短板——Coding。
今天,Google直接跳过3.5 Pro,发布了Gemini 4 Argon。
Argon在主流Benchmark上表现亮眼。但彭博报道显示,一旦进入真实工作状态,其性能会有所下降。有Google 员工认为,Anthropic和OpenAI的旗舰模型迭代速度已经快于Gemini。
一场迟到,且有争议的交卷。
长任务能力与低价策略
这一次,Argon的核心升级,在于输出窗口升级成为100万Token,是目前已公开商业模型里最大的输出窗口。作为对比,GPT-6 Astra的最大输出只有12.8万Token,Gemini上一代还仅为6.4万Token。
按照英文文本粗略折算,相当于一次生成数十万单词。这意味着,模型的复杂任务能力被显著提升,可以一次性处理过去很容易被上下文和输出长度截断的复杂任务。
在定价上,也是保持了Google一贯的性价比策略。Argon首发推广价为每百万Token输入2美元、输出10美元——输入价格与Gemini 3.1 Pro持平,输出反而从12美元降至10美元。
谷歌官方表示,Argon还在Coding和深度研究方面有非常显著的进步。
在谷歌内部,已经有数千名员工使用模型完成任务:
-
算法优化:在量子计算团队,一个Argon参与的算法优化项目只用了几分钟,就把公开基线提高了40%
-
代码迁移:在Google开源的视频解码器libgav1中,Argon Agent还基于编译器输出进行了多轮性能实验,替换了3.2万行SIMD代码。按照Google公布的结果,最终得到的Rust版本运行速度达到原Rust移植版的2.7倍,同时保持相同的视频输出结果。
再来经典跑分环节。

先看它最想证明自己的编程能力。Argon在衡量真实、长周期软件工程能力的DeepSWE v1.1上,拿下了77.9%的新高。谷歌公布的对照成绩里,Claude Opus 5.5是74.2%,GPT-6 Astra是74.1%。Argon高了约4个百分点。
而企业任务中,AutomationBench显示,Argon拿到51.3%,Opus 5.5和Astra分别是42.5%、41.4%,差距扩大到了接近10个百分点。
金融研究也有类似表现。Vals Finance Agent v2中,Argon拿到65.4%,超过Opus 5.5的58.6%和Astra的53.5%。
法律任务的数字更抢眼。Harvey的法律Agent测试里,Argon得分19.6%,谷歌列出的三个对手都没超过7%。
多模态方面,Google 表示,模型可以分析专业图表、从长视频里识别细节,并根据一系列文档采取行动。在长视频理解Benchmark LVBench中,它得到91.7%,Google称其达到当前最佳水平。
而在目前广泛关注的网络安全方面。Argon在防御型网络安全任务上的能力,并用它驱动网络安全Agent,不仅可以寻找漏洞,还能自主验证漏洞,并进一步生成补丁。
在与安全公司Wiz合作的“Scan for Good”项目,Argon已经在一套被全球医院使用的医疗软件中发现一个高危漏洞,该漏洞可能导致敏感个人信息泄露,而此前测试的其他前沿模型均没有发现这一问题。
在专门测试漏洞修复能力的CWE-bench v1上,Argon得到68%,并列第一。在Wiz自己的黑盒渗透测试中,它还可以在看不到源代码的情况下分析真实Web系统,发现攻击面、寻找漏洞,并生成PoC来验证漏洞是否真的存在。
但目前Argon 不走全面开放路线,而是通过“Fairwind 计划”先向一小批可信的网络安全防御者推出,同时正参与美国政府的自愿性发布前模型准入流程。后续才会逐步向开发者、企业和消费者开放。
不过,Argon这份漂亮成绩单也不是没有争议。
最直接的质疑来自Google内部。彭博援引直接接触Gemini 4项目的人士称,Argon虽然在主流Benchmark上表现亮眼,但员工真正把它放进工作流后,表现会明显下降,尤其在部分Coding和界面设计任务上仍会“卡壳”。
但Google方面否认了“真实Coding能力明显落后”的说法,称公司内部普遍认为Gemini 4已经处于前沿水平。
独立评测网站提醒,Argon主要在长上下文、企业知识工作和部分软件工程任务上尤其突出,并不是一个可以横扫所有Coding场景的“绝对第一”。
Google的现状
Gemini 4的出现,结束了Google过去近一年略显混乱的旗舰模型节奏。
今年以来,Google并不是没有发模型。相反,Flash产品线的迭代非常快,3.6、3.7、3.8在几个月内接连上线。
但今年6月本该出现的Gemini 3.5 Pro迟迟没有交付。到7月,Google仍然只能告诉外界,模型还在合作伙伴中有限测试。最终,这款模型被整个取消,Google直接跳到了Gemini 4。
这段空窗期让外界产生了非常多质疑,Google是不是又掉队了?
路透社称,Gemini 3.5 Pro的延期与Google DeepMind内部调整、人员变动等因素有关。Google DeepMind 的联合创始人兼CEO Demis Hassabis淡出主要管理职责,包括Jeff Dean在内的多名Gemini核心负责人离职,OpenAI和Anthropic同期还从Google挖走了明星研究人员。
今年7月,Google CEO桑达尔·皮查伊也在财报电话会上,罕见地花了不少篇幅为Google的AI战略辩护。
他反驳Google正在AI竞争中失去位置,而是强调外界“不应该只看一款Pro模型”,Google的Flash系列仍在快速迭代,Gemini 4将带来更大跃升。同时真正衡量Google AI竞争力,还要把Cloud、自研TPU和整个产品生态一起算进去。
确实,如果把视线从模型排行榜拉回到Google这家公司,“掉队”又很难成立。
Alphabet最新公布的2026年第二季度营收达到1198亿美元,同比增长24%。
其中Google Cloud收入同比暴涨82%至248亿美元,营业利润从去年同期的28亿美元升至88亿美元。Google称,Gemini模型目前每分钟处理约220亿个API Token,Gemini App月活用户已经达到9.5亿,接近九成财富100强企业正在使用Gemini Enterprise。
连一度被认为最容易被ChatGPT颠覆的搜索业务,也还没有出现衰退。
二季度Google Search及其他业务收入同比增长17%至632.7亿美元。Alphabet表示,AI功能正在推动搜索查询量增长。

这也是Google和大部分AI创业公司最大的不同。Google手里则已经有Search、Cloud、YouTube、Android、Chrome,以及自己的TPU基础设施。
少有一家企业有它那么巨大的分发和资源优势。但船大难掉头,拥有的东西越多,需要协调的人、资源也越多。
在各家都已经步入Agent大战的时候,Google的船头在哪呢?
