茉莉花
新闻网
2026-09-03 · 星期四近12小时收录 30 条最近更新 07:07

快讯Gemini 3.8 Flash上线 六周连发三代但实测拉胯

Gemini 3.8 Flash上线 六周连发三代但实测拉胯

转载信息出处与时间记录
内容性质
全文转载(非本站原创报道)
原始出处
爱范儿
原文作者
彭海星
原文发布
本站收录

以近乎下饺子的速度,Gemini 又双叒更新了。

今天凌晨,Gemini 3.8 Flash 正式上线。这已经是 Google 在六周之内发布的第三款 Flash 模型

Image

看起来,Google 要把「小步快跑」的战略贯彻到底。但我比较担心的是,按这个速度,在 Gemini 4 出来之前 3.x 的版本号好像不太够用了……

从版本号上看这只是一个常规更新,但 Google 给 Flash 系列模型安排的任务却越来越重。官方说法称,它的目标是编写和修改大型项目、反复调用工具、独立完成持续数小时的复杂工作。

这些一般用来衡量顶级 Agentic 模型的活儿,如今都委派给了 3.8 Flash。

Image

Flash 系列原本的意义是跑得更快、花得更少,但现在,它不得不代替迟迟没有出现的 3.5 Pro,证明 Google 仍有能力留在牌桌上。

看官方跑分,Google 似乎真的做到了;但社区反馈和我们的简单测试得出了一个相反的结论:

六周连更三代,Gemini 3.8 Flash 依然「圣质如初」。

三周一个新模型,跑分已逼近 Opus 5

Google 将 Gemini 3.8 Flash 称为「迄今最聪明的 Flash 模型」,主要面向长程软件工程、自主 Agent 和复杂企业工作流。

话都这样说了,那最显眼的提升自然是编程。

在测试长程软件工程能力的 DeepSWE v1.1 中,Gemini 3.8 Flash 拿到 71.0% 的成绩,相比 3.7 Flash 的 65.3% 又提高了近 6 个百分点,距离 Claude Opus 5 的 74.0% 只剩一步之遥——要知道,一个半月以前的 3.6 Flash 只有 49%。

Image

而在跨越 STEM、人文和专业知识的 HLE-Verified 中,3.8 Flash 得分 54.9%,略高于 Opus 5 的 54.4%。

在部分多模态测试中,优势甚至更为明显:复杂图表理解测试 CharXiv Reasoning 得分 86.2%,超过 Opus 5 的 83.7%;采用 Agent 模式处理长视频时,LVBench 得分达到 87.8%,更是碾压 GPT-5.6 Sol 和 Opus 5 在内的一众顶级模型。

Image

金融和法律也是 Google 重点宣传的方向。3.8 Flash 在 Vals Finance Agent V2 和 Harvey’s Legal Agent Benchmark 中均超过 3.7 Flash 及其他更昂贵的前沿模型。

Image

只看这些数字,一款价格远低于 Opus 5 的 Flash 模型,似乎已经在编程、图表、视频和部分专业任务中摸到了旗舰模型的门槛。

好消息是,这些能力提升算是「免费升级」,因为 3.8 Flash 和不久前发布的 3.7 Flash 价格保持一致:每百万 Token 输入 0.75 美元,输出 3.75 美元。

原则上这只是限时优惠价格,2027 年 1 月 1 日起,输入输出价格将分别恢复至 1.5 美元和 7.5 美元。

Image

其实早在 3.6 Flash 发布时,Google 就说过这优惠价只会持续到年底;但现在看来,他们更新模型的速度已经明显快过更新价格。说不定这个优惠政策,能熬走四五代模型。

Google 解释称,3.8 Flash 之所以能完成更困难的任务,主要是因为它「更加努力」。也就是说,面对复杂问题时,它会执行更多推理步骤、反复调用工具,并在过程中检查自己的工作。

Image

代价是,它可能比 3.7 Flash 消耗更多的 Token。Google 甚至建议,如果任务更重视计算效率,可以选择降低推理档位,或者继续使用 3.7 Flash。从这个角度来看,3.8 Flash 所谓的更强,似乎有相当一部分来自这种推理上的「强制超频」。

与 3.8 Flash 一起发布的还有 3.8 Flash Cyber。在顶尖大模型越狱发动攻击已经变成一种新的 benchmark 的当下,Cyber 可以说是专门给网络安全机构和网络基础设施维护者用来发现、修复漏洞的专用「补锅匠」。

Image

Google 表示,在一项覆盖 20 种编程语言的内部漏洞发现测试中,其成功率超过 70%。不过,这款模型只通过 Fairwind Program 提供给可信的网络安全机构,普通用户还是接触不到。

速度很 Flash,结果也还是 Flash

为了彰显对 3.8 Flash 的宣传所言非虚,Google 在官方博客中准备了几段炫技演示。

其中一个是完整的 3D 魔法城堡。玩家扮演巫师在城堡中探索,场景里包含谜题、环境叙事、可交互物品和完整关卡,纹理由 Nano Banana 负责生成。

另一个案例则把 Google Maps 塞进了 DOS 界面。它复刻了早年的计算机视觉风格,功能相当完善,可以搜索地点、规划路线,甚至进入街景界面。

至少从官方视频来看,这些已经是具备交互功能和基本产品逻辑的完整 Demo 了。

但 Google 说的话吧,我们也就姑且听听,毕竟前天他们还向《华尔街日报》爆料称内部工程师编程时更喜欢用 3.8 Flash 而不是 Opus 5……

结果怎样,还是要实测了才知道。

所以,我们也拿了两个类似的任务,简单测试了下 3.8 Flash 的成色。

第一项测试是利用 Three.js 搭建一个空客 H145 直升机的 3D 模型。3.8 Flash 没让我等太久,仅用不到一分钟就拆解完了需求,然后以恐怖的速度倾泻出代码;又过了 109 秒,场景和模型就都做好了。

Image

提示词:Create a realistic 3D model of an Airbus H145 helicopter in Three.js. Use the standard factory demonstrator color scheme, emphasizing the compact fuselage, Fenestron enclosed tail rotor, and detailed rotor assembly. Use clean geometry, realistic PBR materials, soft studio lighting, and a neutral background in Three.js。

单从生成速度来看,它的确对得起 Flash 的名头。

但打开看结果,有点不对劲了。功能倒是齐全的,基本光照也有,但机身细节、部件关系和运动方式都相当粗糙。跑是能跑,但和 H145 直升机的关系约等于鸡仔饼与鸡仔的关系。

一直有看爱范儿的读者应该熟悉,这正是昨天我们报道 Fable 5.1 时援引过的测试案例。怎么说呢?由奢入俭难啊……

图|X@@HarshithLucky3

第二项测试是 3D 水流模拟,要求设置可替换的地形,来模拟降雨和地表径流在地形上的移动。同样是两分钟做出来,但这个火山口好像有点漏水……

Image

提示词:Build an interactive 3D water simulation in this empty repository.Generate a procedural mountain landscape from a deterministic seed. Water must flow downhill according to the local terrain gradient, collect in depressions, and form visible streams and lakes.Use TypeScript, Vite, and Three.js. Do not use a prebuilt physics engine or external 3D assets.

这类结果的微妙之处在于,它在工程上确实不是完全失败。任务能结项,代码通常能运行,要求的功能也齐全,但显然离官方案例有着肉眼可见的距离。

X 上的首批用户反馈也出现了类似分裂。一方面,3.8 Flash 的响应速度普遍得到认可;但与此同时,它在真实编程和生成任务中依然容易草率理解需求,迅速交出一个形式完整、但细节一塌糊涂的结果。

Image

图|X@aipulseda1ly

这未必就代表着 Google 伪造了跑分。更有可能,官方和用户测试已经是完全不同的使用方式。

在魔法城堡的案例里,官方明确提到,它是由 3.8 Flash 在 Antigravity 中通过循环指令持续工作,并调用 Nano Banana 生成了场景纹理。

换句话说,官方样例里模型通常有专门设计的 Agent 框架、工具环境和明确的多轮测试标准,而我们用的时候,通常只是给它一段一次性的自然语言指令。

Google 展示的是 3.8 Flash 被整套技术栈托举之后的上限;我们接触到的,是模型单独工作时的下限。因此,3.8 Flash 有可能是个不错的 Agent 零件,但离单独撑起一套可靠的自主工作流还有距离。

Image

图|X@adxtyahq \| 看见球丝滑入墙的一瞬间谁绷得住呢?

更值得注意的是,Google 声称 3.8 Flash 会更认真地推理、调用工具和检查结果,但实际体验很难感受到这种「勤奋」。哪怕将推理等级调到最高,它给人的感觉也不是深思熟虑规划后作答,而是快速堆出一个能交差的结果。

Google 原本想证明,Flash 模型也能在部分场景干旗舰模型的重活,但至少现阶段,它的判断力、稳定性和完成度和旗舰模型相比还是有很明显的差距。

模型之间,等级森严。

Google 不争第一,反而可能赢得更多

就在 3.8 Flash 发布前一天,Google AI Studio 负责人 Logan Kilpatrick 放出了一段与 Google DeepMind 新掌门人 Koray Kavukcuoglu 的访谈。

Image

Koray 在采访中承认,Google 当前的模型「略低于前沿」,但也相当直接地回应了外界关于 Google 已经放弃最强模型竞争的说法:

除了站在前沿,没有别的事情对我们更重要。我百分之百确定,我们会回到前沿。

但表态和现实是两回事。爱范儿此前获悉,Gemini 3.5 Pro 交付失败之后,Google 短期内不再押注 Fable、Opus 级别的超大规模模型,而是将更多资源转向成本更低、迭代更快的 Flash。

当然,这不代表 Koray 说的是空话。Gemini 4 仍然承担着带领 Google 重返第一梯队的长期目标,但不在第一梯队,人也是要吃饭的——在那之前,Flash 要负责守住用户、产品、开发者和收入。

不过,「前沿」有时是一种诅咒。

OpenAI 即将推出的 Astra 已经达到了所谓「关键级」网络安全能力,可以在较少人工介入的情况下发现未知漏洞;研究者也担心,下一代模型可能逐渐采用越来越难观察内部推理过程的架构,让依靠思维链监控危险行为变得更困难。

Image

Anthropic 的 Fable 5.1 则展示了另一种代价——它的能力大幅领先,但社区反馈表示,长任务、子 Agent 和复杂工作流甚至会在两个简单问题后就吞噬掉 Max 订阅计划的五小时额度。

当前沿模型继续前进,它们带来的还有更难控制的能力、更昂贵的推理过程,以及监管机构的巨大压力。

从这个角度来看,3.5 Pro 的失败未必完全是坏事。

转向 Flash 以后,Google 可以将数月一次的前沿模型豪赌,变成像普通软件一样持续更新。新的 Flash 模型可以迅速进入 Gemini App、AI Studio、Antigravity 乃至 Google 搜索,在真实使用中暴露问题,再以「周更」的节奏修修补补。

Image

图|Android Police

如果 3.5 Pro 没有失败,Google 未必会这么决绝地走上这条路。

Gemini App 的月活跃用户已经超过 10 亿,成为 Google 历史上增长最快的产品;从去年五月至今,它增加了约 6 亿用户。

可见,增长不需要最强的模型。

大多数人不会让 AI 独自连续工作九个小时,也不会要求它发现零日漏洞。他们只是想搜索资料、修改照片、总结邮件、做心理咨询或者写一篇小说给自己看。这种时候,没有被长程任务优化污染的 Gemini,反而能写出更好的文字。

即将在中国市场补上空缺的 Apple Intelligence 也是如此。它首先要解决的是通知、文本、图片、Siri 和跨应用操作问题,而非在 benchmark 中击败谁。

Image

对于要被塞进数亿台手机、浏览器和办公软件的 AI 而言,速度快、成本低、能够高并发运行,比拿下排行榜第一更重要。

Image

图|3.8 Flash 惊人的输出速度

退出最强模型的消耗战,可能是一门更轻松的生意。

可这也意味着,在 Gemini 4 真正出现之前,为 Google 技术力代言这项工作只能由 Flash 强行顶上。

于是,Gemini 3.8 Flash 成了一款绝无仅有的奇怪模型。

Image

图|Artificial Analysis

它既要足够快、足够便宜,塞进搜索、手机和十亿人的日常;又要像旗舰模型一样长时间工作、反复调用工具,承担复杂编程和 Agent 任务。

理想很美,现实很糟。两种相反目标的张力之下,3.8 Flash 只能在官方跑分里冒充一会儿 Pro 的样子。

更正与撤稿0 条记录

本文暂无更正或撤稿记录。若本文发布更正、澄清或被撤稿,相关说明将按时间顺序列于此处。版权异议或撤稿请求:见 版权与撤稿,或致函 [email protected]