茉莉花
新闻网
2026-09-23 · 星期三近12小时收录 54 条最近更新 13:35

快讯马岩松十二年设计卢卡斯博物馆落成 成首位主持西方地标的中国建筑师

Anthropic与OpenAI同日发布新模型 单价降了账单未必降

转载信息出处与时间记录
内容性质
全文转载(非本站原创报道)
原始出处
虎嗅网
原文作者
黄天媛
原文发布
本站收录

出品|虎嗅科技组

作者|黄天媛

编辑|苗正卿

头图|AI生成

AI圈真是喘口气的时间都不给留。

北京时间9月23日,Anthropic刚把Claude Opus 5.5端上桌。2小时后,OpenAI立马祭出GPT-6 Sol和Luna迎战。

Opus 5.5比上一代Opus更强了,输入、输出单价也比上一代低了20%。而GPT-6 Sol两项单价只有Astra的五分之一;Luna更夸张,每百万输出Token只要0.5美元。

不过,这轮交锋最有意思的地方,不止降价。

Opus的能力提升,把自家Fable的位置弄得有点尴尬。OpenAI推出更低单价的Sol和Luna,想扩大用户的使用范围。但模型思考时间久了,最后可能花得反而更多。

Opus一升级,Fable先坐不住了

Opus 5.5是Claude 5.5系列第一个登场的模型。

Anthropic给它的定位很高——大多数任务能做到Fable 5.1级别,典型工作负载成本比Opus 5低约40%,而输出速度还快了30%以上。

我们翻了翻Opus 5.5的跑分。

在Anthropic公布的Terminal-Bench 4.0测试里,Opus 5.5拿到66.4%,Astra是57.9%,Fable 5.1是55.8%。到了FrontierCode,Opus又以54.4%小幅领先Astra的53.3%。

但在跨应用工作流测试AutomationBench和科学Agent测试里,领先的仍然是Astra。各项测试的推理设置也有差异,离“全面打爆”还有一段距离。

46fa0a44996309f637e36abe2005a4ced4245f44384d657326a6ca8f392444ad article

比跑分更直观的,是Claude Code负责人Boris Cherny分享的一次代码迁移案例。

他们让Opus 5.5和Fable 5.1分别把HAProxy(虎嗅注:一种把网络请求分配给多台服务器的软件)从C移植到Rust(虎嗅注:C和Rust都是编程语言,这项任务相当于用另一种语言重写软件,同时保留原有功能)

两个模型都通过了几乎全部HAProxy测试,但Opus用了9.5小时,Fable用了12小时,而Opus的成本还低了51%。

当然,这是Anthropic内部分享的单项任务结果,不能代表所有项目。

但对开发者来说,活儿差不多,速度更快,钱还少一半。

这比别的好像都重要。

3c7e701204f4f161097bd07c1c4b0bf19e2167431feac087222db2926a375b06 article

最先感到压力的,可能就是Fable 5.1模型了。

它的标准API输入、输出价格分别是每百万Token 10美元和50美元,Opus 5.5则是4美元和20美元。

如果手头的活儿Opus已经能干好,用户愿意为Fable多花这笔钱吗?

OpenAI摊开价目表

OpenAI的打法有所不同。

Astra把持最高能力的位置,Sol负责复杂编程和Agent工作流,Luna接高频、相对集中的任务。

它贴心地照顾到了不同预算的用户。

按标准API价格,每百万Token输入、输出分别计算,Astra是10美元、50美元;Sol是2美元、10美元;Luna只有0.1美元、0.5美元。

同样是一百万输出Token,Astra收50美元,Luna收0.5美元,差了100倍。

对于每天要调用成千上万次的产品来说,简单工作场景的分类、提取、批量处理任务里,便宜模型只要够用就行。

第三方机构Artificial Analysis的测试也给出了实际成本变化。Sol在其测试中的单任务成本从上一代的1.99美元降到1.06美元,Luna则从0.18美元降到0.07美元。

dcf4b857916b327e57c0439447ab258340c8fa718b6671d5515c52039156712c article

单价降了,账单可不一定

确实是普降价格了,但你可别上来就急着把推理强度拉满。

Artificial Analysis测试显示,Opus 5.5在max档的能力指数达到58分,但平均每项任务生成约11.9万Token,其中约8.4万是推理Token。

同一机构测试里,max档每项任务成本是5.98美元,high档则是1.82美元,对应能力指数54分。

为了多拿这4分提升,成本涨了不少。每个Token便宜了,但推理强度拉高后,模型可能生成更多Token,最后的账单未必更低。

Sol和Luna也出现了Token消耗增加的情况,不过,降价抵消了这部分增量。

Artificial Analysis的评测也显示,Sol和Luna这次省钱,主要靠的是靠降单价,没有省消耗。

在该机构的测试中,相比各自上一代模型,Sol每项任务平均生成的Token从约2.9万增加到3.1万,Luna则从约4.1万增加到5.1万。虽然消耗更多,但由于单价降低,Sol的单任务成本仍从1.99美元降到了1.06美元,Luna则从0.18美元降到了0.07美元。

此外,能力也没有每项都涨。

在Artificial Analysis的编程指数中,Sol从55分升到57分,Luna则从43分降到41分。

接地气的变化

除了价格,这次还有个很接地气的变化。

Anthropic专门强调,Opus 5.5这次会把重要信息放前面,减少行话,改善过去又长又密的表达。

毕竟,干活已经够忙了,谁还想先读一篇AI的工作感想。

但“去啰嗦化”做得怎么样,用户的反馈并不一致。

沃顿商学院教授Ethan Mollick在早期测试后,认可Opus 5.5已经有了Fable级模型的感觉,同时也指出,近期Claude语言过于密集的问题,还没完全解决。

7a3d46f5b7870866f2e9020d3e8fca144a4eb0d5fe1e6f0ba5ad2b4b9705bb6a article

另一边,不少开发者已经开始整活。

Anthropic工程师Addy Osmani用一只Three.js里的骑车鹈鹕庆祝发布。小鸟踩起踏板,比一屏参数容易让人记住多了,这一波手搓动画的效果也让不少人感叹其视频动画能力的提升之大。

0d8a4d4059fc21d07e0bc3883642310041573835c77a4e3aa70b978d602f3af9 article

但热闹归热闹,对普通用户来说,真正决定你留下哪个模型的,还得回归性价比。

同一件事,谁能少返工几次、少花一点钱,谁才一直能够留存用户。

大模型还得卷一会儿。

更正与撤稿0 条记录

本文暂无更正或撤稿记录。若本文发布更正、澄清或被撤稿,相关说明将按时间顺序列于此处。版权异议或撤稿请求:见 版权与撤稿,或致函 [email protected]