在新标签页中打开
茉莉花
新闻网
2026-10-07 · 星期三近12小时收录 93 条最近更新 09:13

快讯播客 半卷书|国庆杂谈:跟袁枚学说话

彭博报告称中国AI模型只落后美国3% Anthropic指DeepSeek等大规模提取Claude能力

茉莉花综合报道

一名女子指着店里屏幕上的菜单,菜单写着“免费 token”和deepseek-v4-flash模型

彭博行业研究分析师利亚(Robert Lea)10月5日发表报告说,自从DeepSeek今年9月推出V4.1 Flash模型以来,中国顶尖人工智能模型在基准测试中的得分只比美国对手落后3%,差距降到历来最小;今年初这个差距是15%,5月是9%,现在是3%。利亚说,模型性能持续改善,意味着中国公司有望拿下更多市场份额。

彭博行业研究算的中美顶尖AI模型得分差距(%)
15%今年初9%5月3%现在

数据:彭博行业研究分析师利亚10月5日的报告

Anthropic 9月发布的威胁情报报告则说,自2月首次披露以来,它又发现并阻断了七家中国实验室对Claude的“蒸馏”攻击:在未经授权的情况下大规模、隐蔽地提取一个模型的能力,复制到另一个模型里,通常靠用盗来的信用卡、登录凭证和API密钥注册的大批假账户。报告说,可以归到DeepSeek名下的这类对话,今年7月的14天里就超过1210万次。受影响的还有中国模型的用户:报告说,DeepSeek、小米和月之暗面把自家模型和用户之间的对话转给Claude,再用Claude的回答作训练数据,其中有个人用户、大型跨国公司和国家相关机构的敏感信息;DeepSeek这样转发时没有告知自己的客户。

在评估大型语言模型的LiveBench测试中,DeepSeek V4.1 Flash得了81.1分,排全球第六;Anthropic最好的模型得分是83.4分。这是自DeepSeek去年推出推理模型R1以来,中国模型拿到的最高排名;不过,LiveBench全球前15名的模型里,中国的只有三款。DeepSeek 9月10日发布V4.1 Flash时说,这个模型参数552B,输入激活只有8B、输出激活16B,成本显著低于已知的同尺寸模型。

同一份报告说,月之暗面(Kimi的开发商)有一次在10天里把近30万条客户请求转给Anthropic,用的是由5380个假账户组成的代理网络;5月到7月可以归到它名下的这类对话超过2300万次,归到阿里巴巴名下的超过1.51亿次。月之暗面的Kimi K3发布后,在多项基准测试中的表现接近OpenAI和Anthropic最先进的模型;7月,白宫科技政策办公室主任克拉齐奥斯(Michael Kratsios)在X平台上说,“我们掌握的信息显示,月之暗面为开发K3模型蒸馏了Anthropic的Fable”。月之暗面负责企业业务的高管接受官方媒体采访时否认了蒸馏指控。

Anthropic记录到的对Claude的蒸馏(部分)
公司时间这类对话
阿里巴巴5月至7月超过1.51亿次
月之暗面5月至7月超过2300万次
DeepSeek7月的14天超过1210万次

数据:Anthropic 2026年9月的威胁情报报告

美国限制英伟达等公司的芯片出口,想遏制中国AI的发展;彭博行业研究的报告则把中国AI的进步归功于越来越深的技术积累,以及针对国产硬件持续优化模型。利亚也说,AI模型的排名会不断变动,表现再好也未必能变成营收,并说中国AI产业眼下集中在低毛利的Token供应上,价格战激烈,这个行业可能要到2030年才能整体盈利。

茉莉花观察

这一节是茉莉花的看法,依据是上文的事实。

我们的分析“只落后3%”是一个引人注目、却会误导人的说法。它说的是基准测试上的得分差(在LiveBench上是81.1分对83.4分);分数接近,说明不了能力是自己研发出来的。Anthropic记录到,DeepSeek在推出V4.1 Flash前两个月,就在14天里从Claude提取了超过1210万次对话,并说这种做法能用远少于自主研发的时间、算力和成本模仿前沿模型;晨星的分析师也说,许多开放模型的开发者过去都针对基准测试优化,以求更高的分数。

不同看法月之暗面否认蒸馏;Counterpoint的分析师认为,它没有足够时间用对手最新的模型训练K3,“时间线没有说服力”,单靠蒸馏也解释不了K3超过对手的表现。我们同意,工程上的进步是真的,DeepSeek说新模型的成本明显低于已知的同尺寸模型;但在Anthropic记录的大规模提取面前,用分数差说中国AI“只落后3%”,高估了中国自主研发的水平。

我们的判断年底LiveBench排行榜的第一名。我们判断,2026年12月31日LiveBench排名第一的模型仍会出自美国公司。目前最高分是Anthropic的83.4分,排第六的DeepSeek V4.1 Flash是81.1分,中国模型在前15名里只有三款;离年底不到三个月,中国模型要拿第一,得超过排在前面的五个模型。

综合联合新闻网、联合早报、美国有线电视新闻网 CNN报道
数据:DeepSeek、Anthropic

相关报道

在 Telegram 关注茉莉花

更正与撤稿0 条记录

本文暂无更正或撤稿记录。若本文发布更正、澄清或被撤稿,相关说明将按时间顺序列于此处。版权异议或撤稿请求:见 版权与撤稿,或致函 [email protected]。