茉莉花
新闻网
2026-09-04 · 星期五近12小时收录 46 条最近更新 12:14

快讯哥伦比亚作家忆遇害父亲:记忆就是不断记下

AI训练靠旧知识 运行却离不开路透社等实时数据源

转载信息出处与时间记录
内容性质
全文转载(非本站原创报道)
原始出处
界面新闻
原文发布
本站收录

文|防冷涂的蜡

近期,路透社宣布加入云数据平台snowflate的数据市场,企业可以直接调用路透社的新闻和多媒体内容,增强自己的AI应用。路透社提供自1987年以来的新闻档案和持续更新的报道,snowflate公司则通过无需复制数据的共享模式,让企业把这些内容直接接进自己的数据和AI系统。

这件事与很多人对AI的认知不同。现在的大模型已经可以总结新闻、翻译报道、撰写摘要,普通的财经分析也不难完成。既然AI已经“会写新闻”,企业为什么还要继续花钱购买路透社的新闻?

这些事实说明,AI真正进入搜索和智能体之后,“会写新闻”可能还不够。模型要继续扩展到现实业务里中,还需要另一类能力。

模型越聪明,为什么越离不开外部数据?

要理解这笔交易,先要区分模型训练和模型运行时需要的两类数据。

大模型训练使用的网页、书籍、新闻、论文和代码,首先解决的是能力问题。模型从这些材料中学习语言、概念关系、已有知识和推理方式,所以它能够解释什么是ROE,也能分析加息通常怎样影响资产价格。这些问题面对的是已经形成的知识库存。

“刚公布的财报是多少”“今晚的航班有没有晚点”“这件商品现在还有没有库存”属于另一类问题。它们未必更复杂,答案却取决于一个不断变化的外部状态。模型接受训练时,财报可能还没有发布,航班尚未起飞,仓库里的最后一件商品也没有卖出。再大的参数规模,也无法从历史语料中推理出尚未发生的事实。

聊天模型主要回答“我知道什么”。AI进入搜索、投资、旅行、购物和企业工作流以后,用户越来越多地追问“世界现在是什么状态”。这要求模型在生成答案时调用搜索结果、数据库、企业系统或数据接口,同时处理更新时间、来源可信度和数据权限。

预训练让模型获得能力,运行时数据让这些能力与现实世界保持同步。模型应用得越深入,外部数据越不只是补充材料,而会成为正确完成任务的前提。

AI能无限生成内容,为什么“新事实”反而更值钱?

AI最先压低的,是已经存在信息的加工成本。摘要、翻译、改写、资料整理和标准化文案,都建立在已有材料之上,工作主要发生在选择、组织和表达环节。

一项发表于《科学》的随机实验,对453名受过高等教育的专业人士进行了中等难度的职业写作测试。使用ChatGPT的参与者,完成任务的平均时间减少了40%,输出质量提高了18%。这组数据对应的正是信息加工环节:当基础信息已经存在,AI可以明显压缩把材料组织成文字的时间。

采访、市场价格、企业财报、实验结果和零售库存则属于另一类生产。它们的成本集中在采集、确认并首次记录一个此前未知或尚不存在的事实。记者网络、现场访问、行情采集系统、核验流程和持续维护,不会随着摘要和改写变便宜而自动消失。

生成式AI可以把一条新闻改写成很多版本,却无法替交易所产生今天的成交价格,也无法在记者完成采访之前知道采访对象刚刚说了什么。企业愿意持续采购的信息,通常具备几个共同特征:足够新、来源可靠、获取渠道有稀缺性,并且能够稳定、结构化地进入机器工作流。

AI可以无限生产内容,但不能无限生产事实。当加工和表达不再稀缺,内容产业的价值开始向事实的采集、确认和供应环节移动。

“新事实”正在怎样变成一门生意?

一旦AI必须持续获得这些信息,内容交易的方式也会随之改变。

过去几年,媒体与大模型公司的代表性合作主要围绕内容许可展开。2024年5月,OpenAi与某新闻集团达成合作,可以使用旗下现有和历史新闻内容,协议据报道五年价值超过2.5亿美元。这类合作的核心,是模型公司为一整套内容资产取得长期使用权,历史内容是其中重要的一部分。

路透社进入snowflate的数据市场展示了另一种用法。企业不需要等到下一轮模型训练,可以通过应用程序接口、数据流、检索增强生成或数据市场,在AI应用运行时调用持续更新的信息。此时企业购买的不只是内容使用权,还包括更新频率、接口能力、数据权限和持续可用性。

新闻数据服务并不是AI创造的新行业。Factiva、道琼斯这样的公司,长期在采集、验证并分发商业信息。Factiva拥有超过3.3万个全球新闻和信息来源,道琼斯每天发布超过1.7万条新闻、数据、评论和统计信息,这些内容早已通过专业金融数据平台进入机构工作流,部分还被自动交易系统直接调用。

AI带来的变化,是这套成熟的数据分发生意多了新的客户。道琼斯在2026年投资者简报中披露,已经有8000多个信息源获得面向客户生成式AI应用的授权;Factiva、约有4000个API或数据流账户,同时已经签下约20笔生成式AI企业客户交易。这几组数据承担的角色不同:4000个账户体现既有数据分发基础,20笔交易直接对应生成式AI新增需求,8000多个授权源则决定AI客户能调用多大范围的内容。

训练阶段和运行阶段,对内容的定价方式不同。前者主要围绕内容使用权定价;后者还要为更新、接口、权限管理和服务稳定性付费,更接近订阅、调用量或数据流收费。

训练语料之外,一个面向AI运行阶段的信息市场正在形成。专业数据服务没有被AI重新发明,而是在原有企业客户之外增加了一类新的机器客户。

谁会在新的内容市场里重新获得定价权?

新客户出现以后,真正重要的问题变成了:这笔钱会流向谁。

路透社的价值不取决于记者能否写出一篇比AI更漂亮的800字报道。AI企业购买的是路透社遍布全球的记者网络、现场采访、事实核验、更新速度,以及把内容转成标准化数据产品的能力。AI可以迅速复制一种写作形式,却很难复制一套长期运行的信息采集体系。

这类能力已经开始体现在类似公司的报表里。

道琼斯在2026年投资者简报中把AI明确列为高端新闻业务的增量收入来源。其企业新闻业务在2025财年实现3.52亿美元收入,占道琼斯总收入15%;到2026财年,专业信息业务收入同比又增长9%,内容授权收入继续增加。AI目前还不是这部分收入的全部来源,但它已经被公司单独列为增长变量。

与此同时,大额AI内容交易并没有平均分布到所有媒体。权威机构今年梳理行业变化时指出,现有的大型AI合作更多集中在高端报纸、通讯社和拥有成规模内容资产的机构,地方媒体和独立媒体获得收入的机会更有限。这个差异并不难理解:模型公司采购运行时数据时,更倾向于一次接入覆盖面广、更新稳定、责任边界清晰的来源。

依靠转载、二手信息整理、搜索引擎优化、摘要和标准化观点生产的机构,处于大模型最容易降低成本的环节。它们缺少独有的信息源,内容本身也更容易被其他渠道替代。相反,能够持续发现事实、验证事实,再把事实以机器可以直接调用的形式提供出去,才更容易形成新的议价基础。

最终的结果,可能是内容行业内部的进一步分层:信息生产者和内容加工者的价值差距继续拉大。前者承担发现、核验和持续供应事实的成本,后者主要依靠既有事实完成再表达。AI让后一个环节越来越便宜,也让前一个环节更接近可以独立出售的数据资产。

AI正在让“生产内容”越来越便宜,却可能让“生产信息”重新获得定价权。

智能体时代,真正争夺的是现实世界的“状态”

新闻只是运行时数据的一种。AI从回答问题走向执行任务以后,价格、库存、订单、天气和金融行情,都开始成为模型必须持续连接的现实状态。

今年5月,阿里巴巴将千问与淘宝全面打通,千问可以直接调用淘宝、天猫超过40亿件商品,并接入订单管理、物流追踪和售后服务等能力。用户通过自然语言完成商品发现和比较以后,还可以继续下单、查询物流和处理售后。

这时候,商品数据的作用已经发生变化。模型通过历史信息可以理解“这双鞋是什么”“两款手机有什么区别”,但真正进入购物流程以后,还要继续读取当前商品、订单和物流状态。商品有没有下架、订单走到哪一步、包裹什么时候送达,都不是模型训练时能够提前掌握的信息。

金融场景的变化更加直接。

同花顺在2026年半年报中披露,已经把“问财”从自然语言问答工具升级为智能投研Agent,覆盖市场研究、盘中跟踪、盘后复盘、公告解读和组合分析等场景;面向机构客户,又推出iFinD MCP,通过标准化接口把投研数据直接接入客户自己的AI环境。

这里的关键同样不只是AI能不能分析一家上市公司。模型可以学习估值方法、财务分析框架和历史市场规律,但“盘中发生了什么”“公司刚刚披露了什么公告”,必须依赖不断更新的金融数据。同花顺把金融数据库通过接口直接提供给智能体,实际上就是在补上模型与当前市场之间的这条连接。

购物和金融看起来是两种完全不同的场景,底层需求却相同:机器开始替用户采取行动以后,必须先确认现实世界现在处于什么状态。库存更新慢了一小时,聊天机器人可能只是回答错误;智能体如果据此完成采购,错误会继续进入订单、支付和履约环节。

AI竞争由此增加了一层基础设施:谁能以更低成本、更稳定的方式连接现实系统,并在执行之前取得最新、可信的数据。

智能体的能力边界,开始同时取决于模型能力和连接现实世界的能力。

结尾

路透社的新闻仍然会被AI购买,因为模型学会组织语言之后,现实世界每天还会继续产生新的事实。AI要进入搜索、投研、购物和交易流程,就必须持续获得这些变化。

生成式AI把摘要、改写和标准化内容的供给推到新的水平,采访、核验、数据采集和系统更新仍然需要持续投入。当内容越来越容易生成,能够持续获得、确认并向机器提供新事实的机构,反而更有机会把这项能力单独定价。

过去的大模型竞争争夺让AI变聪明的数据。智能体时代,又增加了一场让AI与现实世界保持同步的竞争。

更正与撤稿0 条记录

本文暂无更正或撤稿记录。若本文发布更正、澄清或被撤稿,相关说明将按时间顺序列于此处。版权异议或撤稿请求:见 版权与撤稿,或致函 [email protected]