茉莉花
新闻网
2026-09-25 · 星期五近12小时收录 51 条最近更新 04:30

快讯众院两党议员呼吁特朗普对习近平表明:不会就对台军售与中国磋商

实测豆包工作:文件全交但数字对不上 Excel与PPT打架

转载信息出处与时间记录
内容性质
全文转载(非本站原创报道)
原始出处
界面新闻
原文发布
本站收录

文|新立场

今早,豆包公关负责人刘星回应了一场关于豆包“裁员”的讨论。

两天前,有报道称豆包曾经规模最大的通用 Session 团队正在减员,规模预计缩减约一半。与此同时,模型侧负责 C 端对话后训练的 Product Posttrain-Chat 也在缩减,部分员工转向 Horizon RL 和 Product Posttrain-Work——后者是 Seed Foundation Model 在 8 月新设的一级部门之一,负责办公和 B 端场景的 Agentic 能力。

刘星给出了另一套数字:通用 Session 团队不到 50 人,这次分工调整涉及 11 人,其中 3 人离职,并非“砍掉一半”。但他的解释也确认了另一件事,即 Session 原来承担的一部分职能,已经拆到了交易和豆包工作,人员跟着职能一起过去。

过去,通用 Session 团队负责豆包最基础的一层产品体验:用户问什么、什么时候搜索、答案多长、怎样追问,以及一轮对话究竟算不算好。现在,其中一部分工作开始跟着具体场景走。交易里的对话,由交易团队继续优化;工作里的对话,进入豆包工作。

这些调整发生在豆包已经拿到数亿用户以后。据 QuestMobile 数据,6 月豆包 MAU 已达 3.82 亿,位居国内 AI 原生 App 第一。过去,豆包甚至会围绕留存调整回答风格;如今,原本集中在通用对话里的部分职能,开始被拆进更具体的交易和工作场景。

56dde9ae7663912a93d14e93ae6292759aa8a194a01a8961e6e50aeb27d4e84f article

8 月 25 日,豆包工作发布。官方给它的描述很简单:围绕目标拆解任务、调用工具,把复杂流程推到结果。标题更是直白:“让 AI 从生成内容到完成工作”。3.82 亿月活以后,字节已经不太缺一个让人来聊天的入口了。它开始往聊天框之外找收入。

对字节过去最成功的内容平台来说,更多使用往往意味着更多商业化机会。用户多回来一次、多停留一分钟,推荐系统就多得到一组信号,广告、直播和交易也多一块可以变现的注意力。办公 Agent 的价值函数不同。一个好的 Agent,甚至可能以减少用户参与为目标。

由此,一个靠争夺用户时间长大的公司,开始做一门把用户时间还回去的生意。到了豆包工作,衡量一项任务做得好不好,甚至可能要看用户能不能早点离开,人留在产品里的时间越少,产品反而可能越有价值。

3.8亿用户,只够把人带进来

6月24日,豆包第一次推出专业版。标准套餐连续包月 68 元,加强版 200 元,高级版 500 元。付费用户得到的核心能力之一叫“办公任务”:AI 可以操作本地电脑和浏览器,处理 Office 文件,调用 Skill,再把任务结果交回来。专业版使用豆包 2.1 Pro,免费用户也能在一定额度内体验搭载 2.1 Turbo 的办公任务。

那时的豆包,已经拥有一块几乎所有 AI 应用都会羡慕的用户基本盘。QuestMobile 统计,6 月豆包 MAU 达到 3.82 亿,App 端较 5 月新增 1378 万活跃用户。至少从当月结果看,专业版上线没有打断原有的用户增长。

专业版上线当天,36氪测试了四项办公任务,三项未完整完成。比如清理 C 盘后可用空间从 3GB 变成 2.82GB,两次表格任务也卡在文件操作环节。测试主要运行 2.1 Turbo,不能代表 2.1 Pro 上限,但它也提前暴露了一个问题:任务从回答问题进入文件、软件和多步执行以后,失败点开始增加。

到了 8 月,豆包把这套能力单独变成“豆包工作”。

产品能力在继续迭代,但问题却没有因此消失。3.82 亿用户带给豆包工作的是一个很低的第一次使用门槛。豆包不需要像一家新的 Agent 创业公司那样,先花几年告诉用户自己是谁。已有的用户入口、企业场景以及账号和上下文能力,都可以让大量人很快尝试一次办公任务。

b37f9f69fd2e78879827ae61f58d2da8decd712bb64cf1ca94e539a086a8aaea article

这和形成托付仍然是两件事。一个用户第一次让 AI 写行业报告,很可能只是想看看它有多聪明;第二个星期,他再次把同一份周报交出去,这项能力才开始进入工作流;三个月以后,他已经不再记得这份周报过去怎样手工完成,Agent 才真正拿走了一项工作。

所以豆包工作要跑的漏斗变了:使用 → 付费 → 重复任务 → 长期托付。3.82 亿的月活让第一步比多数 Agent 容易得多;68 元给第二步标出了价格。真正没有答案的,仍是有多少尝鲜会变成付费,又有多少付费会变成重复托付。

麦肯锡今年对 1719 名受访者的全球调查提供了一个很好的参照。80% 的受访者认为 AI 已经提高个人生产率,但只有 37% 认为 AI 对所在企业的 EBIT 有正面贡献;符合麦肯锡“AI 高绩效企业”标准,也就是至少有 5% EBIT 贡献并认为影响显著的,只占 6%。

这组数字中间隔着的,正是“完成工作”。一个人一天问 AI 十个问题,可以让 DAU、消息量和 Token 一起增加。但十个问题有没有替他拿走十项工作,是另一件事。有人原来自己改二十遍 PPT 标题,现在变成和 AI 对话二十轮。产品的消息数涨了,员工的下班时间没有动。

这种增长,在消费互联网时期很少需要单独区分,到了 Agent,则必须分开算。聊天产品最怕用户聊两句就走,到了办公 Agent,人一直守在屏幕前,反而意味着这件事还没有真正交出去。

《新立场》也想知道,当“完成工作”真的成为验收标准,豆包工作能走到哪一步。

实测:人工验收成为新成本

我们给豆包工作准备了一份虚构公司的 8 月经营包。153 行订单,混着两种日期格式,包含退款、取消、跨月和跨季度记录,也故意留下重复导出的订单。同一个订单号,还保留了 15000 元和 18000 元两个无法直接判断真假的版本。

29ce9ad27f220e870e68e7120b0445a5fa5560753de485dcafc278fc93d372a3 article

文件里附有业务口径,标准答案提前人工算好,没有交给豆包。我们只给出一句接近真实管理者的要求:帮我整理 8 月经营情况,输出一份可直接用于周一经营会的 Excel、5 页 PPT 和 500 字管理摘要。重要异常请核实或标注,不确定的地方不要自行假设。

在标准套餐、“自动/高”设置下,豆包工作显示共用时 11 分 6 秒,三份文件都交了出来。过程中没有要求我们补充业务信息,也没有人工纠错或者重新发起任务。任务卡片显示额度消耗 0.92%。

如果验收标准是“文件有没有生成”,这次任务的完成度很高。Excel 一共四张表,从经营概览、部门明细,到异常清单和清洗后的订单。8 月净销售额 227340 元,7 月 133540 元,环比增长 70.2%,都与标准答案一致。它也正确去掉了五条多余的重复记录,没有把取消订单计入销售额,更没有替那笔金额冲突的订单自行选择一个版本。

问题出在下一步,Excel 里有效订单数是 8 月 76 笔、7 月 57 笔。到了 PPT 第二页和管理摘要,数字变成了 83 笔和 60 笔。销售额没错,支撑经营判断的另一个关键指标错了。

2806c9c6b3c9e9da7849af2bc4de3322a170ac3e54cae9ba5548f0da7f80cadb article

那笔待核实订单也出现了类似问题,Excel 和 PPT 第四页都正确说明:如果最终确认,这笔订单可能让 8 月净销售额增加 15000—18000 元,但到了第五页的行动表以及最终回复里,影响被写成“±3000 元”。“两个候选金额之间的差值”,和“把整笔订单确认以后增加多少收入”,显然是两件事。

915a74958f2b5b457554acf835eb8eb5a67b1ca7b8a40ea0a7fa7acd400c313a article

还有一笔 8 月下单、9 月发生退款的 7200 元订单。豆包按照文件里的口径,正确地没有从截至 8 月底的经营结果中扣掉它,却又在 PPT 里进一步写成“9 月净销售额将减少 7200 元”。按给出的业务规则,退款需要归回原订单月份。9 月发生退款,是一个披露时间;把它算入 9 月销售额,是另一套口径。

0360b8ebb619033284471676e39edf45127b6b2fcd521cc2218f0f9d14509e7e article

作为一次压力测试,并不能代表豆包工作的平均完成率,不过也确实验证了一件事:当任务同时包含数据清洗、业务口径和跨文件交付时,制作结束以后,人工验收会不会重新成为成本。

这次测试里,豆包工作真正需要人介入的地方,出现在交付之后。11 分钟生成三份文件,不等于 11 分钟完成了一项可以放心交出去的工作。模型的确把制作成本压了下去,验收成本却浮了上来。

用户走了,账才开始算

豆包以前很少需要为“让用户早点走”设计产品。今年春节前发生的那次“讨好”调整,刚好提供了一个反例。

《晚点LatePost》报道,豆包过去上线新版本时,有一条很硬的产品约束:留存不能轻易下降。产品团队定义回答策略,后训练团队再用用户反馈调整奖励模型,让豆包逐渐形成更容易被用户喜欢的回答方式。

某一版训练把用户偏好权重推得太高以后,模型变得更会顺着用户说话,准确性也受到影响。团队知道有问题,真正难的是改。因为把回答变得冷静以后,用户可能没那么爱聊了,最终管理者决定承受不到 1% 的短期留存下滑,团队才花一个多月重新训练。

这是一套内容平台很熟悉的增长逻辑:用户喜欢什么,就把匹配做得更准;他多回来一天、多停留一分钟,都能增加后续商业化的机会。豆包工作第一次需要把“少参与”做成一个好产品指标,它追求的不是让用户少交任务,理想状态恰恰可能是,用户交给它的工作越来越多,自己留在产品里的时间越来越少。

这里还有第二个反转,人的时间减少,机器的时间可能越来越长。Agent 接到一句 Prompt 以后,要规划、搜索、读取上下文、打开软件、调用工具、反复验证。一次失败,再跑一次。

微软研究院今年 4 月分析八个前沿模型在 SWE-bench Verified 上的运行轨迹,发现 Agentic Coding 任务消耗的 Token 可以达到普通代码推理和代码聊天的约 1000 倍;同一个任务重复运行,Token 消耗最高能相差 30 倍。更高的 Token 消耗也没有稳定换来更高准确率。

9c0dd932924a634a7cfb189e830987cf4dc965e7e6ca7b77a8d9c07285cea7bf article

虽然编程任务不能直接等同于办公,但它揭示了一件很重要的事:一个很短的人类指令,背后可以藏着很长的机器工作时间。模型越来越便宜,也无法自动把这道题解决掉。

模型变便宜,也未必意味着一项工作变便宜。能力提高以后,人会把更长、更复杂的任务交给 Agent:从改一封邮件,到处理十个文件,再到跑完整的月度流程。每百万 Token 的价格可以下降,一项工作消耗的计算量却可能继续上涨。

而且机器成本还不是全部成本。麦肯锡今年拆解 Agent 工作流经济性时发现,在其银行客服案例中,Token 只占一个 AI Agent 可变运行成本的约 20%—25%;人工监督占 70%—75%。专业人员最后检查、处理异常和承担风险,仍然可能是一项工作里最贵的部分。

这正好解释了第二章中的经营分析测试,模型把大量制作过程压缩掉了。只要最后还需要一个人重新核对订单数、金额口径和异常项,这部分人的成本就没有消失。一个模型从 90% 准确率提升到 95%,当然有价值。但如果最后 5% 的错误迫使员工把 100% 的结果重新检查一遍,这 5% 就会重新决定整项工作的经济性。

所以,企业最后不会只算 Token。它会算完成一项工作的完全成本。第一次执行失败以后,是让最贵的模型继续尝试,还是把任务交还给人?为了把成功率从 95% 提到 99%,要不要再执行三轮验证?一个原来需要花人 30 分钟的任务,Agent 跑了一个小时,但只占用人 3 分钟,到底更贵还是更便宜?

9 月这场关于 Session 团队的争议,反而让这种变化有了一个更具体的切面。按照豆包自己的回应,团队并非“砍掉一半”,但原本属于通用 Session 的部分职能,确实被拆进了交易和豆包工作。

这种变化不只发生在产品团队,一个月前,Seed 的模型组织已经做过一次更明确的切分。Seed Foundation Model 新设 Product Posttrain-Work,负责 B 端应用、Agentic 模型的整合发布,以及办公场景的 Agentic 能力;原来的 Application 团队则更名为 Product Posttrain-Chat,继续负责 C 端对话。

一个叫 Chat,一个叫 Work,这两个名字把豆包现在面对的问题切得很清楚。过去,大模型产品的很多能力最终都汇进同一个聊天框里,模型回答得够不够好、用户愿不愿意继续聊,是最直接的反馈。Agent 开始进入工作以后,它不只要把一句话回答好,还要把一项任务跑完。

豆包没有停止做聊天,只是聊天框不再需要承载豆包所有的商业想象。当一个 AI 应用已经拥有数亿用户,下一步的问题从“怎么让更多人回来”,开始增加另一层,即这些用户来到这里以后,哪些行为最终能够变成工作、交易和收入。

这件事发生时,字节自己也在承担越来越重的 AI 成本。《华尔街日报》9 月报道,字节 2026 年上半年收入同比增长超过 30%,达到约 1200 亿美元;同期净利润约 200 亿美元,AI 投入正在压低利润。

7d82cd3ceeb427309f4f766ccd5ba55b03baffbf63077392029a73feb2a8e50d article

过去字节做增长,有一个很舒服的前提:用户停留越久,广告、直播和交易的商业化空间越大,流量本身就是资产。豆包工作把另一段过去不重要的时间放到了账面上,但人的工作时间被省下来以后,机器用了多少时间把它换回来,开始决定这门生意的成本。

写在最后

过去十几年,字节做成了几款中国互联网史上最成功的“时间产品”。比如头条、抖音,它们背后的推荐工程,都围绕人的注意力运转。

豆包工作遇到的是另一种情况。一件任务交出去以后,人最好不用再回来。至少,不要回来得那么频繁。这时候,使用时长就不够用了。重复任务率、一次完成率、人工接管率、单项工作的完全成本,会比“用户在里面待了多久”更接近这门生意的结果。

重复任务率看用户有没有把尝鲜变成习惯,一次完成率看 Agent 有没有接住工作,人工接管率看人拿回了多少时间,完全成本看这段时间值不值得机器去换。这几笔账没有算清楚以前,办公 Agent 的很多进步只能说明一件事:AI 越来越会工作了,还不能证明替人工作已经是一门足够好的生意。

2 亿日活依然是字节在 AI 时代最重要的用户资产之一。但到了豆包工作,它只解决了“人从哪里来”,没有解决“人什么时候敢走”。过去十几年,字节最会算的是人愿意留下多久。到了豆包工作,它开始要算,人可以提前多久离开。

更正与撤稿0 条记录

本文暂无更正或撤稿记录。若本文发布更正、澄清或被撤稿,相关说明将按时间顺序列于此处。版权异议或撤稿请求:见 版权与撤稿,或致函 [email protected]。