茉莉花
新闻网
2026-09-17 · 星期四近12小时收录 76 条最近更新 23:53

快讯俄罗斯无人机击中乌克兰巴士与列车,打死五名乘客

国产开源9B模型ZDTaichu5.0 空间理解8项测试断层第一

转载信息出处与时间记录
内容性质
全文转载(非本站原创报道)
原始出处
量子位
原文发布
本站收录

鹭羽 发自 凹非寺

量子位 | 公众号 QbitAI

来了!这一次,国产多模态在物理世界也夯起来了——

九大国际权威空间理解基准测试中,八项断档第一,通用能力还能不打折。

紫东太初最新开源的通用多模态大模型ZDTaichu5.0-9B,直接把10B以下通用模型空间具身的天花板又往上顶了一大截。

这里可能就有朋友要问了,让多模态看懂真实世界,为啥值得单拎出来说?

一个字:难!

过去的多模态模型,已经能把一张图片理解得头头是道,但一旦走进真实物理世界,空间理解与行动能力往往就跟不上;而一些模型为了补足空间能力,又不得不以牺牲通用能力为代价。

能同时跑通这两件事的模型寥寥无几,效果还突出的更是凤毛麟角。

紫东太初就是其中之一,ZDTaichu5.0-9B堪称全能

b0bcfadf83aa58f5462337c6273f96a4ffaa3d58ba76edd2c72a219b2149f6bd article

眼见为实,咱们直接上效果。

73ae134f56ac18f790ade29ece21aa3e64ac9495eab31bf92abe76bc4eda0134 article

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

这是一段由ZDTaichu5.0-9B控制的美工刀具身收纳演示。

如果让人来做,应当是个非常简单的过程:拉开抽屉→放进去→再关闭。但具身不一样,一连串的动作背后都是相当细致的空间判断。

刀柄在哪里?抽屉状态如何?夹爪有没有对准?

每一步都要承接住上一步带来的变化,动作才能看起来顺,这对模型能力的考验是极为苛刻的,而ZDTaichu5.0-9B已经能完成复杂的空间理解和高层任务规划

与此同时,对于这个只有9B大小的模型,其图文理解、文字识别、数学推理和代码能力也依旧稳居第一梯队

3044d4404fe663d95045fa8b4abb459997bcf9814b7b3390b75b49f2b8381777 article

通用能力不降级,空间具身能力向上突破。

很好奇,究竟是如何做到的?

空间具身+多模态双领先

在回答这个问题之前,咱们不妨再多看几个效果感受感受。

先来几道空间具身题目尝个鲜。

从视频目标定位到三视角推理,空间判断稳准狠

第一道题「找东西」:从左至右,找到第二个银色盒子。

这个空间感知任务对于机器人来说,是后续执行任务的大前提。指错了,后面的抓取动作再准确,执行的也是另一个任务。

ea709ee9aab38c2239b570f71398d39656cda4b4a42faafa956e91743e19aafe article

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

△实测由紫东太初完成

画面中,台面挤满杯子、收纳容器和各种杂物,干扰项较多。模型得同时读懂银色这个关键属性、盒子这个对象,以及从左到右第二个这层空间排列关系。

从对比演示中看,ZDTaichu5.0-9B给出的归一化坐标(237,226)最为精准,落在目标标注区域内。

接下来难度升级,不仅要找得对,也要看得准。

这是道考验复杂空间推理的「看位置」题。

f16c06c13944ddb17c0ef7bab2fdb3e8d8ddba13701bb1f022e5e2a25ebb7df9 article

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

△实测由紫东太初完成

输入的是同一房间的三个视角。模型需要设想自己移动到绿框窗帘所在的位置,面向蓝框沙发,再判断红框柜子相对自己的方位。

其中模型得把不同画面中的对象一一对应起来,再根据新的观察位置和朝向转换参照系。

ZDTaichu5.0-9B给出了右前方,预测完全正确

再往前一步,空间判断还得回答哪里具备操作条件,给予机器人接下来的操作以方便。

比如这道「找空位」,要求在最右侧杯子的杯柄方向上,找一块空闲区域。

认出杯子只是开始,随后还要确定杯柄朝向,检查旁边是否被其他物体占用。

e9f2259651a0ae0992647c9f12c3e512c6eed419de0bc0e180facacb23a7dae9 article

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

△实测由紫东太初完成

结果也不出所料,ZDTaichu5.0-9B依旧稳稳落入正确区域

当我们把三个例子放在一起看,它们分别对应目标选择、参照系转换和交互条件判断,都在机器人执行真实物理任务中扮演关键要素。

换言之,这些基础能力都决定着具身能否从一句任务指令到真正可执行

再来看完整成绩单,模型优势就更加清晰了。

在所列的10B档位开闭源模型中,ZDTaichu5.0-9B几乎是断层领先

比如差距较大的MindCube-tiny,ZDTaichu5.0-9B的得分是78.27分,Gemma4 8B-E4B、Gemini 3 Pro和Grok 4分别是48.8462、70.87和63.56。

5aabd2a41de1e6962cedeb1430ea4f36db1d2266a49eecffb3f991acac825728 article

整个榜单把空间感知、三维推理、多视角变换、具身交互都囊括在内了,可谓是面面俱到,足见ZDTaichu5.0-9B已彻底看懂物理场景该怎么操作。

双线突破,通用能力不降级

考完空间能力之后,另一个重要问题随之而来:通用能力还hold得住吗?

这里同样有份基础能力的成绩单。

9116e9aeb1a559831e83ff055e87a7a9f51a987530c1c72e6916685206ee1cf4 article

图解理解基准AI2D达到91.48分,仅次于Gemini 3 Pro,高于其它所有对照模型。

WeMath为75.9分,同样领先;MathVista Mini为84.5分、OCRBench为85.5分,表现颇具竞争力。

除此之外,ZDTaichu5.0-9B在Agent与文本任务上也依旧表现突出,尤其是代码成绩。

9cd7779dfa4b82228a410589643382a1bb99b9781e564503a3fccd81d8625479 article

这些能力具体怎么组合起来用,科研Agent的阻尼振子求解demo给出了直观展示。

该问题要求Agent组织解析求解与Python/SciPy数值计算,并对照两种结果,最后生成相空间图、位移与速度曲线,以及分析报告。

ZDTaichu5.0-9B在整个过程中也丝毫没有掉链子,在问题理解、代码执行、结果核对和图表输出四个阶段子任务上都完美实现连续衔接,最后输出非常完整。

c978c13d130241c1fb1393870b4691e2c16fb937606c456e5f7d15d47c887690 article

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

事实上,这对于同一个9B模型是相当不容易的。

要同时兼顾空间具身能力与通用能力两条线,背后要解决的有很多,例如数据如何组织,以及复杂判断时算力怎么分配。

9B多模态大模型的空间具身能力,是怎样练成的?

ZDTaichu5.0-9B给出的解法贯穿训练推理两部分。

全栈数据生产管线:把通用能力、Agent能力以及空间具身能力全部练进模型

紫东太初先是围绕这一需求,组织了一套经过全流程验证可复用可迁移的数据工程链路。

整体包括三个渐进式成长阶段:

Step 1:预训练数据管线。

这一步数据覆盖开源图文、网页结构化文档、公开视频多视角素材和仿真渲染三维场景。

cbb7a5f49f79d77b70efc8073263141472ea0e3a92fbb2fb9e8f9b9effa5148b article

原始素材进入管线后,先通过感知哈希URL去重,再过滤低清晰度、图文不相关等较差的样本,随后进行内容重写解析和视频抽帧描述,最终打包组织成可训练的图文与时序输入。

最终建立的是视觉、语言、时序和空间概念之间的对齐联系。

Step 2:监督微调数据管线。

随后训练开始覆盖完整任务。

开源SFT指令、真实业务问答、空间具身案例,以及Agent工具调用轨迹,都被组织成多轮对话、多图和视频序列。

bb113a4ccc8f216a7172c7be182545a4d1c5e720c35f93187be5585d72deff4f article

其中针对具身样本,管线还会检查图像、问题、对象关系和操作约束是否一致。还是以开头的美工刀收纳举例,如果图中抽屉关着,模型就不能直接要求夹爪往里放东西。

带步骤的思维链也要经过拒绝采样、格式和一致性校验。这样进入训练的,才是有视觉依据、能解释操作顺序的任务样本。

Step 3:高质量退火+GRPO强化学习数据管线。

最后一步继续针对短板优化。

团队为数据建立能力域-难度-质量标签三维自动标签系统,为模型筛选高信息量样本。

值得注意的是,评测数据不会直接作为训练样本,标签也只是用于提供能力分类与样本筛选的参照。

GRPO则把答案是否正确、空间坐标是否命中、输出格式是否合规,都通通转化成可自动校验的奖励信号,让模型沿着具体反馈继续改进。

于是在层层递进之后,物体识别、空间关系和任务约束都开始逐步连接起来。

未来即使是企业自己的车间录像、实验操作记录和仿真素材,也都可以通过这条路径转化成训练样本。

内置自适应循环推理:把算力用在真正难的判断上

但训练数据只是打好了地基,再往上,每次推理的难度也会随着任务变化

比如有些画面中目标清楚、关系简单;有些任务则要整合多个视角,还要判断遮挡和操作前提。

显然,后者更需要额外计算来修正判断。

ZDTaichu5.0-9B为此引入了内置自适应循环推理,让模型根据预测的不确定性,决定当前Token是否需要再算几轮。

具体来说,模型先完成一次标准前向计算,得到Token预测分布和隐层状态。熵门控随后评估预测的不确定程度,分布越分散,意味着模型对输出的把握越小。

确定性较高时,模型直接输出;遇到高不确定性节点,就在内部重复执行部分层块计算,迭代调整隐层表征,为当前判断增加计算深度

由于这段额外计算发生在模型前向传播内部,也无需为此调用外部工具。

当然,到底算几轮也要有约束,总不能无限制发散下去。

ZDTaichu5.0-9B配套了三重稳定化工程设计,以致于模型能够让算力合理倾斜:

1、阻尼更新:控制每轮修正幅度,避免特征漂移;
2、双重停止判据:同时监测输出分布的KL散度和隐状态残差,判断结果是否趋于稳定;
3、轨迹读出与状态回滚:保留迭代中间轨迹,并从中选择风险最低的表征结果。

有趣的是,这套按任务需要调节推理投入的思路,在最近大火的GPT-6 Astra上也有所体现。

OpenAI官方文档显示,Astra新增支持调节推理投入,并允许在对话过程中为困难任务提高推理投入,反之降低常规任务投入。

相似的路线架构,说明按需分配推理计算已经是国内外新的共识。

ZDTaichu5.0-9B展现出高度对齐的技术前瞻性,也是在开源模型中率先落地这一机制。

△图片截取自OpenAI官方文档

内外循环协同:把单步空间判断接成连续任务

不过,光判断好当前一步还不够,模型还要接着看行动之后发生了什么

因为具身的一次单独行动,环境状态就会随之改变。

模型的内部循环仅仅是围绕当前输入改善感知与推理,外部任务循环还要接收新观测和执行反馈,更新任务进展。

比如再来看个奶酪盒放入碗内的视频,虽然是仿真演示,但整个过程也相对直观:

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

模型首先在工具辅助下识别目标区域,组织接近、抓取、抬起、移动、放下和退出;新的观察结果继续影响后续操作,最终确认奶酪盒留在碗内。

所以在实体系统中,对模型的要求非常之高,模型不仅要承担语义理解、空间判断和高层规划,还要保证外部系统正确执行控制任务。

好在内外两套循环实现了这一点,让每次行动都能成为下一轮判断的新条件,显著提升长程任务的成功率。

从实验台到搬运现场,无需重新造轮子

此时让我们再回到最初的问题:多模态如何看世界?屏幕内外如何衔接?

ZDTaichu5.0-9B给出了实实在在的答案。

对于横在图文模型面前的三座大山,包括对象认不准、方位难转换、进度跟不住,均逐一破解。

模型再也不是“光说不做假把式”,通用跑分好看,真实物理场景跑分更好看。

换句话说,这才是大家心心念念的全能学生,不偏科、两端都均衡。

这还只是其一,更重要的是,它开源

开源意味着啥?产业界可以自己「造」

ZDTaichu5.0-9B不止把权重开放了,连同整套经过工业级验证的数据生产管线详细方案也一并打开,企业就能用自己的数据和机器人继续训练,迭代出更个性化的空间多模态模型。

团队也能少做重复工程,把研发精力更多地放在自身任务的定义、适配和评测上。

这也算另一种产业意义的自适应循环推理了。

从榜单评测走到实体任务验证,ZDTaichu5.0-9B也把空间理解能力带入了科研自动化和智能制造的具体流程。

比如在科研场景,试管转移任务集中展示了模型推理连续性。

两支试管经过抓取、双臂交接和入架,位置与姿态不断变化。模型需要持续区分样品身份,判断哪支已经入架、哪支仍待处理,并据此安排下一步操作。

样品身份、空间位置和任务进度由此被关联起来,为自动化科学实验平台提供上层任务编排与状态记录能力。

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

面向机台上料的工件转移演示,则呈现了机器人从料架抓取工件、转向搬运,再放置到工作台的完整过程。

其意义在于,模型把工单中的目标和位置要求,转化为随现场状态持续更新的操作规划。

将目标识别、搬运衔接和放置检查串成连续流程,为制造场景提供可进一步适配的高层规划基础。

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

对于开发者,ZDTaichu5.0-9B已经交出了一份早期验证答卷,后续完全可以基于它继续往前推,推得快还很准。

而对紫东太初,这次发布意味着通用多模态能力进一步向空间理解与具身任务规划延伸,其产业价值也将在更多具体任务中接受检验:

换一批工件、调整一次对象位置、增加一个操作前提,模型还能否认准对象、更新状态,并组织正确的下一步……

应对这些变化的能力,将成为衡量模型能否适应真实场景的重要尺度。

ZDTaichu5.0-9B用开源模型、数据管线、技术路径和实体案例重新开了个好头,作为基座,势必会让更多通用多模态模型跨越物理门槛。

其实具身智能走到今天,会聊天的模型比比皆是,早就不缺。

缺的是能看懂物理世界并在真实任务中持续维持状态的模型

以前有,但还不够。

紫东太初ZDTaichu5.0-9B是一次从0.001到1的突破,是从数字理解迈向物理具身智能的关键落地。

然后一生二,二生三,三生万物。

Blog链接:
https://taichu-ai.github.io/ZDTaichu5.0-9B
GitHub链接:
https://github.com/Taichu-AI/ZDTaichu5.0-9B
HuggingFace链接:
https://huggingface.co/TaichuAI/ZDTaichu5.0-9B
ModelScope链接:
https://www.modelscope.cn/models/TaichuAI/ZDTaichu5.0-9B

更正与撤稿0 条记录

本文暂无更正或撤稿记录。若本文发布更正、澄清或被撤稿,相关说明将按时间顺序列于此处。版权异议或撤稿请求:见 版权与撤稿,或致函 [email protected]