茉莉花
新闻网
2026-08-31 · 星期一近12小时收录 88 条最近更新 18:50

快讯折叠屏 iPhone 永远不该配手写笔|硬哲学

小鹏第二代VLA重大升级:引入时间维度实现动态4D理解

转载信息出处与时间记录
内容性质
全文转载(非本站原创报道)
原始出处
界面新闻
原文发布
本站收录

今年8月,小鹏集团董事长何小鹏专门到访硅谷,为小鹏硅谷办公室选新址,也是为了履行去年底的诺言:在硅谷参考小鹏总部的园区建一个中国风味的食堂。

这意味着小鹏集团通用智能中心负责人刘先明赢得了去年12月两人立下的赌约——当然,何小鹏当时就提到“团队都相信他们会赢得一个好吃的食堂”。

其实硅谷只是何小鹏此次出行的其中一站,他和团队的足迹遍布北美、欧洲和澳洲,他们的目的只有一个:对比小鹏第二代VLA和友商的最新版。他的结论是“在大路等常规道路场景下,小鹏第二代VLA已经与全球一流水准的产品并驾齐驱;而在小路博弈、园区和停车场等复杂场景下,体验还要更好,支持从导航直接到达停车位,既高效又安全”。

刘先明在一段独白视频中给过去八个月下了一个很好的注脚:“去年如果被问到一个具体的目标,可能我会直接说是我们想要追上特斯拉。但今天我更关心的不是我们和谁相比,而是我们能不能给出一个属于我们自己的答案。一个很好的团队,永远要探索未知的问题。”

这也更符合何小鹏的风格,与其成为一个“追赶者”,不如成为一名“探索者”,在他看来,探索本身是一条更难,但更路的路。小鹏集团的长期愿景本就是成为“物理AI世界的出行探索者、面向全球的具身智能公司”。

从“空间智能”走向“时空智能”

2024年3月加入小鹏到接手重组而成的通用智能中心后,刘先明一直在做的一件事情就是“打地基”——AI Infra(人工智能基础设施,支撑AI模型从训练到推理全生命周期的底层技术体系),小鹏在AI Infra的投入远远超过在模型上的投入。

“AI Infra是支撑scaling law(人工智能领域的规模化法则,描述模型性能和参数大小、数据和算力之间关联的规律)的基础,没有很好的基础,就做不成这件事,也无法加速迭代。”刘先明说。

d86c21e66b35e7edb5d384681806ca6fbc75d4a0c229e4f20126a45093c46e5c article

过去几年,小鹏持续投入建设覆盖数据、训练、仿真、评估、部署和算力的完整AI Infra体系,以自动驾驶作为第一个规模化应用场景,逐步建立起从真实世界数据采集,到模型训练、测试、部署,再到用户反馈和持续优化的完整闭环。

在小鹏看来,模型总会迭代,但真正构建壁垒的是持续迭代模型的能力,能够支撑产品持续进化的基础设施才能够产生长期价值。

早在小鹏第二代VLA今年3月发布的时候,刘先明就抛出一个公式,他认为物理AI能力=模型×算力×数据×本体。模型决定智能的上限,数据提供世界的经验,算力支撑模型的运行和训练,而本体则让AI真正进入物理世界行动并提供新的数据。一个完整的物理AI系统,能力‌不取决于任何单点突破,而是来自四者共同的Scaling‌,缺一不可。

efb32e988a22d127ddd0f8d627869bd007d45685c766cb35e17d455537a4d639 article

第二代VLA的持续升级,正是这一体系不断运转的结果:模型、数据、算力和本体的协同增长。小鹏第二代VLA模型首次重大升级也是遵循这一逻辑。

小鹏为第二代VLA注入了“时间”概念,这也是此次模型升级的核心——让AI理解时间,从过去对物理世界的静态3D空间理解,进一步走向动态4D时空理解。

规则式早已成为过去式,而传统端到端方案尽管可以识别运行的场景,但问题在于它解决的仍然是场景的单点突破,比如,部分模型仅接收离散转向指令,无法像人类结合距离预判提前变道,导致路径规划滞后或偏差,如果训练数据没有覆盖,则容易引发系统的误判。

7119702456d80b8632d1608e4b473a4c9a2122823f730cff4949a3c9b85c72c9 article

‌‌但真实世界中物体和运动轨迹是确定性和偶然性的集合,它是动态变化的,传统端到端架构只关注当下的做法适应不了这种变化。在第二代VLA的升级中,小鹏引入Infini-VLA长时序架构,从而确保模型具备记住前30秒的世界的能力。对于运动状态的“进行时”,小鹏采用了Streaming Inference(流式自回归推理),从离散推理走向连续推理,端到端响应速度提升300%,确保系统可以应对不断变化的道路状况。

edbdb57265f0874d504fa699e399a995b9ebf2fdaa7ac7944d6c2636e7866396 article

此外,小鹏为第二代VLA预测未来的能力则得益于首次上车的小鹏X-Foresight预测世界模型,它可以推演未来6秒内周围环境的动态趋势。第二代VLA具备了“时间逻辑”,能力大幅跃升。

过去的传统模型通常专注于解决当下的问题,工作逻辑是“先看、再算、输出、再看”,把单个场景串联起来成为连续的场景,如果其中一个环节出现卡顿,则会对后续产生影响,甚至出现“逻辑短路”的情况。把真实世界简单看成一个空间,无法具备很好的行动能力。

因为真实世界的每一个物体运动都能画出一条轨迹,但这条轨迹是确定性和偶然性的结合体。比如说,真实的通行中,前车可能突然刹停,行人可能临时改变方向,旁车可能在A点或者B点加塞,这些都是运动中的偶然性。

加入时间要素后,模型从“空间智能”升级为“时空智能”,能更好理解“世界正在发生什么”,实现“边看、边想、边行动”的并行处理。对于运动中的并行处理,小鹏还为第二代VLA引入了Flow Matching(流匹配,一种前沿的生成模型技术),为模型的运动轨迹提供多种解法。

cbe0af9d42ac3233678e3622382841f2e49c8b74214f6a346103dedb58167389 article

小鹏展示的视频片段可以体现升级后的第二代VLA的能力:测试车准确判断前车有三点掉头意向,因此选择停车等待,避免因为误判而前进造成的拥堵;道路封闭维修需要停车让行,测试车判断对向的车辆需要借道行驶,选择等待让对方穿过后再前进,避免抢行造成的拥堵。

1d35be5b4ef670162837cbbb78c54b43336c3a8e776217c45dd9a057366459d2 article

同时,小鹏第二代VLA的目标是实现全球部署,要求模型具备足够强的泛化能力。因此小鹏第二代VLA全新版本端侧模型参数量提升3.5倍,是主流VLA的15倍以上,结合“时空智能”的能力,多维综合安全能力提升20倍。

为了最大化有效利用端侧的算力资源,新模型引入了MoT混合架构,可以针对不同任务动态精准分配模型能力,降低城区道路、园区、泊车等不同场景之间的任务干扰,把不同的问题交给不同的“专家”,进而提升车辆等本体在不同场景下精准解决问题的能力。

小鹏的思路很明确,用打造通用大模型的逻辑来升级第二代VLA,从底层框架构建完整的能力链,以模型、算力、数据和本体四者共同的Scaling协同推进物理AI能力的升级。

通用和复用:小鹏志在物理AI的全球化

小鹏的目标远不止让辅助驾驶变得更好。小鹏定位于“物理AI世界的出行探索者,面向全球的具身智能公司”,不仅是能做自动驾驶的车企、能造车的自动驾驶公司,更是一家物理AI公司。

在车端,小鹏利用做机器人的逻辑重建车机大脑,首次推出的Master Agent实现了VLA与VLM的驾舱融合,Master Agent建立在小鹏自研Omni全模态模型之上,不仅能够理解自然语言和模糊语义,还能将用户意图自动拆解为任务,并调度智驾、底盘、座舱、车身控制等垂直Agent协同执行。

物理世界一个常见的场景是,当一个人从A点到B点,可能他会中途去C点购买一样物品或者解决一个临时性的问题。驾驶同样如此,车辆从A到B点的行驶过程中,可能用户有其他目的,基于Master Agent,用户可以一次性完成任务的布置,或者在中途临时插入一项任务。

Master Agent让整车拥有统一大脑,让车辆智能从响应单一指令,进一步迈向自主理解意图、规划任务和协同执行。

72dd702bc7ad6a5480b22c328429676d836e89048e6520560a69bc78cb7a539c article

这一项升级体现了小鹏第二代VLA的通用和复用能力,也是何小鹏和刘先明一直在提到的“泛化”,主要有两个维度:在外部,是第二代VLA的全球部署能力;在内部则是实现同一个基座模型在不同本体的复用,比如Robotaxi、飞行汽车等。

在小鹏看来,物理世界AI基座真正的价值,不只是把单一任务做得更好,而是将模型在真实世界中学习到的能力迁移、复用到更多任务和更多本体,推动物理AI从单一产品能力走向通用能力。

何小鹏提到了一个细节:小鹏在德国完成了本地化验证,在几乎不增加本地化训练数据的情况下,小鹏第二代VLA在德国的实际体验已经与中国高度接近。

443a6d9f1c43cde721c4d38ee2f0a1e2a9c5012961d2213f704f6a0056332757 article

“我认为这比友商的全球多区域泛化能力要明显领先。小鹏第二代VLA是在‘魔鬼路况’中训练出来的。我们从最难的数据、最复杂的场景做起,不仅追求在各种工况下拥有更好的表现,也希望一套模型能够更好地适应不同国家和地区的道路环境与能力要求。”何小鹏说。

在硅谷,小鹏硅谷办公室向到访的何小鹏赠送了一件铁人的T恤——小鹏的通用人形机器人名为“IRON”,前者的用意不言自明。

基于统一技术底座,小鹏第二代VLA实现L2至L4能力贯通,向更高阶自动驾驶拓展,获得许可后,小鹏已经能够在广州相关一、二、三级测试道路开展主驾无安全员道路测试;小鹏高阶通用人形机器人IRON搭载了3颗图灵AI芯片,有效算力2250 TOPS,在强大算力的支持下,物理世界基座模型实现端侧部署,无需远程遥操作即可自主完成复杂工作任务。

372619afc5cf96bdcfba6e24465a1019c45bb15dd2345c0ed567e005d4197162 article

在车端,小鹏第二代VLA的全新版本计划在9月面向Ultra和Ultra SE车型推送;同时,蒸馏后的图灵VLA 2.0 Lite同样获得显著能力提升,让更多用户享受到更安全、更可靠的城区辅助驾驶体验。图灵VLA 2.0 Lite预计9月开启首批推送,小鹏G9L Max版本将首发搭载这一蒸馏版本。

这一场时长1个半小时的发布会,信息密度足够大,更深层次来看,则是体现了小鹏对人工智能的独特思考——藏在发布会上频繁出现的两个词里:“长期”、“护城河”。

a88a7be40075d53b3a2908a0feb0bab9767d7dace24e708d8c4e4d42d64d628d article

以人工智能为基础的物理AI是小鹏面向未来的蓝图,小鹏机器人以超过430亿元的估值获得首轮超过9亿美元融资,显示了顶级资本对小鹏机器人长期价值的认可,市场重新评估小鹏“汽车+AI+机器人”的价值空间。

不过这仍然需要小鹏的持续投入,更考验何小鹏作为“探索者”的决心:“短期内新车型涌现激烈竞争,到2030年竞争格局将会大幅收敛,真正生出的是强研发、有耐心、战略和细节兼备的公司。小鹏希望能成为全球最好的物理AI公司,技术是小鹏的优势,并协同构建商业、全球化和组织能力。”

更正与撤稿0 条记录

本文暂无更正或撤稿记录。若本文发布更正、澄清或被撤稿,相关说明将按时间顺序列于此处。版权异议或撤稿请求:见 版权与撤稿,或致函 [email protected]