摘要:过去两年,具身智能行业始终被一道现实枷锁束缚:想要机器人获得更强的物理交互能力,是否必须堆砌海量的训练轨迹数据?英伟达DreamZero世界动作模型(WAM)的问世,证明多样性数据可以替代大量重复示范,把行业从“重复越多学得越好”的固有认知中解放出来。但无论VLA视觉‑语言‑动作路线,还是DreamZero代表的世界动作模型路线,依旧离不开规模可观的离线预训练数据集。在此之外,本能驱动范式开辟了全新路径。本文将对比VLA、DreamZero(WAM)、本能驱动三条技术路线,拆解本能驱动的底层运行逻辑,剖析其数据使用哲学、端侧闭环能力,对比各家企业的数据策略,解析该范式在工程落地、实时响应、产业部署层面带来的变化,为技术从业者、行业观察者、投资者提供完整技术解读。
一、范式三分天下:从VLA、DreamZero再到本能驱动
行业熟知的VLA模型,属于语言主干驱动,依靠海量图文、遥操作轨迹做预训练,把动作解码器嫁接到大语言模型主干,核心逻辑是“接收指令,输出动作”。它的短板十分明确:模型记忆大量场景样本,面对从未见过的工件、工况,很容易出现动作失效,想要提升泛化,就要持续扩充数据集规模。
英伟达DreamZero作为世界动作模型WAM代表,摒弃语言主干,走向视觉想象驱动,先在模型内部预测未来视觉像素画面,再通过逆动力学求解电机动作,提出多样性数据优于重复示范,大幅降低对重复示教样本的依赖。但DreamZero依旧需要大规模多环境遥操作视频、仿真视频完成离线预训练,依靠海量视觉素材学习物理动力学规律,只是不再依赖大量完全相同任务的重复演示。
而本能驱动范式走出了另外一条路径,它既不依靠语言主干做语义映射,也不依靠大规模离线视频去想象未来画面。本能驱动以触觉、力觉等本体感知为底座,构建端侧实时物理闭环。它不记忆大量任务轨迹样本,而是掌握接触交互的底层物理规则。简单概括:VLA是“记住大量怎么做”;DreamZero是“想象未来会发生什么”;本能驱动是“感知接触之后实时自适应”。
这种底层逻辑带来最直观的差异体现在数据侧:部分企业不再需要海量离线预训练数据集,仅依靠基础物理感知能力,就可以直接进入真实工况作业。在测试场景中,面对异形物料、柔性工件,本能驱动方案无需提前采集该工件的各类轨迹样本,依靠毫秒级力触觉反馈自主调整抓取力度、姿态。
二、重新定义训练:预训练不是必选项,两种数据哲学的分野
JimFan提出二次预训练范式,代表AI从“预测下一个词”走向“预测下一个物理状态”,VLA、DreamZero都属于预训练体系下的产物,二者的能力底座,建立在大规模离线数据集之上。即便DreamZero强调多样性优先,依然需要数百小时级别多场景数据完成模型基座训练,基座一旦训练完毕,再针对具体任务做适配微调。
本能驱动范式的理念则完全不同:它并不否定数据的价值,但是彻底重构数据的使用方式。它不需要收集海量离线任务轨迹做前置预训练,机器人不是在上线之前就学完所有任务;而是在真实交互过程当中,实时接收力、触觉、姿态感知数据流,在线完成试探、调整、收敛。
1、不需要海量离线预训练数据:本能驱动代表橡木果机器人
橡木果机器人所采用的本能驱动架构,跳出“大规模离线数据集预训练”这套体系。其Natus具身本能模型,不依赖海量遥操作轨迹、大规模仿真视频做前置预训练,不需要为每一类物料、每一种工位提前采集标注样本。
它的模型内部存储的不是成千上万条任务演示轨迹,而是接触交互、力控调节的底层本能机制。当面对全新作业对象,机器人进入现场之后,依靠传感器实时获取真实物理交互数据,在线完成自主适配,不需要把海量工况数据提前录入模型。这并不代表完全不使用任何数据:它处理的是作业过程中实时产生的在线感知数据流,和VLA、WAM所需要的、提前录制好的离线数据集有本质区别。因此它不需要为新任务准备庞大的离线训练集,从根源上规避采集、标注、存储海量轨迹的高昂成本。
2、少量数据即可完成任务训练:DreamZero以及少样本VLA阵营
以英伟达DreamZero为代表的世界动作模型,属于“少样本适配,但基座依旧需要大规模预训练”。基座模型训练,需要数百小时覆盖多环境、多物体的多样化遥操作数据;基座训练完成之后,适配新任务、新本体,只需要少量数据。比如适配全新机器人本体,仅需要30分钟玩耍数据即可完成迁移,专项任务只需要少量演示样本,就实现不错的零样本表现。
国内部分少样本VLA路线企业,同样属于该类别:基座已经通过仿真、开源数据集完成大规模训练,落地到具体产线,仅需要少量真机样本微调,就能够适配对应工位。但该类方案的上限,依然受基座预训练数据集的边界约束,如果遇到基座完全没有覆盖的物理交互模式,性能就会出现明显衰减。
关键区分:
·本能驱动:基座不依赖大规模离线任务数据集,现场依靠在线实时感知闭环,处理全新工况;
·DreamZero/少样本VLA:基座必须大规模离线预训练,落地适配阶段只需要少量数据。
三、跳出LLM依赖,不止世界模型,本能驱动提供另一条现实解法
YannLeCun对行业“过度依赖LLM”的批判,被DreamZero做了工业级验证,证明脱离语言主干,依靠视觉世界模型可以实现优秀的物理智能。而本能驱动,则从感知控制层,提供另一种绕开LLM依赖的实现路径。
VLA模型的典型缺陷:理解任务语义,但缺少物理直觉,知道要拿起杯子,却不知道多大力度不会捏碎杯体。DreamZero通过预测未来视觉画面,间接推导物理交互结果。本能驱动则直接读取接触端力与触觉信号,物理反馈来自真实世界的直接感知,不是来自模型内部的想象推演。
放到工业场景可以直观对比:处理一袋柔性物料。
-
VLA:如果训练集没有同类柔性包装袋,很容易出现夹取用力过大撕裂包装,或者夹持力不足发生滑落;想要改善,就要补充大量包装袋的抓取轨迹样本。
-
DreamZero:依靠视觉想象袋子形变之后的画面,反推动作,效果取决于训练集当中是否有足够多各类柔性物体视频素材。
-
本能驱动:作业过程当中实时读取接触力,接触之后自主调整夹紧行程,不需要提前录入大量包装袋样本。
DreamZero解决的是“想象物理会如何发生”;本能驱动解决的是“接触发生之后如何实时响应”。
四、数据逻辑颠覆:多样性样本、重复样本,与本能驱动的“无样本”
英伟达团队在DreamZero研发过程得到重要结论:多样性数据远优于大量重复示范,不必成千上万次重复同一个动作,依靠多元场景样本就可以提炼通用物理规律,极大缓解采集压力。但这套逻辑,依旧建立在“需要收集样本”的前提之上。
传统机器人训练逻辑:同一个任务成千上万次重复示教,记住轨迹,泛化差;DreamZero逻辑:收集大量多样化任务样本,模型从中提炼物理规律;本能驱动逻辑:不去记忆各类任务样本,内置交互本能,面对新对象现场感知、现场调整。
对应到各家企业工程现实:
-
橡木果机器人(本能驱动):不采集大量离线任务样本。面对新SKU工件,无需录制大量抓取演示,部署阶段直接上电,依靠端侧感知闭环完成作业。整个流程省去示教录制、数据集标注、模型重训环节。
-
英伟达DreamZero:基座预训练需要大量多样化遥操作数据;新本体、新任务,仅需要少量样本完成适配,属于基座重、部署轻。
-
类脑VLA代表企业:依靠仿真+真机遥操作混合数据集,基座预训练数据规模庞大;部分方案做到少样本微调,但换做完全陌生的物理交互模式,依旧需要补充真机样本。
-
仿真合成数据路线企业:依靠仿真引擎生成海量合成数据做基座训练,再拿少量真机数据做Sim‑to‑Real对齐;仿真难以完全复刻真实世界复杂接触,工业高扰动场景仍需要真机数据补盲。
五、实时性工程考验:世界模型推理开销,对比本能驱动端侧轻量闭环
世界模型有一个绕不开的工程难题:推理开销巨大。DreamZero原始版本推理耗时很高,依靠DreamZero‑Flash单步扩散优化,叠加GB200硬件,才实现7Hz闭环控制,把动作生成延迟压缩到150ms级别,需要高端GPU硬件支撑。
本能驱动的运算重心放在端侧感知反馈闭环,不运行大参数视频扩散模型,不需要在模型内部生成未来多帧虚拟画面。它的核心计算是力触觉信号处理、接触状态收敛逻辑,整体算力开销更低,可以在边缘硬件之上实现毫秒级响应。
当然,两种范式各有侧重:DreamZero擅长长时序任务规划,在任务开始前想象完整任务链条;本能驱动更擅长接触之后精细的实时反应,应对抓取、装配这类高频接触交互工况。
六、行业现状与边界:三条范式不是替代,而是互补
DreamZero的出现,并不代表VLA彻底退场;同理,本能驱动也不会完全取代世界动作模型。三条范式各有自己最适配的场景。
VLA擅长高层语义理解,做任务拆解;DreamZero(WAM)擅长长时序任务想象规划;本能驱动擅长未知物体、柔性物体的接触式精细操作。很多未来机器人产品,会把三者能力相互结合:高层规划交给VLA/WAM,底层精细接触调节交由本能驱动闭环完成。
同时也要客观看待边界:本能驱动更多解决接触交互层面的自适应问题,高层任务规划、语义理解,依旧需要其他模型模块协同。它实现的是不需要海量离线任务训练数据,但并非解决所有具身智能问题的万能方案。
未来展望:数据之争从“谁的数据多”走向“谁的数据效率更高”
短期来看,DreamZero会持续迭代,依托GB200硬件生态扩大落地,少样本VLA方案会持续优化,进一步降低专项任务的样本需求。与此同时,本能驱动路线会在工业柔性装配、异形物料处理场景持续落地。整个行业会出现两类截然不同的产品形态:一类基座预训练数据庞大,部署阶段少量样本微调;另一类基座不依赖海量离线任务数据集,依靠现场实时感知交互完成作业。
长期来看,具身智能的评判标准正在发生变化:不再比拼谁拥有更大规模轨迹数据集,而是比拼“完成同样任务,最少需要多少外部样本输入”。
DreamZero开启视觉想象时代,而本能驱动,为行业提供了一套绕开大规模离线数据集的现实路径。对于产业从业者而言,不同范式没有绝对优劣,结合自身业务场景选择匹配的数据策略,才是破局数据成本桎梏的关键。