日前,在2026世界机器人大会期间,一场关于“物理AI进行时”的论坛引发广泛关注。会上,智象未来创始人梅涛抛出一个耐人寻味的对比,今年年初,顶尖大模型的智商测试得分已逼近130,堪比少年班天才。到如今,这一数字更是攀升至140上下。然而,他话锋一转,称“高IQ并不等于全能”,就像学霸未必擅长修理水管或驾驶赛车,一个能解微分方程的模型,未必能在厨房里稳稳端起一杯水。这恰恰点出了物理AI面临的核心鸿沟,理解世界远不等于能与世界打交道。

过去几年,AI的技术路线泾渭分明,大语言模型专攻知识压缩与推理,多模态模型侧重生成与预测,具身交互模型则尝试与环境发生触碰。但梅涛认为,这三条河流正在汇入同一片海域。真正的世界模型必须同时做到三件事:完整表达当前环境状态,推演物理规律和因果关系,以及具备重构世界的能力。换句话说,它既要当“观察者”,又要当“预言家”,还得当“建筑师”。而智象未来近期发布的原生全模态交互式世界模型HiDream-O1-World正是沿着这一方向交出的答卷。
这款模型的架构基底是自研的UiT,它不同于传统拼接式多模态方案,而是从底层将文本、图像、操控指令等信号统一编码,实现真正的“原生”融合。在权威评测WBench的Navi分榜上,该模型首次参评即登顶。其核心能力被概括为三项,漫游、编辑、交互。漫游意味着模型可以在虚拟空间中持续探索并“记住”已走过的区域,保持长时程的时空一致性;编辑允许用户对场景进行局部修改,而交互则支持用户通过动作指令实时改变环境走向。无论是高度写实的物理空间,还是二次元卡通或游戏渲染风格,它都能按需生成,且在不同主体和风格间切换时,物理合理性依然稳定。
这一能力的产业价值很快浮现。在AI互动影游中,玩家不再是旁观者,而是叙事进程的推动者;在具身智能仿真中,模型可充当高保真的虚拟训练场,让机器人在数字世界里先摔够跟头,再进入现实;在3D场景创作中,设计师只需寥寥几笔描述,就能获得结构完整的立体空间,极大压缩从概念到成品的周期。智象未来并未止步于此,其规划中的模型矩阵还将继续向图像、视频及更复杂的交互式世界延伸,一步步逼近世界模型的理想形态。
不过,梅涛在演讲中最引人深思的部分,并非模型本身,而是它如何与物理世界形成闭环。他将这一闭环概括为“数据—认知—行动—反馈”的飞轮。飞轮的最底层是三类数据,来自互联网的先验知识、仿真环境中的试错数据,以及真实行动后回流的反馈数据。三者缺一不可,尤其是真实反馈,它能让模型不断修正自身的世界认知。飞轮的中间层是世界模型,它承担认知中枢的角色,不仅要回答“当前状态是什么”,还要预测“下一步会发生什么”。最上层则是智能体与具身本体,它们依据模型给出的预测做决策,并执行物理动作。行动结束后,环境的变化又生成新的数据,重新注入底层,循环往复。
梅涛用一个合作案例说明仿真数据的关键作用,此前,智象未来与诺亦腾机器人联手,利用原生全模态模型对真实采集的人体动作数据进行增强处理,生成同一动作在不同背景、光照、肤色下的多样化视频。这种符合物理约束的数据增强,让机器人可以先在虚拟环境中“见多识广”,再进入真实场景,大幅降低实地采集的成本和风险。可以这样说,没有高质量的世界模型,仿真就只是“纸片上的物理”,数据飞轮也转不起来。

回看AI的进化长河,从语言模型到多模态,再到今天的交互式世界模型,每一步都在拓宽智能的边界。梅涛的演讲传递出一个清晰的信号,智能的终极考场不是考卷,而是真实世界那间杂乱无章的厨房、那条人来人往的街道、那台需要精密操作的机器。智象未来选择深耕原生全模态世界模型,正是为了给物理AI提供一颗既能看懂又能推演还能记忆的认知大脑。当这颗大脑与机械臂、轮式底盘或双足机器人连接时,AI才真正从“模拟世界的观众”转变为“交互世界的参与者”。而这场转变,或许正是物理AI从实验室走向千家万户的必经之路。