本文导读:2026年,具身智能正从“卷模型架构”走向“卷数据质量”。VLA与世界模型不再是二选一的路线之争,而是走向融合——但无论模型架构如何演进,一个共同瓶颈正在浮现:物理真实、带时间轴的空间数据从哪里来? 本文从行业趋势出发,拆解“空间数据”为何成为世界模型的刚需,以及诠视科技如何以“精准空间测量”重新定义数据采集的价值锚点。
一、从“VLA vs 世界模型”到“VLA + 世界模型”:行业共识正在形成
过去一年,具身智能领域围绕VLA(视觉-语言-动作模型)与世界模型的争论持续升温。英伟达科学家Jim Fan甚至用“VLA已死”的meme图点燃了技术路线更替的讨论。
但进入2026年下半年,多家头部企业的实践表明,VLA和世界模型并非替代关系。GTC 2026上,理想汽车基座模型负责人詹锟明确指出:当视觉、语言和行动统一到一个模型中,它就不再只是自动驾驶模型,而是在逐渐演化为面向物理世界的通用智能体。
CVPR 2026上,小鹏汽车通用智能中心负责人刘先明的表态更具标志性意义:“VLA与世界模型并非竞争关系。” 他进一步阐释:VLA从人类行为中学习“如何行动”,世界模型则通过学习未来状态预测“行动之后世界会如何变化”——二者共同构成物理世界基座模型。
智元机器人合伙人姚卯青在2026 WAIC期间也给出了类似的判断:“VLA、世界模型和我们提出的World Reasoning Action Model,最终都会走向一套融合视觉、语言和动作的多模态体系。它要具备理解与生成一体化的能力,既能理解指令、完成规划,也能预测未来画面和环境变化,并生成动作轨迹。”
行业正在形成的共识是:VLA解决的是语义理解与可解释决策,世界模型解决的是未来状态预测与推演,两者解决的是不同层面的问题,天然具备互补性。其融合的产物,正在被越来越多的从业者称为“物理世界基座模型”。
二、模型架构在变,但“数据瓶颈”从未消失
无论上层模型架构如何演进,一个底层问题始终横亘在行业面前:数据从哪里来?
2.1 具身智能的“数据饥渴”
2026年WAIC上,光轮智能联合创始人杨海波给出了一个震撼的数据:行业要实现可用的具身智能,至少需要1000万小时量级的多模态交互数据,而当前全球有效数据积累尚不足需求的5%。
为什么大语言模型有互联网沉淀数十年的文本数据可用,具身智能却没有现成的“教材”?根本原因是,具身智能面对的是千变万化的非结构化物理世界,需要采集视觉、力觉、触觉等多维度的物理交互信息。
姚卯青进一步将具身智能的数据需求描述为一座“数据金字塔”:
|
层级 |
数据类型 |
作用 |
|
底层 |
大规模预训练数据(含无本体采集的人类数据) |
帮助模型理解空间、动力学和因果关系 |
|
中层 |
真机遥操作等高质量示教数据 |
用于具体场景的监督微调 |
|
顶层 |
真实部署后的在线交互数据 |
通过强化学习提高成功率、节拍和泛化能力 |
三类数据无法相互替代。姚卯青明确指出:“无本体采集负责把规模做上去,真机遥操作提供更贴近本体的数据,真实部署则让模型在工作中持续修正。”
2.2 关键洞察:“关联数据”与“因果数据”是两回事
当前主流的Ego(第一人称头戴)、UMI(夹爪式采集)和遥操作数据采集方式,记录的核心是“视觉-动作关联”——某个画面下执行了某个动作。这种数据足以训练模仿学习,让模型学会“照做”,但不足以让模型理解“为什么这样做会导致那样的物理结果”。
行业头部玩家对此已有清晰认知。姚卯青指出,当前互联网视频的数据分布与机器人真正需要的物理世界数据存在本质差异——“互联网内容很多是娱乐性甚至反物理规律的(比如人也可以飞起来),而机器人需要的是接触丰富、涵盖推拉拧拽等动作、涵盖柔性物体、摩擦力、流体等多样物理交互的真实数据”。
从“关联”到“因果”的跨越,是具身智能从“模仿”走向“理解”的关键一跃。 而这一跃,对数据采集提出了新要求:不仅要记录“做了什么动作”,还要精确记录“动作发生时和发生后,物理世界发生了什么变化”。
2.3 “空间+时间”是产生因果的最小数据单元
那么,“因果数据”到底长什么样?
一个值得注意的行业判断来自姚卯青:“具身智能要出现更高水平的能力涌现,某些环节离不开语言和知识体系。机器人完成长程任务,需要规划,也需要判断当前状态。”
实现这一目标的技术路径,是在数据层面构建“空间+时间”的耦合表示。无界动力发布的全球首个“长时序双向物理因果链”隐空间世界模型,本质上就是在做这件事——让模型能够从时序数据中学习动作与物理状态变化之间的因果映射。
更具体的学术进展来自上海交通大学RHOS团队在ECCV 2026发表的HAT-4D工作。该研究指出,4D交互数据(3D几何+时间变化)是具身智能、机器人学习和VLA训练的重要原料。传统的4D数据采集长期依赖昂贵的多机位系统,而HAT-4D试图将单目视频转化为“带有几何、动态、交互约束的训练资产”。
为什么“空间+时间”能产生因果?单看一张“杯子在桌边”的照片,没有任何因果信息;但看“杯子在桌边→手推→杯子掉落”这个时间序列,因果就浮现了。 时间轴让“空间关系的变化”被记录下来,而“变化”正是因果的最小单元。
三、诠视的实践:从“录像”到“测量空间”
行业趋势正在明确:无论走VLA还是世界模型,物理真实、带时间轴的空间数据都是刚需。 而这类数据,恰恰是诠视科技的技术基因所在。
3.1 “录像”与“测量空间”的本质区别
传统数据采集设备的工作本质是 “录像” ——把操作过程记录下来交给模型去“猜”背后的空间关系。而诠视SeerFusion One的工作本质是 “精准空间测量” ——以RGB图像、IMU数据、全身关节空间定位轨迹、3D场景点云提供精确的空间拓扑关系多模态数据。
这一差异直接影响模型训练的质量。具身大模型要学习的不是像素间的统计相关性,而是动作与物理结果之间的因果映射。这种映射必须以精确的空间关系为锚点——手与物体的距离、相对朝向、接触点的位置变化。如果输入数据在空间维度上是模糊的、漂移的、未对齐的,那么无论模型架构多先进,都难以收敛出可靠的物理理解。
3.2 SeerFusion One:为物理AI和世界模型而生
在2026年WAIC上,诠视科技首次国内公开亮相了SeerFusion One——一款面向具身智能与世界模型训练打造的Ego-Centric数据采集终端。
它的技术架构清晰地回应了“空间+时间”的数据需求:
- 空间精度:双目2MP彩色全局快门相机+四目VGA全局快门追踪相机,毫米级定位精度;
- 时间同步:高速9轴IMU与所有相机实现毫秒级时间戳同步,确保每一帧数据都有精确的时空标签;
- 完整6DoF:不仅记录“看到了什么”,还记录“在什么空间位置看到的”,并将两者精确绑定。
正如诠视科技团队所说:“我们的目标不是做一款更轻便的相机,而是为物理AI提供一个可穿戴的空间数据入口平台。”
3.3 从“事后清洗”到“现场验证”:与物理仿真引擎的协同
在WAIC 2026物理智能创新生态论坛上,诠视科技宣布与飞捷科思联合发布基于物理仿真模型的实时反馈型数采终端。
飞捷科思CTO翟博士在演讲中指出:具身智能模型训练中,大量真实世界数据因无法有效映射到机器人而沦为无效数据。与诠视的联合产品正是针对这一痛点而设计——采集的数据可在采集现场即完成物理约束验证,将数据质量的判断从“事后清洗”前置到“采集现场”。
这意味着,采集到的数据在走出采集现场之前,就已经通过了“物理规律是否合理”的检验,显著提升了有效数据率和后续转化效率。这也是对“因果数据”采集要求的一种工程回应——物理约束本身,就是因果的一种编码形式。
四、结语:路线之争终将收敛于“数据供给能力”
具身智能行业正在从“卷模型架构”走向“卷数据质量”。姚卯青的判断是:如果把具身智能的GPT-3.5时刻定义为通用能力的显著涌现,行业可能在2027年底至2028年初看到关键进展。
支撑这一判断的核心变量是数据。而数据的质量,取决于采集设备能否精确记录每一次接触、每一个位移、每一帧空间关系的变化。
VLA与世界模型从争议走向融合,其共同指向是:物理世界需要物理数据。而这些数据的“物理真实性”,必须以“空间+时间”的精准耦合为锚点——这正是诠视科技用十余年空间感知交互技术积累给出的答案。
让机器真正理解物理世界,从采集有精准时空关系的数据开始。而这,或许正是人工智能走向“物理智能”的第一步。