VLA → WAM · 概念谱系

世界模型

具身策略要在物理世界里连续做决定。只学会「看见就动手」,在接触丰富、长时程、会被自己动作改变的环境里往往不够。世界行动模型把「下一步世界会变成什么样」写进同一套目标函数。下面的分类轴改写自公开综述 arXiv:2605.12090 的概念,文字为具身链原创,不是对任何网站的转写。

概念框架参见 arXiv:2605.12090。本页文字为具身链撰写,不是对任何第三方站点的转写。

VLA

视觉-语言-动作

p(a | o, l)

输入当前观察与语言指令,直接输出动作。语义泛化强,本质是反应式:不显式写出动作之后的物理演化。

World Model

世界模型

p(o′ | o, a)

给定当前观察与动作(或动作序列),预测未来状态或未来观察。可以用来想象、规划或当仿真器,本身不一定输出可下发的关节指令。

Cascaded WAM

级联式世界行动模型

先 p(o′|o,l) 再 p(a|o,o′,l)

先想象未来状态,再从想象中导出动作。模块清晰,便于用真机数据单独修补世界模型,但延迟和误差会沿管道传递。

Joint WAM

联合式世界行动模型

p(o′, a | o, l)

同一个模型同时生成未来状态与动作。训练目标更紧,推理路径更短,表征里的「未来」容易和动作缠在一起,诊断更难。

一条很短的时间线

  1. 1990–2018
    内部模型与模型强化学习

    控制论与模型强化学习把「预测再行动」写成算法,但还没有互联网尺度的视觉语言骨干。

  2. 2018–2022
    潜变量动力学与视频世界模型

    从 PlaNet、Dreamer 到视频生成式世界模型,预测对象从低维状态走到像素。

  3. 2023
    VLA 进入机器人主叙事

    RT-2 把网络尺度视觉语言预训练接到动作词表。反应式策略开始被叫做 VLA。

  4. 2023–2024
    扩散动作与开源 VLA

    Diffusion Policy、OpenVLA、π0 把动作解码做成可复现基线,产业开始把它当默认技能层。

  5. 2025
    VLA 与世界模型装进同一骨干

    WorldVLA、RynnVLA-002 等把未来帧预测和动作预测写成一套自回归目标。

  6. 2026
    WAM 被写成分类框架

    arXiv:2605.12090 给出 Cascaded / Joint 的划分;WLA、VLAW 等沿着「要不要在推理时显式展开世界」继续分叉。

对应论文(本库已收录)

打开论文页

阅读边界

公开信息整理,非投资建议;请回源核验