VLA
视觉-语言-动作
p(a | o, l)输入当前观察与语言指令,直接输出动作。语义泛化强,本质是反应式:不显式写出动作之后的物理演化。
VLA → WAM · 概念谱系
具身策略要在物理世界里连续做决定。只学会「看见就动手」,在接触丰富、长时程、会被自己动作改变的环境里往往不够。世界行动模型把「下一步世界会变成什么样」写进同一套目标函数。下面的分类轴改写自公开综述 arXiv:2605.12090 的概念,文字为具身链原创,不是对任何网站的转写。
概念框架参见 arXiv:2605.12090。本页文字为具身链撰写,不是对任何第三方站点的转写。
p(a | o, l)输入当前观察与语言指令,直接输出动作。语义泛化强,本质是反应式:不显式写出动作之后的物理演化。
p(o′ | o, a)给定当前观察与动作(或动作序列),预测未来状态或未来观察。可以用来想象、规划或当仿真器,本身不一定输出可下发的关节指令。
先 p(o′|o,l) 再 p(a|o,o′,l)先想象未来状态,再从想象中导出动作。模块清晰,便于用真机数据单独修补世界模型,但延迟和误差会沿管道传递。
p(o′, a | o, l)同一个模型同时生成未来状态与动作。训练目标更紧,推理路径更短,表征里的「未来」容易和动作缠在一起,诊断更难。
控制论与模型强化学习把「预测再行动」写成算法,但还没有互联网尺度的视觉语言骨干。
从 PlaNet、Dreamer 到视频生成式世界模型,预测对象从低维状态走到像素。
RT-2 把网络尺度视觉语言预训练接到动作词表。反应式策略开始被叫做 VLA。
Diffusion Policy、OpenVLA、π0 把动作解码做成可复现基线,产业开始把它当默认技能层。
WorldVLA、RynnVLA-002 等把未来帧预测和动作预测写成一套自回归目标。
arXiv:2605.12090 给出 Cascaded / Joint 的划分;WLA、VLAW 等沿着「要不要在推理时显式展开世界」继续分叉。