具身 / 机器人 / 世界模型
论文
精选 12 篇公开 arXiv 论文,覆盖 VLA 奠基、开源基线,以及 2025–2026 年 WAM / WLA 综述与系统。标题与编号已按 arXiv 摘要页核对;简介为中文改写,不是原文翻译。
arXiv:2605.120902026-05已核验链接WAM综述VLA
世界行动模型:具身智能的下一前沿
World Action Models: The Next Frontier in Embodied AI
S. Wang, J. Shi, Z. Fu et al.
把世界模型与动作生成的结合正式命名为 World Action Models,并拆成级联式与联合式两类。本站世界模型页的分类轴来自这篇综述的概念,表述为原创改写。
https://arxiv.org/abs/2605.12090arXiv:2506.215392025-06已核验链接Joint WAMVLA
WorldVLA:自回归的动作世界模型
WorldVLA: Towards Autoregressive Action World Model
Junjie Wen et al.
在同一自回归框架里同时预测动作与未来图像,并讨论动作块生成时的误差累积与注意力掩码。
https://arxiv.org/abs/2506.21539arXiv:2511.175022025-11已核验链接Joint WAM真机
RynnVLA-002:统一的 VLA 与世界模型
RynnVLA-002: A Unified Vision-Language-Action and World Model
RynnVLA Team
用共享词表的自回归骨干同时承担动作预测与未来帧预测,并报告仿真与真机对照。
https://arxiv.org/abs/2511.17502arXiv:2606.059792026-06已核验链接WLAJoint WAM
世界-语言-动作模型
World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis
WLA-0 authors
在 WAM 的世界接口之上补回语言层子任务,用自回归骨干同时预测文本子目标、子目标图像与动作。
https://arxiv.org/abs/2606.05979arXiv:2602.120632026-02已核验链接Cascaded WAM真机
VLAW:VLA 与世界模型的迭代互促
VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model
VLAW authors
用真机 rollout 把世界模型补到足够物理,再生成合成轨迹去改进 VLA,是级联式闭环的一条工程路线。
https://arxiv.org/abs/2602.12063arXiv:2606.001332026-06已核验链接世界模型综述
世界模型综论:架构、方法、推理与应用
World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications
A. H. Zidan, Y. Pan, H. Jiang et al.
覆盖世界模型的架构与推理范式,适合作为 WAM 出现之前的背景阅读。
https://arxiv.org/abs/2606.00133arXiv:2606.207812026-06已核验链接WAM综述
世界行动模型综论:少做梦,多行动
World Action Models: A Survey, Dream Less, Act More
Q. Shen, S. Zhang, Y. Liao et al.
与 2605.12090 同期的另一条综述线索,强调预测保真与可执行动作之间的取舍。
https://arxiv.org/abs/2606.20781arXiv:2406.092462024-06已核验链接VLA开源
OpenVLA:开源视觉-语言-动作模型
OpenVLA: An Open-Source Vision-Language-Action Model
Moo Jin Kim et al.
开源 VLA 基线之一,后续大量 WAM 工作把它当作反应式对照。
https://arxiv.org/abs/2406.09246arXiv:2410.241642024-10已核验链接VLA流匹配
π0:面向通用机器人控制的流匹配 VLA
π0: A Vision-Language-Action Flow Model for General Robot Control
Physical Intelligence
用流匹配解码连续动作的通用操控模型,是 2024–2026 年 VLA 谱系里被引用最多的节点之一。
https://arxiv.org/abs/2410.24164arXiv:2307.158182023-07已核验链接VLA奠基
RT-2:把网络知识迁移到机器人控制
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
Anthony Brohan et al.
较早把互联网尺度视觉语言预训练接到机器人动作词表上的工作,VLA 这个名字由此进入产业讨论。
https://arxiv.org/abs/2307.15818arXiv:2303.041372023-03已核验链接策略扩散
Diffusion Policy:用扩散学习视觉运动策略
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
Cheng Chi et al.
用扩散过程生成动作块,后来成为许多 VLA / WAM 动作头的默认解码器之一。
https://arxiv.org/abs/2303.04137arXiv:2606.010952026-06已核验链接评测WAM
超越任务成功率:WAM 与 VLA 的行为与表征诊断
Beyond Task Success: Behavioral and Representational Diagnostics for WAM and VLA
alphaXiv 2606.01095 authors
指出成功率会掩盖差异:级联式 WAM 更容易出现可解释的预测结构,但推理成本更高。
https://arxiv.org/abs/2606.01095