具身 / 机器人 / 世界模型

论文

精选 12 篇公开 arXiv 论文,覆盖 VLA 奠基、开源基线,以及 2025–2026 年 WAM / WLA 综述与系统。标题与编号已按 arXiv 摘要页核对;简介为中文改写,不是原文翻译。

arXiv:2605.120902026-05已核验链接WAM综述VLA

世界行动模型:具身智能的下一前沿

World Action Models: The Next Frontier in Embodied AI
S. Wang, J. Shi, Z. Fu et al.

把世界模型与动作生成的结合正式命名为 World Action Models,并拆成级联式与联合式两类。本站世界模型页的分类轴来自这篇综述的概念,表述为原创改写。

https://arxiv.org/abs/2605.12090
arXiv:2506.215392025-06已核验链接Joint WAMVLA

WorldVLA:自回归的动作世界模型

WorldVLA: Towards Autoregressive Action World Model
Junjie Wen et al.

在同一自回归框架里同时预测动作与未来图像,并讨论动作块生成时的误差累积与注意力掩码。

https://arxiv.org/abs/2506.21539
arXiv:2511.175022025-11已核验链接Joint WAM真机

RynnVLA-002:统一的 VLA 与世界模型

RynnVLA-002: A Unified Vision-Language-Action and World Model
RynnVLA Team

用共享词表的自回归骨干同时承担动作预测与未来帧预测,并报告仿真与真机对照。

https://arxiv.org/abs/2511.17502
arXiv:2606.059792026-06已核验链接WLAJoint WAM

世界-语言-动作模型

World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis
WLA-0 authors

在 WAM 的世界接口之上补回语言层子任务,用自回归骨干同时预测文本子目标、子目标图像与动作。

https://arxiv.org/abs/2606.05979
arXiv:2602.120632026-02已核验链接Cascaded WAM真机

VLAW:VLA 与世界模型的迭代互促

VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model
VLAW authors

用真机 rollout 把世界模型补到足够物理,再生成合成轨迹去改进 VLA,是级联式闭环的一条工程路线。

https://arxiv.org/abs/2602.12063
arXiv:2606.001332026-06已核验链接世界模型综述

世界模型综论:架构、方法、推理与应用

World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications
A. H. Zidan, Y. Pan, H. Jiang et al.

覆盖世界模型的架构与推理范式,适合作为 WAM 出现之前的背景阅读。

https://arxiv.org/abs/2606.00133
arXiv:2606.207812026-06已核验链接WAM综述

世界行动模型综论:少做梦,多行动

World Action Models: A Survey, Dream Less, Act More
Q. Shen, S. Zhang, Y. Liao et al.

与 2605.12090 同期的另一条综述线索,强调预测保真与可执行动作之间的取舍。

https://arxiv.org/abs/2606.20781
arXiv:2406.092462024-06已核验链接VLA开源

OpenVLA:开源视觉-语言-动作模型

OpenVLA: An Open-Source Vision-Language-Action Model
Moo Jin Kim et al.

开源 VLA 基线之一,后续大量 WAM 工作把它当作反应式对照。

https://arxiv.org/abs/2406.09246
arXiv:2410.241642024-10已核验链接VLA流匹配

π0:面向通用机器人控制的流匹配 VLA

π0: A Vision-Language-Action Flow Model for General Robot Control
Physical Intelligence

用流匹配解码连续动作的通用操控模型,是 2024–2026 年 VLA 谱系里被引用最多的节点之一。

https://arxiv.org/abs/2410.24164
arXiv:2307.158182023-07已核验链接VLA奠基

RT-2:把网络知识迁移到机器人控制

RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
Anthony Brohan et al.

较早把互联网尺度视觉语言预训练接到机器人动作词表上的工作,VLA 这个名字由此进入产业讨论。

https://arxiv.org/abs/2307.15818
arXiv:2303.041372023-03已核验链接策略扩散

Diffusion Policy:用扩散学习视觉运动策略

Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
Cheng Chi et al.

用扩散过程生成动作块,后来成为许多 VLA / WAM 动作头的默认解码器之一。

https://arxiv.org/abs/2303.04137
arXiv:2606.010952026-06已核验链接评测WAM

超越任务成功率:WAM 与 VLA 的行为与表征诊断

Beyond Task Success: Behavioral and Representational Diagnostics for WAM and VLA
alphaXiv 2606.01095 authors

指出成功率会掩盖差异:级联式 WAM 更容易出现可解释的预测结构,但推理成本更高。

https://arxiv.org/abs/2606.01095
公开信息整理,非投资建议;请回源核验