原集嘉宾是 Flexion Robotics 联合创始人 Nikita Rudin。官方节目说明里,讨论轴很清楚:运动远未「解决」、视觉拖累 sim2real、端到端 vs 分层、real-to-sim,以及 VLM→VLA→全身跟踪的层级。免费读者看到这里;下面会员部分按这些可核主题拆,先按官方说明搭骨架,再补带时间戳的口播证据。
TWIML:2026 年的智能机器人,差的不是又能多走几步
Flexion 的 Nikita Rudin 在 TWIML #760 里反复回到:运动在仿真里好看,不代表能部署;视觉一进环,sim2real 就变难;今天更务实的是分层,而不是一把梭端到端。
一手源:TWIML AI Podcast
这期在拆什么
一手源是 TWIML AI Podcast #760(2026-01-08):Intelligent Robots in 2026: Are We There Yet?,嘉宾 Nikita Rudin(Flexion Robotics 联合创始人兼 CEO)。完整节目说明见 twimlai.com/go/760。
和站内上一篇会员拆(Latent Space / 软件 Agent「能演示、不能值班」)对照:那边卡在权限与评价;这边卡在 物理世界里的可部署性——仿真里的运动进步,不等于能进真实场景值班。
下面按官方节目说明的议题拆,并用 ASR 口播作证据。未出现在节目页或听录里的数字与内部指标,一律不编。
1. 运动进步了,但还没「解决」
节目说明明确写道:强化学习与仿真推动了机器人运动(locomotion)的快速进展,同时强调 locomotion is still far from “solved.”
这句对媒体叙事很有用:四足/人形「会走」的视频很容易被剪成「已经能干活」。Rudin 的框架是把「会走」从「能部署」里拆出来——进步真实,闭环未完成。读者核对应听原集里他对「未解决」具体指哪些失败模式(地形、扰动、长时间稳定性等),节目页本身没有展开清单。
2. 视觉一进环,sim2real 明显变难
官方摘要单独点出:sim2real gap;加入视觉输入会引入噪声,并显著加重 sim-to-real transfer 的难度。
门道不在「仿真无用」,而在 观测模态一变,迁移假设就崩。纯本体感觉/状态的运动策略,和「看见图再动」不是同一难度阶。这和站内 Open X 一类「公开轨迹数据」议题是姐妹题:数据与仿真都要回答「你训练时看见的,是不是部署时看见的」。
3. 端到端 vs 分层:今天更务实的是拆开
节目说明写明讨论了 end-to-end 与 modular 之争,并给出立场摘要:separating locomotion, planning, and semantics remains a pragmatic approach today(把运动、规划、语义分开,在今天仍是务实做法)。
对「从模型到房间」读者:这不是否定端到端研究,而是部署叙事上的优先级——先让全身跟踪稳,再让语言/语义层发任务,而不是用一个大网同时赌行走与理解。
4. real-to-sim:用真机数据反修仿真
嘉宾引入 real-to-sim:用真实世界数据去 refine 仿真参数,提高训练保真度。方向与常见的 sim→real 单向箭头相反:不是只把策略搬出去,而是让仿真追着真机分布走。
节目页未给出 Flexion 的具体标定流程或开源工具链;要核对实现细节,只能回听原集或查阅其后续公开材料。
5. 数据配方:RL + 模仿 + 遥操作
官方说明提到:强化学习、模仿学习与遥操作数据如何组合,以训练四足与人形上更稳健的策略。这又是「演示视频不可核」的反面:可核的是 数据来源是否混合、各起什么作用,而不是剪辑后的成功镜头。
6. Flexion 的层级:VLM → VLA → 全身跟踪
节目说明给出架构摘要:
- 预训练 VLM 做高层任务编排(task orchestration)
- VLA 承接中层动作语义
- low-level whole-body trackers 做底层全身跟踪
这与第 3 点的「分层务实」一致:语言/任务在上层,运动闭环在下层。读者若只记住「我们有 VLA」,会漏掉他们把 whole-body tracker 单列出来的原因——部署往往死在下层跟踪,而不是死在提示词。
7. 人形演示的幕后,以及入门建议
节目后段覆盖:人形演示幕后、仿真 RL vs 真机 RL、reward tuning 的讲究,以及对研究者/从业者的入门建议。这些在节目页是议题列表,不是逐条结论;写进笔记时只标记「原集有专段讨论」,避免把二手「内幕」写死。
和本站其它稿怎么串
| 稿 | 关系 |
|---|---|
| Open X-Embodiment(会员) | 公开操作数据;本篇补「策略与仿真侧」叙事 |
| Asimov 开源腿/套件(免费 OSS) | 开源硬件与控制链;本篇偏公司/方法立场 |
| Latent Space Agent 值班(会员) | 软件 Agent 的生产门槛;本篇是具身部署门槛 |
信源
口播证据(英文听录,时间戳)
依据原集音频 ASR(英文)与下载专家整理的可读中文稿,摘几句可回听核对的证据。
- 英文时间戳听录:
docs/transcripts/twiml-760-robots-2026-en.md - 中文书面访谈体:
docs/transcripts/twiml-760-robots-2026-zh.md(YouTube en-orig 字幕 → 翻译;制作说明见同目录twiml-760-robots-2026-zh-NOTES.md)
冷开场 · 价值([00:00])
… there is not a single humanoid robot today that actually generates value. … it’s not doing the actual thing it’s supposed to.
中文稿对应:目前尚无一款人形真正创造实际价值——接近预期≠做对目标作业本身。
运动是否已解决([04:20])
The general question is, is locomotion solved or not? … My take is that locomotion is not solved.
中文稿意译:唯有机器人能到人类可及之处、且使用者不必再怀疑可靠性时,运动才算真正解决。
视觉进环后的 sim2real([07:04])
That sim to real gap is much larger once you have perception in the loop. Once you’re simulating either depth images or RGB images, it’s even worse.
分层仍务实([10:00])
主持人复述、嘉宾认可:modular approach can still be a pragmatic way;嘉宾补白自己 PhD 曾一路推向 locomotion 的 end-to-end,却仍主张当下要拆。
VLM→VLA([23:20])
you take a VLM, you remove the output, and you train a … new part of the network on top, and then you call that a VLA.
real-to-sim([30:33])
… what we call a real to sim process. So we take the real robot, we’re just hanging it in the air, we let it shake a little bit, collect data of all the different motors.
全身跟踪([39:31])
… a whole body tracker, which will receive this plan of how the hand should move and how the whole body should move, and then we’ll control the motors …
限制
议题结构对齐官方节目说明;英文引文来自音频 ASR,中文对照来自字幕译稿,二者时间戳口径可能略有偏差。核对以回听原集为准。