吴佳俊 IROS 2026 演讲:结构化表征是机器人学会推理的脚手架
斯坦福大学助理教授吴佳俊在 IROS 2026 RoBoWoMo 研讨会发表受邀报告《Building Physical Agents via Structured Representations》,以洗盘子场景说明机器人需应对初始状态的定性差别与新观测。
推荐理由:演讲把结构化表征定位为可迁移的中间接口而非硬约束,对做机器人学习框架的人有方法论参考。
斯坦福大学助理教授吴佳俊在 IROS 2026 RoBoWoMo 研讨会发表受邀报告《Building Physical Agents via Structured Representations》,以洗盘子场景说明机器人需应对初始状态的定性差别与新观测。
推荐理由:演讲把结构化表征定位为可迁移的中间接口而非硬约束,对做机器人学习框架的人有方法论参考。
文章对 IROS 2026 进入正式议程的 1933 篇论文做多标签梳理,Robot Learning / Embodied AI 约 809 篇、Navigation / Planning 564 篇、Humanoid / Legged 约 213 篦,指出大模型并没有吃掉机器人学,学习、感知、规划、控制与操作正深度交织。
推荐理由:对1933篇论文的多标签统计给出了各方向的篇数与交叉数据,可据此判断机器人研究的真实重心分布。
IROS 2026 主会于当地时间 9 月 30 日在美国匹兹堡落幕,最佳论文颁给 Yumin Lee、Hyoseok Ju 和 Giseop Kim 的《LT-Mem。
推荐理由:梳理了最佳论文与各专项奖的分布,可看出机器人研究正从展示单一能力转向在真实环境中持续工作。
Visible Touch 论文提出把接触信号暴露在策略已关注的同一空间坐标系中,使任何图像条件策略无需架构改动即可直接利用触觉信息,并配套开源一款用现成零件经参数化 CAD-to-mold 流水线制造的低成本磁性接触传感器。
推荐理由:论文给出把接触信号嵌入策略已有视觉坐标系的做法与开源低成本传感器,读者可据此评估无需改动架构的触觉接入路径。
论文提出基于 JEPA 的机器人世界模型 RoboJEPA,在覆盖 12 种机器人本体的大规模真实机器人数据集上训练,其想象误差(latent rollout 误差)随算力呈二阶幂律,可在拟合规模之外预测模型质量。
推荐理由:论文给出想象误差随算力的二阶幂律,为评估多本体世界模型规模提供了可迁移的预测方法。
Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。
推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。
PointZero 提出以 3D 点轨迹补全作为预训练目标,仅凭单帧 RGB-D 观测和稀疏部分 3D 轨迹预测所有观测点的未来 3D 轨迹,无需机器人动作标签即可学到 3D 动力学先验。
推荐理由:论文提出无需机器人动作标签的预训练目标,可帮助理解如何利用网络视频数据学习 3D 动力学先验。
研究团队提出 FineART 双臂操作数据集,包含 40,543 个 episode(1,718 小时)、533,913 个子任务、覆盖 151 项任务,并开源数据集、模型权重与训练代码。
推荐理由:论文给出子任务标注带来的成功率提升幅度,可评估密集标注对双臂长程任务的价值。
该论文对行为提示(behavior prompting)何时、如何生效进行了实证研究,引入 DrawAnything 和 LIBERO-Gen 基准(最多 2000 个程序生成任务)、上下文视觉运动架构 Behavior Prompting Policy(BPP)以及手持演示接口 iPhUMI。
推荐理由:论文用消融实验指出任务多样性比单任务演示数更关键,做数据采集取舍的团队可参考这一结论。
DepthWorld 提出一种结合学习式立体深度与联合因子图的标定流程,将 DROID 数据集标定为提供稠密度量深度和多视角外参的 DROID-3D,外部相机在 90% 的 episode 上重投影误差 <0.7 px。
推荐理由:论文解释了RGB-only世界模型几何不一致的成因,并给出可迁移的标定与深度监督思路。
论文提出紧凑操作策略 CoRP(48.9M 参数,不含视觉语言模型和视频生成先验),在 LIBERO 达到 97.0%,在 RoboTwin 2.0 Clean/Randomized 分别达到 75.78%/73.36%,匹配大 40.9-163.6 倍的系统。
推荐理由:论文用逐项消融拆解了视觉表征各因素对操作策略性能的贡献,便于评估模型规模与预训练先验的实际作用。
SALT 用上一动作块未执行的 leftover 轨迹作为自监督信号,在测试时对 VLA 策略做适应,无需干扰标注、专家动作或目标域演示。在 LIBERO-10 上,SALT 将 SmolVLA 在五种持续视觉干扰下的平均成功率从 43.9% 提升到 53.2%,GR00T N1.7 从 58.7% 提升到 66.0%。真机实验中,任务进度从 0.49 提升到 0.61。
OpenWAM 提出一个开放的世界-动作建模(WAM)框架,以 Wan2.2-5B 为起点在超过 10,000 小时视频上做因果机器人视频预训练,并通过共享 Mixture-of-Transformers 架构接入动作专家,支持联合、先视频后动作、先动作后视频和解耦四种生成方式。
推荐理由:论文给出了各交互设计在同一测试床上的对比数字,便于评估反事实数据对动力学学习的增益。
SMART 提出面向关节物体操作的大规模合成演示预训练系统,其 SMART-Sim 仿真平台具备关节感知设计,可生成任务并高效采集演示,最终合成的 SMART-Data 覆盖 44 类原子任务、5 种机器人配置和 2,507 个关节物体,共超过 1M 条演示。基于该数据预训练的 VLA 模型在仿真基准上表现具备竞争力,并在真实世界的关节物体操作任务中实现零样本 sim-to-real 迁移。
推荐理由:论文给出合成演示数据的规模与零样本迁移结果,可评估合成预训练在关节物体操作上的可行性。
Flash-WAM 提出模态感知的步蒸馏框架,针对动作流低噪声区间采用线性梯度缩放参数化、视频流高噪声区间采用保方差参数化,把世界动作模型推理压缩到每个模态单步。
推荐理由:论文给出了动作流与视频流噪声分布不对称的结构性分析,做世界动作模型实时推理的团队可据此选择一致性函数参数化。
一项研究系统评估了 Vanilla BC、LSTM-GMM、IBC、Diffusion Policy 与 VQ-BET 等模仿学习算法在白盒、灰盒和黑盒对抗扰动下的脆弱性。
推荐理由:论文给出白盒与黑盒迁移攻击下的成功率下降幅度,可作为评估模仿学习策略鲁棒性的对照基准。
Samuel Liu 等人构建 real2sim2real 流水线,将世界对齐与行为对齐作为两个独立变量,研究二者对协同训练策略性能的影响。在动态灵巧抓取分拣任务上,完全对齐的协同训练把成功率从 52% 提升到 86%;跨配置平均,世界对齐提升 18 个百分点,行为对齐提升 10 个百分点。
推荐理由:论文把世界对齐与行为对齐拆成两个独立变量,给出各自对成功率的贡献幅度,做仿真协同训练的人可据此分配数据投入。
论文针对 VLA 模型低速率推理与机器人高速率执行之间的时间差,测量了模型推理与机器人执行链的端到端时延,并提出两阶段非均匀去噪,将去噪步数从 10 步减到 2 步、模型推理时间从 61.557 ms 降到 21.956 ms。
推荐理由:论文给出两步去噪把推理时间从 61.557 ms 降到 21.956 ms 的实测数据,可为 VLA 实时化优化提供参考。
论文提出 Universal Manipulation Representation(UMR),把操作分解为与本体无关的 World Flow 和相对当前位姿的 Ego Trajectory 两部分,实现人类演示到异构机器人的零样本技能迁移。
推荐理由:论文给出统一动作表示的几何分解思路,跨本体迁移的方法设计对做 VLA 策略的研究者有参考价值。
DEXTERA 提出一套自动化的 real-to-sim-to-real 框架,可将单张 RGB 图像转化为可部署的灵巧操作策略,覆盖场景分解、度量对齐、任务原语构建与多模态策略接口四个阶段。
推荐理由:论文给出从单张 RGB 图像自动生成可部署灵巧操作策略的完整流程,并报告仿真与真实协同训练带来的成功率变化。