吴佳俊 IROS 2026 演讲:结构化表征是机器人学会推理的脚手架
斯坦福大学助理教授吴佳俊在 IROS 2026 RoBoWoMo 研讨会发表受邀报告《Building Physical Agents via Structured Representations》,以洗盘子场景说明机器人需应对初始状态的定性差别与新观测。
推荐理由:演讲把结构化表征定位为可迁移的中间接口而非硬约束,对做机器人学习框架的人有方法论参考。
斯坦福大学助理教授吴佳俊在 IROS 2026 RoBoWoMo 研讨会发表受邀报告《Building Physical Agents via Structured Representations》,以洗盘子场景说明机器人需应对初始状态的定性差别与新观测。
推荐理由:演讲把结构化表征定位为可迁移的中间接口而非硬约束,对做机器人学习框架的人有方法论参考。
文章对 IROS 2026 进入正式议程的 1933 篇论文做多标签梳理,Robot Learning / Embodied AI 约 809 篇、Navigation / Planning 564 篇、Humanoid / Legged 约 213 篦,指出大模型并没有吃掉机器人学,学习、感知、规划、控制与操作正深度交织。
推荐理由:对1933篇论文的多标签统计给出了各方向的篇数与交叉数据,可据此判断机器人研究的真实重心分布。
IROS 2026 主会于当地时间 9 月 30 日在美国匹兹堡落幕,最佳论文颁给 Yumin Lee、Hyoseok Ju 和 Giseop Kim 的《LT-Mem。
推荐理由:梳理了最佳论文与各专项奖的分布,可看出机器人研究正从展示单一能力转向在真实环境中持续工作。
论文提出 RobotWorld,一个面向机器人操作的仿真测试基准,包含 84 项任务,覆盖操作、移动操作、运动、驾驶与空中控制,设有明确的交互预算与可执行的成功判定。
论文提出 Systematic Multi-Agent Vision-and-Language Navigation,将多智能体 VLN 首次系统形式化为带依赖与资源约束(presence locks 和 holding chains)的协同问题。
Faster-WAM 提出以视频世界模型为中心、动作专家仅单层的设计,通过 Dock of Transformers (DoT) 配合 Lite KV-Fusion 让轻量动作专家访问所有视频层表征,并采用仅基于世界模型的条件输入与 retracted 1D-RoPE 位置对齐。
论文提出 StressDream,通过优化扩散式视频世界模型的初始噪声,将想象引导至推理时以文本指定的高影响但合理的结果(如任务失败),从而实现稳健的策略评估与改进。
一篇被 ACM Computer Survey 接收的综述系统梳理了生成式 AI 在自动驾驶全栈中的角色,覆盖 VAE、GAN、Diffusion Models 与 LLM 的原理与取舍,以及图像、LiDAR、轨迹、occupancy、视频生成和 LLM 引导的推理决策等前沿应用。
WBAG 提出一种面向视觉语言动作策略的推理时安全框架,建模机器人全身与抓取相关的附着物体几何,构造随抓取状态变化的安全集,并将其转化为可微的 CBF 约束,对 VLA 的六维操作空间动作做最小修改以避碰。
论文提出社交导航场景理解基准 SocialNav-SUB,一个用于评测 VLM 在真实社交导航场景下理解能力的 VQA 数据集与基准,涵盖空间、时空和社会推理任务,并在统一框架下与人类和规则基线对比。
CoRe-WAM 提出 TraceDelta 模块,用冻结跟踪模型的对应关系将历史视觉特征搬运到当前位置再计算带符号差值,仅优化 1.59 million 参数、5,000 次更新适配预算下,在 RoboTwin 2.0 的 50 项任务上 clean 成功率达 92.22%,较 Motus 提升 3.56 个百分点,随机化评测下 89.60%、提升 2.58 个百分点。
Visible Touch 论文提出把接触信号暴露在策略已关注的同一空间坐标系中,使任何图像条件策略无需架构改动即可直接利用触觉信息,并配套开源一款用现成零件经参数化 CAD-to-mold 流水线制造的低成本磁性接触传感器。
推荐理由:论文给出把接触信号嵌入策略已有视觉坐标系的做法与开源低成本传感器,读者可据此评估无需改动架构的触觉接入路径。
论文提出将鲁棒VLA适配视为失败边界学习问题,并给出方法DLS:基于少量真实演示与仿真协同训练构建真实落地的行为先验,通过on-policy数字孪生rollout大规模发现失败边界。
论文提出 VIA(Visual Interface Agent)框架,把机器人控制重新表述为智能体任务,让现成智能体通过由可交互视觉组件构成的虚拟工作区直接驱动机械臂,用鼠标式工具探测像素并指挥虚拟末端执行器设定目标位姿。
论文提出 MultiSensory World Model(MuSe),通过多阶段融合、多感官未来预测和在预训练数据上的经验回放,把有限的多感官数据注入仅视觉的预训练策略,使其适应新任务并引入新模态,同时保持原有传感器配置下的性能。
论文提出 SAPS,一个在动作层将实时人类遥操作指令与预训练 VLA 动作融合的轻量框架,无需重训策略、辅助动力学模型或架构改动。
论文提出针对机器人学习管线中世界模型的新型数据投毒攻击,可在看似安全的遥操作数据集中注入恶意提示或被破坏的转移动力学,仅在经世界模型输入后激活,进而生成危险的合成训练轨迹并导致不安全的机器人策略部署。作者在动作条件和文本条件世界模型上验证了攻击效果,展示了针对下游 DRL 策略的端到端后门以及 VLA 场景的概念验证,呼吁研究更安全的世界模型并重新评估其在机器人学习供应链中的位置。
WorldDP 提出一种面向多阶段机器人操作任务的分层世界模型框架,高层世界模型作为转移函数在运行时优化可行子目标,再由低层 Diffusion Policy 执行到达。框架引入以物体为中心的表征,将环境实体解耦以支持逐实体的顺序规划。在多个机器人基准测试上,WorldDP 持续优于现有基线,验证了世界模型的物理规划与 Diffusion Policy 高效执行相结合的多阶段性能优势。
TAVIS 是面向主动视觉模仿学习的评测基础设施,包含 TAVIS-Head(5 个任务,通过 pan/tilt 颈部全局搜索)与 TAVIS-Hands(3 个任务,腕部相机局部遮挡)两套任务,基于 IsaacLab 构建,覆盖 GR1T2、Reachy2 两种人形躯干具身。
NovaPlan 是一个分层框架,通过系统性地提出、验证和修复视觉计划,实现鲁棒的零样本长时域操作。高层由 VLM 规划器分解任务,并通过验证多个候选视频回滚过滤动力学不一致的未来;执行中采用在物体中心流与人手流之间自适应切换的混合几何表示,并持续监控执行、在失败时合成指尖轻戳等局部非抓取纠正行为。
论文提出机器人策略框架 Agentic Scene Policies(ASP),通过 scene-agent 工具接口把物体定位能力与机器人技能统一到单一 agentic 动作空间,缓解模块化策略仅按语义检索、缺乏显式空间推理的局限。
RoboFAC 提出一个面向 VLA 模型失败诊断与恢复的框架,构建了含 9,440 条错误操作轨迹、78,623 个 QA 对、覆盖 53 个仿真与真实场景的失败数据集,并训练出可本地部署的轻量多模态模型。实验显示其失败分析准确率比 GPT-4o 高 34.1%,作为外部监督器接入真实 VLA 控制流程后在四项任务上带来 29.1% 的相对提升,且延迟显著低于 GPT-4o;模型与数据集已公开。
论文提出基于 JEPA 的机器人世界模型 RoboJEPA,在覆盖 12 种机器人本体的大规模真实机器人数据集上训练,其想象误差(latent rollout 误差)随算力呈二阶幂律,可在拟合规模之外预测模型质量。
推荐理由:论文给出想象误差随算力的二阶幂律,为评估多本体世界模型规模提供了可迁移的预测方法。
论文提出 Q-learning with Scalar Adjoint Matching(SQAM),针对流策略经多步流生成动作、用离线 RL 微调时每步需向量-雅可比乘积且成本随流步数与策略规模增长的问题,观察到预训练流策略的批量平均速度雅可比集中在对角线上,据此推导出按流时间缩放最终动作价值梯度的闭式标量伴随,消除逐步向量-雅可比乘积,并在策略生成动作上加入价值惩罚。
论文提出 Video Prediction Policy 2(VPP2),一种世界动作模型(WAM),通过大规模操作视频继续预训练、蒸馏为单步视觉规划器,并以 mixture-of-transformers(MoT)架构引入动作模块,实现视频预测与动作生成的零样本泛化。
TERRA 用紧凑的时序效果(净特征变化加窗口内低阶动力学分量)描述状态转移,并提出 Effect-Anchored Transport(EAT),让潜在动作在其他初始状态下解码后锚定到源端观察到的效果,使其含义由跨上下文的作用而非单一转移决定。
RLHND 提出基于视频基础模型的手部跟踪模型,从单目第一视角视频联合估计手部位姿与贴近实际的触觉信息,缓解现有方法仅从裁剪帧回归位姿导致的不准确和物理不一致问题。
论文提出一种事件对齐的视觉动作推理框架,围绕交互事件组织视觉-动作预测,让 WAM 在每次想象推演中生成事件对齐的视觉上下文,对任务关键状态变化给予更细粒度的推理,对连接性过渡则粗粒度推进。
RoboPrompt 是一个轻量级机器人策略引导系统,用户通过绘制轨迹、目标点和粗略方向指令等稀疏输入引导策略行为,将人类意图翻译与基座策略解耦,在噪声空间控制动作生成,无需修改基座策略架构或为其微调。
Long-WAM 提出在实时控制约束下扩展因果世界动作模型上下文的模型系统框架,核心发现是访问历史不等于利用历史,更长历史只有在视频基础模型采用自回归预训练时才显著见效。
同一新闻,精选展示《Long-WAM:扩展世界-动作模型上下文的模型系统框架》
论文发现 VLA 模型对指令措辞高度敏感,$π_{0.5}$ 在 LIBERO 上对 switch on the stove 成功率 100%,对 switch on the hot plate 仅 2%,改写增强微调后的 $π_0$ 仍波动达 61 个百分点。
论文提出 Agentic Real-to-Sim-to-Real(Agentic RSR)框架,把场景重建、策略开发与真机执行通过同一操作任务串联起来:给定工作空间视频、任务描述和已知机器人模型,智能体恢复度量尺度、用视觉反馈迭代细化场景并在 MuJoCo 中检查任务相关交互,再由编码智能体从特权物体位姿逐步过渡到视觉观测和随机化仿真,生成可执行策略。
AirGroundVLN 提出面向目标导向空地协同视觉语言导航(VLN)的大规模基准,包含 19 个 Unreal Engine 环境中的 10,281 个导航片段与 955 个目标实例,设有 seen/unseen 划分与 aerial-visibility 协议。
论文提出 RoboQuest 基准,用于评估智能体通过物理交互主动获取任务相关信息、据此调整后续动作并自主判断何时完成任务的能力。该基准包含十项移动操作任务,围绕搜索、基于操作的检查和交互式测试三类不确定性构建;作者通过统一视觉运动接口评测五个前沿多模态智能体,并测试了在完整轨迹演示上微调的 π0.5 策略。
论文提出OpenViTac,一个跨仿真与真实世界的视触觉机器人操作基准,将接触密集型操作归纳为四个触觉相关能力维度,并提供配对的仿真-真机设置,用于一致评测VLA、WAM和VTLA策略。
论文对 π0.5 和 GR00T N1.7 两个 VLA 模型的语言接地能力开展机制可解释性研究,对其动作生成模块残差流施加 activation 与 attribution patching,并按同义替换、语义缩放、方向性破坏、随机物体替换、空字符串五种策略系统扰动 LIBERO 基准的任务指令。
论文提出 DRIVE(Diversity-driven RL fIne-tuning for VLA gEneralization),把成功行为的多样性显式纳入 RL 微调目标:在相同任务条件下对 rollouts 分组、做时间对齐的轨迹比较,并从相对行为多样性中导出成功条件下的内在奖励,以扩大可行解空间覆盖而不奖励失败的多样或表面时序差异。
Juno 提出一个围绕动作条件 JEPA 构建的统一框架,将其同时用作控制对齐的表征骨干、预测教师和可适配的动力学模型,以解决 VLA 中预测隐变量与具身控制不匹配、干扰动作学习、教师在分布偏移下失准三类问题。
论文提出 ΔWAM,通过动作切线场(Action Tangent Fields)对动作如何诱导未来动力学变化做局部 Taylor 展开,把世界监督重新表述为与动作紧密耦合的一阶结构,并蒸馏进 WAM 的去噪监督。
论文提出 YUBI-STAG 框架,结合接触物体分割与视觉语言模型,为操作演示自动标注物体身份、属性状态、单臂动作、双臂协同与空间交互,以对齐预训练 VLA 与细粒度操作语言。