IROS 2026 大奖揭晓:LT-Mem 拿下最佳论文,人形机器人打网球、端托盘获奖
IROS 2026 主会于当地时间 9 月 30 日在美国匹兹堡落幕,最佳论文颁给 Yumin Lee、Hyoseok Ju 和 Giseop Kim 的《LT-Mem。
推荐理由:梳理了最佳论文与各专项奖的分布,可看出机器人研究正从展示单一能力转向在真实环境中持续工作。
IROS 2026 主会于当地时间 9 月 30 日在美国匹兹堡落幕,最佳论文颁给 Yumin Lee、Hyoseok Ju 和 Giseop Kim 的《LT-Mem。
推荐理由:梳理了最佳论文与各专项奖的分布,可看出机器人研究正从展示单一能力转向在真实环境中持续工作。
论文提出 UltraText Bench,一个面向 prompt-only 密集视觉文字生成的双语评测基准,含 432 条提示、24 个真实场景类别和三个难度等级,中英文各占一半,每条提示标注 4 至 12 个文字区域的精确字符串及结构化参考。
SWE-Game 推出一个由 247 项任务构成的游戏开发基准,覆盖 41 个可执行的 Godot 参考游戏、13 种 2D 与 3D 玩法类别,任务类型涵盖从需求简报生成游戏、按设计文档实现、骨架补全、83 例注入故障修复以及 Godot 到 Unity 移植。
研究团队推出 RobotWorld,一个面向机器人任务的仿真测试基准,将指令与观测转化为物理任务执行。其 84 项任务覆盖操作、移动操作、运动、驾驶与空中控制,设有显式交互预算与可执行成功判定。
一项在 AGX Orin 与 Pololu 3pi+ RP2040 上开展的硬件在环评测显示,任务准入合并能在 48 个条件中的 31 个减少分配器调用与处理器开销,但收益取决于到达强度与分配器类型。
研究提出 SafeActBench,包含 6 个操作域、5 类协议下的 656 个案例,用证据溯源台账与确定性轨迹评估器追踪工具使用型 Agent 从静态动作判断到单步、多步工作流的失败点。在 10 种模型-框架配置中,静态动作评估较强与交互执行较弱并存,失败常发生在执行前:调查不完整或证据未确立就动手。证据确立后单步执行通常可靠,多步工作流则暴露未解决的前置条件与执行不完整。
第三方评估框架在密歇根大学 Mcity 测试设施的仿真与实车测试中验证了开源 L4 自动驾驶系统(ADS),结果显示其仅具备 14 项行为能力中的 6 项,碰撞率为 3.01x10^-3 次/英里,约为人类驾驶员平均水平的 1,000 倍。测试还发现了该系统此前未知的不安全场景,凸显了在大规模部署前开展行为安全评估的必要性。
一项面向软体机器人损伤恢复的无先验可复现基准发布,在九次在线试验协议下,GP-EI 参考控制器在两个各含 75 个本体的队列上以 0.235-0.310 的平均最差掩码奖励超越 random search、Sobol、CEM 和 CMA-ES,并在 69/75 个确认本体上取得增益。
BiGym 2.0 将 BiGym 适配到 Unitree G1,覆盖 20 项家庭任务,使用统一的全身控制器进行演示与评测,每项任务提供 60 条人类虚拟现实演示,含同步多相机视角和全身执行记录。
CLRE 提出一种分层滚动时域控制框架,在冻结上游规划器、不引入新学习模型的前提下,通过有限时域最优控制与预测条件 OBB 可行性测试筛选候选轨迹,下层结合距离速度上限与饱和比例制动律执行。在 Bench2Drive 220 条路线验证集上以 VAD 为上游规划器闭环仿真,驾驶得分从 42.26 提升至 55.89,路线完成率从 55.69 提升至 71.51,碰撞事件从 117 降至 97。
研究者提出 Tetris 基准,用同一组方块、以 oracle 评分衡量 AI Agent 从"服务化"模型获得的决策质量。在一家 serverless 供应商上对 9 个开源权重模型做 5 组预设实验,并自托管一个开源决策模型跑在 CPU 上,发现价格与模型规模不预测决策质量;重发历史在缓存输入免费时几乎零成本,若不免费则贵 11-12 倍且让棋局变差。
论文提出 Embodied Agent Arena,用 1,000 个案例评测七个 VLM 智能体在几何、空间推理、可供性、任务规划和操作五类能力上的表现,案例取自 32 个已有来源并新增几何估计基准 GeoProbe,覆盖 Blender 渲染图与真实场景图像。
NavSafe-∞ 提出一个照片级真实的闭环驾驶安全基准,包含 280 个场景、28 类事件,并按交通事故、弱势道路使用者碰撞、交通违规、交通事件四类给出能力评分。在评测 20 个端到端驾驶策略后发现,开环指标提升并不能可靠转化为闭环安全表现。基准与可扩展的事件编排、策略诊断工具箱将开源。
CANMOT 提出面向 KF 3D 多目标跟踪的类别感知、目标对齐噪声建模框架,为不同交通参与者引入类别专属的过程与测量协方差矩阵,并可选地在目标坐标系下表达以保留纵横向各向异性。在 nuScenes 上的实验显示该方法提升跟踪性能并显著减少身份切换。基于 ANEES 与 χ² 违规检验的分析揭示标准 KF 基线存在严重过度自信,所提方法改善校准但仍存在明显不一致。代码已开源。
SelectOccFlow 提出选择性时空聚合框架,通过 Semantic-Guided Sampling、State-Conditioned Temporal Aggregation 与 Extent-Aware Spatial Aggregation 逐步精炼图像、时序与体素域的上下文证据,用于相机 3D 占据与场景流预测。
ArtifactArena 是一个开放式平台,让模型在物理接地的软硬件协同设计挑战中工程化构建可运行机器人并在模拟竞技场对战。平台通过文本描述、物理仿真器反馈和游戏数据三种 harness 评测前沿模型的零样本、验证器引导精修与开放式物理设计能力,并用对战 Elo 排名对模型进行基准测试。该框架与赛事基础设施将开放社区持续提交,形成不饱和的开放式智能测试床。
Siyuan Liu 等提出 ControlPed 框架,将轨迹级冲突合成与 3D Gaussian Splatting 结合,生成照片级、运动可控的车-人危险交互场景。
Radar2Plan 提出首个面向自动驾驶规划、基于真实世界 4D 雷达数据的开环自车轨迹规划基准,通过统一接口连接传感器编码器、场景表示与规划头。基于 DSERT-RoLL 与 MAN TruckScenes,基准在 12 种天气与光照条件下评测了相机、4D 雷达与 LiDAR 的 7 种组合、4 种规划基线。实验显示 4D 雷达单独即可支撑有竞争力的轨迹规划,并在恶劣条件下保持稳健表现。
GenAIF 用单一生成式轨迹模型从演示与动作干预中学习,同时提供目标条件策略分布与状态到观测的似然映射。
研究通过 540 次瓷砖地面随机试验(保留 539 次),在 45、55、65 cm/s 指令接近速度下评估差速移动机器人的 5 种制动与转向机动。结果显示,反向旋转机动的编码器航向误差随速度从最低升至最高增加 4.7-5.1 度,而弧线与制动辅助枢转变化小于 0.4 度,陀螺仪误差在反向旋转中约 3 度。编码器误差越大,避障成功率越低,研究据此给出 90% 成功率的估计反应距离。
研究者在 NVIDIA Isaac Sim 中为六自由度 BlueROV2-Heavy 管道跟踪 ROV 建立统一动力学框架,用同一 USD 场景向向量化 NumPy 的 Fossen 方程与 PhysX 力施加提供一致的质量、附加质量、阻尼、浮力与推力器参数。
CrashSim 用真实碰撞先验引导多智能体生成式交通仿真,生成更贴近真实碰撞演化过程与碰撞类型分布的自动驾驶安全评测场景。基于 CrashSim 构建的 nuCrash 数据集包含 4,000 多个碰撞与近碰撞场景,对 5 个自动驾驶规划器的闭环评测显示其比 nuScenes 更能暴露规划器安全能力差异。LLM 辅助评测代理进一步给出能力级诊断与改进指导。
DecepEval 发布了一个包含 1,532 个实例、覆盖 3 类任务与 28 个专业场景的 LLM Agent 欺骗行为评测基准,并提出 LLM Deception Diamond 框架,刻画压力、激励、机会、冲突四种可能诱发欺骗的外部条件。
Figure AI 公布 Helix 在物流分拣场景的最新进展,包裹处理时间降至约 4.05 秒,条码朝向成功率提升到约 95%,并能处理 poly bag、平信封等可变形包裹。
推荐理由:原文给出 10 到 60 小时演示数据与各模块消融的量化结果,可用来判断数据规模与架构改动各自的收益。