迭代式奖励设计全景:BIRD 基准统一评测 LLM 奖励函数生成方法
研究者提出迭代式奖励设计基准 BIRD,将现有 LLM 奖励代码生成与迭代改进方法统一到同一配置与评测空间,便于直接对比、消融设计选择。在 MuJoCo、Meta-World、Assistax、HumanoidBench 上,少量简单设计选择持续提升性能,组合后显著优于先前方法。代码已开源。
研究者提出迭代式奖励设计基准 BIRD,将现有 LLM 奖励代码生成与迭代改进方法统一到同一配置与评测空间,便于直接对比、消融设计选择。在 MuJoCo、Meta-World、Assistax、HumanoidBench 上,少量简单设计选择持续提升性能,组合后显著优于先前方法。代码已开源。
SelectOccFlow 提出选择性时空聚合框架,通过 Semantic-Guided Sampling、State-Conditioned Temporal Aggregation 与 Extent-Aware Spatial Aggregation 逐步精炼图像、时序与体素域的上下文证据,用于相机 3D 占据与场景流预测。
研究给出有损编码器下 latent safety filter 安全证书可迁移到物理系统的判据:被丢弃的安全相关动力学的可检测性决定证书是否存在。构造出 latent 模型精确、latent 信号恒报安全而物理状态可任意不安全的系统,此时无证书存在且编码器下游监视器无法检测失效。
CurveCodec 2 用小型学习熵模型对残差做熵编码,整数推理跨平台 bit-exact,并在每段解码片段上验证 ACL 最坏情况或平均误差契约。
该框架将神经网络直觉规划与模型预测控制推理规划结合,通过元认知组件依据知识图谱与风险场在两者间切换。在 CARLA 中针对(应急)车辆闯红灯的分布外场景测试,相比纯神经网络规划器将碰撞数减少 89%,并提升对特殊路权规则的遵守。论文已被 IEEE ITSC 2026 接收。
研究提出用精确二分图完美匹配(Jonker-Volgenant)求解单位质量离散最优传输,在稠密 2-D 实例上比 Sinkhorn 与 Greenkhorn 更快且严格更准:n=500 时 0.01 s、n=8000 时 11.5 s,而 Greenkhorn 达到 1% 质量目标需约 10-80 min(慢 4e2-6e4 倍)。
研究提出一种基于非对称 actor-critic 的循环强化学习策略,用于无人旋翼机在升沉舰船甲板自主降落:训练时 critic 可见 6 s 未来甲板高度,actor 仅接收 17 维机载状态并输出世界系速度与偏航角速率指令。
WAMJET 是一个面向 World Action Models(WAM)推理加速的 agentic harness,通过为编码智能体提供可复用的优化指导以及测量与验证工具,按瓶颈驱动的工作流对推理进行剖析、修改代码、验证效果并迭代优化,同时保持动作质量。
研究者利用流固耦合开发出一类传感端完全不含电子元件的软体触觉传感器,仅用两个外部压力传感器连接充液弹性通道,通过黏性流体位移产生的压力模式编码触碰位置与力。机器学习框架结合特征提取、软聚类与自适应神经模糊推理实现定位与力估计,并在 1D 线性传感器上验证后用空间填充曲线扩展到 2D 触觉映射。该方案在水下或强磁干扰等常规电子传感器易失效的环境中依然有效。
研究提出 InterMimicGen,一个自进化动作模仿框架,让人形机器人运动数据与跟踪策略互相增强,用于扩展 loco-manipulation 能力。该框架先整合动捕的人-物交互数据集并重定向为人形机器人参考动作,保留全身协调与灵巧手-物关系,再训练一个基于物理的通用跟踪器在仿真中执行这些参考动作,并通过数据飞轮不断生成并筛选可执行的动作变体。
RV-ICL 是一种免训练方法,将单个演示视频按抓取、释放等子事件构建为从关键帧到短片段的多层只读层级,供 LLM 智能体在规划前读取粗粒度层、执行中按需加载当前子目标片段。基于 RPent,RV-ICL 在 LIBERO-PRO 上将成功率从 92.6% 提升至 96.5%,在 LIBERO-Plus 上从 86.7% 提升至 95.8%。
AffordCraft 从单张 RGB 图像和任务指令出发,通过检索而非生成的方式定位物体与操作部件,从关节资产库中选取匹配条目并拟合到图像,同时保持部件与关节完整。
推荐理由:论文给出资产库规模与成功率的对照数据,做仿真数据构建的团队可据此评估检索式方案相对生成式方法的成本差异。
研究者提出分层规划框架,用 p-cRVAE 学习线性化物理模型的残差修正,从抓取点观测预测 40 步规划时域内的完整布料构型,并嵌入 MPPI 规划器与 MPC 层完成双臂移动机械臂全身控制。
SimForcing 提出仿真引导框架,通过潜空间运动蒸馏与多块仿真条件注入(含条件 dropout)把仿真运动先验迁移到真实域机器人世界模型,推理时无需额外世界模型。
ArtifactArena 是一个开放式平台,让模型在物理接地的软硬件协同设计挑战中工程化构建可运行机器人并在模拟竞技场对战。平台通过文本描述、物理仿真器反馈和游戏数据三种 harness 评测前沿模型的零样本、验证器引导精修与开放式物理设计能力,并用对战 Elo 排名对模型进行基准测试。该框架与赛事基础设施将开放社区持续提交,形成不饱和的开放式智能测试床。
MarvisNav 是一个零样本物体导航(ZSON)框架,把候选节点及其探索状态投影到第一人称视图上,作为带记忆的视觉路径选项,让 VLM 无需额外融合或重排序即可同时评估目标相关性与探索进度。
该研究提出一种人机协同伤员撤离的联合路径规划方法,通过优化伤员交接的 switch points 最小化任务总时间。在多个 1km2 合成环境中,优化策略较纯人工基线缩短平均任务时间 5.3%、较未优化 switch points 的朴素人机协同策略缩短 7.0%,并降低人体能量消耗 17.8%。
Odyssey 提出一个长时程闭环驾驶基准,包含 100 个场景,每个场景由 100 秒 nuPlan 驾驶日志重建,以保留导航操作与交通交互上下文。基准用显式标准定义(SD)地图路线替代方向指令,并引入 SD Route Compliance、Pre-Lane Change Score 与 RouteDS 指标评估规划器路线遵循与变道准备能力。基准代码与适配后的基线将公开发布。
该研究提出二维分类学,沿"意识对象"与"意识分布"两个轴区分 Mutual Awareness、Shared Situational Awareness 与 Team Situational Awareness,指出三者构成包含层级而非同义词,分布谱系从完全个体化理解(MA)到完全统一理解(SSA),TSA 居于混合位置。
阿利坎特大学团队提出一种结合多智能体强化学习与神经进化策略的混合方法,自动合成用于自主视觉导航的群体机器人控制器,仅依赖单目相机图像的紧凑神经网络面向低成本资源受限平台。在高保真物理仿真中,采用交叉熵方法训练的控制器探索覆盖率比协方差矩阵自适应进化策略高 36.20%。最佳视觉策略探索性能与依赖距离传感器的传统方法统计相当,平均能耗降低 31.40%。
研究提出用 Quality-Diversity(QD)算法解决开放环境中的机器人抓取操作任务,高效发现多种稳健抓取构型,作为在铰接物体上生成多样化操作轨迹的可靠起点。操作行为的多样性提升泛化与适应能力,支持在持续演化的开放世界场景中有效部署。该工作为 3 页短文,已被 IMOL 2025 接收。
DexForge 提出一种可微物理框架,将人类视频演示转换为高保真机器人轨迹,通过球形高斯物体建模与高斯碰撞检测构建可微仿真器,并结合接触感知的运动学重定向与力感知的动力学重定向。
阿利坎特大学团队提出双卷积变分自编码器(共享解码器)框架,结合域随机化与特征级域适应,用 45225 张仿真图像加 4556 张真实样本对齐两域潜空间,真实室内导航图像分类平均成功率接近 91%,显著优于仅仿真或仅真实数据训练。
作者提出 Inspect Robots,一个用于开发和运行具身智能体评测的模块化开源框架,提供可定制、可复用的物理评测抽象与结果分析能力,并自动化评测的搭建、执行与终止。论文用该框架评测了六个基于前沿语言模型的策略的能力与安全性;该框架发布三个月以来已获得近 100,000 次下载。论文已提交至 CoRL 2026 的 SPAIS Workshop。
GAMBIT 是一种多机器人连续轨迹规划框架,先通过模仿学习选择协调的运动基元,再用强化学习微调策略,并引入带备份轨迹的安全回滚机制保证全程无碰撞。实验中 GAMBIT 显著优于集中式运动规划器和分布式反应式规划器等基线,在连续域内可协调一千多台机器人,规划时延低于几百毫秒。
FAVOR 是面向世界动作模型(WAM)的轻量级验证与恢复框架,将 WAM 行动前预测的未来帧保留为锚点,由 Anchor Verifier 比对观测与锚点及已执行动作以标记破坏任务的偏差,再由 Anchor-Guided Recovery 借助视觉语言模型生成简短纠正指令,让 WAM 在强化指令引导下回到预期未来并继续任务。
VLA-ZO 提出一种快速零阶(ZO)适配框架,通过冻结视觉-语言前缀并复用其条件状态,将适配限制在动作侧,配合调度感知预取隐藏状态传输开销。在 LIBERO 相机视角偏移上,VLA-ZO 在 q=16 和 q=64 时端到端适配时间分别较基线 ZO 缩短 25.59× 和 32.54×,平均任务成功率从不适配的 48.27% 提升至 58.17% 和 63.58%。
该研究通过保持场景不变的指令干预实验发现,当指令要求抓取另一个可见物体时,被评估的 VLA 策略与世界动作模型(WAMs)大多仍抓取场景偏好的原目标。线性探针能准确恢复被修改的指令目标,说明语言已被编码但很少决定目标选择;注意力分析显示指令 token 对动作生成贡献偏弱,目标 token 注意力仍停留在原物体上。
推荐理由:论文用保持场景不变的指令干预,区分任务成功与真正遵循指令,给出一套可复用的诊断方法。
AUTOPILOT 项目将 YOLO 目标检测与 MiDaS 深度感知结合,用于自动驾驶车辆的障碍物感知与定位,并通过透视变换与决策实现路径规划。仿真与实验评估显示,YOLO 与 MiDaS 的组合构成一套稳健的目标检测与深度感知系统。该研究发表于 IEEE ICACTA 2023。
研究者将微型 UAV 的定位栈整体卸载到带 7 自由度机械臂的四足机器人上,由臂端相机检测机载 AprilTag 标记并融合四足自身定位,为裸机 27 g、带标记 42 g 的无人机提供完整 6-DOF 位姿。实验室飞行中外部位姿精度达 12-16 mm,自主飞行与动捕控制相差 2-5 cm。四足主动跟随使跟踪误差从 11.0 cm 降至 6.9 cm。
STC-MPM(Soft Tissue Cutting with the Material Point Method)提出一种软组织切割仿真框架,耦合有限应变变形、历史驱动连续损伤与可配置失效后处理,无需预先插入切口界面即可联合分析切口形成与组织响应。
研究者提出 ACG-Bench 基准,用于评测双臂视觉-语言-动作模型的臂级组合泛化能力,包含 8 个任务族下的 23 个任务-条件对,覆盖 6 个域内条件与 17 个未见组合。
Siyuan Liu 等提出 ControlPed 框架,将轨迹级冲突合成与 3D Gaussian Splatting 结合,生成照片级、运动可控的车-人危险交互场景。
TRABot 是一个基于多智能体的框架,通过运动原子构建、对话生成、运动规划与面部动画四类专用智能体,将语音、面部动画与身体手势整合为连贯响应。系统在物理 G1 人形机器人上部署流式人脸-语音-身体集成系统,结合流式对话音频、音频驱动面部动画与语义规划的身体运动,实现统一实时交互闭环。定量与定性实验显示 TRABot 在自然度、表现力与多模态一致性上取得最佳整体性能。
Ching-Lam Cheng 等提出一种把人类操作视频转成机器人可用数据的方法,通过交互感知接触重建模块结合手物分割与网格级接触预测恢复稠密 3D 接触,并转换为平行夹爪的时序稳定抓取,再用深度感知合成模块保证机器人与物体遮挡的物理一致性。
研究提出 I-BFM,据作者称是首个面向人形物体交互的行为基础模型,用前向后向表征与无监督强化学习学习人形、物体及接触的耦合动力学共享表征,同一策略可按下游任务奖励以潜变量指令执行闭环交互。
Radar2Plan 提出首个面向自动驾驶规划、基于真实世界 4D 雷达数据的开环自车轨迹规划基准,通过统一接口连接传感器编码器、场景表示与规划头。基于 DSERT-RoLL 与 MAN TruckScenes,基准在 12 种天气与光照条件下评测了相机、4D 雷达与 LiDAR 的 7 种组合、4 种规划基线。实验显示 4D 雷达单独即可支撑有竞争力的轨迹规划,并在恶劣条件下保持稳健表现。
提出 Conditional Trajectory Peaks(CTP)单次前向策略框架,联合预测动作块候选、概率质量与轨迹尺度,配合 DAPS 峰值特化与 ETBT 证据门控轨迹信念传递,兼顾多模态行为与跨块一致性。
研究提出用 Clark 成对递归闭式计算接触最大值的矩,替代一阶传播与 Monte Carlo 采样,用于不确定高程图上的风险感知路径规划。在 317 段留出的 rover 路径上,修正后的 Clark fold 将均值中位误差从线性化的 2.3% 降至 0.19%,并在 90% CVaR 上取得所有方法中最低误差,GPU 上单次基准规划仅 5.5 微秒。
提出 Execution-Aligned Progressive Noise(EAPN),在动作块间传播共享噪声轨迹并与实际执行位移对齐、块内建模时间相关性,使生成式机器人策略在异步重规划中从执行一致的生成状态续接而非独立噪声重启。