RefAtomNet++:用多轨迹语义检索推进指代式原子视频动作识别
RefAtomNet++ 通过整体句子、部分关键词和场景属性三级语义建模,用细粒度语义线索跨时间检索对齐视觉 token 构建轨迹,经 Mamba 状态空间建模聚合与多层级语义对齐跨注意力融合,实现人物定位与多标签原子动作识别。
RefAtomNet++ 通过整体句子、部分关键词和场景属性三级语义建模,用细粒度语义线索跨时间检索对齐视觉 token 构建轨迹,经 Mamba 状态空间建模聚合与多层级语义对齐跨注意力融合,实现人物定位与多标签原子动作识别。
一篇 arXiv 论文提出基于图的盲楼层分离框架,仅用 Wi-Fi 指纹轨迹实现多楼层垂直定位,无需先验建筑信息或楼层数。
一项研究系统评估了 Vanilla BC、LSTM-GMM、IBC、Diffusion Policy 与 VQ-BET 等模仿学习算法在白盒、灰盒和黑盒对抗扰动下的脆弱性。
推荐理由:论文给出白盒与黑盒迁移攻击下的成功率下降幅度,可作为评估模仿学习策略鲁棒性的对照基准。
提出开放世界全景分割方法 Con2MAV,可在测试时发现新语义类别与新物体实例,并保持增量发现类别间的一致性,在道路到水下多类数据集上展现开放世界分割能力与已知类别竞争力。同时发布自动驾驶异常分割基准 PANIC,含 800 张图像、50 多个未知类别、4,000 多个物体实例及像素级语义与实例标注,并提供隐藏测试集竞赛。实现将在录用后开源,论文已被 IJRR 接收。
预测性肌骨仿真显示,50 Nm 峰值力矩下髋-膝-踝(H+K+A)联合助力使六名受试者的运输成本(COT)平均降低 48.50 +/- 4.55%,个体降幅 42.22% 至 54.65%。
Zhuo Lin 等人提出 InterEvolve,在不重新训练的前提下让控制器通过测试时进化完成未训练过的人形 loco-manipulation 任务。方法包含 object-aware forward-backward 行为基础模型,以及由 LLM 智能体结合执行反馈与技能库修订结构、数值优化器调节常数的奖励程序。
UniWAM 提出一种统一架构,将物理推理器、世界生成器与动作预测器结合,共同学习物理世界的语义理解、视觉生成和动作预测。论文针对人类第一视角数据与机器人数据建立了数据清洗与标注流程,用自然语言表示低层动作,并在后训练中引入未来视觉噪声增强与基于历史条件的 flow matching,以减少去噪步数并保持性能。
FlashDexRetarget 提出一种基于强化学习的多参考灵巧重定向框架,用单一策略联合学习多条演示,将重定向优化成本分摊到各参考上。
推荐理由:论文给出与 CHORD 的对比数据,可帮助评估多参考重定向在数据生成成本上的实际收益。
论文提出 Embodied Agent Arena,用 1,000 个案例评测七个 VLM 智能体在几何、空间推理、可供性、任务规划和操作五类能力上的表现,案例取自 32 个已有来源并新增几何估计基准 GeoProbe,覆盖 Blender 渲染图与真实场景图像。
Samuel Liu 等人构建 real2sim2real 流水线,将世界对齐与行为对齐作为两个独立变量,研究二者对协同训练策略性能的影响。在动态灵巧抓取分拣任务上,完全对齐的协同训练把成功率从 52% 提升到 86%;跨配置平均,世界对齐提升 18 个百分点,行为对齐提升 10 个百分点。
推荐理由:论文把世界对齐与行为对齐拆成两个独立变量,给出各自对成功率的贡献幅度,做仿真协同训练的人可据此分配数据投入。
DITTO-X 是一种与手型无关的灵巧遥操作接口,利用机器人手自带的传感渲染关节力与指尖接触事件,并可直接驱动 Sharpa、Wuji、Inspire 三款商用灵巧手而无需逐手重新设计。
研究者构建同一双臂机器人单元的两套仿真版本,对比自建重建(度量尺度物体几何、人工编写物理参数、自建场景 splat)与开源默认重建(生成式单图 mesh、引擎默认物理、Gaussian-splat 场景)对 sim-to-real 评分一致性的影响。
Token-World 是一种动作条件世界模型,将 VLM 特征压缩为紧凑 token 状态,在降维空间学习未来动态并映射回策略表示,用于机器人操作。在闭环评估中,其模拟策略性能与参考策略的相关性高于 Ctrl-World(r=0.794 vs. 0.583),且仿真时延更低。消融实验显示紧凑表示的设计与维度显著影响未来状态预测,代码将开源。
Magic-W0 提出结构化世界-动作基础模型,将交互建模为由 Current State、Transition、Future State 组成的 Structured World Transition,并以层对齐架构耦合世界转移预测与动作生成。
论文针对 VLA 模型低速率推理与机器人高速率执行之间的时间差,测量了模型推理与机器人执行链的端到端时延,并提出两阶段非均匀去噪,将去噪步数从 10 步减到 2 步、模型推理时间从 61.557 ms 降到 21.956 ms。
推荐理由:论文给出两步去噪把推理时间从 61.557 ms 降到 21.956 ms 的实测数据,可为 VLA 实时化优化提供参考。
EmbodiRSI 是一个面向 real-to-sim-to-real 的递归自我改进(RSI)agentic 系统,从目标部署场景构建任务专属仿真,用策略执行反馈引导经验采集与策略更新,包含 Collaborative Error Correction 与 Adaptive Data Collection 两个互补机制。
DODGER 是一个安全引导强化学习框架,直接执行策略生成的动作驱动训练 rollout,同时用 CBF 过滤参考与约束违例塑造避碰行为,避免仅执行安全过滤动作限制策略探索。该方法经 Dubins-car 安全分析验证,并在全尺寸人形仿真与真实人形机器人实验中基于 LiDAR 感知完成多动态障碍物目标导航,运行时无需安全过滤器。
论文提出 actualization 任务,在冻结的视频世界模型之上用轻量模型选择并实现任务对应的未来状态,据此输出机器人动作。作者实现的 RoboActualizer 仅 60M 参数,由两个 DiT 专家通过 flow matching 联合预测未来 latents 与动作,可在单张 32 GB 显存 GPU 上训练完成。
提出 LQR-ArUco 融合的分层控制框架,解决两轮倒立摆(TWIP)机器人在非对称物体操作中的动态失稳与导航漂移。机外视觉系统跟踪 ArUco 标记提供高时延全局航点导航以绕开里程计漂移,机载低时延控制环用惯性与编码器数据抑制扰动。实测中该双环方案让自制机器人准确导航、抵御减速带冲击、适应动态跷跷板坡道并稳定搬运负载。
CoBrush 提出一种分层规划框架,把多轮人机协同绘画拆解为语义、空间与执行三层协调过程,将高层意图推断与空间定位、笔触级控制分离,支持在真实丙烯画布上渐进式构建复杂场景。真实人机绘画会话、压力测试与用户研究表明,相比单轮基线,CoBrush 在语义对齐、空间推进稳定性与机器人动作合理性上更优。该工作已被 IROS 2026 接收。
斯坦福等机构研究者提出 DexAgent,一个 agentic Human2Sim2Robot 框架,把单段第一视角人类视频和任务提示转成可用于策略训练的物理可落地机器人轨迹。
论文提出 Universal Manipulation Representation(UMR),把操作分解为与本体无关的 World Flow 和相对当前位姿的 Ego Trajectory 两部分,实现人类演示到异构机器人的零样本技能迁移。
推荐理由:论文给出统一动作表示的几何分解思路,跨本体迁移的方法设计对做 VLA 策略的研究者有参考价值。
研究提出用大语言模型构建显式工程模型的机器人设计框架,将物理关系、兼容性约束与目标显式化后再做多目标优化,以获得可行性与 Pareto 最优保证。在四旋翼与循迹小车选型问题上,30 次直接由 LLM 生成的设计试验无一能通过最终模型的可行性验证。与独立专家模型及多轮模型细化的对比显示,建模假设变化会显著改变预测的可行与 Pareto 最优设计集合。
FAVOR(Free-floating Arm Velocity Optimization with Recursive Sensitivities)提出一种面向无驱动航天器的规划器,通过优化 Bezier 关节速度曲线实现避障到达、跟踪与规定时间预抓取拦截,决策维度与 rollout 分辨率无关。
Rolling-WAM 将世界动作模型(WAM)的联合去噪分摊到连续重规划周期,在滑动窗口内以交错噪声等级维护视频-动作块,滚动噪声调度完全去噪即将执行的动作块并部分细化远期块。相比标准联合 WAM,其稳态重规划速度提升 4.5x。在 LIBERO、RoboTwin 和真实 Unitree G1 人形机器人上的评测显示其操作性能具有竞争力。
NavProbe 提出一种分层零样本导航智能体,用动态子目标议程配合主动证据检索,在上下文不足时按需调取视觉与几何记录以生成、修订或解决子目标。在 R2R-CE 上取得 71.7% SR 与 55.8% SPL,RxR-CE 上 55.3% SR 与 38.6% SPL,超过强零样本基线;HM3D-v2 ObjectNav 上 SR 达 79.3%。代码已开源,并有真实机器人定性演示。
研究在 FANUC 与 xArm 两台真实商用工业机械臂上实证评估了基于学习的机械臂操作后门攻击与防御,验证后门可在常规任务执行中保持隐蔽、仅在特定触发器出现时诱导语义错误的抓取行为。作者提出一种在线防御流程,在运行时检测并中和触发器,并与离线微调防御对比效果。评估还测量了防御流程引入的计算时延与执行开销,以判断其是否适用于高吞吐工业场景。
NavSafe-∞ 提出一个照片级真实的闭环驾驶安全基准,包含 280 个场景、28 类事件,并按交通事故、弱势道路使用者碰撞、交通违规、交通事件四类给出能力评分。在评测 20 个端到端驾驶策略后发现,开环指标提升并不能可靠转化为闭环安全表现。基准与可扩展的事件编排、策略诊断工具箱将开源。
Dr-LiSA 提出首个将 2D 旋转雷达强度测量在 SE(3) 中与 3D 激光雷达地图配准的直接方法,通过学习式前向模型从候选位姿的激光雷达子图预测雷达测量,实现预测与观测雷达扫描的直接光度对齐。在超过 90 km 道路数据上,其 SE(2) 精度超越既有雷达-激光雷达方法,并与最先进雷达-雷达定位的平面精度相当。
PredActor 是一种预测式动作扩散策略,仅依赖本体感知历史即可联合预测动作与内部未来状态轨迹,通过 classifier-free guidance 强化文本条件动作、classifier guidance 将未来状态引向测试时目标,无需动作参考跟踪器或特权全身状态。
提出一种基于切换的自适应控制框架,用于空中机械臂在任务执行中应对动态切换工况,无需预先获知飞行器与机械臂耦合及状态相关不确定性。框架给出一类切换信号,刻画可保证系统稳定的过渡阶段。对比实验验证了该框架相对现有方法的有效性。
提出 FOM-SAM3 框架,从少量多视角配准图像学习可复用的细粒度物体记忆 token,同时保持 SAM3 完全冻结,通过一对多学习定位目标物体并排除相似干扰项。
DEXTERA 提出一套自动化的 real-to-sim-to-real 框架,可将单张 RGB 图像转化为可部署的灵巧操作策略,覆盖场景分解、度量对齐、任务原语构建与多模态策略接口四个阶段。
推荐理由:论文给出从单张 RGB 图像自动生成可部署灵巧操作策略的完整流程,并报告仿真与真实协同训练带来的成功率变化。
GroundingVLN 以视觉 grounding 作为推理与动作的共享接口,在结构化推理中锚定任务相关视觉证据,并预测与进度对齐的像素目标交由几何规划器转为基本动作。
研究者将行为学习与时序组合分离,从同一离线演示训练无条件多模态扩散策略与语义预测器,由 LTL 自动机在部署时跟踪指令进度并按预测语义结果为策略动作打分,两个学习组件训练时均不接收规范,无需重训即可复用演示行为执行未见过的时序组合。导航环境、CALVIN 操作与真机实验显示,复杂时序指令与安全约束执行可靠,较时序逻辑基线显著提升。
GraRe 通过学习式重排序改进冻结 6-DoF 抓取检测器的候选排序,从候选属性、分层局部几何与物体上下文三类特征估计抓取质量,经 Transformer 融合后与检测器置信度合成最终排序。在 GraspNet-1Billion 上对 5 个冻结检测器实验,Average AP 最高提升 13.56 分,真实机器人实验验证了杂乱场景下的鲁棒抓取。项目代码已开源。
Arm2Air 将预训练 Neural MP 模型生成的机械臂避障骨架迁移至 UAV 中继部署,用少量目标域数据配合 Low-Rank Adaptation 微调 transformer 迁移平台。
BC-NMPC 将电池与推进系统模型集成进 NMPC 框架,实时预测 UAV 的电压、电流、功率与最大可用推力,以应对高速敏捷飞行中电池耗尽导致的推力损失。实飞验证了模型精度,仿真评估了重规划算法;电池容量耗尽时,相比无感知控制器,不重规划平均位置误差降低 25%,重规划降低 88%。该方法使 UAV 在任务全程保持时间最优飞行。
PACE 提出交互式人格引导流水线,让 Ameca 人形机器人通过用户问答动态合成定制化、有心理学依据的人格,并编译为多视角维度的结构化人格提示,驱动多模态表达行为。实证 HRI 评估对比通用基线,考察动态生成人格对用户信任、拟人化感知、人格一致性、个人相关性与交互质量的影响。
CERPE 是一个系统级框架,通过协调视觉基础模型联合估计自运动与机器人间相对位姿,用于短暂协作感知场景。该框架以持续共享的固定大小描述子触发事件驱动的原始图像请求,并通过度量尺度化的自运动传播相对位姿,即使无视觉重叠也能维持估计。仿真与真实机器人实验显示,CERPE 在 6-DoF 相对位姿估计上优于所选基线方法。