LeCuration:用小型世界模型做数据筛选的多面工具
LeCuration 是一个以 LeWorldModel(LeWM)为潜在编码器与预测器、并加入 diffusion transformer(DiT)解码器的小型世界模型,用作面向更大下游模型的数据筛选工具。其嵌入可作为异常检测信号和基于内容的聚类启发式,自回归预测游戏状态可定性检查动作-状态一致性。论文给出 CS:GO 游戏数据的概念验证案例,尚未报告定量筛选指标与下游训练结果。
LeCuration 是一个以 LeWorldModel(LeWM)为潜在编码器与预测器、并加入 diffusion transformer(DiT)解码器的小型世界模型,用作面向更大下游模型的数据筛选工具。其嵌入可作为异常检测信号和基于内容的聚类启发式,自回归预测游戏状态可定性检查动作-状态一致性。论文给出 CS:GO 游戏数据的概念验证案例,尚未报告定量筛选指标与下游训练结果。
研究在目标条件策略学习中识别出一种"视界信息诅咒":增大目标重标注视界会显著削弱策略泛化与性能,即便测试时只评估邻近子目标序列,行为克隆(BC)策略仍出现严重的、依赖训练视界的性能退化,而强化学习(RL)目标可缓解该现象。作者将其解释为动作与事后重标注目标之间条件互信息随视界下降,并发现将短视界策略的输入 Jacobian 蒸馏到长视界策略可在组合操作任务上带来显著性能提升。
StableGrasp 提出一个基于可微仿真的优化框架,从单张 RGB 图像重建物理稳定的仿人手抓取,将视觉手部姿态与决定抓取力的控制目标显式分离。该方法在可微仿真器中通过最小化抓取动能联合优化手部几何与控制,并对手部几何施加正则以保持视觉一致性与几何合理性。实验显示其重建的抓取在严格物理仿真下比其他手-控制策略稳定得多。
论文研究了受中性原子量子计算机原子搬运启发的单步带标签令牌路由问题的计算复杂性。研究证明该问题在最大度为四的平面网格图上即使存在边不相交路径的解仍为 NP-complete,在最大度为三的树上按解边重数参数化为 W[1]-hard,且在候选边重数不超过八的树上仍为 NP-complete。同时证明该问题在树上按最大度与候选边重数(或候选顶点重数)联合参数化时是固定参数可解的。
GUARD 提出一种几何不确定性感知框架,在单次前向传播中同时完成点云滤波与分割,用于机器人硬盘拆解中的部件识别。该框架结合多尺度几何 Transformer 与多带宽随机傅里叶特征高斯过程估计逐点几何不确定性,并辅以预测熵抑制不可靠测量。
论文提出一种可扩展的异构图神经网络(GNN)框架,用于自动生成和评估多智能体共享路图,将路径点、智能体位置和任务位置表示为异构图中的不同节点。模型在专家求解器轨迹聚合的占据密度图上训练,学习识别关键兴趣点并剪除冗余节点与边,生成紧凑、协调感知且对任务排列不变的路图。实验显示该框架在稠密路图上可将运行时间和图规模至少降低 40%。
LASER 提出一种离线强化学习算法,通过隐空间伴随匹配实现熵正则化的隐空间强化学习,在保持表达性流策略的同时避免通过时间反向传播。在 40 项不同数据集质量的 OGBench 任务上,LASER 取得 state-of-the-art 性能,且在所有任务上使用固定的、与任务无关的超参数,优于包括按任务和数据集专门调参的基线方法。该论文已被 NeurIPS 2026 接收。
论文提出 FlightMagNav,一个面向近地飞行平台磁场定位研究的开放数据集,数据由搭载两台光泵磁力计(量子磁力计)和 GNSS 辅助惯性导航系统的无人机采集,包含磁场地图学习与验证两部分测量。随数据集一并发布了概率式磁场地图学习与验证框架,并用其演示数据集的用法,最后展望了可基于该数据集展开的研究方向。
RoboPrompt 是一个轻量级机器人策略引导系统,用户通过绘制轨迹、目标点和粗略方向指令等稀疏输入引导策略行为,将人类意图翻译与基座策略解耦,在噪声空间控制动作生成,无需修改基座策略架构或为其微调。
Long-WAM 提出在实时控制约束下扩展因果世界动作模型上下文的模型系统框架,核心发现是访问历史不等于利用历史,更长历史只有在视频基础模型采用自回归预训练时才显著见效。
同一新闻,精选展示《Long-WAM:扩展世界-动作模型上下文的模型系统框架》
论文发现 VLA 模型对指令措辞高度敏感,$π_{0.5}$ 在 LIBERO 上对 switch on the stove 成功率 100%,对 switch on the hot plate 仅 2%,改写增强微调后的 $π_0$ 仍波动达 61 个百分点。
论文提出一种分解式触觉表示与控制框架,将法向力与接触斑映射为可从传感器读数恢复的有效接触响应,并把响应分解为接触几何、力分布和时变接触三部分分别编码与随机化,Tactile Gated Policy 在控制中保留这些表示且无需重训练即可覆盖所有掩码配置。
HuMBLE 提出一种学习框架,从人体运动数据合成可实时操控、鲁棒且拟人的人形机器人步态策略。方法先用强化学习训练全身参考条件策略,再经师生蒸馏得到仅依赖本体感知和平面躯干速度指令的轻量先验策略,随后用多任务强化学习微调,以目标条件任务扩展指令覆盖并用参考引导任务作为风格正则。
论文提出 Agentic Real-to-Sim-to-Real(Agentic RSR)框架,把场景重建、策略开发与真机执行通过同一操作任务串联起来:给定工作空间视频、任务描述和已知机器人模型,智能体恢复度量尺度、用视觉反馈迭代细化场景并在 MuJoCo 中检查任务相关交互,再由编码智能体从特权物体位姿逐步过渡到视觉观测和随机化仿真,生成可执行策略。
一项研究提出基于释放状态的模型化框架,让 6-DoF 机械臂投出能飞回的回旋镖,据称是首个实现回旋镖返回飞行的机器人机械臂。演示中回旋镖以 51 rad/s(8.1 rev/s)释放,飞至距基座 2.03 m 处并落回 0.31 m 内。成功释放与实测人类投掷差异显著,表明机器人无需模仿人类动作即可实现返回飞行。
论文提出感知辅助的高度自适应规划框架CMP-IRRT*,即Channel Mamba PointNet引导的Informed RRT*规划器,用于四足机器人穿越低矮障碍。
论文提出 LLA-MPPI(Look-back and Look-ahead Adaptive Model Predictive Path Integral control),把全身自适应转化为在一组 GPU 批量接触仿真器(物理或结构参数不同)上的选择,用窗口化预测误差选出最能解释近期运动的模型,再由全身 MPPI 规划器在该模型上优化控制,无需离线训练且所选假设物理可解释。
FoldBack 是一种面向长程衣物折叠的自纠错掩码生成策略,围绕三个推理时决策构建恢复机制:何时精修与验证、如何回滚、以及在何处及如何重试。它将精修与抓取校验对齐到 pick-and-place 事件,把机器人退回可重试的预抓取构型并保留成功抓取,选择性重新生成失败片段及部分后续动作,同时避开此前失败的抓取位置,无需恢复演示或基策略重训。
RFPO 是一个面向连续机器人控制的流策略优化框架,用 Reward-aware 在线 Reflow 修正学生策略的传输路径,并以冻结的 Gaussian PPO 控制器在完整与中间积分预算下提供动作空间监督,使部署策略只需单步 Euler 积分即可执行。
AirGroundVLN 提出面向目标导向空地协同视觉语言导航(VLN)的大规模基准,包含 19 个 Unreal Engine 环境中的 10,281 个导航片段与 955 个目标实例,设有 seen/unseen 划分与 aerial-visibility 协议。
研究团队推出 RobotWorld,一个面向机器人任务的仿真测试基准,将指令与观测转化为物理任务执行。其 84 项任务覆盖操作、移动操作、运动、驾驶与空中控制,设有显式交互预算与可执行成功判定。
论文提出 RoboQuest 基准,用于评估智能体通过物理交互主动获取任务相关信息、据此调整后续动作并自主判断何时完成任务的能力。该基准包含十项移动操作任务,围绕搜索、基于操作的检查和交互式测试三类不确定性构建;作者通过统一视觉运动接口评测五个前沿多模态智能体,并测试了在完整轨迹演示上微调的 π0.5 策略。
NeRFifyMesh 提出一条将现有带纹理 Mesh 模型转换为 NeRF 表示的新流水线,通过采样 Mesh 几何与纹理人工生成基于点的真值辐射场,无需基于相机的采样或多视图图像渲染即可训练 NeRF。基准测试显示其渲染质量与基线方法相当,并演示了构建统一 NeRF 场景与基于提取几何的碰撞仿真,论文已被 IROS2026 接收。
论文提出OpenViTac,一个跨仿真与真实世界的视触觉机器人操作基准,将接触密集型操作归纳为四个触觉相关能力维度,并提供配对的仿真-真机设置,用于一致评测VLA、WAM和VTLA策略。
一项研究在 CogniPlan 数据集中插入门诱导的歧义,对比纯几何模型与增加门语义通道的模型,发现门区域 L1 误差从 0.004342 降至 0.000025,F1 与 IoU 从 0.031311 和 0.015905 提升至 1.000000。全图性能两者相近,表明语义线索可改善几何观测歧义区域的预测占据补全。该成果已被 IEEE TENCON 2026 接收。
MultiFly 提供 17,272 个同步样本,覆盖 RGB、热成像、LiDAR 和 radar 四种模态,来自 4 个郊区场景,含 15 个语义类的逐帧标注以及标定和 GNSS-RTK/IMU 数据。
研究团队提出一种基于霍尔效应的紧凑型力传感器,含3个毫米级感应单元(taxel),可贴装于机器人手术工具抓取面,用于补偿微创手术中的触觉反馈缺失。传感器将霍尔效应传感器与磁体嵌入可变形弹性体接触层实现小型化,经6自由度(DoF)并联机器人标定,每个taxel检测法向与剪切力的平均RMSE为2.133 kPa。标定后的传感器在仿体与离体猪组织上完成验证,可感知牵拉过程中的触觉与滑动。
论文提出分层强化学习框架,将高频关节级运动执行与低频步态适应分离,后者显式最小化运输成本 CoT,并通过三阶段 Isaac 训练实现零样本 sim-to-real 迁移。
论文系统研究高分辨率动态触觉传感对灵巧机械手抓握稳定性预测的作用,采集了覆盖 200 个物体、共 10,000 次抓握试验的数据集,每只多指手配备四个 Digit 360 触觉传感器,同步记录视觉、本体感觉与触觉流。
一项机器人研究提出控制感知布局修复方法,从结构化任务记录出发,将全程跟踪、间隙与驱动要求编译为可审计的仿射布局约束,仅修复声明的连续坐标,保留事件顺序、时序、拓扑与控制器不变。在三个研究者编写的任务抽象上,两种后端均通过全部三个布局的认证,并完成每个后端 300 次全新配对 rollout。风险目标扫描还暴露出仅靠布局编辑无法满足的固定事件测试。
一篇 arXiv 论文提出一种全驱动 4-DOF 机械手指,采用关节专用的混合远程驱动架构:MCP 关节由两组刚性连杆传动驱动,PIP 与 DIP 关节由闭合环路钢丝传动独立驱动并引入滚动接触关节(RCJ)。实验用 ArUco 标记跟踪测量滚珠丝杠位移,验证了远端传动的机械解耦;孤立驱动 MCP、PIP、DIP 时指尖平均峰值力分别为 21.28 N、9.22 N、5.75 N。
论文对 π0.5 和 GR00T N1.7 两个 VLA 模型的语言接地能力开展机制可解释性研究,对其动作生成模块残差流施加 activation 与 attribution patching,并按同义替换、语义缩放、方向性破坏、随机物体替换、空字符串五种策略系统扰动 LIBERO 基准的任务指令。
论文提出 LiSoNav-COL 任务,要求机器人在空场景记忆起步、持续寻找被移动的小物体,并发布覆盖 28 个室内场景、45 类小物体的基准 LiSoNav-Eval,其导航序列包含未变动与已重定位目标以评测记忆复用与适应能力。同时提出基于多视角观察与视角锚定记忆的导航方法 IVAM-Nav,实验显示其优于代表性方法;基准分析表明物体越小、环境越大、重定位距离越长挑战越大,数据集与代码已公开。
RealtimeWAM 提出一个免训练的通用框架,通过并行执行与自适应计算降低世界动作模型(WAM)的推理延迟,可在 FastWAM 和 OpenWAM 等多种架构上复用。
一篇 arXiv cs.RO 论文提出基于 Model Predictive Control (MPC) 的分布式控制器,用于高效执行基于 braid 的拓扑约束。
Video-to-Model 框架可从输入视频自动建模可变形缝合线的运动:感知模块定位并跟踪缝合线,时空 CNN 网络估计结构化 CBF-CLF-QP 模型的有效参数,再在用户定义的针头速度输入下仿真缝合线。在未见过的缝合线构型与运动上的实验表明,该框架能可靠重建缝合线行为、自动配置模型并以低跟踪误差复现预期运动,减少手动调参需求。
论文提出仅依靠软光学触觉传感在线估计接触力与可能时变任务帧的方法,用于混合力/运动控制,假设局部平面接触且接触力矩可忽略。该方法将弹性体单帧形变图像映射为压入深度、两个相对传感器倾斜角和3D接触力,每个量附带逐样本不确定性估计;映射通过自标注流程学习,由机械臂施加受控接触并用辅助Force/Torque传感器离线提供真值标签。
研究团队构建了配备人工肌肉、多模态传感器和强化学习训练的神经网络控制器的机器人运动系统类比模型,实现了精准运动与损伤鲁棒性,并复现出类似动物的神经群体动力学。研究发现神经旋转会产生垂直于抓取方向的振荡机动以优化轨迹调整,该结论经灵长类神经数据验证,同时揭示了传感器与运动冗余下的反直觉神经能量原则。
论文提出一套视觉系统,由带臂载相机的四足机器人对 nano-UAV 进行定位:四足跟踪无人机,用分割掩码与深度估计其在自身坐标系中的位置,并通过实时无线电链路发送。
论文提出 DRIVE(Diversity-driven RL fIne-tuning for VLA gEneralization),把成功行为的多样性显式纳入 RL 微调目标:在相同任务条件下对 rollouts 分组、做时间对齐的轨迹比较,并从相对行为多样性中导出成功条件下的内在奖励,以扩大可行解空间覆盖而不奖励失败的多样或表面时序差异。