SAM3 引导的视觉运动策略实现细粒度物体操作:持久记忆学习与聚焦视觉条件化
提出 FOM-SAM3 框架,从少量多视角配准图像学习可复用的细粒度物体记忆 token,同时保持 SAM3 完全冻结,通过一对多学习定位目标物体并排除相似干扰项。
提出 FOM-SAM3 框架,从少量多视角配准图像学习可复用的细粒度物体记忆 token,同时保持 SAM3 完全冻结,通过一对多学习定位目标物体并排除相似干扰项。
DEXTERA 提出一套自动化的 real-to-sim-to-real 框架,可将单张 RGB 图像转化为可部署的灵巧操作策略,覆盖场景分解、度量对齐、任务原语构建与多模态策略接口四个阶段。
推荐理由:论文给出从单张 RGB 图像自动生成可部署灵巧操作策略的完整流程,并报告仿真与真实协同训练带来的成功率变化。
GraRe 通过学习式重排序改进冻结 6-DoF 抓取检测器的候选排序,从候选属性、分层局部几何与物体上下文三类特征估计抓取质量,经 Transformer 融合后与检测器置信度合成最终排序。在 GraspNet-1Billion 上对 5 个冻结检测器实验,Average AP 最高提升 13.56 分,真实机器人实验验证了杂乱场景下的鲁棒抓取。项目代码已开源。
研究团队发布开源全栈系统 EgoSteer,用第一人称人类视频扩展灵巧手 VLA 预训练,并以少量真实机器人数据完成后训练。
推荐理由:论文给出从第一人称视频构建 9606 小时预训练数据的完整管线,做灵巧手数据工程的团队可对照其吞吐与精度做法。
Mask2Real-WM 提出两阶段世界模型,将像素预测解耦为动力学模型与渲染模型,以分割掩码作为 Sim-to-Real 桥梁提升灵巧手可控性。动力学模型在覆盖完整手部运动的合成数据上训练,再仅用 2.5 h 真实演示微调并训练渲染模型。在 23-DoF 机器人系统上与四种模型对比,解耦模型经人工盲评可控性最强,且帧更清晰、感知质量相当。
ResCue(Residual Spatial Cueing)把语言推导出的目标信息转成空间条件注入视觉策略:预训练 grounding 生成目标掩码,独立 cue 编码器将特征残差融合到空间 RGB 特征中,保留场景上下文并显式标出目标。
通过方向性任务误差监督与任务误差模型驱动的样本选择,残差学习在 Barrett WAM 机械臂上实现稳定的三球、四球和五球杂耍,系统从第二次尝试即收敛,此后任务误差单调下降且无失败。对比显示,方向性反馈与信息性先验缺一不可,其中固定 Jacobian 的 Newton 更新最快且完全可靠。学习到的残差可容忍先验失配与关节跟踪退化,主要影响收敛速度。
AHEAD(Anticipatory Horizon Extrapolation with Adaptive Dynamics)提出一种 predict-then-act 包装器,用运动感知的潜空间世界模型预测 VLA 特征空间中的未来 patch token,使冻结的 VLA 能应对执行过程中物体移动的场景。
推荐理由:论文给出 AHEAD 在动态抓取任务上相对基线的成功率对比,可为处理运动物体的 VLA 方案提供参考。
Victor Kowalski 等提出 VE2VF,用人在回路的强化学习与师生蒸馏,把依赖视觉的教师策略蒸馏到仅使用 pose、twist 和 wrench 传感的无视觉学生策略,全程在真实世界训练,无需 domain randomization 或数据增强。
该研究提出将深度确定性策略梯度(DDPG)强化学习与有界极值搜索(ES)结合的混合控制器,用于提升机器人推物和抓放任务在分布偏移下的鲁棒性。DDPG 策略在标准条件下训练,部署时叠加有界 ES,以应对时变目标和空间变化摩擦等超出训练分布的工况。研究证明机械臂可在有限时间内收敛到目标物体,随后有界 ES 实现对有界速度移动目标的有限时间收敛,并给出收敛时间解析公式与增益调节方法。
该研究提出一种免导数的 episodic 潜在策略改进方法,通过将初始噪声采样替换为精心选择的常量噪声向量(golden ticket),改进冻结的 diffusion 或 flow matching 策略。
浙江大学团队提出 TDC 方法,将力调节分解为可从仿真迁移的方向分量与可手动调节的幅值分量,仅用仿真数据即可实现自适应柔顺。方向分量由基于预训练 VLA 微调的视觉运动策略预测任务坐标系与控制模式向量,部署时由导纳控制器结合人工指定刚度与目标力旋量实现柔顺控制。该方法已被 CoRL 2026 接收,在微波炉开门、插孔、白板擦拭和开门四个接触密集任务上取得较高成功率并对外部扰动具备鲁棒性。
TRACER 提出纹理鲁棒的可供性思维链框架,将高层语义指令映射为外观鲁棒、物理一致的可变形物体交互区域。框架包含树状可供性思维链 TA-CoT、空间约束边界细化 SCBR 与交互收敛细化流 ICRF,抑制边界溢出并整合分散的可供性响应。在 Fine-AGDDO15 数据集与真实机器人平台上,TRACER 提升多纹理可供性定位精度与长程操作成功率,源码与数据集将公开。
Po-Chen Ko 等人提出 RELIC,一种面向机器人操作的视频重规划框架,通过优化捕捉环境隐藏物理属性的潜变量嵌入,并用基于拒绝的采样过滤与既往失败不一致的假设,从而在测试时失败中适应推门还是拉门、摩擦等只能靠试错揭示的属性。
研究提出用伪触觉作为反馈消除抓取操作任务中的夹爪状态歧义,使模仿学习策略可完全在仿真中训练。该方法受力控夹爪充当触觉传感器的思路启发,为策略提供无噪声的二值夹爪状态观测,无需额外数据采集或硬件改动。三项真实抓取任务实验验证了其必要性、有效性与高效性,成果已被 IROS 2025 接收。
提出一种基于 Dirichlet Process Mixture 的贝叶斯非参数技能先验,在结构化隐空间中建模时序扩展技能,无需预设成分数即可自适应发现技能,并嵌入分层强化学习框架指导高层技能选择。
DAHLIA 提出一种数据无关的代码生成框架,将长程操作任务建模为回合式任务规划与评估,用渐进组织的上下文示例和 chain-of-thought 推理引导 LLM 合成可执行代码计划。
研究提出让机器人逐条主动索取运动学示教的方法,用螺旋几何表示从示教生成操作规划并使示教充分性可度量,结合基于 PAC-learning 的多臂老虎机采样策略评估任务空间子区域的规划能力,并用启发式从薄弱区域追加示教。22 名无机器人背景参与者在倒水和舀取两项任务上的用户研究表明,少于 10 条示教即可教会机器人规划任务。成果发表于 2026 IEEE ICRA。
GeoBridge-VLA 提出一种两阶段方法,从预训练 VLA 的冻结视觉编码器中学习几何特征用于动作预测,Stage I 训练 feature bridge 与 geometry decoder 并用深度监督,Stage II 冻结这些模块后训练门控残差接口与动作侧投影及 action expert。
RAGrasp 提出一种检索增强的平面平行夹爪抓取流水线,仅用本地采集的少量带抓取标注 RGB-D 模板即可适配新物体,无需端到端重训练。系统用 DINOv2 视觉特征与外观、深度线索驱动 SAM2 分割查询物体,经两阶段几何-语义检索级联选模板,再由置信度门控选择抓取迁移估计器并做约束细化。真实试验中对已见物体 20/20、未见物体 19/20 抓取成功。
研究提出 InterMimicGen,一个自进化动作模仿框架,让人形机器人运动数据与跟踪策略互相增强,用于扩展 loco-manipulation 能力。该框架先整合动捕的人-物交互数据集并重定向为人形机器人参考动作,保留全身协调与灵巧手-物关系,再训练一个基于物理的通用跟踪器在仿真中执行这些参考动作,并通过数据飞轮不断生成并筛选可执行的动作变体。
研究提出用 Quality-Diversity(QD)算法解决开放环境中的机器人抓取操作任务,高效发现多种稳健抓取构型,作为在铰接物体上生成多样化操作轨迹的可靠起点。操作行为的多样性提升泛化与适应能力,支持在持续演化的开放世界场景中有效部署。该工作为 3 页短文,已被 IMOL 2025 接收。
DexForge 提出一种可微物理框架,将人类视频演示转换为高保真机器人轨迹,通过球形高斯物体建模与高斯碰撞检测构建可微仿真器,并结合接触感知的运动学重定向与力感知的动力学重定向。
STC-MPM(Soft Tissue Cutting with the Material Point Method)提出一种软组织切割仿真框架,耦合有限应变变形、历史驱动连续损伤与可配置失效后处理,无需预先插入切口界面即可联合分析切口形成与组织响应。
研究者提出 ACG-Bench 基准,用于评测双臂视觉-语言-动作模型的臂级组合泛化能力,包含 8 个任务族下的 23 个任务-条件对,覆盖 6 个域内条件与 17 个未见组合。
提出 Conditional Trajectory Peaks(CTP)单次前向策略框架,联合预测动作块候选、概率质量与轨迹尺度,配合 DAPS 峰值特化与 ETBT 证据门控轨迹信念传递,兼顾多模态行为与跨块一致性。
Mulligan 将初始状态分布作为决策变量,每轮从已观察到的失败状态和未尝试状态开始采集,以提升固定监督采集预算下的数据效率。论文在 2,550 个盲测留出回合的三个真实任务和两个仿真任务上评估,相比均匀初始状态采样表现更好;结合基于价值函数的动作选择后,HiL-IDQL+Mulligan 在真实任务上最终成功率提升 10-34 个百分点。在操作员介入下,人机协作完成 98% 的采集回合。
推荐理由:论文给出在固定采集预算下按失败状态分配初始状态分布的做法,做数据采集策略的团队可参考其对比设计。
论文提出 Bilinear Flow Policy(BFP),一种面向目标条件模仿学习的生成式视觉运动策略,通过检索锚点训练样本并把未见观测-目标对分解为锚点加残差,再用双线性条件流建模多模态动作分布,以解决目标超出演示分布时的分布外推问题。
Seonghoon Yu 等人提出 RACE(Reliable Action-Chunk Extension)框架,通过辅助的一步去噪预测子技能切换时机,并以此条件化动作生成,降低长动作块在子技能过渡处的误差。
研究提出六种虚拟模型设计方法,用于力控机械臂在含障碍与不确定性的环境中完成抓取任务。在一台力控 8 自由度人形机器人上开展三项实验,测试可预测性、对外力的敏感度以及对已知和未知障碍的适应性。结果显示该方法虽牺牲精度与轨迹最优性,但能以直观、可扩展的方式设计复杂抓取动作。
研究提出 OCLO,一种不依赖人体运动数据、仅由两个末端执行器目标指令驱动的人形 loco-manipulation 系统,通过解析可达性先验在线生成骨盆高度与躯干姿态,并用 policy-in-the-loop 采样精修。
TacGELLO 利用 3D 打印主手已有的舵机,在夹爪扳机处提供触觉接触反馈,并在臂关节处提供基于电流的负载提示。AnySkin 接触检测触发扳机位置保持,跟随臂关节电流变化调整主手舵机输出限值以在抬升时产生阻力。在一名操作者完成的 6 次 UR3 会话中,发送指令跟踪误差为 0.15–0.36° RMSE,轨迹滞后 82–98 ms,62 个抓取区间中有 60 个记录到触觉触发。
EvoMem-VLA 通过显式编码并保留历史状态间的变化来构建状态演化记忆,使策略能跟踪超出孤立快照的任务进展。
VICON 提出视觉-惯性-接触手物跟踪框架,通过改造视觉惯性手套并按人类抓握频率布置 FSR 力敏电阻,同步记录接触状态与标定法向力,配合 RGB-D 相机与单目视频重建网格、基于因子图的物体轨迹估计,在严重遮挡下联合捕捉手物运动与接触信息。
该框架通过局部恢复监督实现视觉运动策略的递归自改进:离线审计器定位未解决失败并给出修复目标,固定多模体智能体作为工具型教师生成恢复动作,冻结的学生策略验证续接可行性,仅部署学生。
提出一种基于数字孪生的 AR 遥操作接口,融合裸手追踪、双手机器手与机器人/任务物体的虚拟表示,用于灵巧操作演示采集。接口将触觉测量渲染到机器人手网格上形成视-力反馈,并提供用户可控虚拟视角面板或遮挡感知透明渲染以缓解遮挡。通过 Task 1 与 Task 2 用户研究评估力可视化与视觉辅助在精细力控和遮挡操作任务中的作用。
TANav 用一次短暂轻推测量推压阻力,由 TacPhys 读取力序列(可选 RGB-D 与运动学)估计质量以决定是否授权推压。仿真中将漏推率从 28.7% 降至 5.5%,重复巡逻下恢复 oracle 90% 的路径节省、边界违规从 4.3% 降至 2.9%。
研究提出 ExStereo 立体模块,用立体图像对重建场景几何并渲染多视图作为显式立体表示,通过 action-stereo cross-attention 让动作 token 选择性关注立体 token,使策略基于 3D 场景信息生成机器人动作。
PatternDex 提出从人类-物体演示中学习手与物体运动的相关性并表示为 token 序列(交互模式),据此估计适配目标机器人的腕部运动与接触点,作为强化学习策略的引导,从而避免 embodiment gap。
研究提出通过柔性 Fin Ray 夹爪的形变进行视觉力预测,实现无需力或触觉传感器的力感知操作。方法先在标定数据上训练视觉力估计器为演示标注力,再训练动作-力联合生成策略,测试时选取预测力最接近目标的候选动作。在摘莓、抓空罐、手内重定向和插头插入任务上验证了可行性。