PACE:通过对话式引导在人机交互中实现人格自适应
PACE 提出交互式人格引导流水线,让 Ameca 人形机器人通过用户问答动态合成定制化、有心理学依据的人格,并编译为多视角维度的结构化人格提示,驱动多模态表达行为。实证 HRI 评估对比通用基线,考察动态生成人格对用户信任、拟人化感知、人格一致性、个人相关性与交互质量的影响。
PACE 提出交互式人格引导流水线,让 Ameca 人形机器人通过用户问答动态合成定制化、有心理学依据的人格,并编译为多视角维度的结构化人格提示,驱动多模态表达行为。实证 HRI 评估对比通用基线,考察动态生成人格对用户信任、拟人化感知、人格一致性、个人相关性与交互质量的影响。
CERPE 是一个系统级框架,通过协调视觉基础模型联合估计自运动与机器人间相对位姿,用于短暂协作感知场景。该框架以持续共享的固定大小描述子触发事件驱动的原始图像请求,并通过度量尺度化的自运动传播相对位姿,即使无视觉重叠也能维持估计。仿真与真实机器人实验显示,CERPE 在 6-DoF 相对位姿估计上优于所选基线方法。
研究团队发布开源全栈系统 EgoSteer,用第一人称人类视频扩展灵巧手 VLA 预训练,并以少量真实机器人数据完成后训练。
推荐理由:论文给出从第一人称视频构建 9606 小时预训练数据的完整管线,做灵巧手数据工程的团队可对照其吞吐与精度做法。
研究人员提出 CORL-AUV,用 CFD 数据训练阻力代理模型(SDM)替代逐步求解 CFD,在强化学习训练管线中将阻力估计加速 700000 倍,并据此训练 PPO 策略零样本部署到 6-DOF AUV。
GEM-Occ 提出 Gaussian Evidence Memory 框架,将多视角累积的几何与语义证据整合为持久的语义占据记忆,支持跨房间的持续建图与高效查询。团队同时发布 HIOcc 基准,统一语义标签空间与评测框架,覆盖局部预测、房间级在线建图和建筑级建图。实验显示 GEM-Occ 在 HIOcc 上优于现有方法,兼顾内存占用与占据查询速度。
Mask2Real-WM 提出两阶段世界模型,将像素预测解耦为动力学模型与渲染模型,以分割掩码作为 Sim-to-Real 桥梁提升灵巧手可控性。动力学模型在覆盖完整手部运动的合成数据上训练,再仅用 2.5 h 真实演示微调并训练渲染模型。在 23-DoF 机器人系统上与四种模型对比,解耦模型经人工盲评可控性最强,且帧更清晰、感知质量相当。
论文提出 SVA(Search, Value, and Act)框架,用 Monte-Carlo tree search 在仿真中探索冻结 VLA 的输出分布并收集带经验回报的轨迹,再蒸馏成轻量 Q 值模型,部署时由评估器从多个候选动作中选出不确定性正则化 Q 值最高者,无需仿真器。
推荐理由:论文用 pass@k 诊断说明冻结 VLA 输出分布里已有可用行为,把树搜索蒸馏成 Q 值评估器可在不改骨干的前提下提升成功率。
该研究提出一种可重构摇臂-转向架机构,通过在转向架关节安装电机主动摆动,在四轮与六轮构型间切换,转向架末端安装全向轮实现四轮差速转向。样机实验显示,其零半径转向速度超过传统六轮摇臂-转向架机构 5 倍,平均轮端总扭矩仅约 17%。机器人成功攀爬 40 cm 台阶,平均攀爬时间 6.4 s。
该论文提出 MoRE(Mode Redirection),通过一次简短的 uncloning 步骤把临时模式分类器的重定向信号蒸馏进策略权重,使策略在零推理开销下抑制不想要的行为模式,并用 retain loss 保留期望模式的能力。
ResCue(Residual Spatial Cueing)把语言推导出的目标信息转成空间条件注入视觉策略:预训练 grounding 生成目标掩码,独立 cue 编码器将特征残差融合到空间 RGB 特征中,保留场景上下文并显式标出目标。
通过方向性任务误差监督与任务误差模型驱动的样本选择,残差学习在 Barrett WAM 机械臂上实现稳定的三球、四球和五球杂耍,系统从第二次尝试即收敛,此后任务误差单调下降且无失败。对比显示,方向性反馈与信息性先验缺一不可,其中固定 Jacobian 的 Newton 更新最快且完全可靠。学习到的残差可容忍先验失配与关节跟踪退化,主要影响收敛速度。
CANMOT 提出面向 KF 3D 多目标跟踪的类别感知、目标对齐噪声建模框架,为不同交通参与者引入类别专属的过程与测量协方差矩阵,并可选地在目标坐标系下表达以保留纵横向各向异性。在 nuScenes 上的实验显示该方法提升跟踪性能并显著减少身份切换。基于 ANEES 与 χ² 违规检验的分析揭示标准 KF 基线存在严重过度自信,所提方法改善校准但仍存在明显不一致。代码已开源。
Hebero(Heterogeneous Benchmark for Robot Learning)是一个基于 GPU 并行 Isaac Lab 的基准,支持在全部 40 个异构任务上联合训练和评估单一策略。
AHEAD(Anticipatory Horizon Extrapolation with Adaptive Dynamics)提出一种 predict-then-act 包装器,用运动感知的潜空间世界模型预测 VLA 特征空间中的未来 patch token,使冻结的 VLA 能应对执行过程中物体移动的场景。
推荐理由:论文给出 AHEAD 在动态抓取任务上相对基线的成功率对比,可为处理运动物体的 VLA 方案提供参考。
BiMoSG 提出双模态 3D 场景图生成方法,面向开放集任务执行,默认以"fast"模式高效生成粗粒度场景图,遇到可能包含任务相关物体的区域时切换到"slow"模式生成细粒度开放词汇 3D 场景图。该方法生成速度显著快于开源 state-of-the-art 方案,可将场景图生成与任务执行集成,支持实时部署。
Victor Kowalski 等提出 VE2VF,用人在回路的强化学习与师生蒸馏,把依赖视觉的教师策略蒸馏到仅使用 pose、twist 和 wrench 传感的无视觉学生策略,全程在真实世界训练,无需 domain randomization 或数据增强。
FLASH Policy 用 Legendre 多项式连续轨迹表示替代离散动作块生成,通过稀疏时间采样拟合专家演示,单次推理即可覆盖更长的动作时域。该方法以历史多项式系数而非高斯噪声初始化流匹配,缩短传输距离并支持单步推理,多项式解析求导还可直接为力矩控制器提供速度前馈信号。
推荐理由:用 Legendre 多项式连续轨迹替代离散动作块,配合历史系数初始化流匹配,给出了单步推理与速度前馈的完整实现思路。
Premover 是一个轻参数模块,可在指令输入过程中提前启动机器人执行,同时保持 VLA 主干网络冻结,通过学习得到的视觉-语言焦点图和动作就绪门降低交互延迟。
该自主机器人伤亡评估系统融合多种视觉算法输出,以专家规则构建的贝叶斯网络对伤情做概率推理,在 DARPA Triage Challenge 的 11 人与 9 人伤亡场景中,生理评估准确率从 15% 提升至 42%、19% 提升至 46%。整体分类准确率从 14% 升至 53%,诊断覆盖率从 31% 扩展到 95%。
研究者将时序行为树(TBT)重构为三值信号时序逻辑(STL)形式,引入第三真值 Unknown 以刻画轨迹既未完全满足也未违反规范的情形,并为部分轨迹 STL 与 TBT 提出混合整数线性编码。该编码通过混合整数优化为线性动力系统生成构造即正确的控制策略,论文已获 IEEE CDC 2026 接收。
该研究提出将深度确定性策略梯度(DDPG)强化学习与有界极值搜索(ES)结合的混合控制器,用于提升机器人推物和抓放任务在分布偏移下的鲁棒性。DDPG 策略在标准条件下训练,部署时叠加有界 ES,以应对时变目标和空间变化摩擦等超出训练分布的工况。研究证明机械臂可在有限时间内收敛到目标物体,随后有界 ES 实现对有界速度移动目标的有限时间收敛,并给出收敛时间解析公式与增益调节方法。
研究提出将 LLM 作为调优专家嵌入贝叶斯优化循环,为 FDM 3D 打印选择配置:近似评估器对候选配置打分并返回结构化诊断,LLM 据此提出自然语言调整并编译为机器可执行指导。
Zhou Fang 等提出 ProbeFlow,一种面向 VLA 模型的免训练自适应推理框架,通过初始与前瞻速度向量的余弦相似度评估轨迹复杂度并动态调度积分步数,以剪枝冗余网络评估。
推荐理由:原文给出用速度向量余弦相似度动态调度积分步数的方法,可迁移到其他 Flow Matching 动作头的推理加速。
该研究提出一种免导数的 episodic 潜在策略改进方法,通过将初始噪声采样替换为精心选择的常量噪声向量(golden ticket),改进冻结的 diffusion 或 flow matching 策略。
研究团队发布 FoMo 多季节数据集,在北方森林中历时一年、12 次部署采集超过 64 km 的六条多样化轨迹,用于挑战现有里程计与 SLAM 流程。数据涵盖旋转与混合固态激光雷达、FMCW 雷达、立体与单目相机及两个 IMU,真值由三台 GNSS 接收机与静态基站后处理得到,并附气象站、相机标定和车辆功耗等元数据。
浙江大学团队提出 TDC 方法,将力调节分解为可从仿真迁移的方向分量与可手动调节的幅值分量,仅用仿真数据即可实现自适应柔顺。方向分量由基于预训练 VLA 微调的视觉运动策略预测任务坐标系与控制模式向量,部署时由导纳控制器结合人工指定刚度与目标力旋量实现柔顺控制。该方法已被 CoRL 2026 接收,在微波炉开门、插孔、白板擦拭和开门四个接触密集任务上取得较高成功率并对外部扰动具备鲁棒性。
研究在统一 VLM-hidden + diffusion-policy 范式下比较 InternVL3、Qwen3VL 与 ResNet、ViT、EVA-CLIP,发现策略学习扩大共享决策子空间但两分支保留不可迁移残差,纯视觉编码器在几何主导场景更强,VLM 在语义复杂长尾场景更有效。
RPL 提出两阶段训练框架,先用特权高度图观测训练地形专家策略,再蒸馏为基于多深度相机的 transformer 策略,实现人形机器人在复杂地形上的多方向鲁棒运动。
TRACER 提出纹理鲁棒的可供性思维链框架,将高层语义指令映射为外观鲁棒、物理一致的可变形物体交互区域。框架包含树状可供性思维链 TA-CoT、空间约束边界细化 SCBR 与交互收敛细化流 ICRF,抑制边界溢出并整合分散的可供性响应。在 Fine-AGDDO15 数据集与真实机器人平台上,TRACER 提升多纹理可供性定位精度与长程操作成功率,源码与数据集将公开。
RVC-NMPC 将时变互易速度约束(RVC)直接集成进非线性模型预测控制(NMPC)问题,仅依赖对其他机器人的可观测信息即可实现 UAV 互碰撞规避,整条流水线运行在 100 Hz。仿真覆盖最多 10 架 UAV、速度达 25 m/s,实飞实验加速度达 30 m/s²。与现有方法相比,该方法在挑战性场景中飞行时间缩短 31%,所有试验均保持无碰撞导航。
提出最小限制超平面控制障碍函数(Least Restrictive Hyperplane CBFs),通过优化支撑超平面朝向降低保守性,使安全控制更接近期望控制。该方法将常见基于距离的 CBF 视为 H-CBF 的特例,在带加速度约束的双积分器系统上穿越任意形状的静态与动态障碍群进行验证。结果显示,期望控制与安全控制之间的平均差距缩小一个数量级。
Po-Chen Ko 等人提出 RELIC,一种面向机器人操作的视频重规划框架,通过优化捕捉环境隐藏物理属性的潜变量嵌入,并用基于拒绝的采样过滤与既往失败不一致的假设,从而在测试时失败中适应推门还是拉门、摩擦等只能靠试错揭示的属性。
ZeST 将重复的 VLM 输出作为随机测量并融合为不确定性感知后验,实现零样本可通行性预测,避免机器人进入危险环境采集真实数据。在受控室内与非结构化室外环境中,ZeST 以最高 4s 推理延迟取得 90-100% 导航成功率,持续抵达最终目标,优于其他先进方法。
一篇综述分析物理仿真器如何缩小机器人导航与操作任务的 sim-to-real 差距,考察以往综述较少关注的仿真器属性、任务特性与硬件需求。文章还整理了基准数据集、评测指标、仿真平台与方法资源,帮助研究者在硬件约束下选择合适工具。该综述共 35 页、9 幅图,已被 ACM Computing Surveys (CSUR) 接收。
研究提出用伪触觉作为反馈消除抓取操作任务中的夹爪状态歧义,使模仿学习策略可完全在仿真中训练。该方法受力控夹爪充当触觉传感器的思路启发,为策略提供无噪声的二值夹爪状态观测,无需额外数据采集或硬件改动。三项真实抓取任务实验验证了其必要性、有效性与高效性,成果已被 IROS 2025 接收。
提出一种基于 Dirichlet Process Mixture 的贝叶斯非参数技能先验,在结构化隐空间中建模时序扩展技能,无需预设成分数即可自适应发现技能,并嵌入分层强化学习框架指导高层技能选择。
DAHLIA 提出一种数据无关的代码生成框架,将长程操作任务建模为回合式任务规划与评估,用渐进组织的上下文示例和 chain-of-thought 推理引导 LLM 合成可执行代码计划。
研究提出一种将现有基于反馈的运动学运动规划器适配到二阶自主系统的方法,同时保留其安全性与几乎全局渐近稳定性保证。方法覆盖两类运动学运动规划器:基于导航函数推导的规划器,以及直接通过期望速度场定义、不依赖底层导航函数的规划器。两个基于反馈的运动学运动规划器被适配到二阶系统,并在仿真与实验中得到验证。
该研究提出一种面向实时自动驾驶的遮挡感知应急安全关键规划方法,用幻影车辆的前向可达集推导风险感知动态速度边界,并以时空屏障约束写入双凸非线性规划,同时优化探索与回退轨迹。基于共识 ADMM 将问题分解为低维凸子问题以实现实时求解。仿真与遮挡路口实车实验验证了安全性与通行效率提升。
研究提出让机器人逐条主动索取运动学示教的方法,用螺旋几何表示从示教生成操作规划并使示教充分性可度量,结合基于 PAC-learning 的多臂老虎机采样策略评估任务空间子区域的规划能力,并用启发式从薄弱区域追加示教。22 名无机器人背景参与者在倒水和舀取两项任务上的用户研究表明,少于 10 条示教即可教会机器人规划任务。成果发表于 2026 IEEE ICRA。