基于 Koopman 模型预测控制的折纸启发式软体膝关节康复外骨骼
针对软体膝关节康复外骨骼难以精确建模气动执行器与人机耦合动力学的问题,研究提出基于 Koopman 的模型预测控制(KMPC)框架,用提升线性 Koopman 模型表示非线性人机耦合系统,并将肌电(EMG)信号纳入系统输入以捕捉个体神经肌肉特征。
针对软体膝关节康复外骨骼难以精确建模气动执行器与人机耦合动力学的问题,研究提出基于 Koopman 的模型预测控制(KMPC)框架,用提升线性 Koopman 模型表示非线性人机耦合系统,并将肌电(EMG)信号纳入系统输入以捕捉个体神经肌肉特征。
论文提出自监督框架 LfH-CP,通过两阶段幻觉关键点生成动态障碍物数据集,无需专家演示或试错探索。该方法先识别障碍物必须出现的时空关键点以形成近最优运动规划,再程序化生成多样轨迹,避免模式坍缩。仿真中基于 LfH-CP 数据集训练的规划器成功率高于既有幻觉方法。
一种将物体重建信息以可见性约束融入移动机械臂全身控制的方法,无需额外路径规划器即可在路径上保持信息量最大区域处于相机视野内。在 114 个物体、57 个类别的仿真与 8 DoF 全向移动机械臂、腿式机械臂实机实验中,该方法重建熵与采样策略无统计显著差异,计算时间快 6.2 至 19.36 倍,视点间总耗时减少 13.76% 至 27.9%。
LHM-Humanoid 通过学习"可恢复"的周期交接状态,让物理仿真人形在单次不间断运行中反复完成取物—搬运—放置,在 350 个覆盖四类房间的杂乱布局上取得比端到端 RL、分层 RL 及既有物理人机交互方法更成功、更稳定的长时程运动表现。
一套三阶段离线指令生成框架在悬挂式双足机器人上复现了 Vicon 系统记录的人体行走与下蹲动作,关节角度重复试验的平均 RMSE 低于 7°、标准差低于 0.33°。框架先用 SDRE 控制推导参考力矩轨迹,再经参数化优化转为受电机转速与加速度限制的梯形关节速度指令,最后由 PID-LQR 补偿修正。各报告情形下关节角度与力矩轨迹的最大 RMSE 和标准差均低于 MPC 与 IPSO-PID。
一套 11-DOF 机器人系统将 6-DOF 机械臂与改进的 5-DOF 绳驱末端执行器结合,用于 CT 引导针刺活检,通过加权逆运动学控制器与零空间控制策略提升灵巧度与工作空间。在临床相关仿真场景中,该系统在不同人体模型上达到 97% 的一致可达率。面向任务的加权矩阵策略在穿刺活检的五个代表性子任务中经仿真与真实实验验证,表现出更优的跟踪精度与可操作性。
一项硬件在环 V2I 研究将任务感知证明建模为运行时保障契约,把完整性有效、证据足够新鲜、决策在预算内完成三个条件绑定,把二值门控的两种结果扩展为四种,区分篡改、证据过期与决策超时导致的拒绝。
VeriFine 提出一种 agent harness 框架,通过策略、训练课程与 judge 的协同演化来扩展验证能力,以支撑具身推理中的持续自我改进。
ACM MobiHoc 2026 接收的 Demo 论文展示了一个通过 ROS 2 耦合 NVIDIA Isaac Sim 与 NVIDIA Sionna 的实时协同仿真框架,闭合感知-动作-通信(PAC)环路。
一项研究提出将人群规模的不良事件监测作为手术数字孪生的独立信念层,并在 FDA MAUDE 血栓取回导管(产品代码 NRY)的 8,617 份报告上评测联邦贝叶斯协议,其中 6,491 份按关键词规则分为五类并划分到 K=8 个厂商站点。
研究提出上下文条件化的 Hamilton-Jacobi 可达性方法,为八状态车辆模型学习一个后向可达管,以局部边界几何、摩擦系数和对抗扰动尺度为条件,无需重新综合即可跨部署条件查询。
EmbodiedSmith 提出一个通过递归自我改进(RSI)规模化生成具身数据的框架,将资产、场景与任务生成统一到同一流水线,支持自主创建和语言驱动定制。其核心是智能体式改进回路,场景生成预判下游任务需求,任务生成引导场景定向编辑,使场景与任务迭代互相改进,提升任务生成成功率,包括长时程任务。
arXiv 论文提出 CATS(Conditioning for Action using only Temporal Smoothness),通过证明时序惩罚可约束共享下一状态的当前状态间期望动作差异,为时序正则化提供了空间平滑效果。CATS 将时序惩罚与线性 ramp-up 结合,先学习高回报行为再逐步平滑动作,在仿真与真实机器人实验中显著减少动作振荡,且几乎不增加计算开销、不损害任务性能。
一篇 arXiv 论文提出信念引导的双控制算法,将信念空间滚动时域选择与目标集进展函数的期望下降约束结合,证明了决策时刻几乎必然的目标集收敛。在平面调节实验中,两步前瞻选择在 11 次决策内将欧氏状态范数降至 0.01 以下,而短视的单步选择在零输入后立即失去可容许性。在模拟双臂装配任务中,该算法相对参考跟踪基线将无穷范数相对位置误差降低 96.4%。
JEPA 世界模型训练中加入动作重建(逆动力学损失)目标,可保证编码器在有限时域可达子空间上为单射,从而保留对控制至关重要的不稳定模态。论文证明精确动作重建使编码器不丢弃任何 H 步内可达的状态方向,且有限时域可控性 Gramian 的主特征空间随 H 增大收敛到可控不稳定子空间。
MRPilot 是一个混合现实系统,围绕 Forming、Reviewing、Following、Repairing 四个阶段监督和干预基于 LLM 的多机器人团队,将机器人团队计划与执行状态表示为跨同步就地视图和总览视图共享的结构化承诺。
一项研究将视觉语言导航(VLN)从仿真环境迁移到真实世界,在自建的 Ackermann 转向移动机器人上实现离线导航。该系统采用 Cross-Modal Attention(CMA)架构,通过线性光度调整和少量真实数据微调完成域适应,无需导航图或全景视图。实验以 SPL 和 nDTW 指标评估,验证了方法的鲁棒性与适应性。
R2RI 是首个专为机器人间交互(RRI)任务设计的数据集,包含多款人形机器人基于真实人类社交行为建模的交互场景,提供各机器人机载传感器的第一人称视角与外部固定相机的第三视角。数据集涵盖 Event 与 RGB 两种模态,规模超过 6.5M 帧、约 5000 段视频,帧率达 120 fps,已公开发布全部任务与模态的数据及标注,并对比了两种模态在多项感知与交互任务上的表现。
一项面向工程硕士生的可扩展游戏化工作坊在 10 场次中让 226 名学生通过移动网页界面为非推理与推理 LLM 编写提示词,完成复杂度递增的网格导航任务,系统返回机器人可执行计划、轨迹可视化与自动评分,并在 Boston Dynamics Spot 机器人上进行现场演示。
Hierarchy-GBP(H-GBP)提出两阶段迭代框架,先用粗图近似(abstraction)求解全局误差并投影回原图(recovery),再用 GBP 精修局部误差,通过推导抽象与恢复步骤的组合矩阵算子并分析其谱半径,证明了收敛到最优解。
一项针对四旋翼强化学习控制器的研究比较了5种扰动保真度等级(从无风、离散1-cosine阵风到统计湍流、合成相干结构和大涡模拟大气边界层场),在0-12 m/s风速扫描下对PPO智能体进行全交叉保真度训练测试评估。
论文提出 QF3(Fast Flow RL with Filtered Q-Gradients),一种在线离策略 RL 算法,通过 flow matching 加上 critic 的动作梯度、经一步预测反向传播来训练流策略,且只将 critic 梯度施加于接近回放动作的那些动作维度。
推荐理由:论文给出相对 FPO++ 的 10x 训练加速和零样本上机结果,可评估该算法是否值得在人形运动控制任务中试用。
PEARS 提出一种物理先验引导的混合强化学习框架,用于带触觉反馈的预训练机器人策略在线自适应。仿真中 PEARS 较最强单任务基线将成功率提升 12.4-37.4 个百分点,达到同等成功阈值所需交互回合数最多减少 53.2%。真实实验中,PEARS 在白板擦除任务上达到 95% 成功率,在移液器吸取任务上达到 90%。
DepthWorld 提出一种结合学习式立体深度与联合因子图的标定流程,将 DROID 数据集标定为提供稠密度量深度和多视角外参的 DROID-3D,外部相机在 90% 的 episode 上重投影误差 <0.7 px。
推荐理由:论文解释了RGB-only世界模型几何不一致的成因,并给出可迁移的标定与深度监督思路。
LBA-CBF 通过在短回看窗口内按近期预测误差对一组候选动力学模型排序,并对与最优模型容差内的所有模型强制执行高阶 CBF 条件,从而在动力学突变时维持安全认证。
论文提出 PhoneBot,一个低成本开源人形机器人平台,把商用智能手机作为主要感知与计算单元,利用其 IMU、摄像头、无线连接和板载处理能力降低硬件成本并简化系统架构。
一项面向社交机器人语音对话的可扩展基准被提出,用于评估澄清请求、打断、具身信号(如点头或面部提示)和时间约束等常见对话问题。该基准同时提出采用实时通信框架 Retico,以满足机器人语音对话能力的技术要求。研究已被 IROS 2026 Workshop on Human-Robot Dialogue 接收并展示。
EgoLAP 提出一种 VLA 预训练框架,通过共享的语言动作链式思维联合学习人类与机器人轨迹,将运动意图表达为结构化、时间抽象的语言动作。在真实世界与仿真实验中,EgoLAP 达到 80.1% 的真实任务平均进度,较其他动作表示方式取得 2.3x 性能提升。运动级推理也优于结合子任务、目标框与视觉轨迹的复合推理格式。
论文提出非线性模型预测规划方法NMPP,将感知到的障碍物作为硬几何约束,并向避障的SE(3)控制器传递全状态参考轨迹。实验显示其位置RMSE较线性MPC轨迹规划器低58-67%,较多项式轨迹规划器低41-70%;在最高9.5 m/s的森林飞行中全部无碰撞完成,在更激进的速度配置下成功率达86%,而现有先进规划器仅26%。真实部署中在未知杂乱环境下以最高5.5 m/s稳定飞行。
一项面向腿式机器人的磁场感知控制框架,通过建模、估计并动态补偿空间变化的磁力矩,提升四足机器人在强磁场环境中的运动鲁棒性。
arXiv 论文提出一种带几何先验的非参数异方差模仿学习方法,用于从人类示教中学习概率策略,优化后的公式使包含位置与姿态的轨迹更新耗时低于 3 ms。该方法采用非可分对角核捕捉同一自由度间的不确定性关系,支持流形值输入与大角度姿态变化的流形值输出,并可通过任务参数化适配不同物体位姿。作者在玩具示例与真实机器人操作任务上进行了自主执行和共享控制场景的评测。
HygieneRoboBench 推出 624 个实例、覆盖 134 个任务族的基准,用于评估家用机器人在给定执行历史下依据接触历史识别卫生风险并安全续接任务的能力。
RIWANav 提出一种后训练框架,将世界模型与动作模型(策略)的耦合适配建模为任务特定的递归自改进(RSI):世界模型通过想象结果为 GRPO 提供比较反馈,改进后的策略再按行为新颖度与预测误差构建自课程,筛选与专家一致的动作-视频对来精炼世界模型,闭合递归自改进循环。实验显示 RIWANav 优于训练基线与已有方法,真实场景试验也验证了其实际可用性。
arXiv 论文提出一种力感知四足运动框架,将未固定负载上的人为交互视为指令,通过柔顺负载策略与因果力估计器结合,仅凭机器人机载测量推断外部作用力。该方法经 estimator-in-the-loop 数据聚合与微调训练,仿真和真机实验表明控制器能保持稳定负载运动、柔顺响应外部交互,并据推断力支持人类引导的轨迹改变。
CropSentry 提出一种低成本地面多机器人系统,由两台自主机器人逐行检测叶片颜色与环境数据,经空间映射汇总至主机器人并生成实时 Web 仪表盘。实验共采集 63 次观测,作物健康分类总体准确率 84.12%,其中健康植株 82.60%、缺素植株 88%、病害植株 80%,10 次从机观测无线通信成功率达 100%。
论文提出 Coordinated Multi-Agent Diffusion Steering(CMDS)框架,将冻结的预训练扩散模型作为可复用生成原语,通过学习到的控制协调其逆向过程,把协调问题建模为随机最优控制问题,平衡组合输出的装配级奖励与对预训练动力学的偏离。
论文提出 Loss-Conditioned Activation-Moment(LCAM)剪枝方法,一种面向预训练机器人操作策略的免训练非结构化剪枝方案,通过自递归由粗到细流程在剪枝后无需恢复训练与仿真 rollout。
论文提出 Micro Neural Policies(MNP)合成方法,结合 Evolution Strategy(ES)搜索与 Statistical Model Checking(SMC)验证,在不牺牲安全与鲁棒性的前提下大幅压缩神经网络规模。
推荐理由:论文给出策略内存占用与抖动等量化指标,便于评估微型神经策略在 MCU 上的部署可行性。
PER-DDP 提出一种基于自由能/相对熵不等式推导的熵正则化种群框架,将先验引导采样、扩展 rollout 评估与 Pareto 过滤结合,在保留 DDP 二阶结构的同时把采样开销与优化种群规模解耦。在多个系统和数百个环境的评测中,PER-DDP 的成功率高于现有采样增强型轨迹优化方法,并能在所有基线方法均无法求解的环境中找到可靠解。
WareFly-VLA 发布了一套面向智能仓库的无人机 VLA 框架与数据集,包含 507 段人工遥操作飞行片段和 8,504 帧高分辨率 RGB 数据,均采集自 NVIDIA Isaac Sim,并配有目标工人的外观描述与四自由度同步控制指令。