跳到正文
热点事件持续更新

PhysMoDPO用偏好优化提升人形机器人动作物理合理性

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

PhysMoDPO 论文作者团队提出一个基于直接偏好优化(DPO)的框架 PhysMoDPO,将全身控制器(WBC)纳入训练管线,直接优化扩散模型,使 WBC 输出同时符合物理规律与原始文本指令,替代以往依赖脚滑惩罚等手工物理启发式的方法。 作者称,在仿真中的零样本动作迁移与真实 G1 人形机器人部署上,PhysMoDPO 均带来显著提升;在文本到动作与空间控制任务的仿真机器人实验中,其在物理真实性和任务相关指标上均有一致改善。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.RO 机器人学
    PhysMoDPO:用偏好优化实现物理上合理的人形机器人动作生成

    论文提出 PhysMoDPO,一个 Direct Preference Optimization 框架,将 Whole-Body Controller(WBC)纳入训练管线,直接优化扩散模型使 WBC 输出同时符合物理规律与原始文本指令,替代以往依赖脚滑惩罚等手工物理启发式的方法。

本事件热度走势

可比范围当前
9
可比范围峰值
1010月9日 13:00
近 24 小时变化
–

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。