PhysMoDPO用偏好优化提升人形机器人动作物理合理性
热点事件持续更新
PhysMoDPO用偏好优化提升人形机器人动作物理合理性
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
PhysMoDPO 论文作者团队提出一个基于直接偏好优化(DPO)的框架 PhysMoDPO,将全身控制器(WBC)纳入训练管线,直接优化扩散模型,使 WBC 输出同时符合物理规律与原始文本指令,替代以往依赖脚滑惩罚等手工物理启发式的方法。 作者称,在仿真中的零样本动作迁移与真实 G1 人形机器人部署上,PhysMoDPO 均带来显著提升;在文本到动作与空间控制任务的仿真机器人实验中,其在物理真实性和任务相关指标上均有一致改善。
AI 根据报道生成 · 3 小时前更新
最新进展10月9日 12:00
PhysMoDPO:用偏好优化实现物理上合理的人形机器人动作生成报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv cs.RO 机器人学PhysMoDPO:用偏好优化实现物理上合理的人形机器人动作生成
论文提出 PhysMoDPO,一个 Direct Preference Optimization 框架,将 Whole-Body Controller(WBC)纳入训练管线,直接优化扩散模型使 WBC 输出同时符合物理规律与原始文本指令,替代以往依赖脚滑惩罚等手工物理启发式的方法。
本事件热度走势
- 可比范围当前
- 9
- 可比范围峰值
- 1010月9日 13:00
- 近 24 小时变化
- –
02.557.510
13:0014:0015:00
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。