Figure 用强化学习让 Figure 02 实现自然类人步行,策略零样本迁移到真机
Figure 公布了纯仿真训练的端到端强化学习步行控制器,让 Figure 02 人形机器人以类人步态行走,策略零样本迁移到真机无需微调。训练在 GPU 加速物理仿真中并行运行数千台参数各异的 Figure 02,几小时内积累数年仿真数据,覆盖多种地形、执行器动态变化以及绊倒、打滑和推搡等扰动。
推荐理由:原文给出了用人类步行参考轨迹做奖励先验、再以 kHz 力矩闭环补偿执行器建模误差的做法,可迁移到其他双足训练。