跳到正文
arXiv cs.RO 机器人学· Ruiyan Xu, Haisheng Su, Sixu Lin, Zhaokun Yue, Chengming Hu, Xin Jin, Guiliang Liu·· 2 天前AI 评分55

R²-WAM:面向世界动作模型的修复与拒绝后训练方法

$R^2$-WAM: Repair-and-Reject Post-Training for World Action Models

AI 导读

论文提出 R²-WAM,一个两阶段修复与拒绝的后训练框架,先用运动学对齐分数提升预测未来与输入动作的一致性,再用修复后的视频模型比较采样动作与示范动作的想象结果,对任务进度低于示范参考一定裕度的样本做负向微调,无需额外环境交互或改动推理流程。

来源:arXiv cs.RO 机器人学 · arxiv.org