跳到正文
arXiv cs.RO 机器人学· Logan Mondal Bhamidipaty, Lauren Robson, Linda Petrini, Shengrui Lyu, Kamal Ndousse·· 2 天前AI 评分47

迭代式奖励设计全景:BIRD 基准统一评测 LLM 奖励函数生成方法

A Bird's-Eye View of Iterative Reward Design

AI 导读

研究者提出迭代式奖励设计基准 BIRD,将现有 LLM 奖励代码生成与迭代改进方法统一到同一配置与评测空间,便于直接对比、消融设计选择。在 MuJoCo、Meta-World、Assistax、HumanoidBench 上,少量简单设计选择持续提升性能,组合后显著优于先前方法。代码已开源。

来源:arXiv cs.RO 机器人学 · arxiv.org