跳到正文
arXiv cs.RO 机器人学· Zewei Zhou, Rachel Luo, Yulong Cao, Chaowei Xiao, Chensheng Peng, Boyi Li, Thomas Tian, Zheng Lian, Yan Wang, Jiaqi Ma, Boris Ivanovic, Marco Pavone, Wenhao Ding·· 1 天前AI 评分51

VeriFine:通过验证器与策略协同演化扩展具身推理的自我改进

VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning

AI 导读

VeriFine 提出一种 agent harness 框架,通过策略、训练课程与 judge 的协同演化来扩展验证能力,以支撑具身推理中的持续自我改进。

来源:arXiv cs.RO 机器人学 · arxiv.org