arXiv cs.RO 机器人学· Zewei Zhou, Rachel Luo, Yulong Cao, Chaowei Xiao, Chensheng Peng, Boyi Li, Thomas Tian, Zheng Lian, Yan Wang, Jiaqi Ma, Boris Ivanovic, Marco Pavone, Wenhao Ding·· 1 天前AI 评分51
VeriFine:通过验证器与策略协同演化扩展具身推理的自我改进
VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning
AI 导读
VeriFine 提出一种 agent harness 框架,通过策略、训练课程与 judge 的协同演化来扩展验证能力,以支撑具身推理中的持续自我改进。
来源:arXiv cs.RO 机器人学 · arxiv.org