arXiv cs.RO 机器人学· Silong Yong, Stephen Sheng, Carl Qi, Xiaojie Wang, Evan Sheehan, Anurag Shivaprasad, Yaqi Xie, Katia Sycara, Yesh Dattatreya·· 1 天前AI 评分55
VLLR:面向长时程机器人任务的可泛化稠密奖励框架(IROS 2026)
Generalizable Dense Reward for Long-Horizon Robotic Tasks
AI 导读
论文提出 VLLR 稠密奖励框架,结合 LLM/VLM 的外部奖励与策略自确信度的内部奖励,在无需人工设计奖励的情况下微调机器人基础策略。LLM 将任务分解为可验证子任务,VLM 估计进度以初始化价值函数并仅用于短暂热身阶段,自确信度则在 PPO 微调全程提供逐步内在引导。
来源:arXiv cs.RO 机器人学 · arxiv.org