Hugging Face 每日论文·· 2 天前AI 评分47
On KL-Regularized Policy Optimization:KLPO 用采样器锚定 KL 正则实现无 critic 的策略优化
On KL-Regularized Policy Optimization
AI 导读
论文提出 KL-Regularized Policy Optimization(KLPO),将 KL 正则锚定在采样器上,通过最小二乘拟合采样器自身轨迹的 log-ratio 最优性条件,无需重要性权重即可完成策略更新。
来源:Hugging Face 每日论文 · huggingface.co