SQAM用标量伴随匹配简化流策略Q-learning微调
热点事件持续更新
SQAM用标量伴随匹配简化流策略Q-learning微调
1 篇报道1 个报道来源7 小时前更新
先了解这件事
AI 综述
Yonghoon Dong 等人提出 Q-learning with Scalar Adjoint Matching(SQAM),用于流策略与 VLA 策略的离线强化学习微调。针对流策略多步生成动作时每步需向量-雅可比乘积、成本随流步数与策略规模增长的问题,作者观察到预训练流策略的批量平均速度雅可比集中在对角线上,据此推导出按流时间缩放最终动作价值梯度的闭式标量伴随,消除逐步向量-雅可比乘积,并在策略生成动作上加入价值惩罚。 论文报告称,SQAM 的提升集中在 OGBench 最难的四个域,其成功率在每个域上比该域最强基线高 18 到 35 个百分点;在三个任务上均优于监督微调。
AI 根据报道生成 · 7 小时前更新
最新进展10月8日 12:00
SQAM:用标量伴随匹配实现流策略的 Q-Learning 微调报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.RO 机器人学SQAM:用标量伴随匹配实现流策略的 Q-Learning 微调
论文提出 Q-learning with Scalar Adjoint Matching(SQAM),针对流策略经多步流生成动作、用离线 RL 微调时每步需向量-雅可比乘积且成本随流步数与策略规模增长的问题,观察到预训练流策略的批量平均速度雅可比集中在对角线上,据此推导出按流时间缩放最终动作价值梯度的闭式标量伴随,消除逐步向量-雅可比乘积,并在策略生成动作上加入价值惩罚。
本事件热度走势
- 可比范围当前
- 8
- 可比范围峰值
- 1010月8日 13:00
- 近 24 小时变化
- –
02.557.510
13:0014:0015:0016:0017:0018:0019:00
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。