跳到正文
热点事件持续更新

SQAM用标量伴随匹配简化流策略Q-learning微调

1 篇报道1 个报道来源7 小时前更新

先了解这件事

AI 综述

Yonghoon Dong 等人提出 Q-learning with Scalar Adjoint Matching(SQAM),用于流策略与 VLA 策略的离线强化学习微调。针对流策略多步生成动作时每步需向量-雅可比乘积、成本随流步数与策略规模增长的问题,作者观察到预训练流策略的批量平均速度雅可比集中在对角线上,据此推导出按流时间缩放最终动作价值梯度的闭式标量伴随,消除逐步向量-雅可比乘积,并在策略生成动作上加入价值惩罚。 论文报告称,SQAM 的提升集中在 OGBench 最难的四个域,其成功率在每个域上比该域最强基线高 18 到 35 个百分点;在三个任务上均优于监督微调。

AI 根据报道生成 · 7 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.RO 机器人学
    SQAM:用标量伴随匹配实现流策略的 Q-Learning 微调

    论文提出 Q-learning with Scalar Adjoint Matching(SQAM),针对流策略经多步流生成动作、用离线 RL 微调时每步需向量-雅可比乘积且成本随流步数与策略规模增长的问题,观察到预训练流策略的批量平均速度雅可比集中在对角线上,据此推导出按流时间缩放最终动作价值梯度的闭式标量伴随,消除逐步向量-雅可比乘积,并在策略生成动作上加入价值惩罚。

本事件热度走势

可比范围当前
8
可比范围峰值
1010月8日 13:00
近 24 小时变化
–

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。