跳到正文
arXiv cs.RO 机器人学· Xingjian Li, Jianhua Z. Huang, Junli Duan·· 2 天前AI 评分55

策略记忆反向传播何时重要:物理信用、优化器更新与可观测性

When Does Backpropagating Through Policy Memory Matter? Physical Credit, Optimizer Updates, and Observability

AI 导读

研究在 Transformer 船舶轨迹模型与四旋翼跟踪策略中测量记忆梯度截断的代价:船舶模型中切断 key-value cache 梯度使梯度范数缩至约十分之一,但一步物理信用下几乎不变;AdamW 将 2% 梯度差异放大为最高 31% 的更新差异。

来源:arXiv cs.RO 机器人学 · arxiv.org