arXiv cs.RO 机器人学· Xingjian Li, Jianhua Z. Huang, Junli Duan·· 2 天前AI 评分55
策略记忆反向传播何时重要:物理信用、优化器更新与可观测性
When Does Backpropagating Through Policy Memory Matter? Physical Credit, Optimizer Updates, and Observability
AI 导读
研究在 Transformer 船舶轨迹模型与四旋翼跟踪策略中测量记忆梯度截断的代价:船舶模型中切断 key-value cache 梯度使梯度范数缩至约十分之一,但一步物理信用下几乎不变;AdamW 将 2% 梯度差异放大为最高 31% 的更新差异。
来源:arXiv cs.RO 机器人学 · arxiv.org