Hugging Face 每日论文·· 3 天前AI 评分55
LoGRA:用低秩梯度草图扩展 LLM 强化学习训练
LoGRA: Scaling LLM Reinforcement Learning with Low-Rank Gradient Sketches
AI 导读
LoGRA 通过低秩梯度草图保留有效学习信号,将 LLM 强化学习后训练的平均训练内存最多降低 45.7%,且不损失性能。该方法配合 predicted-KL 步长控制,在单个八 GPU 节点上稳定训练 27B 参数模型超过 1,100 步,而 dense Adam 会显存耗尽,使原本内存不可行的 RL 训练变得可行。代码已在相关库中开源。
来源:Hugging Face 每日论文 · huggingface.co