跳到正文
Hugging Face 每日论文·· 3 天前AI 评分55

LoGRA:用低秩梯度草图扩展 LLM 强化学习训练

LoGRA: Scaling LLM Reinforcement Learning with Low-Rank Gradient Sketches

AI 导读

LoGRA 通过低秩梯度草图保留有效学习信号,将 LLM 强化学习后训练的平均训练内存最多降低 45.7%,且不损失性能。该方法配合 predicted-KL 步长控制,在单个八 GPU 节点上稳定训练 27B 参数模型超过 1,100 步,而 dense Adam 会显存耗尽,使原本内存不可行的 RL 训练变得可行。代码已在相关库中开源。

来源:Hugging Face 每日论文 · huggingface.co