跳到正文
Hugging Face 每日论文·· 1 天前精选AI 评分62

MiMo-V2.6:通过扩大强化学习算力迈向自我改进

MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement

AI 导读

MiMo-V2.6 系列报告介绍了一个全模态模型家族,通过扩大 RL 算力推进模型智能:异步训练每步消耗 1,568 个样本和 2.7-3.7B tokens,上下文长度最高达 1M;环境覆盖代码、通用、视觉和网络领域,并引入 groupwise agentic grading 提供更准确的奖励信号。

推荐理由

报告拆解了扩大强化学习算力的三个维度及配套基础设施,便于评估其可复现性。

来源:Hugging Face 每日论文 · huggingface.co