Hugging Face 每日论文·· 1 天前精选AI 评分62
MiMo-V2.6:通过扩大强化学习算力迈向自我改进
MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement
AI 导读
MiMo-V2.6 系列报告介绍了一个全模态模型家族,通过扩大 RL 算力推进模型智能:异步训练每步消耗 1,568 个样本和 2.7-3.7B tokens,上下文长度最高达 1M;环境覆盖代码、通用、视觉和网络领域,并引入 groupwise agentic grading 提供更准确的奖励信号。
推荐理由
报告拆解了扩大强化学习算力的三个维度及配套基础设施,便于评估其可复现性。
来源:Hugging Face 每日论文 · huggingface.co