信源:X:罗福莉 (@_LuoFuli) · 👁️ 11688 次研读

小米MiMo-V2.6强化学习训练进展公开

💡 灵机 AI 深度洞见与核心提炼
小米MiMo-V2.6正处于RL训练中,团队从三方面扩展规模:计算(每步约2B tokens,1568条prompt×16次rollout,全异步)、环境与harness(多任务agentic RL,单次运行混合多种harness)、评分计算(agentic组内信用分配,结合测试用例与rubric奖励)。团队称已研究RL能扩展到多远,将在未来几周逐步开源细节,并直播训练过程。
信源媒体:X:罗福莉 (@_LuoFuli)
访问出处网页 ↗
阅读原文出处 ↗