行业 信源:X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf) · 👁️ 35662 次研读

小米 MiMo-V2.6 正在进行大规模 RL 训练并公开训练直播

💡 灵机 AI 深度洞见与核心提炼
小米团队称 MiMo-V2.6 目前正处于 RL 训练中途,探索 RL 的规模上限。其扩展了三个方向:算力(每步约 2B tokens,1568 prompts × 16 rollouts。
信源媒体:X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf)
访问出处网页 ↗
阅读原文出处 ↗