小米MiMo-V2.6开源RL训练细节,已投入超100万美元
💡 灵机 AI 深度洞见与核心提炼
小米MiMo-V2.6正进行大规模RL训练,从三个维度扩展:计算(每步约2B tokens、1568 prompts×16 rollouts、全异步)、环境与harness(多任务智能体RL,单次运行混合多个harness)以及评分计算(组内智能体信用分配,结合测试用例与rubric奖励)。团队表示将在未来数周逐步开源细节,目前投入已超100万美元。
信源媒体:X:Elvis Saravia (@omarsar0, DAIR.AI)
访问出处网页 ↗