腾讯混元:LLM 强化学习批大小扩展研究
💡 灵机 AI 深度洞见与核心提炼
腾讯混元研究发现,在 GRPO 和 PPO 中重新调整学习率可在有限批大小范围内保持每条响应的学习效果。在固定硬件上,扩大批大小使 PPO 生成阶段吞吐量最高提升 2.29×,最佳 GRPO 配置以少 29% 的时间达到相同验证目标。该研究将经典临界批大小理论扩展至在线 LLM 强化学习场景。
信源媒体:X:腾讯混元 (@TencentHunyuan)
访问出处网页 ↗