灵
灵机 FeedHub
🌙
← 返回 AI 资讯大厅
📰 今日早报 ↗
← 返回 AI 资讯大厅
9月24日 10:29
信源:
X:腾讯混元 (@TencentHunyuan)
· 👁️ 30382 次研读
腾讯混元:LLM 强化学习批大小扩展研究
💡 灵机 AI 深度洞见与核心提炼
腾讯混元研究将经典临界批大小理论扩展到在线 LLM 强化学习,发现在 GRPO 和 PPO 中,重新调整学习率可在有界批大小范围内保持每条响应的学习效果。在固定硬件上,扩大批大小使 PPO 生成阶段吞吐量最高提升 2.29×,最佳 GRPO 配置以少 29% 的时间达到相同验证目标。
信源媒体:
X:腾讯混元 (@TencentHunyuan)
访问出处网页 ↗
阅读原文出处 ↗
📋 复制分享链接
← 返回大厅