GRPO 强化学习新方法 Never Give Up 提升难题表现
💡 灵机 AI 深度洞见与核心提炼
针对 GRPO 强化学习在难题上收益有限的问题,研究者提出 "Never Give Up" 方法:当 GRPO 组内所有回答都错误时,以约 0.9 的概率继续采样,以寻找非零梯度的批次,该方法有效。研究将 RL 收益集中在简单题目的现象称为 LLM 强化学习的马太效应,并借助异步 RL 攻克更难问题。
信源媒体:X:Nathan Lambert (@natolambert)
访问出处网页 ↗