论文 信源:X:Arena (@arena) · 👁️ 14178 次研读

Arena 提出图像模型后训练复合奖励方案,FLUX.2-dev 提升 69 Elo、Ideogram 4 达 1224

💡 灵机 AI 深度洞见与核心提炼
Arena 发布图像模型后训练奖励设计研究,指出人类偏好奖励必要但不充分,可能奖励看似美观但漏细节、加未要求内容或出现 reward-hacking 的输出。
信源媒体:X:Arena (@arena)
访问出处网页 ↗
阅读原文出处 ↗