论文 信源:X:面壁智能 OpenBMB (@OpenBMB) · 👁️ 29585 次研读

面壁智能推出 Diffusion Reward Models,学习完整奖励分布

💡 灵机 AI 深度洞见与核心提炼
面壁智能联合清华 THUNLP 提出 Diffusion Reward Models(DRM),不再把人类偏好压缩成单一分数,而是学习完整奖励分布,保留分歧、不确定性与多种合理判断。
信源媒体:X:面壁智能 OpenBMB (@OpenBMB)
访问出处网页 ↗
阅读原文出处 ↗