灵
灵机 FeedHub
🌙
← 返回 AI 资讯大厅
📰 今日早报 ↗
← 返回 AI 资讯大厅
9月4日 07:56
论文
信源:
X:Rohan Paul (@rohanpaul_ai)
· 👁️ 18828 次研读
Microsoft 与加州大学圣地亚哥分校提出 TailSFT:过滤已拟合样本可提升后续 RL 表现
💡 灵机 AI 深度洞见与核心提炼
Microsoft 与加州大学圣地亚哥分校的论文指出,模型在 SFT 后可能看起来更好,但因 SFT 会抹掉 RL 需要发现的罕见正确行为,反而是更差的 RL 起点。
信源媒体:
X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗
阅读原文出处 ↗
📋 复制分享链接
← 返回大厅