论文 信源:X:DAIR.AI (@dair_ai) · 👁️ 47610 次研读

TailSFT:微软提出过滤式SFT提升RL性能

💡 灵机 AI 深度洞见与核心提炼
微软研究指出标准SFT会持续在模型已拟合的序列上消耗梯度,收窄了后续RL所需的探索分布。TailSFT在训练中过滤这些序列,专注学习数据中欠拟合的尾部。在OLMo-3 7B上,pass@16在编程任务上最高提升16.8个绝对点,数学提升3.1点;经GRPO后最终pass@1最高提升3.9点,部分场景早期奖励提升速度快2.5倍。
信源媒体:X:DAIR.AI (@dair_ai)
访问出处网页 ↗
阅读原文出处 ↗