信源:X:Nathan Lambert (@natolambert) · 👁️ 24326 次研读

Olmo 3 上的后训练新工作

💡 灵机 AI 深度洞见与核心提炼
基于 Olmo 3 的酷炫后训练工作 :) RL 成本高昂,所以每一步都应算数。约 1 年前,我们展示了 xent SFT 并非为 RL 做准备的最佳方式(https://arxiv.org/abs/2510.15020)。现在我们提出 TailSFT(https://arxiv.org/abs/2608.25756),一种轻量且有原则的方法,可直接提升覆盖度并获得更好的 RL 后性能。
信源媒体:X:Nathan Lambert (@natolambert)
访问出处网页 ↗
阅读原文出处 ↗