论文 信源:X:Elvis Saravia (@omarsar0, DAIR.AI) · 👁️ 48067 次研读

Meta Superintelligence Labs 提出 Sharpening Tax:RL 后训练提升 pass@1 但损失测试时扩展性

💡 灵机 AI 深度洞见与核心提炼
Meta Superintelligence Labs 等发表论文,发现带轻量推理框架的预训练 LLM 在足够采样预算下解决智能体任务的覆盖面常超过 RL 后训练版本,如 BFCL v4 多轮、ACEBench 和 WebShop 上后训练模型赢在 pass@1,但基座模型在大 K 下常解出后训练模型从未解出的任务。研究将这一测试时扩展性损失命名为 Sharpening Tax,在 14 个基座/后训练配对、4 个模型族、3 个基准共 42 对中大多成立,随模型规模增大,可由少量 rollout 估计;提出的 PTGS 在 RL 中按提示估计难度设置采样温度,税更小且提升 pass@1。
信源媒体:X:Elvis Saravia (@omarsar0, DAIR.AI)
访问出处网页 ↗
阅读原文出处 ↗