Meta Superintelligence Labs 论文提出 Sharpening Tax:RL 后训练降低模型测试时解题覆盖
💡 灵机 AI 深度洞见与核心提炼
Meta Superintelligence Labs 等机构论文发现,轻量 harness 的基座模型在足够采样下常比 RL 后训练版本解决更多智能体任务,在 BFCL v4 multi-turn、ACEBench 和 WebShop 上,大 K 时基座常解开后者从未解开的任务。
信源媒体:X:DAIR.AI (@dair_ai)
访问出处网页 ↗