微软 Taste-Bench 测智能体决策品味
💡 灵机 AI 深度洞见与核心提炼
微软等机构提出 Taste-Bench,衡量前沿智能体在长任务决策点能否选对方向,最佳模型正确率仅 59.7%。该基准从工程与研究运行中的并行尝试和绕路自动挖掘分叉点,越依赖轨迹后段证据的分叉越难,加大推理预算也无法提升准确率。作者将教师模型对结果的判断蒸馏进学生模型,在留出的 SWE-bench Pro 任务上提升了端到端成功率。
信源媒体:X:Elvis Saravia (@omarsar0, DAIR.AI)
访问出处网页 ↗