论文 信源:X:Rohan Paul (@rohanpaul_ai) · 👁️ 49786 次研读

长程任务基准揭示前沿模型平均通过率仅6.4%

💡 灵机 AI 深度洞见与核心提炼
Long-Horizon-Terminal-Bench 基准测试显示,17 个前沿模型在 46 个长程终端任务上平均通过率仅 6.4%,严格全完成评分下 10 个模型零通过。失败运行中 79% 因超时终止,最佳模型也仅达 28.3%。模型能执行局部合理步骤,却无法将数百步转化为最终成果,印证 Chamath 关于长程任务"根本行不通"的论断。
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗
阅读原文出处 ↗