长程智能体可靠性未至,WeaveBench 最佳仅 41.2%
💡 灵机 AI 深度洞见与核心提炼
长程智能体可靠性尚未随更强模型到来,在 WeaveBench 的 114 项混合 GUI-CLI 任务中,官方报告的最佳通过率仅 41.2%。当前模型能处理局部步骤,但需显式审计状态才能保持全程任务不偏轨。论文提出 LongHorizon-Harness,认为长程可靠性取决于模型外围的 harness 而非模型本身。
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗