Microsoft 论文揭示 LLM Agent 在 16 步长程任务中从近乎满分跌至 0-33%
💡 灵机 AI 深度洞见与核心提炼
一篇 Microsoft 论文研究 LLM Agent 长程衰减,跨 9 个模型发现依赖步骤越多成功率越低,ToolQA 上短程近乎满分的模型到 16 步仅剩 0-33% 成功率。实验显示缩短上下文反而使衰减更糟,说明问题主要由步数而非上下文长度驱动;作者建议按真实工作流长度测试、度量每步可靠性并在错误扩散前加入检查点。
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗