论文 信源:X:Rohan Paul (@rohanpaul_ai) · 👁️ 37823 次研读

DuMateBench 论文:Agent 框架差异可使同一模型表现相差 27.27 个百分点

💡 灵机 AI 深度洞见与核心提炼
论文《DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows》提出基于 200 个真实用户会话重建任务的基准,涵盖编码、网络调研、文档处理和内容创作,并加入缺失依赖、不稳定网络和干扰文件等环境复杂度。
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗
阅读原文出处 ↗