论文 信源:X:DAIR.AI (@dair_ai) · 👁️ 40036 次研读

Google DeepMind 发布 XYEval,测试智能体是否盲从用户的错误建议

💡 灵机 AI 深度洞见与核心提炼
Google DeepMind 发布 XYEval 论文,在 tau2-bench、SWE-bench、Terminal-Bench、HLE 和 MCP-Atlas 任务中加入一条自信但误导的用户建议,任务与正确解法不变。
信源媒体:X:DAIR.AI (@dair_ai)
访问出处网页 ↗
阅读原文出处 ↗