Amazon 论文 GAUGE 探讨何时不能信任 LLM judge 评估任务型智能体
💡 灵机 AI 深度洞见与核心提炼
Amazon 发布 GAUGE 论文,研究 LLM 模拟用户加 LLM judge 这一评估关卡何时不可信。研究发现满意度不等于任务成功,57.5% 被评为满意的对话实际未完成客户任务;在能力相近的智能体之间,该关卡有 31% 的配对选出奖励更低的一方,而差距大的配对中这一比例不足 1%。
信源媒体:X:DAIR.AI (@dair_ai)
访问出处网页 ↗