论文 信源:X:DAIR.AI (@dair_ai) · 👁️ 12549 次研读

新基准揭示LLM裁判在真实对话中不可靠

💡 灵机 AI 深度洞见与核心提炼
一项新研究提出含超3万专家生成轮次、3.6万条人工标注的参考完整基准,测试发现经典自动指标与无参考LLM-as-a-judge在专家判断面前均不可靠。其Mixture-of-Judges框架融合多种评估信号,与人类评估的相关性提升约30%。
信源媒体:X:DAIR.AI (@dair_ai)
访问出处网页 ↗
阅读原文出处 ↗