灵
灵机 FeedHub
🌙
← 返回 AI 资讯大厅
📰 今日早报 ↗
← 返回 AI 资讯大厅
8月30日 09:00
论文
信源:
X:DAIR.AI (@dair_ai)
· 👁️ 12549 次研读
新基准揭示LLM裁判在真实对话中不可靠
💡 灵机 AI 深度洞见与核心提炼
一项新研究提出含超3万专家生成轮次、3.6万条人工标注的参考完整基准,测试发现经典自动指标与无参考LLM-as-a-judge在专家判断面前均不可靠。其Mixture-of-Judges框架融合多种评估信号,与人类评估的相关性提升约30%。
信源媒体:
X:DAIR.AI (@dair_ai)
访问出处网页 ↗
阅读原文出处 ↗
📋 复制分享链接
← 返回大厅