灵
灵机 FeedHub
🌙
← 返回 AI 资讯大厅
📰 今日早报 ↗
← 返回 AI 资讯大厅
9月12日 03:13
信源:
X:Thariq (@trq212)
· 👁️ 31421 次研读
基准测试隐藏测试过严问题
💡 灵机 AI 深度洞见与核心提炼
如今仅凭通过/失败分数基本无法解读评测结果 我在基准测试中看到的许多失败,都源于过于严格的隐藏测试,某些情况下模型的答案比预期的评测结果更合理
信源媒体:
X:Thariq (@trq212)
访问出处网页 ↗
阅读原文出处 ↗
📋 复制分享链接
← 返回大厅