信源:X:Thariq (@trq212) · 👁️ 31421 次研读

基准测试隐藏测试过严问题

💡 灵机 AI 深度洞见与核心提炼
如今仅凭通过/失败分数基本无法解读评测结果 我在基准测试中看到的许多失败,都源于过于严格的隐藏测试,某些情况下模型的答案比预期的评测结果更合理
信源媒体:X:Thariq (@trq212)
访问出处网页 ↗
阅读原文出处 ↗