论文:LLM 排行榜名次很大程度由评测配置决定,gemma4-31b 得分可在 31% 到 89% 间波动
💡 灵机 AI 深度洞见与核心提炼
一篇论文在固定 12 个模型和 3,679 个问题的前提下,只改变提示词格式、选项顺序、打分方式等常规评测设置,结果排名大幅波动。gemma4-31b 得分在 31% 到 89% 之间,12 个模型中有 4 个至少在一种有效设置下排到第一;相邻模型平均 95.7% 的差距来自评测设置改变时会翻转答案的题目,最大不稳定来源是打分方式,即生成答案还是选最高似然选项。
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗