耶鲁等机构论文:物理基准评测质量差,GPT-5.6-Sol 的 HLE-Physics 修正后从 47.3% 升至 78.7%
💡 灵机 AI 深度洞见与核心提炼
耶鲁大学联合多所机构论文审计 6 个主流物理基准后发现,模型被误判的失败大多源于糟糕题目、错误参考答案和脆弱的评分器。在 4 个被审计基准子集的 250 个被拒案例中,仅 12 个是模型真实错误;GPT-5.6-Sol 经专家复评后 HLE-Physics 分数从 47.3% 升至 78.7%。
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗