信源:X:Rohan Paul (@rohanpaul_ai) · 👁️ 47445 次研读

研究:LLM 高分却缺基础,Qwen3-80B 一致性仅 48%

💡 灵机 AI 深度洞见与核心提炼
一项研究对比 8 个 LLM 与超 18000 名人类学习者,发现人类答对难题时 72.7% 也能答对其所有前置基础题,整体得分 79.6%;Qwen3-80B-Instruct 得分更高达 92.5%,但仅 48.16% 的正确答案满足同样的前置一致性。论文指出高准确率可能掩盖知识断层,建议用难易关联题组而非孤立基准题评估推理模型。
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗
阅读原文出处 ↗