论文 信源:Epoch AI:研究、数据与评测 · 👁️ 17315 次研读

MMLU:衡量大模型通用知识的多学科基准

MMLU:衡量大模型通用知识的多学科基准
💡 灵机 AI 深度洞见与核心提炼
MMLU 是由四选一题目构成的基准,覆盖人文学科、STEM、社会科学和专业领域,许多题目需要回忆领域事实、应用定义或在时间限制下做轻度推理。凭借广度与稳定性,MMLU 常被模型报告用作通用知识的核心指标,其按学科划分的子分数可反映模型在不同领域的强弱。
信源媒体:Epoch AI:研究、数据与评测
访问出处网页 ↗
阅读原文出处 ↗