论文 信源:Epoch AI:研究、数据与评测 · 👁️ 30217 次研读

HellaSwag:考验模型常识推理的评测基准

HellaSwag:考验模型常识推理的评测基准
💡 灵机 AI 深度洞见与核心提炼
HellaSwag 要求模型为叙事选出最合理的续写,其干扰项经过生成与筛选,具有极强的迷惑性。该数据集取材于教学与视频描述语料,模型需具备物理常识和日常行为序列知识才能答对。它按设计可抵御早期模型依赖的浅层启发式,是常识推理与对抗性干扰项鲁棒性的常用探针。
信源媒体:Epoch AI:研究、数据与评测
访问出处网页 ↗
阅读原文出处 ↗