灵
灵机 FeedHub
🌙
← 返回 AI 资讯大厅
📰 今日早报 ↗
← 返回 AI 资讯大厅
论文
信源:
Epoch AI:研究、数据与评测
· 👁️ 38978 次研读
BBH:大模型推理压力测试基准
💡 灵机 AI 深度洞见与核心提炼
BIG-Bench Hard(BBH)汇集了早期大模型即便扩大规模仍表现不佳的任务,涵盖逻辑演绎、算法推理、因果推断和数学。这些题目被设计为避免捷径,奖励能规划、串联中间步骤并组合运用规则的模型。BBH 常被模型报告用作推理压力测试,其得分提升往往与更好的工具使用、长上下文处理及中间计算整合能力相关。
信源媒体:
Epoch AI:研究、数据与评测
访问出处网页 ↗
阅读原文出处 ↗
📋 复制分享链接
← 返回大厅