灵
灵机 FeedHub
🌙
← 返回 AI 资讯大厅
📰 今日早报 ↗
← 返回 AI 资讯大厅
论文
信源:
Epoch AI:研究、数据与评测
· 👁️ 38160 次研读
LiveBench:跨推理、编程、数学等类别的模型评测基准
💡 灵机 AI 深度洞见与核心提炼
LiveBench 聚合了推理、编程、数学、数据分析和语言等类别的任务,每次发布固定任务集与评判标准,从而支持同类对比并反映用户需求与提示词风格的变化。结果通常汇总为类别分数和总分。由于任务多样且频繁更新,LiveBench 适合长期追踪模型的实际效用与性能回退风险。
信源媒体:
Epoch AI:研究、数据与评测
访问出处网页 ↗
阅读原文出处 ↗
📋 复制分享链接
← 返回大厅