灵
灵机 FeedHub
🌙
← 返回 AI 资讯大厅
📰 今日早报 ↗
← 返回 AI 资讯大厅
8月29日 06:18
论文
信源:
X:Rohan Paul (@rohanpaul_ai)
· 👁️ 37515 次研读
长时程AI任务评测:顶尖模型仅达人类27.3%
💡 灵机 AI 深度洞见与核心提炼
一项研究对8款领先模型进行为期一年的长时程任务测试,包括GPT-5.6 Sol和Claude Opus 4.8,其性能相较人类大幅下降。最佳配置Qwen3.7-Max with Hermes最终仅获得人类平均收益的27.3%,凸显长时程执行可靠性严重不足。
信源媒体:
X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗
阅读原文出处 ↗
📋 复制分享链接
← 返回大厅