GPT-6 Astra 基准测试对比 GPT-5.6 Sol 与 Claude Fable 5.1,ARC-AGI-3 从 7.8% 升至 98.6%
💡 灵机 AI 深度洞见与核心提炼
作者转发一张完整基准对比表,称 OpenAI 新发布的 GPT-6 Astra 在多项评测上明显领先。ARC-AGI-3 从 GPT-5.6 Sol 的 7.8% 升至 98.6%,FrontierMath Tier 4 (v2) 为 97.6%,SRE-Bench 为 99.2%,ExploitBench 为 100.0%;作者称其压过了新发布的 Claude Fable 5.1。
信源媒体:X:Kim (@kimmonismus)
访问出处网页 ↗