论文 信源:X:Kim (@kimmonismus) · 👁️ 36893 次研读

Martian AI Frontier 推出模型可靠性榜单,跨模型路由错误减少 46%-54%

💡 灵机 AI 深度洞见与核心提炼
Martian 推出 AI Frontier 可靠性榜单,每个数据点运行 10 次,覆盖 16 个基准(含 TerminalBench、LiveCodeBench 等),当前 Qwen3.7 Max 可靠性 96.1%,Claude Opus 4.6 为 94.4%,GPT-5.5 为 93.5%。
信源媒体:X:Kim (@kimmonismus)
访问出处网页 ↗
阅读原文出处 ↗