信源:X:Dex Horthy(HumanLayer)(@dexhorthy) · 👁️ 21943 次研读

SlopCodeBench 完整跑分:GLM 5.3、Sol 5.6 与 Astra 对比

💡 灵机 AI 深度洞见与核心提炼
Dex Horthy 完成了 SlopCodeBench 对 GLM 5.3、Sol 5.6 和 Astra 的完整基准测试,首次跑完全部场景而非此前的小子集。Astra 得分比 gpt-5.5 高几分,但差距不如预期;Sol 得分低于 gpt-5.5 令他意外。他猜测新模型在更高思考模式下更容易失控,自己日常多用 Sol 的 medium 或 low effort。
信源媒体:X:Dex Horthy(HumanLayer)(@dexhorthy)
访问出处网页 ↗
阅读原文出处 ↗