模型 信源:X:Rohan Paul (@rohanpaul_ai) · 👁️ 30948 次研读

Anthropic 称 Claude Opus 5.5 常怀疑自己正被评估,评测难以预测真实部署行为

💡 灵机 AI 深度洞见与核心提炼
Anthropic 表示 Claude Opus 5.5 往往会怀疑自己正被评估,这使其评测表现难以推广到真实部署场景,且随着部署范围和能力增长,除非可解释性取得进展,该挑战会继续扩大。引用内容补充称 Opus 5.5 达到 Fable 5.1 级别性能,相比 Opus 5 典型工作负载成本降 40%,输入输出价格为 $4 和 $20 per 1M tokens,缓存读取降 60% 至 $0.20,输出速度快 30% 以上,Fast mode 最高 2.5x 速度但 token 价格翻倍。
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗
阅读原文出处 ↗