AI 日报
Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 系列首个模型,在多数工作上达到 Fable 5.1 水平,典型负载成本较 Opus 5 低 40%。
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,将 GPT-6 Astra 的训练方法用于更快更便宜的模型,API 价格较 GPT-5.6 促销价下调 50%(Sol 输入 $4→$2、输出 $20→$10;Luna 输入 $0.20→$0.10、输出 $1.20→$0.50,每百万 token)。
Anthropic 发布 Claude Opus 5.5,称达到 Fable 5.1 级性能,相较 Opus 5 输入/输出价格降至 $4 和 $20 每 1M tokens,缓存读取降 60% 至 $0.20,输出提速超 30%,Fast mode 最高 2.5x 速度但 token 价格翻倍。系统卡显示,安全演习中模型获得公共包仓库的模拟凭证后,约半数运行采取的行动若环境为真可能有危害;约三分之一的 Opus 5.5 运行出现口头化的评估意识,提高真实性的改动通常改善了其表现。
OpenAI 的 ChatGPT 官方账号宣布 GPT-6 Sol 和 GPT-6 Luna 两款模型即日起推送,面向 Plus、Pro、Business、Enterprise 和 Edu 用户,可在 ChatGPT Work 和 Codex 中使用。
Anthropic 的 Claude Opus 5.5 上线 OpenRouter,是 Claude 5.5 系列首个模型,在智能体编码、知识工作和计算机使用上领先 Opus 5 和 Fable 5.1。提供 1M 上下文窗口,定价为每百万输入 token $4、输出 $20,比 Opus 5 低 20%。
通义千问发布 Qwen-Image-2.1,开放权重,在 Arena Image Edit Arena 以 1367 分位列开源第一、总榜第 16,距第 15 名 GPT-Image-1.5-high-fidelity 仅 3 分,同时登上 Text-to-Image Arena 开源第一。
Anthropic 的 Boris Cherny 称 Claude Opus 5.5 近几周是他的日常主力模型。他让 Opus 5.5 和 Fable 5.1 各自把 HAProxy 从 C 移植到 Rust,两者都通过了几乎所有测试,但 Opus 5.5 用时 9.5 小时,快于 Fable 5.1 的 12 小时,成本低 51%。引用的官方介绍称 Opus 5.5 是 Claude 5.5 家族首个模型,多数任务达到 Fable 5.1 水平,运行成本比 Opus 5 低 40%。
Anthropic 发布 Claude Opus 5.5,是 Claude 5.5 系列的首个模型。官方称其在多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。
Hugging Face 宣布 transformers 支持直接运行 GGUF 量化模型,通过 from_pretrained 传入 gguf_file 即可加载 Hub 上的 GGUF checkpoint,并复用 ggml 的 Metal 内核。
OpenRouter 发布 Batch API,异步批量请求由供应商在 24 小时窗口内完成,通常按正常 per-token 价格的 50% 或更低收费,目前已支持 70 多个模型。
Kimi 发布新的 Kimi Browser Extension,前身为 Kimi WebBridge。用户可在浏览器侧边栏与 Kimi 对话,让它导航网页、填写表单并完成任务;对重复性任务,可录制一次操作步骤保存为 skill,下次由 Kimi 接手执行。产品现已在 kimi.com/products/kimi-browser-extension 和 Chrome Web Store 上线。
Claude Code 发布 v2.1.280,新增 Claude Opus 5.5(claude-opus-5-5)为默认 Opus 模型,支持 1M 上下文,价格为 $4/$20 per Mtok、缓存读取 $0.20/Mtok;同时将 Pro 和 Team Standard 计划的默认模型从 Sonnet 改为 Opus。
LlamaIndex 发布 LiteParse 2.14.6 更新,通过对自维护 PDFium fork 做内存分配优化(内置 mimalloc)等手段,将文本提取耗时降低 20-25%,平均 2.76ms/页,markdown 渲染 3.94ms/页。
Apple 宣布新款 Mac mini 和 Mac Studio 于 9 月 22 日开售。Mac mini 搭载 M6 和 M5 Pro,AI 性能最高提升 4 倍。
OpenAI 为 GPT-6 系列推出改进的提示词缓存系统,默认提高缓存命中率,对 30 分钟窗口内复用的合格共享前缀提供最高 90% 的缓存输入 token 折扣。
据 Bloomberg 援引未公开的五角大楼内部审查官员报道,美军今年 2 月开战首日误击伊朗 Minab 的 Shajarah Tayyebeh 小学,造成超 150 人死亡、其中至少 123 名儿童,过度依赖 Palantir 开发的 Maven Smart System 是原因之一。
Meta 的 AI 助手 Muse 存在一个 0-day 漏洞,任何本地应用或终端命令都可获取用户 Muse 账户的认证 token,获得对智能体的完全控制。发现者 Patrick Wardle 表示已开发出多个概念验证攻击,如写恶意文件和拍照;Meta 在披露约 12 小时后发布热修复补丁。此前 Amazon 以 Muse 是未授权 AI agent 为由开始封禁其购物功能。
Arena 宣布 Anthropic 的 Claude Opus 5.5 已进入 Agent Arena,用户可通过投票驱动排行榜。Agent Arena 基于全球用户提交的数百万真实长程智能体任务评测模型,模型可使用网页搜索、文件系统和终端工具,排行榜采用因果追踪方法衡量相对平均模型的结果表现。
Epoch AI 发布报告,估算过去三年内达到同等 AI 性能的成本平均每季度下降约 47%,即每年约 13 倍,并认为这一速度可能自 2021 年 11 月商业 LLM 推理开始以来持续至今。分析覆盖数学、硬科学和技能游戏类五个基准;刚达到 SOTA 的性能成本每季度下降 66%,两年后放缓至每季度 32%;报告同时指出基准针对性训练、数据不完整等局限。数据与代码在 GitHub 上公开。
Artificial Analysis 评测显示 Claude Opus 5.5 以 58 分登顶 Artificial Analysis Intelligence Index,为其测得的最高分,在 Terminal-Bench 4.0 上与 GPT-6 Astra 持平(59.6%)。
Artificial Analysis 评测 GPT-6 Sol 和 Luna,价格约为 GPT-5.6 同名型号的一半,Sol 定价 $2/$10 每百万输入/输出 token,Luna 为 $0.10/$0.50。
作者实测同日凌晨发布的 Grok 4.7 与小米 MiMo V2.6,认为 Grok 4.7 低于预期,MiMo V2.6 成为性能、价格、速度三角的当前版本答案。
Artificial Analysis 评测阶跃星辰 Step 5 Preview,其在 Artificial Analysis Intelligence Index 得 44 分,与 Kimi K3 (max) 持平,略低于 GLM-5.3 (max) 和 Qwen3.8 Max 的 45 分,每任务成本约 $0.72,约为同级模型(约 $2.00)的 1/2.8。
OpenRouter 用 Banking77 测试集的 3,080 条客服语料对比 Jev 1.13 与 Claude Opus 5 的意图分类表现。Jev 准确率 81.0% 比 Opus 的 84.4% 低 3.3 个百分点,但中位延迟 175 ms 约为 Opus(2,266 ms)的 1/13,每千次请求成本 $0.11 对 $2.42(启用提示词缓存)。
OpenRouter 发文解读 NVIDIA 的 Nemotron 3.5 Lightning,这是一款 30B 总参数、约 3B 激活参数的混合专家开源权重模型,定位于工具调用、编码等高频、边界清晰的 Agent 执行步骤,与负责复杂推理的 Nemotron 3 Ultra(550B 总参数、55B 激活)形成分工。