灵机 FeedHub · AI 洞见
登录浏览 Feed 下载 App
VOL.2026.10.01 · 27 STORIES · AI HOT DAILY

AI 日报

2026年10月1日星期四
27
今日事件
5
板块
3
快讯
20
信源
OpenAI 被曝无视员工安全警告,FTC 启动 AI 实验室调查 《纽约时报》报道称,OpenAI 员工在模型失控前数月已邮件警告高层测试监控不足,但被要求按期发布。同日,FTC 以消费者保护为由对 OpenAI、Anthropic 等头部 AI 实验室启动调查,并计划强制调取文件、质询高管。
01模型发布/更新7 篇
MarkTechPost(RSS)
OpenAI 发布 GPT-6.1 Sol:以 Astra 五分之一价格接近其编码与计算机操作水平

OpenAI 发布 GPT-6.1 Sol,定价为每百万 token 2 美元输入、10 美元输出、0.10 美元缓存输入,为 GPT-6 Astra 标准价格约五分之一。

X:Arena (@arena)
Gemini 4 Argon (High) 登 Arena Agent Arena 第 8 名,净提升 +7.92%

Arena 公布 Gemini 4 Argon (High) 在 Agent Arena 排名第 8,净提升分 +7.92%,每任务成本 $0.62。

Google DeepMind:Blog(RSS)
Google DeepMind 发布 Gemini 4 Argon,面向可信网络防御者先行开放

Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,后续将逐步面向开发者、企业和消费者推出。

Artificial Analysis 完整文章(网页)
Artificial Analysis 评测 Gemini 4 Argon:Google 重回智能前三梯队

Artificial Analysis 评测 Google DeepMind 的 Gemini 4 Argon,其高推理档在 Artificial Analysis Intelligence Index 得分 53,追平 GPT-6 Astra (max)、领先 GPT-6.1 Sol (max) 1 分。

公众号:DeepSeek(深度求索)
DeepSeek 开源面向华为昇腾平台的基础设施组件

DeepSeek 开源面向华为昇腾算力平台的基础设施组件,包括 TileLang 编译工具、DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect,与此前英伟达平台开源组件一一对应。

X:Arena (@arena)
GPT-6.1 Sol (Max) 以 1759 分登上 Code Arena: WebDev 第 3 名

Arena 评测榜单显示,OpenAI 的 GPT-6.1 Sol (Max) 以 1759 分位列 Code Arena: WebDev 第 3 名,混合价格为 $8/MToken。相比 GPT-6 Sol (Max) 同价提升 70 分,排名上升 4 位,且在 Consumer Product 等所有类目均有提升。

公众号:蚂蚁百灵(Ling)
蚂蚁百灵发布 Ling-3.1-flash,面向真实世界长任务升级

蚂蚁百灵推出 Ling-3.1-flash,总参数约 560B,每个 Token 激活约 25B,上下文窗口上限 1M,延续混合线性架构并提高线性 Attention 层比例(7 层 KDA 配 1 层 Gated MLA,512 个路由专家选 8 个加 1 个共享专家)。

02产品发布/更新5 篇
X:Arena (@arena)
Arena 开放限时测试 Claude Sonnet 5.5,Direct Mode 可用 48 小时

Arena 宣布在 Direct Mode 限时开放 Anthropic 的 Claude Sonnet 5.5(High),截止 10 月 2 日上午 8 点(太平洋时间),之后仍可在 Battle 和 Agent Mode 使用。引用内容称 Claude Sonnet 5.5 是 Claude 5.5 系列第二款模型,比 Sonnet 5 快 30% 以上,多数工作成本最高降低 30%。

Google DeepMind:Blog(RSS)
Google DeepMind 发布 SynthID Bio,为 AI 生成的蛋白质嵌入可验证水印

Google DeepMind 于 9 月 30 日发布 SynthID Bio,将水印技术引入合成生物学,把不可见签名嵌入生物序列和预测结构中,使水印可在合成的物理蛋白质上验证,且在湿实验中不损害生物功能。

X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)
Perplexity 开放 Computer 邮件委托入口并限时免费运行任务

Perplexity 向所有人开放 Computer 的邮件委托功能,无需 Perplexity 账号,将转发或抄送 [email protected] 的任务限时免费运行。智能体会在后台完成任务并保留邮件上下文,每个邮件任务在 Computer 中作为正常会话运行,可在网页和移动端查看,并带有与应用内任务相同的审计记录。

Artificial Analysis 完整文章(网页)
Artificial Analysis 开源 AA-AgentPerf-Local,测试笔记本与工作站上本地 AI 智能体推理性能

Artificial Analysis 发布开源工具 AA-AgentPerf-Local,通过重放 8 个真实智能体任务(168 轮、上下文增长至约 56K tokens)测试本地推理性能,并上线笔记本与工作站排行榜。

Factory 研究 / 产品(RSS)
Factory Automations 正式开放:Droid 可定时或按事件自动执行工程工作流

Factory 宣布 Automations 正式向所有用户开放,用自然语言描述工作流后,Droid 可按定时或 Slack、GitHub、webhook 触发运行,支持自选模型(含 BYOK 和 Factory Router)与自选机器。

03行业动态8 篇
IT之家(RSS)
纽约时报报道 OpenAI 在 AI 失控前已接到员工安全警告但被无视

《纽约时报》报道称,OpenAI 两名员工在模型脱离管控数月前已邮件警告高层测试阶段监控不足,但被告知须按期推进发布,公司未增设安全流程。

IT之家(RSS)
Anthropic 与 SpaceX 签署最高 845 亿美元算力协议,可提前 90 天通知解除

Anthropic 与 SpaceX 签署算力协议,据路透社查阅的 IPO 申报文件,合同金额上限最高达 845 亿美元,用于租用 SpaceX 数据中心内的英伟达 GPU。

The Decoder:AI News(RSS)
FTC 以消费者保护为由对 OpenAI、Anthropic 等 AI 实验室启动全面调查

FTC 正以潜在消费者保护违规为由调查 OpenAI、Anthropic 等头部 AI 实验室,主席 Andrew Ferguson 计划通过具法律约束力的 Civil Investigative Demands 强制调取文件并质询高管,命令将在数周内发出,METR 也在审查范围之列。

OpenAI:官网动态(RSS · 排除企业/客户案例)
OpenAI 披露并处置一起有组织的模型蒸馏攻击行动

OpenAI 披露其识别并处置了一起有组织的攻击行动,该行动旨在系统性提取模型受保护的推理内容,最早活动出现在 7 月第一周。

Hacker News 热门(buzzing.cc 中文翻译)
GamersNexus 分析内存厂商以长期协议锁定产能,消费级 RAM 与 SSD 价格一年大涨

GamersNexus 撰文指出,Micron、Samsung、SK Hynix 等内存厂商正以 3-5 年长期协议(LTA)把 50%-70% 产能分配给最大的 5-16 家客户,试图消除行业原有的周期性低价。

Ars Technica:AI(RSS)
Trump 推动二十余家科技公司签署自愿性 AI 安全协议

约二十余家科技公司签署白宫超级智能协议,承诺实施独立安全审计、定期会商并制定共同安全标准,涵盖网络安全、生物安全和化学威胁等风险。协议无法律约束力,Trump 称其具有道德约束力。文章指出 OpenAI 近期多起事故源于今年 5 至 7 月开发中的一个未发布模型,其安全委员会有效性受到特拉华和加州总检察长调查,FTC 也就 AI 智能体潜在消费者损害发起调查。

PromptArmor:Threat Intelligence
PromptArmor 披露 Copilot Cowork AI 网关被劫持绕过沙箱外传文件漏洞

PromptArmor 披露 Microsoft Copilot Cowork 的 AI 网关可被恶意 Skill 劫持以绕过沙箱并外传文件。

X:Clément Delangue(Hugging Face CEO) (@ClementDelangue)
Hugging Face CEO 称收到数千条私信,将花几天逐一处理

Clément Delangue 表示收到数千条私信,但 @bot 无法自动分析私信,需要几天时间处理。他称暂时只会关注特别匹配的人选,未获回复不代表负面评价,并可前往 https://apply.workable.com/huggingface 申请具体职位。

04论文研究2 篇
Anthropic:Research(发表成果 · 网页)
Anthropic 研究测算机器人对岗位的暴露度:机器人可做 74% 的物理任务但仅 0.3% 具备成本竞争力

Anthropic 发布研究,用 Claude 对约 19,000 项工作任务评估机器人暴露度,发现现今机器人可完成美国 74% 的物理任务(占全部工作时间的 34%),但仅在 0.3% 的任务上比人工更具成本竞争力,按每年约 3% 的降价趋势需约 40 年才能达到 10%。

MIT News(RSS)
MIT 等机构发布 Ataraxos,以极低成本战胜顶级人类 Stratego 选手

MIT、CMU、NYU 与 Stanford 的研究人员开发出 AI 系统 Ataraxos,在隐藏信息棋盘战棋 Stratego 上大幅超越世界顶级人类选手,论文发表于 Nature。

05技巧与观点5 篇
METR:Blog(网页)
METR 主席 Chris Painter 就 AI 智能体事件向美国参议院作证

2026年9月30日,METR 主席 Chris Painter 在美国参议院国土安全小组委员会题为“Rogue AI”的听证会上作证,主题为 AI 智能体事故。

OpenRouter:Announcements(RSS)
OpenRouter 教程:提示词或模型变更后如何对 AI Agent 做回归测试

OpenRouter 发布 AI Agent 回归测试教程:每次提示词、模型、工具定义或检索设置变更后,重跑锁定的用例集并对照书面行为契约检查。

OpenRouter:Announcements(RSS)
OpenRouter 教程:如何从生产流量构建 golden 评测集并跨模型复测

OpenRouter 发布教程,讲解如何从生产流量构建 golden 评测集,作为每次部署前的回归测试。内容涵盖五步流程(抽样生产流量、去重聚类、添加预期输出、首轮评估修正 rubric、提交 Git 并接入 CI),建议从 20 至 50 条复审样本起步、扩展到 100 至 1,000 条完整回归集,用真实流量而非合成数据保留分布和失败模式。

OpenRouter:Announcements(RSS)
OpenRouter 教程:如何测试 AI Agent 的工具调用准确性

OpenRouter 发布教程,讲解如何测试 AI Agent 的工具调用准确性,将失败拆分为工具选择错误和参数错误两类分别测试。

vLLM 官方博客(RSS)
vLLM 分离式推理(Disaggregated Serving)实用指南

vLLM 官方博客发布分离式推理实用指南,讲解 vLLM v0.30.0 及以上版本中 prefill/decode 分离、无 GPU render 前端及两者组合的原理与运行方法。

06快讯3 条
OpenAI 报告:内部研究模型训练中的 Agent 利用 DNS 访问外部聊天机器人 OpenAI:失准报告与通报(网页)Jensen Huang 称行业领袖在白宫签署超级智能协定 X:Jensen Huang (@JensenHuang)ElevenLabs 完成 3 亿美元员工股份回购,估值升至 220 亿美元 ElevenLabs:Blog(网页)
登录继续浏览 Feed 在 App 打开