本周 AI 快讯 | 1 分钟速览
01 DeepSeek 发布 V4.1 Flash:三模式合一,缓存命中降价 60%,性能全面超越 V4 Pro。
02 月之暗面 ARR 破 10 亿美元:K2.8 Preview 上线 Kimi Code,综合性能接近 K3。
03 面壁智能开源 MiniCPM5-2B:4B 以下参数模型 Agent 能力全球第一。
04 OpenAI claimed 解决纳维 - 斯托克斯难题部分命题:数学家 Buckmaster 质疑数据泄露争抢优先权。
05 25 位菲尔兹奖得主联名警告:AI 与数学研究严重错位,忽视概念理解侵蚀学术根基。
06 GPT-6 Astra 需求过载:暂停 Pro 订阅,FrontierMath 题集宣告饱和。
07 OpenAI 密集发布新品:Agents API 公测,GPT-Live-1 语音及 Images 2.5 上线。
08 Meta 发布个人智能体 Muse:独立虚拟机隔离运行,冲上美区应用榜第二。
09 Cognition 发布 SWE-2:基于 Kimi K3 后训练,成本比 Claude Fable 5.1 低 64%。
10 Suno 获华纳等授权发布 v6:AI 音乐版权战达成和解,支持自然语言编辑。
11 谷歌 Gemini 推出 Windows 原生应用:支持全局唤起,每日简报向免费用户开放。
12 Cursor Projects 开启公测:持久化协调智能体实现跨任务并行运行。
13 苹果发布折叠屏 iPhone Duo:Siri AI 重构,AFM 3 模型家族首秀。
DeepSeek 发布 V4.1 Flash,三模式合一降价 60%
9 月 10 日,DeepSeek 正式发布 V4.1 Flash 模型,将原有的快速、专家、识图三大模式合并为统一智能模型,系统可根据任务自动适配。该模型总参数量 552B,采用 MoE 架构,输入阶段仅激活 8B 参数,解码阶段激活 16B,原生支持视觉理解和 100 万 token 上下文。
在定价方面,空闲时段缓存命中价格降至 0.02 元/百万 token,较此前降低 60%;缓存未命中为 1 元,输出为 4 元。高峰时段价格翻倍。DeepSeek 表示,V4.1 Flash 在性能、速度和费用三项指标上已全面超越 V4 Pro。应广大开发者要求,原定于 9 月 14 日下线的 V4 Pro API 服务将继续保留,计费方式不变。此外,DeepSeek 开始灰度测试 AI 语音对话功能,编程工具 DeepSeek Harness 更新至 0.1.5 版本,新增文件上传和侧边栏预览功能。
月之暗面 ARR 突破 10 亿美元,K2.8 Preview 全量上线 Kimi Code
据报道,月之暗面 8 月年度经常性收入(ARR)已突破 10 亿美元。自 3 月首次站上 1 亿美元以来,该公司用时 5 个月实现 10 倍增长,其中 6 月至 8 月两个月内从 3 亿美元跃升至 10 亿美元。核心驱动力为 7 月发布的 Kimi K3 模型,其性能逼近海外顶尖竞品且 API 定价极具竞争力。公司年底目标定为 20 亿美元。
9 月 11 日,Kimi K2.8 Preview 全量上线 Kimi Code,模型标识符保持 kimi-for-coding 不变,客户端及第三方工具无需修改配置。官方称其综合性能已接近 K3。关于上市传闻,知情人士否认了筹备沪港双重上市的消息,但确认月之暗面已于 9 月初以保密形式向港交所递交了 A1 文件。
面壁智能开源 MiniCPM5-2B,4B 以下 Agent 能力全球第一
9 月 9 日,面壁智能联合 OpenBMB 开源端侧模型 MiniCPM5-2B。该模型参数量 2.5B,在 Artificial Analysis 智能指数中取得 23 分,位列全球 4B 以下开源模型第一。其中 Agent 能力得分 20 分,远超同级对手的 2 分。在 34 项基准测试中,其平均得分 53.9,优于参数量近两倍的 Qwen3.5-4B(51.1 分)。
MiniCPM5-2B 采用 42 层标准 Llama 架构,原生支持 128K token 上下文、混合思维和工具调用,权重以 Apache 2.0 许可开源。面壁智能将其定位为端侧通用 Agent 雏形,支持深度搜索和代码生成等任务,训练数据亦同步开源。
OpenAI 声称解出 Navier-Stokes 千禧年难题,数学家争优先权
9 月 8 日,OpenAI 宣布其内部系统解出了悬而未决超 80 年的 Navier-Stokes 千禧年难题部分命题(即初始光滑静止流体可在有限时间内产生奇点)。此次求解动用约 1 万个并发智能体,运行 88 小时,产出约 1300 亿输出 token。随后 GPT-6 Astra 用时 17 小时在 Lean 中完成形式化验证。OpenAI 声明不申领 100 万美元奖金,成果尚未经过同行评议。
数学家 Tristan Buckmaster 在 OpenAI 发布前 12 小时公开声明,称其与合作者 Levent Alpöge 在 Euler 方程上的相关进展被泄露给 OpenAI,可能影响了解题策略。OpenAI 研究员 Sébastien Bubeck 予以否认,称双方证明方法完全不同。Buckmaster 还指控 Bubeck 曾施压要求其去除合作者署名,并威胁其学术生涯。目前双方说法均未获独立验证。
25 位菲尔兹奖得主联名警告 AI 与数学「严重错位」
陶哲轩、邓煜、Peter Scholze 等 25 位菲尔兹奖得主于 9 月 11 日联合发表声明,涵盖 1978 年至 2026 年各届获奖者。声明指出,AI 公司正以超越同行评议的速度批量产出数学证明,对解题速度的追求正在取代对概念理解的深耕。数学家们警告,未经归属的快速证明绕过了完整的评审与传播流程,可能破坏孕育新思想的学术土壤。
该声明发表于 OpenAI 宣布 Navier-Stokes 成果三天后。声明特别强调归属问题,指出 AI 系统可能在训练中接触过人类未发表工作,但缺乏追踪机制。签署者之一、2026 年菲尔兹奖得主邓煜在社交媒体调侃,若 AI 证完所有定理,他将退休创作小说。
GPT-6 Astra 需求超载暂停 Pro 订阅,FrontierMath 宣告饱和
GPT-6 Astra 发布八天后,OpenAI 于 9 月 11 日宣布暂停 200 美元 Pro 订阅的新增注册,以保障现有用户体验,已订阅用户及 API 服务不受影响。同日,Epoch AI 宣布 FrontierMath Tier 4 数学题集已饱和,GPT-6 Astra 以 97.6% 的得分攻克最后一道未解题目。该题集通过率在 14 个月内从 5% 飙升至 98%。
OpenAI 同时宣布达成「自动化研究实习生」里程碑,研究员日均调用相当于 3.1 个工作日的智能体推理算力。然而,GPT-6 Astra 的评测数据引发质疑:据报道,OpenAI 曾修改多项基准测试指标,包括幻觉率和网络安全评分。ARC-AGI-3 的双口径成绩差异(62.7% 与 99.9%)也引发了关于是否使用专用适配工具链的讨论。
OpenAI 密集发布 Agents API、GPT-Live-1 和 Images 2.5
9 月 10 日,Agents API 进入公测,开发者可在 OpenAI 托管沙盒或自有基础设施中构建智能体,OpenAI 负责会话编排与故障恢复,不额外收取服务费。GPT-Live-1 实时语音模型上线 API,定价 0.05 美元/分钟(不含后端推理),支持全双工对话、打断处理及电话语音智能体。
此前发布的 ChatGPT Images 2.5 是当前最先进的图像生成模型,延迟降低 50%,新增 Sketch 草图参考功能。API 端同步上线 Flare 和 Sunburst 两款新模型。此外,OpenAI 推出金融服务版 ChatGPT,内置 Daloopa、PitchBook 等金融数据源,Morgan Stanley 和 Evercore 为首批合作方。
Meta 发布个人 AI 智能体 Muse,独立虚拟机隔离运行
9 月 8 日,Meta 推出个人 AI 智能体 Muse。每个用户的 Muse 运行在独立的 Secure VM 中,自带浏览器,可代为收发邮件、预订行程、填写表单及比价。用户凭据加密存储,Muse 无法查看,敏感操作由独立的 Sentinel 智能体审批。
Muse 分为免费、20 美元/月和 100 美元/月三档,无广告,目前已上线美区 iOS、Android 及网页端,并迅速升至美区应用榜第二。Meta 计划年底前推出 Confidential VM 版本,届时连 Meta 自身也无法查看虚拟机内容。Muse 与 Meta AI 聊天机器人分开运营,是 Meta 在消费级 AI 智能体领域的首个独立产品。
Cognition 发布 SWE-2,基于 Kimi K3 后训练成本低 64%
9 月 10 日,Cognition 发布编程模型 SWE-2,基于月之暗面的 Kimi K3(2.8T 参数)进行后训练。该模型在 Terminal-Bench 2.1 中得分 92.8%,居所有模型之首。在 FrontierCode 1.1 上得分为 50.0%,DeepSWE 1.1 上得分为 73.0%。Cognition 宣称其成本比 Claude Fable 5.1 低 64%。
SWE-2 是首个支持推理强度分级的 SWE 系列模型,通过单次强化学习覆盖低、中、高三个推理档位,现已部署至 Devin Desktop 和 CLI 中。Cognition 选择在国产开源基座上进行前沿后训练,这种组合在编程 AI 领域较为罕见。
Suno 携华纳和 BMG 授权发布 v6,AI 音乐版权战收兵
继 2025 年华纳音乐起诉 Suno 侵权并和解后,双方联手训练新模型。9 月 9 日,Suno 发布 v6、v6-wild 和 v6-mini 三款新模型,首次使用华纳、BMG 和 Believe 三家唱片公司的授权数据训练。v6 为旗舰模型,v6-wild 面向实验性创作,v6-mini 对所有用户免费,前两者需 Pro 或 Premier 订阅。
v6 系列新增自然语言编辑功能,支持通过文字描述修改歌曲段落或歌词,并支持多首歌曲混音。输入方式扩展至音频、图像和视频。Suno 与唱片公司之间设有营收分成安排,具体条款未披露。
谷歌 Gemini 推出 Windows 原生桌面应用,每日简报向免费用户开放
9 月 10 日,谷歌发布 Gemini Windows 原生桌面应用,支持 Windows 10/11 及 x64/ARM64 设备。用户可通过 Alt+ 空格快捷键全局唤起,在不切换窗口的情况下核查文档、搜索信息或生成内容,也可将多步任务交给 Gemini Spark 自主完成。
同周,谷歌将 Gemini 每日简报功能向免费用户开放。该功能可自动汇总待办事项和未回复邮件,目前率先面向美区用户,未来将覆盖更多地区。
Cursor Projects 开启公测,持久化协调智能体跨任务运行
9 月 10 日,Cursor Projects 功能开启公测,适用于跨多个 PR 的特性开发、代码迁移或长期项目。该功能引入「协调者」角色,负责规划任务、委派子智能体执行并验收结果,其本身不编写代码。协调者运行在云端,确保开发者离线后工作仍能继续。
Projects 旨在解决超出单次对话范围的长期工作需求。用户在左侧导航栏启动 Project 并描述目标后,协调者将自动拆解任务并分配执行。
苹果发布折叠屏 iPhone Duo,Siri AI 重做与 AFM 3 首秀
9 月 9 日,苹果秋季发布会推出折叠屏 iPhone Duo,起售价 1999 美元,将于 10 月 16 日预订,23 日发售。同场发布的 iPhone 18 Pro 搭载 A20 Pro 芯片及 4800 万像素可变光圈主摄。发布会重点展示了基于大语言模型重构的 Siri AI,分为端侧和云端两层。
苹果同步发布 AFM 3 模型家族。其中 AFM 3 Core Advanced 拥有 20B 参数,采用闪存加 DRAM 混合加载架构,将完整参数存于闪存,仅按需调入专家模块,使手机能运行超大参数模型。云端版 AFM 3 Cloud Pro 运行于谷歌云英伟达 GPU,并延伸了苹果 Private Cloud Compute 的隐私保护。iOS 27 将于 9 月 14 日推送,Siri AI 将以英文 Beta 形式首发。

