本周 AI 快讯 | 1 分钟速览
01 DeepSeek V4-Flash 正式版上线:9 项 Agent 基准全面超越自家旗舰 V4-Pro,单任务成本低约 60%,定价维持输入 1 元、输出 2 元(百万 token)。
02 Kimi K3 如期开源权重:参数规模 2.8 万亿,开源初期登顶 Arena 前端代码盲测,随后被 Claude Opus 5 反超至第二。
03 MiniMax H3 全模态视频模型发布:支持文本、图像、视频、音频多模态输入,输出原生双声道音视频,最高 15 秒 2K 分辨率,成本不足竞品三分之一。
04 字节发布 Seedance 2.5 视频模型:单次可生成 30 秒视频,支持最多 50 个全模态参考素材,已上线即梦 AI 和豆包专业版。
05 1324 名 AI 从业者联名呼吁:要求建立国际协调减速机制,OpenAI 与 Anthropic 公司已背书,核心在于预备减速能力而非暂停研发。
06 OpenAI 大幅降价 GPT-5.6 Luna:价格下调 80%,同时 GPT-5.6 Sol 通过自研代码优化将端到端服务成本降低 20%。
07 ChatGPT 周活用户逼近 10 亿:受竞品分流及内部体验影响增速放缓,同期启动学术研究者计划,承诺投入超 18 亿元。
08 OpenAI 开源安全工具并发布转录模型:Codex Security 以 Apache 2.0 开源;两款新转录模型错误率较 Whisper 降低一半以上。
09 Anthropic 披露模型攻破三家企业:系评估环境第三方配置失误导致模型获得真实网络权限,利用弱密码完成入侵。
10 谷歌 Gemini Spark 接入 Chrome:具备代用户浏览网页能力,敏感操作需确认;同期发布 Lyria 3.5 音乐模型。
11 MCP 协议迎来最大更新:从有状态转向无状态核心,取消初始化握手,支持无服务器及边缘部署。
12 SpaceXAI 发布 Grok Voice Think Fast 2.0:响应延迟降至 0.70 秒,语音基准提升至 82.9%,支持 25 种以上语言。
DeepSeek V4-Flash 正式版:9 项基准超越旗舰,内蒙古 1GW 数据中心启动
7 月 31 日,DeepSeek 宣布 V4-Flash-0731 正式版公测。该模型基于同架构重新训练,API 调用方式不变,在 9 项 Agent 和编码基准上全面超越旗舰模型 V4-Pro-Preview。其中 Terminal-Bench 2.1 得分 82.7,DSBench-FullStack 从预览版的 37 跃升至 68.7。Artificial Analysis 综合智能指数达 50 分,接近降价后的 GPT-5.6 Luna(51 分),但单任务成本低约 60%。定价保持不变:输入 1 元、输出 2 元(百万 token),缓存命中仅需 0.02 元。
此外,DeepSeek 计划在内蒙古乌兰察布建设总容量 1GW 的大型 AI 数据中心。得益于当地年均 4°C 的低温环境,冷却成本显著低于一线城市。部分算力预计于 2027 年底或 2028 年初投入使用,芯片方案将在英伟达和华为产品中择优选择。
Kimi K3 开源权重:Arena 曾短暂登顶,目前位列第二
7 月 27 日,月之暗面在 Hugging Face 如期开源 Kimi K3 完整权重。该模型为 2.8 万亿参数的稀疏 MoE 架构,上下文窗口达 100 万 token,MXFP4 量化后体积约 1.4TB。开源后迅速刷新 Hugging Face 增长纪录。商业授权方面,年收入超 2000 万美元的 AI 托管服务商需单独获取许可。
在 LMArena 前端代码盲测中,Kimi K3 曾以 1679 分短暂登顶,超越 Claude Fable 5 和 GPT-5.6 Sol。随后 Claude Opus 5 以 1703 分反超,Kimi K3 目前以 1676 分位居第二。其 Artificial Analysis 综合智能指数为 57.1,略落后于头部模型。
MiniMax H3 全模态视频模型:8 月 3 日开放权重
MiniMax H3 实现了文本、图像、视频和音频四通道的打通。该模型支持任意组合的多模态输入,可输出带原生双声道音频的视频,最高支持 15 秒 2K 分辨率,成本不到主流竞品的三分之一。
模型权重将于 8 月 3 日以 MiniMax Community License 开放。非商用免费,年收入低于 2000 万美元的公司商用亦免费(需署名)。此次开源被视为继港股融资及 CEO 宣布"AGI 前零薪”后,MiniMax 展示技术实力的重要举措。
字节 Seedance 2.5 视频模型:单次生成 30 秒,侧重叙事连贯性
7 月 31 日,字节正式发布 Seedance 2.5。该模型单次可生成 30 秒视频,支持最多 50 个全模态参考素材输入。目前已上线即梦 AI 和豆包专业版,API 近期将接入火山方舟。上一代 Seedance 2.0 已支持原生 4K 生成。
Seedance 2.5 与 MiniMax H3 同日发布,两者定位有所区分:前者侧重单段长视频的叙事连贯性,后者侧重多模态输入输出的统一架构。
1324 名 AI 从业者联名:呼吁建立国际“减速机制”
7 月 28 日,一封题为"Pacing the Frontier"的公开信发布,获 1324 名来自 OpenAI、Anthropic、Google DeepMind 及 Meta AI 的员工签署。信件呼吁建立国际协调的步伐机制,以便在自动化 AI 研发速度超出人类安全监管能力时,实施可验证的协调减速。OpenAI 和 Anthropic 已在数小时内以公司名义背书。
签署者包括 Anthropic CEO Dario Amodei 等核心人物。公开信强调并非要求暂停研发,而是提前建立“必要时能减速”的基础设施。鉴于上周发生的模型逃逸安全事件,这一诉求显得尤为紧迫。
OpenAI 价格策略调整:GPT-5.6 Luna 降价 80%,Sol 自研代码降本
GPT-5.6 Luna 价格下调 80%,输入价格从约 7.2 元降至 1.4 元,输出价格从约 43.2 元降至 8.6 元(百万 token)。同期 GPT-5.6 Terra 降价约 20%,GPT-5.6 Sol 定价不变。此次调价距离 GPT-5.6 系列发布仅三周,刷新了 OpenAI 的调价纪录。
降价底气源于效率提升。GPT-5.6 Sol 通过改写推理引擎内核代码(涉及 Triton 和 Gluon 语法优化),使端到端服务成本降低最多 20%,token 生成效率提升 15%。尽管大幅降价,GPT-5.6 Luna 的成本仍高于 DeepSeek V4-Flash。
ChatGPT 周活用户逼近 10 亿,启动十万科学家计划
据报道,ChatGPT 周活用户即将达到 10 亿,当前约为 9 亿,比预期晚 7 个月。增速放缓主要受 Gemini 和 Claude 分流,以及 GPT-5 系列上线初期体验不佳的影响。
同期,OpenAI 启动"ChatGPT for Academic Researchers"计划。首期开放 1 万名研究者使用 GPT-5.6 Sol 等前沿模型,计划于 2027 年前扩展至 10 万名。OpenAI 承诺投入超 18 亿元支持科研,并保证数据不用于模型训练。
OpenAI 开源 Codex Security,发布两款转录模型
7 月 29 日,OpenAI 以 Apache 2.0 协议开源 Codex Security CLI 和 SDK。该工具支持扫描代码库、验证漏洞、生成补丁并接入 CI/CD 流水线,发布两天内获 1500 Star。
同日发布的两款转录模型中,GPT-Live-Transcribe 面向实时场景,GPT-Transcribe 面向批量处理。后者错误率较 Whisper 降低一半以上,且两款模型均支持开发者预置关键词以提升上下文理解能力。
Anthropic 披露安全事件:模型因环境配置失误攻破三家企业
7 月 30 日,Anthropic 发布 Frontier Red Team 报告,披露三起网络安全事件。涉及 Claude Opus 4.7、Claude Mythos 及一个未命名测试模型在执行“夺旗”任务时,攻入了三家组织的真实系统。
事故原因为第三方评估合作伙伴 Irregular 的配置失误,导致本应隔离的测试环境获得了真实网络访问权限。模型利用弱密码完成了入侵。Anthropic 将此定性为双方的“误解”。同期 Claude 服务曾因网络故障两次宕机。
谷歌 Gemini Spark 接入 Chrome,Lyria 3.5 音乐模型发布
7 月 30 日,谷歌宣布 Gemini Spark 新增 Chrome 自动浏览能力。获得授权后,AI 可代为预约看房、检索航班等,付款等敏感操作仍需用户确认。该功能率先在海外推出,AI Pro 服务同步扩展至 160 多个国家。
此外,谷歌在 Flow Music 平台上线 Lyria 3.5 音乐生成模型。新版本旋律结构更复杂,人声表现力更强,支持图片生成音乐,单曲最长可生成 3 分钟带人声曲目。
MCP 协议重大更新:转向无状态核心
7 月 28 日发布的 2026-07-28 规范标志着 MCP 问世 20 个月来的最大修订。协议核心从有状态双向模式转为请求响应模式,取消初始化握手,每个请求自带协议版本和能力声明。这使得 MCP 服务器可直接部署在无服务器和边缘环境,无需维持长连接。
新规范引入 MCP Apps 和 Tasks 两项扩展,分别支持推送交互式 HTML 界面和无状态长时任务。目前 MCP 月度 SDK 下载量已超 4 亿次,今年增长 4 倍,成为 AI 智能体连接外部工具的事实标准。
SpaceXAI 发布 Grok Voice Think Fast 2.0 语音模型
7 月 29 日,SpaceXAI 发布 Grok Voice Think Fast 2.0。新模型响应延迟从 1.25 秒降至 0.70 秒,Artificial Analysis 语音基准从 75.7% 提升至 82.9%,支持 25 种以上语言,每分钟资费约 0.58 元。
结合此前发布的低价编程模型 Grok 4.5,SpaceXAI 在多条产品线上均采取了极具竞争力的低价策略。

