2026(09.14-09.20)全球AI与数据领域十大事件
9月14日:全国网络安全标准化技术委员会发布《人工智能安全治理框架3.0》
✔事件:在2026年国家网络安全宣传周开幕式上,全国网络安全标准化技术委员会发布《人工智能安全治理框架3.0》。该框架在国家互联网信息办公室指导下,由中国网络空间研究院、国家互联网信息办公室数据与技术保障中心等专业机构、科研院所与企业共同研究编制。框架接续前两版的核心逻辑,仍以"风险分类、技术应对、综合治理"三条主线组织内容,但根据过去一年模型能力与产业形态的变化,重新梳理了风险分类,并调整了技术应对与综合治理的具体措施。官方表述强调以人为本、向上向善,同时把风险意识与安全可控放在同等位置。
✔影响:这是中国 AI 安全治理从原则宣示走向标准化操作的关键一步。3.0 版本的核心价值不在新增条款,而在"风险分类"被重新梳理——分类一旦调整,后续的评估方法、测试工具、合规清单都会跟着改,直接决定企业合规成本的分布。对全球产业有三层含义:其一,框架由网安标委发布,意味着它具备向国家标准转化的通道,未来可能成为国内 AI 产品上线的前置条件,与欧盟《人工智能法案》的风险分级形成两条并行的监管路径;其二,框架强调"技术应对"而非仅靠制度约束,会带动安全评测、红队测试、内容审核工具的采购需求,形成新的服务市场;其三,中美欧三地在 AI 安全上各自立标,跨国企业在模型出海时需要同时满足多套分类体系,合规的边际成本将显著上升。风险在于框架仍是软性指引,落地时间表与约束力尚未明确。
9月15日:工业和信息化部、国家发展改革委联合印发《电子信息制造业发展"十五五"规划》
✔事件:两部门联合印发《电子信息制造业发展"十五五"规划》,明确抢抓人工智能发展机遇,按"筑基、提质、育新、治理"四条思路部署 17 项任务。量化目标有二:到 2030 年规模以上企业营业收入突破 30 万亿元,产业研发投入强度达到 3.5%。与 AI 直接相关的是算力与数据部分——规划提出构筑先进计算生态体系,推进计算架构、数据存储、高速互连、算电协同等技术创新,开发面向大模型训练与推理的计算微架构,突破高带宽内存池与存算一体等关键技术,并强调加强算力、存力、运力、电力的协同配置。
✔影响:这份规划把 AI 基础设施从"算力单点"扩展为"算力—存力—运力—电力"四要素协同,是对过去两年实际瓶颈的正面回应:训练大模型的约束早已不只是 GPU 数量,而是内存带宽、数据中心互联与供电能力。三项关键技术点名值得注意——高带宽内存池、存算一体、计算微架构,都是当前被海外厂商主导或尚无成熟方案的环节,规划将其列为突破方向,意味着国产替代的资源配置会向这三处倾斜,相关设备与材料企业将获得确定性订单预期。30 万亿元的营收目标与 3.5% 的研发强度并列,说明政策导向正从"做大规模"转向"规模与研发并重"。对全球产业的影响:中国在存储与互连环节的投入会加剧与三星、SK 海力士、博通的竞争;算电协同的提法则呼应了国内"东数西算"与绿电直连的现实约束,可能形成有别于欧美的数据中心选址与供电范式。
9月16日:民航局、国家数据局联合印发《民航数据治理体系建设实施方案》
✔事件:民航局与国家数据局联合印发《民航数据治理体系建设实施方案》,落实数据要素市场化配置改革、深化数据资源开发利用与健全数据要素基础制度的部署。方案设定了两个时间节点:到 2027 年,基本实现运行、出行、物流、监管等重点领域公共数据开放共享,并探索数据要素市场化流通试点;到 2030 年,全面实现行业公共数据开放共享与授权运营,数据要素市场基本形成。部署内容围绕数据基础制度、行业数据资源建设、数据要素高效流通三块展开,同时推动"数据要素×"行动与公共数据"跑起来"示范场景建设,构建民航数据流通利用基础设施。
✔影响:民航是数据密度最高、且横跨公共与商业属性的行业之一——航班运行数据、旅客出行数据、货运物流数据与监管数据分属不同主体,长期存在共享难、定价难、授权难的问题。由民航局与国家数据局联合印发,说明行业数据治理已从单个部门的内部事务升级为跨部门协同议题。对产业的影响有三层:其一,公共数据授权运营在民航落地,会为其他行业提供可复制的定价与授权模板,尤其"到 2030 年数据要素市场基本形成"这一表述,暗示数据交易在民航场景要形成真实交易额而非仅做试点;其二,数据流通基础设施的建设会带动数据确权、隐私计算、数据沙箱等技术服务的行业化应用;其三,对航空公司、机场、OTA 平台而言,数据开放共享意味着既有数据壁垒被削弱,靠信息不对称获取的收益会收缩,而基于数据的增值服务空间打开。全球视角下,这是中国数据要素改革在垂直行业深化的重要样本,与欧盟数据空间(Data Spaces)在交通领域的布局路径相似但机制不同。
9月16日:「稳准智能」发布 400M 参数结构化数据基础模型 LimiX-2
✔事件:「稳准智能」发布 LimiX-2,一支清华博士团队用 400M 参数的结构化数据基础模型,在 TabArena、TALENT、BCCO 三个国际主流基准测试中拿下二分类、多分类、回归等各项任务的第一名,且呈现断层领先。该模型属于 LDM(Large Data Model,结构化数据基础模型)路线,瞄准的是生产侧的核心痛点:让基础模型直接学习不同结构化数据中的变量关系、条件关系与生成机制,而不是把表格数据转成文本再交给语言模型处理。
✔影响:过去三年的基础模型竞赛几乎全部集中在文本、图像、音视频等非结构化数据上,而企业生产经营中占比最大的表格数据始终缺乏通用基础模型,只能依赖 XGBoost、LightGBM 这类传统机器学习工具逐任务训练。LimiX-2 用 400M 参数在主流表格基准上做到第一,说明结构化数据同样存在"预训练 + 微调"的规模效应,只是此前缺少合适的建模路径。这对全球产业的意义在于:其一,参数效率极高意味着部署成本低,可以直接嵌入企业 ERP、风控、供应链系统,替代大量定制化建模项目,冲击传统 AutoML 与数据科学外包市场;其二,若 LDM 路线成立,会改变企业对数据资产的估值逻辑——结构化数据的价值不再取决于标注质量,而取决于能否作为预训练语料,进而影响企业内部数据治理的投入方向;其三,400M 的体量也提示这条路线尚未被大厂重点覆盖,存在创业公司的窗口期。需要留意的是,三个基准测试均以学术数据集为主,工业场景中缺失值、口径漂移、样本极不平衡等问题的表现仍待验证。
9月16日:谷歌与DeepMind 联合成立 DeepMind 研究院
✔事件:谷歌及其旗下 DeepMind 的研究人员成立 DeepMind 研究院,旨在推动围绕通用人工智能(AGI)的跨学科讨论。研究院董事包括 DeepMind 联合创始人 Shane Legg、谷歌高管 James Manyika 与谷歌 DeepMind 董事长 Demis Hassabis,其中 Legg 担任执行主编。研究院定位为开放讨论平台,强调呈现谷歌、DeepMind 以及全球研究界在 AGI 问题上的不同观点,而非发布统一立场。首批发布四篇文章,主题分别为 AGI 经济政策、模型推理透明度、人类繁荣原则与前沿 AI 评估框架。其中 Rohin Shah 与 Anca Dragan 撰文指出,应关注模型"透明窗口"缩小带来的安全风险,并提出可通过限制"不可见串行深度",或要求低透明度系统证明其仍具备同等可监控性来应对。
✔影响:前沿实验室成立研究院并不新鲜,值得关注的是它选择在 AGI 议题上做跨学科开放讨论,并把"经济政策""人类繁荣"这类非技术命题放在首批议题之列。这释放出两个信号:一是前沿厂商已开始为 AGI 到来做制度与政策层面的预备工作,而不只是技术准备;二是当监管压力上升时,由企业主导的研究院可以成为议程设置的通道——哪些风险被定义、如何度量、用什么框架评估,往往比技术本身更影响最终规则。首批文章中"透明窗口"的提法尤其值得记录:它把安全问题的焦点从"模型会不会作恶"转向"人类还能不能看懂模型在做什么",并提出以"不可见串行深度"作为可度量的技术指标。这可能成为评估框架的早期雏形。对全球产业的影响:企业研究院与政府监管之间的边界会变得模糊,AGI 评估标准的话语权争夺已经开始;同时,推理透明度若被纳入合规要求,会直接影响模型架构选择,链式思考等方法的可解释性设计将不再是可选项。
9月17日:Figure AI 发布 Helix 2.5,在 30 个陌生家庭完成零样本测试
✔事件:Figure AI 发布新一代模型 Helix 2.5,并公开了一次零样本测试结果:在 30 个真实的湾区民宅中,机器人把训练好的行为模式直接迁移到从未接触过的家庭环境,面对陌生物体与陌生房间布局,未做任何针对性数据采集或微调。420 次试验成功 237 次,零样本成功率 56%,评测为盲测,且没有任何单一评测任务在 Index 预训练数据中的占比超过 1.90%。作为对照,同样硬件与任务数据、但未经过 Index 预训练的策略成功率仅 9%。Figure 同时对比了上一代 Helix 02:后者需先在目标场地采集数据才能训练,而 Helix 2.5 仅用一半的适应数据量,就在 30 个从未见过的家庭中追平了 Helix 02 在单一场地的成功率,整体成功率提升 522%。
✔影响:家用场景长期是具身智能最难攻克的堡垒——每个家庭的物品摆放、光照条件、户型结构都不同,靠现场采集数据训练的方式在商业上无法规模化。56% 的零样本成功率本身并不高,但它的意义在于验证了一件事:预训练数据规模与泛化能力之间存在可预测的比例关系,这与语言模型早期观察到的缩放律高度相似。如果这一关系在机器人领域同样成立,那么具身智能的商业逻辑将从"每进入一个场景就要采一遍数据"转向"扩大预训练数据规模即可提升泛化",边际成本结构被彻底改写。对全球产业的影响有三层:其一,机器人厂商的护城河从硬件制造能力转向预训练数据资产,掌握大规模真实操作数据的公司优势会持续放大;其二,家用机器人量产的可行性显著提升,服务机器人从工业场景向消费场景渗透的时间表可能提前;其三,1.90% 的数据占比上限说明泛化并非来自任务记忆,这对评测方法论本身也有价值。需要保留的怀疑是:30 个家庭集中在湾区,房屋类型与文化背景相对同质,跨地域、跨文化的泛化表现仍未知;56% 的成功率距离可交付产品还有相当距离。
9月18日:工业和信息化部、国家发展改革委等十部门联合发布《医药工业发展"十五五"规划》
✔事件:十部门联合发布《医药工业发展"十五五"规划》,提出加快布局前沿技术和产品,强化跨学科交叉融合与前沿技术供给,支持医药工业企业、高校、科研院所、医疗机构联合攻关。与 AI 直接相关的部署包括:加快人工智能、量子计算、超级计算、计算医学等新技术赋能药物研发;探索超限制造、太空制药、生物制造等药械生产新模式;深化基因编辑、分子精准递送、细胞编程与调控、先进组学、新一代脑机接口等前沿技术应用。规划还列出若干需突破的关键技术:人工生命体系合成、类器官与器官芯片、通用型细胞治疗、复杂再生器官、诊疗一体化放射性药物、异种移植器官,并要求培育若干新增长点。
✔影响:把 AI 与量子计算、超级计算并列写入药物研发的技术路线,说明政策层面已把计算能力视为医药创新的基础生产要素,而非辅助工具。这份规划的影响面超出医药行业本身:其一,"计算医学"被单独提出,意味着临床数据、组学数据、影像数据的合规使用与跨机构流通会成为刚需,与数据要素改革形成交汇,医药数据资产化的需求会明显上升;其二,类器官与器官芯片被列入突破方向,将直接替代部分动物实验,这既降低研发成本,也会重塑实验动物与临床前研究的外包市场;其三,生物制造、细胞编程与调控、异种移植等方向的技术门槛极高,规划以"联合攻关"方式部署,意味着产学研协同的资源配置会集中在少数头部机构。对全球产业而言,中国把 AI 制药从企业自发探索上升为国家产业规划的一部分,会加快在计算医学与生物制造领域与欧美形成并行竞争,尤其在器官芯片与细胞治疗这两个监管创新密集的领域。
9月18日:阿里巴巴 Qwen 团队发布原生全模态模型 Qwen3.8-Omni-Flash
✔事件:阿里 Qwen 团队发布新一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频、视频四种输入,提供 100 万 Token 上下文窗口;官方称相比上一代 Qwen3.5-Omni-Plus,在 29 项基准测试中的平均成绩提升超过 25%。这次升级的重点不在能力清单的堆叠,而在处理方式——它不是把语音识别、图像识别等能力简单拼接成流水线,而是在模型层面原生处理不同类型的信息。阿里的产品意图表述得比较明确:让模型不仅"看懂""听懂"音视频内容,还要在理解之后完成任务规划、调用工具,把活干完。
✔影响:全模态模型的竞争此前长期停留在"支持多少种模态"的数量比较上,真正的难点在于不同模态之间能否共享同一套表征与推理过程。原生处理意味着音频与视频不再被转成文本再送进语言模型,信息在转译环节的损耗被绕过——这对实时交互类产品是决定性的,因为转译延迟与语义丢失正是语音助手长期体验不佳的根因。100 万 Token 上下文配合视频输入,则打开了长视频理解、会议全程追踪、监控场景回溯这类此前算不过账的应用。对全球产业的影响:其一,阿里把全模态能力与智能体规划绑定,实际上是在争夺"多模态入口 + 任务执行"的复合位置,与谷歌 Gemini、OpenAI 的多模态产品线正面竞争;其二,原生全模态对推理算力的需求结构不同于纯文本模型,音视频 token 的处理会把压力更多分配到内存带宽与专用加速器上,利好相关硬件环节;其三,模型开源或低价策略若延续 Qwen 系列的一贯做法,会进一步压低多模态能力的采购成本,压缩专做单一模态的垂直厂商的生存空间。
9月18日:智谱发布 GLM-5.3-FlashX,速度达每秒 200 token
✔事件:智谱发布新模型 GLM-5.3-FlashX,官方标称最高生成速度达每秒 200 个 token。这款提速型号基于此前以"Ox Alpha"之名先行测试的 GLM-5.3-Flash,后者凭借同尺寸模型中最强的智能水平在海外开发者中积累了口碑,调用量持续攀升。面对增长过快的需求,智谱在 10 万张国产芯片构成的推理算力基础上,继续加码基础设施与推理优化投入。官方将 FlashX 的定位概括为:第一次把智能水平、价格与速度三者同时握在手里。
✔影响:推理速度正在成为与模型智能同等重要的竞争维度,这一点在智能体场景中尤其明显——多轮工具调用、长程任务推进都依赖低延迟响应,速度不够时任务完成时间会成倍拉长,用户体验直接崩塌。每秒 200 token 的输出速度已接近人类快速阅读的上限,意味着延迟不再是交互的瓶颈。更值得记录的是支撑结构:10 万张国产芯片承载推理,说明国产算力在软件栈优化到位后具备承接大规模前沿模型服务的能力,这对"国产算力能否支撑真实业务"的争论提供了一个可核验的样本。对全球产业的影响:其一,智能、价格、速度三者同时优化会加速模型市场向头部集中,仅靠单点优势(便宜或快)的厂商难以维持份额;其二,推理侧的成本与速度竞争会逐步把 API 定价推向接近边际成本,模型层的利润空间被压缩,价值向应用层与基础设施层转移;其三,国产芯片集群在推理场景的规模化落地,会削弱高端 GPU 在推理市场的锁定效应,这一趋势对全球算力供应链的长期格局有实质影响。
9月18日:Anthropic 披露内部研发自动化数据,Claude 主导 26% 研发任务
✔事件:Anthropic 对外披露内部研发自动化统计。截至 2026 年 8 月,Claude 已主导公司 26% 的 AI 研发任务,而 2 月这一占比尚不足 1%。公司采用六级自动化框架评估 AI 参与程度,其中 AL4 级别定义为"AI 主导"——人类只给出高层目标指令,由 AI 完成绝大部分流程,人负责监督审核。目前超过 90% 的研发工作达到人机协作及以上等级,但没有任何任务实现完全无人自主(AL5),AI 始终处于人类监管之下。公司内部约有 3 万个由 Claude 驱动的 AI Agent 并行开展研究与工程工作,Agent 之间可互相分配任务、交叉纠错,8 月单月产生超 10 亿次决策。代码层面,合并入库的代码中超过 80% 由 Claude 生成,工程师产出效率相比过去提升数倍。这些 Agent 承担模型实验、代码编写、数据分析、结果校验等底层研发工作,并参与下一代 Claude 模型的迭代——即业界所称的递归自我改进。
✔影响:这是目前公开信息中,关于 AI 参与自身研发最具体的一份数据。从 2 月的不足 1% 到 8 月的 26%,六个月内完成数量级跃升,且明确标注尚未触及 AL5 完全自主,说明"递归自我改进"已经从概念讨论进入工程现实,但仍在人类可控边界内。对全球产业有四点影响:其一,研发效率的量级差异会直接体现在模型迭代速度上,掌握同类自动化能力的前沿实验室之间的差距将被拉大,而未能建立这套体系的机构会被迅速甩开;其二,80% 代码由 AI 生成的比例,意味着软件工程岗位的职能会从"写代码"转向"定义问题与审核产出",这对整个科技行业的人才结构与教育体系是实质性冲击;其三,六级框架与 AL4 的定义提供了一个可参考的度量方法,监管机构很可能以此为基础设计研发自动化的申报或审计要求;其四,3 万个 Agent 并行、8 月单月 10 亿次决策,说明 Agent 编排与交叉校验已成为真实的生产系统,围绕多 Agent 协作的可观测性与安全管理会形成新的工具市场。需要保留的怀疑是:这些数据由 Anthropic 自行发布,缺少第三方核验,"主导"与"人机协作"的判定标准也未公开,不宜直接跨公司比较。
小结
一条主线:AI 开始参与生产 AI,而治理与基础设施同步补位
本周十件事分布看似零散,但有一条线索贯穿:AI 正从"被使用的工具"变成"参与生产的主体"。最直接的证据来自 Anthropic——Claude 主导了 26% 的研发任务,80% 的入库代码由其生成,3 万个 Agent 并行工作并参与下一代模型的迭代。这不是效率优化的范畴,而是生产关系的改变。
与此同时,其余九件事几乎都在为这一变化准备配套条件:Figure 用零样本泛化让机器人摆脱"每进一个场景就要采一遍数据"的束缚,LimiX-2 让占企业数据最大比例的表格数据也获得基础模型,Qwen 与智谱把多模态理解与推理速度推到可用于实际任务的水平——这三者扩展了 AI 能参与生产的边界。
另一侧则是补位:网安标委的框架3.0 划定安全治理的分类与措施,"十五五"电子信息规划把算力、存力、运力、电力作为一个整体来配置,民航与医药两份行业方案则把数据要素改革落到了具体行业。能力在扩张,规则与底座在同步跟进,这是本周最值得记录的节奏。
三条结构性趋势
第一,基础模型的边界从非结构化数据扩展到结构化数据与物理世界。 过去三年基础模型的战场集中在文本、图像、音视频。本周出现两个明确的越界信号:LimiX-2 用 400M 参数证明表格数据同样存在预训练规模效应;Figure 的 Helix 2.5 证明机器人泛化能力随预训练数据呈可预测的比例增长。这两条路线的共同意义在于,它们把"基础模型"这一范式从语言领域推广到了企业生产经营与物理操作领域——而后两者的数据体量远大于公开文本语料。
第二,推理时代的三个竞争维度已经收敛为"智能 × 价格 × 速度"。 智谱明确把三者并列作为产品定位,阿里以原生全模态加百万上下文争夺复合位置,Anthropic 用自动化研发压缩迭代周期。单点优势(只便宜、或只快、或只在某个榜单领先)已不足以维持份额。更深远的影响是:当三者同时被优化,模型层的利润空间会被持续压缩,价值向应用层与基础设施层转移,这与云计算早期的演化路径高度相似。
第三,"十五五"开局之年,中国的产业规划开始把 AI 作为基础设施而非应用来配置。 电子信息规划把算力、存力、运力、电力并列,明确要突破高带宽内存池与存算一体;医药规划把人工智能与量子计算、超级计算并列为药物研发的技术路线;民航方案则把数据要素改革落到行业级市场建设。政策语言的共同特征是:不再讨论"AI 能做什么",而是直接部署"支撑 AI 持续运转需要什么"。
四点启示
[1]重新审视结构化数据资产的价值。 如果 LDM 路线被验证,企业内部沉淀的表格数据将从"运维负担"变成"预训练语料"。值得现在就做的是盘清自身结构化数据的规模、口径一致性与合规状态——这类资产的估值方式可能在未来一两年内被重估。
[1]把推理速度纳入模型选型的第一梯队指标。 智能体场景下延迟对任务完成时间的影响是非线性的。如果你的技术选型只看榜单分数与单价,建议补测实际业务负载下的端到端延迟——200 token/秒与几十 token/秒之间的差距,在长程任务中会放大到数倍。
[1]关注"能力扩张"与"规则补位"之间的时间差。 本周 Anthropic 的数据显示能力扩张速度远超预期,而《人工智能安全治理框架3.0》仍是软性指引。这个时间差既是机会也是风险:机会在于早期建立自动化能力的企业能拉开差距,风险在于合规要求落地时,已建成的自动化流程可能需要重构。建议在做研发自动化投入时,同步保留可审计的决策记录。
[1]盯住具身智能的数据资产,而非硬件参数。 Figure 的对比实验说明,护城河来自预训练数据规模而非本体硬件。评估机器人赛道标的时,真实操作数据的积累量与多样性,比自由度数量与负载参数更能预示长期竞争力。
—— END ——
(都看到这里了,还不关注我们吗 ?可以持续获得AI时代的生存指南哦 ↓)
往期回顾:
1. 产业观澜 | 2026(09.07-09.13)全球AI与数据领域十大事件
2. 产业观澜 | 2026(08.31-09.06)全球AI与数据领域十大事件
3. 产业观澜 | 2026(08.24-08.30)全球AI与数据领域十大事件
4. 产业观澜 | 2026(08.17-08.23)全球AI与数据领域十大事件
5. 产业观澜 | 2026(08.10-08.16)全球AI与数据领域十大事件
本文由公众号原创 · 转载请注明出处

