一、本周三起 AI 安全事故,每一起都该让你警觉
事故一:GPT-5.6 Sol 自己删用户的文件
OpenAI 这周新出的旗舰模型 GPT-5.6 Sol,上线没几天就被开发者集体在 X 上吐槽——这模型会不经询问自己删文件。
OthersideAI 的创始人 Matt Shumer 公开发帖说,Sol 几乎删光了他 Mac 上的所有文件。还有人说它自己删了生产数据库,有人发现它主动去删云端的虚拟机。
最让人生气的是,OpenAI 自己早就知道这个问题。他们在发布前两周公开的系统卡里就白纸黑字写过:Sol 在编码场景里"过度智能体化",会"采取任何能完成任务的动作,包括破坏性操作",除非用户"明确且无歧义地禁止"。系统卡里甚至举了具体例子——Sol 因为找不到目标虚拟机,就把另外三台虚拟机一起删了;还自己上网搜了用户没授权过的凭据来用。
OpenAI 的回应是什么?承认 Sol 比 GPT-5.5 更容易超出用户意图,但说"破坏性行为应该属于罕见",建议用户"自己做好权限隔离、备份、分阶段部署"。
翻译成人话:我们知道它会闯祸,但防闯祸的事你自己干。
这件事给我的震动很大。我们以前以为 AI 工具就像一个听话的实习生,你说什么它做什么。但 Sol 这种"过度智能体化"的模型,更像一个过于积极、不想让你失望、于是擅自动手的实习生——你说"清理一下旧的测试环境",它就直接把你整个项目目录 rm 了。
事故二:xAI 的官方 Grok CLI 偷偷上传你整个代码库
第二件事更阴险。
安全研究者发现,xAI 官方发布的 Grok CLI(命令行编程助手,npm 包 @xai-official/grok 的 0.2.93 版),在每次任务的前后,会把你的整个工作目录打包成 tar.gz 文件,通过一个独立的旁路通道静默上传到 xAI 的 Google Cloud 仓库。
研究者做了一个实验:让模型只回复一个单词,上传照样发生。
更离谱的是,上传包里不只是你当前的项目,还包括仓库之外的文件——~/.claude.json、Claude Code 的全局配置、你写的所有 AGENTS 规则、30 多个 Skill 文件,甚至还有 API 密钥。
也就是说,如果你装了这个 CLI 在自己电脑上跑过,你的所有 Claude 配置、所有自定义 Skill、所有 API key,可能都已经躺在 xAI 的服务器上了。
7 月 13 号凌晨,xAI 通过服务端的远程开关加了一个 disable_codebase_upload 字段,把默认上传行为关掉了。但请注意——这个上传功能从 CLI 上线开始一直是默认开启的,关掉它是因为被人挖出来了。
事故三:Cursor IDE 的 0day 漏洞,7 个月没修
第三件事跟所有用 Cursor 写代码的人有关。
安全公司 Mindgard 在 2025 年 12 月就发现了 Cursor 的一个严重漏洞:你在 Windows 上打开任何一个仓库,只要这个仓库里藏了一个恶意的 git.exe,Cursor 会自动执行这个文件,不需要你点任何东西。
漏洞原理很简单——Cursor 加载项目时会在工作区里找 Git 程序,找到就用。攻击者只要把木马伪装成 git.exe 塞进仓库里,你一 clone 一打开,就中招了。
最离谱的是处理过程。Mindgard 在 7 个月里多次报告,Cursor 的 CISO 也确认了,但因为内部自动化流程出了故障,问题被搁置。Cursor 在这 7 个月里发布了 70 多个新版本,漏洞一直没修。最后 Mindgard 不得不走"完全公开披露"——直接把漏洞细节发出来,逼 Cursor 修。
临时自救的办法只有两个:用 AppLocker 阻止从工作区目录执行 git.exe,或者在隔离的虚拟机里打开任何不信任的仓库。
三件事放在一起,给我们什么启示?
第一,AI 模型越来越"自动",意味着它犯错的代价也越来越大。GPT-5.6 Sol 这种"过度智能体化"的模型,是未来一年的主流方向,每个大厂都在做。AI 自己动手的能力越强,你做权限隔离和备份就越紧迫。
第二,AI 编程工具会接触你全部代码和密钥,选工具要看清它的数据流向。Grok CLI 这件事不是个例,是行业里一直存在的暗坑。你装任何编程 Agent、CLI、SDK 之前,最好先搜一下它的数据上传行为。
第三,clone 陌生仓库一定要在隔离环境里。Cursor 这个 0day 不只是 Cursor 的问题,未来其他编程工具也可能有类似的"工作区执行"漏洞。
如果你想我写一份具体的"AI 工具安全自查清单",可以在评论区扣 1,人多我就专门写一篇。
二、Anthropic 用 Claude Code 两周迁完百万行代码
讲完事故,说一条这周被严重低估的好消息。
Anthropic 自己的工程师,用 Claude Code 在两周内把 Bun 项目的百万行 Zig 代码全部迁移成了 Rust。所有原有测试 100% 通过,合并后出现的 19 个回归问题全部修好了。
Bun 是一个很火的 JavaScript 运行时,核心代码用 Zig 写的。把百万行 Zig 改写成 Rust,这种工程量在传统模式下起码要一个团队搞半年。
效果有多夸张?编译时间从 8 分钟降到了 2 秒,二进制启动速度快了 6 倍。这次迁移花了大约 16.5 万美元的 API 费用——听起来不少,但对比一个工程团队半年的工资,便宜太多了。
更夸张的是另一个案例。Anthropic 另一位工程师用一个周末,把一个 Python 代码库迁到了 16.5 万行 TypeScript。
这件事给我的信号很明确:AI 不是只在帮你写新代码,它已经能大规模重构、迁移存量代码。
对咱们普通人来说,如果你手头有那种"早想换语言但一直不敢动"的老项目——比如老旧的 PHP、过时的 Python 2、维护成本越来越高的 jQuery——现在可以认真考虑用 AI 来做迁移了。前提是,你的项目要有完整的测试用例兜底,否则 AI 改完你都不知道对不对。
三、国行 Apple 智能正式落地,背后的 AI 是阿里千问
如果你用的是国行 iPhone,这周有个跟直接相关的消息。
苹果的"Apple 智能"已经在 7 月 8 号完成了国内备案。而给国行 Apple 智能提供 AI 能力的,是阿里千问 Qwen。
这意味着什么?以后国行 iPhone、iPad、Mac、Vision Pro 上的文本理解、图像识别、内容生成这些 AI 功能,跑的是阿里的模型,不是 OpenAI 的。
苹果为什么选阿里?阿里董事会主席蔡崇信说,苹果在最终敲定阿里之前,跟国内好几家 AI 公司都谈过。最后选阿里,应该是综合考虑了模型能力、合规资质、商务条件。
这件事的弦外之音是——国内 AI 模型的能力,已经被苹果这种最挑剔的国际巨头认可。千问、Kimi、混元这一波国产模型,已经不是"凑合能用",而是"苹果都愿意用"。
对国行用户来说,下半年 iOS 更新之后,可以期待一下 Siri 终于变聪明了。
四、AGI 还有多远?两个大佬给出了完全相反的答案
这周有两位 AI 大佬对 AGI 时间表发了言,观点截然相反。
Google DeepMind 创始人 Demis Hassabis 说:AGI 可能几年内就到。他强调 AGI 的影响会是工业革命的 10 倍,而且来得更快。他还呼吁美国赶紧成立一个类似金融业 FINRA 的前沿 AI 监管机构。
普林斯顿教授 Arvind Narayanan 在 ICML 2026 的主旨演讲里说:AI 就是"正常技术"。他反对"AGI 马上来了"这种叙事,认为人类应该主动适应 AI 而不是躺平等待奇迹。
这俩谁对?我自己的判断是——Hassabis 讲的是技术可能性,Narayanan 讲的是社会影响。技术上 AGI 几年内能不能实现,是有可能的;但即使实现了,它能不能像工业革命那样改变所有人的日常生活,是另一回事。我们目前看到的 AI 影响,更多是工具层面的,还没到"重塑社会结构"的级别。
跟这个话题相关,本周还有一条很有意思的新闻。OpenAI 的 CEO Altman 改口了——他说自己现在"相当确信"AI 净创造了就业,"这并非我预期"。Anthropic 的 CEO Dario Amodei 也修正了之前"AI 会导致大规模裁员"的说法。
但有意思的是,多项严肃研究没有发现 AI 对整体生产力或就业市场产生显著影响。一项多校联合研究指出,程序员和文案的就业危机其实始于 2022 年初,比 ChatGPT 发布还早。
所以你看到的"AI 要取代你了"和"AI 反而创造了就业",目前两种说法都缺乏硬证据。我们可能还需要再等一两年,看真实数据出来。
五、基础设施军备:台积电、Meta、内存、电费
最后快速过一遍这周的基础设施新闻。这些事听起来离你远,但其实是 AI 能力增长的"地基",决定了未来两年你能用到的 AI 有多强、多便宜。
台积电上调资本支出。台积电把 2026 年的资本支出预测从 560 亿美元上调到了 600~640 亿美元。下一代 A14 制程(1.4nm)进展顺利,计划 2028 年量产。台积电说 A14 会比 2nm 更大、更持久。芯片产能持续扩张,意味着 AI 算力的瓶颈不会卡在芯片制造上。
Meta 砸 500 亿建数据中心。Meta 把路易斯安那州的数据中心扩建到 5GW,总投资超过 500 亿美元,是全球最大的 AI 基础设施投资之一。Meta 还承诺承担全部能源和水资源费用,再额外投 10 亿美元改善当地道路和供水。
黄仁勋:英伟达季度收入逼近千亿美元。黄仁勋在摩根士丹利路演中说,英伟达的季度营收即将逼近 1000 亿美元,而且增长还在加速。他否认了下一代旗舰架构 Rubin Ultra 延期的传闻。
但另一面是真实成本。
The Atlantic 这周有一篇很扎心的文章,标题叫"生成式 AI 是一场工程灾难"。文章指出,AI 公司可能已经买走了全球 70% 的高端计算机内存,导致内存和硬盘价格飞涨——两年前 350 美元的硬盘现在涨到 800 美元还缺货,部分笔记本电脑涨价 50%。文章预测,平价入门级电脑可能在 2028 年前消失。
Fortune 的报道更直接:数据中心已经让美国公众的电费增加了 230 亿美元,而且这个涨价会持续到 2028 年底。普通居民在替 AI 公司分摊电网基础设施的成本。
这两条新闻我特意放在一起。AI 红利的另一面,是真实的资源消耗,而且这个消耗不均等地落在了所有人头上——不管你用不用 AI,你买电脑、交电费的时候都在为它付费。
六、国产开源模型这周集体爆发
这周除了 Kimi K3,国内好几家都发了开源模型,质量都很能打。
腾讯混元 Hy3:295B 总参数、21B 激活的 MoE 架构,定位是"Agent 向 LLM"。已经集成进微信服务 10 亿+ 用户。腾讯还发了 1bit 量化版,单张 96GB 显卡就能跑这个接近 300B 的大模型。
腾讯混元 HyOCR-1.5:1B 参数的端到端 OCR 模型,全栈开源(训练代码、推理代码、权重都有),推理速度比上一代快 6.37 倍。在 OmniDocBench 上拿了端到端第一。
小米 Xiaomi-Robotics-U0:380 亿参数的多模态模型,做具身智能(机器人场景)生成。在 World Arena 具身视频生成排名第一,还能把 pi_0.5 机器人在真实世界操控任务上的分布外成功率从 36.9% 提升到 63.2%。
商汤 SenseNova-Vision-7B-MoT:7B 参数,一个模型统一处理检测、OCR、GUI 识别、深度估计、分割、多视图等几乎所有主流视觉任务。开源了权重和 5000 万示例子集。
Bonsai 27B:第一款能装进 iPhone 17 Pro 跑的 27B 多模态模型。基于 Qwen3.6,做了极致量化(1-bit 版本只有 3.9 GB),保留 90% 性能。
国产模型这周的密度,已经超过了海外同期。开源生态尤其活跃——以前我们说"中国模型跟在 GPT 后面",现在不少垂直领域(OCR、视觉、端侧)已经是中国开源模型领跑。
七、彩蛋:GPT-5.6 一小时证明了 50 年没解的数学猜想
最后说一件让我有点震撼的事。
OpenAI 用 GPT-5.6 Sol Ultra 模型,在不到一小时里,生成了图论里著名的"循环双覆盖猜想"的完整证明。这个猜想从 1970 年代提出以来,悬而未决超过 50 年。
模型调用了 64 个并行子智能体加对抗智能体,原本预留了 8 小时计算时间,结果 1 小时就完成了。OpenAI 已经把证明和提示词以 PDF 公开了。
当然,严肃地说——这个证明还没经过同行评审,也没用 Lean 这种形式化工具验证。如果最终通过,这将是 LLM 第一次独立解决维基百科"未解决数学问题"列表里的难题。
不管证明本身成不成立,这件事的方向意义很大:AI 不只是写代码、写文章,它开始进入"知识生产"的核心地带。
这周给我的三个启示
第一,AI 安全已经不是未来时,是现在进行时。三起事故,三种不同的失败模式——模型自己干坏事(GPT-5.6)、工具偷你数据(Grok CLI)、漏洞被你 clone 进来(Cursor)。从今天起,给所有 AI 工具配上最小权限,是你应该立刻做的事。
第二,AI 已经开始大规模重构存量代码。Anthropic 那篇百万行 Zig 转 Rust 的博客,是个里程碑。如果你的老项目有完整测试覆盖,现在是用 AI 做大重构的窗口期。
第三,国产开源模型已经成气候。不是某一家强,是一群家都在各自垂直领域做到顶尖。如果你还在只盯着 GPT 和 Claude,会错过很多更便宜、更适合中国场景的工具。
这周你最在意哪件事?最担心哪一件?留言聊聊。
静远,一个在AI时代坚持手把手带你上车的普通人。

