📅AI周报|智能体开始接管软件,AI进入“操作时代”
(6.1~6.7日)
本周最大的变化,不是某个模型又刷新了榜单,而是越来越多产品开始瞄准同一个目标:
让AI直接完成工作,而不是辅助人工作。
🚀 OpenAI把Codex升级成全能智能体
OpenAI正式升级Codex战略。
从代码助手进化成全能工作助手,新增设计、数据分析、建站等能力。
上传文档后,可以直接生成能访问、能互动的网站;Vibe Coding作品支持一键上线部署;还新增iOS开发插件,能够预览和调试手机应用。
与此同时,GPT-5.6已进入内部测试,据称视觉理解和前端审美能力大幅提升。
如果说ChatGPT改变的是搜索,那么Codex想改变的可能是整个软件工作流。
🤖 Anthropic发出重磅警告
Anthropic透露,目前内部约80%的代码已经由AI完成。
更值得关注的是,顶级模型正在参与下一代模型研发。
当AI开始帮助研发AI,行业距离真正意义上的“递归自我改进”又近了一步。
因此Anthropic再次呼吁放缓AI研发节奏。
无论是否认同这一观点,这都说明前沿实验室已经开始认真讨论AI自主研发的问题。
🇨🇳 国产开源持续发力
MiniMax开源百万上下文大模型,代码能力跻身全球第一梯队。
字节则连续开源多个重磅项目:
• 多模态统一模型,实现视频生成与编辑一体化;
• 新一代语音模型,支持快速声音克隆;
• 数字人能力持续增强。
国产模型的竞争重点,正在从参数规模转向实际应用能力。
⚙️ 本地AI时代加速到来
英伟达发布个人AI计算平台,拥有1PF算力和128G统一内存,可运行1200亿参数级模型。
Google同步开源多模态小模型,仅需16G显存即可运行图像、视频和音频任务。
过去大家讨论的是云端AI。
现在越来越多企业开始讨论:
哪些能力应该留在本地运行。
🎨 内容生成进入“精确控制”阶段
RAV发布4K图像模型,通过结构化布局精准控制画面。
Ideogram支持文字图层编辑、透明背景和版式控制。
Triple实现单图生成3D模型。
Google推出实时音乐模型。
AI生成内容正在从“随机惊喜”走向“可预测交付”。
🎙️ AI声音越来越接近真人
本周多个语音模型集中开源:
声音克隆、情绪控制、语速调整、口型同步基本全部覆盖。
对于直播、电商、短剧、数字人等行业来说,制作门槛正在快速下降。
🛠️ Agent生态开始补齐最后一公里
除了模型本身,一批围绕Agent的新工具值得关注:
• Stop Slope:专门去除AI味内容;
• Mq:帮助AI高效处理Markdown文档;
• Website Specification:首次把“Agent可读性”纳入网站建设标准;
• GitHub Copilot CLI:加入批评式Agent和语音交互;
• Hocus Pocus:降低多人实时协作开发门槛;
• DriftVM:探索Agent时代的新型桌面交互。
这些工具虽然不如大模型吸睛,但可能比模型本身更重要。
📌 本周观察
如果说过去两年AI行业的目标是:
让AI学会使用人类语言。
那么这一周透露出的信号是:
下一阶段的目标,正在变成让整个数字世界学会被AI使用。
注意看本周出现的新东西:
Codex开始操作软件;
GitHub开始培养会批判的Agent;
Markdown工具专门为LLM设计;
网站标准开始强调Agent可读性;
大量模型开始直接生成网页、应用、视频和音频。
这些变化背后有一个共同趋势:
过去是人适应软件。
未来可能是软件适应AI。
很多人以为AI革命是在创造新的工具。
但从这周开始,一个更大的变化正在出现:
互联网正在被重新改造成适合Agent工作的环境。
当网站开始为Agent设计、软件开始为Agent设计、工作流开始为Agent设计时,
真正的竞争或许已经不再是“谁拥有最强模型”,
而是谁能成为Agent时代的基础设施。
这可能才是本周最值得关注的信号。

