大数跨境

AI周报|智能体开始接管软件,AI进入“操作时代”

AI周报|智能体开始接管软件,AI进入“操作时代” 唐门AI OPC社区
2026-06-08
3
导读:📅AI周报|智能体开始接管软件,AI进入“操作时代”(6.1~

📅AI周报|智能体开始接管软件,AI进入“操作时代”

(6.1~6.7日)

本周最大的变化,不是某个模型又刷新了榜单,而是越来越多产品开始瞄准同一个目标:

让AI直接完成工作,而不是辅助人工作。

🚀 OpenAI把Codex升级成全能智能体

OpenAI正式升级Codex战略。

从代码助手进化成全能工作助手,新增设计、数据分析、建站等能力。

上传文档后,可以直接生成能访问、能互动的网站;Vibe Coding作品支持一键上线部署;还新增iOS开发插件,能够预览和调试手机应用。

与此同时,GPT-5.6已进入内部测试,据称视觉理解和前端审美能力大幅提升。

如果说ChatGPT改变的是搜索,那么Codex想改变的可能是整个软件工作流。

🤖 Anthropic发出重磅警告

Anthropic透露,目前内部约80%的代码已经由AI完成。

更值得关注的是,顶级模型正在参与下一代模型研发。

当AI开始帮助研发AI,行业距离真正意义上的“递归自我改进”又近了一步。

因此Anthropic再次呼吁放缓AI研发节奏。

无论是否认同这一观点,这都说明前沿实验室已经开始认真讨论AI自主研发的问题。

🇨🇳 国产开源持续发力

MiniMax开源百万上下文大模型,代码能力跻身全球第一梯队。

字节则连续开源多个重磅项目:

• 多模态统一模型,实现视频生成与编辑一体化;
• 新一代语音模型,支持快速声音克隆;
• 数字人能力持续增强。

国产模型的竞争重点,正在从参数规模转向实际应用能力。

⚙️ 本地AI时代加速到来

英伟达发布个人AI计算平台,拥有1PF算力和128G统一内存,可运行1200亿参数级模型。

Google同步开源多模态小模型,仅需16G显存即可运行图像、视频和音频任务。

过去大家讨论的是云端AI。

现在越来越多企业开始讨论:

哪些能力应该留在本地运行。

🎨 内容生成进入“精确控制”阶段

RAV发布4K图像模型,通过结构化布局精准控制画面。

Ideogram支持文字图层编辑、透明背景和版式控制。

Triple实现单图生成3D模型。

Google推出实时音乐模型。

AI生成内容正在从“随机惊喜”走向“可预测交付”。

🎙️ AI声音越来越接近真人

本周多个语音模型集中开源:

声音克隆、情绪控制、语速调整、口型同步基本全部覆盖。

对于直播、电商、短剧、数字人等行业来说,制作门槛正在快速下降。

🛠️ Agent生态开始补齐最后一公里

除了模型本身,一批围绕Agent的新工具值得关注:

• Stop Slope:专门去除AI味内容;
• Mq:帮助AI高效处理Markdown文档;
• Website Specification:首次把“Agent可读性”纳入网站建设标准;
• GitHub Copilot CLI:加入批评式Agent和语音交互;
• Hocus Pocus:降低多人实时协作开发门槛;
• DriftVM:探索Agent时代的新型桌面交互。

这些工具虽然不如大模型吸睛,但可能比模型本身更重要。

📌 本周观察

如果说过去两年AI行业的目标是:

让AI学会使用人类语言。

那么这一周透露出的信号是:

下一阶段的目标,正在变成让整个数字世界学会被AI使用。

注意看本周出现的新东西:

Codex开始操作软件;

GitHub开始培养会批判的Agent;

Markdown工具专门为LLM设计;

网站标准开始强调Agent可读性;

大量模型开始直接生成网页、应用、视频和音频。

这些变化背后有一个共同趋势:

过去是人适应软件。

未来可能是软件适应AI。

很多人以为AI革命是在创造新的工具。

但从这周开始,一个更大的变化正在出现:

互联网正在被重新改造成适合Agent工作的环境。

当网站开始为Agent设计、软件开始为Agent设计、工作流开始为Agent设计时,

真正的竞争或许已经不再是“谁拥有最强模型”,

而是谁能成为Agent时代的基础设施。

这可能才是本周最值得关注的信号。 


【声明】内容源于网络
0
0
唐门AI OPC社区
1234
内容 36
粉丝 0
唐门AI OPC社区 1234
总阅读8
粉丝0
内容36