1、World Labs 推首个多模态世界模型 Atlas,像素级镜头控制拍出电影级“子弹时间”大片
2、腾讯 WorkBuddy 宣布开放平台上线,全面开放 Agent 基座能力
3、网信办重点整治 AI 换脸、魔改名著,豆包等主流模型严格限制违规输出
4、豆包手机 9 月开售:命名努比亚 NaviX Ultra,号称全球首款 AI 智能体旗舰
5、Meta 首发实时音频感知模型:支持 20 多人分轨转写,每千分钟仅 3 美元
6、Anthropic 发布 Fable 5.1:性能大幅提升,成本骤降四成
7、谷歌 Gemini 3.8 Flash 内测代号"Skimaki",最快周三上线决战竞品
8、谷歌 AI 修图工具 Pics 上线:Docs 与 Slides 中点击图片即可编辑
1. World Labs 推出全球首个多模态世界模型 Atlas,实现像素级镜头控制
World Labs 正式发布全球首个多模态世界模型 Atlas。该模型的核心突破在于具备像素级的相机控制能力,能够生成高质量图像与视频,并精准重建三维空间。Atlas 不仅支持从多张图像生成 3D 模型,还能基于文本生成图像及全景视图,展现出卓越的世界生成、重建与时空模拟能力。

亮点提要:
Atlas 模型能以像素级精度控制相机,生成图像和视频帧,并在三维空间中完美重构场景。
支持从单张或多张输入图像输出明确的 3D 模型,重建效果优于多数顶级开源模型。
具备时空模拟功能,可重新构图视频以增强戏剧性视觉效果,同时支持文本生成图像和 360 度全景。

2. 腾讯 WorkBuddy 开放平台上线,全面释放 Agent 基座能力
腾讯 WorkBuddy 宣布其开放平台正式上线,全面开放 Agent(智能体)基座能力。该平台旨在连接更多生态能力,深入 diverse 应用场景,致力于成为承载各类工具的通用平台。

亮点提要:
WorkBuddy 开放平台正式启动,首批引入超百家生态合作伙伴。
9 款联名智能硬件首发亮相,覆盖多个行业领域。
腾讯云副总裁表示,WorkBuddy 将打造面向 Agent 时代的操作系统。
3. 网信办专项整治 AI 乱象,主流大模型严管违规内容
中央网信办开展“清朗·整治 AI 应用乱象”专项行动,深度治理 AI 技术滥用问题。行动涵盖清理违法违规信息、查处违规账号及处置违规网站与应用。多地网信部门推出精准治理举措,主流平台则通过强化技术赋能提升智能检测效率。此外,头部大模型平台严格审核原始语料,应用商店收紧开发者准入规范,从源头防范 AI 生成内容的违规传播。
亮点提要:
重点整治利用 AI 制作虚假信息、传播低俗内容及魔改名著等技术滥用行为。
多地网信部门推出精准治理措施,显著提升对违规内容的识别与处置能力。
通过源头审核机制和平台技术升级,有效遏制 AI 生成内容的违规传播路径。
4. 豆包手机 9 月开售:命名努比亚 NaviX Ultra,主打 AI 智能体旗舰
努比亚 NaviX Ultra 作为全球首款 AI 智能体旗舰手机,通过将大模型智能体嵌入系统底层,实现了与传统 AI 手机的本质区别。凭借强大的智能操作能力和本地化隐私安全保障,该设备为用户带来了全新的交互体验。

亮点提要:
采用 AI 原生手机架构,大模型智能体直接嵌入系统底层,操作体验更高效。
具备强大智能操作能力,AI 可自动完成订票等复杂任务,无需用户手动干预。
强化隐私安全保障,所有运算和数据记忆均在本地完成,不上传云端。
5. Meta 首发实时音频感知模型,支持 20 多人分轨转写
Meta 推出首个实时音频感知模型 Muse Voice Transcribe,支持流式语音识别、说话人分离与端点检测,广泛适用于会议记录和通话字幕等场景。该模型可同时处理 20 余名说话者的录音,支持 70 余种语言,并引入自适应延迟机制以平衡响应速度与准确率。

亮点提要:
作为实时音频感知模型,支持“边说边出字”的流式语音识别功能。
可分离并自动转写 20 余名不同说话者的声音轨道。
支持 70 余种语言,具备自适应延迟机制以进一步提升识别准确率。
6. Anthropic 发布 Fable 5.1:性能狂飙且成本骤降四成
Anthropic 发布新一代旗舰大模型 Fable 5.1,在性能与成本方面实现双重突破。Fable 5.1 在多项基准测试中超越前代产品及竞争对手,同时大幅降低使用成本,特别是在处理智能体化复杂任务时,成本节省最高可达 45%。这标志着 AI 大模型的竞争已向极致性价比全面延伸。

亮点提要:
Fable 5.1 在多项基准测试中全面超越上一代模型及主要竞争对手。
基础使用成本降低 25%,复杂任务成本节省幅度高达 45%。
为 Anthropic 上市提供强有力的技术支持,有望刷新 IPO 募资纪录。
7. 谷歌 Gemini 3.8 Flash 内测代号"Skimaki",强化编程与 RL 能力
谷歌在人工智能领域迎来关键更新,推出 Gemini 3.8 Flash 模型,其编程能力显著提升。与此同时,DeepMind 团队经历重要人事调整,谷歌也进一步加大对强化学习(RL)的投入力度,以应对激烈的市场竞争。
亮点提要:
推出内部代号为"Skimaki"的 Gemini 3.8 Flash 模型,重点提升编程能力。
DeepMind 团队 undergo 人事调整,Koray Kavukcuoglu 接任高级副总裁,强调加快执行速度。
谷歌将更多研发资源和算力倾斜至强化学习环节,并招募 Barret Zoph 负责技术攻坚。
8. 谷歌 AI 修图工具 Pics 上线,Docs 与 Slides 可直接编辑
谷歌正式推出 AI 图像设计与编辑工具 Google Pics。用户可在网页版或直接于 Google Docs、Slides 中使用该工具,支持素材上传、对象分割和文字修改等功能。目前,个人和企业用户正分阶段开放访问权限。

亮点提要:
支持上传素材或输入提示词生成图片,并可在 Google Docs 和 Slides 中直接编辑。
具备精确的对象分割能力,允许用户单独调整图片中的物体或文字元素。
个人和企业用户将通过特定账户或套餐逐步获得访问权限。

