大数跨境

AI日报:World Labs推多模态世界模型Atlas;WorkBuddy宣布开放平台上线;网信办重点整治AI换脸、魔改名著

AI日报:World Labs推多模态世界模型Atlas;WorkBuddy宣布开放平台上线;网信办重点整治AI换脸、魔改名著 AIbase基地
2026-09-02
5
AI 日报

9 月 2 日•AIbase

1、World Labs 推首个多模态世界模型 Atlas,像素级镜头控制拍出电影级“子弹时间”大片

2、腾讯 WorkBuddy 宣布开放平台上线,全面开放 Agent 基座能力

3、网信办重点整治 AI 换脸、魔改名著,豆包等主流模型严格限制违规输出

4、豆包手机 9 月开售:命名努比亚 NaviX Ultra,号称全球首款 AI 智能体旗舰

5、Meta 首发实时音频感知模型:支持 20 多人分轨转写,每千分钟仅 3 美元

6、Anthropic 发布 Fable 5.1:性能大幅提升,成本骤降四成

7、谷歌 Gemini 3.8 Flash 内测代号"Skimaki",最快周三上线决战竞品

8、谷歌 AI 修图工具 Pics 上线:Docs 与 Slides 中点击图片即可编辑

1. World Labs 推出全球首个多模态世界模型 Atlas,实现像素级镜头控制

World Labs 正式发布全球首个多模态世界模型 Atlas。该模型的核心突破在于具备像素级的相机控制能力,能够生成高质量图像与视频,并精准重建三维空间。Atlas 不仅支持从多张图像生成 3D 模型,还能基于文本生成图像及全景视图,展现出卓越的世界生成、重建与时空模拟能力。

亮点提要:

Atlas 模型能以像素级精度控制相机,生成图像和视频帧,并在三维空间中完美重构场景。

支持从单张或多张输入图像输出明确的 3D 模型,重建效果优于多数顶级开源模型。

具备时空模拟功能,可重新构图视频以增强戏剧性视觉效果,同时支持文本生成图像和 360 度全景。

2. 腾讯 WorkBuddy 开放平台上线,全面释放 Agent 基座能力

腾讯 WorkBuddy 宣布其开放平台正式上线,全面开放 Agent(智能体)基座能力。该平台旨在连接更多生态能力,深入 diverse 应用场景,致力于成为承载各类工具的通用平台。

亮点提要:

WorkBuddy 开放平台正式启动,首批引入超百家生态合作伙伴。

9 款联名智能硬件首发亮相,覆盖多个行业领域。

腾讯云副总裁表示,WorkBuddy 将打造面向 Agent 时代的操作系统。

3. 网信办专项整治 AI 乱象,主流大模型严管违规内容

中央网信办开展“清朗·整治 AI 应用乱象”专项行动,深度治理 AI 技术滥用问题。行动涵盖清理违法违规信息、查处违规账号及处置违规网站与应用。多地网信部门推出精准治理举措,主流平台则通过强化技术赋能提升智能检测效率。此外,头部大模型平台严格审核原始语料,应用商店收紧开发者准入规范,从源头防范 AI 生成内容的违规传播。

亮点提要:

重点整治利用 AI 制作虚假信息、传播低俗内容及魔改名著等技术滥用行为。

多地网信部门推出精准治理措施,显著提升对违规内容的识别与处置能力。

通过源头审核机制和平台技术升级,有效遏制 AI 生成内容的违规传播路径。

4. 豆包手机 9 月开售:命名努比亚 NaviX Ultra,主打 AI 智能体旗舰

努比亚 NaviX Ultra 作为全球首款 AI 智能体旗舰手机,通过将大模型智能体嵌入系统底层,实现了与传统 AI 手机的本质区别。凭借强大的智能操作能力和本地化隐私安全保障,该设备为用户带来了全新的交互体验。

亮点提要:

采用 AI 原生手机架构,大模型智能体直接嵌入系统底层,操作体验更高效。

具备强大智能操作能力,AI 可自动完成订票等复杂任务,无需用户手动干预。

强化隐私安全保障,所有运算和数据记忆均在本地完成,不上传云端。

5. Meta 首发实时音频感知模型,支持 20 多人分轨转写

Meta 推出首个实时音频感知模型 Muse Voice Transcribe,支持流式语音识别、说话人分离与端点检测,广泛适用于会议记录和通话字幕等场景。该模型可同时处理 20 余名说话者的录音,支持 70 余种语言,并引入自适应延迟机制以平衡响应速度与准确率。

亮点提要:

作为实时音频感知模型,支持“边说边出字”的流式语音识别功能。

可分离并自动转写 20 余名不同说话者的声音轨道。

支持 70 余种语言,具备自适应延迟机制以进一步提升识别准确率。

6. Anthropic 发布 Fable 5.1:性能狂飙且成本骤降四成

Anthropic 发布新一代旗舰大模型 Fable 5.1,在性能与成本方面实现双重突破。Fable 5.1 在多项基准测试中超越前代产品及竞争对手,同时大幅降低使用成本,特别是在处理智能体化复杂任务时,成本节省最高可达 45%。这标志着 AI 大模型的竞争已向极致性价比全面延伸。

亮点提要:

Fable 5.1 在多项基准测试中全面超越上一代模型及主要竞争对手。

基础使用成本降低 25%,复杂任务成本节省幅度高达 45%。

为 Anthropic 上市提供强有力的技术支持,有望刷新 IPO 募资纪录。

7. 谷歌 Gemini 3.8 Flash 内测代号"Skimaki",强化编程与 RL 能力

谷歌在人工智能领域迎来关键更新,推出 Gemini 3.8 Flash 模型,其编程能力显著提升。与此同时,DeepMind 团队经历重要人事调整,谷歌也进一步加大对强化学习(RL)的投入力度,以应对激烈的市场竞争。

亮点提要:

推出内部代号为"Skimaki"的 Gemini 3.8 Flash 模型,重点提升编程能力。

DeepMind 团队 undergo 人事调整,Koray Kavukcuoglu 接任高级副总裁,强调加快执行速度。

谷歌将更多研发资源和算力倾斜至强化学习环节,并招募 Barret Zoph 负责技术攻坚。

8. 谷歌 AI 修图工具 Pics 上线,Docs 与 Slides 可直接编辑

谷歌正式推出 AI 图像设计与编辑工具 Google Pics。用户可在网页版或直接于 Google Docs、Slides 中使用该工具,支持素材上传、对象分割和文字修改等功能。目前,个人和企业用户正分阶段开放访问权限。

亮点提要:

支持上传素材或输入提示词生成图片,并可在 Google Docs 和 Slides 中直接编辑。

具备精确的对象分割能力,允许用户单独调整图片中的物体或文字元素。

个人和企业用户将通过特定账户或套餐逐步获得访问权限。

【声明】内容源于网络
0
0
AIbase基地
1234
内容 552
粉丝 0
AIbase基地 1234
总阅读11.2k
粉丝0
内容552