大数跨境

AI大模型产业最新动态:十大热点新闻与解读 -2026年9月13日

AI大模型产业最新动态:十大热点新闻与解读 -2026年9月13日 模达科技-AI绘未来
2026-09-13
388

“ 模达卓越,智启未来”

www.modatech.com.cn / www.modatech.cn









 模达卓越,智启未来

   模达科技       

www.modatech.com.cn / www.modatech.cn

国内外大模型发展如火如荼,近期有哪些值得关注的新闻?一起看看吧!

国际篇

INTERNATIONAL NEWS

  • 微软发布MAI-Image-2.6-Flash:图像生成速度提升2.8倍

微软9月正式推出自主研发图像生成模型的轻量化变体MAI-Image-2.6-Flash,并已通过Microsoft Foundry开启公开预览。作为上月登顶技术榜单前列的MAI-Image-2.6的高效率版本,该模型的推出标志着微软在AI图像生成领域全面展开对高并发、低延迟及成本敏感型工业级应用场景的布局。

测试数据显示,MAI-Image-2.6-Flash的图像生成速度达到GPT-Image-2-Medium的2.8倍,整体综合效率提升达72%。在大幅削减推理延迟与计算开销的同时,该变体完整继承了主模型的核心生成与编辑能力,支持高精度的文本到图像生成以及局部对象级图像编辑。

此外,MAI-Image-2.6系列整体带来了多项架构级升级,包括支持最多5张参考图以保障多图角色与产品的一致性、集成Bing搜索的网络定位功能以补充现实世界图像信息,并新增对动态宽高比和更高分辨率输出的原生支持。

在商业化定价策略上,Flash版本将文本输入、图像输入和图像输出的每百 Token价格分别下探至1.75美元、2.50美元和19美元,较主模型实现了超过50%的显著降本。

微软官方建议将主模型应用于对画质和文本渲染要求苛刻的商业设计与最终生产资产,而将Flash版本精确定位于交互式应用、快速创意迭代以及大规模自动化流程。这一兼顾极端性能与极致性价比的多模态模型矩阵,反映出当前生成式AI从单一技术突破向高吞吐量、低成本工程化落地演进的行业趋势。


  • 马斯克杀入Copilot主场:Grok Bot深度接管微软账号

Grok Bot近期迎来重大升级,正式宣布全面接入微软账号。通过专属插件打通Outlook、日历(Calendar)以及OneDrive等核心办公组件,它可以全方位协助用户完成收发并整理邮件、创建修改及回复会议日程,以及浏览和上传网盘文件等复杂的日常办公任务。

实际上,相关的底层连接器早在今年5月就已经问世。而此次更新的核心亮点,在于将这些连接器适配成了常驻云电脑的Grok Bot插件。这一改变使 Grok Bot从过去的“被动响应指令”实现了质的飞跃,能够真正意义上主动处理各项工作,例如自动阅读邮件并预先撰写回复草稿等。

在行业生态与技术路径方面,各大科技巨头和开源社区都在积极布局微软账号智能体。目前,微软Copilot、Anthropic以及开源项目OpenClaw等都在这一赛道展开竞争。值得注意的是,微软采取了对第三方相对开放的标准授权流程,而谷歌相对而言则对自动化登录设置了更多的限制条件。

与其他同类产品相比,Grok Bot的最大特点在于用户无需自行配置复杂的本地设备或服务器。在完成授权后,它便能够在云端进行7×24小时的全天候不间断运行。为了确保安全和可控性,系统规定所有关键操作在执行前必须经过用户的审批确认,最终的拍板权始终掌握在用户自己手中。

图源:网络


  • 达芬奇DaVinci Resolve 21.1发布:接入Claude Code与ChatGPT Codex

剪辑师的终极效率神器来了。Blackmagic Design官方9月8日正式推出视频剪辑软件DaVinci Resolve21.1,此次更新迎来了一次突破性的智能化升级,全面接入了Claude、Claude Code以及ChatGPT Codex等一众顶尖AI助手。

在核心功能上,用户现在可以直接通过日常语言与AI展开交互,由其代劳原本繁琐的常规操作。无论是在庞大的素材库中进行项目分析、智能化整理媒体文件、修改各项软件设置,还是执行批量的视频渲染,AI都能轻松驾驭。不仅如此,剪辑师只需向AI助手下达指令,它便能从海量长视频中精准剪辑出精彩片段、自动剔除冗余画面,甚至直接辅助完成最终视频的渲染工作。这一变革将彻底把创作者从低效重复的劳动中解放出来,让更多的时间和精力回归到纯粹的创意构思中。

除了备受瞩目的AI助手矩阵,新版本在传统影像制作的硬件与工作流适配上也做出了多项实用改进。达芬奇的照片页面迎来了重要扩展,现已原生支持富士GFX及X系列相机、徕卡SL以及索尼α7R VI等主流机型。摄影师和剪辑师在日常拍摄后,可以直接导入这些相机的原始格式照片进行处理,彻底省去了繁琐的格式转换环节,实现高效直出的无缝衔接。

此外,DaVinci Resolve21.1针对影视后期的实际痛点,进一步优化并升级了多机位工作流,大幅提升了多视角切换与同步的流畅度。同时,软件官方还在此次更新中引入了全新的图形工具,为创作者在视觉特效、调色及画面修饰上提供了更加丰富、精细的表现手段。

图源:网络

  • 告别配音“对不上嘴”!亚马逊Prime Video重磅上线AI口型同步技术

语言不通造成的影视剧观看违和感即将成为历史。当地时间9月9日,亚马逊通过新闻稿正式宣布,旗下流媒体平台Prime Video全面上线全新的AI口型同步功能。该技术能够巧妙地将演员的嘴部动作与真人配音的音轨进行精准对齐,彻底解决过去跨语言配音时画面与声音脱节的痛点。

作为该功能的全球首发落地项目,目前这项技术率先支持德国热门剧集《贵族高中:我们之间的鸿沟》的英语配音版。全球订阅用户已经可以在该剧的第一季和第二季中体验到这一全新的视听效果。同时,亚马逊官方确认,即将在12月9日上线的第三季也将同步支持该项AI口型同步功能,并在未来逐步扩展到更多影视作品中。

在技术实现层面,Prime Video的这项创新融合了最前沿的人工智能与视觉特效技术,确保演员在说出翻译后的台词时,面部视觉效果与听觉声音能够完美契合。值得注意的是,随着生成式AI在视频领域的快速普及,整个行业都在积极布局这一赛道。例如,Meta和YouTube近期也相继面向创作者推出了人工智能自动配音功能,并自带“口型同步”选项,让视频中的人物看起来就像是在直接使用观众偏好的语言进行交流。

回顾这一功能的演进过程,亚马逊其实早有布局。早在去年,Prime Video便已经开始在《熙德:传奇》、《我的鹦鹉妈妈》以及《久别重逢》等12部精选电影和电视剧中,针对英语和西班牙语进行“AI辅助”配音的初步试验。随着此次正式上线与规模化应用,流媒体的全球化内容分发正迎来一场全新的技术升级。

图源:网络


  • OpenAI开放GPT-Live-1 API:每分钟0.05美元

OpenAI近日宣布,将目前用于ChatGPT语音功能的GPT-Live-1正式开放给开发者使用。开发者现在可以通过API把这一语音模型集成到自己的应用和业务流程中,构建能够实时听取用户讲话、同时进行回应的全双工语音助手。该模型的语音前端价格为每分钟0.05美元,后台用于复杂推理的模型则需按相应模型价格另行计费。

边听边说,打断与停顿都能自然处理

GPT-Live-1是OpenAI今年推出的新一代实时语音模型,最大特点是采用全双工架构。传统语音AI通常依次完成语音识别、语言模型推理和语音合成三个步骤,用户说完话系统才能处理并生成回答;而GPT-Live-1能在听取用户讲话的同时生成语音输出,因此可更自然地处理打断、停顿、附和以及快速的来回对话,还能判断何时该继续说话、暂停、倾听或调用工具。

OpenAI表示,这种架构明显降低了语音交互延迟,解决了传统流水线容易出现的衔接问题,开发者无需再自行协调多个独立模型之间的复杂切换。测试中,GPT-Live-1在Full Duplex Bench上比GPT-Realtime-2.1高出 30 个百分点,尤其在轮流发言延迟与交互行为方面提升明显;与GPT-6 Astra 以中等推理强度配合时,在评估端到端语音智能体任务的Tau3测试中也取得第一名。

复杂推理交给后台模型,成本可按需组合

GPT-Live-1并不负责所有复杂推理。OpenAI将负责实时听说交互的语音模型与负责深度推理的后台模型分离:当用户提出需要搜索、复杂分析或较长任务的问题时,GPT-Live-1会把工作交给后台模型,同时继续维持自然语音交流。开发者因此可按业务选择后台模型——简单任务用更快更便宜的模型,复杂问题交给更强的推理模型。

应用方面,GPT-Live-1原生支持电话场景,可用于餐厅预约、客户支持等全双工语音智能体。早期案例中,语言学习平台Speak发现,相比此前基于轮次的系统,GPT-Live-1使系统主动打断学习者的情况减少接近80%。

模型还提供原生语音识别转写与响应文本,支持关键词偏置、轮次检测,并针对嘈杂环境做了优化;OpenAI同时扩大了可用声音,覆盖更丰富的口音、方言和语言。开发者还可将GPT-Live-1与Codex等工具结合,由语音模型接收任务、后台工具处理,再回到语音对话。

图源:网络


国内篇

DOMESTIC NEWS

  • 微信内测“小微AI社交”新功能,支持原生AI助手跨账号代理沟通

9月7日,据媒体报道,微信正在小范围内测全新“小微AI社交”功能,标志着其原生智能助手在Agent(智能体)社交协同领域迈出关键一步。腾讯官方目前对该消息暂无正面回应。

在本次内测的业务逻辑中,用户只需向自身账号下的“小微”下达意图指令,“小微”即可跨账号寻找目标好友的“小微”展开独立跨端对话。在获得对方授权确认后,两个AI智能体将先行完成需求对接与信息交换,最终将协同结果带回;若交互过程涉及关键决策,系统会及时提醒用户进行人工确认,形成“AI先行沟通、用户最终拍板”的闭环链路。

据腾讯客服介绍,作为集成于微信主界面左上角入口的原生AI助手,“小微”此前已具备丰富的生态连接与交互能力,包括通过自然语言对话操作调设置、发消息、打音视频通话及搜索朋友圈等原生功能,调起服务类小程序完成挂号或买咖啡等日常履约,搜索生成多媒体内容,以及在聊天框内提供总结与回复建议等。

此次“AI社交”能力的引入,推动微信“小微”从单一的工具型单机助手向多智能体协同网络演进。这一动作不仅凸显了头部社交平台将大模型能力深融入即时通讯底层生态的战略意图,也预示着未来的人际交互正在加速向“ Agent对齐”与“智能体代理社交”的新阶段转型。

图源:网络

  • 小鹏人形机器人自动化生产线正式启用,核心制程自动化率超80%

9月8日,小鹏机器人生产线正式启用,全球首位高阶通用人形机器人完成自动化总装并自主走下产线亮相,标志着小鹏机器人正式完成从研发试制到产线制造关键跨越,向规模量产迈出重要一步。

针对人形机器人长期停留在小批量、半手工装配阶段,且规模化制造极其困难的行业痛点,小鹏集团自主设计开发了全球首条高阶人形机器人自动化产线。该产线将汽车工业成熟的质量体系与人形机器人精密制造深度融合,以车规级一致性标准打造高阶人形机器人的量产品质体系。

在技术与工艺层面,该生产线以规模量产为目标进行正向开发,核心制程自动化率超80%,构建起高精度、高柔性与智能化的制造体系,不仅确保了关键工序的稳定一致,也为后续规模化生产和快速扩产奠定了扎实基础。

小鹏集团董事长、CEO何小鹏表示,该自动化生产线是从零创造、无先例可循的全新品类产线,小鹏致力于打造具备全泛化能力的新型机器人。此次车规级制造体系在机器人领域的成功落地,不仅验证了跨工业门类制造经验赋能硬件创新的可行性,也将进一步加速人形机器人产业从实验室走向商业化大规模应用。

图源:网络

  • 曹操出行联合豆包上线AI打车服务,首批落地北京、杭州、苏州

曹操出行与豆包联合推出的AI打车服务已在北京、杭州、苏州上线。用户在豆包内咨询路线、地点、餐饮娱乐等本地生活信息时,系统可根据对话内容生成出行方案,并直接衔接曹操出行的打车服务。

曹操出行表示,后续双方还将拓展智能车控等AI出行功能,并将相关服务向更多城市复制,同时进一步探索Robotaxi服务能力。

图源:网络

  • DeepSeek V4.1 Flash发布:原生多模态视觉理解全面超越Pro版

深度求索发布全新模型结构系列最小尺寸成员DeepSeek V4.1Flash,具备原生多模态视觉理解能力,旨在实现更高能力上限、更快推理速度与更大吞吐量,并支持向更大参数扩展。

该模型采用552B参数 MoE架构,创新性引入Causal-Encoder-Decoder结构,输入输出不对称设计使输入激活仅8B、输出激活16B,成本显著低于同尺寸模型。配合全新预训练与大规模强化学习后训练,其智能水平超越 DeepSeek V4Pro等旗舰。

效率方面,KV Cache大幅压缩,HBM需求减至上一代1/4、SSD减至 1/8,Agent场景成本显著降低,相对初代KV Cache已缩减至1/437。

V4.1Flash已上线API,模型名为deepseek-flash;旧版V4Flash系列已下线,旧模型名暂时路由至新模型。官方计划有序下线V4Pro:9月14日12:00后至V4.1Pro上线前,deepseek-v4-pro请求将路由至V4.1Flash计费。腾讯WorkBuddy、CodeBuddy、OpenCode已全量接入。API定价同步下调,延续峰谷定价,闲时为高峰一半,新价格已于9月10日12:00生效。

图源:网络

  • 商汤AI办公智能体“小浣熊”移动端上线:手机发指令,电脑持续执行

商汤科技推出的AI办公智能体“小浣熊”移动端App正式上线,支持iOS和安卓系统,用户可通过自然语音快速对话操作,实现手机发指令,电脑持续执行。该智能体搭载多模态智能体创作引擎,能够理解整理用户碎片化信息,并具备长链条思考及企业内外部信息融合能力

图源:网络

>>>>>>END<<<<<<

模达科技AI前沿,与您一起见证智能科技的蓬勃发展!

文章仅代表我司观点,请您甄别借鉴。



模达科技公众号

微信号 : modatechsub

 扫码关注我们。

【声明】内容源于网络
0
0
模达科技-AI绘未来
1234
内容 80
粉丝 0
模达科技-AI绘未来 1234
总阅读8.7k
粉丝0
内容80