大数跨境

The Batch:956 | 一个模型在说话,另一个模型在思考

The Batch:956 | 一个模型在说话,另一个模型在思考 DeeplearningAl
2026-07-20
6

Hi~新朋友,记得关注我们哟

ChatGPT 语音模式升级:支持全双工实时对话,复杂任务自动移交推理模型

最新消息:GPT-Live 系列模型发布

核心动态:7 月 8 日,OpenAI 正式发布 GPT-Live-1 和 GPT-Live-1 mini 两款语音模型,为重构后的 ChatGPT Voice 提供驱动。新模型采用“全双工”(Full-duplex)技术,实现音频的同步收发,彻底改变了以往“对讲机式”的轮流交互模式。

关键特性:

  • 连续交互:输入与输出重叠处理,支持实时打断、插话及自然停顿反馈(如“嗯”、“对”)。
  • 智能分工:遇到需深度推理的任务时,语音模型会将问题无缝移交后台 GPT-5.5 处理,期间保持对话流畅,结果生成后自动整合。
  • 功能升级:支持实时翻译、9 种重塑语音(含防克隆保护);GPT-Live-1 用户可调节推理强度(即时/中/高),分别调用 GPT-5.5 Instant 或 Thinking 版本。
  • 性能跃升:在 GPQA 基准测试中,高推理模式下得分达 84.2%(前代 AVM 为 45.3%);人工评测偏好度提升至 75.7%。
  • 覆盖范围:已登陆 iOS、Android 及 Web 端。Plus/Pro 会员默认使用 GPT-Live-1,免费用户使用 mini 版。开发者 API 尚未开放。

未披露信息:参数量、架构细节、训练数据截止点及具体延迟数据暂未公布。

运作方式:多模型集成系统

OpenAI 发布的系统卡显示,GPT-Live 由多个模型协同工作,主要革新在于连续音频处理任务动态委派

  • 实时决策:模型每秒多次判断下一步动作(说话、聆听、等待、插话或触发工具),无需等待轮次结束。
  • 任务编排:涉及网页搜索或多步推理时,前台语音模型将任务委托给 GPT-5.5,两者共享上下文但独立运行。未来系统将自动适配更新的推理模型。
  • 同步安全:安全检查贯穿对话全程,可实时中断风险回复、播放安全提示或提供援助资源。

性能表现:全面超越前代

内部评估显示,GPT-Live 在复杂任务处理与安全合规上显著优于前代 Advanced Voice Mode (AVM):

  • 科学推理:GPQA(研究生级科学题)高推理模式得分 84.2%,AVM 仅为 45.3%。
  • 事实检索:BrowseComp 基准测试中,正确率高达 75.2%,而 AVM 仅 0.7%。
  • 用户体验:在 5-10 分钟的配对对话中,GPT-Live-1 在流畅度、打断处理等方面获 75.7% 的人类评审偏好。
  • 安全合规:非法行为识别率提升至 97%(AVM 为 74%);自我伤害相关查询识别率达 98%;心理健康对抗性提示识别率提升至 84%。

新闻背后:行业趋势与竞争格局

GPT-Live 的两大核心技术——全双工处理与推理模型编排,并非孤立创新。阿里巴巴 Qwen2.5-Omni、Thinking Machines Lab 及 Kyutai 的 Moshi 等均已探索类似架构。谷歌 Gemini Live 亦提供连续对话及屏幕共享功能。OpenAI 的优势在于将该技术组合大规模推向大众市场,目前 ChatGPT 语音功能周活跃用户超 1.5 亿。

重要原因:布局硬件生态

此次升级折射出 OpenAI 更大的战略野心。据彭博社报道,公司计划年底前发布一款无屏便携智能音箱,完全依赖 GPT-Live 进行语音交互,预计 2027 年初上市。该设备旨在通过持续学习实现高度个性化,成为日常生产力的核心交互界面。

我们在想:解耦带来的长远价值

全双工技术消除了传统语音系统中繁琐的静默检测与缓冲计时,让交互更自然。但更具深远意义的是对话层与推理层的解耦:这使得语音接口能即时继承前沿模型的智力升级,无需在“响应速度”与“思考深度”之间妥协。全双工让语音更好聊,而智能委派让语音值得聊。

【声明】内容源于网络
0
0
DeeplearningAl
吴恩达老师的人工智能教育传播平台.
内容 1300
粉丝 0
DeeplearningAl 吴恩达老师的人工智能教育传播平台.
总阅读16.9k
粉丝0
内容1.3k