大数跨境

减少“等AI”的时间,Gemini 3.8 Live开始边聊边干活

减少“等AI”的时间,Gemini 3.8 Live开始边聊边干活 AIGC开放社区
2026-09-17
14
导读:AI开始一边和你聊天,一边替你把事情办了

专注 AIGC 技术的专业社区,关注大语言模型(LLM)的发展和应用落地,聚焦 LLM 及 AI 技术的市场研究和开发者生态。

想象这样一个场景:你正在与 AI 讨论出行计划,话音未落它已开始查询航班;你将镜头对准桌上设备,它能依据画面实时回应;即便后台任务尚未完成,它也不会突然沉默,而是主动告知“正在处理”。

这正是 Google 于当地时间 9 月 15 日发布的 Gemini 3.8 Live 系列旨在实现的交互体验。此次更新包含两款模型:Gemini 3.8 Live主打实时、低延迟的语音交互;Gemini 3.8 Live Extended Thinking则进一步强化了后台推理与多步骤任务处理能力。

消除交互等待,实现连续对话

传统语音助手的交互逻辑多为“用户说完—AI 识别—给出回答”。一旦涉及查资料、比价或安排日程等复杂任务,AI 往往需等待工具返回结果,导致用户无法判断系统是处于思考状态还是已卡死。

Gemini 3.8 Live 致力于隐藏这段“空白期”。据 Google 开发者文档显示,该模型支持文本、图片、音频和视频多模态输入,具备实时音频流、交错式推理及异步函数调用能力。这意味着 AI 可在用户持续讲话时处理新信息,或在对话中无缝调用外部工具,将交互从“一问一答”升级为连续交流。

此外,Google 宣称该模型能自动识别并切换 97 种语言。不过需注意,实际效果仍受口音、环境噪声及具体语言组合的影响。

Extended Thinking:从问答工具进阶为任务助手

Gemini 3.8 Live Extended Thinking 的升级更为显著。当面对复杂规划、数据分析或耗时较长的工具调用时,该模型可在后台持续推理,并通过语音向用户实时反馈进度。

例如,当用户提出“制定周末上海行程”的需求时,模型可先确认预算与时间,随即并行查询交通、酒店及景点信息。在等待数据返回期间,模型不会静默,而是维持对话互动。

这一特性标志着语音 AI 正从单纯的“问答工具”向“任务助手”演进。当然,模型能否精准完成任务,仍取决于工具接口的可靠性、数据的及时性以及对用户意图的理解深度。

双模型定位:适配不同工作状态

根据 Google 的开发说明,两款模型各有侧重:

  • Gemini 3.8 Live:适用于快速响应场景,如语音搜索、客服分流、语言练习及基础设备控制。
  • Extended Thinking:更适合多步骤复杂任务,包括技术排障、深度出行规划、复杂信息检索及代码辅导。

目前,两款模型已接入 Gemini API 和 Google AI Studio。企业侧能力主要以私有预览形式提供,普通用户的具体可用功能则取决于所在地区、产品类型及订阅等级。对开发者而言,这意味着语音应用不再局限于“语音转文字后处理”,而是可以直接构建实时、双向且具备工具调用能力的语音智能体。

核心挑战:稳定性胜过榜单成绩

Google 引用了 Artificial Analysis、τ-Voice 和 Sierra 等机构的评测数据,显示 Extended Thinking 在部分语音和智能体测试中表现优异。

然而,对于语音智能体而言,榜单成绩仅是参考维度之一。用户更关注的是:AI 是否会出现听识错误、能否妥善处理打断、工具调用是否准确,以及在遇到异常时能否清晰说明。特别是在客服、办公和车载等高风险场景中,一次错误的执行操作远比回答错一个知识点后果严重。因此,随着语音交互无限接近真实工作流,其对系统稳定性、权限管理及数据安全的要求也水涨船高。

Gemini 3.8 Live 系列的核心价值,不仅在于 Google 公布的各项评测指标,更在于其尝试重塑人机交流范式:AI 无需等待用户说完,也不必在后台处理时保持沉默,而是能够实现“边听、边想、边做”。

这条技术路线最终能走多远,尚需经受真实用户体验与第三方测试的检验。但可以确定的是,语音 AI 的发展方向已从单纯的“会回答”迈向“能协助完成事务”。

【声明】内容源于网络
0
0
AIGC开放社区
1234
内容 1956
粉丝 0
AIGC开放社区 1234
总阅读56.6k
粉丝0
内容2.0k