大数跨境

豆包又偷偷进化了!AI终于能边看、边听、边说,这次真的有点像“真人”了

豆包又偷偷进化了!AI终于能边看、边听、边说,这次真的有点像“真人”了 我的Ai笔记
2026-08-11
0
导读:豆包视频通话接入SeedRealtime,开始实现边看、边听、边说的实时交互。
点击蓝字,关注我们


这是我的第475篇Ai笔记,本篇2222、累计笔记8433187

彩蛋:文末给大家准备了一份《SeedRealtime 20个实用场景清单》,可以照着试一试。

引言

豆包最近又悄悄搞了个大动作。

这次没有发布什么惊天动地的新模型,升级的是一个很多人可能根本不会特别关注的功能:视频通话

但我把资料和演示完整看了一遍之后,突然觉得,这次更新可能比很多跑分第一更值得普通人关注。

因为现在的豆包,已经开始能够一边看着你,一边听你说话,同时还能随时开口回应。你话没说完,它会继续听;旁边有人插话,它会判断是不是在跟它说;甚至画面发生变化以后,它还可以在合适的时候主动提醒你。

8月6日公开的信息显示,豆包视频通话正式接入原生音视频全双工模型 SeedRealtime,可以在连续变化的真实场景中实现边看、边听、边说,目前已经面向用户开放体验。

简单来说:

以前你是在使用AI。

现在,它开始尝试真正待在现场了。

思考

为什么我觉得这次升级很重要?

以前很多AI视频通话,本质上还是一条流水线:先听你说话,再转成文字,视觉模型负责看,大模型负责想,最后再把答案念出来。

每个模块都很强,但串起来以后就特别容易出现一种熟悉的“机器感”:你还没说完,它抢话了;你已经说完,它又愣两秒;旁边有人聊天,它突然以为是在叫它。

所以跟传统AI语音助手聊天,经常像拿着对讲机。你说完,我再说。

这次 SeedRealtime 想解决的,就是这个问题。

它采用端到端架构,把声音和画面放进连续的信息流中处理。公开资料显示,在人工评测中,对话节奏相关问题减少了一半,抢话和回应迟缓等现象明显降低。

但真正让我觉得有意思的,是:眼睛也进来了。

过去很多多模态AI更像“给我一张图,我帮你分析”。

现在开始变成:“我一直跟着现场看。”

你刚才指了什么、镜头扫过哪里、现在谁在讲话、画面发生了什么变化,这些连续的信息都会影响AI接下来的判断。

从“识别一张图”到“理解正在发生的事情”,差别其实非常大。

AI+

那这种能力到底能干什么?

我觉得三个场景最能说明问题。

01|你说“这个”,它终于知道你指的是谁

想象一下,你把镜头对着桌面,上面同时放着咖啡机、杯子和几个按钮,然后问一句:

“这个怎么用?”

现实中的人会结合你的手势、动作和刚才发生的事情,自然判断“这个”到底指什么。

AI以前就很容易懵。

SeedRealtime 这次会同步处理声音、视觉画面以及连续的时间信息,所以它看到的不再只是某一帧截图,而是整个持续发生的现场。

这件事真正重要的地方在于:以前我们得把话说得越来越像提示词。

现在机器终于开始学习:人到底是怎么说话的。

02|多人聊天,它开始知道谁在跟它说话

第二个场景更难:

多人对话。

一个房间里只要多两个人,传统语音助手就很容易乱套。

A在问AI问题,B在旁边聊天,电视里还有人在说话。

到底听谁的?

SeedRealtime 可以结合声音和画面判断当前发言对象,以及现在应该倾听、回应还是保持安静。公开资料给出的场景中,就包括多人聚会持续对应不同发言者,以及在嘈杂环境中区分用户主述和旁人闲聊。

这个能力如果稳定下来,意义就不只是视频聊天。

会议助手、家庭陪伴、智能眼镜、机器人,未来都会遇到同一个问题:现场这么多人,你得知道谁是在跟你说话。

03|最难的能力,其实是知道什么时候闭嘴

第三个能力,我觉得反而最容易被低估:停顿。

比如你说:“我觉得这个方案吧……”

然后停了一秒。

正常人知道,你可能只是在组织语言。

传统AI很可能已经冲出来开始回答了。

所以真正自然的实时AI,难点不只是“会不会说”,还得知道:

什么时候该说,什么时候继续等。

SeedRealtime 会实时感知用户的语速和停顿,并结合现场情况判断什么时候接话、回应或者保持安静。

这也是我觉得这次升级特别有意思的地方。AI开始学的不只是怎么回答。

还有:什么时候别说。

祛魅与吐槽

当然,夸了半天,该泼的冷水还是要泼。

千万别看到“边看、边听、边说”,就直接脑补成贾维斯已经住进手机里了。还早。

第一,交互更自然,不代表已经和真人一样。

现在能确认的是抢话、迟缓等节奏问题得到了明显改善。

但真人聊天里的随时打断、情绪变化、多人插话、半句话理解,复杂度要高得多。

第二,加入视觉以后,稳定性只会更难。

声音本来就要处理噪音、停顿和重叠语音,现在还要继续判断手势、镜头变化、物体关系和上下文。

官方演示好看是一回事。

真正连续用十几二十分钟还能不能稳稳跟住,才是硬指标。

所以现在我不会把它吹成什么“AI真人朋友”。

但我愿意给它一个更准确的评价:实时多模态AI,开始真正有用了。

三句话

最后,老规矩,用三句话总结一下。

1. SeedRealtime真正重要的地方,不只是豆包多了一个更自然的视频通话,而是AI开始从“等你提问”,进入持续看、持续听、实时参与的阶段。

2. “边看、边听、边说”背后解决的是一个更大的问题:AI能不能把连续发生的声音、画面、动作和对话放在一起理解。

3. 以后AI助手真正拉开差距的地方,可能不只是知道多少知识,而是你在做事情的时候,它能不能一直跟得上,还知道什么时候该帮忙、什么时候该闭嘴。

🎁彩蛋福利🎁

为了让大家更新完豆包之后,不至于打开视频通话又不知道该玩什么,我整理了一份:

《SeedRealtime 20个实用场景清单》

里面包括旅行翻译、设备操作、口语陪练、博物馆导览、做饭指导、多人对话等场景,每个都配了可以直接照着说的测试指令。

扫码回复关键词【实时】,直接领取。

【声明】内容源于网络
0
0
我的Ai笔记
很干货、有深度、真免费,关注“我的Ai笔记”,每天学Ai技巧! 赋能客户、助力普通人在Ai时代抢占先机。
内容 444
粉丝 1
我的Ai笔记 很干货、有深度、真免费,关注“我的Ai笔记”,每天学Ai技巧! 赋能客户、助力普通人在Ai时代抢占先机。
总阅读24.3k
粉丝1
内容444