这是我的第475篇Ai笔记,本篇2222、累计笔记8433187
彩蛋:文末给大家准备了一份《SeedRealtime 20个实用场景清单》,可以照着试一试。
豆包最近又悄悄搞了个大动作。
这次没有发布什么惊天动地的新模型,升级的是一个很多人可能根本不会特别关注的功能:视频通话。
但我把资料和演示完整看了一遍之后,突然觉得,这次更新可能比很多跑分第一更值得普通人关注。
因为现在的豆包,已经开始能够一边看着你,一边听你说话,同时还能随时开口回应。你话没说完,它会继续听;旁边有人插话,它会判断是不是在跟它说;甚至画面发生变化以后,它还可以在合适的时候主动提醒你。
8月6日公开的信息显示,豆包视频通话正式接入原生音视频全双工模型 SeedRealtime,可以在连续变化的真实场景中实现边看、边听、边说,目前已经面向用户开放体验。
简单来说:
以前你是在使用AI。
现在,它开始尝试真正待在现场了。
为什么我觉得这次升级很重要?
以前很多AI视频通话,本质上还是一条流水线:先听你说话,再转成文字,视觉模型负责看,大模型负责想,最后再把答案念出来。
每个模块都很强,但串起来以后就特别容易出现一种熟悉的“机器感”:你还没说完,它抢话了;你已经说完,它又愣两秒;旁边有人聊天,它突然以为是在叫它。
所以跟传统AI语音助手聊天,经常像拿着对讲机。你说完,我再说。
这次 SeedRealtime 想解决的,就是这个问题。
它采用端到端架构,把声音和画面放进连续的信息流中处理。公开资料显示,在人工评测中,对话节奏相关问题减少了一半,抢话和回应迟缓等现象明显降低。
但真正让我觉得有意思的,是:眼睛也进来了。
过去很多多模态AI更像“给我一张图,我帮你分析”。
现在开始变成:“我一直跟着现场看。”
你刚才指了什么、镜头扫过哪里、现在谁在讲话、画面发生了什么变化,这些连续的信息都会影响AI接下来的判断。
从“识别一张图”到“理解正在发生的事情”,差别其实非常大。
那这种能力到底能干什么?
我觉得三个场景最能说明问题。
01|你说“这个”,它终于知道你指的是谁
想象一下,你把镜头对着桌面,上面同时放着咖啡机、杯子和几个按钮,然后问一句:
“这个怎么用?”
现实中的人会结合你的手势、动作和刚才发生的事情,自然判断“这个”到底指什么。
SeedRealtime 这次会同步处理声音、视觉画面以及连续的时间信息,所以它看到的不再只是某一帧截图,而是整个持续发生的现场。
这件事真正重要的地方在于:以前我们得把话说得越来越像提示词。
现在机器终于开始学习:人到底是怎么说话的。
02|多人聊天,它开始知道谁在跟它说话
第二个场景更难:
多人对话。
一个房间里只要多两个人,传统语音助手就很容易乱套。
A在问AI问题,B在旁边聊天,电视里还有人在说话。
到底听谁的?
SeedRealtime 可以结合声音和画面判断当前发言对象,以及现在应该倾听、回应还是保持安静。公开资料给出的场景中,就包括多人聚会持续对应不同发言者,以及在嘈杂环境中区分用户主述和旁人闲聊。
这个能力如果稳定下来,意义就不只是视频聊天。
会议助手、家庭陪伴、智能眼镜、机器人,未来都会遇到同一个问题:现场这么多人,你得知道谁是在跟你说话。
03|最难的能力,其实是知道什么时候闭嘴
第三个能力,我觉得反而最容易被低估:停顿。
比如你说:“我觉得这个方案吧……”
然后停了一秒。
正常人知道,你可能只是在组织语言。
传统AI很可能已经冲出来开始回答了。
所以真正自然的实时AI,难点不只是“会不会说”,还得知道:
什么时候该说,什么时候继续等。
SeedRealtime 会实时感知用户的语速和停顿,并结合现场情况判断什么时候接话、回应或者保持安静。
这也是我觉得这次升级特别有意思的地方。AI开始学的不只是怎么回答。
还有:什么时候别说。
当然,夸了半天,该泼的冷水还是要泼。
千万别看到“边看、边听、边说”,就直接脑补成贾维斯已经住进手机里了。还早。
第一,交互更自然,不代表已经和真人一样。
现在能确认的是抢话、迟缓等节奏问题得到了明显改善。
但真人聊天里的随时打断、情绪变化、多人插话、半句话理解,复杂度要高得多。
第二,加入视觉以后,稳定性只会更难。
声音本来就要处理噪音、停顿和重叠语音,现在还要继续判断手势、镜头变化、物体关系和上下文。
官方演示好看是一回事。
真正连续用十几二十分钟还能不能稳稳跟住,才是硬指标。
所以现在我不会把它吹成什么“AI真人朋友”。
但我愿意给它一个更准确的评价:实时多模态AI,开始真正有用了。
最后,老规矩,用三句话总结一下。
1. SeedRealtime真正重要的地方,不只是豆包多了一个更自然的视频通话,而是AI开始从“等你提问”,进入持续看、持续听、实时参与的阶段。
2. “边看、边听、边说”背后解决的是一个更大的问题:AI能不能把连续发生的声音、画面、动作和对话放在一起理解。
3. 以后AI助手真正拉开差距的地方,可能不只是知道多少知识,而是你在做事情的时候,它能不能一直跟得上,还知道什么时候该帮忙、什么时候该闭嘴。
为了让大家更新完豆包之后,不至于打开视频通话又不知道该玩什么,我整理了一份:
《SeedRealtime 20个实用场景清单》
里面包括旅行翻译、设备操作、口语陪练、博物馆导览、做饭指导、多人对话等场景,每个都配了可以直接照着说的测试指令。
扫码回复关键词【实时】,直接领取。

