大数跨境

用豆包当播客嘉宾、监督收行李……实测字节SeedRealtime三大硬核新功能

用豆包当播客嘉宾、监督收行李……实测字节SeedRealtime三大硬核新功能 AI新榜
2026-08-10
5
导读:豆包音视频通话,离真人搭子进了一步

豆包近期悄然升级了音视频通话功能,展现出诸多创新应用场景。除了实时监督孩子作业并分析错题外,它还能在桌游中担任"AI 判官”,全程跟进游戏进程,精准判断出牌顺序与犯规行为。

这一变化源于字节跳动 Seed 团队于 8 月 5 日发布的原生音视频全双工大模型 SeedRealtime,该模型已在豆包 APP 全量上线。此次升级聚焦三大核心能力:音视频联合理解、主动交互能力以及流畅的交互节奏。用户更新至最新版本即可体验视频通话新功能。

与此前版本相比,新模型实现了从“被动响应”到“主动陪伴”的跨越。旧版豆包类似群聊中的 AI,需被"@”才回应;新版则如同全天候在线的搭档,能自主判断介入时机。例如,在博物馆参观时,用户只需预设“看到铜老虎提醒我”,无需反复确认,AI 识别目标后便会主动提示;在多人交谈中,它也能智能判断何时补充信息或保持静默。

所谓“全双工”,即通信双方可同时进行数据发送与接收。传统大模型对话 akin 对讲机模式(说完一轮再回应),而 SeedRealtime 更贴近真人视频聊天场景:支持随时插话、打断,AI 能在倾听的同时实时观察画面变化并做出反应。

理论上,电商从业者可利用该功能打造不仅能念稿,还能根据弹幕实时场控的直播数字人。但这要求 AI 具备精准的身份识别、复杂环境下的关键信息提取、长程记忆及社交分寸感。本次测试将重点验证上述能力。

语意模糊时,豆包能否自主理解?

SeedRealtime 的首要能力是“音视频联合理解”,即整合画面、声音与时序信息进行综合研判,实现边看、边听、边说的同步处理。

测试选取“同事点下午茶”这一常见场景,由三人模拟点单过程,重点考察三项指标:话语不完整时能否通过画面补全信息、语音不清时能否依赖视觉判断、订单频繁变更时能否准确记忆最终结果。

测试初期,我们隐藏了关键身份信息,仅告知豆包“穿粉色条纹的是小 A",随后让小 A 指向菜单上的冰美式并说“我要这个”。豆包成功结合外貌特征与手势动作,准确识别出人物及其所点饮品。

随后增加难度:选取两款读音相近的饮品,故意含糊发音但明确指向其中一款。豆包未单纯依赖模糊语音猜测,而是借助画面信息做出了正确判断。

在记忆力测试环节,三人依次用手势点单,期间穿插闲聊并多次修改订单(如小 A 从饮料 a 改为 b,小 C 二次点单更换品种),且未每次提醒豆包注意变更。测试结束时提问“小 A 最终点了什么”及“小 C 第二次点的什么”,豆包均回答正确。这表明其不仅具备听觉记忆,更能理解事件发生的时序逻辑及覆盖关系,拥有出色的上下文理解能力。

此项能力极大降低了使用门槛,让用户无需像编写 Prompt 般严谨表达。无论是组装家具时指着零件询问连接方式,还是烹饪中途确认调料是否已放,均可通过最自然的交互方式完成。

无需指令,它会主动提醒吗?

第二项核心能力为“主动的交互能力”。用户在视频通话中预设关注目标后,即可专注于自身事务,待目标出现或画面发生变化时,AI 将主动发出提醒。官方演示包括博物馆展品识别及论文特定章节定位等场景。

本次测试模拟“赶高铁前收拾行李”的紧迫场景。用户告知豆包需携带钥匙、白色充电器、笔及红色小包等物品,随后开启视频自行收拾,未附加“发现遗漏立即提醒”的指令,以观察其自主监控能力。

测试显示,当镜头扫过目标物品时,豆包能主动提示具体位置,有效辅助整理。但也存在误判情况:曾将黑色充电器误认为白色目标,或在笔未入镜时错误报告已发现。经追问后,它能重新确认并修正错误。

在抗干扰测试中,用户一边收拾一边与他人闲聊,豆包未因环境噪音而中断任务或遗忘指令。然而,当用户故意遗留白色充电器并询问“是否齐备”时,豆包错误地确认可以出发;即便随后将已打包物品重新放回桌面,它仍维持“全部收好”的判断。更甚者,它能指出笔未带走,却同时结论“东西已齐”,显示出逻辑一致性尚待优化。

尽管表现并非完美,但豆包在目标出现时的主动提醒能力及抗干扰性,已证实 SeedRealtime 在主动交互层面的显著进步。未来,该功能可拓展至健身动作纠正、会议发言提醒等“监工”场景。

多人对话中,豆包懂得适时开口吗?

第三项能力“流畅的交互节奏”,旨在赋予 AI 类似人类的社交直觉,解决“何时说话、何时闭嘴”的难题。

测试将豆包引入实时播客录制现场,考察四种情境:被点名时能否接话、未点名但语境指向时能否领会、被人打断时能否识趣停声、他人交谈时能否避免乱插嘴。

结果显示,当直接被问及“豆包你怎么看”时,它能正常回应;在未称呼名字仅问“那你呢”时,它也能敏锐捕捉语境并主动接话。在人声打断测试中,豆包能迅速停止输出,不强行覆盖人声,表现出接近真人的交谈礼仪。

更具亮点的是其主动性。当讨论涉及"AI 答案给得太快”或"AI 别太懂事”时,即便无人点名,豆包也能顺势加入讨论甚至追问,成功扮演了对谈嘉宾的角色。

在嘈杂的多人大环境中,克制插话尤为关键。如在机场场景中,即便旁人提及“航班”等关键词,豆包也未误判为对自己的呼叫,仅在用户明确提问时才作答。在陪练英语场景中,即使背景有人打电话,它仍能专注跟随孩子的学习进度。

实时音视频的未来想象

经过多轮测试,豆包已初步具备“现场搭子”的特质:无需详尽指令,懂得察言观色。虽然在复杂场景的判断与主动提醒的稳定性上仍有提升空间,但其展现的潜力已激发无限遐想。

未来应用前景广阔:旅行时可辅助识别路牌景点,帮助老人操作设备,或作为内容创作者的探店、Vlog 及综艺节目的第三方嘉宾。若主动提醒能力进一步稳定,还可应用于资料检索、会议议题监控等长链条任务。

实时音视频技术的下一站,是应对动态变化的真实生活现场。AI 不应局限于静态的图片或音频分析,而需适应人的走动、意图变更及环境流转,精准拿捏介入时机。随着技术成熟,AI 眼镜、耳机等随身设备有望承载这样一个“平时不打扰、需时能帮手”的智能伙伴。

届时,用户无需苦思 Prompt,只需打开视频,即可将 AI 召唤至现场协助解决问题。

【声明】内容源于网络
0
0
AI新榜
做内容从业者关心的AI研究,发布AI产品榜.
内容 1478
粉丝 0
AI新榜 做内容从业者关心的AI研究,发布AI产品榜.
总阅读94.2k
粉丝0
内容1.5k