OpenAI 刚推出了实时语音模型 GPT-Live,目前已经上线 ChatGPT 的语音功能中。这次体验非常惊艳——反应速度、对话节奏和拟人化程度,已经遥遥领先传统的 AI 语音助手。
01 不再是"你说完,我再说"
很多人会问:Gemini Live 和 Grok Voice 不是早就支持语音对话了吗,有什么不同?
区别在于,GPT Live 采用的是模型级的全双工语音架构——它可以一边说、一边持续理解你的声音。
所以在实际交流中,我可以随时插嘴打断、中间临时改口。它不仅会停下来,还能理解我为什么打断它,并接着刚才的话题继续聊。
与此同时,它对停顿和说话节奏的判断也自然了很多:我思考的时候,它不一定会马上抢话;我还没说完的时候,它会用"嗯""明白"这样的短反馈表示自己还在听。
这变化看起来不大,但它直接决定了模型给你带来的"真人感"。
02 反应快,而且更像真人
GPT Live 给我最直观的感受就是——快。
很多问题在我说完之后,它就能立刻接上。但它不是单纯抢答,而是能根据语气、停顿和上下文,判断什么时候该回应,什么时候该继续等。
它的语气和情绪也比以前更加松弛自然。特别是它还能听懂你的情绪:你笑它也笑,你严肃它的语气也严肃。回答不再总是特别完整、特别正式,而是根据当下情况来。
当然,目前中文还不是它最擅长的语言。发音没有问题,但依旧有一点"外国人说中文"的感觉。
不过在我看来,这并不影响它整体的交互能力。
03 真正的优势:记忆打通
GPT Live 另一个很重要的优势:它并不是一个独立的模型,而是可以带上文字聊天里的记忆。
在文字聊天里说过的话、你的个人偏好,都可以继续在语音里调用。结束语音之后,刚才聊过的内容也会保留在聊天窗口里,可以继续通过文字追问。
比如我直接问它"我昨天做了什么工作",它可以结合之前的文字聊天和记忆来回答。
语音不再只是厂商强行拟人化的方式,
而是开始成为完整 ChatGPT 的交互入口。
04 目前还不是完全体
当然,GPT Live 目前也有一些限制。
⚠️ 中文口音还需要继续优化
⚠️ 暂时不支持视频和屏幕共享
所以它目前最适合的场景,依然是纯语音聊天、头脑风暴和长时间陪伴式交流。
05 语音正在成为 AI 的主界面
整体体验下来,我觉得 GPT Live 最大的意义,是语音交互终于开始追上 ChatGPT 本身的能力。
自从使用 AI 以来,我几乎有一两年没有打字了,全部都用语音交互。我桌面上的话筒,以及我们公司的纽扣话筒,几乎人手一个,在公共开放区说悄悄话也没问题。
语音交互已经成为 AI 交互的主流形式,
GPT Live 还不赶紧用起来!
你平时用语音和 AI 交流吗?评论区聊聊 💬
小旭音乐是国内知名的游戏音乐品牌,AI音视频创意团队。代表作包括《古剑奇谭》《完美世界》《诛仙》《天龙八部》《QQ斗地主》《仙剑奇侠传七》等上千部。成立于2006年,总部在北京,在广州、成都均设有分部。2024开始在AI音视频领域布局发力,创立“小旭 AI-Studio”视频号,属于国内AI音视频头部账号,是国内规模和影响力名列前茅的音乐品牌。

分享、在看与点赞
带你玩转AI音视频

