大数跨境

智能外呼Agent的响应速度与成本,取决于记忆怎么存

智能外呼Agent的响应速度与成本,取决于记忆怎么存 红熊AI
2026-09-20
11
导读:打破准确率、响应速度和成本的“不可能三角”


当智能外呼Agent把一通电话打出去,客户说完话,AI 在回复客户之前,有多少时间可以用来“思考”?


据统计,人与人正常对话时,一轮对话间的停顿大约是 200 毫秒。换成AI时,行业给出的口径是 800 毫秒。一旦超过它,客户的耐心就开始下降;到了 1.5 秒,客户直接挂断电话的概率将大大增加。


这短短800 毫秒的窗口,要排进四道工序:判断对方是否说完→把语音转成文字→让模型根据文字想清楚怎么答→把答案合成语音。


要考虑的问题其实不止是客户耐心,还有Token预算。因为一个很自然的做法是:为了确保回复准确率,模型需要存住更长的对话上下文,让它别忘了前面说过什么。但如此做的代价也显而易见:生成变慢、显存与成本抬升、并发量因算力吃紧而变少。


简单来说就是:AI记的太少,则回复不准,牺牲客户体验;AI记的太多,则思考越慢、成本越高、并发量越低。


这似乎成了语音智能体(即智能外呼 Agent)的一个“不可能三角”。但红熊AI“记忆科学”打破了这一桎梏——记忆不能全塞进上下文,而应该科学地分层。



800 毫秒的预算,被四道工序分走


各环节的耗时,公开的工程口径大致稳定:


  • 判断说话人是否讲完,10 到 30 毫秒;

  • 把语音转成文字,60 到 120 毫秒;

  • 模型开始输出文字,100 到 250 毫秒;

  • 合成首段语音,40 到 100 毫秒;

  • 再加上网络往返的 20 到 60 毫秒。


各环节加起来是 230 到 560 毫秒,看上去还有余量,但这是各环节跑在理想状态下的结果,而且延迟要按 95 分位来守,不能按平均值。


这个预算是被一点点压出来的。公开的行业基准显示,2024 年生产环境的端到端延迟中位约 1.2 秒,到 2026 年 4 月已经降到 680 毫秒左右。两年省下来的时间,来自工程上的反复优化。对语音智能体来说,延迟已经变成产品能力的一部分,不再是一个可以商量的参数。


对记忆的需求是真实的。客户在第四轮问“你刚才说的那个套餐多少钱?”,如果系统不记得,只能请对方重说一遍,对话的信任就断在这里。多轮沟通的价值,本来就建立在“前面说过的还算数”上。


于是两件事撞在一起:记忆要多,预算只有那么宽。


当上下文拉长,缓存、速度、并发同时受压



缓存显著拉大

模型处理一段对话时,会把每个词对应的注意力中间结果存下来,避免重复计算。这份缓存的大小与上下文长度成正比。以 8B 参数规模的模型为例,每处理一个词约产生 128KB 缓存,8K 上下文约 1GB,128K 约 16GB。而这个模型本身的权重,也不过 16GB。上下文足够长的时候,它“记住的东西”占用的显存,会和它整个模型一样大。



语音生成速度变慢

模型每生成一个词,要把整份缓存从显存里读一遍。上下文短的时候,算力在算;上下文长的时候,算力大部分时间在等数据搬过来,生成就从算力受限变成显存带宽受限。公开的本地推理实测里,同一个模型在 2K 上下文能跑到每秒 60 个词,到 32K 会掉到每秒 10 个词上下。文字对话还能等,语音不行。



并发量明显受限

缓存按会话各存一份,同时打进来的电话越多,叠加得越快。同样是 128K 上下文,32 路并发需要约 512GB 缓存,相当于六张 80GB 加速卡,而这个模型的权重一张卡就放得下。把上下文从 8K 提到 128K,同一张卡能承载的通话路数会掉到原来的十六分之一左右。


外呼是潮汐业务。营销活动、账单日、通知集中下发,话务量在几个小时内翻几倍,容量得按峰值准备,成本也按峰值支付,剩下的时间大量算力闲置。峰值那一小时决定了整个月的账单。


成本跟记忆量挂钩,也跟记忆的存法挂钩


过去外呼这门生意算账简单:拨了多少通、接通多少通,成本按分钟摊。大模型改变了成本跟什么挂钩。同样一通五分钟的电话,成本可能相差几倍,差别取决于对方问了几轮、带进来多少上下文。十分钟以上的深度沟通,算力开销会明显放大。


这解释了一个经营者会先感受到的现象:量上去了,账反而算不平。


◎算力花在上下文上,换回的是通话质量一线项目的观察是,大模型方案的有效通话时长比关键词脚本方案长出一截,配置周期也从以周计缩到以天计。


◎算力花在并发上,换回的是接通量。这两者要的是同一份显存,经营者实际在做的选择题是:这份显存怎么分。


所以账单上贵出来的那部分,对应的是它记得更多这件事。真正的问题在于,这份记忆用什么方式存,决定了它有多贵。


分层:把长历史压成摘要,按需取回


理想方案是:当期对话里必要的信息留在上下文,跨会话、跨月的经验压缩成摘要,存到上下文之外。


人脑的信息处理方式可以参照。接一位老客户的电话,不会把过去三年和他的通话记录在脑子里重放一遍,记得的是他的偏好、他的业务、上次谈到的结论;需要具体细节时,去翻记录。留在脑子里的少,能调取的并不少。


落脚到工程上就是:开销偏贵、容量也有限的那一层是当期上下文,放的是这几轮对话;再往下一层是长期记忆,跨会话、跨月的经验在这里压成持久化摘要,占的是存储,不再占用显存;需要的时候按相关性取回少量片段,历史本身不必重新载入。


红熊AI 的 MemoryBear 记忆引擎做的就是这套分层:长期固化把长对话压成可复用的摘要,检索按需取回相关片段,记忆的写入、更新与删除留有记录。分层不止发生在记忆上,模型选择也遵循同样的逻辑,简单问答交给轻量模型,复杂沟通才调用大模型。


这样做的意义不止于省钱。上下文里装的东西越少,模型需要分心的部分就越少,留给当前这句话的判断力反而更多。


记忆分层管理的机制,打破智能语音Agent的“不可能三角”,在保住客户体验的同时,有效控制住成本,并让记忆的长期积累成为可能。



回到文章开头, 800 毫秒的对话间隔来自人类本身的生理判断,不会因为模型变大而变宽。所以语音智能体之间的差别,到头来会落在同一个问题上:如何管理“上下文记忆”,应该让AI记住什么、何时取回、什何时遗忘。


不止是语音对话场景,只要 AI 需要跟人打交道,记忆管理会从体验问题落向商业问题,并最终回归到系统工程问题。




【声明】内容源于网络
0
0
红熊AI
红熊AI国内首个融合记忆科学的企业级多模态大模型平台:提供新一代人工智能客服平台与营销服务平台,实现智能体互动服务 × 全场景赋能方案,精准营销|动态转化|服务闭环,AI自助解决率高达98.4%!
内容 289
粉丝 0
红熊AI 红熊AI国内首个融合记忆科学的企业级多模态大模型平台:提供新一代人工智能客服平台与营销服务平台,实现智能体互动服务 × 全场景赋能方案,精准营销|动态转化|服务闭环,AI自助解决率高达98.4%!
总阅读5.2k
粉丝0
内容289