本次活动由 StepFun(阶跃星辰)与出海同学会联合举办,聚焦 Voice AI 的技术演进与真实落地场景。
Keynote 环节,StepFun 高级产品经理杨旸系统梳理了以语音为模态入口的五类任务,涵盖语音生成、声音编辑、音乐生成、音频理解,以及全双工对话与端侧语音代理。结合产品演示,重点展示了声音编辑模型的副语言控制能力、R 系列音频推理模型对情绪与属性的理解能力,以及车机场景下前后端协同的语音架构设计。
Panel 环节邀请了来自电商直播 SaaS、AI 硬件记录设备、客服语音 AI 三个领域的嘉宾,围绕 Voice AI 带来的全新用户体验、五大核心要素的优先级排序,以及端到端与级联架构的选型逻辑展开深入讨论。
语音模态可以作为哪五类任务的入口?
演讲嘉宾:杨旸(StepFun)
以语音模态为入口的任务主要分为五类:前两类为偏离线、非实时的生成类任务,即音频的理解和生成;中间两类为偏实时场景的对话任务,包括音频对话/推理任务和音频实时交互任务;最后一类是语音为入口的 Agent 任务,这是未来的核心方向。在 LLM 时代,将 audio token 纳入训练后,语音模型已具备执行类 LLM Agent 任务的能力,超越了传统的识别与生成范畴。
语音生成与声音编辑能带来哪些新体验?
在非实时场景中,语音生成可通过富语言标记(如冷笑、叹气)及导演级行为指令提升表现力,显著优化广播剧和有声书的听感。声音编辑模型具备“理解 + 生成”的本质,不仅能复现语气风格,还能在重生成过程中自动去除背景噪音,且不会丢失原始音色信息。这一特性为自媒体从业者在嘈杂环境下的录音后期处理提供了高效解决方案。
音乐生成模型能实现哪些创作方式?
当前全球音乐模型厂商中,MiniMax 擅长声音克隆,Suno 音乐性最佳。StepFun 定位介于两者之间,兼顾音乐性与声音相似度。即将推出的新版本支持 Text to Music、AI Cover(哼唱改版本)及 Vocal to Music(干声生成完整乐曲)等多种创作模式。
音频模型除了识别文字,还能理解和推理哪些信息?
除传统 ASR 外,新一代音频模型能深度理解情绪、年龄、语速、音高乃至物理环境音(风声、车声等)。Demo 显示,R 系列模型可准确分析独白中的性别、年龄段及情绪状态。得益于类似 MTP(多 token 预测)技术,该模型在中文及中英混合长尾榜单上表现优异,具备低 RTF(实时因子)和极快的推理速度,且定价具有竞争力。
语音对话如何实现更自然的全双工交互?
针对富语言信息理解难、人设崩塌及首响延迟等痛点,StepFun 的 2.5B 参数 time 系列模型首响已压缩至 200-300ms。全双工交互作为“听、理解、决策、说”的实时闭环,正致力于解决增量理解、用户自我修正、实时反馈(如“嗯”、“哦”)、边填槽边执行及多人说话人区分等关键技术难题。
语音如何成为 Agent 任务的入口?
端侧 SLA(语音识别代理)采用小模型并行推理,可在百毫秒内直接输出 toolcall 指令并打断云端操作,高效执行常见指令。在车机系统中,采用“前端端到端语音模型 + 后端大 LLM"的协同架构:简单指令由前端直接处理,复杂长链任务则移交后端,前端继续负责交互沟通。这种分层设计平衡了响应速度与任务处理能力,适应车端算力紧张的现状。
关于数据训练,预训练阶段主要采购国内供应商数据;Mid-train 或 Post-train 阶段则根据任务类型,采取音棚采集、构造特定场景数据或利用声音编辑模型进行单轨拆多轨合成等多元化策略。
Voice AI 能为用户带来哪些全新体验?
Vincent Yang(Firework):电商直播场景的难点在于本地化 Annotation 和口音适配,尤其是阿拉伯语等方言复杂的语种。大品牌对成本不敏感,更关注质量,特别是本地方言和口音的准确度,这是当前的核心挑战。
Feifan Fan(Plaud):在房地产、法律、医疗等垂直场景,AI 硬件让用户专注于对话而非记录。通过 Voice AI 和 AI Summary 能力,可自动汇总长时对话中的关键信息,挖掘跨周期的决策价值。专属硬件的“一键录制”特性解决了手机操作繁琐的问题,确保不错过灵光一闪的瞬间。
Henry Z.(Cresta):电话客服场景中,AI Agent 可实现 24 小时值守,保持情绪稳定,并能克隆顶级声优声音提升体验。此外,AI 还可扮演难缠客户用于员工培训。实际数据显示,AI Agent 达成目标的速度比人工快约 30%,且能精准把握语境,以共情方式回应用户。
不同 Voice AI 场景应如何排序五大核心要素?
杨旸(StepFun):优先级需视具体场景而定。售后客服侧重任务完成率与稳定性,快速响应场景则更看重低延迟。
Vincent Yang(Firework):电商直播中,语音自然度第一,需消除机器感并适配各国口音;稳定性第二,确保长时间直播声音不漂移。
Feifan Fan(Plaud):AI 硬件场景下,任务完成率和稳定性居首,确保数据零丢失;延迟和成本相对次要。未来将结合声纹匹配等技术,提升嘈杂环境下的信息采集准确性。
Henry Z.(Cresta):电话客服场景中,任务完成率与稳定性并列第一,语音自然度第二(影响前五秒留存),延迟第三(2 秒内可接受),单位成本最后。
行业共识认为,端到端链路延迟控制在 1.2 秒左右较为理想,但直播场景因涉及对嘴渲染和画面同步,综合延迟往往超过 2 秒。
Voice AI 应如何选择架构,又需要解决哪些关键技术问题?
架构选型:端到端架构适合陪伴类或对成本不敏感的场景,能更好理解情绪和副语言信息;级联架构则在可控性和工程性上更具优势,适合 B 端复杂工作流。车企等强工程能力玩家可采用前后端分离的混合架构。
关键技术挑战:全双工架构目前尚未完全成熟,主要问题包括 Back Channeling(附和词)处理不当导致的误停顿,以及语音表达能力不及传统 TTS 方案。此外,AI 抢话是常见体验痛点,未来需通过构造包含不同停顿习惯的数据,让模型从语义层面而非仅凭声学特征判断用户是否说完,从而实现更自然的交互。
创业机会:应用层公司的核心价值在于对垂直行业 Domain Expertise 的积累。以大品牌为例,他们缺乏资源调试工具和解决幻觉问题,急需懂业务流程的伙伴提供端到端解决方案。因此,深入切入垂直领域、解决全流程问题是 Voice AI 创业的关键机会。

