Cue 是一款运行于桌面的语音 AI 智能体。用户只需按下快捷键并口述指令,即可在任何应用中实现精准听写、屏幕内容读取及智能任务执行。
Cue 的核心愿景是让语音成为人机交互的自然延伸,使键盘在日常计算中从“必需”变为“可选”。这一目标的实现,得益于 Gemma 等开放模型,使得小型团队能够将高性能 AI 完全部署在用户本地设备上。
润色语音:平衡真实声音与响应速度
语音输入并非直接生成完美文本,初始的语音转文本(STT)输出往往包含语气词、标点缺失、同音错误及自我修正痕迹。如何将这些原始数据流转化为高保真文本,同时确保速度不中断用户体验,是语音优先界面的核心工程挑战。
研究表明,从说话到看到文本的延迟若超过 500 毫秒,用户便会感知卡顿,从而打破“语音比打字快”的体验错觉。Cue 此前基于云端的润色步骤会增加 800 至 900 毫秒延迟,且其他模型常存在“过度编辑”问题,抹去了说话者的个人风格。
集成 Gemma 4 E4B 后,Cue 的延迟大幅降低 44%,中位数延迟从 876 毫秒降至 488 毫秒,成功控制在感知预算时间内。
△ 润色步骤的延迟是在 Apple Silicon (M 系列芯片) 上通过 Ollama 测量的,测试基于包含英语和混合语言输入的 227 个真实语音样本基准。单用户听写使用量是在默认切换前后的四周内,对活跃测试版用户统计而得。数据截至 2026 年 5 月。
Cue 的润色架构简洁高效:音频经云端 STT 转录为原始文本后,通过 Ollama 发送至用户本地运行的 Gemma 4 模型。系统提示词仅约 400 个 Token,却编码了关键格式化规则:
- 恢复标点符号并将数据流分割为句子;
- 去除语音中的语气助词;
- 结合上下文语境修正同音字;
- 根据输入框类型调整格式(如终端命令不加句号,邮件撰写则保留完整标点)。
润色后的文本随即通过原生 API 粘贴至光标处。整个闭环流程耗时不到一秒,实现了从“延迟卡顿”到“瞬间插入”的本质跨越。自改进实施以来,Cue 的单用户听写量增长约 30%,用户开始更频繁地使用语音处理长内容及时效性任务。
△ 在 Cue 的润色架构中,云端 STT 接收音频并将其转录为文本,随后润色步骤完全在用户的本地机器上运行。
颠覆架构:将限制转化为特性
Cue 为所有用户(含免费版)提供无限制听写服务。随着 Gemma 4 E4B 实现全端侧运行,润色步骤的边际成本降至零,使得原本可能受限的功能得以免费开放。
团队最初计划仅将 Gemma 作为离线备用方案,假设更大规模的云端模型准确性更高。然而,基于 227 个真实语音样本的基准测试显示,Gemma 4 恰好具备在不“过度编辑”的前提下进行格式化纠错的能力。这种曾被视作“限制”的特性,实则是文本润色任务所需的关键优势。
目前,Cue 采用“基础模型 + 提示词工程”的部署策略,将当前应用上下文(如应用名称、输入框类型)注入提示词,以适配不同场景。云端路径仍作为备用方案:若检测到 Ollama 未运行,系统将自动切换至云端模型,确保服务连续性。
“我们原本预期 Gemma 只是离线模式下的备用方案。但对真实的语音样本运行基准测试后,架构得到了巨大的反转——现在 Gemma 是默认的润色方案,而云端模型则成为了备用方案。我们原本以为是缺点的'限制',最终证明恰恰是这项任务所需要的。”
—— Eli Li,Cue 创始人兼 CEO
引领设备端语音智能体的未来
除当前的润色功能外,团队正将 Gemma 的应用扩展至两个新领域:
- 记忆层:构建持久化的本地层,跨会话学习用户的说话风格、词汇及格式偏好,使输出更适应用户而非强加预设风格。
- 智能体路径:利用 Gemma 4 原生的函数调用(Function Calling)功能,通过 Ollama tools API 直接在本地处理部分独立任务,减少对云端模型的依赖。
为评估润色延迟、保真度和质量,团队构建了确定性、可复现的基准测试套件,并计划开源评估框架,助力开发者社区在自身工作负载上进行结构化对比。
本地与云端的能力差距正在迅速缩小。对于 Cue 而言,基于真实数据的测量给出了明确答案:在高频语音交互场景中,Gemma 4 是最合适的模型选择。




