大数跨境

一个小模型意图识别系统的 5 天进化实录|支付宝618

一个小模型意图识别系统的 5 天进化实录|支付宝618 阿里技术
2026-07-13
6

这是 2026 年的第 35 篇文章

(本文阅读时间:约 25 分钟)

01 业务背景

2026 年,AI 已深度渗透至代码编写与技术决策的各个环节。在支付宝 CY26-618 电商大促中,核心命题是将 AI 能力真正触达 C 端用户,优化购物体验。

AI 找优惠一期:以 Agent 为本

一期核心采用“猜你喜欢”式的智能推荐。结合用户画像、跨阵地消费行为及点击偏好等多维数据,AI 从 20 多个权益池中自主筛选并推荐用户可能感兴趣的权益。

该方案优势在于零门槛,用户无需操作即可获取优惠。其逻辑类似于传统推荐系统:预判需求并主动满足。然而,当用户带有明确诉求(如“想买手机,有什么券”)时,推荐系统往往只能提供“可能喜欢”的内容,而非“当下想要”的结果。

AI 找优惠一期 - 推荐版

AI 找优惠二期:以人为本

二期在一期基础上引入对话式交互。核心理念是:当用户有明确诉求时,搜索比推荐更准确。系统需听懂用户的自然语言表达(如“想买个蓝牙耳机,200 以内”),精准匹配权益或商品,并为多轮追问和意图流转预留空间。

AI 找优惠二期 - 会话版

我在其中做什么

在二期链路中,我的工作聚焦于关键环节——意图识别

意图识别是链路的“翻译层”,负责将用户的自然语言转化为下游系统可消费的结构化查询。该模块虽占链路比例小,但对最终体验具有决定性影响。

02 意图识别:让 AI 听懂人话

意图识别(Intent Detection)旨在回答“用户到底想要什么”。传统做法将其视为分类任务,但在开放域消费场景中,用户表达方式无穷无尽且意图流动多变,传统分类器难以应对。

大语言模型(LLM)的出现改变了规则,使意图识别从“分类问题”转变为“理解问题”。LLM 能直接理解语义、追踪上下文并进行推理,不再依赖预设标签体系。

针对 AI 找优惠场景,我们将用户意图划分为四种类型:

基于类型定义,确立优先级策略:

  • ITEM 和 BENEFIT(L1 最高优先级):用户诉求明确,直接推荐,无需追问。
  • VAGUE(需模型推理):用户有购物倾向但品类不明。模型需判断明确程度(L2-L4),并引导用户澄清直至达到 L1。
  • IRRELEVANT(无关):用户仅为闲聊,不强行推送优惠。

问题定义清晰后,核心挑战转向工程落地:选择何种模型运行这套意图识别系统?

03 模型选型—4 小时从调研到拍板

模型选型需满足五大约束条件:

  1. :首 Token 延迟需在 1~2 秒内。
  2. :大促流量巨大,需控制 Token 成本。
  3. :需理解语义等价性,而非简单关键词匹配。
  4. 记得住:上下文窗口需支持 32K,以容纳 System Prompt 及多轮对话。
  5. 别越界:模型仅作为“翻译官”,输出结构化查询(意图类型、关键词、摘要),不涉及商品推荐逻辑。
模型唯一任务:将“人话”翻译成“机器能懂的查询语言”。

基于低时延、场景相对简单的特点,目标锁定为小模型。我们在 4 小时内完成了从调研到评估报告的全过程。

3.1 站在巨人的肩膀上:借鉴前人经验

调研三个类似场景团队的经验:

  • A 团队:使用 Qwen3-14B 升级至 235B,因需注入特定域内知识。
  • B 团队:使用 Qwen3-8B,采用两阶段链路(先理解意图,后补齐商品内容)。
  • C 团队:使用 Qwen3-30B。

候选范围收敛至 Qwen3 系列的 8B、14B、30B 档位。

3.2 候选名单:从七到四的筛选

初始候选包含七个 Qwen3 系列模型,覆盖纯文本、多模态及嵌入类型。

3.2.1 排除多模态模型

Qwen3-Omni-30B-A3B-Instruct 和 Qwen3-VL-8B-Instruct 被排除。原因:当前交互仅为纯文本,多模态组件闲置却增加推理开销;且在同等参数下,纯文本 Dense 模型的 TTFT 和吞吐优于多模态模型。

3.2.2 排除嵌入模型

Qwen3-Embedding-8B 被排除。原因:无法生成自然语言追问文案;对细粒度意图边界(如商品意图 vs 权益意图)区分能力弱于 LLM;维护向量库及阈值成本高。

3.2.3 最终候选:四位选手

最终保留四个 Qwen3 纯文本模型:8B、14B 及两个 30B MoE 版本。

3.3 评测的第一步:构建黄金用例集

评测前首要任务是准备可信的用例集,避免“垃圾进,垃圾出”。

3.3.1 基于业务规则定向构造

用例集需覆盖边界场景、贴近真实口语风格,且标注无歧义。数据集按意图类型分块,包含期望输出 JSON 结构。

评测核心:边界 Case 比典型 Case 更具区分度。
# ITEM — 品类词 + 规格属性
- name: ITEM-128G 白色手机
  expected_type: ITEM
  prompt: 想买个 128G 白色手机
  expected_output:
    intentType: ITEM
    keywords: ["手机", "128G", "白色"]

# BENEFIT — 寻找优惠券/红包/权益
- name: BENEFIT-有红包吗
  expected_type: BENEFIT
  prompt: 有红包可以领吗
  expected_output:
    intentType: BENEFIT
    keywords: ["红包"]

3.3.2 人工审查锁定黄金集

对模型生成的用例进行人工审查,消除二义性。例如,“电脑配件有红包可以领吗”虽涉及权益,但受限于下游能力,优先识别为商品意图以提升用户体验。

- name: ITEM-电脑配件 + 红包
  expected_type: ITEM
  prompt: 电脑配件有红包可以领吗
  expected_output:
    intentType: ITEM
    keywords: ["电脑配件"]
黄金用例集价值在于每一条都经过人工校验,确保标注可信。

3.3.3 候选模型实测

四个候选模型在相同 System Prompt 和输入下运行全部 Case。对比显示,不同模型在 TTFT(首字延迟)及输出准确性上存在差异。

3.4 四维评测:效果、时延、成本、上下文

评测结果显示:14B 模型效果最佳且时延尚可;8B 模型效果略低但时延最优。综合考虑资源交付风险,最终线上选用Qwen3-8B,这是在多重约束下的最务实选择。

04 系统提示词调优实战

模型选定后,通过系统提示词(System Prompt)的自进化进一步提升效果。

4.1 从手工调参到自动化框架

经历三次迭代实现自动化闭环:

  • 第一次迭代:搭建自动化框架,实现“跑评测→打分→改写”闭环,解放人力。
  • 第二次迭代:引入 Test Split,将数据分为训练集(驱动改写)和测试集(验证泛化),防止过拟合。设定双门槛收敛条件(Train≥90 且 Test≥92)。
  • 第三次迭代:建立反过拟合防线。要求改写器抽象规则而非堆砌案例;限制新增案例数量;区分训练集与测试集信号;仅修改未达标维度。

4.2 双轨评分体系:规则+LLM

设计六个评分维度,采用规则打分(判对错,如格式、意图类型)与 LLM 打分(判好坏,如关键词提取质量、追问自然度)相结合的方式。

规则打分管“对不对”,LLM 打分管“好不好”。

权重分配向业务核心指标倾斜:意图准确性(30%)与关键词提取准确率(30%)占比近 60%。

4.3 纠偏机制:当模型方向跑偏

若模型优化方向偏离预期(如错误修改整体 Prompt 而非新增步骤),需及时打断 Loop,利用 PromptOptimizer 修正大方向后重新执行。

4.4 上线前的 Bad Case 处理

上线前夕发现兜底逻辑导致体验割裂:当用户询问非电商属性权益(如签证)时,若无权益召回,系统会随机推荐无关商品。

解决方案:调整意图识别逻辑,将非电商属性的权益咨询识别为“无关意图(IRRELEVANT)”。通过新增训练用例、人工确认修改方向、多轮 Loop 迭代及同步更新评测标准,快速解决了该问题。

05 效果与收益

实验结论:互动深度驱动转化效率提升

一、实验设计
以普通版本为基线,将对话场景拆分为自动首推组、预设按钮交互组、自定义对话组,观测 CTR 与人均价值贡献。

二、核心发现

  1. 自动首推 alone 无法带来正向转化:被动推荐导致商品点击率下降 11.8%,人均价值贡献下降 8.3%。
  2. 用户主动互动是核心驱动力:一旦用户转为主动交互,核心指标显著正增长。
  3. 互动深度与转化效率正相关:自定义对话组(最深交互)的商品点击率达普通版的 3.7 倍,人均价值贡献达 2.1 倍。

三、业务启示

  1. 不建议单独依赖自动首推承接转化。
  2. 应重点引导用户进入主动交互(预设按钮、自定义对话)。
  3. 自定义对话是效率最高的转化场景,应优先建设。

06 踩坑总结

6.1 重复了 3 遍就要造轮子

AI 时代造轮子成本大幅降低。项目中开发了“增量单元测试脚本”和“评测结果可视化脚本”,极大减少了重复操作的心智损耗,提升了开发幸福感。

一个顺手的脚本能减少数十次重复操作,大幅提升效率。

6.2 Switch Context 累,但是值得

项目开发涉及 Java 编码、Prompt 框架开发、数据评测等多线程工作,频繁的上下文切换成本高昂。但这正是 AI 时代的开发常态:开发者角色从执行者转变为调度者,吞吐量取决于同时调度多少个 AI 高效运转。

快速切换上下文的能力,是提高工作吞吐量的关键。

6.3 保持热情与动手能力

面对 AI 能力的各种声音,保持谦逊、务实、专注自身技能提升,才是 AI 时代程序员的核心竞争力。

07 未来展望

7.1 React Agent 架构演进

当前方案通过同步接口提供服务,限制了流式体验。未来计划演进至 React Agent 架构,以实现真正的流式服务响应。

【声明】内容源于网络
0
0
阿里技术
阿里技术官方号,阿里的硬核技术、前沿创新、开源项目都在这里。
内容 450
粉丝 1
阿里技术 阿里技术官方号,阿里的硬核技术、前沿创新、开源项目都在这里。
总阅读26.3k
粉丝1
内容450