
论文: EAGER: Enrich-and-Align Generative Query Recommendation from Clicked Items in E-commerce Search
作者: Shuwei Yuan*, Mingqian Ding*, Luxin Liu, Rong Xiao, Xiaoyi Zeng(阿里巴巴国际数字商业集团)
论文状态: 已录用(EMNLP 2026 Industry Track)
论文链接:https://arxiv.org/abs/2609.07143
1. 业务背景与挑战
用户在推荐流里点了一个商品,说明他的兴趣在这一刻被具体化了,但还没被表达成一次完整的检索意图。I2Q(Item-to-Query) 要做的就是把这次模糊的兴趣接力成一次明确的搜索。
它和相关搜索(Q2Q)有个根本区别:Q2Q 有用户输入或者选择的 query 当锚点,I2Q 没有。手上只有一个商品加一份用户画像,要凭空替用户想出他接下来想搜什么。线上原本依赖搜索日志进行挖掘——通过 query 搜索结果里有哪些商品来关联商品和 query。两个绕不过去的问题:
- 长尾和冷启动直接失效。
query 下曝光商品大部分为热门商品,长尾商品行为稀疏无法统计,新品完全没有行为,无法完成 query 召回。 - 继承了检索链路的偏差。
一个商品能挂上哪些 query,取决于搜索引擎当时愿不愿意把它召回、并且排得够前,排不上去的组合永远不会进日志。再加上这类共现统计方法只能从既有的 query 池里挑,池子里没有的表达根本挑不出来。两重天花板叠在一起,结果就是现有召回系统的天花板。
生成式模型不依赖日志共现进行挖掘,从根上解决前者。但直接上 SOTA 大模型不现实,这是全量点击流量触发的场景,线上 RT 和成本都撑不住,因此需要选择更轻量化的大模型来完成本任务。
2. 方法:Enrich撑开空间,Align压准偏好
EAGER分两阶段:Enrichment(Stage 1)解决能生成什么,Alignment(Stage 2)解决该生成什么。线上推理时模型输入商品 + 用户画像,输出K条query的列表Y。
2.1 多源意图SFT
构建I2Q训练数据集,需要把Label拆成三个部分,并按意图强度从高到低排成有序序列:
是用户点该商品后在推荐面板上真实点走的 query(意图最强,居首); 是同一个用户点完推荐 query 之后自己主动发起的后续搜索,反映他即时的点后意图; 由 Qwen3-235B 教师基于标题 / 属性 / 类目 / 可能的使用场景做离线扩写,用来缓解点击日志本身的稀疏。第三段存在一个潜在隐患:LLM 生成的 query 之间没有可靠的优先级,直接拼到标签末尾等于往监督信号里增加噪声,所以我们用 PARM(见 2.3)给 打分取 Top-k 再拼进去。
2.2 课程学习+ 多样性正则 + 自蒸馏
这个任务真正难的地方不是“infer出多条query”,而是决定沿哪些角度去扩。如果只拿最终答案当监督,模型得自己从标签里反推出扩写维度;而相关性是底线、个性化是上限--一条贴合画像但跟商品无关的 query 毫无价值。所以我们把训练拆成四段,按难度递增:
但是SFT的损失只拟合和label的相似,对于10条之间是否互相重复并不关心。对于实际应用过程中我们不仅需要模型输出的query与商品相关并且表达能够多样,因此我们额外加一项显式的多样性惩罚:
取token级 Jaccard,不需要额外encoder参与计算。 通过测试在0.1附近最优:太大则模型为了凑多样性开始生成不相关 query。在经过课程学习和多样性正则之后,使用训练好的模型通过提高温度采样得到一批I2Q SFT数据用于自蒸馏,经过测试发现temperature 0.9~1.0 最优、top-k则是越大越好。
2.3 混合奖励的 GRPO
SFT 的目标是"像标签",但标签本身来自有偏日志和教师模型,"像Label"≠"用户会点";而且 SFT 难以直接优化合规目标,会生成包含无意义营销词、侵权品牌词等。所以将奖励拆成两路:
规则奖励是8种可程序化校验的加权子项:数量合规、体验合规、词汇覆盖、用户意图对齐、流畅度、多样性、惩罚词、格式合法。其中词汇覆盖是防幻觉主力——长度 < 3 词的 query 必须有 ≥2 个词命中商品标题,否则要求 query 词项被标题覆盖 ≥75%。
模型奖励靠PARM(Preference-Aware Reward Model),一个 Qwen3-4B 的生成式点击预测器。它不是二分类头,而是把判别问题重写成生成问题:给定 生成自然语言标签 ,训练目标 。推理时取
好处是直接复用预训练语义能力,小样本下比接分类头稳得多。
训练样本用位置感知采样构造:点第 1 位的样本整条丢弃(首位天然高曝光,不含偏好信息),点第 k 位则以它为正例、其前面被跳过的全部为负例,被点位置之后一律忽略。本质是抽取"用户跳过了前面、选了后面"这个显式偏好信号。我们在21 万PV数据上验证,PARM与真实点击的Top-1一致率79.8%,Top-2~4 均 >72%。
值得一提:PARM在SFT阶段就已经在用了(2.1 的label重排就是它做的),同一个偏好模型串起监督构造和 RL 对齐,避免两阶段优化方向不一致。
3. 离线评估
主指标是 Soft HR@K(Soft Hit Rate):生成的 query 只要命中日志中被点的那条,或者它有 ≥60% 的词项出现在用户进入搜索后所点击商品的标题里,就算命中——也就是把指标锚定在二跳商品点击上,而这正是这个场景真正的业务目标。另外两个维度:APD(Average Pairwise Distance,列表内两两平均距离)和 Distinct-2(二元组去重率)衡量多样性;Rule(规则合规分,满分 10)直接对应线上可用率。
3.1 主结果
两点值得说。一是 1.7B 打赢了 GPT-5.2(77.96 vs 75.73),而且多样性和合规的优势更大(APD 72.96 vs 67.74,Rule 9.16 vs 8.57)——闭源大模型直接用于电商场景还是存在一定短板。二是朴素串联 SFT+GRPO 几乎白干:纯SFT是74.04,串上GRPO只到74.19;而不做SFT直接上 RL 更差(66.58),因为模型连任务长什么样都不知道,RL没有可探索的优质样本。真正的差距在多样性上——SFT→GRPO 的 APD 只有 53.34,EAGER 是 72.96,说明 Enrichment 那一套(课程 + 多样性正则 + 自蒸馏)才是把采样空间撑开的关键。
3.2 课程学习的验证
回头看2.2的四种课程任务,我们做了增量消融:
最大的单步收益来自加入用户画像,但它得基于前两段的基础之上才兑现,课程顺序本身是必要的。
3.3 CaseStudy
KR 站英语女性用户点了个 PU 皮托特包:
线上baseline给出 tote bag / bags for woman / zara bags,泛词加跨品牌漂移;
EAGER 给出 large capacity tote bag / designer PU leather handbag / casual shopping bag / PU leather shopper——材质、容量、场景、风格四个维度都展开了。
4. 线上部署&A/B效果
EAGER不替换现有链路,而是作为新增召回接入:X2Q召回+ 向量召回 + EAGER生成式召回,三路并行进召回池,排序层完全复用现有模型,统一出Top-4。
A/B 设置: 9 天,5% 流量
一跳和二跳指标均上涨,说明 EAGER 带来的不只是更吸引人点的泛词,而是更精准的意图承接,用户点击进入搜索结果页之后确实找到了想买的东西。
5. 总结
生成式召回在工业界落地,主流路线是 SID(Semantic ID):先把物料量化成一串离散语义 ID,模型自回归地"吐 ID",再查表还原成物料。在商品、视频这类物料上这套做法很合理,物料是一个有限集合,ID 化之后既能压缩表示,又能天然对齐现有的索引和工程链路。
但 I2Q 的"物料"是 query,本身就是自然语言,不需要"还原"这一步,先量化成 SID、再解码回文本,中间那道离散化只会掉信息。更关键的是,SID 的码本是从既有物料集合建出来的,模型只能吐出码本里已经存在的 query,这跟第1节里X2Q召回"只能从既有 query 池里选择"的缺陷是一致的;而这个场景真正缺的恰恰是池子里没有的表达:长尾商品、新品、多语言、组合意图。
所以我们在这个场景上放弃SID,让 LLM 直接在自然语言空间里生成,把输出空间的上限从码本大小解放成词表组合。代价是丢掉了离散 ID 自带的约束:生成的东西可能不相关、不合规、也可能十条长得一样。EAGER 这套两阶段设计,本质上就是把这些约束用别的方式补回来,监督信号按意图强度排成有序序列,结构比数量更重要;奖励拆成"可验证的"和"学出来的"两路,合规、格式、词汇覆盖这些能写成硬规则的别指望模型自己学,"用户会不会点"这种写不出规则的才交给奖励模型,混在一起两边都糊;多样性则必须显式建模,并接受它和命中率之间的权衡。最终EAGER通过1.7B的模型进行上线,通过增量的形式接入现有召回系统,为AliExpress搜索带来了点击率与转化的双正收益,且转化侧的涨幅明显大于点击率。
6. 关于我们
我们是阿里国际-智能技术-AE 搜索算法团队,负责 AE / 淘宝海外 /GMarket/ Tao 日本等业务搜索场景。将大模型技术应用于国际化电商搜索,包括多语言电商大模型构建、基于 LLM 的搜索全链路升级(多语言 Query 理解与相关性、多模态文档扩展、端到端生成式召回等),以及 AI 搜索在国际化电商导购的探索。近年在 CIKM、WWW、AAAI、KDD 等会议发表多篇论文。欢迎感兴趣的同学加入我们。
点击上方名片,关注我们吧~

