编者摘要:PILOT 是淘宝提出的大模型 Agent 推荐实验优化框架,针对现有 Agent 三大缺陷:被动响应指标变化、仅支持全局策略、缺少可复用实验方法论。框架设置三大 LLM 角色,运行在受约束控制环路中,安全、统计、权限由确定性服务强制执行,大模型仅在合法选项内做选择,不能自创指令。
- 实验管理器
完整管控实验全生命周期,任务接入、观测、异常恢复、事后复盘,实现从被动调参转为主动实验。 - 搜索规划器
基于 PolicyTree 决策树实现用户分群个性化策略;采用自上而下可证伪假设检验,替代传统事后归纳总结,生成挑战者候选。 - 记忆整理器
fork‑merge 分支合并记忆架构,维护策略证据库、方法论经验库;记忆拥有 draft‑supported‑approved置信生命周期,区分因果证据与诊断证据,避免单次实验幻觉。
线上与 ROAM(被动自由探索 Agent)做对照实验:5 个实验桶,PILOT 最高 IPV+1.40%,成交金额 + 1.50%;搜索效率 53.3%→93.3%(+40pp),4/5 桶达成业务目标,实验全流程无需人工干预。
7 个关键问题问与答
Q1:现有推荐智能体有哪三大核心短板?
A:①被动响应,仅对指标变化事后调整,不做预先假设验证;
②只能全局策略,无法针对用户子群体做差异化;
③仅保存单次任务信息,无法沉淀可复用实验方法论。
Q2:PILOT 三个 LLM 角色各自职责是什么?
A:实验管理器:负责完整实验生命周期;搜索规划器:生成用户分群决策树候选方案;记忆整理器:异步沉淀策略与实验操作知识。
Q3:什么是 PolicyTree 决策树?
A:可执行策略树,通过类别 / 数值 / 哈希分割把用户切分为多个叶子,每个叶子绑定独立策略包,实现用户细分个性化,满足完备互斥约束。
Q4:PILOT 如何防止大模型幻觉?
A:采用受约束控制环路,大模型只能在确定性服务输出的合法选项中选择;使用自上而下可证伪假设检验;记忆需要多任务复现才能升级置信等级,区分诊断证据与因果证据。
Q5:记忆整理器两套存储分别存什么?
A:策略证据库:存储不同策略‑人群配对的对比效果;方法论经验库:沉淀实验运维操作流程、故障处理、放量回滚等元知识。
Q6:fork‑merge 记忆架构作用?
A:每个任务开辟独立记忆分支,并行任务互不干扰;任务结束校验通过后才合并回主知识库,避免任务之间数据污染。
Q7:PILOT 对比 ROAM 主要实验结果?
A:PILOT 搜索效率从 53.3% 提升到 93.3%;最优桶 IPV+1.40%;5 个实验组 4 个达成目标,全流程不需要人工干预,各项业务指标全面优于 ROAM。
附录 淘宝PILOT 技术报告
PILOT 团队
现有面向推荐系统优化的智能体方案本质上仍然是被动响应式的:它们只会根据观测到的指标变化调整参数,不具备主动设计对照实验、在用户细分层面定制策略,或是跨任务沉淀可复用实验方法论的能力。本文提出 PILOT(面向在线树实验的主动洞察学习器,Proactive Insight Learner for Online Tree‑Experiments),这是一套大语言模型智能体框架,在受约束的控制环路内设置三类角色,由确定性服务强制执行全部安全、统计与权限边界:
- 实验管理器(Experiment Manager)
仅从规则生成的合法命令集合中做选择,负责完整实验生命周期,包括任务接收、观测管控、异常恢复以及事后复盘; - 搜索规划器(Search Planner)
负责生成面向用户细分人群个性化的候选决策树,仅当实验管理器发起规划请求时才会被调用; - 记忆整理器(Memory Curator)
异步地将实验结果提炼为策略层面的领域知识以及可溯源的实验方法论,即便该组件发生故障,也不会干扰主控制环路运行。
实验管理器赋予智能体主动执行能力;搜索规划器实现超越全局调参的人群级个性化;记忆整理器让每一项已完成任务都能够为后续任务提供学习素材。
本系统部署于淘宝平台,设置 5 个实验分组。将 PILOT 与 ROAM(基于智能体动作的被动优化,Reactive Optimization with Agent‑driven Moves)开展对比。ROAM 属于自由探索智能体,缺少生命周期管控与结构化假设检验能力。 PILOT 实现指标提升:商品详情页浏览量(IPV)最高提升+1.40%,核心商品详情页浏览量(Core IPV)+1.60%,成交订单数+0.96%,成交金额+1.50%。对比 ROAM 的最优结果(IPV+1.00%、Core IPV+0.90%、成交订单数 + 0.60%、成交金额 + 1.13%),同时将搜索效率从 53.3% 提升至 93.3%(提升 40 个百分点),整个实验周期全程无需人工介入。
图 1|淘宝首页 “猜你喜欢” 场景下 PILOT 与 ROAM 线上 A/B 实验结果 ©2026 淘宝,保留所有权利 arXiv:2608.18637v1 [cs.IR] 2026‑08‑19
1 引言
工业级推荐平台将线上实验作为一套持续运行的控制环路:划分实验组、部署策略、监控指标,以此决定下一步调整方向。传统上这套环路由实验人员人工驱动。随着并发实验数量、用户细分群体不断增加,人工设计与迭代已经无法满足规模需求。
面向推荐场景的智能体方案,开始把这类优化决策从人类交给大语言模型智能体。有一类智能体负责物品选择,具备记忆与工具调用;一类用于模拟用户,完成训练与评估;还有一类实现与用户对话交互。而另一类研究方向,把智能体当作协调者,直接对推荐系统本身进行操作,而非仅仅生成推荐列表。这一类协调式智能体和本文工作最为接近,但仍然存在三点关键局限,制约进一步发展:
局限 L1:被动响应模式。现有协调智能体只会对已经观测到的指标波动或者故障做出反应;不会在部署前提出假设并完成验证。
局限 L2:仅支持全局策略。优化作用于整个系统或者整个实验组,智能体无法针对实验组内部不同用户子群体使用差异化策略。
局限 L3:缺少方法论沉淀。虽然记忆与自我迭代越来越常见,但沉淀的只是单次任务的内容知识,不会提炼成智能体自身的实验方法论;因此无法形成可复用能力,让智能体运行后续实验时变得更快、效果更好。
针对以上局限,本文提出 PILOT(面向在线树实验的主动洞察学习器),一套大模型智能体框架。它的运行模式更像人类实验人员,而非指标响应器:管理完整实验生命周期、通过决策树实现人群级个性化、从每一次实验中提炼可复用知识。 PILOT 在受约束的控制环路内部设置三类大模型角色;由确定性服务强制保障安全、统计与权限边界。 框架的三大核心能力,分别对应三类角色,直接解决 L1‑L3 问题:
实验管理器(第 3 节):管控完整实验生命周期,包括任务接收、操作手册组装、观测管控、异常修复、规模验证、事后复盘;而不是在指标告警出现之后才被动响应。每一步都会由确定性的管理器防护模块,基于当前状态与固化策略生成合法命令集合,管理器只能从中选择动作(行为有边界)。高风险决策(估计目标、防护约束、预算、最终确认)需要显式人工输入,不允许智能体自行推断(安全可控);固定权限层级,固化安全策略与用户确认的配置优先级永远高于智能体推理(可审计)。
搜索规划器(第 4 节):全局策略会对整个实验组套用同一套方案,但组内不同用户需要不同处理方式。搜索规划器生成候选决策树,在用户细分粒度实现策略个性化;为每一个叶子节点绑定独立的策略组合,仅在用户行为确实存在差异的地方做差异化处理(实现个性化)。候选来源分为三路:确定性基线、附带证据引用的大模型生成假设、有边界的探索槽位;所有候选必须经过确定性校验器,才可以进入实验流程(结果可验证)。规划器仅能在实验管理器明确发起规划请求的时候被调用,不能管理生命周期、修改观测窗口、升级最优策略(职责范围受限)。
记忆整理器(第 5 节):在实验证据确认完成之后异步工作,将实验结果沉淀到两个独立存储库:策略证据库,记录不同策略组合对比效果,附带人群范围与证据类型标记(支持对比分析);方法论经验库,记录如何开展实验,保存来源溯源信息,并且拥有一套完整置信度生命周期:草稿→待确认→已批准(受管控)。每一项任务从共享知识库分出一条独立分支;任务结束之后,只有经过验证的条目才会合并回主库。后续任务可以基于更加丰富的知识库开展,任务之间不会互相污染(能力持续累积)。
PILOT 部署于淘宝推荐平台,共 5 个实验分组;对比对象为 ROAM,该智能体只做自由探索,没有生命周期管控与结构化假设检验。 PILOT 将最优分组指标从 IPV+1.00% 提升至 + 1.40%;核心 IPV 从 + 0.90% 提升至 + 1.60%;成交订单数从 + 0.60% 提升至 + 0.96%;成交金额从 + 1.13% 提升至 + 1.50%。搜索效率从 53.3% 提升到 93.3%(+40 个百分点);整个实验周期无需人工介入。
本文剩余部分组织结构:第 2 节概述 PILOT 整体框架以及受约束控制环路;第 3‑5 节分别详细讲解实验管理器、搜索规划器、记忆整理器;第 6 节展示线上 A/B 实验结果、消融实验,以及假设迭代完整案例;第 7 节总结。
图 2 PILOT 框架总览。受约束控制环路中的三类大模型角色,分别解决现有协调智能体的一项缺陷:实验管理器实现主动的生命周期管控;搜索规划器依靠决策树实现人群层面个性化;记忆整理器让实验方法论可以跨任务迭代进化。
2 PILOT 框架
PILOT 把大模型部署在三处最需要主观判断的环节:生命周期管理、候选方案生成、证据提炼;三者整合进一套受约束的控制环路。系统其余全部组件都是确定性执行。
事件(用户请求、平台信号、定时器、执行器回调)触发管理器防护模块,计算当前允许执行的动作集合:一份合法可执行步骤清单,完全由状态机与固化策略生成,大模型不参与。之后实验管理器从清单中选择动作,可以同步委派任务给搜索规划器。防护模块校验该选择是否匹配当前状态、参数边界、有效凭证;状态提交器会原子化执行确认后的指令,它是系统唯一具备状态写入权限的组件。
这套环路由六项确定性服务支撑:前面提到的管理器防护模块、状态提交器;统计引擎生成不可修改的决策凭证;契约构建器预先写下判断实验结果的规则;校验器检查搜索规划器输出的全部候选方案;动作枚举器列出当前所有合法动作。
核心隔离原则:大模型角色负责从已有选项中做判断选择;确定性服务负责生成选项空间、校验每一次选择、提交状态变更,大模型不能自创命令、篡改统计结论、越过权限边界。
服务层之下是基础层:持久化存储包含支持分支‑合并机制的记忆库、策略中心保存策略组合定义与模板、领域知识库;还有线上运行时,负责线上流量划分与策略下发。
2.1 实验管理器
实验管理器是整个实验生命周期的语义所有者:任务接收、组装任务操作手册、在合法动作集合内推进实验、观测管控、异常恢复、规模验证、事后复盘。它让智能体从被动调参转变为主动管理实验。
任务接收阶段,最终产出一份和用户达成一致的固化任务规格文档,同时生成操作手册;手册结合用户指令以及过往任务验证有效的方法论。 生命周期推进包含四层容易混淆但含义完全不同的时间概念:
- 单次观测(look)
读取一次数据并完成状态判断; - 一轮测试(wave)
一批同时启动的挑战者实验组; - 时代(epoch)
一个窗口内,最优策略、估计指标、决策策略全部冻结;该时代内部所有挑战者共用同一套对比基准; - 一轮搜索迭代(search iteration)
完整的 “规划‑部署‑观测‑决策” 循环。
观测管控会记录每一次观测结果,在证据判定为最终结论之前都视作临时结果;只有最终确认的结果,才允许更新记忆库、开启下一轮规划。第 3 节完整介绍整个生命周期。
2.2 搜索规划器
搜索规划器负责生成候选方案:读取当前最优策略、合法动作集合、证据、记忆库,输出简短候选列表,附带假设与证据引用。仅当实验管理器显式发起规划请求才被调用,它本身不能管理生命周期、修改观测窗口、分配流量、升级最优策略。
它输出的每一个候选都叫挑战者(Challenger):相对于当前最优策略,仅发生一次原子变更的实验变体;所有挑战者统一和固定基线分组 B0 做对比,B0 作为平台锚点,全程不会变化。 挑战者上线前,会预先约定一套决策规则,明确什么结果算正向、负向、无结论、需要延长观测;一旦数据开始流入,规则不允许修改。第 4 节详细介绍决策树模型、合法动作空间、三路候选生成机制。
2.3 记忆整理器
记忆整理器是异步证据提炼组件:证据确认完成之后,把实验结果整理进两套记忆存储:一套保存带证据标记的策略组合对比领域知识;另一套保存带溯源信息、完整置信度生命周期的实验方法论。 具备故障隔离特性:记忆整理器发生故障只会影响知识积累,不会破坏正在运行的实验。
第一套存储不会单独记录某一个策略的效果;每一条条目都是两个策略组合之间对比,同时标记这份证据是支持因果推断,还只是诊断性观测。 第二套存储记录每一条方法论来自哪里,是单次尝试还是跨任务反复验证有效;只有经过验证的方法论,才可以在没有人工参与的情况下填充未来任务的操作手册。第 5 节讲解两套记忆库、分支‑合并隔离机制、写入管控规则。
3 实验管理器
本章讲解实验管理器如何承载一次完整实验:把原始需求收敛为固化规格文档与操作手册(3.1);观测每一轮实验,判断何时推进流程(3.2);一轮实验达到目标后确认并交付结果(3.4)。
3.1 实验准备
正式搜索开始前,实验管理器把原始请求转化为三份不可修改的产物:理解用户诉求,组装任务执行方案,确定不同产物之间的优先级覆盖顺序。
任务规格文档:实验管理器首先作为对话智能体。用户以自然语言给出目标;管理器不能直接把原始文本丢给搜索规划器;必须将对话收敛为带版本的任务规格文档 τ,之后才可以启动搜索。 任务规格 τ 是带版本的记录,包含下表字段。一旦固化,在整个任务周期内不可修改;运行中的实验轮次不会读取未定稿的草稿版本。 收敛分为四个状态:未完成、待用户确认、就绪、已固化。必须解决上一状态识别出的缺失、模糊字段,才能流转到下一个状态。 部分高风险字段,管理器不允许自行猜测填充;必须结构化请求用户,列出可选取值,给出推荐默认值,设置回复截止时间;任务规格不能越过 “待用户确认” 状态,直到用户完成回复。
表 1|任务规格 τ 字段,按类别与确认风险等级分组
表格
类别 字段 风险等级 人群与搜索设置 固定基线 B0、初始最优策略、搜索空间 标准 管控规则 规模验证目标与策略、通知策略、用户指定方法论引用 标准 预算与时间 观测调度约束、起止时间、流量、实验组、轮次预算 混合 目标与指标 优化目标、最低业务收益、估计目标、核心指标 混合 人群与搜索设置 随机化、曝光配置 高风险 管控规则 防护阈值与停止策略、审批矩阵 高风险
组装操作手册:任务规格 τ 回答了 “本次任务要测什么”,但没有说明 “怎么运行任务”。任务启动前管理器还要准备运行环境:选择性汇集业务知识、记忆库、分析方法、策略、和本任务相关的方法论。优先使用本轮对话中用户确认过的内容,缺失部分用过往任务验证有效的方法补齐。输出产物是操作手册 P,任务运行时使用的执行手册。固化 P 之前,管理器防护模块会校验手册覆盖所有即将面对的决策,所有内容不超出来源权限范围。
权限优先级层级:τ 和 P 固化完成后,管理器后续所有选择遵循固定优先级:
固化安全与统计策略 > 固化任务规格文档 > 固化操作手册 > 已批准方法论 > 临时未确认提示 > 智能体自身推理。
高优先级来源永远不会被低优先级覆盖,哪怕智能体推理得出不一样的结论。
3.2 观测与流程推进
图 3|最优‑挑战者轮次生命周期。每一轮将当前最优策略与一个或多个挑战者放在固定观测窗口对比;最终输出升级、保留、继续观测三类凭证。升级成功的挑战者成为下一轮最优策略;保留则最优策略维持不变。固定基线 B0 作为所有轮次对比的锚点,全程不变。
每一个挑战者,都是基于当前最优策略执行恰好一次原子动作得到(图中标记 Δ₁)。一轮实验内部,观测面板执行四步流水线:采集指标、异常诊断、校验数据完整性、生成决策凭证,之后管理器才可以拿到凭证。流水线表现并不固定:第 1 轮干净结束;第 2 轮检测到样本比例不匹配,延长观测窗口之后才结束;第 3 轮延长窗口后正常结束。 如果轮次结束拿到升级凭证,获胜挑战者晋升为下一轮最优策略(轮 1、轮 3);拿到拒绝凭证,最优策略保持原样(轮 2)。完成晋升之后,校验是否达成任务规格文档 τ 设定目标:达成,则退出搜索循环,进入分阶段放量、在独立验证集 Dconfirm 做确认、上线交付;如果没有达成且预算剩余,回到新一轮搜索;预算耗尽则搜索停止。
一轮实验的观测过程:轮次运行过程中,实验管理器按照预先设定的观测计划监控。每一次观测采集指标,诊断波动、分配异常(样本比例错配、数据延迟、曝光中断),判断窗口:继续等待、延长、关闭。 判断仅基于数据健康信号:数据新鲜度、完备度、样本量、完整性;不会提前看指标提升方向。“接近显著”、事后挑选有利日期、裁剪窗口美化结果,全部属于禁止行为。 单次观测如果异常只是噪声,则标记为仅诊断用途,不作为有效证据,延长观测窗口等待干净结果;反复出现异常,或者触碰硬性边界,则暂停本轮实验,上报人工。未解决的异常,绝对不能用来决定是否更换最优策略。
轮次凭证:数据状态正常之后,管理器关闭本轮,输出三类凭证之一:
- 继续观测(continue)
本轮继续运行,安排下一次观测; - 升级(promote)
本轮挑战者获胜,挑战者成为新最优策略;如果任务目标达成,则进入确认阶段; - 拒绝(reject)
结果为负或者无统计结论。最优策略不变;预算还剩则开启新一轮,否则停止搜索。
并不是所有凭证都留给智能体选择。触碰防护规则、数据完整性故障,合法响应只有一种,由确定性服务标记为强制动作;管理器只能确认该动作或者上报人工,相关事实数据会被锁定,不再提供决策参考。
开启新一轮:只有上一轮效果判定完成,并且任务还需要继续搜索(未达成目标,τ 还有剩余预算),才会开启新一轮。执行固定顺序:管理器先编写分析配置,告诉确定性服务需要对当前搜索空间计算哪些内容;向搜索规划器发起规划请求;规划器输出候选,管理器从中选择,不能自己生成候选;选中的每一个候选生成挑战者(相对于当前最优,只执行一次原子动作);管理器部署挑战者,平台编译并上线,开启观测窗口。 每一轮都会消耗 τ 定义的流量与轮次预算,管理器持续跟踪剩余额度。轮次运行期间,管理器可以调度下一次观测、标记观测仅用于诊断、延长观测窗口、通知相关人员、按需上报异常。但不允许:未经审批部署候选、扩大流量、篡改统计结论、执行确定性服务没有生成的动作、仅依靠搜索阶段数据就升级最优策略。
故障与停止逻辑:管理器输出无效或者超时,系统有限次重试,之后回退到安全默认行为:保持轮次现状或者上报人工。任何不可逆操作(部署候选、扩大流量、修改 τ)都必须人工审批,管理器无权自行决定。当拒绝凭证出现,同时 τ 预算耗尽,搜索停止;这仅代表本轮轮次、流量用完,并不代表不可能再获得进一步收益。
3.3 确定性服务与统计系统
上面描述的全部生命周期,管理器虽然要做判断(输出哪类凭证、何时上报、如何解读异常),但所有判断都被一层确定性服务限制,管理器不能推翻。 一共六项服务,职责清晰可审计。核心分离原则:大模型拥有判断选择权(在允许选项内挑选);确定性服务拥有强制执行权(生成选项集合,校验每一次选择,提交状态)。
表 2|约束大模型判断的确定性服务
表格
服务 产出物 作用 管理器防护模块 控制命令集合 基于状态机与固化策略生成可执行命令集合;在提交前校验管理器的选择 状态提交器 状态变更 唯一状态写入组件;原子执行防护模块校验通过的命令 统计引擎 决策凭证 生成每一轮不可修改的观测凭证;管理器可以使用凭证,但是不能修改统计结论 契约构建器 学习契约 在采集数据之前固化结果判定标准和执行计划 候选校验器 校验报告 对规划器输出的每一个候选,做动作格式、合法空间、证据校验 动作枚举器 动作集合 列出当前最优决策树上全部合法原子动作;规划器不能使用集合以外的动作
3.4 结果确认与交付
分阶段放量:拿到升级凭证并且达成任务目标,搜索阶段结束。管理器不再开启新轮次;转而管理从搜索流量向生产流量分阶段移交。放量分为多个阶段;每个阶段设置比上一阶段更大流量占比,以及窗口最大、最小时长。阶段运行时间至少达到最小时长才允许推进;到达最大时长之后重新评估,输出保持、继续放量、回滚三类结论,观测信号和 3.2 保持一致。
独立确认与事后复盘:放量不等于确认最优策略有效。搜索阶段的数据 Dsearch 被用来挑选最优策略,因此不能作为最终证明。最终确认,使用 Dconfirm—— 最优策略固定之后,全新采集的隔离样本,只运行一次测试。如果 Dconfirm 上结果不显著,不能通过重复观测或者混入 Dsearch 来挽救。确认通过后,最优策略交付生产环境;任务进入事后复盘。管理器汇总复盘报告:哪些方案有效、哪些需要重试、哪些需要上报,以及操作手册 P 后续应当如何调整。这份复盘产出方法论补丁,交给记忆整理器(第 5 节)。复盘处理完毕,任务才算真正完成。
4 搜索规划器
本章详细介绍搜索规划器:问题形式化定义(4.1);候选投入实验预算前的预筛选、探索、排序(4.2);高分候选如何通过全实验组 A/B 迭代循环完成验证(4.3)。
4.1 问题形式化定义
策略树 PolicyTree
策略树T是一棵根树,把全部用户人群映射到策略组合。内部节点基于已经可以拿到的前置特征对用户分流;每一个叶子\(\ell\)绑定唯一策略组合\(b(\ell)\)。 形式化表达:
\(T(u)=b(\ell_j),\quad j=\arg_{\ell}[u\in path(\ell)]\) 用户u匹配路径\(\ell_j\),就使用该叶子绑定的策略组合。
合法策略树两条不变约束:
- 完备且互斥
任意用户u,有且仅有一个叶子\(\ell\)满足路径条件;叶子谓词把人群切分为互不重叠、覆盖全部人群的细分片段;没有用户漏掉,也没有用户同时匹配多个叶子。 - 规范化唯一标识
如果两棵树语义等价,给每一个用户分配完全一样的策略组合;无论节点顺序、语法表达差异,它们的规范化哈希完全相同。系统依靠该特性检测:结构不同,但逻辑等价的树,避免重复做实验。
内部节点分为三类,划分人群方式各不相同:
- split(类别特征分割)
:匹配枚举特征取值(城市∈{上海,北京,杭州});不匹配走默认子分支。 - numericSplit(数值分割)
数值特征阈值 / 区间,支持 <≤> ≥ between。 - hashSplit(哈希分割)
基于用户 ID 稳定哈希(MurmurHash3),划分百分比人群;同一个用户永远落到同一分支,实现稳定子人群实验。
图 4|PolicyTree 策略树结构示意图。
搜索空间 SearchUniverse:搜索启动前,搜索空间S定义所有树必须遵守的边界,包含:
-
注册特征集合 F,附带类型、前置可用性、缺失值处理、允许取值 / 阈值; -
注册策略组合集合,每一个是线上运行时可以执行的带版本配置; -
初始种子树\(T^{(0)}\); -
硬性树约束与搜索预算: -
\(d_{max}\)最大树深度,限制根到叶子路径长度,防止细分人群样本过少,统计效力不足; -
\(L_{max}\)最大叶子数量,控制 distinct 策略分配总数,控制部署复杂度; -
\(w_{min}\)最小叶子全局占比,保证每个叶子流量足够,统计引擎可以在预算内输出确定凭证; -
\(F_{max}\)最大不同特征数量,限制整棵树使用的不同分割特征,降低高维空间过拟合风险。
搜索预算包含最大轮次\(R_{max}\)、总实验组‑天预算、实验组数量\(\kappa\)、每轮最大并发挑战者。全部数值在任务规格阶段由用户设定并固化;大模型不能修改。
搜索问题数学描述:搜索从搜索空间S给定初始树\(T^{(0)}\)出发,寻找序列\(T^{(0)},T^{(1)}…T^{(R)}\),每一步\(T^{(r+1)}\)由\(T^{(r)}\)执行恰好一个原子动作\(a^{(r)} \in A(T^{(r)})\)得到。 \(Y(T)\)代表 A/B 平台部署树T观测到的核心线上指标。优化目标:
约束全部来自搜索空间S,大模型无权修改。保证每一棵生成树可以上线部署,每一个叶子流量足够做统计判断。
B0、最优策略、挑战者:一轮实验同时存在三类树。固定基线\(T_0\)(B0)全程运行平台默认逻辑,不发生变化,作为总提升\(\Delta_{total}\)的锚点。最优策略\(T^*\)为本时代内已经确认表现最好的树,作为搜索基准;所有挑战者和它对比,得到单步效果\(\Delta_{step}(a)=\mathbb{E}[Y(T^*_a)]-\mathbb{E}[Y(T^*)]\)。 在一个时代内部最优策略\(T^*\)保持冻结;时代内部所有挑战者共用同一套对比基准。拿到升级凭证,获胜挑战者成为下一个时代最优策略;旧搜索数据仅作为历史证据,不再作为升级依据。
动作集合 ActionEnvelope:给定当前最优树\(T^*\)、剩余深度预算、S全部约束;动作枚举器确定性生成动作集合\(A(T^*)\):全部合法原子动作,有限、可审计。每个动作\(a\in A(T^*)\)指定目标叶子\(\ell\)、动作类型、生成候选树\(T^*_a\)。 五类原子动作:
-
split:在某个叶子基于类别 / 数值特征切分,生成子节点,绑定新策略组合; -
prune:撤销一次分割,把子节点合并回父叶子; -
hashExpand:增加 hashSplit 节点,用于稳定用户级子人群实验; -
collapse:撤销扩展,把子树合并回上层; -
updateStrategy:修改叶子\(\ell\)绑定策略组合\(b(\ell)\),不改动树结构。
搜索规划器只能引用\(A(T^*)\)中已经存在的动作 ID;不能发明集合之外的动作。没有被规划器列入候选短名单的动作仍然保留审计记录,还可以进入边界探索通道。
4.2 预筛选与探索
搜索分为两个阶段。第 0 轮完成预分析与探索流量:诊断特征质量,切分人群,小规模组内对比,输出优先级排好的候选短名单。第 1‑N 轮,通过完整实验组 A/B 迭代循环验证候选(4.3)。第 0 轮结果只决定候选验证顺序;候选是否最终被采纳,完全取决于完整实验组 A/B 结果。
图 5|搜索规划器流水线:阶段 1 预分析与候选召回;阶段 2 可选:基于哈希分割的探索探测;阶段 3 基于假设生成提案。
4.2.1 预分析与候选召回
分配任何探索流量前,规划器对注册特征集合 F 执行结构化筛选流水线:质量诊断、边界生成人群切分、基于历史记忆降权。
特征质量诊断:针对每一个注册特征\(f\in F\)检查四项属性:
-
前置可用性:是否曝光前就可以拿到,避免后处理偏差; -
缺失率:缺失值过多会造成分割不稳定,降低有效样本; -
时间稳定性:特征分布跨天是否发生巨大漂移,干扰重复测量; -
覆盖度:非缺失用户是否足够,切分出子群体可以达到最小叶子占比\(w_{min}\)。
硬阈值不通过直接排除;通过的特征附带质量分数,影响后续优先级。
候选边界生成与人群切分:通过质量筛选的数值特征,候选分割边界来自确定性集合:分布分位数、业务规则阈值(会员等级、购买数区间)、历史实验中策略效果发生突变的位置。类别特征候选集合就是枚举取值集合。 规划器衡量暴露加权后验方差,衡量分割后不同子群体行为差异程度:
\(\mathcal{V}(f,c)=\sum_g w_g(\bar{y}_g-\bar{y})^2\) g代表特征f按边界c切分出子群体;\(w_g\)子群体曝光占比;\(\bar{y}_g\)子群体核心指标后验均值;\(\bar{y}\)全局后验均值。\(\mathcal{V}(f,c)\)越大,代表这个分割维度下,不同子群体响应差异越大,越适合做个性化。 识别高度相关、几乎重复的特征做合并,避免把探索预算浪费在冗余对比上。
基于历史记忆降权:规划器拿剩下的 “特征‑边界” 对,去记忆库(第 5 节)查询历史证据。过去全量实验组没有收益的 “特征‑策略” 组合被降低优先级;已经被证伪的机制直接剔除。反过来,历史上正向但是统计结论不足的组合,提升优先级,是低成本做确定性验证的机会。 本阶段输出有序短名单:(特征‑边界‑策略)三元组;排序综合人群方差、特征质量得分、历史先验。
4.2.2 探索流量与候选排序
该阶段不是每次都会执行。同时满足两个条件才开启:①τ 剩余实验周期足够,探测轮不会挤压 1‑N 轮验证预算;②经过预分析剩下候选数量太多,只靠离线预分析不能稳定挑出最优候选。如果实验周期很短或者候选池很小,直接跳到 4.2.3 三路候选生成,直接使用预分析排序作为优先级依据。
探测:使用扩展动作:开启探索时,规划器对当前最优树插入 hashSplit 扩展节点,执行 hashExpand 动作。依靠稳定哈希把用户固定分配到分支;同一个用户多次访问始终看到同一套策略,可以衡量即时效果,也可以衡量累积效果(例如一周内购买频次变化)。因为分配是用户粒度,样本积累取决于曝光用户总数,而不是页面浏览量。
候选排序:探测窗口结束,规划器用子群体人均收益贡献给候选打分:
\(g_{pop}(a,g)=w_g\cdot(\bar{y}_g^{cand}-\bar{y}_g^{ctrl})\) \(\bar{y}_g^{cand}\)、\(\bar{y}_g^{ctrl}\)分别代表子群体g在候选策略、对照策略下人均后验指标;\(w_g\)子群体曝光占比。必须满足两条阈值才进入候选列表:①样本量达到确定性评估最低要求;②估计收益在连续足够多天保持稳定。不满足任意一条,就不再影响候选优先级,但仍然作为细分诊断证据供规划器参考。
全局占比加权:子群体收益汇总为动作a全局贡献得分:
\(g(a)=\sum_g g_{pop}(a,g)\) 该加权保证:局部提升巨大但是人群占比极小的子群体,不会主导排序。最终候选优先级由\(g(a)\)决定:改善大人群的动作排在局部高增益但覆盖很小的动作前面。
4.2.3 基于假设的候选提案
动机:绝大多数现有大模型优化框架采用自底向上模式:收集一系列实验动作与结果轨迹,让大模型事后总结轨迹,提炼可复用启发式规则。该模式存在三点结构性缺陷:
-
高随机性:大模型对噪声高维轨迹做事后总结;同一套轨迹多次总结,会得到互相矛盾结论; -
积累方向不可控:大模型事后决定哪些轨迹片段重要;系统无法控制保留哪些知识;经验沿着大模型注意力方向随机增长; -
没有内置置信度:单次偶然跑出来的启发式,和几十个实验反复验证的启发式无法区分;容易产生幻觉结论,传递到后续决策。
PILOT 改用自上而下,先假设后验证模式。消耗任何实验预算前,搜索规划器必须输出一个可以证伪的假设:明确目标人群、策略改动、预期因果机制、满足什么条件该假设就应当被推翻。之后分配 A/B 流量专门检验该假设。 假设通过验证,作为高置信度经验记录,附带完整溯源链;假设被推翻,作为负向结果,关闭该分支搜索空间。两种情况经验都附带可审计溯源链条(假设‑契约‑数据‑凭证);置信度由统计实验设计决定,不是由大模型生成叙事是否通顺决定。
表 4|自底向上轨迹总结 VS 自上而下假设检验对比
表格
自底向上(轨迹→总结) 自上而下(假设→证据) 知识来源 大模型对完整轨迹事后叙事 预先注册、可证伪的假设 方向控制 由大模型注意力决定,不可控 由规划器提案决定,可审计 置信度 无内置度量;无法区分单次运行与多次复现结果 基于统计凭证;置信度等于实验统计功效 负向结果 通常丢弃或者模糊记录 显式关闭假设分支,避免重复探索 幻觉风险 高:叙事通顺不等于实证有效 低:每一条声明都具备溯源链条
假设构造流程:当实验管理器下发规划请求,规划器读取当前最优策略、动作集合\(A(T^*)\)、全部积累证据(预分析结果、可选探测信号、过往验证轮次结果),记忆库相关条目。执行四步推理:
-
回顾上一轮假设结果:支持 / 推翻 / 尚无定论; -
识别制约下一步决策最大的不确定性; -
从\(A(T^*)\)挑选动作,分为三类:利用已知正向信号(开发)、探索未充分测试区域(探索)、证伪现有固有假定(证伪); -
对每一个选中动作,写明不同实验结果如何改变后续搜索方向。
开发‑探索‑证伪三分模式,保证提案不只是贪心追求收益;证伪类提案价值在于:就算没有正向收益,负向结果可以永久修剪搜索分支,加速收敛。
PlannerProposal 规划提案:规划器唯一正式输出就是规划提案。每一条提案动作包含 6 个字段:
-
ActionId:必须存在于当前\(A(T^*)\); -
Ordinal Priority:规划器自己短名单内部排序; -
Hypothesis:可证伪陈述,写明目标人群、策略改动、预期方向、推翻假设条件; -
Evidence Refs:支撑该假设的证据引用; -
Expected Mechanism:动作产生效果的因果逻辑简述; -
Outcome for Next Decision:条件计划:假设成立后续执行什么动作;假设被推翻,关闭哪条假设分支、转而调研什么备选方案。
提案严禁包含:效应估计、标准误差、显著性、后验概率、流量分配建议、升级决策、观测窗口调整、提前停止结论。这些全部归统计引擎与实验管理器,不属于规划器职责。职责分离保证大模型只负责 “测什么,为什么测”;实验是否成功完全由确定性统计机制判定。
4.3 候选验证
预筛选得到排序候选列表之后,搜索进入迭代验证循环(第 1‑N 轮)。每一轮将排名靠前候选转为挑战者树:每一个挑战者和当前最优策略相比只发生一次原子变更;通过完整实验组 A/B 评估。 核心原则:不能单凭预筛选 / 探测证据采纳候选;必须经过和最优策略对比的统计显著全量实验组验证。
预先注册判定标准:挑战者上线部署前,冻结本轮全部判定标准:待检验假设、核心指标、需要检测最小效应大小、防护阈值;定义每一种统计结果(正向、负向、无结论、延长观测)对应的后续动作。 在看到数据之前锁定标准,规避 “事后修改成功定义” 的常见陷阱。规划器指定要测试什么;确定性统计机制判定是否通过。
验证循环流程:每一轮执行:挑战者编译成可执行策略树,和最优策略一起部署到 A/B 平台。观测窗口期间,实验管理器采集指标,监控数据健康(3.2)。观测结束,统计系统输出判决:升级、拒绝、继续延长观测。同一轮并行跑多个挑战者时,统计阈值做多臂联合校准,控制整体错误率。 每一次判决完成,输出作为策略经验记录保存,包含假设、目标人群、指标结果、是否达到全实验组阈值。验证通过的假设成为高置信正向经验;被推翻的作为负向经验,避免后续重复探索。两类结果全部交给记忆整理器(第 5 节),保证后续轮次,乃至未来同一搜索空间下其他实验,可以复用积累证据,不用从头再来。
5 记忆整理器
记忆整理器把已经完成的实验、用户反馈转化为跨实验可复用知识。维护两套互补记忆存储:
- 策略证据库(Strategy Evidence)
围绕 “策略‑人群” 组合保存证据;每一条记录某套策略针对特定人群线上指标、正负向结果。 - 方法论经验库(Methodology Experience)
保存如何开展实验的操作知识。记录等待、重试、保障流量样本、观测实验、流量放量、回滚等操作;附带执行上下文、结果、用户反馈。
策略证据库 Strategy Evidence 方法论经验库 Methodology Experience 覆盖范围 领域知识:哪套策略组合,在哪类人群优于对比基准 元知识:特定业务场景下,如何正确运行实验 检索主键 源策略组合 ID,目标策略组合 ID,人群范围 操作类型,场景断言 数据模型 EvidenceItem(每轮不可修改观测)聚合为 ScopedClaim(跨轮结论) PostmortemRecord(每任务不可修改复盘)提炼为 MethodologyEntry(迭代操作建议) 写入时机 轮次结束拿到升级 / 拒绝 / 无结论凭证 任务复盘生成方法论补丁 消费方 搜索规划器:候选召回、历史降权(4.2.1) 实验管理器:组装操作手册、运行时决策(3.1) 置信度驱动 独立多任务下 ScopedClaim 结论保持一致 独立多任务下操作结果保持一致
表 5|记忆整理器维护两套存储对比
重要边界:单任务统计凭证(升级 / 拒绝 / 无结论)决定本任务下一步:更换最优策略、维持现状、延长轮次。但哪怕凭证确定性很强,生成的记忆条目也只能是草稿。单个实验不足以生成可以跨任务复用的知识。条目从草稿→待确认→已批准,必须经过多独立任务证据对齐校验(5.2)。
记忆库无论处于哪一级置信度,只起参考作用。可以影响候选召回排序、实验规划、操作方法选择;永远不能直接作为升级理由,不能自己生成统计证据,不能扩大权限。记忆不能替代实时生成的决策凭证。
5.1 记忆架构:分支‑合并机制
图 6|PILOT 记忆分支‑合并生命周期。每一项新任务从共享主内存分出独立分支;任务运行时分支对其他并行任务不可见。任务证据最终确认完成,记忆整理器 Agent 做对齐,推进置信度,把经过批准的更新合并回主记忆库,供给后续任务。
启动新任务时,整理器从主知识库 fork 一条独立分支,策略证据、方法论经验两套存储全部复制。任务运行过程中,所有新生成证据项、声明、方法论补丁全部写在本地分支;对其他并行任务完全不可见。多个任务并行运行,各自写自己分支;只有合并阶段才互相汇聚,运行期间互不干扰。
只有当任务完成、证据到达最终确认状态之后,才进入合并流程。记忆整理器 Agent 校验证据状态,使用 5.2 对齐逻辑,把分支条目合并回主存储。置信度(草稿→待确认→已批准)只能在跨任务对齐之后才会提升;更新后主记忆库被下一个任务复用,形成能力增强闭环。
如果合并流程故障(冲突无法解决、大模型超时、整理异常),已经确认的实验证据、管理器当前决策、下一次规划请求全部不受破坏。故障只会损害未来任务可用知识,不会破坏产生这份证据的当前任务正确性。
5.2 信息对齐与置信度生命周期
记忆整理器给每一条记忆条目赋予三种置信状态;该置信度衡量跨任务重复验证程度,不是原始单实验统计显著性。
- draft(草稿)
任务本地观测,存入共享记忆,还没有得到其他独立任务复现。每一条新生成条目初始状态都是草稿,无论原始实验样本量多大、统计结论多么确定。 - supported(待确认)
在完全相同检索条件下,至少收到一次来自独立任务一致结果。属于重复观测证据,但还不足以放开无限制自动复用。 - approved(已批准)
积累独立跨任务确认,达到管控阈值,没有未解决重大矛盾。已批准条目可以在无人干预情况下,用于候选召回、优先级排序、组装操作手册、选择操作流程。
名义置信度流转路径:draft → supported → approved。 只有独立任务给出一致确认,置信度才允许提升。同一任务内部多次重复观测不算独立证据,不能增加置信度。出现矛盾证据,整理器重新评估声明;如果冲突证据足够强,可以标记原有条目为 “被取代”,新旧证据完整保留,不会静默覆盖旧记录。每一次置信度变更、标记取代,都附带证据与理由。
对齐流程:任务把新观测写入隔离分支;任务证据最终确认之后,整理器将分支每一条条目和主存储对应条目对齐。使用存储专属检索键匹配:策略证据库用(源策略 ID,目标策略 ID,人群范围);方法论经验库用(操作类型,场景断言)。
对每一条传入分支条目,对齐得到三类结果:
- 证据一致
传入结论和现有声明检索键完全匹配,方向一致;整理器把该任务加入支持引用列表。第一次独立确认,草稿升级到 supported;积累足够独立确认,supported 升级到 approved。更多一致观测只会加强证据,不改变状态。 - 证据矛盾
传入结论和现有声明同一检索键下结果冲突;记录为矛盾引用,重新评估置信度。孤立矛盾不会直接删除旧条目;同时保存支持与矛盾证据,停止置信度向上流转,执行冲突解决规则。当独立矛盾证据积累足够强,可以推翻原有声明,原有条目显式标记 “被取代”,写明证据与理由。对立结论作为全新草稿条目,同样必须完整走完跨任务验证生命周期。哪怕很强的反证,也不能直接生成 approved 级别的新声明。 - 没有匹配条目
主存储没有相同检索键记录;传入条目作为 draft 插入主存储;等待后续独立任务提供支持或者矛盾证据。
关键区分:跨任务置信度 ≠ 单任务统计显著性。统计引擎判断本实验内部效应是否足够强,输出终端决策凭证;记忆整理器判断该结论在多个不同实验之间是否稳定可靠。因此:哪怕单次实验样本巨大、统计结论板上钉钉,输出记忆条目只能是 draft。避免单次偶然结果被过早当作普适知识。
终端 “无结论” 属于独立语义结果,不等同负向证据:代表任务样本、统计功效不足以分辨该声明。整理器可以保留执行记录用于诊断;不计入矛盾,不改动已有声明置信度。
范围兼容性要求:置信度提升,必须检索范围严格兼容。策略证据库需要策略对比、人群谓词完全匹配;方法论经验库要求操作类型、场景谓词完全匹配。范围部分重叠但不完全相同的条目,只可以拿来做上下文参考,不能用来触发置信度变更。
举例:针对「购买数≥3 且周访问频次≥5」人群得到证据,可以辅助解读「购买数≥3」人群声明;但不能直接确认或者推翻更广范围的声明。反复观测到范围特异性差异,整理器生成多条独立范围条目,不会强行合并成一条笼统结论。
5.3 策略证据库
策略证据库保存跨任务知识:不同策略组合相对基线的效果、适用人群、置信等级。一轮实验拿到凭证之后,整理器存储结果,使用 5.2 对齐流程,和历史任务证据做比对。搜索规划器利用这套记忆召回有希望候选,对历史无效方案降权;实验管理器利用它查找本任务相关历史证据。
策略组合标识与成对对比存储:策略组合包含策略列表、执行顺序、准入触发规则、共享资源配置;通过规范化哈希生成全局唯一strategy_bundle_id,跨任务可以识别完全一样的配置。 每一条观测记录定向成对对比:from_bundle_id代表对照组组合;to_bundle_id代表待评估组合;同时写明适用人群population_scope。例如 “IPV 提升 3%” 这条信息必须绑定对照组和对应人群。保证后续任务检索同一组对比,不会混淆不同基线、不同人群下的结果。只有策略对比、人群范围完全一致,多条观测才可以共同提升声明置信度;人群重叠但不完全相等的证据只能作为参考,不算独立确认。
不可修改观测与迭代结论:EvidenceItem 是单轮实验不可修改记录,保存策略对比、人群范围、线上指标结果、统计凭证,写入之后永远不变。ScopedClaim 是跨任务聚合结论,把相同(源‑目标‑人群)的 EvidenceItem 汇总在一起;同时保存支持证据、矛盾证据;置信度遵守 5.2 生命周期。如果足够矛盾证据推翻声明,不会直接覆盖旧记录,而是标记 “superseded(被取代)” 并写明理由。结论可以迭代演进,底层原始实验记录永久保留不变。
因果证据 vs 诊断证据:
- 因果证据
来自预先注册、随机 A/B 完整策略对比。可以支撑 ScopedClaim,推动跨任务置信度提升。 - 诊断证据
事后分析,例如分组切片、探测实验。可以发现人群差异,辅助规划器生成后续候选;但不能提升声明置信度,不能当成经过验证的因果结果。
边界约束:记忆库可以影响候选选择与实验规划,但永远不能替代当前实时统计凭证,不能直接触发升级。当记忆结论和线上 A/B 实时凭证冲突,实时决策凭证优先级更高。记忆证据只有在轮次结束完成对齐合并之后,才对后续任务可见;同一轮运行过程中,不能读取本轮刚产出记忆作为历史依据。
5.4 方法论经验库
策略证据回答 “什么策略有效”;方法论经验库回答 “如何把实验做好”。保存操作实践:等待时长、异常重试、保障流量样本、观测运行实验、流量逐步放大、回滚。每一个任务结束,实验管理器输出事后复盘(3.4),总结执行动作、遇到问题、保留 / 调整流程。记忆整理器结合用户反馈生成 MethodologyEntry,也就是可以被未来任务复用的操作建议。
图 7|方法论经验生命周期。(A) 经验整理链路:从用户反馈、组织手册、任务复盘、智能体建议提取建议,跨任务评估,以 draft‑supported‑approved 置信度存入方法论存储。(B) 任务执行链路:新任务组装操作手册,运行实验,产出复盘记录,再反馈回整理链路。
操作分类与检索:MethodologyEntry 索引由两部分:operation_type操作类型,scenario_predicate场景谓词,限定建议生效条件。六类核心操作类型:
-
wait:收集证据需要等待多久,再做下一步决策; -
retry:异常、无结论轮次如何恢复; -
guarantee volume:保障每实验组流量样本量; -
observe:监控运行实验,判断是否需要介入; -
scale up:条件达成之后,如何提升流量占比; -
rollback:触碰防护 / 安全条件如何回滚干预。
不可修改复盘记录与迭代方法论:PostmortemRecord 是完整任务不可修改复盘记录,保存执行操作、上下文、异常、结果、管理器评估、用户反馈,写入后不允许修改。MethodologyEntry 把相同(操作类型,场景谓词)的多条复盘记录聚合;整理器跨任务对比结果与用户反馈,识别流程反复成功、反复失败、反复引发用户顾虑的模式。支持证据、矛盾证据全部保留,置信度遵循 5.2 生命周期。后续证据推翻建议时,标记 “被取代”,写明理由,原始记录完整保留。操作建议可以迭代,但历史溯源全部可查。
来源溯源和权限区分:每一条建议记录来源类型:
historical_experiment从过往任务流程、结果提炼; agent_postmortem复盘阶段智能体自我改进建议; 两类来源生成条目初始都是 draft,必须经过跨任务独立确认,才可以自动复用。
current_user_input(用户当前任务显式指定流程)、org_runbook(外部组织流程手册)权限不一样,可以直接指导执行,但这份权威不视作跨任务实证确认。就算从用户手册提炼出可复用方法论声明,仍然以 draft 状态进入记忆生命周期。避免把人为规定直接当成已经被大量实验验证的普适经验。
组装操作手册与使用边界:新任务准备阶段(3.1),实验管理器组装操作手册,融合当前用户指令、组织流程、记忆库匹配的方法论。权限高的指令优先级高于学习得来的经验。已批准方法论可以自动使用;supported 仅作为提示;未验证智能体建议,仅在没有更高优先级流程可用时才会被参考。 方法论经验库永远只做参考,不会扩大智能体权限。检索得到建议只能指导等待、重试、保障样本、观测、放量、回滚;执行动作仍然必须满足当前任务管控、安全约束。随着 approved 方法论不断积累,后续实验拿到更可靠的操作手册,同时保留用户指令、实时实验证据的最高优先级。
5.5 写入管控与数据飞轮
记忆整理器让已经完成任务自动变成未来任务输入。实验证据最终确认之后,结果与操作反馈自动整理进入策略证据库与方法论经验库。策略证据库帮助系统选择下一步探索方向;方法论经验库改进后续...
省略。。。。。。

