大数跨境

意识 × Loop:让 Loop 跨 Session 自进化的最佳实践

意识 × Loop:让 Loop 跨 Session 自进化的最佳实践 阿里技术
2026-07-10
10
导读:关于 Agent Loop 跨会话自进化与对齐,本文或许可以提供一些实践样本和参考

这是 2026 年的第 34 篇文章(本文阅读时间:约 20 分钟)

注:本文提到的“意识”指 QoderWork 内的意识功能(包括长短期记忆、用户画像、工作手册等),但本最佳实践适用于任何主流 Agent。

01 开篇:Loop Engineering 的致命短板

Loop Engineering 近期备受瞩目,其核心在于通过配置 Automations、Skills 和 Sub-agents,让 Agent 在单次会话中自动运转。然而,这一模式存在一个常被忽视的致命缺陷:会话结束,Loop 即“死亡”。

用户花费大量时间调试 evals 或纠正判断偏差,一旦关闭窗口,这些经验便随之消失。下次会话,Agent 依旧重蹈覆辙。这种无法跨 Session 自进化的 Loop,本质上只是一个更花哨的 Prompt,如同每天都在训练一位患有失忆症的新员工。

真正的“跨 Session 自进化”,是赋予 Agent 一本自动记录并翻开的笔记本。本文以 FDE(Forward Deployed Engineering)公司的横向深度调研为例,探讨如何实现这一目标。选择调研作为场景主要基于两点:

  • 长时任务特性:调研需按 3C 框架(Company/Customer/Competitor)展开,若无法积累跨会话经验,每次从零教学效率极低。
  • 硬性质量标准:数据需可溯源、判断需区分口径、获客来源需拆解至通道级。简单的 Loop 产出往往缺乏可信度,导致大面积返工。

下文将围绕三个核心问题展开:如何让教训跨 Session 自动加载?如何将对齐拆分为三层互不污染?哪些关键环节必须保留人工干预?

02 效果验证:何为“无需返工”的产出

结论前置:单人 1 天完成 61 家 FDE 方向公司的 3C 深度调研及横向汇总,总计 12 万字。速度并非重点,关键在于产出质量。

以 Palantir 的深度分析为例,严格执行以下标准:

  • Company 维度:涵盖商业模式、产品服务、核心竞争力、融资估值及关键节点。
  • Customer 维度:将获客通道拆解为 CEO 直连、政府关系、AIP Bootcamp 导流、投资者叙事四类,并给出定性占比估算。
  • Competitor 维度:明确"FDE×自营产品×政府牌照”的差异化定位,而非简单罗列竞品。

在数据严谨性上,每个硬数字均附带来源链接(如财报摘要、薪酬报告)。61 家公司汇总后,实现了深度的横向对比:分析五种定价模式的成立条件,拉通估值倍数横线得出"FDE 含量与估值倍数反相关”的结论,并指出中国 FDE 公司的最大威胁源自云厂商而非同行。

此类产出可直接用于团队对齐、架构评审或 OKR 立项。调研最大的时间成本往往在于“返工”。引入“意识×Loop"机制后,从第一版起便卡住“数据可追溯、结论有支撑”两条红线,实现一版过。

此外,沉淀下的 AGENTS.md、MEMORY.md、USER.md 及 Skill 具备可复利性。实测显示,在切换至全新行业进行第二方向调研时,启动 Session 的首篇产出即满足所有 evals 硬标准。迁移的是流程骨架与质量红线,而非具体的行业认知。

03 Loop Engineering 六大框架的落地实践

Addy Osmani 在《Loop Engineering》中提出了 Automations、Worktrees、Skills、Plugins & Connectors、Sub-agents、State 六大基础设施。本次调研中,Skills 对应框架复用,Connectors 打通内部文档社区,Automations 负责会话结束后的总结与坑点追加。

以下重点阐述三个经过重新定义或发现特殊价值的框架:

Worktrees:隔离的核心是防偏见污染

虽然调研场景不涉及 Git 文件冲突,但 Worktrees 的底层逻辑——“并行任务共享状态会导致互相污染”——至关重要。本次实践将其映射为上下文隔离:六份深度报告并行运行,每份拥有独立上下文,写完后再合流。

这种做法的真正收益不仅是加速,更是避免“先入为主”的偏见传染。若不隔离,Agent 在分析 B 公司时容易下意识套用 A 公司的模式。强制每份分析从原点起步,确保了客观性。

Sub-agents:正反对抗优于分头干活

针对证据不足但方向感强的判断,派遣两个子 Agent 并行作业:一个寻找支持证据,一个专门寻找反例。例如某次证据比为 3:17,从而得出硬性结论。这种方式有效规避了单个 Agent 的确认偏差(Confirmation Bias)。审校环节同理,启用独立子 Agent 仅接收标准而不接收历史,可避免自我印证。

State:从进度记录升级为行为塑造

传统的 State 仅追踪任务进度,但在复杂调研中,更需要“上次犯的错下次自动避开”、“判断偏好自动加载”。因此,将 State 扩展为由 AGENTS.md、MEMORY.md、USER.md 构成的“意识层”,实现行为塑造而非单纯的进度管理。

04 意识×Loop:自进化的具体机制

Loop Engineering 解决了单次会话的自动化,但若会话结束后不留痕迹,便是资源浪费。将经验全部塞入 Skill 会导致臃肿且难以个性化,因此需构建独立的“意识层”。

意识层包含三个核心文件,均在会话开启时自动加载,会话中自动更新:

  • AGENTS.md(主动规则):规定输出前的自查项、禁用表达及必做动作(Proactive rules/evals)。
  • MEMORY.md(被动经验):记录踩过的坑、被纠正的判断及跨会话延续的状态(Passive lessons/state)。
  • USER.md(法官偏好):记录个人的判断标准、输出风格喜好及厌恶的表达方式(Judge preferences)。

实战案例:首次 Session 中,Agent 将某 AI 应用公司的客户来源简单归结为“销售外拓”。经人工纠正为“存量升级 + 生态挂靠”双轮驱动后,该教训被写入 MEMORY.md。第二次 Session 分析另一家公司时,Agent 自动加载该教训,主动拆解客户通道,无需重复指令,产出质量显著提升。

目前 MEMORY.md 中沉淀的关键条目包括:

  • 长文档写入需分批切片并复核,避免超过 API 字节阈值。
  • 客户来源判断必须拆解为四类通道并给出定性比例。
  • 关键外部数字必须经过“官方 + 高管发言 + 第三方”三源交叉验证。
  • 上游平台是否下场是判断赛道威胁的首要信号,连续出现可考虑升格进 AGENTS。

AGENTS.md 则承载固化后的规则。例如,针对 Agent 喜欢追加虚浮“综合评价”段落的问题,写入禁令:“结构化分段后禁止追加总结段,硬结论必须落在具体证据里”。随着积累,MEMORY 中的高频稳定经验会被人工升格至 AGENTS,使 Loop 愈发稳健。

05 三层对齐:解决 Loop Engineering 的核心难题

“对齐”不能简化为调优 Prompt,真实场景中至少包含三个层级,需分层承载以避免混乱。

第一层:Evals 对齐(AGENTS.md)

定义 Agent“该主动做什么”。当前 AGENTS.md 维持在约 15 条高频命中规则,分为反面清单(如禁止无来源数字、禁止正确废话)和正面清单(如必须给时间线、必须区分口径)。其核心来源是 MEMORY 中经验的升格。

第二层:场景对齐(三要素)

明确产出给谁看、以何种方式消费、读者需做什么决策。启动调研前明确这“三要素”,Agent 的语气、深度与结构自然适配。

第三层:Judge 偏好对齐(USER.md)

解决主观审美差异。例如个人厌恶"AI 味”表达(破折号连用、宏大词汇),偏好短句白话,拒绝客套元评论。USER.md 确保输出风格“像人写的”。若文件间出现张力,遵循“硬约束(AGENTS)优先于软偏好(USER)”的原则。

06 为何未采用“全自动 Loop"

本次实践中,保留了两个人工干预环节:"MEMORY 升格 AGENTS"与“总报告硬结论下判”。

  • 防止错误泛化:MEMORY 升格 AGENTS 是从“试探”到“铁律”的过程。若由 Agent 自动判断,极易将偶发噪声当作通用规律,污染后续所有会话。曾有一次 Agent 试图将特定行业的 ROI 偏好升格为通用规则,若未及时拦截,将导致后续分析全面偏差。
  • 信用背书:总报告的硬结论涉及架构选型与立项决策,代表个人信用背书,必须由人工亲自把关。

简言之,Loop 可以自转,但 Judge 不能自动。人工保留的是“阀门”与“终审权”。

07 搭建 Loop 自进化的实操步骤

任何人都可按以下步骤搭建自己的进化系统:

  1. 建立 AGENTS.md:梳理工作中“绝不能出现”和“必须做到”的 5 条规则。可从过往返工案例或纠正 Agent 的记录中提取。
  2. 积累 MEMORY.md:每次会话结束前,强制 Agent 将本次教训写入该文件。关键动作是主动纠错,确保跨 Session 受益。
  3. 补充 USER.md:记录个人偏好,尤其是“厌恶什么”,让输出风格贴合本人。

启动初期(前 2-3 个 Session)可能因纠正和记录稍慢,但从第 4 个 Session 起效率将显著提升。待意识文件稳定后,再优化 Skill 和 Automation。同时需注意定期清理 MEMORY.md,将已升格条目删除,归档过时经验,保持上下文精简。

08 结语

Taste(品味)是 Loop 的准备动作,而非产出。Loop 只能放大已有的专业积累,无法让新手瞬间变专家。若缺乏对领域的深刻理解,根本无法制定出有效的 AGENTS 规则。

此外,Loop Engineering 的价值在非代码场景(如调研)中更为显著。Coding 场景有天然 Evals(测试通过与否),而调研等场景的 Evals 需自行设计,这正是边际收益最大的地方。

本文的创作过程本身也应用了 Loop Engineering:通过三个 Sub-agent 分别扮演不同读者角色,从术语门槛、节奏、可迁移性等维度打分,设定 9 分阈值,循环优化直至达标。

注:本文为作者个人技术思考与经验分享,不代表公司官方立场。文中涉及的前瞻性判断基于写作时的实践与认知,仅供交流参考。


欢迎留言一起参与讨论~
【声明】内容源于网络
0
0
阿里技术
阿里技术官方号,阿里的硬核技术、前沿创新、开源项目都在这里。
内容 450
粉丝 1
阿里技术 阿里技术官方号,阿里的硬核技术、前沿创新、开源项目都在这里。
总阅读26.3k
粉丝1
内容450