大数跨境

Agent 记忆到底怎么做?一文讲透 8 种 Memory 策略,从窗口到 Memory OS

Agent 记忆到底怎么做?一文讲透 8 种 Memory 策略,从窗口到 Memory OS 智能体AI
2026-10-02
11
导读:别只会用向量数据库:Agent Memory 的 8 种策略,你用到第几种了?

给 Agent 接上向量数据库,并不等于赋予了它真正的“记忆”。

在实际应用中,用户常遇到此类场景:与 Agent 长时间对话后中断,再次询问过往项目细节时,Agent 却表示无法访问之前的对话。

多数人的第一反应是接入向量数据库。然而,构建长期记忆系统远比想象中复杂。“记忆”背后隐藏着诸多子问题:

  • 哪些信息应保留在当前对话中?
  • 哪些信息应当被遗忘或压缩?
  • 哪些数据值得长期保存及何时召回?
  • 记忆间是否存在关联?上下文溢出时如何处理?

向量数据库仅解决了部分存储与检索问题,而决定 Agent “智能程度”的关键,在于如何管理有限的认知空间。

核心观点:「记忆从来不是“把历史存起来”,而是怎么管理一块有限的认知空间。」

本文看点

01

八种记忆方案演进

02

记忆本质是注意力管理

03

企业级选型五个 Level

01

FOUNDATION

LLM 本身是没有记忆的

底层事实在于:模型每次推理仅能看见当前输入的上下文,不存在中间态或隐藏意识。其逻辑可简化为:

...公式

LLM + Context = 这一次对话里的“记忆”

因此,Agent Memory 的核心挑战在于:如何将过去有价值的信息,在合适的时间点,以合适的形式重新注入 Context 中。

围绕这一目标,业界演化出八种技术路径:


02

THROTTLING

前四种方案:如何“节流”

这四种方案主要解决留存、遗忘及压缩效率问题。

01 全量记忆:保留所有历史

将完整对话历史原样输入模型。优点是无信息损失;缺点是随着对话延长,Token 消耗剧增,最终触及 Context Window 上限。该方案仅适用于短对话或一次性问答场景。

02 滑动窗口:保留最近 N 轮

仅保留最近的对话记录。优点是长度可控、成本低;缺点是仅依据时间戳判断,无法区分信息重要性,可能导致关键背景信息丢失。常见于在线客服等短周期场景。

03 相关性过滤:基于价值筛选

根据相关性、重要性对记忆打分,实现从“时间驱动”到“价值驱动”的转变。风险在于判断误差可能导致关键信息被误删,且这种“失忆”难以察觉。

04 摘要压缩:提取核心语义

利用 LLM 对长对话进行摘要,压缩后存入上下文。虽能大幅降低 Token 占用,但压缩必然伴随细节丢失,需在成本与信息完整性间权衡。

上述方案的共同局限是:一旦信息移出当前 Context,便无法找回。这引出了长期存储的需求。


03

STRUCTURE

后四种方案:如何“建结构”

05 向量数据库:按需召回

VectorDB 解决的是长期记忆的存取方式。流程为:对话内容 Embedding 入库,通过语义检索取出 Top-K 相关记忆注入 Context。其优势在于实现了“需要什么找什么”,但需精细调优 Embedding 质量、切块策略及召回准确率。

06 知识图谱:结构化关系记忆

将对话转化为实体与关系存入图数据库。相比向量检索,图谱能精确表达复杂关系(如人物、项目、公司间的关联),适用于金融、医疗等领域。缺点是构建与维护成本高。

07 分层记忆:短期+长期组合

借鉴人类认知模型,将记忆分为工作记忆(滑动窗口管理)和长期记忆(向量库或图谱管理)。系统具备分层意识,按信息性质分区存放,常见于个性化助手及复杂企业系统。

08 类操作系统内存管理:动态调度

将记忆视为资源管理问题。Context Window 类比 RAM,长期记忆库类比 Disk,Memory Manager 类比操作系统。通过 Page In/Out 机制,动态将活跃记忆换入工作区,非活跃记忆换出。MemGPT (Letta) 是该理念的代表。

此时 Agent 的核心问题转变为:「当前时刻,哪些记忆应被放进工作区?」


04

COMPARISON

八种方案对比分析

成熟 Agent Memory 系统通常是多种方案的组合,而非单一应用。

方案
核心策略
解决的问题
全量记忆
全部保留
不遗忘
滑动窗口
最近优先
控制长度
相关性过滤
重要优先
减少无关信息
摘要压缩
信息压缩
降低 Token
向量数据库
按需召回
长期存储
知识图谱
结构化关系
复杂推理
分层记忆
分级管理
短期 + 长期
类 OS 管理
动态换入换出
超长记忆管理

「这八种方案并非互相替代,而是不断叠加的关系。」


05

INSIGHT

深度洞察:记忆的本质是注意力管理

归纳而言,记忆工程需回答四个核心问题:

Remember:什么值得记住?

Forget:什么可以忘掉?

Retrieve:什么时候该把它找回来?

Compress:如何用更少 Token 表达更多信息?

「Memory Engineering 的本质,其实不是 Storage Engineering,而是 Context Engineering。」

存储仅是手段,真正的难点在于让信息在正确时刻出现在正确位置。


06

PRACTICE

落地参考:企业级 Agent 选型建议

根据业务复杂度,可将选型分为五个层级:



Level 1:简单 Chatbot

采用全量记忆或滑动窗口,满足基础交互需求。



Level 2:长对话 Agent

结合滑动窗口与摘要压缩,有效控制 Context 长度。



Level 3:知识型 Agent

引入短期窗口与向量数据库,具备初步长期记忆能力。



Level 4:复杂企业 Agent

融合短期记忆、摘要、向量库及知识图谱,实现分层管理。


Level 5:长期运行 Agent

增加 Memory Manager,负责写入、召回、压缩、淘汰及优先级排序的全套调度逻辑。

达到 Level 5 才算真正进入 Agent Memory Engineering 领域,这已超越简单的数据库接入范畴。


∞

THE END

结语

Agent 的发展焦点正从模型能力、工具调用转向 Context 管理。未来的核心议题将是:

「Agent 能否长期、稳定、低成本地管理自身记忆?」

真正具备长期工作能力的 Agent,需明确知晓过往行为及信息优先级。Agent Memory 将演变为完整的 Memory Operating System,成为下一阶段 Agent 工程中值得关注的基础设施。


END

【声明】内容源于网络
0
0
智能体AI
1234
内容 509
粉丝 0
智能体AI 1234
总阅读21.7k
粉丝0
内容509