大数跨境

清华最新综述 LLM Memory:《Memory for Large Language Models》(附下载)

清华最新综述 LLM Memory:《Memory for Large Language Models》(附下载) 鹏博士研究院
2026-08-25
3

大模型能写万字长文、完成复杂逻辑推理,背后靠两大核心支撑:一是大家熟知的缩放定律(参数、数据、算力堆砌),二是长期被忽略的底层核心——记忆(Memory)

过去两年,记忆这个词在LLM领域被用的很多,KV Cache叫记忆,RAG叫记忆,Agent的向量库也叫记忆,Titans的测试时训练还叫记忆。每个人都在谈记忆,但没有人在同一个坐标系里谈。

近日,清华大学唐杰团队联合新加坡国立大学(NUS)和Bosch AI发布重磅综述《Memory for Large Language Models》,首次提出一套三维记忆分类体系,把所有大模型记忆机制装进统一框架,厘清隐式/显式、短期/长期、在线/离线记忆的边界,堪称LLM记忆领域的百科全书。

记忆从“计算副产品”升级为一等架构设计

传统Transformer里,记忆只是模型前向计算附带产生的临时产物;而新一代LLM、智能Agent中,记忆已经成为独立、可控、可持久化的核心架构模块。

SRA46PRJACQAQ

上图清晰展示两条技术路线的鸿沟:

1. 传统LLM:隐式瞬时记忆

代表就是Transformer的KV缓存、RNN/SSM隐藏状态。记忆完全绑定单次推理会话,对话结束、计算终止,所有信息直接清空;存储容量被上下文窗口锁死,无法跨会话留存经验。

2. 前沿Agent时代:显式持久自适应记忆

将记忆解耦为独立的架构组件。一类是通过测试时学习(如Titans/TTT) 动态更新参数的持久化模块;另一类是可寻址的查找存储(如Engram) 与条件化参数路由(如MoE),支持跨会话留存经验。

论文由此提炼出三大维度,也是衡量一切记忆系统的核心标尺:

• Representation(表征形式):记忆是隐式寄生于计算,还是显式独立可寻址?

• Update Dynamics(更新机制):记忆仅在离线训练时固化,还是支持在线推理时按规则演化?

• Persistence(持久性):记忆随窗口蒸发(短期),还是能跨序列压缩留存(长期)?

三大维度,读懂所有LLM记忆机制

论文的核心贡献是提出一个三大维度分类框架,用来描述大模型记忆的设计空间。

SH5N6PRJABQAK
维度1:表征形式——隐式记忆 vs 显式记忆

这是最核心的划分标准,区分依据:是否存在独立、可控的读写寻址接口

隐式记忆(Implicit Memory):绑定计算的临时工作台

记忆是前向计算的附带产物,没有独立读写入口,所有存储、读取逻辑完全由网络结构固定,无法单独编辑。

主要分为三类:

3ZSOMPRJABQFE
(1)注意力类隐式记忆(KV Cache)

标准Transformer、StreamingLLM、Longformer都属于此类。推理时逐token生成KV张量,依靠滑动窗口、稀疏注意力控制存储规模;优点是与模型原生计算无缝融合,缺点是存储量随序列长度线性上涨,会话结束数据全部销毁。

(2)稀疏选择性记忆

MoBA、NSA、RATTENTION等方案,不改变KV存储本质,仅通过路由、门控筛选部分token参与注意力计算,在有限缓存预算下优先保留关键信息,属于对隐式记忆的访问优化,并未新增独立存储模块。

(3)循环序列记忆(SSM/线性注意力)

Mamba、RWKV、Kalman线性注意力、Gated DeltaNet系列,把全部历史压缩为固定尺寸隐藏状态,实现O(n)线性复杂度,突破注意力二次方算力瓶颈。

短板也很突出,压缩会丢失细粒度细节,长期历史容易出现状态干扰、信息混淆。

隐式记忆共同局限

容量受硬件、窗口限制;无自主读写控制;无法跨会话留存信息,天生不适合长期个性化Agent场景。

显式记忆(Explicit Memory):独立硬盘,可自主读写

拥有脱离前向计算的独立存储组件,支持主动寻址、写入、擦除、更新,信息能在多轮推理、多会话间持久保存,也是当下创新最密集的赛道:

N6Y6OPRJACQE2
(1)参数化记忆模块(Test-Time Training路线)

代表模型:Titans、TTT-E2E、In-Place TTT、MEMORYLLM

核心思路:在骨干模型之外新增一套专用可更新参数,推理阶段依靠梯度、误差信号实时更新,只修改记忆模块权重,冻结主干预训练参数,规避灾难性遗忘。

简单理解:给模型配一块“可实时擦写的专用内存”,对话中不断沉淀当前任务、用户偏好信息。

(2)检索查表式记忆

代表:kNN-LM、Engram、PlugLM、ExplicitLM

以哈希槽、可编辑向量库、独立KV存储池为载体,离线构建知识库,推理时通过相似度检索调取历史信息;存储容量可无限扩容,和模型主干算力解耦,是RAG与原生模型融合的关键桥梁。

(3)MoE混合专家:参数空间的条件记忆

Switch Transformer、Mixtral、DeepSeek-MoE本质是模块化持久记忆:每个专家子网存储一类领域知识,路由函数根据输入选择性激活对应专家,相当于在参数里搭建“分目录知识库”,仅在训练阶段更新(离线记忆)。

(4)多时间尺度嵌套更新

Nested Learning是代表,区分快慢两套参数更新周期:高频模块存储短期对话细节,低频模块沉淀长期通用经验,平衡可塑性(学新知识)与稳定性(不忘旧知识)。

维度2:更新机制——离线记忆 vs 在线记忆

更新机制回答的是“记忆什么时候能被修改”,和表征维度完全正交,同一类存储结构可兼具两种更新特性:

1. 离线记忆:仅预训练阶段依靠梯度更新,推理全程固定不变。传统MoE、早期kNN-LM都属于此类,模型上线后无法吸收新信息。

2. 在线记忆:推理过程中实时更新,也是实现持续学习的核心能力。Mamba循环状态、Titans测试时梯度更新、HAM门控缓存写入都属于在线机制。

论文进一步细化5种底层更新规则,覆盖所有技术路线:

  • 优化式写入:TTT、Titans,依靠梯度目标更新记忆参数;
  • 状态转移更新:Mamba、RWKV,通过线性/门控递推刷新压缩状态;
  • 信号门控写入:AMOR、HAM,用熵、预测误差判断是否写入记忆;
  • 准入/驱逐/整合:StreamingLLM,定义缓存淘汰、压缩策略;
  • 结构/目标诱导更新:Engram、MoE,依靠离线架构设计固定记忆逻辑。
维度3:持久性——短期记忆 vs 长期记忆

衡量信息的有效留存周期,不单纯看存储大小,核心看有效作用跨度

1. 短期记忆:仅限单会话、局部上下文窗口内生效,KV缓存是典型代表,粒度精细但留存时间极短。

2. 长期记忆:可跨文档、跨对话留存信息。分两种实现:循环模型,用固定尺寸状态压缩百万级上下文;显式存储模块,独立记忆池永久保存检索条目、可更新参数。

混合记忆架构,下一代模型的主流设计

单一隐式、单一显式记忆都存在难以兼顾的短板:纯注意力 KV 显存随序列二次膨胀,纯 SSM 压缩会丢失精细事实,仅靠检索/参数显式记忆又带来训练、推理开销上涨。论文指出,混合记忆架构是当前主流最优折中方案,通过融合不同记忆通路互补优缺点,在召回精度、推理成本、跨会话持久度之间取得平衡。

层间交替注意力 + SSM

这是目前最常见的混合形态,核心设计为在 Transformer 网络中交替排布注意力块与状态空间(SSM)块,用静态固定比例分配两种记忆通路的权重,全程无动态调度逻辑。

滑动窗口注意力模块负责短期高精度隐式记忆,完整保留近千 token 内细粒度语义、数字、逻辑关联,保证问答、代码、精细推理不丢失细节;Mamba、RWKV 类循环模块充当超长压缩记忆,将数十万字符历史压缩进固定维度隐状态,实现 O (n) 线性推理复杂度,大幅降低长文本显存占用。

Samba、Jamba/Jamba-1.5、Kimi Linear 是典型代表:Samba 交替堆叠 Mamba 与滑动注意力层,在长文档摘要、书籍级文本任务超越纯 Transformer 与纯 Mamba;Kimi Linear 采用 3:1 固定配比混合 KDA 循环单元与多头隐注意力,兼顾超长对话与精准事实召回。同时衍生轻量化改造路线 LightTransfer,可直接将预训练纯 Transformer 替换部分低效层为循环单元,无需完整重训,大幅降低模型迭代成本。

这类混合的分配方式是静态的,哪些层用Attention、哪些层用SSM,在设计时就固定了,推理时不可改变,缺少动态资源调配能力。

自适应混合记忆路由(动态调度记忆)

该路线摒弃固定网络布局,引入不确定性、预测误差、熵值等门控信号,实时判断当前文本是否需要启用高成本注意力存储,实现按需分配记忆算力。主要有两条自适应设计:

  • 后置注意力精炼(AMOR):主干全程使用轻量化循环记忆完成基础生成,仅当模型输出熵超过预设阈值(代表文本模糊、逻辑复杂、信息密度高),才临时启动注意力模块做局部上下文精炼;简单叙事、短句对话直接跳过注意力通路,平均推理开销大幅下降。
  • 预测误差互补缓存(HAM):每层同时运行循环压缩记忆 + 稀疏 KV 缓存两套通路,模型对当前 token 预测误差大、难以拟合时,才将该条目写入高保真 KV 缓存;绝大多数易预测文本仅保留在循环状态,严格控制缓存总量,完美解决长序列显存膨胀问题。

这类的优势在于算力随输入自适应,无冗余开销;缺陷在于门控阈值依赖人工调参,熵/误差信号无法预判远期关键信息。

隐式短时缓存 + 显式长期存储双体系

专为长期对话、个性化 Agent 打造的分层双存储体系,也是 Titans、Hydra 等带测试时训练(TTT)模型的核心结构,严格区分单轮临时工作台与跨会话硬盘两套独立记忆子系统。双层分工逻辑:

  • 底层隐式短时记忆:Transformer 原生 KV 缓存、滑动窗口注意力,仅保存本轮对话上下文,推理结束可清空,负责实时上下文理解;
  • 顶层显式长期记忆:独立可更新参数模块 / 哈希检索存储池,属于在线更新型显式记忆,跨多轮对话、多文档永久沉淀用户偏好、历史事实、任务规则,推理前会先读取长期记忆信息再结合本轮上下文生成输出。

这类混合在架构层面彻底打破了所有信息都必须在计算图中流动的限制,真正实现了计算与存储的解耦。

4.多时间尺度时序混合架构

混合系统不仅在表示形式上不同,在更新时间尺度上也可以不同。TTT-E2E在推理过程中做批量式参数更新,而Nested Learning把学习分解为多个嵌套优化循环,以不同频率运行。当这些机制集成到更大的架构中时,会形成记忆层级:激活状态以token级粒度演化,显式记忆模块以交互或批次级粒度更新,主干参数保持冻结或缓慢适配。不同时间尺度的记忆各司其职,快的捕获近期模式,慢的编码稳定知识。

5.多组件模块化设计

超越简单的层交错,一些架构显式整合多个记忆相关组件来应对不同的建模需求。Hydra把结构化状态空间主干、稀疏全局注意力、MoE前馈路由以及双工作区和事实记忆机制组合在一起。每个组件有不同的记忆特性,通过编排来平衡长程上下文传播、稀疏访问效率和专用计算。Expansion Span则探索混合记忆跨度增强,在SSM-注意力混合体中引入跨度扩展注意力,把注意力上下文的一部分预留给超出常规窗口的检索token。通过把条件检索、状态传播和局部注意力结合,扩展了混合模型的有效精细记忆跨度,而不承担大上下文窗口的全部成本。

内存管理与记忆评测体系
工程层面:内存效率优化

综述完整梳理生产环境落地的关键技术,解决长上下文推理显存爆炸痛点:

  • KV缓存压缩:向量量化、低秩投影降低缓存占用;
  • 分页注意力PagedAttention:碎片化内存高效复用,支撑大批次长文本推理;
  • 记忆合并:Bottlenecked Transformer定期压缩缓存,减少冗余存储;
  • 循环状态快照缓存:Memory Caching分段保存SSM状态,平衡固定尺寸与历史召回能力。
评测:如何客观衡量模型“记性好不好”?

记忆能力无法只用困惑度、通用问答精度衡量,论文划分四大评测维度,配套行业主流基准:

  • 长上下文检索:Needle-in-Haystack、LongBench、RULER,测试百万token下远端事实召回准确率;
  • 结构化长推理:SCROLLS、NarrativeQA,验证模型整合分散信息完成逻辑推导的能力;
  • 稳定性与抗干扰:针对显式在线记忆,测试持续更新后的遗忘、信息干扰程度;
  • 效率权衡:同等召回精度下的显存占用、推理延迟,区分“真记忆提升”和“单纯扩大上下文窗口”。
开放挑战与未来方向

论文最后列出了六大未解决核心难题,也是未来的创新主线:

1. 统一的LLM记忆理论: 当前的记忆机制是按操作方式分类的(注意力、循环、检索、参数化)缺乏通用数学抽象,无法量化记忆容量、压缩损耗、干扰程度,缺少统一理论指导架构设计。

2. 终身可塑参数记忆:在线更新极易出现漂移、灾难性遗忘,如何分层隔离记忆参数,实现无遗忘持续学习,是个性化Agent落地最大瓶颈。

3. 可解释、可控的更新规则:现有门控、梯度更新逻辑黑盒化,无法人为干预“记住/遗忘哪些信息”,缺少可逆、可诊断的记忆写入机制。

4. 自适应动态记忆调度:现有混合架构多为静态设计,未来需要智能控制器,根据输入内容、任务类型自动分配注意力、循环、检索记忆资源。

5. 软硬件协同记忆设计:大上下文场景下,显存带宽、存储层级成为性能瓶颈,需要从芯片、加速器底层适配分层记忆架构。

6. 标准化多维记忆评测框架:现有基准碎片化,缺少同时衡量容量、保真度、持久度、效率的统一评测标准,难以公平对比不同记忆方案。

结语

过去我们评判大模型,只看参数量、上下文长度、通用能力,这篇综述证明记忆架构将成为下一代LLM的核心分水岭。传统隐式记忆(KV、SSM)能解决长文本推理效率问题,但做不到持续积累经验;而显式持久记忆让AI真正具备“学习、沉淀、复用过往交互经验”的能力,是通用Agent、个性化数字助手、终身学习系统的底层底座。

论文提出的这套三维分类框架的最大价值是把分散在长上下文、测试时训练、检索增强、MoE四大赛道的研究打通,给从业者一套统一的分析、对比、创新工具。未来无论是自研基础大模型,还是搭建企业级Agent系统,记忆架构设计都会成为不可跳过的核心环节。

模智空间公众号后台对话框私信260813获取完整论文!

【声明】内容源于网络
0
0
鹏博士研究院
内容 3457
粉丝 0
鹏博士研究院
总阅读4.8k
粉丝0
内容3.5k