大数跨境

当 Agent 拥有“肌肉记忆”:EverMemOs 的长期记忆系统设计与实践

当 Agent 拥有“肌肉记忆”:EverMemOs 的长期记忆系统设计与实践 DataFunSummit
2026-07-28
3
导读:胡传锐 EverMind 算法负责人

导读当 Agent 需要执行“请用上个月的分析方法重新分析 Q4 数据,保留我上次手动调整过的两个参数”这类跨周任务时,单纯依靠上下文窗口或传统 RAG 均告失效。本文围绕长期记忆系统的三类抽象(情景记忆、画像记忆、程序记忆),介绍了自研的 EverMemOs 核心算法——基于超图聚类的 HyperMem 检索框架,以及让 Agent 从经验中提炼可复用技能的 Self-Evolving 机制。同时,文章解析了 EverMemBench 与 EvoAgentBench 两套评测体系,揭示了当前记忆系统在多跳推理与多方协作场景下的真实瓶颈。

主要内容包括以下几个部分:

1. 记忆,Agent 基础设施的最后一块拼图

2. 从 RAG 到 MemoryOS:行业演进与能力缺口

3.EverMemOs:超图记忆与自进化技能

4. EverMemBench:让记忆评测对部署现实诚实

5. 总结:三条结论

分享嘉宾|EverMind 算法负责人

内容校对|韩珊珊

出品社区|DataFun

01

记忆,Agent 基础设施的最后一块拼图

当用户向 Agent 发出“请用上个月的分析方法重新分析 Q4 数据,保留我上次手动调整过的两个参数”这一指令时,背后涉及四项能力缺口:跨数百条历史记录的时间语义定位、分散在多个会话中的流程重建、识别用户显式修改过的状态、以及推断该用户隐性的验收标准。这些能力无法仅靠增强基座模型获得。

两股力量将记忆系统推向了前台。第一股是上下文成本的超线性增长。即便模型支持 1M 或 5M 窗口,真实长任务仍会溢出——每次 API 调用重放全部历史,注意力复杂度 O(N)导致首 Token 延迟飙升,成本成为填不满的黑洞。第二股是 Agent 从无状态聊天转向有状态执行。以 OpenClaW 为代表的执行型 Agent,每个任务跨天、跨工具,必须记住用户的偏好、历史决策以及错误教训。没有记忆的 Agent,如同每天重新培训的实习生。

综合结论:记忆已经从“模型的一个特性”转变为"Agent 系统里独立的基础设施”。

团队将长期记忆拆解为三类,对应认知心理学的划分。情景记忆负责存储发生过的事件——时间、地点、参与方、因果链,作用是突破上下文窗口,保留推理素材。语义记忆/画像沉淀稳定事实——偏好、身份、习惯、价值观,承担长期个性化,作为隐形上下文。程序记忆/技能提炼如何做事的 SOP,包括触发条件与操作序列,让 Agent 随使用自我进化,越用越像用户。

理想的记忆系统应同时具备四项能力:跨时间的联想推理(时间和因果作为一等公民)、从经验到技能的抽象(不止存 Trace,还要沉淀可复用 Skill)、多模态统一记忆(文本、图像、表格不被模态分隔)、以及白盒管理与隐私隔离(可读、可改、可审计,严格租户隔离)。

02

从 RAG 到 MemoryOS:行业演进与能力缺口

记忆系统的四代演化沿着三条轴线同时上升:能力轴从事实检索到多跳推理再到程序性学习;抽象轴从 Token 到 Chunk 到 Entity/Relation 再到 Topic/Episode/Fact;工程轴从脚本库到 SDK 到云平台再到面向 Agent 的 OS

第二代 Vanilla RAG 解决了“事实召回”,但它不算记忆。固定长度切块加向量相似度检索,无时间感知——“上个月的方法”无法被 Embedding 正确定位;无多跳推理,只拼接 TopK 片段;无 Profile 抽象,相同事实重复出现无法合并;无程序性记忆,成功经验一次性使用;无多模态原生,图像表格被扁平化。

第三代 Graph/KG RAG 引入实体与关系补上了拓扑结构。HyperGraphRAG 用超边表达多元关系,在 LoCoMo 上达到 86.49,是 RAG 类的最强基线。但图结构依然是被动的,缺少“用户画像”和“技能”这类抽象层。

第四代产品化记忆系统各有取舍。Mem02024 年首发)简洁快速,工程化最好,亚马逊等厂商在使用,但缺乏程序记忆与多模态。Zep 以时序化时间图为特色,擅长追踪跨会话变更。Memobase 将记忆建模为可更新的用户画像卡片,结构化字段驱动。MimOS(国内团队)定义了从 KV Cache 到参数化记忆的三层架构。现有方案在 EpisodicProfileProcedure、多模态四个维度上无一拿满——这正是 EverMemOs 的起点。

03

EverMemOs:超图记忆与自进化技能

为什么选超图

真实对话框的关联是高阶的,并非两两配对。一次周报协作同时连接“写周报”这一 Topic、多个 GitHub Commit 事件、以及“老板不看代码”这一 Profile 事实。传统图只能表达成对关系,而超图的一条超边可以同时连接一个 Topic 下的所有 Episode,或一个 Episode 下的所有 Fact,将高阶关联一次性表达。

构建流水线分三个阶段,全部由 LLM 驱动且支持增量更新。第一阶段是边界检测:流式 LLM 对对话做语义完整切分,每个 Episode 附带摘要与时间戳。第二阶段是主题匹配:新 Episode 与历史 Topic 做相似度匹配,够相似则挂载到旧 Topic,否则新建。第三阶段是事实抽取:从每个 Episode 中抽取原子事实,并通过加权超边绑定。超边嵌入采用传播机制——节点的向量同时携带其所有高阶邻居的信息,为联合推理铺路。

检索阶段采用 Coarse-to-Fine 策略:先定位主题,再拉取 Episode,最后聚焦事实。默认参数(K_Topic, K_Episode, K_Fact)为(15,25,30),初始候选池 100,可选 Cross-Encoder 重排序。在 LoCoMo Benchmark 上,HyperMem 在 Overall 得分 92.73,相比 HyperGraphRAG86.49)提升 6.24,尤其在 Multi-hop 维度领先 12.8 分——超图对高阶关联的建模优势在此最明显。

从经验到技能:让 Agent 长出肌肉记忆

只存储 Trace 没有意义。人类学骑自行车,不是记录每次摔倒的物理参数,而是提炼出肌肉记忆。Agent 也一样——多次成功应抽象成“什么情况→哪几步→什么关键点”;失败经验应变成警示;用户纠正后,下次自动更新。

Self-Evolving Skills 的闭环包含五个自动阶段:经验采集→经验结构化(提取 Intent/Approach/Insight)→语义聚类→Skill 提炼→Skill 使用与反馈。每个 Skill 拥有四维成熟度评分:完整性(触发条件/步骤/注意事项是否齐全)、可执行性(步骤能否落到工具调用)、证据支撑(是否被多条正向经验证实)、清晰度(描述是否无歧义)。Skill 经历雏形、成长、成熟、退役的完整生命周期。

在 EvoAgentBench 上,团队用 OpenClaW 框架测试了四个领域。以 27B 模型为例,软件工程任务的基础成功率仅 11.5%,经过 100 轮自进化后暴涨至 38.5%(相对提升 234.8%);信息检索任务从 30.8% 提升至 32.3%,对话轮次从 25.3 压缩至 26.5(注意此处为轮次增加,原文表格中 27B IR 轮次从 25.326.5,但 397B 从 36.324.3,小模型在简单任务上仍有波动)。更为关键的是:27B 模型配 EverMemOs 后在软件工程上达到 38.5%,与 397B 裸模型持平——记忆的边际收益高于参数规模扩张。

04

EverMemBench:让记忆评测对部署现实诚实

行业现有 BenchmarkLoCoMoLongMemEval 等)均为 User-Assistant 双人对话,单场单 Persona,千轮级上下文,且 Memory Awareness 与 Profile Understanding 大部分未覆盖。团队自建 EverMemBench,基于三大设计哲学。

统一而非拼装:三个评测维度(精细召回、记忆意识、画像理解)在同一套对话、同一组角色上考察,避免碎片化评估。难度感知的评分:每道题带难度权重(0.8/1.0/1.2),“会做简单的”和“会做难的”不等同计分。对部署现实诚实:Pipeline 中所有L LM 统一为 4B 参数模型,排行差异真正反映记忆能力而非基座强弱。

场景设计为企业级多人多群组协作——模拟真实工作场景中产品群、算法群、工程群同时讨论相近主题,信息分散且相互关联。3×矩阵覆盖三类认知层级各三个子任务:精细召回包括单跳、多跳、时间跨度;记忆意识包括约束遵守、主动提醒与规则更新;画像理解包括风格模仿与角色边界推断。

主实验结果揭示了四个关键现象。第一,简单事实记得住,复杂关联记不住——单条信息最佳模型达 98%,但多人多群组多跳召回降至 26%

第二,跨群组协作是核心瓶颈:问题涉及群组数从 增至 时,所有系统准确率下降超 60%。即便给全量上下文(Full Context)也扛不住,证明不是召回问题而是能力问题。

第三,时间轴推理很弱——“何时完成”“间隔多久”所有系统最高 45%,系统只把时间戳当标签排序,不理解任务生命周期。

第四,缺乏长期 Profile 理解:要求模仿某人沟通风格回复,最低准确率仅 11%

05

总结:三条结论

第一,长上下文与外部记忆是互补而非替代关系。扩展上下文窗口缓解单次推理的信息密度,但无法替代跨任务的 Episode/Profile/Procedure 三类抽象。上下文是暂存,不是记忆。

第二,在经验密集型任务上,记忆架构的边际收益高于模型规模扩张。27B EverMemOs 在软件工程任务上追平 397B 裸模型,且跨信息检索、推理、工程三个维度全部正向提升——记忆优先于参数堆砌。

第三,多方协作推理是当前记忆系统的主要性能瓶颈。群组数增加导致准确率断崖式下降,且在所有受测系统上同时出现。下一个瓶颈不是规模或检索,而是跨主体信息流的建模。

以上就是本次分享的内容,谢谢大家。


分享嘉宾

INTRODUCTION


胡传锐

EverMind

算法负责人

2019 年校招加入奇虎 360 人工智能研究院,从 0-1 搭建智能物联网设备 CV 算法体系,后担任行业大模型负责人,主导研发的税务大模型荣获人民网数造新实体典型案例等荣誉;现任职 EverMind 算法负责人,主导 EverMemOS 及相关基准测试研发,核心技术应用于定位为"AI 联合创始人”、助力小团队高效协作的 tanka 产品。

往期推荐


ES 基于 Agent+Skill 的新一代搜索引擎!

VeloxCon China 2026 将于 12 月 5 日在上海举办,议题征集正式启动!

只靠知识库,救不了 AI Agent:它真正缺的是“会做事的经验”

Palantir 最新发布背后:Agent 已经会干活了,企业为什么还不敢放手?

Agent 失控的真相:上下文、工具和记忆,都不是越多越好

深圳 Agentic AI 会议日程已定,安克创新、平安、传音、韶音、荣耀、Kimi 等 60 个 Agent 技术案例等你来听

非对称解耦与 Head 级竞争:长文本推理效率优化的三条路径

Palantir 如何把企业 AI 接入核心业务:从数据整合走向可执行智能

为什么你的 AI Agent 一问业务就“露馅”?因为缺了这层语义底座

Skills+CLI 的 Agent 数据湖落地探索!

点个在看你最好看

SPRING HAS ARRIVED

【声明】内容源于网络
0
0
DataFunSummit
DataFun社区旗下账号,专注于分享大数据、人工智能领域行业峰会信息和嘉宾演讲内容,定期提供资料合集下载。
内容 1321
粉丝 0
DataFunSummit 北京鸿润嘉诚企业管理咨询有限公司 DataFun社区旗下账号,专注于分享大数据、人工智能领域行业峰会信息和嘉宾演讲内容,定期提供资料合集下载。
总阅读37.3k
粉丝0
内容1.3k