智猩猩AI整理
编辑:金水
9月21日,来自美国德州大学达拉斯分校(UT Dallas)研究者提出并开源了智能体记忆新架构 Jev-Mem。第二天,这篇论文便出现在 Hugging Face Papers 趋势榜页面,引发社区关注。
这次研究没有继续堆更大的模型,而是换了一个思路:
让轻量级的Jev负责“记忆怎么管理”,让大模型负责真正复杂的推理。
在LoCoMo测试中,Jev-Mem取得 0.777的LLM-as-a-Judge得分,相比最强基线 MAGMA 提升11.0%;同时记忆构建时间压到 158 秒,比最快的竞争系统快 6.6 倍,平均查询延迟降到 0.93 秒,降低 36.7%。
那么,Jev-Mem到底做了什么?
论文题目:
Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents
01
Agent记忆太贵,
Jev-Mem换了种做法
Jev-Mem的思路很简单:把“记忆管理”和“复杂推理”拆开。
记忆分类、关系判断、查询路由、候选评分、停止判断,这些操作输出的都是有界结果,一个标签、一个概率、一个分数,而不是自由文本。用自回归 LLM 逐 token 生成再解析,对这类高频决策来说太贵了。
团队因此引入 System-One / System-Two 的分工,System One 负责高频、结构化的轻量决策;System Two 只在复杂推理和答案合成时才被调用。
整套架构分成三个平面:专门的 System-One 控制平面、结构化的多关系记忆平面、以及 System-Two 推理平面。
Jev负责高频、结构化的决策,例如记忆分类、关系判断、查询路由、候选打分和是否继续检索。
真正需要开放式生成和复杂推理时,再交给System Two。
也就是说能快速判断的事情,不让大模型反复生成。
02
Jev到底管什么?
Jev-Mem并不是简单地给Agent增加一个向量数据库。
它把记忆组织成一个多关系记忆空间。同一条记忆可以同时拥有不同类型的关系,包括:语义关系、时间关系、因果关系和实体关系。
例如,Agent过去记录了一次项目经历。
Jev首先判断这条信息属于什么类型,然后寻找可能相关的历史记忆,再判断它们之间是否存在语义、时间、因果或实体关系。
因此,记忆写入过程可以概括成:观察 → 类型判断 → 候选记忆 → 关系构建 → 更新记忆,而到了真正查询的时候,Jev又会继续参与。
它首先判断当前问题更需要哪类关系,然后分配检索预算,再进行图搜索、候选打分,并判断现在找到的信息够不够了?
如果不够,就继续扩展;如果已经足够,直接停止检索。
整个过程变成路由 → 检索 → 评估 → 扩展 → 再评估,而不是传统的固定Top-K搜索。
最后,筛选出的高质量证据才交给System Two进行最终回答。
03
效果怎么样?
Jev-Mem在LoCoMo上进行了长期记忆测试,最终整体 LLM-as-a-Judge达到0.777,最强基线 MAGMA 为 0.700,相对提升 11.0%。
增益在需要多步检索和去噪的题目上最明显:多跳问答 0.623(基线最高 0.569)、开放域 0.618(基线最高 0.517)、对抗性干扰题 0.962(基线最高 0.742)。
效率侧的差距同样直接。
在记忆构建阶段Jev-Mem只需要158秒,而最快的竞争方法也需要1044秒,相当于将构建时间降低84.9%,达到 6.6×加速;A-MEM、MemoryOS 更是要 3000 秒以上。
在查询阶段,Jev-Mem平均只需要 0.93秒,比最快的基于记忆的基线 MAGMA(1.47 秒)低 36.7%,比直接把全文喂给模型(1.74 秒)还低 46.6%。
作为对照,MemoryOS 单次查询要 32.68 秒,这正是"把复杂处理留在检索路径上"要付出的代价。
也就是说,Jev-Mem并不是单纯追求“记得更多”。
它试图解决的是另一个问题:Agent应该如何更高效地管理自己的记忆?
04
总结
过去的Agent记忆,重点更多放在“存什么、怎么存、怎么检索”。
Jev-Mem则进一步把问题变成了,“谁来控制这些记忆操作?”
它用Jev承担高频、轻量的System-One决策,把复杂的开放式推理留给System Two。
最终在保持较高回答质量的同时,显著降低了记忆构建和查询的计算开销。
对于正在走向长程任务的AI Agent来说,未来需要优化的可能不只是模型本身有多强,还包括Agent如何更高效地调用自己的记忆。
END
关注+星标,获取AI前沿进展与开源一线动态

