传统 Agent 记忆评测长期受困于“自选模型、自配裁判、自挑数据集”的数据注水问题。近日发布的 Agent Memory Leaderboard(AML)通过严格控制变量的评测架构与专业评估协议,构建了一套纯粹的盲测管线。本文将从技术架构角度,深度解析 AML 评测管线的核心工程细节。
01|传统评测的水分陷阱:为何以往排名不可信?
在 AI 记忆领域,过往多数论文与产品虽声称“击败基线”,但其评测管线存在三大核心缺陷:
一是下游推理模型混淆,利用强模型生成回答以掩盖记忆检索召回不全的致命缺陷;二是裁判偏误与 Prompt 过拟合,针对特定数据定制评分 Prompt,或使用倾向性极强的自定义 Judge 模型;三是自选测试集与黑盒运行,仅展示优异表现的数百道题目,刻意掩盖离群失效案例。
AML 的核心突破在于彻底重构评测管线(Evaluation Pipeline),明确责任边界:参评系统仅负责 Add(写入)与 Search(检索),平台统一负责 Answer(生成回答)与 Eval(评估),随后进行完整性、版本与资格复核。这种将“记忆系统行为”与“平台评分逻辑”分离的机制,实现了精准的问题归因。
02|技术拆解:AML 评估管线的工程设计
AML 的发布引发技术社区广泛关注,其核心价值在于不仅依赖数据集,更依靠稳定、透明的运行合同(Evaluation Contracts)实现公平比较。
AML 自动化工程管线具备四大硬核设计:
接口责任隔离(Add / Search Boundary)
参评系统被严格限制为仅响应两个 HTTP API:Add 接口负责接收长周期历史对话和代码记录并更新记忆;Search 接口负责根据 Query 返回 Top-K 记忆证据片段。
评估合同版本哈希(Evaluation Contracts Versioning)
每一期评测的超参数(如 top_k=100、超时阈值、固定使用 gpt-4o-mini 生成答案等)均通过 Hash 锁定,杜绝评测过程中参数的静默更改。
高并发与自适应重试(Adaptive Concurrency & Resilience)
评测平台采用 64-Worker 异步并发调度架构,自动处理厂商 API 在面对海量请求时的 5xx 报错与限流,确保高压盲测环境下的系统稳定性。
近 5k 规模的盲测集(Private Blind Dataset)
AML 基于 1.5 亿字符的超长上下文构造了近 5000 道盲测试题,涵盖召回、利用、安全等七大核心维度及丰富子类。该数据集规模既能全面评估系统在复杂场景下的综合表现,又避免了冗余。结合“公开子集 + 隐藏私有盲测集”的双轨设计,AML 能够精准检验参评系统的真实能力上限。
03|首期榜单公布
在 AML 首期文本记忆赛道中,参评系统被严格划分为“开源方法榜”与“商业产品榜”两大独立通道,二者使用完全相同的测试套件与评估标准。
商业产品榜(Commercial Track)
第 1 名 MemoraX:综合得分 58.02,斩获商业榜榜首,并在 7 项文本能力分项中全维度领跑。
第 2 名 MemOS:综合得分 45.89,总响应延迟控制出色。
第 3 名 NTES-MEMORY-SMART:综合得分 44.21,展现了网易在智能记忆方向的坚实技术基础。
除成绩外,榜单还提供了时间与返回规模的定性标签。当前商业榜前三名的总耗时、写入和检索均标注为"Fast",Token 效率处于领先水平,直观反映了其工程形态优势。
开源方法榜(Academic/Open-Source Track)
第 1 名 InvMem:综合得分 45.06,结合知识图谱与隐式索引路线,表现出色。
第 2 名 ReFind:综合得分 44.97,以微弱差距紧随其后。
第 3 名 ActiveMemoryIndex:综合得分 44.84,在动态记忆重排上表现亮眼。
AML 的真正价值不在于单次榜单排名,而在于它将过去隐含、分散且易作弊的评估变量,重构成可版本化、可审计的标准化评测合同。对于正处于基础设施摸索期、通用术语尚未统一的 Agent Memory 领域,这种“变量控制”的工程基座比暂时的排名更为关键,它让行业后续的技术讨论与工程演进得以基于公正、透明的运行证据展开。

