AI 长任务降本新方案:接入外部记忆节省 55.7% Token
在代码分析、资料搜索等长周期任务中,随着对话深入,AI 需反复处理历史代码、日志及指令,导致 Token 消耗急剧增加。本文介绍一种通过引入外部记忆机制优化 Token 使用的方案:将非即时需要的长内容存储于外部,仅在上下文中保留关键信息。
实测数据显示,在 OpenClaw 中接入该插件后,Token 消耗直接降低 55.7%。
接入插件后,除首轮对话外,后续每轮交互的 Token 消耗均显著下降:
该方案不仅服务于单个 Agent,其团队记忆版本(Memory Hub)更可将聊天记忆、技能库、Wiki 及代码图谱统一转化为可审核、可分配的团队资产。这对于一人公司或多 Agent 协作场景极具价值:调研成果可无缝流转至开发环节,测试复盘经验可沉淀为通用技能,从而构建具备共享记忆与持续进化能力的 Agent 小队。
Memory Hub 不仅是展示面板,更能统一管理团队、Agent、记忆资产、版本权限及绑定关系:

其节省 Token 的核心逻辑在于:将冗长的搜索结果、代码片段及报错日志卸载至外部文件,仅在上下文窗口中保留轻量级的 Mermaid 任务图。
本方案基于腾讯云数据库开源的 Agent Memory 插件(目前获 12.1K Star):
下文将演示如何在 Hermes 和 OpenClaw 中接入该插件,助力长任务执行者降低运营成本。
Hermes 接入 TencentDB Agent Memory 实战
接入流程简便,获取源码并切换至对应目录后,执行以下命令即可完成本地安装:
.\scripts\setup-hermes-memory-tencentdb.bat
安装完成界面如下:

随后需配置大模型以管理长短任务记忆,执行相应配置命令:

当 8420 端口被监听并显示特定界面时,表明插件本地安装成功:

最后,在 Hermes 中通过以下命令启用插件:
hermes config set memory.provider memory_tencentdb
OpenClaw 的接入步骤与此类似。
该插件默认使用本地 SQLite,个人开发者无需预先购买云数据库或搭建复杂的 RAG 工作流,上手门槛低。
为何需要 TencentDB Agent Memory 插件?
尽管 Hermes 和 OpenClaw 自带会话保存功能,但在面对长任务时,搜索结果、源码和日志会迅速填满上下文。一旦开启新会话,项目背景往往需重新交代,导致效率低下。
如下图所示,在新会话中询问项目详情,AI 仍需从零开始检索:

此外,原生记忆分散在默认目录、会话数据库及各 Profile 中,难以形成系统化积累:

TencentDB Agent Memory 插件旨在解决上述痛点,构建可长期积累的记忆系统,主要实现三大功能:
- 将原始对话整理为 L0-L3 四层记忆,逐步提取事实、需求、任务经验及用户习惯;
- 支持跨会话复用记忆,避免 Agent 重复学习;
- 将大段源码和日志外存,上下文中仅保留摘要与任务图,大幅降低 Token 消耗。
实测 TencentDB Agent Memory 三大核心能力
L0-L3 分层记忆构建
在 Hermes 中设定回复偏好后,插件立即将对话完整保存至 L0 层:
查询记忆库可见 L0 层数据:
经过多轮交互,插件将"Project-47"、“中文输出”、“先结论后证据”等长期指令提取至 L1 层。即便退出当前会话,L1 层记忆依然保留:
进入 L2 层,插件按项目和任务场景自动归类信息。例如,将"Excel 可视化项目”与"TencentDB Agent Memory 分析任务”整理为可复用的场景记忆块:
L3 层则基于多轮对话形成稳定的用户画像,总结开发能力、协作方式及工具偏好,构成 Agent 对用户的长期认知:
跨会话记忆召回
重新开启会话并让 Hermes 核对 L0-L3 记忆,插件能准确调用搜索工具,找回原始对话、长期要求、项目场景及用户画像:
实测显示,新会话成功召回全部四层记忆并参与回答:
Agent Memory 自动注入项目场景和用户画像,使 Hermes 无需重新搜索即可恢复工作状态:
该机制将协作过程沉淀为可查看、可纠错、可复用的资产,使 AI 从一次性工具转变为持续进化的长期助手。
长任务 Token 压缩机制
针对长任务上下文膨胀问题,插件在 OpenClaw 中将工具产生的大段原始结果自动保存至外部 refs 目录:
任务完成后,自动生成 Offload 索引文件(如 23KB),供后续按需回查:
长任务被压缩为一张 Mermaid 图,通过 node_id 保留进度与受阻点:
主上下文仅保留摘要和索引,细节通过 node_id 按需加载,这是降低 Token 消耗的关键。
实测对比显示,同一会话、同一模型及提示词下:
- 压缩前单次调用消耗:32,935 Token
- 开启插件后单次调用消耗:15,974 Token
七轮会话 Token 消耗折线图显示,第六次会话触发压缩机制,后续上下文显著缩短:
总结
TencentDB Agent Memory 插件通过将对话沉淀为 L0-L3 四层记忆,实现了项目事实、工作要求及用户习惯的可视化与复用。新会话可自动召回背景信息,长任务则通过外部存储与摘要生成大幅降低 Token 消耗。实测数据显示,Token 成本减少约 55.7%,对于高频长任务用户而言,能显著节省运营开支。
该项目由腾讯云数据库完全开源。没有记忆的 AI 仅是工具,拥有记忆的 AI 才能随使用不断增值,成为真正的数字资产。

