近期,红熊AI MemoryBear完成升级,新版本代号“明镜”。取这个名字的时候,记忆科学团队在想的是——记忆系统走到这个阶段,最要紧的已经不是“能记住更多”,而是能不能像一面镜子一样:看得清、留得住、放得下。
◎ 看得清:Agent 想调用一段最近记忆或一份用户偏好时,能不能一步取到、不用绕路。
◎ 留得住:真正被反复引用的核心内容,能不能稳定沉淀下来。
◎ 放得下:那些用过一次、再也没被回望的临时事实,能不能被优雅地放下,而不是继续堆在管理面板上。
MemoryBear v0.3.12「明镜」这次更新,主线只有一件事:让记忆学会取舍。
围绕这条主线,本次版本做了四件事:
01 记忆写入更精、更省:长列表消息独立成节点,相同内容不再重复剪枝。
02 记忆调用更快、更懂:极速检索与用户画像成为 Agent 可直接调用的内置记忆工具。
03 记忆生命周期首次成形:存储上限、活跃度遗忘、前端可管理,闭环打通。
04 工作流与知识库的稳态升级:MinerU V3、PostgreSQL 查询、cURL 导入等能力集中落地。
记忆写入更精、更省:写入端的第一次“减法”
要让记忆学会取舍,第一步先落在写入端——决定"什么值得原样留下",以及"什么可以少烧一遍"。
❏ 长列表消息独立附属节点
过去,一段"20 条产品清单"型的长列表消息会作为一整段进入记忆萃取,剪枝时被切成几个大块,检索时命中的往往是"清单里的一部分文字",具体是第几条产品、每一条的细节,容易被稀释掉。
归藏那一版把入口收敛,这一版继续在语义边界上做细分:需要剪枝的长列表或清单型消息,会自动生成独立的附属节点,并与剪枝内容相关的实体建立关联。
举个常见的场景:
一位运营同事把一份"客户投诉分类清单"作为对话内容发给 Agent,希望 Agent 在后续对话里能准确引用"清单里的第 3 条"。明镜之前,这条消息会被并入普通萃取流,检索时容易只召回大意;明镜之后,它作为一个附属节点独立存在,节点内每一条都可以被精确定位,同时与这段内容里涉及的实体保持关联。
节点的粒度更细了,检索命中的准确率也随之提升。
❏ 剪枝不重复执行与Token节省
写入端另一件事是"少烧一遍"。剪枝的结果现在会持久化在记忆消息层,相同内容再次进来时直接命中已有的剪枝结果,不再重复调用 LLM。
举个常见的场景:
同一段内容因为重复的消息摄入被多次写入——比如一段固定话术被反复推送进来。明镜之前每一次都要走完整的剪枝流程,Token 消耗按次数线性叠加;明镜之后,从第二次起直接复用已有的剪枝结果,LLM 调用和 Token 消耗明显下降。
配套的还有两处兼容改进:剪枝允许QA素材为空,来自 MCP、API、工作流自定义输入的场景不再因为素材形态问题被卡住;默认开启剪枝通过升级迁移完成,无需手动切换,历史数据不受影响。
写入端做到"该单独存的单独存、该省的省下",剩下的记忆才更值得被调用。
记忆调用更快、更懂:极速检索与用户画像,成为内置记忆工具
写入端做完减法,接下来是调用端做“提速”。这一版把两个原本“藏得比较深”的能力,做成了 Agent 在运行时可以直接调用的内置记忆工具:极速检索(Express Retrieval)与用户画像(Persona Memory)。
❏ 极速检索:Agent主动取一段“最近记忆”
需要先说清楚:Agent 调用记忆,走的仍然是 Tool Calling——这一点没有变。明镜做的,是把极速检索作为一个内置记忆工具提供出来,Agent 在运行时通过 Tool Calling 点名调用它。区别在于,在极速检索这个模式下,记忆检索工具本身的响应更快,同一次 Tool Calling 的整体耗时随之下降。
举个常见的场景:
一个销售支持 Agent,在回答某个客户具体问题之前,希望先"回顾一下这个客户最近一次问过什么"。这一步依然是一次 Tool Calling,但走极速检索模式时,记忆检索的响应比通用查询更快,Agent 拿到结果、接着往下回答的等待更短。
❏ 用户画像:Agent 主动调一份“偏好档案”
用户画像作为工具的思路和极速检索一致:Agent 主动去调、拿到一份关于当前用户的稳定偏好上下文,然后据此调整自己的响应。有几点需要先讲清楚:
· 用户画像是 Agent 内部构建、内部使用的偏好上下文,由 Agent 主动调用,不是在后台悄悄抓取用户信息;
· 数据只用于让当前 Agent 更懂当前用户,不流向任何外部系统,也不做外部推荐;
· 用户画像的调用仍然受空间级记忆配置约束——空间管理员在归藏那一版设置好的"记什么、不记什么"边界继续生效。
举个常见的场景:
一位终端用户在过去几次对话里反复提到"我不喜欢过多寒暄,直接给方案"。明镜之后,用户画像作为内置记忆工具可供 Agent 通过 Tool Calling 调用,模型自主判断在合适的时机取出这条偏好,本次回答的语气、长度、结构自然向用户习惯靠拢——同样地,这个模式下记忆检索工具的响应也更快。
极速检索让"当下这一刻"更快召回,用户画像让"这个人本身"更稳定被理解。两者都作为内置记忆工具,由 Agent 在运行时通过Tool Calling 调用;变化不在于绕开了Tool Calling,而在于这两种模式下记忆检索工具的响应更快,Agent 取记忆的等待更短。
记忆生命周期首次成形:从“存起来”到“学会放下”
第三件事,是这一版真正的分水岭:让记忆有一条完整可管理的生命周期——记得住、看得清、也放得下。
过去MemoryBear已经能记、能查、能取,但没有"退场机制"。用得越久,记忆越堆越多;管理员越看越迷茫;早期一次性的临时事实和长期真正有用的偏好混在一起,等到检索性能开始感觉到衰减时,往往已经难以回头收拾。
明镜这一版把生命周期补全,分三件事协同工作。
❏ 存储上限:给记忆一条边界
新增了可配置的记忆节点存储上限。空间管理员可以根据业务规模定一个阈值,超过阈值时自动触发遗忘策略。这条能力的意义不在于"限制",而在于"给记忆量一条边界"——避免长期堆积拖慢检索。
❏ 活跃度感知的遗忘引擎
关键在这里:遗忘引擎不是黑盒。它的判定依据是两个具体、可解释的信号——每条记忆的诞生时间,和它被使用过多少次。
· 对象:只清理那些长期没有被引用过的记忆节点;
· 保留:反复被引用的核心内容会一直留下,越常用越安全;
· 触发:默认由存储上限被打破时驱动,管理员也可以在配置里主动调整触发策略。
举个常见的场景:
一个客户支持 Agent 用了半年之后,早期临时会话里的"客户当时用了 X 邮箱"这类一次性事实,因为几个月没被引用,会随着遗忘策略自然淡出;而"客户偏好中文回复""客户所属行业是制造业"这类被反复引用的偏好,会被保留下来。让 Agent 保有的都是仍在被自己引用的记忆。
❏ 前端直接删除:人工兜底的最后一道闸
即便有活跃度判定,"AI 决定删什么"依然是敏感的话题。所以我们在管理面板里加了一条明确的能力:记忆节点可以从前端直接删除。管理员任何时候都可以打开管理页,看到节点、判断价值、直接操作。
这一条与遗忘引擎共同构成明镜的记忆治理原则:AI 提议清理,用户始终可控。
系统提出建议、执行清理,但最终判断权和操作入口始终在人手里。管理员可以随时看到发生了什么、可以随时干预、也可以随时手工清理系统没提议的节点。
记忆生命周期的成形,让 MemoryBear 从"能承接更多",走到了"能长期维护"。
工作流与知识库的稳态升级:让工作流少绕一跳
前面三件事都发生在记忆核心。第四件事,是把这套记忆能力周边的工作流和知识库打磨得更趁手。
❏ 结构化文档解析升级:MinerU V3 + 私有化部署
PPT / PPTX 解析管道这一版切到了 MinerU V3,同时补齐了 PDF 降级时的进度回调,格式感知与容错更强。对本地化数据管控要求较高的团队,工作流和智能体现在支持配置并调用私有化部署的 MinerU 服务——数据不出内网,也能享受同一套解析能力。
❏ 单库检索重排与过滤逻辑优化
混合检索去掉了重复的双重重排,并支持自定义重排模型;分词检索关掉了全局阈值过滤。检索速度上来了,召回的完整度不打折。
❏ 内置 PostgreSQL 查询工具
工作流和智能体现在可以直接连 PostgreSQL 做在线查询,不用再自己写一个数据库工具节点。业务表里的一条订单、一条工单、一条客户记录,都可以在流程里被自然引用。
❏ HTTP 节点导入 cURL
工作流的 HTTP 请求节点新增"导入 cURL"能力。从 API 文档里复制一段 cURL 命令过来,一步生成配置好的 HTTP 节点,省下逐字段填写的时间。
❏ 跨空间迁移自动绑定记忆配置
这条承接 v0.3.11 归藏留下来的语法——把工作流或智能体从一个空间迁到另一个空间时,"记忆提取""记忆存储"节点会自动绑定目标空间的默认记忆配置,不再需要手动重新指定。"归一"的规则,在迁移这个动作里继续兑现。
结语
随着 AI Agent 应用更加深入地走向真实生产环境,"能记住"已经不再是记忆系统的终点——能不能在需要时被快速调用、能不能被长期治理、能不能在噪声中留下真正有价值的部分,正在成为 Agent 长期可靠性的分水岭。
MemoryBear v0.3.12「明镜」这次更新,让写入更精、让调用更快、让生命周期成形、让工作流和知识库更趁手——这些事情加在一起,指向同一个方向:让记忆真正成为 Agent 的长期资产,而不只是一个会不断膨胀的存储层。
当记忆能被系统主动判断价值、被用户随时看见和干预,Agent 的长期表现才会自然稳定下来。
下一步我们会继续沿着几个方向打磨。开放接口将迎来更细粒度的用量与频次治理,让不同规模的团队都能安心接入;记忆的成长、演化与消退会被串成一条可追溯的时间线,让每一条记忆的完整生命周期都清晰可见;短期记忆的检索时效将进一步提升,让当下的对话被更快理解、更准引用。
与此同时,我们会引入业界公认的长期记忆评测标准,用更高的尺度去衡量记忆能力本身,并持续优化知识库在高并发与纯图片场景下的表现。体验侧,工作流与对话流将支持一问多答的流式回复;参数配置在自运行、分享与 API 调用三种场景下也会更加一致,更贴合真实的使用习惯。
记忆觉醒·智能新生
红熊AI 2026产品发布会
7月31日18:00 敬请关注
⍌ 预约红熊AI产品发布会~

