上一期我们讨论了AI应用场景从试点到规模化的路径:规模化的瓶颈不在技术而在适配层,需要行业图谱做横向对标,效果评估要覆盖技术指标、业务价值和能力沉淀三层,场景库则要做到动态管理、与预算挂钩、有进有出。
场景解决的是“AI在哪里创造价值”的问题,本期要回答的是:AI凭什么持续创造价值?
一个越来越清晰的共识是:大模型的通用能力正在快速拉平,竞争的重心正在转向模型之外的配套能力。其中最容易被忽视、却日益关键的一项,是AI的“记性”——它能记住什么、怎么记住、怎么想起、怎么忘掉。本期我们探讨智能体记忆管理的技术体系,以及企业什么条件下值得建设统一的记忆平台。
如果把AI智能体比作一个真实的打工人,大模型(大脑)负责思考和理解,工具模块(手脚)负责执行,而记忆模块就是它的“经验和记性”。
智能体记忆,是指AI系统记录、回忆过去经验,并以此来改进决策和行为的能力。它不是简单地把聊天记录存进硬盘,而是在用户授权下,对交互过程中的有效信息进行识别、抽取、组织和存储,让AI在后续任务中复用历史经验。
一条合格的智能体记忆,至少要满足四个特征:
• 可沉淀:能从交互中自动抽取,同时兼容来自持久化存储和人工录入的知识;
• 可检索:用的时候能按需找回来,而不是全文重读;
• 可更新:用户改主意了,记忆能改;情况变了,记忆能修;
• 可遗忘:过期的、错误的、用户要求删除的,能真正清掉。
第三条和第四条尤其重要,也正是“记忆管理”区别于“数据存储”的地方。
第一,记忆让个性化成为可能。没有记忆,“千人千面”只是一句口号。用户的偏好、习惯、禁忌,全部需要跨会话保留。
第二,记忆让长任务有了连贯性。一个持续数周的采购谈判、一个跨多次会话的软件开发项目,中间任何一次对话中断,都依赖记忆把“我们聊到哪了”接续起来。没有记忆,长任务只能退化为一次又一次孤立的一问一答。
第三,记忆让智能体越用越“懂行”。每一次任务结束,把“什么方法有效、什么坑要避开”沉淀下来,下一次再遇到类似场景直接调用——这正是人类专家成长的方式,也是智能体从“通用”走向“专精”的路径。
第四,记忆能显著降本增效。把所有历史一股脑塞进上下文,既贵又慢又容易出错;把大部分历史存入外部记忆、按需检索,上下文只保留当前任务所需,推理成本和时延都能明显下降。
认知科学把人类记忆分为工作记忆、情景记忆、语义记忆和程序记忆。这套分类几乎可以直接平移到智能体上——因为两者的难题是同构的:记什么、存哪、怎么找。
图:记忆的类型
这套分类与产业界更常提到的“短期记忆、长期记忆”并不矛盾,而是两个不同维度的切法:短期/长期回答“存多久”,四分法回答“存什么、怎么存、怎么查”。两者的映射关系非常干净:
工作记忆大致对应短期记忆,存放在高速缓存中,随会话结束而清空;情景、语义、程序三类对应长期记忆,持久化存储,但各自携带不同的有效期和衰减策略。
记忆管理可以归纳为三个动作。
第一招:克制地写。不是每句话都值得记。好的记忆系统坚持“少写、晚写、带证据写”:会话中只把任务状态放在工作记忆里,会话结束后再做“结算”——本轮产生了什么可跨会话复用的信息?其中哪些是稳定事实,哪些只是临时状态?写入时要带上来源和置信度。
第二招:聪明地查。拒绝“向量相似度取前几条”式的偷懒检索,改为多路召回:语义召回找“意思相近的”,关键词找“字面上命中的”,时间线找“最近发生的”,再按相关性、时效、重要性加权排序。进入上下文前设 token 预算:当前任务约束永远优先,低分记忆宁可不拿,避免“为了记得多,反而答得偏”。
第三招:体面地忘。记忆会过期,会冲突,会出错。好的记忆管理系统为每条记忆配置有效期。发现记忆冲突时不直接覆盖,而是保留版本、标注分歧,交由智能体在对话中判断或者要求用户澄清。用户要求删除的,支持软删除与硬删除,并全程留痕可审计。
一句话概括:写入要克制且带证据,检索要混合且受约束,遗忘要体面且可审计。
这是企业用户最关心的问题。答案是:看量级,不必人人上平台。如果使用场景是单部门、一两个智能体、只做单一任务,轻量方案就足够。但出现以下任一信号,就值得认真考虑建设统一的记忆平台:
• 智能体数量超过个位数,且分散在不同业务线,各自重复建设“记忆模块”;
• 多个智能体需要共享同一份用户画像(用户明确要求客服助理知道的偏好,营销智能体也想使用);
• 记忆内容涉及个人信息,合规审计要求“记得什么、谁看过、何时删的”全程可查;
• 记忆质量成为瓶颈,需要统一的评估、清洗和治理手段,而不是各业务自行其是。
把前文所有讨论收拢成一张图,一个典型的记忆平台可以概括为“一横、两纵、两条安全带”。
图:通用记忆平台架构
“一横”是记忆的生命周期流水线,从原始信息到可供使用,共四道工序。原始信息产生、处理、记忆沉淀入库、对外服务。
“两纵”是在流水线之上接出的两条消费路线。路线 A 给智能体用,走运行时循环:智能体发起记忆检索、引擎组装记忆块、嵌入 prompt、大模型推理(回答或调用工具)、工具观察回流、会话结算写回。路线 B 给人用,走治理与供给:开发者借助检索回放和写入追踪调试记忆行为;运营人员通过看板监控质量指标,受理用户的查看、更正、删除请求,调阅审计日志;业务专家以低代码方式维护技能模板、定义画像标签,并审核反思产出的结论是否符合业务实际;终端用户则拥有对自己记忆的查看、更正、删除与授权入口。
还有两条纵贯全程的安全带。一条是安全合规,另一条是治理评估。记忆是智能体最敏感的资产,因为它天然贴近隐私。一条偏好记录、一段病史描述、一次位置提及,存进记忆库的那一刻,就进入了个人信息保护的监管视野。
记忆系统不能凭感觉验收。建议关注五组指标:
图:记忆系统评估指标(参考)
让AI从“聪明工具”变成“可靠伙伴”,缺的不是更大的模型,而是更好的记忆。
本文的讨论可以收拢为三句话:技术上,写入要克制且带证据,检索要混合且受约束,遗忘要体面且可审计;工程上,是否建平台看量级,“一横两纵两条安全带”的架构意味着记忆是需要全生命周期治理的资产;治理上,记忆天然贴近隐私,安全合规必须贯穿全程。
记忆管理与上一期的场景规模化互为表里:没有记忆,试点经验无法复用,“能力沉淀”就落了空;没有场景,记忆也无的放矢。两者共同指向AI应用从单点工具走向体系化能力。
但记忆解决的是“记得住”,还没有解决“做得对”。智能体如果不懂企业的业务规则和数据口径,依然只是外行助手。下一期,我们将探讨本体智能如何助力AI从“通用对话者”升级为“专业业务执行者”。敬请期待!
图:AI原生评估体系
“智能原生”系列评估测试,是由中国信通院推出的一套第三方评估测试体系。该体系立足于“智能原生”的核心内涵--即从设计之初就将人工智能作为核心中枢,系统性重构技术架构与业务逻辑。旨在全方位评估企业的智能原生能力建设水平,衡量技术产品能力与场景实践成效,帮助企业依托AI原生范式激活数据潜能,实现生产经营模式的根本升级。
当前,国内企业智能化转型普遍面临技术迭代快速、场景落地滞后、项目建设碎片化、价值成效难量化、合规治理体系不完善等共性难题。为系统性破解产业痛点、打通智能原生产业落地全链路,智能原生领航计划聚焦顶层范式构建、标准体系引领、全域生态协同三大核心方向持续深耕,全方位赋能企业高质量智能化转型。
为进一步壮大智能原生领航计划,汇聚更多产业力量参与理论研究、标准研制、场景落地,现面向全行业正式开启第二批参与单位招募。诚挚欢迎各行业央国企、骨干产业企业、科研机构、AI科技服务商踊跃申报加入,共同参与智能原生方法论研究、行业标准编制、专题产业研讨、落地试点评估等系列核心工作,携手共建智能原生产业新生态。
有意向参与的单位可点击“阅读原文”下载申请表,填写完整并加盖单位公章后,将盖章PDF扫描件发送至联系人邮箱。
联系人:
韩老师
18627873252(微信同号)
hanxiaolu@caict.ac.cn

