大数跨境

基础模型已经商品化,AI 的下一个壁垒是什么? 拆解 Instinct 背后:效用驱动记忆如何重塑智能体

基础模型已经商品化,AI 的下一个壁垒是什么? 拆解 Instinct 背后:效用驱动记忆如何重塑智能体 苏哲管理咨询
2026-09-25
4
导读:前人已有 MemGPT、Generative Agents 等研究,Instinct 把这套架构落地个人智能体。可验证预测:随数据增长性能平稳、支持偏好更新、懂得静默。该架构天然契合数据最小化,企业智

编者摘要:本文《Instinct假说》提出 AI 发展第三波浪潮:护城河从模型能力、执行能力转向效用驱动记忆架构。第一波(2022‑2023)以 ChatGPT 为代表,基础模型能力是壁垒;第二波(2024‑2025)Devin、Claude Code 实现自主执行,执行能力成为壁垒;第三波 2026 年以后,持久状态 / 记忆成为核心护城河。

记忆不等同数据库存储,不是全盘记录原始数据,而是类似编译器:通过接纳效用、行动效用筛选信息,丢弃噪声,编译为四层记忆结构:瞬时摄入层、语义分类账本、信念偏好模型、待办备忘录。依靠溯源机制解决传统 RAG 幻觉、旧知识残留问题。

真正的智能主动性不靠定时任务,而是对比事件与持久状态产生状态差值,基于风险、权限做行动 / 询问 / 推迟 / 静默决策,懂得不打扰才是高级智能。

前人已有 MemGPT、Generative Agents 等研究,Instinct 把这套架构落地个人智能体。可验证预测:随数据增长性能平稳、支持偏好更新、懂得静默。该架构天然契合数据最小化,企业智能体则需要支撑多人共享记忆。

10个关键问题Q&A

Q1:AI 三波浪潮分别是什么,护城河有什么变化?
A:第一波 2022‑2023:基础模型能力是护城河;第二波 2024‑2025:Agent 执行能力是护城河;第三波 2026 之后:持久状态与记忆成为护城河。模型、执行能力逐步走向商品化,记忆架构成为稀缺资产。
Q2:为什么说记忆不是数据库或向量 RAG?
A:数据库 / RAG 倾向完整保存全部原始对话日志。真正记忆是编译器:主动筛选、压缩、丢弃噪声;记忆目标不是高保真还原过去,而是辅助未来决策,全盘记录反而会阻碍思考。
Q3:什么是接纳效用 Admission Utility?
A:评估一条新信息,对未来决策的预期价值,是否值得付出存储、索引成本,决定要不要存入记忆系统。
Q4:什么是行动效用 Action Utility?
A:也叫中断闸门。当状态发生变化,综合评估价值、权限、风险、不可逆性,决定智能体直接执行、询问用户、推迟处理,还是保持静默。
Q5:Instinct 四层记忆架构包含哪些模块?
A:①瞬时摄入层;②选择性语义分类账本;③信念与偏好模型;④流程化待办备忘录。所有推导信息绑定溯源来源。
Q6:传统 RAG 记忆方案有什么缺陷?
A:删除原始数据后,旧推理结论、过时偏好依旧残留在摘要与图谱中,产生顽固幻觉;很难干净撤销已经推导出来的旧认知。
Q7:什么才是 Agent 真正的主动性?定时器为什么不行?
A:真正主动性来自状态差值:新事件与内部持久状态对比产生变化,再决策行为。定时器是粗暴定时轮询,容易造成无意义打扰;最好的智能证据是懂得不去打扰用户。
Q8:作者提出关于 Instinct 的三条可验证预测是什么?
A:①历史数据膨胀,性能平滑可控不崩坏;②用户修改偏好,旧偏好不会残留干扰;③会合理选择什么都不做,不会频繁骚扰用户。
Q9:该记忆架构对用户隐私有什么价值?
A:架构遵循数据最小化原则,原始交互数据解析完成就丢弃,只保存提炼后的语义事实;记忆系统越强,需要留存原始用户数据越少。
Q10:个人智能体记忆和企业智能体记忆最大差异?
A:个人 Agent 只维护单个人的状态记忆;企业智能体需要同时维护大量人员、Agent 的个人记忆与组织共享记忆,对接业务文档、系统记录,复杂度更高。

附录:本能假说:为何记忆正在成为 AI 的核心护城河

作者:Ashwin Gopinath

核心摘要:我提出的观点是,Instinct 之所以表现得惊艳出众,并非源于一套无可替代的智能执行引擎,而是得益于它独特的记忆架构。ChatGPT 代表基础模型时代,Devin、Claude Code 标志着自主执行时代,而 Instinct 则拉开了 AI 发展的第三波浪潮:基础模型已经走向商品化,执行能力也正快速步入同质化,基于效用驱动的记忆,才是 AI 真正的闪光点,同时也是核心竞争壁垒。

早在 2023 年,我和诺亚花了大约三个月时间打磨一个十分朴素的构想:如果让大语言模型智能体复盘自身犯下的错误、开展自我反思,会发生什么?这次实验最终催生了 Reflexion 项目,并后续发展出独立的生命力。说实话,我们最初的目标并不是打造一套复杂的推理引擎,而是希望为 AI 赋予用于自我批判的工作记忆 —— 借助自我审视,引导模型在下一轮输出中得到更准确的结果。这一点十分关键,后文我们还会再次谈及。

正式展开之前,需要做必要说明:Instinct 是一款出色的产品。诺亚曾是我的学生,我在麻省理工任职期间和他有过合作,之后也一直保持着浅度联系,但我并不掌握 Instinct 内部实现的一手信息。我难免会带有主观倾向:一方面出于对学生的认可,另一方面我本人也长期研究智能体及其记忆机制,只不过我的研究方向面向企业场景,而非个人消费端。下文所有内容,都只是我实际体验产品后,对这套惊艳产品做出的分析解读。

大家使用 Instinct 完成各式各样任务的场景,既令人惊叹,也引人深思。单独拆解来看,它完成的各项能力,Hermes、OpenClaw 等同类产品同样可以实现。可为什么大家会高呼这是智能体领域的重大突破?在我看来,它的优势并不浮于表面,只有亲身深度使用后才能体会。绝大多数智能体,使用越久性能就越容易衰减,但 Instinct 截然相反,随着交互变多,它的表现反而持续提升,这正是解开谜题的关键线索。

引擎能力正在走向商品化

我有一个不一样的判断:Instinct 的核心智能运行循环本身未必有多么特殊。现如今,标准化的智能体执行能力已经高度商品化。任意一款性能不错的基础大模型,搭配一套够用的工具调用框架,就能够完成接口调用、遵循指令、生成多步骤规划。不同产品之间,权限管控、计算机操作细节、执行稳定性虽有差异,但执行层面的优化更多已经演变为工程问题;记忆,才是稀缺的架构资产。

我的核心推论是:Instinct 真正的突破点,是一套内置的 “笔记本” 机制,也就是底层一套设计严谨的记忆架构。抛开我们团队自研的智能体,这是我第一次见到面向普通用户的智能体,搭载完成度如此高的个人记忆架构。倘若我对这套 “笔记本” 的工作逻辑判断无误,就可以解释 Instinct 最奇妙的特质:它的价值不只体现在你主动下达指令的时候,更体现在你没有下达指令的时刻。

想要理解这套记忆体系的核心地位,我们可以对比玩具级智能体与长期运行型智能体的区别。事务型智能体只运行有限轮次,获取答案、调用工具之后就结束进程。而长期运行智能体,需要跨越数日、数周,在充满不确定性的现实环境中持续工作。举一个非常生活化的例子:协商降低有线电视账单。整个流程包含致电客服、等待接通、接收模糊的挽留优惠方案、等待回电、隔几日跟进、必要时升级投诉。智能体完成这类长周期任务,难点不在于执行操作,而在于漫长等待过程中维持状态、锚定目标,在没有新事件发生的时候,依旧清楚哪些信息至关重要。

个人记忆架构

长期运行的智能体,并不需要存储全部原始历史记录,它需要一套经过筛选的工作状态。瞬时观测信息,只有具备实际价值才会被采纳,编译为持久化的认知与待办目标,同时保留信息溯源依据,支撑智能体实现状态恢复、观点修正与逻辑溯源。

记忆是一种 “编译器”,而非数据库或知识图谱

行业里很多团队处理记忆问题,会直接套用数据库思路:存储全部对话记录、交互回执,寄希望于向量检索、图检索 RAG 技术,后续从中捞出需要的信息。但磁带录音机式的全盘记录,不等于记忆。博尔赫斯笔下《博闻强记的富内斯》讲透了这个道理:一个无法遗忘任何事物的人,恰恰因此丧失思考能力。

思考本身,就是忽略细节差异、归纳共性、完成抽象的过程。如果把眼睛接收的每一束光线、耳朵捕捉的每一段声波全部保存下来,得到的不是理解与思考,只是一堆杂乱噪声。脱离效用目标的记忆毫无意义 —— 记忆系统需要主动预判:哪些信息会对未来决策产生价值。

这不只是编程层面的比喻,也契合计算神经科学领域的主流观点。Richards 与 Frankland 等研究者提出:记忆的目的,并不是高保真还原过去,而是辅助做出未来的智能决策。健康的大脑会主动遗忘,正是这个道理。人类在日常生活中,会舍弃绝大多数无效信息,把剩余经验压缩为少量可靠事实保存下来,本质上就是不断预判这些事实未来是否有用。

真正的记忆,绝非简单粗暴的信息调取;它依靠两套效用函数,主动且有策略地决定哪些信息应当舍弃:

  1. 接纳效用
    评估一条新观测信息,对于未来决策的预期价值,是否值得消耗成本去存储、建立索引。
  2. 行动效用(中断闸门)
    判断状态变化是否值得触发行动。这里不仅权衡便利度与干扰程度,还需要评估风险、不可逆性以及操作权限。

如果一项操作价值高、权限充足、可撤销(例如更新日历日程),智能体就可以静默执行;如果操作影响重大、不可撤销(发送邮件、发起付款),则需要向用户确认;如果预期综合收益很低,最优选择就是保持静默。

结合产品表现推断,Instinct 在后台持续运行一套基于效用的处理循环。它不会在推理阶段反复压缩无限膨胀的对话上下文,也不会把原始历史记录的检索当作记忆本身。面对源源不断的个人生活数据流:聊天文本、工具调用记录、各类回执消息,它持续回答三个问题:

  • 哪些内容改变了我们对用户的认知?
  • 哪些正在进行的任务取得了进展?
  • 哪些内容可以安全丢弃?

基于回答,信息会被编译为多层级状态模型:

  1. 瞬时摄入层
    原始对话、回执只留存到语义解析完成,之后直接丢弃。
  2. 选择性语义分类账本
    只追加写入经过筛选的事件与状态变更记录,保存溯源元数据,不囤积原始冗余数据。
  3. 持续迭代的信念与偏好模型
    可修改、带版本标记,记录用户习惯与约束条件(例如:用户不希望早晨被电话打扰)。
  4. 流程化待办备忘录
    动态追踪未完成子目标与依赖关系(例如:周四若无反馈,则升级处理)。

依托这套架构,智能体执行任务时,不会被上下文失效问题拖累,也无需读取海量原始素材,可以直接从整理完毕的状态快速接续工作。我推测这套记忆系统同样掌握 “遗忘” 的实现逻辑。分类账本本身只做追加写入,但从中衍生出的每一条认知,都会绑定溯源信息:对应对话片段、信息来源、推理逻辑。传统 RAG 系统很难处理信息变更:即便删除向量数据,旧的推理结论依旧残留在摘要、图谱边之中,带来幻觉问题。而溯源机制搭配时间戳校验,可以完整废弃一整套过时推导,彻底清除失效事实,避免残留错误信息。

主动性源于状态差值,而非定时任务

效用驱动的压缩记忆,是实现真正智能体主动性的核心。如今绝大多数智能体都属于被动响应型:收到指令才做出反馈。还有一部分依靠粗糙定时器、定时巡检模拟主动能力,但这种方式往往会造成过度打扰。讽刺的是,堆砌越多主动功能,产品体验反而越不智能。

真正的主动能力,不是简单给智能体循环外挂定时任务。完整的底层能力栈才能催生原生主动性:带状态的记忆、持续事件感知、明确的待办追踪、具备风险意识的行动策略。其核心是动态识别状态差值。

举个场景:当你处于睡眠状态,一封新邮件抵达。后台引擎解析邮件,对比内部记录的状态,识别出变化差值,再决定执行动作或是保持静默。三大模块协同工作:待办备忘录捕捉状态变化;习惯偏好模型判断是否需要打扰用户,这件事是立刻提醒,还是记到次日处理;分类账本则负责留存凭据,供智能体后续解释行为。

由此可以得到一个十分精妙的推论:一套效用函数运转良好的最好证明,不是恰到好处的消息推送,而是懂得保持沉默。懂得何时不去打扰用户的智能体,远比随时推送消息的智能体,更懂用户。

站在行业积累之上

当然,很多前人工作打下了重要基础:Generative Agents 实现重要性反思;MemGPT、Letta 构建分层记忆与休眠记忆机制;Mem0、A‑MAC 等最新研究,把记忆信息接纳机制进行规范化。过去行业长期聚焦检索环节,但前沿方向已经转移到流程上游:判断哪些信息值得保存,如何把信息编译为可变状态,以及何时应当保持静默。

我所在初创公司 Sentra 自研企业智能体,内部已经落地同类思路。如果我对 Instinct 的判断成立,说明我们在解决完全不同业务问题时,得出了高度趋同的结论。诺亚把这套思路落地到个人智能体赛道,而我们深耕企业场景,研究组织共享记忆。

这套思路可以产出可验证的预测,而不只是主观感受:

  1. 用户历史数据不断累积,Instinct 性能应当平滑可控,因为它基于整合后的状态运行,而非原始聊天记录;
  2. 面对用户偏好变更(例如 “我现在吃素了”),旧偏好不会持续干扰输出,溯源机制支持有效清理旧信息;
  3. 产品会合理选择什么都不做。如果上线数月之后依旧频繁打扰用户,那说明我的整套判断存在偏差。

最后聊聊数据采集、屏幕抓取、训练授权相关讨论。行业服务条款在用户反馈推动下不断迭代,但架构层面有一点很关键:基于效用编译构建的系统,天然契合数据最小化原则。提取语义状态、丢弃原始交互流,持久化事实才是核心资产,未压缩的原始数据反而是负担。高效的信息压缩与选择性留存,可以成为建立用户信任的核心逻辑。记忆 “笔记本” 做得越好,系统需要留存的原始用户数据就越少。

全量存储原始记录的模式,不仅会拉低智能体效果,还会损害隐私,检索方案选择不当更会埋下技术债务。随着赛道走向成熟,我期待主动遗忘,从藏在细则里的功能局限,转变为产品信任叙事的核心卖点。

AI 的第三波浪潮

回想我和诺亚开发 Reflexion 的时候,反思只是服务于单一任务:失败之后,把失败转化为文本,再次尝试。倘若我对 Instinct 的理解属实,它把同类思想拓展到全新的规模:不再局限于单条测试样本,而是针对杂乱真实的个人生活持续开展反思。看到他深度探索个人记忆方向,回顾我们早期的交流,是一件很美妙的事。

我们 Sentra 的企业智能体中已经看到同类行为,只是面向企业场景。这也映射出 AI 行业的发展脉络: 第一波浪潮聚焦能力:基础模型让机器拥有出色语言思考能力; 第二波浪潮聚焦执行:Devin、Claude Code 这类系统,为模型套上执行循环,完成规划、工具调用、落地任务; 第三波浪潮聚焦状态:智能体长期驻留在现实场景中,理解过往发生了什么、当下什么最重要、后续应当如何行动。

第三波浪潮才刚刚开启。过去一年行业出现循环工程、上下文图谱等各类说法,都在间接讨论这件事。但本质上,记忆是编译器,不是数据库,不是知识图谱,也不是文件系统。而 Instinct,恰好向我们展示了为什么这套机制会带来魔幻般的使用体验。

企业端方案还需要更进一步:个人智能体只需要维护单个人的持久记忆;企业场景下,成千上万人与智能体,需要依托通讯记录、业务系统、文档素材,维护个人与共享状态。整体架构逻辑相通,但需要叠加更多复杂能力。未来我会分享服务两万人规模企业的落地经验。

放眼长远,AI 领域核心难题已经不再仅仅是教会机器如何思考、如何行动。而是教会机器理解当下真实世界,分辨哪些信息值得被记住。

作者注:Ashwin Gopinath是 Sentra 的 CEO,本文探讨的诸多问题正是公司的业务方向。Sentra 正在打造一套基础共享记忆层,服务于构建企业大脑:完整企业的动态共享模型。它接收企业内结构化、非结构化全部数据,同时为人类员工与各类智能体提供支撑。

Ashwin Gopinath,连续创业者、前 MIT 助理教授、AI Agent 记忆领域核心研究者,《The Instinct Thesis(本能假说)》作者,社交账号:@ashwingop。

一、学术履历

  1. 博士:波士顿大学电子与计算机工程博士,获系杰出博士论文奖MIT School...。
  2. 曾任加州理工(Caltech)高级研究科学家、Google X(谷歌登月实验室)研究员;之后担任麻省理工 MIT 机械工程系助理教授,早期研究方向为 DNA 纳米技术、合成生物学、纳米光物理,2017 年获得 Robert Dirks 分子编程奖MIT School...。
  3. AI 领域代表作 Reflexion(NeurIPS 2023),和学生 Noah Shinn(Instinct 产品创始人)联合发表:提出让 AI 智能体通过自然语言自我反思、复盘错误来提升性能,不需要微调模型权重,依靠记忆实现迭代优化,是 LLM Agent 领域高引用经典论文。

Noah Shinn 是他在 MIT 的学生,这也是他写《Instinct假说》分析 Instinct 产品的渊源,他本人没有 Instinct 内部一手资料,全部基于外部产品体验推演架构。

二、创业经历

  1. Palamedrix(蛋白质组学初创),联合创始人,两年内被 SomaLogic 以 5250 万美元收购,属于生物硬科技创业经历。
  2. Sentra(联合创始人)
    主打企业组织记忆(Enterprise General Intelligence),a16z 领投 500 万美元种子轮。
    • 把 Reflexion 的智能体记忆思想迁移到企业场景:不再面向个人,为企业构建共享记忆层,把会议、聊天、文档、业务系统编译成企业持久状态,打造 “企业大脑”。
    • 核心论点:大模型、Agent 执行能力会商品化,真正护城河是记忆与状态,和《本能假说》个人 Agent 理论一脉相承,只是一个面向个人,一个面向大型组织。

【声明】内容源于网络
0
0
苏哲管理咨询
为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
内容 2245
粉丝 0
苏哲管理咨询 为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
总阅读50.3k
粉丝0
内容2.2k