编者摘要:本文《Instinct假说》提出 AI 发展第三波浪潮:护城河从模型能力、执行能力转向效用驱动记忆架构。第一波(2022‑2023)以 ChatGPT 为代表,基础模型能力是壁垒;第二波(2024‑2025)Devin、Claude Code 实现自主执行,执行能力成为壁垒;第三波 2026 年以后,持久状态 / 记忆成为核心护城河。
记忆不等同数据库存储,不是全盘记录原始数据,而是类似编译器:通过接纳效用、行动效用筛选信息,丢弃噪声,编译为四层记忆结构:瞬时摄入层、语义分类账本、信念偏好模型、待办备忘录。依靠溯源机制解决传统 RAG 幻觉、旧知识残留问题。
真正的智能主动性不靠定时任务,而是对比事件与持久状态产生状态差值,基于风险、权限做行动 / 询问 / 推迟 / 静默决策,懂得不打扰才是高级智能。
前人已有 MemGPT、Generative Agents 等研究,Instinct 把这套架构落地个人智能体。可验证预测:随数据增长性能平稳、支持偏好更新、懂得静默。该架构天然契合数据最小化,企业智能体则需要支撑多人共享记忆。
10个关键问题Q&A
附录:本能假说:为何记忆正在成为 AI 的核心护城河
作者:Ashwin Gopinath
核心摘要:我提出的观点是,Instinct 之所以表现得惊艳出众,并非源于一套无可替代的智能执行引擎,而是得益于它独特的记忆架构。ChatGPT 代表基础模型时代,Devin、Claude Code 标志着自主执行时代,而 Instinct 则拉开了 AI 发展的第三波浪潮:基础模型已经走向商品化,执行能力也正快速步入同质化,基于效用驱动的记忆,才是 AI 真正的闪光点,同时也是核心竞争壁垒。
早在 2023 年,我和诺亚花了大约三个月时间打磨一个十分朴素的构想:如果让大语言模型智能体复盘自身犯下的错误、开展自我反思,会发生什么?这次实验最终催生了 Reflexion 项目,并后续发展出独立的生命力。说实话,我们最初的目标并不是打造一套复杂的推理引擎,而是希望为 AI 赋予用于自我批判的工作记忆 —— 借助自我审视,引导模型在下一轮输出中得到更准确的结果。这一点十分关键,后文我们还会再次谈及。
正式展开之前,需要做必要说明:Instinct 是一款出色的产品。诺亚曾是我的学生,我在麻省理工任职期间和他有过合作,之后也一直保持着浅度联系,但我并不掌握 Instinct 内部实现的一手信息。我难免会带有主观倾向:一方面出于对学生的认可,另一方面我本人也长期研究智能体及其记忆机制,只不过我的研究方向面向企业场景,而非个人消费端。下文所有内容,都只是我实际体验产品后,对这套惊艳产品做出的分析解读。
大家使用 Instinct 完成各式各样任务的场景,既令人惊叹,也引人深思。单独拆解来看,它完成的各项能力,Hermes、OpenClaw 等同类产品同样可以实现。可为什么大家会高呼这是智能体领域的重大突破?在我看来,它的优势并不浮于表面,只有亲身深度使用后才能体会。绝大多数智能体,使用越久性能就越容易衰减,但 Instinct 截然相反,随着交互变多,它的表现反而持续提升,这正是解开谜题的关键线索。
引擎能力正在走向商品化
我有一个不一样的判断:Instinct 的核心智能运行循环本身未必有多么特殊。现如今,标准化的智能体执行能力已经高度商品化。任意一款性能不错的基础大模型,搭配一套够用的工具调用框架,就能够完成接口调用、遵循指令、生成多步骤规划。不同产品之间,权限管控、计算机操作细节、执行稳定性虽有差异,但执行层面的优化更多已经演变为工程问题;记忆,才是稀缺的架构资产。
我的核心推论是:Instinct 真正的突破点,是一套内置的 “笔记本” 机制,也就是底层一套设计严谨的记忆架构。抛开我们团队自研的智能体,这是我第一次见到面向普通用户的智能体,搭载完成度如此高的个人记忆架构。倘若我对这套 “笔记本” 的工作逻辑判断无误,就可以解释 Instinct 最奇妙的特质:它的价值不只体现在你主动下达指令的时候,更体现在你没有下达指令的时刻。
想要理解这套记忆体系的核心地位,我们可以对比玩具级智能体与长期运行型智能体的区别。事务型智能体只运行有限轮次,获取答案、调用工具之后就结束进程。而长期运行智能体,需要跨越数日、数周,在充满不确定性的现实环境中持续工作。举一个非常生活化的例子:协商降低有线电视账单。整个流程包含致电客服、等待接通、接收模糊的挽留优惠方案、等待回电、隔几日跟进、必要时升级投诉。智能体完成这类长周期任务,难点不在于执行操作,而在于漫长等待过程中维持状态、锚定目标,在没有新事件发生的时候,依旧清楚哪些信息至关重要。
个人记忆架构
长期运行的智能体,并不需要存储全部原始历史记录,它需要一套经过筛选的工作状态。瞬时观测信息,只有具备实际价值才会被采纳,编译为持久化的认知与待办目标,同时保留信息溯源依据,支撑智能体实现状态恢复、观点修正与逻辑溯源。
记忆是一种 “编译器”,而非数据库或知识图谱
行业里很多团队处理记忆问题,会直接套用数据库思路:存储全部对话记录、交互回执,寄希望于向量检索、图检索 RAG 技术,后续从中捞出需要的信息。但磁带录音机式的全盘记录,不等于记忆。博尔赫斯笔下《博闻强记的富内斯》讲透了这个道理:一个无法遗忘任何事物的人,恰恰因此丧失思考能力。
思考本身,就是忽略细节差异、归纳共性、完成抽象的过程。如果把眼睛接收的每一束光线、耳朵捕捉的每一段声波全部保存下来,得到的不是理解与思考,只是一堆杂乱噪声。脱离效用目标的记忆毫无意义 —— 记忆系统需要主动预判:哪些信息会对未来决策产生价值。
这不只是编程层面的比喻,也契合计算神经科学领域的主流观点。Richards 与 Frankland 等研究者提出:记忆的目的,并不是高保真还原过去,而是辅助做出未来的智能决策。健康的大脑会主动遗忘,正是这个道理。人类在日常生活中,会舍弃绝大多数无效信息,把剩余经验压缩为少量可靠事实保存下来,本质上就是不断预判这些事实未来是否有用。
真正的记忆,绝非简单粗暴的信息调取;它依靠两套效用函数,主动且有策略地决定哪些信息应当舍弃:
- 接纳效用
评估一条新观测信息,对于未来决策的预期价值,是否值得消耗成本去存储、建立索引。 - 行动效用(中断闸门)
判断状态变化是否值得触发行动。这里不仅权衡便利度与干扰程度,还需要评估风险、不可逆性以及操作权限。
如果一项操作价值高、权限充足、可撤销(例如更新日历日程),智能体就可以静默执行;如果操作影响重大、不可撤销(发送邮件、发起付款),则需要向用户确认;如果预期综合收益很低,最优选择就是保持静默。
结合产品表现推断,Instinct 在后台持续运行一套基于效用的处理循环。它不会在推理阶段反复压缩无限膨胀的对话上下文,也不会把原始历史记录的检索当作记忆本身。面对源源不断的个人生活数据流:聊天文本、工具调用记录、各类回执消息,它持续回答三个问题:
-
哪些内容改变了我们对用户的认知? -
哪些正在进行的任务取得了进展? -
哪些内容可以安全丢弃?
基于回答,信息会被编译为多层级状态模型:
- 瞬时摄入层
原始对话、回执只留存到语义解析完成,之后直接丢弃。 - 选择性语义分类账本
只追加写入经过筛选的事件与状态变更记录,保存溯源元数据,不囤积原始冗余数据。 - 持续迭代的信念与偏好模型
可修改、带版本标记,记录用户习惯与约束条件(例如:用户不希望早晨被电话打扰)。 - 流程化待办备忘录
动态追踪未完成子目标与依赖关系(例如:周四若无反馈,则升级处理)。
依托这套架构,智能体执行任务时,不会被上下文失效问题拖累,也无需读取海量原始素材,可以直接从整理完毕的状态快速接续工作。我推测这套记忆系统同样掌握 “遗忘” 的实现逻辑。分类账本本身只做追加写入,但从中衍生出的每一条认知,都会绑定溯源信息:对应对话片段、信息来源、推理逻辑。传统 RAG 系统很难处理信息变更:即便删除向量数据,旧的推理结论依旧残留在摘要、图谱边之中,带来幻觉问题。而溯源机制搭配时间戳校验,可以完整废弃一整套过时推导,彻底清除失效事实,避免残留错误信息。
主动性源于状态差值,而非定时任务
效用驱动的压缩记忆,是实现真正智能体主动性的核心。如今绝大多数智能体都属于被动响应型:收到指令才做出反馈。还有一部分依靠粗糙定时器、定时巡检模拟主动能力,但这种方式往往会造成过度打扰。讽刺的是,堆砌越多主动功能,产品体验反而越不智能。
真正的主动能力,不是简单给智能体循环外挂定时任务。完整的底层能力栈才能催生原生主动性:带状态的记忆、持续事件感知、明确的待办追踪、具备风险意识的行动策略。其核心是动态识别状态差值。
举个场景:当你处于睡眠状态,一封新邮件抵达。后台引擎解析邮件,对比内部记录的状态,识别出变化差值,再决定执行动作或是保持静默。三大模块协同工作:待办备忘录捕捉状态变化;习惯偏好模型判断是否需要打扰用户,这件事是立刻提醒,还是记到次日处理;分类账本则负责留存凭据,供智能体后续解释行为。
由此可以得到一个十分精妙的推论:一套效用函数运转良好的最好证明,不是恰到好处的消息推送,而是懂得保持沉默。懂得何时不去打扰用户的智能体,远比随时推送消息的智能体,更懂用户。
站在行业积累之上
当然,很多前人工作打下了重要基础:Generative Agents 实现重要性反思;MemGPT、Letta 构建分层记忆与休眠记忆机制;Mem0、A‑MAC 等最新研究,把记忆信息接纳机制进行规范化。过去行业长期聚焦检索环节,但前沿方向已经转移到流程上游:判断哪些信息值得保存,如何把信息编译为可变状态,以及何时应当保持静默。
我所在初创公司 Sentra 自研企业智能体,内部已经落地同类思路。如果我对 Instinct 的判断成立,说明我们在解决完全不同业务问题时,得出了高度趋同的结论。诺亚把这套思路落地到个人智能体赛道,而我们深耕企业场景,研究组织共享记忆。
这套思路可以产出可验证的预测,而不只是主观感受:
-
用户历史数据不断累积,Instinct 性能应当平滑可控,因为它基于整合后的状态运行,而非原始聊天记录; -
面对用户偏好变更(例如 “我现在吃素了”),旧偏好不会持续干扰输出,溯源机制支持有效清理旧信息; -
产品会合理选择什么都不做。如果上线数月之后依旧频繁打扰用户,那说明我的整套判断存在偏差。
最后聊聊数据采集、屏幕抓取、训练授权相关讨论。行业服务条款在用户反馈推动下不断迭代,但架构层面有一点很关键:基于效用编译构建的系统,天然契合数据最小化原则。提取语义状态、丢弃原始交互流,持久化事实才是核心资产,未压缩的原始数据反而是负担。高效的信息压缩与选择性留存,可以成为建立用户信任的核心逻辑。记忆 “笔记本” 做得越好,系统需要留存的原始用户数据就越少。
全量存储原始记录的模式,不仅会拉低智能体效果,还会损害隐私,检索方案选择不当更会埋下技术债务。随着赛道走向成熟,我期待主动遗忘,从藏在细则里的功能局限,转变为产品信任叙事的核心卖点。
AI 的第三波浪潮
回想我和诺亚开发 Reflexion 的时候,反思只是服务于单一任务:失败之后,把失败转化为文本,再次尝试。倘若我对 Instinct 的理解属实,它把同类思想拓展到全新的规模:不再局限于单条测试样本,而是针对杂乱真实的个人生活持续开展反思。看到他深度探索个人记忆方向,回顾我们早期的交流,是一件很美妙的事。
我们 Sentra 的企业智能体中已经看到同类行为,只是面向企业场景。这也映射出 AI 行业的发展脉络: 第一波浪潮聚焦能力:基础模型让机器拥有出色语言思考能力; 第二波浪潮聚焦执行:Devin、Claude Code 这类系统,为模型套上执行循环,完成规划、工具调用、落地任务; 第三波浪潮聚焦状态:智能体长期驻留在现实场景中,理解过往发生了什么、当下什么最重要、后续应当如何行动。
第三波浪潮才刚刚开启。过去一年行业出现循环工程、上下文图谱等各类说法,都在间接讨论这件事。但本质上,记忆是编译器,不是数据库,不是知识图谱,也不是文件系统。而 Instinct,恰好向我们展示了为什么这套机制会带来魔幻般的使用体验。
企业端方案还需要更进一步:个人智能体只需要维护单个人的持久记忆;企业场景下,成千上万人与智能体,需要依托通讯记录、业务系统、文档素材,维护个人与共享状态。整体架构逻辑相通,但需要叠加更多复杂能力。未来我会分享服务两万人规模企业的落地经验。
放眼长远,AI 领域核心难题已经不再仅仅是教会机器如何思考、如何行动。而是教会机器理解当下真实世界,分辨哪些信息值得被记住。
作者注:Ashwin Gopinath是 Sentra 的 CEO,本文探讨的诸多问题正是公司的业务方向。Sentra 正在打造一套基础共享记忆层,服务于构建企业大脑:完整企业的动态共享模型。它接收企业内结构化、非结构化全部数据,同时为人类员工与各类智能体提供支撑。
Ashwin Gopinath,连续创业者、前 MIT 助理教授、AI Agent 记忆领域核心研究者,《The Instinct Thesis(本能假说)》作者,社交账号:@ashwingop。
一、学术履历
-
博士:波士顿大学电子与计算机工程博士,获系杰出博士论文奖MIT School...。 -
曾任加州理工(Caltech)高级研究科学家、Google X(谷歌登月实验室)研究员;之后担任麻省理工 MIT 机械工程系助理教授,早期研究方向为 DNA 纳米技术、合成生物学、纳米光物理,2017 年获得 Robert Dirks 分子编程奖MIT School...。 -
AI 领域代表作 Reflexion(NeurIPS 2023),和学生 Noah Shinn(Instinct 产品创始人)联合发表:提出让 AI 智能体通过自然语言自我反思、复盘错误来提升性能,不需要微调模型权重,依靠记忆实现迭代优化,是 LLM Agent 领域高引用经典论文。
Noah Shinn 是他在 MIT 的学生,这也是他写《Instinct假说》分析 Instinct 产品的渊源,他本人没有 Instinct 内部一手资料,全部基于外部产品体验推演架构。
二、创业经历
-
Palamedrix(蛋白质组学初创),联合创始人,两年内被 SomaLogic 以 5250 万美元收购,属于生物硬科技创业经历。 - Sentra(联合创始人)
主打企业组织记忆(Enterprise General Intelligence),a16z 领投 500 万美元种子轮。 -
把 Reflexion 的智能体记忆思想迁移到企业场景:不再面向个人,为企业构建共享记忆层,把会议、聊天、文档、业务系统编译成企业持久状态,打造 “企业大脑”。 -
核心论点:大模型、Agent 执行能力会商品化,真正护城河是记忆与状态,和《本能假说》个人 Agent 理论一脉相承,只是一个面向个人,一个面向大型组织。

