这是我的第426篇Ai笔记,本篇2076、累计笔记7318467
彩蛋:结尾扫描二维码,领取Buzzy神级手册。
最近折腾 Coding Agent,我越来越强烈地感觉到一个问题:现在的 AI 编程工具,干活已经越来越猛了,但脑子多少还有点“金鱼”。
一个项目聊几个小时,好不容易让它理解了架构、技术债、哪些地方不能动、哪些方案已经踩过坑。结果第二天新开一个 Session,又得重新介绍一遍;从 Codex 换到 Claude Code,前面磨合出来的经验更是直接清零。
最近看 No Priors 的访谈时,我发现 Karpathy 也专门提到了这个问题。他认为 Agent 接下来需要补上的重要能力之一,就是更复杂的 Memory System。
巧的是,最近我看到一个叫 MemoraX Code 的开源项目,干的恰恰就是这件事:给 Coding Agent 加上真正可以跨 Session、甚至跨 Agent 使用的长期记忆。
目前 MemoraX Code 已经支持 Codex、Claude Code、DeepSeek Harness 和 OpenCode,并且已经在 GitHub 开源,个人用户也可以免费体验。
传送门:https://code.memorax.net
GitHub:https://github.com/memorax-ai/memorax-code
为什么我觉得 Memory 这件事,比表面看起来重要得多?
因为真实的软件开发,从来不是跑完一次 Benchmark 就结束。一个项目可能持续半年甚至几年,今天改登录,下周动数据库,一个月后重新回来修权限,开发者中途还会不断切换 Codex、Claude Code、OpenCode 等不同工具。
问题就在这里:模型越来越聪明,但它每次打开项目,都像第一天上班。
昨天刚搞清楚为什么这里不能改、哪个方案已经失败、上线前必须跑哪些测试,第二天换个 Session 又得重新解释。长期记忆真正想解决的,就是让这些已经付过成本、验证过的项目经验能够继续留下来。
我比较认同一句话:
模型能力决定这一次能走多远,Memory 决定下一次从哪里开始。
MemoraX Code 到底能解决什么?其实看几个最常见的开发场景就明白了。
01|换 Session,也不用重新介绍项目
前一天,Codex 在开发过程中已经搞清楚了项目为什么采用当前架构、哪些模块有特殊限制、哪些方案已经验证失败。第二天打开一个全新的对话,不复制聊天记录,也不用重新写一篇项目背景,当新任务再次碰到相关模块时,这些经验可以重新被找回来。
这个体验看似简单,对长期项目却很重要。开发者最烦的往往不是 Agent 偶尔写错一行代码,而是同一个坑昨天刚解释完,今天还要再解释一次。
02|Codex 学会的东西,Claude Code 也能继续用
更有意思的是,Memory 并不一定要锁死在某个 Agent 里。
比如前面一直用 Codex 开发,后面觉得某个任务 Claude Code 更合适,可以直接换工具。之前在 Codex 中形成的项目经验,后续依然可以被 Claude Code 使用。
这件事我觉得很关键。模型和工具以后肯定会不断换,但项目为什么这么设计、踩过什么坑、什么方案已经被证明有效,这些经验应该属于开发者,而不应该被锁死在某一个聊天窗口里。
03|上下文可以压缩,关键经验不能一起消失
复杂开发任务跑几个小时以后,上下文迟早会越来越长,最终难免压缩。日志、重复对话和无效尝试可以丢掉,但架构约束、失败方案和验证规则最好留下来。
MemoraX Code 的思路,就是把这些值得复用的信息从普通聊天记录里分离出来,后续真正需要的时候再召回。
所以长期记忆真正有价值的地方,不是“过去说过什么”,而是过去发生的事情里,哪些会影响下一次决策。
04|效果到底怎么样?数据还挺夸张
当然,只能记住还不够,最终还是要看能不能把任务做得更好。
在 AML(Agent Memory Leaderboard)的 Coding Track 中,MemoraX Code 拿到了 62 分,排名第一,相比 Claude Mem,解题率提升了 10%。团队还把历史任务里积累的工程经验用到一个新的 3 小时开发任务中,综合得分从 11.71 提升到 70.30,关键检查项从 2/13 提升到 10/13,模型调用成本反而下降了 22.6%。
好家伙,任务得分接近原来的 6 倍,Token 钱还花少了。
仔细想想其实很好理解。Agent 有了过去验证过的经验以后,不需要每次都重新搜索、试错、报错、换方案。真正值钱的地方,就是少犯重复的错误,少走已经走过的弯路。
05|Memory 也不是存得越多越好
看到这里,很容易产生一个误区:既然记忆这么重要,那把所有聊天记录全部存下来不就行了?
还真不行。
比如“这个项目前端优先使用浅色背景”属于稳定偏好,值得长期保存。但几十轮调试日志、已经废弃的临时方案,就没有必要一直留着。更不能你今天只是改个按钮颜色,Agent 突然给你翻出几周前的数据库迁移记录。
所以一个好用的 Memory System,真正要解决两个问题:什么值得记,以及什么时候应该想起来。
MemoraX Code 会根据当前任务找回相关的项目约束、失败方案和开发习惯,同时这些 Memory 只是参考,Agent 仍然需要读取最新代码、运行测试,再决定过去的经验今天还能不能继续使用。用户也可以查看、修改和删除记忆,避免错误经验一直被重复调用。
目前团队给出的内测结果是,85.5% 的记忆触发与用户判断一致,81.2% 的记忆内容获得正向反馈。
夸了半天,该泼的冷水还是得泼。
第一,旧经验也会过期。 项目升级框架、换数据库、重构目录之后,三个月前正确的 Memory 今天完全可能已经错了。所以记忆只能作为参考,最新代码和测试结果永远应该拥有更高优先级。
第二,错误的 Memory 比没有 Memory 更麻烦。 如果 Agent 第一次就总结错了,又把这条错误经验长期保存,一次幻觉就有机会变成持续性错误。因此用户能查看、修改和删除记忆,这个能力非常重要。
第三,Memory 解决不了模型本身不会的问题。 它可以帮助 Agent 少走重复弯路,却不会凭空提升模型的基础推理和编程能力。未来 Coding Agent 的竞争,很可能会同时看模型能力、工具调用和长期记忆。
最后,老规矩,用三句话总结一下:
Coding Agent 下一轮非常值得关注的能力,就是长期记忆。模型已经越来越会干活,接下来要解决的是别每次打开项目都重新做人。
Memory 真正值钱的地方,不是保存聊天记录,而是把项目约束、失败方案和已经验证过的经验留下来,让 Agent 少走重复的弯路。
以后你用 Codex、Claude Code 还是其他 Agent,都可以继续换;真正应该长期留下来的,是属于你自己的项目经验。
工具装上只是第一步,真正麻烦的是:
到底什么应该让 Agent 记住?怎么让记忆在后面的项目里真正发挥作用?
所以我按照实际开发场景,重新整理了一份:《Coding Agent 长期记忆实操清单》
长期记忆内容分类表
项目约束记录模板
失败方案记录模板
跨 Session 使用流程
跨 Agent 迁移检查表
Memory 定期清理清单
避免错误记忆污染的检查规则
想自己给 Codex、Claude Code、OpenCode 这类 Coding Agent 搭一套长期记忆的朋友,可以直接拿去照着配置。
扫码回复关键词【记忆】,我把这份实操清单发给你。

