Anthropic刚干了一件让自己生态里的prompt工程师集体愣住的事。
Claude Code的系统提示词,从65000 token直接砍到不到200 token。不是优化,不是精简,是近乎毁灭性的削减。99.7%的prompt被扔进了垃圾桶。
更关键的是,这不是翻车事故,是主动选择。
技术人员Tariq Shihipar说了一句很重的话:"引导AI的方式已经发生了根本性转变。"
先说背景。Claude Code之前的system prompt膨胀到什么程度?65000个token,哪怕你关闭大部分功能,光保底就12000 token。
打个比方:你雇了个程序员,入职第一天给他发了一本650页的员工手册。他花了一整天读完,然后才开始写第一行代码。
这还只是"冷启动"成本。每一轮对话、每一个请求,模型都要先把这坨巨大的prompt过一遍。token费用在燃烧,注意力在被稀释,模型的"工作记忆"被占用了大量带宽去处理那些规则——而不是用户真正想让它做的事。
行业里管这叫"prompt债"——就像代码里的技术债一样,只不过代码债会在你改功能的时候炸开,prompt债只会让模型悄悄变差,你还不知道为什么。
Tariq那番话里最扎心的部分是这句:"用户输入的示例往往会限制模型的表现。事实上,新模型所掌握的示例,比用户更具想象力。"
这话反直觉,但仔细想想又很合理。
过去两年,AI coding圈形成了一个惯性思维:上下文越大越好,few-shot示例越多越好,规则越细越好。于是各家都在疯狂往system prompt里塞东西——格式要求、行为边界、负面指令、输出模板、思维链引导……
结果就是,system prompt变成了一件巨大的包袱。模型不是在思考你的问题,而是在执行你的"防呆手册"。
Anthropic现在不这么干了。他们把"禁止这样做""不要那样做"的硬性规则全部干掉,换成了上下文引导——不告诉你不能做什么,而是让你理解该做什么。就像教一个成年人,不是给他一份罚单清单,而是告诉他目标是什么。
把时间线拉长来看,提示词工程经历了一个明显的"短-长-短"演变。
早期模型能力弱,你需要用很短的提示配大量示例,手把手教它理解任务。后来模型越来越聪明,大家发现可以塞更多上下文、更复杂的指令,prompt越来越长,似乎长prompt=好结果。
现在又回到了短。但不是回到最初的短——是因为模型强到不再需要那些"脚手架"了。就像你教小孩骑自行车,一开始要辅助轮,后来要扶着后座跑,最后全拆掉。车还是那辆车,但骑车的人已经不一样了。

这大概才是提示词工程的终局:不是写出更精妙的prompt,而是不再需要prompt。
当模型足够强的时候,你说一句"帮我修这个bug"就够了。它知道代码规范、知道项目结构、知道测试标准,不需要你在前面铺好红地毯。
说实话,"prompt工程师"这个词从一开始就有误导性。它暗示这是一门可以固化的手艺,像写SQL或者配nginx一样,有一套可复制的方法论。
但事实是,prompt工程的核心能力从来不是"写出好prompt",而是理解模型在想什么。你知道它什么时候在偷懒,什么时候在胡编,什么时候被你的指令绕晕了——这种直觉才是真正值钱的。
Anthropic这一刀砍下去,砍掉的不只是65000个token,还有那种"我把提示词写得越详细,AI就越好用"的幻觉。
未来的方向很清晰:与其花三天写一个完美的system prompt,不如花三天想清楚你到底要AI做什么。问题定义的能力,永远不会被模型的进步淘汰。
有意思的是,Anthropic这次精简prompt的动作,跟软件工程里一个老生常谈的原则如出一辙:最好的代码是不用写的代码。
最好的prompt,可能也是不用写的prompt。

你觉得呢?你日常用AI写代码的时候,system prompt占多大比重?有没有经历过"越写越长、效果越差"的阶段?
—— 蓝核科技 ——

