一个越来越常见的念头
模型分层定价后,许多人萌生同一想法:既然 Flash 级模型成本低廉,何不全权交由其运行 Agent?
账目看似诱人,但裸用弱模型隐患巨大——这非体感偏差,而是结构性缺陷。广为流传的 Harness 工作环图清晰揭示了解法:由 commodity 模型承担整条弧线任务,frontier 模型仅在关键高价值节点介入,全程约可节省 75% 的 frontier 用量。
关键在于,“省”字背后依托于一整套防护与验证机制。缺失这些机制,省钱终将酿成事故。
隐患不在“错”,在“错得自信且连贯”
弱模型的致命之处并非犯错——强模型亦然——而在于其错误分布不可预测。
它不会在预期位置出错,而是以流畅、完整且看似合理的方式犯错:代码可运行但逻辑歪斜,文档通顺但结论虚假。裸用弱模型,等同于将全部验证成本转嫁给下游、用户及生产环境。
Harness 的本质在于内化此成本:通过 critique 阶段与 commit 门禁,将“默认信任”转变为“默认怀疑”。模型允许犯错,但错误无法通过门禁。
Critique 的有效性,取决于校验器而非另一模型
这是该图最易被误读之处。
让同一 Flash 模型既当 worker 又当 critic,收益甚微——同源错误难以自我检出。若模型认为某种写法无误,变换身份复核后大概率仍判定无虞。
真正有效的 critique,锚点在于非模型要素:
- 可执行的验证
:测试、类型检查、编译、lint——运行失败即定性,无需辩论; - 结构约束
:schema 校验、JSON-LD 的 framing/slicing 等形状约束——先行锁定输出“形状”; - 领域不变量
:此为 DDD 用武之地。聚合不变条件、领域事件合法性均可形式化为机器可检契约。
换言之:领域建模越坚实,harness 的 critique 阶段越廉价可靠。 模型负责生成候选,本体与不变量负责否决候选。生成归模型,审判归工程。
"-75% frontier usage"的真正含义
该数字不仅意味“节省 75% 成本”,更揭示了一个常被忽视的事实:Agent 工作流中多数 token 消耗属于平庸劳动。
高决策密度环节仅存于几点:
- 规划与拆解
——方向错误则后续徒劳; - 首个任务的冷启动
——无上下文时最考验判断力; - 最终 promote 的交接
——此步决定成果能否交付。
上述环节值得投入 frontier 模型。而中间大段的执行、填充、格式化属 commodity 劳动——采用便宜模型辅以门禁完全胜任。
这正是弧线的含义:commodity floor 承担维护与简单任务,frontier 仅覆盖规划期、首任务及交接瞬间。
一个不能回避的边界
需冷静看待:harness 存在补偿极限。
若底层模型连“被约束后的输出空间”都无法触及——例如长链推理任务中弱模型在中途漂移——再多 critique лишь 导致反复否决与重来。延迟与 token 成本反而爆炸,不如直接启用强模型。
因此,harness 中最难且最值得精细设计的乃是 routing 逻辑本身:界定何种任务升级、何种任务留存于 commodity floor。
此事亦可建模:将工作流绘制为技能 DAG,各节点声明能力需求,路由依标注调度。DAG 即那条弧线,调度策略即为 frontier 的使用纪律。
结语:模型可换,纪律永存
Harness 绝非弱模型的临时补丁,而是将工程纪律——验证、门禁、不变量、路由——确立为架构一等公民的方式。模型每半岁迭代,今日省钱的 Flash 明日或已过时,但那套“默认怀疑、机器校验、按决策密度调度”的流程将沉淀下来,且越跑越具价值。
弱模型不可裸奔。为其披上 harness,便宜方成真便宜。

