大数跨境

输出价涨3.5倍,你的AI工具跟不跟

输出价涨3.5倍,你的AI工具跟不跟 琪琪智码
2026-08-20
4
导读:8月13日,DeepSeek开源了内部Agent工具Harness,同一天把API输出价从6元涨到27元/百万token。对卖家来说,真正该查的是你付费的AI工具能不能换模型。读完你能拿到一张清单,查

8月13日,DeepSeek发布了Harness v0.1开发者预览版,MIT许可证,代码扔在GitHub上随便用。这是它内部自用的agent软件,定位是OpenAI Codex和Claude Code的开源替代。同一天,它还干了一件事:宣布API涨价,8月17日生效。

输出价格从6元涨到27元/百万token,涨3.5倍;缓存命中输入从0.025元涨到0.3元,涨11倍。读完这篇,你能拿到一张清单,查出你正在付费的AI工具会不会被上游涨价绑架。

这两个动作放在一起看,才真正有意思。

亚马逊卖家来说,你未必会自己去调DeepSeek的API。但你一定在用AI工具——写listing的、做客服的、跑广告报表的、选品调研的。这些工具背后调的模型,和它们能不能换模型,直接决定你明年这个时候的软件账单。

一、九类组件全能换,这才是Harness真正值钱的地方

Harness的设计原则就一句话:一切皆插件

模型、工具、技能、会话、沙箱、存储、循环、调度、UI——这九类组件全部位于Cordis插件边界之后,每一个都能替换。支持DeepSeek API、Anthropic、OpenAI、AWS Bedrock、Google Vertex、Azure、Codex,以及任何兼容OpenAI协议的端点。在Settings→Models里切换模型,下一个请求直接生效,不用重启服务

这意味着什么?

你买了一个用DeepSeek做底座的选品工具,下个月DeepSeek涨价11倍,工具商扛不住要给你涨价。如果这个工具的模型接口是可替换的,你就能说:换成别的兼容端点,继续用。如果不可替换,你只有两条路:接受涨价,或者整个工具换掉。

再往深一层想。模型本身正在快速商品化。今天DeepSeek强,下个月可能是另一个。如果你的AI工具把模型“焊死”在自己的架构里,你就被迫跟着厂商的节奏走。焊不死的工具,模型层变成了一个可以随时比价的零部件。

我给中小卖家的判断很直接:从Harness开始,买AI工具必须问一句“能不能换模型”。能换,这是工具的基本素养;不能换,价格再便宜我也不建议碰,因为它在替你锁死未来的议价权。说句实话,我目前还没看到哪家卖家常用的选品、listing工具公开承诺“多端点+热切换”——这个空白本身就说明问题。如果你的工具敢这么宣传,把页面发我看看。

二、换模型不重启,这个动作值多少账单上的钱

先给你一把可以直接代入的尺子(价格为DeepSeek 8月17日峰值价):你的月度API成本 = 输出token量(百万)×27元 + 缓存命中token量(百万)×0.3元 + 未命中token量(百万)×9元。再按一个典型调用量做验算(日10万次输出、每次输出500 token、输入1500 token、30%缓存命中,比例与次数为便于计算的假设值):涨价后峰值月成本约6.9万元,涨价前旧价约1.8万元。两案摆开:方案A,接受涨价,一年多承担约60万;方案B,换成错峰时段或一家便宜40%的兼容端点,峰值成本压回一半左右。小卖家按你的日调用量等比缩放,公式才是你的答案。

但方案B有个前提:工具能不能做到不停机切换。如果需要工具商停服三周做改造,你的旺季listing更新全耽误了,这省下的钱根本不值一提。Harness这个“不重启”的设计,就是把切换成本从“几周”压到“一个请求”。

这背后的商业逻辑是这样的:模型是耗材,harness是资产。耗材会涨会跌会被替代,资产才是你真正该为它付费的东西。现在整个AI工程圈正在形成一个共识,叫Agent = Model + Harness。模型是大脑,harness是包裹这层大脑的运行时基础设施——编排循环、工具、记忆、错误处理、安全护栏。而越来越多的证据表明,真正拉开差距的,是外层不是内层。

三、只换外层不换模型,数据说得很清楚

我说外层比模型值钱,不是感觉,有两组数据。

第一组来自LangChain团队。他们在TerminalBench 2.0基准测试里做了一个实验:底层模型和权重完全不动,只调整包裹在外面的基础设施。结果排名从30名开外跃升到第5,通过率从52.8%提升到66.5%。模型一个字没换,涨了13.7个百分点。

第二组是我自己项目的日志,一手数据。我们做了一套公众号内容自动化harness,同一份素材包,只重写提示词结构——要求每篇必须有一个读者可对照的量化支点,并把可以用代码精确校验的规则从提示词里拿出去——首稿评分从50分升到87分。37分的提升,同样没换模型。

这说明一件事:对于已经跑起来的AI工作流,大部分瓶颈不在模型笨,而在外层结构差。

对卖家的启发是什么?如果你在用AI工具做listing优化、客服回复、广告分析,不要一看到V4-Pro-0813这种新模型就急着升级。先把你的提示词结构化、把你的检查规则写清楚、把重试和容错机制配好。按我们自己的实验,这一层改好,收益比追新模型大得多。

但这里必须踩一脚刹车。

四、v0.1开发者预览版,我的建议是先别上生产

Harness本身是个好信号,开源MIT也很有诚意。但官方信息显示:这是开发者预览版,官方定位是开发基础设施,不是生产级产品。稳定性、长期维护承诺,目前都没有官方确认。

我们自己吃了不少自建harness的亏。

第一类坑是token预算。同一个配置错误,一天内在三个不同调用点重复出现:推理输出和正文共用了max_tokens额度,预算给紧,正文直接为空。其中一处是静默失败——素材包被截断在句子中间,不报错,下游照常写稿,还通过了审稿。这种错误在生产环境里是最危险的,它不会告诉你出事了。

第二类坑是确定性校验的边界。我们有一篇已经87分、超过86分放行线的稿子,因为命中了极限词词库里的“最佳”被连退四轮,最后降到81分。而那个词的实际语境是供应链术语“最佳订货量”。词库按词匹配,但监管管的是用法。后来我们改成“硬拦+看语境”两级判定才解决。这件事告诉我们:能用代码精确测的交给代码,需要理解力的判断留给模型,这条分工的边界划错了,代价是真实的高分稿被误杀

第三类坑是改写策略。我们做过统计:进入多轮改写的11篇稿子里,有6篇最终分数低于自身历史最高分,也就是改写让稿子变差了。典型轨迹像这样:85.0→84.0→83.0→83.0,越改越差。这暴露了一个很多AI工作流都有的毛病:没有设定“改写必须对比历史最高分、下降了就回滚”的机制。

所以Harness v0.1值不值得关注?值得。现在该不该上生产?我的判断是别。官方自己都没承诺,你拿它跑真实业务等于把营业流水押在一个预览版上。但你可以做另一件事:把这个“九类可替换、换模型不重启”的设计原则,当作你选AI工具的检查清单,现在就拿来审一遍你已经付钱的那些工具。

行动清单

·今天:把你正在付费的所有AI工具列成表,逐一给供应商发一封邮件,问清一个问题——“底层模型能不能换、怎么换、要不要停服”。

·本周内:把涨价敏感度算出来。按你自己工具的调用量,估算如果API输出价格涨3.5倍,你的工具订阅费大概涨多少,别等供应商通知。

·本周内:检查你正在用的AI工作流,哪些环节是“模型换了工具就废”的。这些环节优先换成支持多端点的工具。

·下周起:如果你在自建AI agent,把token预算做成硬校验,在推理输出和正文共用时设独立上限并加截断检测,这是最容易静默失败的地方。

·本月内:把Harness的repo拉下来,只在测试环境跑一跑,感受一下“切换模型不重启”的体验,为将来给供应商提需求积累判断依据。

参考来源

DeepSeek AI Releases DeepSeek Harness in Developer Preview

DeepSeek releases V4-Pro-0813 and Harness v0.1

网易科技:DeepSeek API涨价明细

新浪科技:DeepSeek涨价幅度分析

腾讯新闻:Agent Harness行业综述

知乎:TerminalBench 2.0基础设施层改进测试

琪琪智码 QiCode

懂跨境业务的私有化系统服务商


订单中台 · 仓储 WMS · 履约物流 · 采购供应链

财务结算 · 数据中台 BI · AI 智能运营

私有化部署 · 源码交付 · 18+ 电商渠道对接

www.qiqicode.cn

点击文末「阅读原文」直达官网

系统选型、私有化部署,扫码加企业微信聊

本文由 AI 辅助创作,配图由 AI 生成;内容基于公开信息整理,仅供参考,不构成投资建议。

【声明】内容源于网络
0
0
琪琪智码
1234
内容 6
粉丝 0
琪琪智码 1234
总阅读6
粉丝0
内容6