8 月 11 日,Pi Harness 创始人 Mario Zechner 转发了一组引人注目的数据:开发者 0xEvan 利用 Pi 调用 DeepSeek V4 Flash,在处理近 10 亿输入 Token 的情况下,缓存命中率高达 99.93%,最终成本仅为 2.65 美元。若未启用缓存,同等算力消耗预计需 132 美元。
同日,开发者 Shantanu Goel 指出,DeepSeek V4 Flash 在其他 Harness 中的缓存命中率通常为 94% 至 97%,而在 Pi 中却能稳定维持在 99% 以上。Mario 对此评论称:“在使用本地模型时,这一优势尤为显著。”
此类社区案例屡见不鲜。
这让人联想到 Mario 今年 5 月对"Pi + DeepSeek V4"组合的评价:"pi + ds4 == sovereign AI enterprise ready clearly."意即该组合已具备企业级主权 AI 的能力。当时这或许只是看到开发者用该组合跑通终端俄罗斯方块后的调侃,但三个月后,一项公开横向测试用数据证实了这一观点。
Pi 搭配 DeepSeek,性能超越 Claude Code?
AI 智能体开发工具公司 Composio 近期进行了一项公开对比测试。测试选用同一模型 DeepSeek V4 Flash,分别在 8 种不同的智能体 Harness 中运行,要求完成 30 项高难度任务(包括采取行动、调用工具及独立闭环工作)。
测试结果显示,Pi Agent 以通过 20 项任务(成功率 66.7%)位居榜首;Oh My Pi 通过 17 项排名第二;Claude Code、Codex 和 Deep Agents 均通过 16 项;Prime Agent 与 Hermes Agent 各通过 15 项(其中 Prime Agent 有 6 次运行因超时或无记录未被计分);OpenCode 通过 14 项排名末位。
在模型相同的前提下,仅更换外层 Harness,任务成功率便从 46.7% 提升至 66.7%,差距达 20 个百分点。
成本差异更为悬殊:Pi 平均每项成功任务耗时成本仅 0.028 美元,而 Claude Code 高达 0.195 美元,约为前者的 7 倍。
在执行速度上,Pi 完成任务的中位时间为 132.2 秒,虽略慢于 Claude Code(122.7 秒)和 OpenCode(129.7 秒),但综合成功率、速度与成本三维指标,Pi 表现最为突出。
该测试揭示了"Harness 乘数效应”:围绕 AI 搭建的工具层能显著放大或削弱模型的实际表现。选择合适的 Harness,可使同一模型更可靠、高效;反之,即使底层模型能力相同,任务成功率和效率也会大幅下降。
Composio 强调,孤立评测模型具有局限性。若 Agent 排行榜仅列出模型名称而未说明所用 Harness,其评分结果是不完整的。
极简的 Pi,为何胜出?
Composio 测试中一个关键细节是:Pi 采用的是全新、未经修改的默认安装,仅接入了测试所需的 MCP 服务器插件,无任何自定义配置或特殊调优。正是这套“开箱即用”的轻量方案,通过了最多任务。
反观 Prime Agent,其在八种 Harness 中产生了最庞大的会话,部分会话消耗多达 350 万 Token 并进行了 33 次工具调用。这种过度复杂的前置规划导致评分器处理超时,致使 6 次运行无效。即便仅统计有效运行,Prime 的任务通过数也与 Hermes 相当,但耗时接近 Pi 的两倍。
数据呈现出鲜明反差:功能庞杂的 Prime 被自身运行负担拖慢,而轻量的 Pi 则以低开销实现了最高通过率。这表明,在此类测试中,增加层级并未带来更好结果,反而挑战了“配置越多效果越好”的传统认知。
DeepSeek V4 Flash 定位为侧重速度与效率的 Flash 模型。轻量化配置的 Pi 之所以占优,逻辑在于:每增加一层,智能体就多了一个可能出错的路径;每增加一个工具,决策复杂度便随之上升;每增加一份冗长的指令文件,模型需处理的噪声也更多。
干净的 Harness 为模型提供了从接收任务到执行完成的短路径,而臃肿的架构则导致绕行。默认安装之所以击败重量级配置,核心在于路径更短,偏离方向的风险更低。
99.9% 缓存命中率的实现机制
Pi 并非专为 DeepSeek 设计,而是一套面向开发者的 Agent 底座,支持扩展系统提示词、筛选对话历史、自定义上下文压缩及动态管理工具。这种可编程性为 DeepSeek 的缓存优化提供了广阔空间。
DeepSeek API 采用前缀缓存机制:若请求开头的 Token 序列与上一次完全相同,服务端将直接从缓存读取并以极低价格计费。关键在于,前缀匹配必须从第一个 Token 开始,一旦上下文前部发生变化,后续大量 Token 将无法命中缓存。
典型的 Agent 请求包含系统提示词、工具定义、对话历史及本轮新增内容。随着会话增长,重复内容增多,理论上更适合缓存。但若 Harness 每轮都重新整理内容(如加入时间戳、改变工具顺序或重写摘要),长上下文将难以被稳定复用。
针对此痛点,社区涌现出一批优化项目。开源项目 Reasonix 专为 DeepSeek 前缀缓存设计,其核心理念是保持上下文前端稳定,采用追加而非修改的方式,并将变更成本降至最低。
有开发者尝试将 Reasonix 的性能优势移植至针对 Pi 优化的 DeepSeek 软件包中。激活后,缓存命中率可稳定维持在 99.7% 至 99.9% 之间。
Reasonix 的具体实现策略包括:
- 启动时注入稳定环境摘要:避免每轮对话重新生成,并在触发摘要压缩前截断清理过时的工具输出。
- 工具 Schema 契约文档化:对内置工具进行回归审查,防止因工具定义调整导致缓存失效。
- 双模型模式隔离:执行模型与规划模型运行在各自独立且缓存稳定的会话中,避免交错破坏前缀稳定性。
Pi 生态中的第三方扩展 pi-deepseek-cache 也采用了类似思路:
- P0 层:冻结日期和当前工作目录,杜绝因动态内容(如 Current date)导致的缓存失效。
- P3 层:利用 deepseek-v4-flash 在 temperature 为 0 的条件下进行确定性摘要,并对结果做哈希缓存,确保相同输入始终复用字节一致的摘要。
- P2 层:通过 SHA-256 哈希诊断前缀变化,帮助开发者快速定位缓存失效根因。
降本效果显著:以 deepseek-v4-flash 为例,输入 Token 成本从每百万 0.14 美元降至 0.003 美元,降幅达 98%;deepseek-v4-pro 则从 3.00 美元降至 0.025 美元,降幅高达 99%。
写在最后
值得注意的是,DeepSeek 官方至今尚未推出自有 Harness。然而,"DeepSeek Harness 团队”微信公众号已于 8 月 11 日完成注册,且产品内测已启动,预示着官方产品即将正式发布。
官方 Harness 的核心优势在于“原生适配”。不同于第三方通过公开 API 进行的逆向优化,官方团队可与模型训练团队深度协同,利用模型内部非公开信息进行针对性优化。这种深度的软硬结合,是任何第三方方案难以企及的。
参考链接:
https://x.com/badlogicgames/status/2086877202239353285
https://www.reddit.com/r/DeepSeek/comments/1vhhxvy/deeppi_reasonixlevel_cache_performance_in_pi/
https://dev.to/arshtechpro/reasonix-deepseek-a-terminal-coding-agent-built-around-the-thing-everyone-else-ignores-3l21
https://pi.dev/packages/@rohaquinlop/pi-deepseek-cache
https://www.youtube.com/watch?v=j3c35v386T0
声明:本文为 AI 前线整理,不代表平台观点,也不构成投资建议,未经许可禁止转载。

