大数跨境

DeepSeek + Pi 王炸组合跑赢 Claude Code?Pi创始人:这套组合我早押中了

DeepSeek + Pi 王炸组合跑赢 Claude Code?Pi创始人:这套组合我早押中了 AI前线
2026-08-15
5
导读:8 月 11 日,Pi Harness 创始人 Mario Zechner 转发了一组数据:开发者 0xEvan 用 Pi 调用 DeepSeek V4 Flash
作者 | Tina

8 月 11 日,Pi Harness 创始人 Mario Zechner 转发了一组引人注目的数据:开发者 0xEvan 利用 Pi 调用 DeepSeek V4 Flash,在处理近 10 亿输入 Token 的情况下,缓存命中率高达 99.93%,最终成本仅为 2.65 美元。若未启用缓存,同等算力消耗预计需 132 美元。

同日,开发者 Shantanu Goel 指出,DeepSeek V4 Flash 在其他 Harness 中的缓存命中率通常为 94% 至 97%,而在 Pi 中却能稳定维持在 99% 以上。Mario 对此评论称:“在使用本地模型时,这一优势尤为显著。”

此类社区案例屡见不鲜。

这让人联想到 Mario 今年 5 月对"Pi + DeepSeek V4"组合的评价:"pi + ds4 == sovereign AI enterprise ready clearly."意即该组合已具备企业级主权 AI 的能力。当时这或许只是看到开发者用该组合跑通终端俄罗斯方块后的调侃,但三个月后,一项公开横向测试用数据证实了这一观点。

Pi 搭配 DeepSeek,性能超越 Claude Code?

AI 智能体开发工具公司 Composio 近期进行了一项公开对比测试。测试选用同一模型 DeepSeek V4 Flash,分别在 8 种不同的智能体 Harness 中运行,要求完成 30 项高难度任务(包括采取行动、调用工具及独立闭环工作)。

测试结果显示,Pi Agent 以通过 20 项任务(成功率 66.7%)位居榜首;Oh My Pi 通过 17 项排名第二;Claude Code、Codex 和 Deep Agents 均通过 16 项;Prime Agent 与 Hermes Agent 各通过 15 项(其中 Prime Agent 有 6 次运行因超时或无记录未被计分);OpenCode 通过 14 项排名末位。

在模型相同的前提下,仅更换外层 Harness,任务成功率便从 46.7% 提升至 66.7%,差距达 20 个百分点。

成本差异更为悬殊:Pi 平均每项成功任务耗时成本仅 0.028 美元,而 Claude Code 高达 0.195 美元,约为前者的 7 倍。

在执行速度上,Pi 完成任务的中位时间为 132.2 秒,虽略慢于 Claude Code(122.7 秒)和 OpenCode(129.7 秒),但综合成功率、速度与成本三维指标,Pi 表现最为突出。

该测试揭示了"Harness 乘数效应”:围绕 AI 搭建的工具层能显著放大或削弱模型的实际表现。选择合适的 Harness,可使同一模型更可靠、高效;反之,即使底层模型能力相同,任务成功率和效率也会大幅下降。

Composio 强调,孤立评测模型具有局限性。若 Agent 排行榜仅列出模型名称而未说明所用 Harness,其评分结果是不完整的。

极简的 Pi,为何胜出?

Composio 测试中一个关键细节是:Pi 采用的是全新、未经修改的默认安装,仅接入了测试所需的 MCP 服务器插件,无任何自定义配置或特殊调优。正是这套“开箱即用”的轻量方案,通过了最多任务。

反观 Prime Agent,其在八种 Harness 中产生了最庞大的会话,部分会话消耗多达 350 万 Token 并进行了 33 次工具调用。这种过度复杂的前置规划导致评分器处理超时,致使 6 次运行无效。即便仅统计有效运行,Prime 的任务通过数也与 Hermes 相当,但耗时接近 Pi 的两倍。

数据呈现出鲜明反差:功能庞杂的 Prime 被自身运行负担拖慢,而轻量的 Pi 则以低开销实现了最高通过率。这表明,在此类测试中,增加层级并未带来更好结果,反而挑战了“配置越多效果越好”的传统认知。

DeepSeek V4 Flash 定位为侧重速度与效率的 Flash 模型。轻量化配置的 Pi 之所以占优,逻辑在于:每增加一层,智能体就多了一个可能出错的路径;每增加一个工具,决策复杂度便随之上升;每增加一份冗长的指令文件,模型需处理的噪声也更多。

干净的 Harness 为模型提供了从接收任务到执行完成的短路径,而臃肿的架构则导致绕行。默认安装之所以击败重量级配置,核心在于路径更短,偏离方向的风险更低。

99.9% 缓存命中率的实现机制

Pi 并非专为 DeepSeek 设计,而是一套面向开发者的 Agent 底座,支持扩展系统提示词、筛选对话历史、自定义上下文压缩及动态管理工具。这种可编程性为 DeepSeek 的缓存优化提供了广阔空间。

DeepSeek API 采用前缀缓存机制:若请求开头的 Token 序列与上一次完全相同,服务端将直接从缓存读取并以极低价格计费。关键在于,前缀匹配必须从第一个 Token 开始,一旦上下文前部发生变化,后续大量 Token 将无法命中缓存。

典型的 Agent 请求包含系统提示词、工具定义、对话历史及本轮新增内容。随着会话增长,重复内容增多,理论上更适合缓存。但若 Harness 每轮都重新整理内容(如加入时间戳、改变工具顺序或重写摘要),长上下文将难以被稳定复用。

针对此痛点,社区涌现出一批优化项目。开源项目 Reasonix 专为 DeepSeek 前缀缓存设计,其核心理念是保持上下文前端稳定,采用追加而非修改的方式,并将变更成本降至最低。

有开发者尝试将 Reasonix 的性能优势移植至针对 Pi 优化的 DeepSeek 软件包中。激活后,缓存命中率可稳定维持在 99.7% 至 99.9% 之间。

Reasonix 的具体实现策略包括:

  • 启动时注入稳定环境摘要:避免每轮对话重新生成,并在触发摘要压缩前截断清理过时的工具输出。
  • 工具 Schema 契约文档化:对内置工具进行回归审查,防止因工具定义调整导致缓存失效。
  • 双模型模式隔离:执行模型与规划模型运行在各自独立且缓存稳定的会话中,避免交错破坏前缀稳定性。

Pi 生态中的第三方扩展 pi-deepseek-cache 也采用了类似思路:

  • P0 层:冻结日期和当前工作目录,杜绝因动态内容(如 Current date)导致的缓存失效。
  • P3 层:利用 deepseek-v4-flash 在 temperature 为 0 的条件下进行确定性摘要,并对结果做哈希缓存,确保相同输入始终复用字节一致的摘要。
  • P2 层:通过 SHA-256 哈希诊断前缀变化,帮助开发者快速定位缓存失效根因。

降本效果显著:以 deepseek-v4-flash 为例,输入 Token 成本从每百万 0.14 美元降至 0.003 美元,降幅达 98%;deepseek-v4-pro 则从 3.00 美元降至 0.025 美元,降幅高达 99%。

写在最后

值得注意的是,DeepSeek 官方至今尚未推出自有 Harness。然而,"DeepSeek Harness 团队”微信公众号已于 8 月 11 日完成注册,且产品内测已启动,预示着官方产品即将正式发布。

官方 Harness 的核心优势在于“原生适配”。不同于第三方通过公开 API 进行的逆向优化,官方团队可与模型训练团队深度协同,利用模型内部非公开信息进行针对性优化。这种深度的软硬结合,是任何第三方方案难以企及的。

参考链接:

https://x.com/badlogicgames/status/2086877202239353285

https://www.reddit.com/r/DeepSeek/comments/1vhhxvy/deeppi_reasonixlevel_cache_performance_in_pi/

https://dev.to/arshtechpro/reasonix-deepseek-a-terminal-coding-agent-built-around-the-thing-everyone-else-ignores-3l21

https://pi.dev/packages/@rohaquinlop/pi-deepseek-cache

https://www.youtube.com/watch?v=j3c35v386T0

声明:本文为 AI 前线整理,不代表平台观点,也不构成投资建议,未经许可禁止转载。

【声明】内容源于网络
0
0
AI前线
面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
内容 8665
粉丝 0
AI前线 面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
总阅读181.7k
粉丝0
内容8.7k