8 个 Agent Harness 横向测评:Pi+DeepSeek 成本最低,但速度不是最快
同一个模型,不同 Harness,成本可能差出一个数量级。
Agent Harness(智能体运行框架)热度飙升,连 DeepSeek 也推出了自有版本,上线数小时 Star 数即超 6 万。面对 Hermes、Pi、OMP、Prime Agent 等众多选择,开发者该如何决策?Composio 基于同一 DeepSeek V4 Flash 模型,通过 30 个真实多步骤任务进行了硬核数据测评。
测试设置:30 个高难度任务,真实 SaaS 操作
测试采用 DeepSeek V4 Flash(Artificial Analysis 得分 52,对比 Opus 5 Max 的 63 分,成本仅其几十分之一)。30 个任务要求 Agent 在 Google 表格、日历、GitHub、Linear、Gmail、Slack 间协同操作,限时 900 秒。任务涵盖同步表格与日历、核对 GitHub issue 和 Linear 任务、跨 Gmail/Slack 同步工单等,且严禁改动无关数据。
结果:四本经济账
1. 通过率:Pi Agent 最高
- Pi Agent:20/30,成功率 66.7%
- Prime Agent、OMP 紧随其后
- OpenCode 排名垫底
2. Token 消耗:Prime Agent 是“油老虎”
- Prime Agent 平均每任务消耗 140 万 token
- OMP、Claude Code 约为 74.2 万
- Pi 约 55.9 万,Hermes 最省,仅 19.2 万
3. 耗时:Claude Code 最快,但快≠高通过率
- Claude Code 中位耗时 122.7 秒
- Pi 耗时 132.2 秒,排名第三
- OMP 最慢,达 272.4 秒
- 注意:Token 消耗与耗时不成正比。Claude Code 与 OMP token 相近,但耗时相差一倍以上。
4. 成本:Pi 每个成功任务仅$0.028
- Claude Code 最贵,$0.195/成功任务,因其缓存命中率仅 1.5%
- Pi 成本最低为$0.028,DeepAgents 为$0.045,Hermes 为$0.056
- 缓存命中率是成本差异的关键:Codex 约 70%,OMP 约 57%,Claude Code 仅 1.5%
选型建议
- 求稳又省:首选 Pi Agent(通过率最高 + 成本最低)或 DeepAgents
- 在意速度、预算不敏感:可选 Claude Code,但需承担高额账单
- 任务极度吃上下文:慎选 Prime Agent(140 万 token,且有 350 万会话警告)
- 预算敏感、不介意等待:Hermes 最省 token,值得一试
未来企业评估 Harness 将如同评估模型一般,重点关注 Token 消耗、完成时间、总成本及单次成功成本。针对同一任务,选对“模型+Harness"组合,这四本账的差异可能高达一个数量级。
参考:Composio 官方测试

