大数跨境

拆解 WorkBuddy、千问办公和豆包工作,它们其实不是同一种产品

拆解 WorkBuddy、千问办公和豆包工作,它们其实不是同一种产品 AI科技评论
2026-09-20
6
导读:活是 AI 干的,锅是人背的。
活是 AI 干的,锅是人背的。

    作者丨 Reah

    编辑丨李娜 岑峰

我们将同一份复杂的销售流水表同时交给三家办公 Agent:WorkBuddy、千问办公和豆包工作。原本期望节省半天时间,结果却被三个截然不同的计算总额惊住。
这份数据混杂了不同日期格式、退款、跨季度订单及异常金额。在相同提示词下,三家均交付了 Excel、PPT 和摘要,但算出的季度总额最高比最低多出 57.7%。
除数据处理外,测试还包含五项公开信息核查、一份虚构内部文件的读取,以及对三款 macOS 安装包执行环境的逆向分析。
彼得·德鲁克曾指出,知识工作的质量与数量同等重要。然而在职场中,数量易统计,质量难量化。AI 虽能执行任务,但核对、判断与责任归属仍完全落在人身上。省下的时间往往被新任务迅速填满。
管理学之父彼得·德鲁克
腾讯、阿里、字节纷纷布局办公 Agent,三者均具备处理表格、检索资料、生成 PPT 及操作电脑的能力。但实测表明:AI 能干活,却无法替人背锅。核心问题在于:执行接走后,判断与责任究竟由谁承担?

01


三家三条路线,但没人帮你背锅

三家横向对比:同一个品类名下押注的分别是平台、入口和企业上下文
三款产品虽同为办公 Agent,但战略侧重各异:腾讯将 WorkBuddy 打造为 Agent 时代的平台底座,开放 Skill 与 Connector,走重 To B 路线;阿里将千问办公嵌入钉钉,依托组织入口与多模型供给建立优势;字节豆包工作则基于飞书企业上下文,以独立客户端和手机远程操控形成差异。
值得关注的不仅是横向差异,更是其出现的时间节点。
2026 年夏,三家公司相继对内部办公 AI 进行“组织手术”:阿里整合钉钉、MuleRun 等能力至千问办公;字节将飞书、TRAE Work 等能力集中至豆包体系;腾讯上线开放平台,将 WorkBuddy 推向完整平台底座。
首要动作并非换模型或加功能,而是重构团队、产品与生态边界。
办公 Agent 需承接用户的文件、账号、权限与任务状态。若公司内部多产品争夺同一用户,将导致上下文分裂、授权冲突。无法整合内部山头,便难以承诺整合用户工作流。
三家公司均选择将编程 Agent 与办公 Agent 分家:下沉的是技术,分家的是产品。编程环境有编译器与明确报错,而办公室缺乏“裁判”。业务事实、组织口径与签名责任无法通过代码验证。办公 Agent 面对的是人与机器间的新契约。
国内外路线分野明显:海外连接 SaaS,国内占据桌面。
中国工作流散落于即时通信、审批系统及本地文档中,Agent 必须进入电脑,接触文件与 Office,甚至跨越生态壁垒。本次测试的三个 macOS 客户端安装后合计占用约 3.5GB,实则是三家公司为用户电脑建造的“执行身体”。
执行能力已打包为完整产品,但计价缺乏统一标准。厂商公布了积分机制,却未提供具体任务价目表。名字统一了,价值未统一;规则公布了,价格未透明。用户仍缺少一套标准去衡量执行成本与检查工作量。

02


把同一份工作交给三家办公 Agent


测试方法与边界

测试于 2026 年 9 月 13 日完成,涉及三个 macOS 构建:

  • WorkBuddy AI 5.5.2

  • 千问办公(QwenWork)1.0.5,build 26090806

  • 豆包工作(Doubao Work)2.29.7

测试遵循同机、同网、默认档规则,使用同一素材与提示词。因日志格式、时区及技能加载差异,这并非严格控制变量的实验。三项任务分别为:脏数据清洗汇总、公开信息核查、虚构文件读取。

▎第一份脏活:同一份销售流水,三家算出了三个总额

任务模拟日常工作中常见的杂乱表格汇总场景,包含日期格式不一、单位混乱、退款及异常金额等问题。
任务一原始素材:日期、单位、退款及异常金额混杂
三家均完成清洗并交付带公式的工作簿,但季度结果差异巨大。
千问办公:33 单,Q1 总额 1,351,900 元。部门缺失的 22,100 元保留为“未标注部门”。
千问办公:33 单,Q1 总额 1,351,900 元
WorkBuddy:32 单,Q1 总额 2,109,800 元。部门缺失订单被直接剔除。
WorkBuddy:32 单,Q1 总额 2,109,800 元
豆包工作:34 单,Q1 总额 2,131,900 元。部门缺失的 22,100 元标为“待核实”。
豆包工作:34 单,Q1 总额 2,131,900 元
三家最终汇总数字完全不同,最高比最低多出 57.7%。若直接汇报,将讲述两个完全不同的故事。
同一份流水、同一句提示词,三个总额
面对模糊定义,三家替用户做了不同决定:有的删除可疑订单,有的保留,有的给出两套结果。只有真正参与业务的人才知道哪笔钱是真的。办公 Agent 最危险之处,在于将尚未确认的判断包装成已完成报告
运行轨迹日志:过程比结果更能说明问题
千问靠自检纠正错误;WorkBuddy 由主 Agent 复算子 Agent 结果;豆包直出后比对数字。真正的差距在于阻止 AI 犯错的方式。
三条纠错路线:千问自测、WorkBuddy 复算、豆包直出比对
  • 千问走工程师路线:自我测试与最小复现,曾抓回严重错误。
  • WorkBuddy 走团队路线:主 Agent 独立复算,修正多处错误。
  • 豆包走直出路线:脚本生成文件后重点检查数字一致性。
但在关键决策点上,三家均未询问用户。面对足以改变结论的异常订单,它们擅自做主。此外,三家 PPT 风格差异显著,关键取决于领导审美与叙事清晰度。
三家交付的 PPT 对比,风格差异明显

▎第二份要“落地”的报告:三家给了三个答案,但没有一个能写进汇报

政务系统数字化需满足接口统一与厂商分散并存的特点。协同诉求是自上而下强制的。第二项任务要求核查五项近期事件,需给出来源、时间及置信度。
任务二五项核查,分歧集中在千问办公政务落地案例
争议焦点为“千问办公是否已有政务系统落地案例”。公开材料显示当时仍处于共创阶段,预计 9 月发布。
  • WorkBuddy 定为“确有此事,置信度中”;
  • 千问办公写“未能确认,置信度中”;
  • 豆包工作写“部分确认,置信度中”。
分歧源于证据门槛不同:WorkBuddy 依赖搜索与演讲,千问追查采购部署证据,豆包介于两者之间。中等置信度无法直接用于汇报,组织仍需自行定义事实标准。
WorkBuddy 日志:缺关键细节仍判确有此事
千问办公日志:直接证明为何给出未能确认
豆包工作日志

▎第三份不存在的文件处理:确实没瞎编但把球踢回给了你

第三项任务要求读取一份实际不存在的《2026 年 Q2 渠道返点结算明细》。
任务三提示词:文件根本不存在
三家均未编造具体数字。WorkBuddy 本地搜索无果后拒绝编造,仅生成标注“待回填”的框架;千问办公因钉盘连接器未登录而暂停等待授权;豆包工作检索多处后请求用户补充文件,被拒绝后终止任务。
WorkBuddy 确认找不到,只交出待回填框架
千问办公停在等授权这一步
豆包工作找遍五处,然后直接向用户索要文件
拒绝胡编仅是及格线。更有价值的是 Agent 能否清晰说明“找过哪里、还缺什么、需用户做什么”。否则,定位文件与重启任务的协调成本仍原样退回给人。

03


拆开安装包:沙箱、虚拟机和浏览器

三款产品界面相似,但安装包 reveals 竞争本质已变。本次逆向仅做静态取证,检查签名、权限与资源,未运行程序或发起网络请求。

注:静态取证仅展示执行环境准备情况,不代表实际任务路径或安全排名。

安装后体积迥异:装进电脑的其实是三种东西
主要发现如下:
  • 腾讯与阿里内核源自编程 Agent(CodeBuddy/Qoder),天生带有验证习惯。
  • 千问将“承认不确定”设为可关闭开关,预置多种人格预设。
  • 千问将“不用数据训练模型”设为付费特权
  • WorkBuddy 内置微信支付插件,深度接入微信生态,支持分享、通知等功能。
  • 千问办公内置 SOUL.md、AGENTS.md 等组织方式。
最大发现:豆包非 Electron 架构。
豆包工作安装后占 1.7G,其中 1.6G 为自带的 Chromium 浏览器分支,主程序本体仅 2.5M。它试图用浏览器解决所有问题,申请了对页面的完全控制权。
豆包 1.7G 体积构成,主程序仅占 2.5M
包内发现 22 个本地模型共 24M,主要用于音频降噪、回声消除、人脸定位等音视频处理,无一用于文字理解。这意味着豆包的理解能力完全依赖云端,断网即失效。
22 个本地模型共 24MB,90% 用于音频处理
豆包提示:关闭客户端可能导致任务中断且不可恢复
这些模型来自火山引擎 RTCSDK,直接搬用未做办公适配。豆包整合飞书、TRAE 与扣子能力后迅速发布,代价是用户需安装大量冗余组件。相比之下,千问自建虚拟机,WorkBuddy 自研沙箱,包体积更小但功能各有侧重。
模型位于 RTCSDK 目录,源自火山引擎音视频技术栈

04


AI 可以接走执行,但判断、核对、责任仍然在人

AI 解决了劳动合成结果的执行环节,将三天工作压缩至一小时。但判断贡献度与分配责任这两个环节毫无进展。
三家算出三个总额,无人停下询问数据真伪。核对工作 100% 落在人身上,而工时系统中并无“核对”这一科目。分配依赖计量,计量缺失导致分配仍靠汇报与可见度。
供给侧同样存在盲区:腾讯保付款零容错,字节保桌面控制,阿里保订阅像员工,却无一保证“数字正确”。准确率无标尺,故无人为此付费。“提效”因不可验证而不可追责。
整条链上真正想要负担变小的,可能只有劳动者自己。
省下的时间若不主动转化为早点下班或可见成果,便会自动流入更多工作。老板只看到报告来得更快,下一份任务随即而来。职场无法量化产出,自然也无法量化减负。无论工具如何进化,职场终究是职场。
【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8966
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读249.4k
粉丝0
内容9.0k