作者丨 Reah
编辑丨李娜 岑峰
01
三家三条路线,但没人帮你背锅
02
把同一份工作交给三家办公 Agent
测试方法与边界
测试于 2026 年 9 月 13 日完成,涉及三个 macOS 构建:
WorkBuddy AI 5.5.2
千问办公(QwenWork)1.0.5,build 26090806
豆包工作(Doubao Work)2.29.7
▎第一份脏活:同一份销售流水,三家算出了三个总额
-
千问走工程师路线:自我测试与最小复现,曾抓回严重错误。 -
WorkBuddy 走团队路线:主 Agent 独立复算,修正多处错误。 -
豆包走直出路线:脚本生成文件后重点检查数字一致性。
▎第二份要“落地”的报告:三家给了三个答案,但没有一个能写进汇报
-
WorkBuddy 定为“确有此事,置信度中”; -
千问办公写“未能确认,置信度中”; -
豆包工作写“部分确认,置信度中”。
▎第三份不存在的文件处理:确实没瞎编但把球踢回给了你
03
拆开安装包:沙箱、虚拟机和浏览器
注:静态取证仅展示执行环境准备情况,不代表实际任务路径或安全排名。
-
腾讯与阿里内核源自编程 Agent(CodeBuddy/Qoder),天生带有验证习惯。 -
千问将“承认不确定”设为可关闭开关,预置多种人格预设。 -
千问将“不用数据训练模型”设为付费特权。 -
WorkBuddy 内置微信支付插件,深度接入微信生态,支持分享、通知等功能。 -
千问办公内置 SOUL.md、AGENTS.md 等组织方式。
04
AI 可以接走执行,但判断、核对、责任仍然在人

