智见AI
最近在和电子工业出版社合作录一门 WorkBuddy 的实战课。这篇文章出自其中一节「初识 WorkBuddy」,我直接免费分享出来。如果你正在用 WorkBuddy 或者打算用,这篇能帮你省掉大量瞎摸的时间。
先给个判断:WorkBuddy 是国内目前功能做得最全面、也是上手门槛最低的 Agent 产品。我推荐所有想尝试 Agent 的小白和知识工作者,首选它。
下面我把打开 WorkBuddy 之后你需要搞清楚的每一件事,从头到尾走一遍。
功能区全景:左上角四个入口
WorkBuddy 界面左上角是功能配置区域,核心入口都在这:助理、项目、专家、自动化。
助理,就是 WorkBuddy 版本的龙虾。有人格、有记忆,可以配置到微信的 ClawBot 里,这样以后直接从手机微信就能操控电脑。这个功能我用了段时间,确实方便——在外面跑的时候,手机发一句话,电脑上的 WorkBuddy 就开始干活了。
主要是在微信里面使用clawbot可以生活场景和工作场景不分开,之前想用Hermes总是要额外打开飞书。
项目,是团队协作能力。通过「项目」和「任务」两层结构,让团队成员共享上下文、标准与知识。如果是个人用,这个功能暂时不用管。
专家,这个是重点。里面包含了 subagent、skill、MCP 的配置。
专家分两种:「专家中心」里可以按行业分类浏览,也可以用自然语言描述创建自己的专家。这里需要调用一个内置的「设计subagent」的skill,叫做expert-manager
专家是「角色切换」机制——以「人设 + 方法论 + 工具链」让 WorkBuddy 用特定领域专家身份执行任务。专家团更进一步,由多位专家分工协作,由团长自动拆解、并行执行并整合交付。
专家、专家团、Skill 三者的关系:
| 维度 | Skill | 专家(Agent 型) | 专家团(Team 型) |
|---|---|---|---|
| 本质 | 工具能力:让 AI 能做某件事 | AI 顾问:懂某个领域的角色 | AI 协作团队:自动拆解、并行、完整交付 |
| 怎么选 | 需要 AI 具备某种工具能力 | 有一个明确的单点问题 | 任务复杂,需要多角色配合 |
一句话:Skill 是能力,专家是能力加经验,专家团是多位专家加协作流程。
自动化,就是定时任务。按固定周期把预设好的提示词发给 WorkBuddy 执行,成果还能推送到小程序。逻辑简单,但用好了很省事。
以上先建立个全局意识就行,后面结合实操展开。
新建任务:每个选项该怎么选
新建任务栏是 WorkBuddy 最重要的界面。它解决一个问题:这次任务,要让哪个 Agent、带着哪些材料、用什么权限、在哪个目录里干活。
很多人一上来就输入一句话让 AI 开干,能出结果,但结果散、文件乱、权限风险高。下面逐项说清楚。
场景选择:三层预设
WorkBuddy 把上手门槛做得非常低,通过三层预设把用户的提示词门槛大大降低。
第一层,按工作场景分:职场、开发、设计。日常默认选「日常办公」就行,也能做开发任务,这是 WorkBuddy 的主推场景。
第二层,场景下的任务分类。比如选了日常办公,下面就是文档处理、数据可视化、深度调研这些。选中一个分类,底层会自动路由到某个专家团或者skill包,确保任务质量更高。
这里有个值得拆一下的东西——「深度研究」。
深度研究既不是单一 Skill,也不是 MCP,更不是一段 Prompt。 它是 WorkBuddy Teams Marketplace 里的一个 Expert Agent 包(deep-research@cb_teams_marketplace),本质是「主 Agent 编排 + 子 Agent 执行 + 多工具协作」的 Agent Team 系统。
这个设计是 WorkBuddy 的一个亮点。它不是简单地在提示词里说"你是一个调研专家",而是真正拆成了多个子 Agent 各干各的,有编排层、有执行层。后面实操部分你会看到它并行干活的效果。
第三层,具体任务。比如竞品对比分析。选完之后输入框自动填入提示词模板,改一改就能用。
三层的作用就是把用户原本需要通过提示词表达的意图给选项化了。这是 WorkBuddy 相对于黑黢黢终端里的 CLI Agent 最大的优势——上手门槛低很多。
工作模式:Ask、Plan、Craft
三种模式,理解成三种「派活力度」。
| 模式 | 什么时候用 | 怎么理解 |
|---|---|---|
| Ask / 问一问 | 只想了解、分析、确认,不希望它改文件 | 先问清楚 |
| Plan / 想一想 | 长线程复杂任务,需要先制定计划 | 先让它说怎么做 |
| Craft / 做一做 | 目标明确,可以直接生成或修改文件 | 让它开始干活 |
我的习惯:不确定任务边界时用 Ask,重要文件或复杂任务用 Plan,明确要生成文件时用 Craft。
这不是保守,是稳定。Agent 能干活,也可能理解错任务。让它先解释计划,是把控制权留在人手里。
模型选择:按任务类型匹配
第一个要关注的是上下文窗口。目前只有 GLM 5.2 和 Deepseek V4 系列支持 100 万上下文窗口,适合长线程任务或者你想长期使用某个对话 session。
多模态这块要注意:目前只有 GLM 5V Turbo 和 Kimi 系列是真正支持多模态的,也就是能像人眼一样看到并理解图片。理论上你可以给它传网页截图让它复刻,它做前端任务时也能自己截图、自己评估结果。
其他模型的「图片输入」功能,是 WorkBuddy 预制了 OCR 工具——上传图片后先 OCR 提取文本,再把文本传给模型。不是真的多模态。
每个模型后面标了积分消耗比率,数值越大消耗越多,其他意义我也不确定,简单理解就行。
综合来说,我日常怎么选模型:
- 日常办公任务:默认 Deepseek V4 Pro。能力强、上下文空间大、性价比最高。
- 复杂开发任务、Skill 设计:直接 GLM 5.2。整体能力水平跟 Claude Opus 4.6 差不多。
- 视觉审查任务(网页复刻、做 PPT 等):Kimi 2.6 或 Kimi 2.7 Code。
如果哪天 GLM 5.2V Turbo 出了,那就是最完美的选择:顶级智力 + 100 万上下文 + 视觉能力 + 高输出速度。
技能:给 WorkBuddy 拓展能力边界
Skill 大部分由三部分组成:工具本身、使用工具的说明书、做成功某件事的最短成功路径。
举个例子。最近 Seedance 2.5 很火,如果想让 Agent 制作宣传视频,就得设计一个 Skill:包含 Seedance 2.5 的 API 和 Key,让它有调用权限;说清楚 API 怎么用;再把宣传视频制作的方法论打包进去。这样就能全流程制作出高质量视频。
用 Skill 有两种方式:点技能按键直接选,或者在输入框打斜杠输入前几个字母匹配。
初始状态下 WorkBuddy 已经内置了几个官方 Skill,确保高频场景不额外配置也能用。
想加新 Skill 也简单,两种方法:
方法一:从 Skill 商店添加。 商店里的 Skill 基本是 WorkBuddy 官方一对一邀约上传的,安全和质量没问题。比如卡兹克开源的「卡兹克公众号写作」,点个➕就加了。
方法二:用自然语言让 WorkBuddy 帮你找。 直接在输入框说需求就行。底层原理是 WorkBuddy 内置了一个叫 Find-Skills 的元 Skill,通过关键词去 SkillHub(腾讯官方的 Skill 社区)上搜索。
还有个细节:WorkBuddy 把一些热门 Skill 预制到了本地文件夹里,查找时先从本地找,更快。有些 Skill 需要特定网络环境安装,预制到本地就绕过了这个问题。
工作目录:先给 Agent 一个干净房间
新建任务时,默认不会选择本地工作空间。
不选的话,系统每次会自动划定一个临时目录,命名规则是 WorkBuddy/YYYY-MM-DD-HH-MM-SS。
我的建议是:下达任何任务之前,提前选好自己本地的文件夹作为工作空间。我自己是把所有任务都放到 Obsidian 仓库里,这样个人上下文归集起来,以后 Agent 可以随时调用。
打开新文件夹作为工作空间时,首次交互会触发初始化——WorkBuddy 会问你一些问题来了解你,形成自己的身份认知。
固定使用一个文件夹还有个好处:你可以在根目录放一个 AGENTS.md 文件。目前除了 Claude Code 不支持,其他任何 Agent 都支持这个文件作为系统提示词——任何对话中都会初始加载。所以在这个文件夹里跑的 Agent,比如 Claude Code、比如 Codex,都会加载这个文件来获得对你的静态认知和运行规则。
独立工作目录的好处:材料清楚、文件不乱、风险可控。
连接器:能不用就不用
连接器本质就是 MCP,用于把 WorkBuddy 和外部服务连起来——邮箱、腾讯文档、乐享知识库、会议工具等。
去 WorkBuddy 商店一键添加,简单授权就能用。比如授权完乐享之后,WorkBuddy 就能读取、编辑、管理乐享知识库的内容。
但我的判断是:现在任何 MCP 能实现的功能,几乎都可以通过 API + Skill 实现。不建议折腾 MCP——占用上下文空间大,我现在已经几乎不用了。
权限:我的选择是完全开放
WorkBuddy 能读写文件、整理目录、生成文档,也可能执行脚本或调用外部程序。两种权限模式:
- 默认权限:危险操作(比如删文件)会被拦截,系统发权限申请让你确认。
- 完全访问:跳过所有权限申请,确保任务连贯性。
我是任何 Agent 产品都默认开放最高权限。原因很简单:Agent 任务通常时间很长,开默认权限会频繁弹出权限申请,而大多数权限申请对普通用户来说根本看不懂。我选择完全相信 Agent,到现在没遇到过误删文件的情况。模型智力越来越强,这种极端边界情况会越来越少。
不过有一点:开完全访问权限时,建议选最顶级的模型,比如 GLM 5.2。选个垃圾模型,它真有可能做出比较呆的事情。
跑一个真实任务:让 WorkBuddy 调研 Loop Engineering
还是用我的 Obsidian 仓库作为工作空间,日常办公模式,选深度调研任务类型。让 WorkBuddy 调研最近火爆的 Loop Engineering,产出一个白皮书。
这是个比较长线程的复杂任务,所以我开了 Plan 模式。
任务一开始,WorkBuddy 就体现出了非常强的并行能力——同时调用多个工具,还额外调了一个 Explorer 的 subagent。
我不确定是 WorkBuddy 的 Harness 工程做得好,还是 GLM 5.2 这个模型本身就强,大概率是两者综合的效果。
Plan 模式的好处是在关键决策点,WorkBuddy 会用 Ask user question 工具向你提问,而且是选择题,确保跟你对齐需求。
计划产出一个 Markdown 格式的详细方案,你审核没问题后点「确认计划」,WorkBuddy 自动退出 Plan 模式进入 Craft 模式开始执行。
有新产物的时候它会在右侧直接打开。有时候不打开也没关系,直接去工作空间里按路径找就行。
用好WorkBuddy 的核心不是「会用每个按钮」,是知道每个功能选项背后意味着什么。界面会更新,按钮会变化,但「给 Agent 派活」这件事的逻辑是稳定的。
对WorkBuddy感兴趣的朋友可以蹲一下这个系列的文章,大鹏只做深度实践类的文章。 #WorkBuddy #教程 #skill #Agent #prompt

