Muse 把 Personal Agent 这条赛道推到了讨论中心。只是 Personal Agent 这个概念,边界正变得越来越模糊。该有哪些功能,云端一定要有主机吗?该怎么交互?iMessage、bot 还是单独 App?需要有哪些能力,操作浏览器、调用工具、打电话?
太多非共识,完全还没收敛的状态。
但作为目前跑得最快的产品,Muse 的产品交互,值得一聊。
当 Agent 从「回答问题」变成「替你做事、一直在线」,产品要重新做哪些设计决策?
需要主动,但不能变成又一个不停推送通知的应用;它可以替用户把事情做到哪一步,什么时候必须停下来等待批准?它需要了解邮件、日历、支付信息和长期记忆,又该如何让用户放心把这些数据交出去?
Muse 的产品设计,就是在这三组矛盾之间找平衡。Agent 要足够主动,又不能烦人。要能真正动手,又不能失控。要知道你的一切,又得让你敢交出去。
最近,Muse 团队分别公开了产品设计与安全架构的完整复盘。马克·扎克伯格也在播客中谈到了自己如何使用 Muse,以及 Meta 对 Personal Agent 的长期判断,很值得一看。
以下是 Muse 团队围绕产品设计的思考,经 Founder Park 编译整理。
01 | 只有一个长对话的交互,该怎么设计?
设计 Muse,就像在为一个新时代设计产品。
模型会主动行动,能掌握多得多的上下文,能力强到可以自己生成交互体验。这意味着要作出大量没有先例的产品决策,一边想象人们沟通、创造的新方式,一边保护他们的数据和操作安全。
Muse 的主聊天界面,被设计成一段持续的长对话,就像你和另一个人交谈那样。 和其他 AI 应用不同,它不是一轮提问、一轮回答。你可以打断它,也可以连续交给它好几件事,不必等上一件有回复。它的记忆跨对话保留,也能处理大量上下文。
早期测试中,仍有一些用户希望把某些话题的上下文单独放开。随着项目越来越复杂,这种需求也很合理,所以有了侧边对话。
主动发消息还带出一个更小的设计问题。消息可能不按对话顺序到来,用户也会连发好几条,这时一份平铺直叙、不断变长的转录就不好读了。所以 Muse 用回了聊天气泡,标明一个想法在哪里结束、下一个从哪里开始。
给 Muse 设计形象和个性,既令人愉快,也是再自然不过的选择。长期与它对话时,对着一家公司的标志或一个抽象实体说话,总觉得很奇怪。 内部测试时,每个人想象的对话对象都不一样,大家开始创造属于自己的 Muse。
团队由此意识到,让 Muse 真正成为「你的」Muse,对产品至关重要。自己创建形象、给它取名、赋予它独特风格,如今已经成为最能让用户兴奋的核心功能之一。
02 | 有主动能力很重要,但要慎用主动能力
Muse 的神奇之处,在于看着它真正在替你完成一件事。
Muse 希望能尽可能有效地帮助你完成任务、实现目标。它的系统提示词第一行就是,「你的使命是让用户的生活变得更好。」
要做到这一切,Muse 必须能力很强,而且足够主动。
Muse 有自己的电脑,配备文件系统和终端,因此可以自己写代码、构建任务所需的工具。它也能使用完整的网页浏览器,进行搜索、浏览网站、填写表格,以及完成预订、购买等交易。
它还能为你制作东西,文档、PDF、网页,以及更多形式的内容。它可以制作开支追踪工具、交互式学习指南,或是帮助你发现睡眠规律的仪表盘。
而且 Muse 会一直工作。一旦你设定目标或任务,它就会按照日程安排、或在相关事件发生时继续推进,采取下一步行动并跟进。与此同时,你仍然可以在对话里交给它别的事。后台工作完成后,它会判断结果是否值得告诉你,只有出现有意义的新进展,或者需要你参与时,才会通知你。
一个例子是,在 Muse 发布前一周,Muse 设计负责人 Mona Sarantakos 把孩子的开学准备交给了 Muse:盯学校的邮件和学区网站,把重要日期放进家庭日历,把文具加进购物车,找到儿子想要的卫衣,再订一顿庆祝开学的晚餐。就在这个过程中,Muse 从邮件里翻出一件她肯定会漏掉的事,儿子的体育项目选拔,报名还有 12 小时截止。她登机前收到 Muse 的消息,马上打给丈夫,对方赶在截止前 4 小时交了表。要不是 Muse 发现了这件事,儿子就没法参加选拔。
Muse 也会主动行动。即使你没有发起对话,它也能给你发消息。因此,主动发消息的门槛必须很高。 这条消息得确实有帮助,值得打断你。默认设置适合大多数人,你也随时可以让自己的 Muse 关闭主动消息、减少频率,或者增加频率。
后台任务也一样,做完之后,Muse 会先判断结果值不值得告诉你,只有出现有意义的新进展,或者需要你参与时,才会通知你。
03 | 虽然是 chat,但不能只有 chat
虽然 chat 是主要的交互形式,但在交互上,Muse 还是设计了很多 chat 之外的形式。
团队有意识地划定了哪些地方必须使用明确的界面控件,带有清晰「接受/拒绝」选项的结构化审批卡片,以及安全保存登录凭证的机制。
有时候,一大段文字也不是回答问题的合适形式。让一个人帮你规划旅行,你想要的是一份行程单,不是一篇两千字的回复。如果你想长期追踪支出,比起每天收到一条消息,可能更想要一个实时更新的仪表盘。
Muse 可以制作丰富、可交互的内容,通过聊天发给你,也可以在聊天界面之外使用。这些内容被称为 Artifacts,比起今天聊天框里的一段文字,人们会越来越想要内容更丰富、为自己量身定制的界面。
早期测试还暴露出一个意外的问题,Muse 能做的事太多,人们反而不知道该从哪里开始。 所以 Muse 被设计成会持续思考自己能为你做什么,根据你的目标、行为模式,以及从对话中了解到的信息,生成新想法。
Muse 会以多种形式向你提出这些想法:你刚开始使用时收到的提示、「想法」标签页里的建议。如果它了解你的目标,还会根据观察以及与你的对话,主动分享新的点子,或建议调整原有计划。
后台同时处理多项任务、应用关了也照样运行,这很令人兴奋,但也带来一个问题。它究竟在做什么?看不见的东西,很难让人信任。于是界面的透明度被不断提高。Muse 形象下方有一行简短说明,写着它正在做什么。点开形象,能看到完整的活动记录,以及你已经批准的权限。
用户开始同时交给 Agent 多项长期任务,其中很多都和想实现的目标有关。只有活动记录还不够,还需要清楚看见 Muse 正在替你追踪哪些事、打算怎样实现目标。这些都记录在「目标」标签页里,你可以直接在那里和 Muse 互动,也可以在聊天里讨论。
权限界面、「设置」和记忆文件也都考虑了透明度。你可以直接阅读、编辑自己的记忆文件。
04 | 权限设计上,一定是「Human-in-the-loop」
这是 Meta 第一次把收件箱、日历和 shell 交给一款软件,让它在无人看管的情况下运行,结果并不总是如人所愿。要让所有人都能用上这项技术,就必须通过审慎的设计和工程,让它更安全地运行。这个项目的大部分精力,都花在了这里。
训练模型时,团队特别关注这类 Agent 最关键的能力:通过 CLI 和 Skills 零样本调用工具,处理长上下文,在长任务中遵循指令并识别提示词注入,以及协调多个 Agent。
但无论底层模型多强,Agent 仍然会犯错,也可能通过它读取的数据受到攻击。所以设计系统时,要预设 Agent 可能正在遭受攻击,并限制潜在损害。运行 Agent 的 Harness 待在一个独立隔离的运行单元里,看不到真实凭证。它与外部世界的每一次交互,都必须经过它无法绕过的 Sentinel。
Sentinel 是一个与 Muse 分开的宿主侧 Agent,是连接器操作和所有网络出站流量唯一的审批方,决定允许、拒绝或询问用户。Muse 可以提出操作请求,但只有 Sentinel 能准许执行。
Muse 仍然可能、也确实会出错。但团队预计,凭借内置的安全系统,错误会少得多,造成的损害也会小得多。
你和你的 Muse 共用一台专属云端电脑,但理解它的正确方式是:同一台电脑上有两个彼此隔离的安全域,而不是一个拥有整台机器 root 权限的大模型 Agent。运行单元预期会处理不可信的数据,所以安全检查模型、凭证服务、连接器执行进程等都放在它外面,攻击者无法在运行单元里关掉这些防护。
Muse 能通过对话处理很多事,但在少数领域,光靠对话不够。所以有意识地划定了必须使用明确界面控件的地方:带清晰「接受/拒绝」选项的结构化审批卡片,以及安全保存登录凭证的机制。
「Human-in-the-loop」会在写邮件、买东西这类关键操作前征求你的意见。但也要避免「横幅盲视」,用户为了让提示消失,什么都一律批准。监督那些「无法撤销」的操作很重要。因此,默认设置允许 Muse 正常浏览网页,但遇到难以撤销的操作就会停下来。你也可以通过内置控件调整默认设置,让它更谨慎或更宽松。
通过「Human-in-the-loop」授予的批准,是权限边界明确的能力授权,不是聊天中的一句建议。Muse 支持取得一次性、仅限当前会话、仅限当前任务、有时间限制,或持续有效的权限。
目的不是事事都询问用户。只读、此前已获准,或可证实风险很低的操作,都可以不打断用户而继续。希望能在真正需要同意的地方设置阻力,同时让日常操作顺畅进行。随着积累更多真实用户的使用经验,预计会继续调整其中的平衡。
权限也是逐步放开的。用户通常更愿意先让 Agent 读,比如「读我的日历,提醒我有冲突的安排」,等了解它表现如何,再决定是否授予「替我安排新会议」这样的写权限。Muse 在服务支持时把读写分开,控制粒度比 OAuth 通常的分组更细。
邮箱是一个例子。主邮箱里很可能有大量一次性验证码,点一下「忘记密码」,通常就能用邮箱重置别的网站的密码。把邮箱连接给 Muse,不应该让 Agent、或操控 Agent 的人,得以在其他网站冒充你。所以 Muse 的邮箱连接器会用确定性规则和分类模型,滤掉验证码、密码重置链接和免密登录链接。
购物是最受欢迎的浏览器用途之一,出错可能损失真金白银。已经保存过支付信息的网站,Muse 会识别结账页,每次购买都展示交易详情,请你本人批准。在没买过东西的网站,付款时系统签发一次性卡号,只对特定商家、特定金额、在有限时间内有效。即便它通过提示词注入被窃取,对攻击者也不会有多大用处。
Simon Willison 在 2025 年 6 月提出的「致命三要素」,是 Muse 一直紧盯的问题:访问私人数据、接触不可信内容、能够对外通信。如果 Agent 同时具备这三项能力,攻击者就很容易诱骗它读取你的私人数据,再发给攻击者。
为此,Muse 采用多层防御:训练模型识别和抵御提示词注入;来自外部的数据进入上下文时一律标为不可信输入;多个与核心模型分开训练的检测分类器并行检查;把数据移出 VM 的操作,交给用户审批。即便 Muse 被诱导去做坏事,确定性的边界依然生效。
当然,Muse 不能免疫攻击。提示词注入仍是整个行业尚未解决的问题,Muse 也会犯错。系统的设计目标是在出问题时限制影响,让用户保持控制权,又不被过多提醒压得喘不过气。
05 | 扎克伯格:Personal Agent「分寸感」很重要
Alex Heath:你自己怎么用 Muse?
扎克伯格:我自己用 Muse,是想让它帮我成为更好的父亲、丈夫和朋友,帮我和别人保持联系。
我三岁的女儿喜欢烘焙,我自己一窍不通,却觉得这是可以一起做的有趣项目。于是我让 Agent 每个周末安排一个适合三岁孩子和完全不会烘焙的大人一起做的项目,再用 Instacart 之类的服务买齐食材,这样星期天我们见面就能直接动手。之后我会告诉它效果如何。第一次的棒棒糖蛋糕太难了,意外地难,它会根据反馈调整计划。
大女儿开始喜欢爬山,有些山要申请许可。我让 Agent 盯着开放申请的时间,一有名额就替我们拿到。它告诉我哪天申请成功,我就知道那天得请假陪她去。
我还在 MMA 训练馆装了摄像头,让它看视频给我反馈。有一次它挑出一个片段说「看起来你真的放弃了」。我说,是啊,当时我真的累坏了。教练们也笑,说有些话他们不好意思对我讲,倒是 Agent 直接讲了。
Alex Heath:早期测试时,有没有哪种用法让团队印象很深?
扎克伯格:有意思的是,每个人都想拿它做完全不同的事。有人第一天就拿它协助管理在家教育,另一个人不到一天就让它规划了一整趟旅行。
有位平时很怀疑技术的朋友,试用后几天没有任何反馈,突然发信息问我:「正式上线时,我能保留现在这个 Muse 吗?还是会被重置?」我一看,就觉得这说明产品有用了。
Alex Heath:你们团队说它会「夜里学习」。
扎克伯格:对,它会把自己的反思整合进记忆,持续推进项目,还会建议新项目。我和一个女儿一起玩《文明》,Agent 提议替她做一份攻略,我同意了。攻略做好后,它又问要不要加入不同文明的历史知识,变成一份历史教材。我说好啊,它就在自己做的应用里加了一个新标签页。
很多人不知道 AI 能帮自己做什么。如果 Agent 会主动根据你的情况建议有用的事,就解决了使用门槛上的很大一部分问题。
Alex Heath:你们还提到 Muse Agent 的「舰队」可以从整个群体中匿名地学习。这种网络效应会是你们真正的优势吗?
扎克伯格:行业目前大多把 Agent 当作单人游戏。每个人有自己的 Agent,用自己的就行。 但 Agent 相互协作还能产生很多有趣的事,公司内部已经看到员工的 Agent 彼此互动。这次发布大部分还不会开放这些功能,但长期看它会很重要。
我们有几个独特之处。第一,从一开始就围绕这个用途设计模型。第二,Meta 有社交方面的基因,会更关注怎样用 AI 加强人与人的关系,帮助人处理生活中那些柔软但很重要的部分。第三个或许令人意外,隐私和安全。
Alex Heath:为什么是隐私和安全?
扎克伯格:要有用,Agent 不只需要一流的智能,还得真正理解你和你的目标。你会把消息、邮件、健康信息等接进去,人们必须高度信任它。
过去十多年,我们把 WhatsApp 建成全球最大的端到端加密系统之一,连 Meta 自己也看不到用户的信息。这教会我们一件重要的事,如果系统设计成我们自己也看不到内容,用户就不必担心政府、黑客或 Meta 内部人员通过我们拿到信息。我们从一开始就把这个经验带进了 Muse,亲自招募了 Signal 创始人 Moxie Marlinspike,他当年也帮我们开发过 WhatsApp 的加密,现在专门负责 Muse 的机密虚拟机项目。
年初 OpenClaw 出来时,很多人买 Mac Studio 放在家里运行,设备实实在在归自己,确实让人安心。但几十亿人不可能都买一台 Mac Studio,在家自己配置、运行。我们希望 Muse 拿来就能用,可以交给家里技术能力不同的任何人,一天内就帮他们处理生活中的事。
Alex Heath:它还得知道哪些事情不该说。
扎克伯格:对。我们把「分寸感」当作个人超级智能需要专门训练的能力。 你的 Muse 会知道很多关于你的事,还要到外部世界替你办事,却不能随意透露敏感信息。
比如你有过敏症或者怀孕了,你去订餐厅,不一定想透露自己怀孕,但可能想找一家无酒精鸡尾酒好喝的地方。Agent 要帮你达成目标,同时不暴露不必要的个人信息。它还得自己判断什么敏感,不能每一步都来问你。这是我们专门训练的能力。
如果你做的是 Claude Code,场景就不一样。团队在企业里合作编程,项目本身可能对同事可见,对信息敏感程度的区分没那么重要。我不认为一家拿现成模型稍做后训练的公司,能赶上我们从预训练起就为这个目标设计模型、注入相应数据做出的产品。
Alex Heath:它会和 Meta AI 共存吗?
扎克伯格:我想会,目前两者感觉不太一样,我都在用。Muse 更像持续对话,也更倾向于把你的问题理解成一个长期目标,可能根据你的一句话投入很长时间做事。有时你只是想问个问题、立即得到答案,我就更常用 Meta AI。以后或许会合并,我还不确定。
更多阅读
Diogo Almeida:我为什么要做 Jev?
姚顺宇、施天麟聊 RSI:最难的不是实现自我迭代,而是如何验证迭代有效
YC 2026 Startup 复盘:硬件、数据的都在挣钱,应用团队开始自己训模型了
实时交互模型:一个还没形成共识的赛道,怎么就成了热门?

