大数跨境

Patronus:AI Agent 上岗之前,先把它关进一个“假公司”里练习

Patronus:AI Agent 上岗之前,先把它关进一个“假公司”里练习 Fun AI Everyday
2026-07-18
2
导读:AI Agent 正式上岗之前,也需要“有工作经验”。所以,先给它造一个“假公司”进去实习。

今天来聊一家很有意思的 AI 公司:Patronus,https://www.patronus.ai/

假设你做了一个 AI 客服 Agent。

它不只是回答问题,它还可以查订单、找客户资料、判断退款规则,然后直接操作后台退款。

产品演示的时候,一切正常:

你问:“我的订单为什么还没到?”它查物流,告诉你原因。

再问:“我不想要了,帮我退款”,它找到订单,调用退款接口,完成。

看起来,这个数字客服已经可以上班了,是吗?

但你敢直接把后台账号交给它吗?

Patronus AI 想了一个很直接的办法:先给 Agent 造一个假的工作环境。

假的网站,假的客户后台,假的订单,假的退款接口。

让 AI Agent 先进去开始“试用期”:查客户、填表、调用工具、处理退款。

Agent 可以不断犯错,反正不是真的钱,也不是真的客户。

系统把它每一步怎么做、在哪里出错全部记录下来,再给结果打分。

做对,奖励;做错,惩罚,然后继续练。

Patronus 甚至希望这些模拟环境可以根据 Agent 当前的能力,自动生成更难的新任务。 

也就是 Patronus 做的事,公司 2023 年成立,两位创始人都来自 Meta AI

2026 年 6 月,Patronus 完成 5000 万美元 B 轮融资,累计融资达到 7000 万美元。

过去一年,公司收入增长了 15 倍。 

Patronus 给自己现在做的东西起了一个很专业的名字:

Digital World Model,数字世界模型。

但我觉得我们可以先把它就理解成:

AI Agent 正式上岗之前,先给它造一个“假公司”进去实习。

以前测 AI,只需要问它 1000 道题

Patronus 一开始不是做“假公司”的,2023 年公司成立时,它做的是 AI 测评

两位创始人 Anand Kannappan 和 Rebecca Qian 在芝加哥大学读计算机时就认识。

后来 Rebecca 在 Meta AI 的 FAIR 团队做自然语言和 AI 对齐研究;Anand 在 Meta Reality Labs 做因果推断和实验系统。

2022 年 11 月,ChatGPT 发布。

Anand 看到消息以后,5 分钟内就发给了 Rebecca。

两个人都觉得,这东西一定会进入企业。

但很快,Anand 听说自己哥哥所在的投行 Piper Sandler 直接禁止员工在公司内部使用 OpenAI

他很意外,后来他们问了越来越多企业,发现大家的反应差不多。

想用,但不敢。 

原因很简单:AI 会胡说、会泄露敏感信息;同样的问题,今天回答对,明天可能回答错。

所以 Patronus 最早给自己的定位,有点像:

AI 时代的穆迪(金融产品评级机构)。

一家公司准备上线 AI 产品,先交给 Patronus 检查。

有没有幻觉?回答是否正确?会不会输出公司敏感信息?有没有安全问题?

Patronus 自动出题、攻击模型、给结果打分,再比较不同模型的表现。

公司在 2023 年发布 FinanceBench,用公开财务文件做金融问答测试;随后又做了企业敏感信息测试、版权检测和幻觉检测模型 Lynx。

2024 年 5 月,公司完成 1700 万美元 A 轮融资。 

这种方式很容易理解,比如公司做了一个 AI 财务助手,准备 1 万个问题。

“这家公司去年收入是多少?”

“毛利率同比变化多少?”

“根据年报,公司的长期债务是多少?”

让 AI 回答,然后逐个打分,正确率 95%,很好,继续优化,做到 98%,上线。

问题是,后来 AI 开始从“回答问题”变成 Agent。

以前 AI 只需要说,现在它开始动手了。

原来这套测试方法突然就不够用了。

一个 Agent 出错,可能要到第 27 步才看出来

还是开头那个退款 Agent 的场景。

客户说:“我上周买了一双鞋,鞋码不对,帮我退款。”

AI 要做什么?先找到客户,查订单,确认是哪双鞋。

然后检查商品状态,查看退款政策,判断有没有超过退款期限,检查商品是否已经发货。

再选择退款原因,调用退款接口,记录处理结果,最后再回复客户。

这里可能有十几个动作,即使每一个动作都没问题,最后也可能错。

比如:

客户有两笔都是 99 美元的订单,AI 找错了一笔。

又比如退款政策写着:“已发货商品不能直接退款,需要先创建退货单。”

AI 查到了政策,也理解了,但执行时还是直接调用了退款接口。

还有一种更麻烦,AI 调用退款接口,系统返回:错误。AI 看了一眼,觉得可能只是系统延迟。

于是告诉客户:“退款已经完成。”

最终回复看起来很礼貌,但钱根本没退。

Patronus 后来在 Agent 测评研究里发现,很多关键错误只有在交互过程中才会出现:

错误使用工具、丢失前文信息、执行顺序不对。

只检查最后一句回答,会把这些问题全部藏起来。 


他们还做过一个叫 TRAIL 的测试。

简单来说,就是给 AI 一段很长的 Agent 工作记录,让它判断这个 Agent 到底哪里出了问题。

里面会出现调用错工具、任务安排错误、上下文丢失、超时等 20 多类问题。

结果,当时测试的先进模型表现都很差。

Gemini 2.5 Pro 的综合准确率只有 11%,OpenAI o3 是 9.2%,Claude 3.7 Sonnet 是 4.7%。 

注意,这里测试的甚至还不是“让 Agent 自己完成工作”,只是让 AI 看工作记录,找错误,就已经这么难了。

于是 Patronus 慢慢意识到:

Agent 不能只做考试题,得把它放进一个环境里,看它怎么干活。

于是,他们开始复制网站和企业后台

Patronus 现在做的模拟环境,可以复制网站和内部系统的工作逻辑,让 Agent 在里面调用工具、操作流程和完成任务。

Patronus 使用 Digital World Models 创建网站和内部系统的模拟环境,让 Agent 在里面接受压力测试和强化学习。 

这里的“复制”,不一定是把一家公司的整个系统原封不动克隆一次。

核心是把 Agent 工作时会遇到的东西做出来。

有哪些工具,每个工具能做什么,输入什么参数,系统有什么规则,一次操作以后,系统状态怎么变化。

举个简单的例子,一个模拟退款后台里,可以有:

查询客户、查询订单、查看支付记录、创建退款、取消退款、创建工单、给客户发邮件

然后再写规则:

只有支付成功的订单才能退款、同一笔订单只能退款一次、超过 30 天不能自动退款、已经发货的订单需要先走退货流程、5000 美元以上退款需要人工审核。

这时候 Agent 进来,系统给它一个任务:

“客户要求退掉上周购买的一双鞋。”

Agent 开始工作,它调用:

查询客户,系统返回一个假的客户;查询订单,返回三笔假订单。

AI 选择一笔,查支付,再调退款。

每做一步,模拟环境都要像一个真实系统一样给出反馈。

订单存在、或者不存在、权限不够、参数错误、银行拒绝、接口超时、退款成功。

然后 Agent 根据新的结果,决定下一步。

这已经不是“问 Agent 一个问题”,它更像是在看一个新员工操作公司后台。

更关键的是,“假公司”还会自己出新题

普通测试还有一个问题:题是固定的。比如你给退款 Agent 准备 1000 个案例。

第一题:订单超过 30 天;第二题:订单已经发货;第三题:客户买错尺码。

Agent 不断训练,1000 道题越来越熟,最后正确率 99%。

看起来很厉害,但真实客户不会按照题库来。可能出现:

客户有两笔同金额订单,其中一笔已经部分退款;支付信用卡已经注销;

商品发货了,但物流显示丢失;客户同时要求修改地址和退款。

退款接口第一次超时,第二次返回重复请求等等。

这时候固定题库很容易被“刷完”。

Patronus 在 2025 年底提出 Generative Simulators,也就是生成式模拟环境。

它不再只准备一批固定任务,系统会同时生成:

任务、环境变化、评分规则。

Patronus 公开的架构里,首先设定难度和基本条件。

任务生成模块开始出题,简单任务给少量工具,复杂任务加入更多工具。

然后根据 Agent 当前能力筛选题目。

Agent 做,产生完整操作轨迹,最后用奖励函数检查结果。 

假设 Agent 已经特别会处理普通退款,系统就没必要继续让它做:“客户买错鞋码,请退款。”

可以开始不断增加麻烦。

这次客户有五笔订单、下次退款金额超过权限、再下一次接口中途报错。

或者把浏览器工具加进来,让 Agent 不只调用 API,还需要打开网页检查页面显示。

Patronus 官方甚至举过一个例子:

在类似软件开发测试的任务里,加上浏览器工具以后,可以要求 Agent 一边修改前端代码,一边真的打开网页看页面,再根据视觉结果继续调试。 

这里的逻辑特别像游戏。

你已经会打第一关,系统不给你继续刷一级小怪,开始加 Boss。

为什么 AI Agent 特别需要这种“实习经历”?

Patronus 很喜欢拿自动驾驶举例。

自动驾驶汽车不可能为了测试一次极端情况,真的在路上等一个孩子突然追着球跑出来,也不可能天天等暴雪、沙尘暴和罕见交通事故。

所以自动驾驶公司会做模拟世界,让车在假的道路里反复遇到极端情况。

Patronus 的判断也是一样的:AI Agent 也需要自己的模拟器。

只不过自动驾驶面对的是现实世界,道路、汽车、行人、红绿灯。

Agent 面对的是数字世界:

代码库、浏览器、企业软件、邮件、客户系统、财务工具、公司自己的工作流程。

Patronus 目前列出的模拟领域已经包括软件开发、客户服务、产品应用和金融,训练能力包括深度研究、多轮对话、长期任务和记忆。

公司希望能支持持续数天甚至数周的长流程 Agent 任务。 

如果一个 Agent 未来真的在公司里工作一年,它需要的也不只是“聪明”,还得理解这个数字世界怎么运转。

这家公司三年前还在给 AI “改卷子”

回头看 Patronus 的产品变化,其实挺有意思。

2023 年,它给 AI “改卷子”:

问 AI 一个问题,然后看答案,检查幻觉,检查安全,给分。

2024 年以后,它开始看 Agent 的完整工作记录:

任务有没有完成、工具用对了吗、执行顺序对吗、有没有走错路径、多 Agent 之间的任务分配有没有问题。

Patronus 做了 Percival,一个专门检查 Agent 工作轨迹的 AI 调试工具,可以识别 20 多类失败问题。

它披露的 Nova AI 案例中,团队通过自动提示词建议在一周内修复三个 Agent 故障,并在实验中将 Agent 准确率提高 60%。 

再到 2025、2026 年,他们发现,只检查已经发生的错误还是不够。

所以干脆自己造环境,让 Agent 主动进去犯错。

公司也已经把自己的定位从开始的“ AI 届的穆迪”,改成:模拟世界的智能。

根据 Patronus 的披露,其数字世界数据资产超过 100 万份,模拟环境在真实产品 UI 和功能上的覆盖度达到 85%,有超过 5000 名来自软件、学术和金融等领域的专家参与相关数据和环境工作。

公司称,在长期任务测试中,其模拟训练带来 30%—40%的模型能力提升。 

2026 年 6 月,Patronus 完成 5000 万美元 B 轮融资,过去一年收入增长 15 倍。

它的投资人声称:

几乎所有前沿 AI 实验室以及大量新 AI 公司都已经成为 Patronus 的客户,市场对这种模拟环境的需求接近“供不应求”。 

Agent 真要进公司,一定需要先“实习和试用”

我之前写 Aaru 的时候,讲过一个很有意思的思路。

现实里做消费者调查太慢,那就先造一群 AI 消费者,让他们先模拟购买、讨论和改变想法。

Aaru:三个少年,用 AI 模拟消费者,怎么做出 10 亿美元公司

Patronus 走的是另一条路线:

企业不敢直接把真实后台交给 Agent,那就先造一个假的数字世界。

假客户、假订单、假网站、假接口、假公司规则,然后让 Agent 先进去干活,把能犯的错多犯几遍。

而且随着 Agent 越来越聪明,这个“假公司”也开始主动给它制造新的麻烦。

如果未来真的要让 Agent 查客户、操作系统、写代码、做金融分析,光让它读更多互联网文字可能不够。

Agent 也需要“有工作经验”。

Patronus 想做的,就是给 Agent 造出这段工作经历。

以上,祝你今天开心。

【声明】内容源于网络
0
0
Fun AI Everyday
每天分享一个好玩的AI应用
内容 28
粉丝 0
Fun AI Everyday 每天分享一个好玩的AI应用
总阅读182
粉丝0
内容28