今天来聊一家很有意思的 AI 公司:Patronus,https://www.patronus.ai/
假设你做了一个 AI 客服 Agent。
它不只是回答问题,它还可以查订单、找客户资料、判断退款规则,然后直接操作后台退款。
产品演示的时候,一切正常:
你问:“我的订单为什么还没到?”它查物流,告诉你原因。
再问:“我不想要了,帮我退款”,它找到订单,调用退款接口,完成。
看起来,这个数字客服已经可以上班了,是吗?
但你敢直接把后台账号交给它吗?
Patronus AI 想了一个很直接的办法:先给 Agent 造一个假的工作环境。
假的网站,假的客户后台,假的订单,假的退款接口。
让 AI Agent 先进去开始“试用期”:查客户、填表、调用工具、处理退款。
Agent 可以不断犯错,反正不是真的钱,也不是真的客户。
系统把它每一步怎么做、在哪里出错全部记录下来,再给结果打分。
做对,奖励;做错,惩罚,然后继续练。
Patronus 甚至希望这些模拟环境可以根据 Agent 当前的能力,自动生成更难的新任务。
也就是 Patronus 做的事,公司 2023 年成立,两位创始人都来自 Meta AI。
2026 年 6 月,Patronus 完成 5000 万美元 B 轮融资,累计融资达到 7000 万美元。
过去一年,公司收入增长了 15 倍。
Patronus 给自己现在做的东西起了一个很专业的名字:
Digital World Model,数字世界模型。
但我觉得我们可以先把它就理解成:
AI Agent 正式上岗之前,先给它造一个“假公司”进去实习。
以前测 AI,只需要问它 1000 道题
Patronus 一开始不是做“假公司”的,2023 年公司成立时,它做的是 AI 测评。
两位创始人 Anand Kannappan 和 Rebecca Qian 在芝加哥大学读计算机时就认识。
后来 Rebecca 在 Meta AI 的 FAIR 团队做自然语言和 AI 对齐研究;Anand 在 Meta Reality Labs 做因果推断和实验系统。
2022 年 11 月,ChatGPT 发布。
Anand 看到消息以后,5 分钟内就发给了 Rebecca。
两个人都觉得,这东西一定会进入企业。
但很快,Anand 听说自己哥哥所在的投行 Piper Sandler 直接禁止员工在公司内部使用 OpenAI。
他很意外,后来他们问了越来越多企业,发现大家的反应差不多。
想用,但不敢。
原因很简单:AI 会胡说、会泄露敏感信息;同样的问题,今天回答对,明天可能回答错。
所以 Patronus 最早给自己的定位,有点像:
AI 时代的穆迪(金融产品评级机构)。
一家公司准备上线 AI 产品,先交给 Patronus 检查。
有没有幻觉?回答是否正确?会不会输出公司敏感信息?有没有安全问题?
Patronus 自动出题、攻击模型、给结果打分,再比较不同模型的表现。
公司在 2023 年发布 FinanceBench,用公开财务文件做金融问答测试;随后又做了企业敏感信息测试、版权检测和幻觉检测模型 Lynx。
2024 年 5 月,公司完成 1700 万美元 A 轮融资。
这种方式很容易理解,比如公司做了一个 AI 财务助手,准备 1 万个问题。
“这家公司去年收入是多少?”
“毛利率同比变化多少?”
“根据年报,公司的长期债务是多少?”
让 AI 回答,然后逐个打分,正确率 95%,很好,继续优化,做到 98%,上线。
问题是,后来 AI 开始从“回答问题”变成 Agent。
以前 AI 只需要说,现在它开始动手了。
原来这套测试方法突然就不够用了。
一个 Agent 出错,可能要到第 27 步才看出来
还是开头那个退款 Agent 的场景。
客户说:“我上周买了一双鞋,鞋码不对,帮我退款。”
AI 要做什么?先找到客户,查订单,确认是哪双鞋。
然后检查商品状态,查看退款政策,判断有没有超过退款期限,检查商品是否已经发货。
再选择退款原因,调用退款接口,记录处理结果,最后再回复客户。
这里可能有十几个动作,即使每一个动作都没问题,最后也可能错。
比如:
客户有两笔都是 99 美元的订单,AI 找错了一笔。
又比如退款政策写着:“已发货商品不能直接退款,需要先创建退货单。”
AI 查到了政策,也理解了,但执行时还是直接调用了退款接口。
还有一种更麻烦,AI 调用退款接口,系统返回:错误。AI 看了一眼,觉得可能只是系统延迟。
于是告诉客户:“退款已经完成。”
最终回复看起来很礼貌,但钱根本没退。
Patronus 后来在 Agent 测评研究里发现,很多关键错误只有在交互过程中才会出现:
错误使用工具、丢失前文信息、执行顺序不对。
只检查最后一句回答,会把这些问题全部藏起来。

他们还做过一个叫 TRAIL 的测试。
简单来说,就是给 AI 一段很长的 Agent 工作记录,让它判断这个 Agent 到底哪里出了问题。
里面会出现调用错工具、任务安排错误、上下文丢失、超时等 20 多类问题。
结果,当时测试的先进模型表现都很差。
Gemini 2.5 Pro 的综合准确率只有 11%,OpenAI o3 是 9.2%,Claude 3.7 Sonnet 是 4.7%。
注意,这里测试的甚至还不是“让 Agent 自己完成工作”,只是让 AI 看工作记录,找错误,就已经这么难了。
于是 Patronus 慢慢意识到:
Agent 不能只做考试题,得把它放进一个环境里,看它怎么干活。
于是,他们开始复制网站和企业后台
Patronus 现在做的模拟环境,可以复制网站和内部系统的工作逻辑,让 Agent 在里面调用工具、操作流程和完成任务。
Patronus 使用 Digital World Models 创建网站和内部系统的模拟环境,让 Agent 在里面接受压力测试和强化学习。
这里的“复制”,不一定是把一家公司的整个系统原封不动克隆一次。
核心是把 Agent 工作时会遇到的东西做出来。
有哪些工具,每个工具能做什么,输入什么参数,系统有什么规则,一次操作以后,系统状态怎么变化。
举个简单的例子,一个模拟退款后台里,可以有:
查询客户、查询订单、查看支付记录、创建退款、取消退款、创建工单、给客户发邮件。
然后再写规则:
只有支付成功的订单才能退款、同一笔订单只能退款一次、超过 30 天不能自动退款、已经发货的订单需要先走退货流程、5000 美元以上退款需要人工审核。
这时候 Agent 进来,系统给它一个任务:
“客户要求退掉上周购买的一双鞋。”
Agent 开始工作,它调用:
查询客户,系统返回一个假的客户;查询订单,返回三笔假订单。
AI 选择一笔,查支付,再调退款。
每做一步,模拟环境都要像一个真实系统一样给出反馈。
订单存在、或者不存在、权限不够、参数错误、银行拒绝、接口超时、退款成功。
然后 Agent 根据新的结果,决定下一步。
这已经不是“问 Agent 一个问题”,它更像是在看一个新员工操作公司后台。
更关键的是,“假公司”还会自己出新题
普通测试还有一个问题:题是固定的。比如你给退款 Agent 准备 1000 个案例。
第一题:订单超过 30 天;第二题:订单已经发货;第三题:客户买错尺码。
Agent 不断训练,1000 道题越来越熟,最后正确率 99%。
看起来很厉害,但真实客户不会按照题库来。可能出现:
客户有两笔同金额订单,其中一笔已经部分退款;支付信用卡已经注销;
商品发货了,但物流显示丢失;客户同时要求修改地址和退款。
退款接口第一次超时,第二次返回重复请求等等。
这时候固定题库很容易被“刷完”。
Patronus 在 2025 年底提出 Generative Simulators,也就是生成式模拟环境。
它不再只准备一批固定任务,系统会同时生成:
任务、环境变化、评分规则。
Patronus 公开的架构里,首先设定难度和基本条件。
任务生成模块开始出题,简单任务给少量工具,复杂任务加入更多工具。
然后根据 Agent 当前能力筛选题目。
Agent 做,产生完整操作轨迹,最后用奖励函数检查结果。
假设 Agent 已经特别会处理普通退款,系统就没必要继续让它做:“客户买错鞋码,请退款。”
可以开始不断增加麻烦。
这次客户有五笔订单、下次退款金额超过权限、再下一次接口中途报错。
或者把浏览器工具加进来,让 Agent 不只调用 API,还需要打开网页检查页面显示。
Patronus 官方甚至举过一个例子:
在类似软件开发测试的任务里,加上浏览器工具以后,可以要求 Agent 一边修改前端代码,一边真的打开网页看页面,再根据视觉结果继续调试。
这里的逻辑特别像游戏。
你已经会打第一关,系统不给你继续刷一级小怪,开始加 Boss。
为什么 AI Agent 特别需要这种“实习经历”?
Patronus 很喜欢拿自动驾驶举例。
自动驾驶汽车不可能为了测试一次极端情况,真的在路上等一个孩子突然追着球跑出来,也不可能天天等暴雪、沙尘暴和罕见交通事故。
所以自动驾驶公司会做模拟世界,让车在假的道路里反复遇到极端情况。
Patronus 的判断也是一样的:AI Agent 也需要自己的模拟器。
只不过自动驾驶面对的是现实世界,道路、汽车、行人、红绿灯。
Agent 面对的是数字世界:
代码库、浏览器、企业软件、邮件、客户系统、财务工具、公司自己的工作流程。
Patronus 目前列出的模拟领域已经包括软件开发、客户服务、产品应用和金融,训练能力包括深度研究、多轮对话、长期任务和记忆。
公司希望能支持持续数天甚至数周的长流程 Agent 任务。
如果一个 Agent 未来真的在公司里工作一年,它需要的也不只是“聪明”,还得理解这个数字世界怎么运转。
这家公司三年前还在给 AI “改卷子”
回头看 Patronus 的产品变化,其实挺有意思。
2023 年,它给 AI “改卷子”:
问 AI 一个问题,然后看答案,检查幻觉,检查安全,给分。
2024 年以后,它开始看 Agent 的完整工作记录:
任务有没有完成、工具用对了吗、执行顺序对吗、有没有走错路径、多 Agent 之间的任务分配有没有问题。
Patronus 做了 Percival,一个专门检查 Agent 工作轨迹的 AI 调试工具,可以识别 20 多类失败问题。
它披露的 Nova AI 案例中,团队通过自动提示词建议在一周内修复三个 Agent 故障,并在实验中将 Agent 准确率提高 60%。
再到 2025、2026 年,他们发现,只检查已经发生的错误还是不够。
所以干脆自己造环境,让 Agent 主动进去犯错。
公司也已经把自己的定位从开始的“ AI 届的穆迪”,改成:模拟世界的智能。
根据 Patronus 的披露,其数字世界数据资产超过 100 万份,模拟环境在真实产品 UI 和功能上的覆盖度达到 85%,有超过 5000 名来自软件、学术和金融等领域的专家参与相关数据和环境工作。
公司称,在长期任务测试中,其模拟训练带来 30%—40%的模型能力提升。
2026 年 6 月,Patronus 完成 5000 万美元 B 轮融资,过去一年收入增长 15 倍。
它的投资人声称:
几乎所有前沿 AI 实验室以及大量新 AI 公司都已经成为 Patronus 的客户,市场对这种模拟环境的需求接近“供不应求”。
Agent 真要进公司,一定需要先“实习和试用”
我之前写 Aaru 的时候,讲过一个很有意思的思路。
现实里做消费者调查太慢,那就先造一群 AI 消费者,让他们先模拟购买、讨论和改变想法。
Aaru:三个少年,用 AI 模拟消费者,怎么做出 10 亿美元公司
Patronus 走的是另一条路线:
企业不敢直接把真实后台交给 Agent,那就先造一个假的数字世界。
假客户、假订单、假网站、假接口、假公司规则,然后让 Agent 先进去干活,把能犯的错多犯几遍。
而且随着 Agent 越来越聪明,这个“假公司”也开始主动给它制造新的麻烦。
如果未来真的要让 Agent 查客户、操作系统、写代码、做金融分析,光让它读更多互联网文字可能不够。
Agent 也需要“有工作经验”。
Patronus 想做的,就是给 Agent 造出这段工作经历。
以上,祝你今天开心。

