大数跨境

同样的准确率,一个宁可错杀,一个宁可放过

同样的准确率,一个宁可错杀,一个宁可放过 AI驱动数字化转型
2026-10-04
8
导读:幻觉检测这道任务上,Jev和Opus 5打了个平手,都是87%的准确率。
幻觉检测这道任务上,Jev和Opus 5打了个平手,都是87%的准确率。真正拉开的是账单,Jev做一千次判断花0.05美元,Opus 5花14.30美元,差出将近三百倍。
分数一模一样,价格差出两个数量级。这个组合摆出来,人很容易直接得出一个结论,那就选便宜的。
把两个模型各自判错的题摊开看,出来的东西比分数和价格都更有意思。同样87%的底下,两个模型错的不是同一批题。
一个把大批本来没问题的判成了有问题,一个放过了大批真有问题的。分数一样,错法正好反过来。
选型这件事上,最容易被跳过的就是这一层。
准确率这个指标有个先天缺陷,它把所有错误一视同仁。把对的判成错的,和把错的判成对的,扣分一模一样,至于错朝哪个方向,它一概不管。可落到业务上,两种错误的分量常常差出几十倍。
两种错法,你受得起哪一种。

错法的来源:训练目标的差异
01
这道差别有来处,就在两个模型的训练目标里。
先把接口说清楚。Jev只有三种问法,从给定选项里挑一个,按给定等级打分,或者返回一个命题为真的概率。它读入一份状态,可以是客户邮件、订单字段、规则摘要,也可以是之前的处理记录,然后对每个问题分别给出答案和概率分布。
生成式模型做判断的时候,动作是写一段理由再给结论。它的默认姿态是说得通就认,碰上模棱两可的,会顺着上下文补一个解释,补完就判成立。这个习惯带来大量假阳性。
Jev没有这个动作。它只能在给定集合里挑,挑的时候依据的是概率分布,不够确定就往回收。这个习惯带来大量假阴性。
一个往外扩,一个往里缩。准确率可以同时停在87%,可它们压根不在同一条决策边界上。
翻到具体数字会更直观。一份独立基准把两个模型放在同样任务上比,Jev只高出1.4个百分点。但失败清单摊开,对照大模型交出17个假阳性、0个假阴性,Jev反过来。
分数只差1.4个点,错的方向却完全相反。对一个要自动审批或者自动阻断的系统来说,后者才是真正要拿去做决策的数。

不同业务,不同的错误代价
02
拿风控来说。一笔可疑交易被放过去,损失就是那笔钱的数额,明码标价,当天入账。反过来,一笔正常交易被拦下来,损失是一通客服电话、一次客户流失,短期账上看不见,要几个月后才发作。两种错误的计价单位都不一样,怎么可能用同一个准确率去评价它们。
内容审核又反过来。漏掉一条违规内容,平台挨的可能是监管的板子,一次就疼;误删一条正常内容,丢的是创作者的信任,是慢性病。方向不同,业务对阈值该往哪拧的偏好就不同。
阈值才是那颗能拧的旋钮。

阈值:交换比由业务决定,不是模型
03
同一个模型,判定的松紧是可以调的。有团队在幻觉检测上试了五档阈值,从0.50一路提到0.95。阈值往上抬,模型只在很有把握时才判成立,假阳性掉下去,假阴性涨上来;往下压,两边对调。
这条曲线是所有分类器共有的,不是Jev的独门功夫。区别在于Jev递给你一个能拿去用的概率,生成式模型递过来的多半是一句“我比较确定”。
渗透测试那篇论文有一句话说得很直白:
一个系统能自动到什么程度,直接取决于它的校准质量。能不能自动,能自动多少,都挂在这个数上。
五档阈值跑下来,真正留下来的东西是那条曲线本身,不是某一档的分数。它告诉你,要把假阳性压到什么程度,得拿多少假阴性去换。这个交换比属于业务,不属于模型,模型只能把曲线递给你,选哪一点落在上面,得你自己拿主意。

现存的问题:旋钮有了,刻度还模糊
04
麻烦也正是在这里。
官方把87%摆出来的时候,没有同时给出ECE,也没有给出可靠性曲线。第三方社群里已经有人把这句疑问直接摆到台面上,一个靠校准吃饭的模型,发布时不给校准曲线。
独立测评给出的数字互相打架。一套社区基准测出官方Jev的预期校准误差是0.113,另一家在662条提示上测到的是0.0588。两套题不一样,不能直接比,但足够说明一件事,校准不是能脱离题目分布去谈的指标。
更尖锐的来自复现。有人照公开描述重建了RLCD训练流程,模型在留出测试集上准确率涨了6个点,校准一动没动,ECE从0.022走到0.023。准确率涨和校准涨是两件事,这个实验把它们分得很干净。
旋钮还在,刻度是模糊的。
对照那一侧还摇。
同一道题让大模型评审连跑十次,不同次给出的判断彼此对不上,分歧率在0.62到0.84之间。这不是判错,是改判。你连它到底属于错杀还是放过都归纳不出来,更谈不上设阈值。
Jev这一侧的另一项卖点恰恰在稳定性上。有开源评测专门测了同一条输入在多次采样下概率的一致性,还画了自动决策曲线。稳定的错,比来回摇摆的对,在工程上好处理得多,因为稳定的错你至少能量出来。
这件事还有个更现实的用处。概率稳定,你才敢设一道闸门,比如低于0.7的一律转人工。闸门能立住的前提是,0.7这个数今天和明天指的是同一件事。概率天天漂,闸门就是摆设,设了也没人信。

对抗场景:错杀和放过的代价同时放大
05
有研究者专门测了决策模型的提示注入,论文名字起得很直白,叫决策劫持。邮件正文或者网页里夹带的一段恶意文字,能直接改写Jev给各个动作分配出去的概率。换到新一批验证调用上,被攻下来的比例从1.8%抬到3.5%。还有一处更值得盯,攻击者想要那个动作,模型给它打出的平均最高分整整翻了一倍。
模型不会输出一个格式外的命令,它依然在你给的选项里选。它只是把那个动作的概率抬了上去。固定格式挡住了越界,挡不住偏移。
所以结论只有一条,外部内容一律当不可信数据处理,执行前必须有独立的权限校验,概率不能当放行凭证。
选型的正确步骤:先分清你怕什么
06
落到自己系统上,先要做的跟选模型无关,是分清你怕什么。
风控怕放过,审核怕错杀,这两类场景该设的阈值方向是相反的。拿一个统一的分数卡住所有动作,从一开始就错了。
再往下,是把错误成本分开算。误放行、误阻断、人工复核,三笔账各算各的,再分别定阈值。这一步做完,你才知道那个概率该拧到哪一档。
我这套系统里做过一件类似的事,高频的简单判断下沉到本地免费模型,复杂推理才上云。回头看,那条路只能算静态路由,按任务类型提前写死,写完就不再看实际输入。同样一句客户消息,有的三秒能判死,有的要翻三张表才敢下结论,规则给它们安排的却是同一条路。动态门控不一样,它按每一次的实际输入分,代价是多一次判断调用。这笔账划不划算,取决于你的输入有多参差不齐。
还有一件,是看清它自己的边界。Choice能列出的选项最多255个,图像目前不处理,官方那批评测跑的是自家业务自动化工作流,不是MMLU这类公开基准。最后一条尤其要记住,它解释了为什么官方数字和独立基准常常对不上。

关于成本:别把调用量下降直接当成账单折扣
07
至于成本,那批传播最广的数字出自REFLEX,一百项固定任务成功率95%,强模型调用量比全程用强模型少72.7%。后面还跟着一句容易被截掉的话,三种回退策略下降幅落在66%到72%之间,72.7%是其中最好的一档。
它讲的是调用量,不是账单。Jev自己有调用费用,网络往返有延迟,判错了要重试,拿不准要升级,人工复核也坐在里面。把72.7%读成账单打三折,是这批传播里最常见的一次换算错误。
放到智能体里,两种错法的价码更清楚。判断该不该把这一步交给强模型,判成该交而其实不必,代价是多花一次强模型的钱,纯粹的浪费;判成不必交而其实需要,代价是这一步直接答错,后面的步骤跟着一路歪下去。前者是浪费,后者是事故。REFLEX那套结构之所以要分两层,就是为了让这两类错误能被分开定价,而不是混在一个准确率里。

上线前的低成本工序和最后边界
08
上线之前还有一道成本极低的工序,先跑影子模式。模型只给建议不执行,把预测和真实处理结果对一对,跑够样本再决定要不要打开自动执行。这一步挡掉的是绝大多数上线才发现概率不可信的事故,而它的成本只是多等一段时间。
还有一条边界常被略过。要是你手上那个强模型自己就能把动作路由判得足够准,中间再垫一层决策模型,能捞回来的收益会薄得相当快。这条决定了你要不要上这套东西,比分数重要。
六个克隆在两周内冒出来,说明做一套这个东西的技术门槛并不高。真要说壁垒,多半落在工程侧和评测侧,不在权重里。对用的人来说这不算坏事,克隆多了,能拿到的独立基准也多了,87%这个数字到底意味着什么,会越来越清楚。
分数是个容易让人松懈的东西。两个模型都写着87%,你会以为它们在做同一件事。
摊开看才知道,一个宁可多抓一批,一个宁可少判一个。你要选的不是那个分数,是那个方向。

【声明】内容源于网络
0
0
AI驱动数字化转型
专注AI,促进智造行业数据衍生,服务智能制造企业的数字化、智能化,聚焦大模型私域部署、大模型微调、数据清洗、AI模型训练、私域知识库及agent技术延展等。行业智能,落地为先。
内容 1100
粉丝 1
AI驱动数字化转型 专注AI,促进智造行业数据衍生,服务智能制造企业的数字化、智能化,聚焦大模型私域部署、大模型微调、数据清洗、AI模型训练、私域知识库及agent技术延展等。行业智能,落地为先。
总阅读12.5k
粉丝1
内容1.1k