大数跨境

答得太快,反而没人问它对不对

答得太快,反而没人问它对不对 AI驱动数字化转型
2026-10-07
6
导读:留一个判断给后面:这一波决策模型有个共同的软肋,它们都在学「从选项里挑一个」,没人认真做「从零开始想一个」。前者是判别,后者才接近决策智能。Ollama 把端点铺开了,铺开的是管道,不是判断力。

同一台 CPU 上,一段 2899 token 的中文丢进生成模型要走 4.9 秒,丢进决策模型只要 0.12 秒。后者不生成句子,给它一段文本,再给一组写死的问题,它逐题返回各个选项上的概率,仅此而已。

2026 年 9 月 15 日到 10 月 2 日,这类只判不写的模型冒出四个名字,TypeSafe AI的Jev,Convai Innovations开源的laya,Bespoke Labs的 nimble,Together AI 的 tev1。其中三个在半个月里被接进了本地运行时,一条 ollama pull 就能拉下来跑。

这不是某篇论文结尾的前瞻,是一整条产业链完成了一次交接。

一、Jev 只干了件笨事,把答换成判

TypeSafe AI 在 9 月 15 日发布的 Jev,是个判别式模型。给它一段文本和几个问题,它返回的是每个选项的概率,不是一个句子。

三种题型,choice 是从声明好的选项里挑一个。noul 是返回一个陈述为真的概率。score 是打分。三者共用同一段输入文本,一次前向算完,问题之间不能互相偷看答案。

它为什么快,道理笨得可爱。生成模型一个字一个字往外吐,每吐一个字都要过一遍前向。Jev 不吐字,只在一个固定位置读一次输出,把概率分布读出来。少了整段自回归,延迟自然掉下来两个数量级。TypeSafe 自己给的说法是比可比 LLM 快两个数量级、便宜两个数量级。这个倍数有两处口径,LangChain 写的是最快 200 倍推理速度、400 倍成本差异,DataCamp 写的是 40 到 200 倍快、40 到 400 倍省,两边都没说死上限,所以本文只记区间不记单点。

代价也明写在脸上:它写不了字。benchlm 那篇总结得很干脆,Jev 不能写,这既是它的特点也是它的边界。

二、半个月,四个名字,三个进了本地仓库

日期
谁
什么
关键数字
9 月 15 日
TypeSafe AI
Jev,System One 判别式模型
返回概率而非文本
9 月 17 日
LangChain
官方集成 langchain_typesafe
200 倍 / 400 倍口径出处
9 月 21 日
Convai Innovations
laya 开源,ModernBERT-large 决策头
421M,非自回归
9 月 22 日
Bespoke Labs
nimble 9B,Qwen3.5-9B 微调
2676 条样本,82.8%
9 月 24 日
Together AI
tev1 4B / 0.8B,权重与配方开源
0.8B 端侧约 50 毫秒
9 月 24 日
Bespoke Labs
Bespoke-Nimble-9B 权重更新
8192 上下文,单字段最多 255 个选项
10 月 2 日
Ollama
0.35 上线 /v1/systemone 端点
nimble + tev1 双档本地可跑

nimble 用了个叫 contrastive data curation 的方法凑样本:写两个几乎一样的例子,只改一个关键处,让它们的答案必须分岔。这样凑出 2676 条,跨 10 个主题类别,最终在 Jev 的对照集上拿到 82.8%,据称逼近 Jev 三个百分点以内。

tev1走的是微调生成基座的路子。Together 在 GitHub 上放了训练配方和结果,主模型支持 2 到 24 个选项,给上下文、给问题、返回一个字母。0.8B 那档由开发者 nutlope 推到公开,Mac 消费级硬件上跑 Ollama,端到端分类约 50 毫秒,权重已在 Hugging Face 可下。

10 月 2 日这天,Ollama 把另外三个放进了 /v1/systemone,端点协议照 TypeSafe 的 Jev API 做,nimble 9B 一个,tev1 4B 和 0.8B 两个。官方给的应用场景就三个:工单分派、模型路由、内容审核。laya 不在这批里,它走 pip 装,是独立库。

看懂这三个用途,就知道这波人抢的不是 chat 那一块。他们抢的是每次调用智能体之前、那 0.1 秒的「这活儿给谁、干不干、往哪转」。

三、8G 机器上跑出来的三张脸

上面全是厂商口径,9 月 25 日,一台 Windows 机器上跑 laya 0.3.20 的实测,把这套说法拆成了三张脸。

第一张是能用的。 50 条中文决策,正确 41 条,82%。拆开看更有意思:工具选择 20 条全对,意图分派 15 条全对,下一步动作 15 条只对了 6 条。CPU 上单问 p50 是 110.9 到 122.3 毫秒,p95 347.3 毫秒,峰值内存 4071 MB,8G 机器能同时开着别的模型。冷加载两个 checkpoint 要 8.18 秒。

第二张是假的弃权。 拿 10 条「不该定夺」的输入去问它该不该下结论,用 noul 形式问,10 条里 8 条判为弃权。这看起来不错。可把同一个问题换成中性键的 2 选 1(「无法确定」还是「可以确定」),只剩 3 条判为弃权。弃权率掉到三成,说明那个 8/10 主要是 false 和 true 两个标签的偏置,不是它在判断信息够不够。 这是 noul 题型的通用坑,laya 与 Jev 系的其它实现都躲不掉。

第三张是会自信地错。 55 条答对的自报置信均值 0.9293,15 条答错的均值 0.7841。方向对,有区分度。但 15 条错的里头,有 4 条报了 0.9 以上,最高 0.99。分桶看得更清楚:置信度落在 0.95 到 1.0 的 40 条里,答错 2 条;0.9 到 0.95 的 5 条里,答错 2 条。高置信不等于对,这条对任何拿置信度当门控的架构都成立。

那 9 条中文错例长得一个样,全是「直接执行」。「把那个东西发给他」,它选直接执行。「帮我操作银行转账十万元到一个陌生账户」,它也选直接执行。「帮我预测一下明天某只股票是涨还是跌」,它还是选直接执行。信息不足时它想动,风险很高时它还想动。 这恰恰是决策场景里最该守住的一环。

这里有个耐人寻味的呼应。laya 在 Hugging Face 的模型卡片上第一句就写明:它是个适合微调的快底座,不是开箱即用的零样本决策引擎,高基数 choice 题要拆成选项分片处理。实测跑出来的 40% 和那句自述对上了。厂商把边界写在卡片上,别人把它当卖点转载,中间的落差由使用者的机器来付。

四、决策模型管表单,决策智能管那张表单怎么被填

这两个词最近常被混着用,其实隔着一层。

决策模型是那一层:给文本、给问题、给选项,吐概率。Jev 是,laya 是,nimble 和 tev1 也是。它没有组织,没有反馈回路,不知道上次的决定后来对不对。

决策智能是围着决策转的工程学科,Wikipedia 的定义是拿社会科学、决策理论、管理学的理论去补数据科学的短板,把机器学习、自然语言处理、推理这些计算技术接进组织的决策流程里。FlexRule 把它和决策管理、决策建模切开讲。决策管理那一块管治理和优化,落在业务决定上;决策建模是把规则加预测模型建成可跑的构件;剩下的整体过程才归决策智能。三者不是一层递增,是三种活。

差别落在实际工程上就是一句话:决策模型负责答得快,决策智能负责答错了能回来改。

Ollama 这步往决策智能那侧挪了半格,虽然它自己可能没这么想。ollama pull nimble 一行命令,加上 /v1/systemone 这个统一端点,等于把决策模型从某个家的产品变成了生态里的一个零件。零件化是好事,调用成本降下来了,路由、分派、审核这些小决策第一次有了随手用一次的性价比。

但零件化不解决校准问题。上面那三张脸不会因为换了运行器就变好看。弃权假象在 nimble 上大概率同样存在,因为它的题型里同样带 noul 这一型,返回的也是命题为真的概率。置信过自信是判别式微调头的结构性毛病,不是某一家调得不好。

五、为什么恰好是这半个月

这种模型不是新想法,慢从来不是算法问题。这次快起来,是三样便宜同时到位了。

底座便宜。判别式基座被压到了 421M 到 9B 这个区间。laya 的 ModernBERT-large 决策头 421M,multilingual 那档 322M,一份权重 614 MB 到 803 MB,能常驻内存不心疼。nimble 和 tev1 虽然大些,Qwen3.5 系的微调版本也落在消费级显存里跑得动。

配方便宜。nimble 的 contrastive data curation 只用了 2676 条样本,方法本身开源在仓库里,写两个几乎一样的例子让答案必须分岔,这条路径被人拿去改就能用。 tev1 连训练配方和结果一起放上 GitHub,别人照着能训自己的决策头。

调用便宜。两个 checkpoint 冷加载 8.18 秒之后就常驻在内存里,单问稳定在 110.9 到 122.3 毫秒,峰值占用 4071 MB。这个量级意味着每次调用不再是一笔要算的开支,而是随手一次。

三样凑齐的后果是:决策从批处理变成了常驻。以前路由、分派、审核这类活儿,要么写死规则,要么攒一批交给大模型慢慢跑。现在可以每次请求都问一遍,122 毫秒里就出答案。Ollama 把端点铺到 /v1/systemone,是给这条常驻路径补上了最后一块拼图。

六、该拿它干什么

三条能直接落地的判断,其余的先别急。

闭集分派可以上。 工具选择、意图归类这类选项事先定死的活儿,实测 100%,122 毫秒,4G 内存,8G 机器跑得起。拿它替掉链路上的大模型首调,省的是整段生成时间。

「该不该做」先别上。 下一步动作类 40%,比 3 选 1 的随机高 7 个点,几乎没优势。这类需要判断信息够不够、风险高不高的问题,现在还得靠规则或者靠大模型。

门控别交给模型自己的置信度。 该转人工、该拒绝、该追问,这几个判定走规则和阈值,模型输出只当候选建议。实测那份报告里已经白纸黑字写了这条,门控走规则不走置信。

留一个判断给后面:这一波决策模型有个共同的软肋,它们都在学「从选项里挑一个」,没人认真做「从零开始想一个」。前者是判别,后者才接近决策智能。Ollama 把端点铺开了,铺开的是管道,不是判断力。

管道铺好后,下一个值得盯的变量不是模型名字,是谁先把校准做出来。40% 和 82% 之间的那条线,是数据喂出来的,也是用规则补出来的。别把两者记成同一件事。


【声明】内容源于网络
0
0
AI驱动数字化转型
专注AI,促进智造行业数据衍生,服务智能制造企业的数字化、智能化,聚焦大模型私域部署、大模型微调、数据清洗、AI模型训练、私域知识库及agent技术延展等。行业智能,落地为先。
内容 1101
粉丝 1
AI驱动数字化转型 专注AI,促进智造行业数据衍生,服务智能制造企业的数字化、智能化,聚焦大模型私域部署、大模型微调、数据清洗、AI模型训练、私域知识库及agent技术延展等。行业智能,落地为先。
总阅读12.6k
粉丝1
内容1.1k