让LLM回答是或不是,就像雇五星大厨泡方便面。Jev的出现是为了解决这个浪费——一个专门做决策的System One模型,不生成文本,只返回类型化答案。但它闭源,API要花钱。
JEV:一个只会说「选A、打3分、是」的AI模型爆了,48小时炸出14个项目
Jev 刚火两天,开源复现就来了:一个9B,一个0.5B
在此之前笔者已经给出一些替代,而这其中Laya的呼声很高。
一个多语言、非自回归的System 1决策引擎。项目由Convai Innovations开发,Apache 2.0许可。单次前向传播33毫秒,支持100多种语言,运行内存不到1GB,Hugging Face上免费下载,能跑在笔记本甚至手机上。
官方给出了与Jev的对比:T4 GPU上单问题延迟32.8ms,而Jev的第三方基准是236-276ms p50,差距7倍左右。在typed-decisions基准上,微调后的Laya达到0.766准确率,超过Jev的0.727。AG News、DAIR Emotion也领先。成本更不用比——Jev按API收费($0.042/百万token),Laya自托管,电费自理。
但别急着换。项目的“Honest limits”写得很清楚:
- 基础checkpoint零样本接近随机
:在typed-decisions上只有0.36,随机基线是0.318,多数类基线0.461。所有性能提升来自微调。Laya是“可特化的底座”,不是开箱即用的零样本引擎。 - 上下文窗口只有512-1024 token
:长文档或复杂状态装不下。 - 高基数选项会崩
:Banking77的77个标签,默认token预算下每标签只有3-4 token,准确率0.425 vs Jev的0.870。Jev支持255个选项,Laya需要调参或分层。 - 英语和multilingual模型各有软肋
:英语模型在非拉丁语系上直接躺平——Khmer语准确率0.000,置信度却高达0.952。所以必须用内置Router做脚本检测,否则它的自信反而害人。
有网友指出,Jev的场景大多I/O bound,分类速度本身不是瓶颈,喂决策的速度才是。也有网友质疑6-7x是延迟还是吞吐,并发下差距可能缩小。
所以Laya的价值不是“干掉Jev”,而是提供了一个可自由修改、本地运行、成本可忽略的决策层。适合场景:固定工作流中的意图分类、邮件分诊、内容审核、工具调用安全门禁。不适合:开放式任务、超长上下文、零样本泛化。
如果你已经在用Jev,可以留着。如果你想折腾,Laya的微调notebook在Kaggle免费GPU上跑4-5小时,能针对自己的数据定制一个决策模型。这种自由度,是闭源API给不了的。
项目地址:https://github.com/NandhaKishorM/laya
关注公众号回复“进群”入群讨论

