大数跨境

我复刻并开源了全网爆火的 Jev(多模态版)

我复刻并开源了全网爆火的 Jev(多模态版) 独立开发
2026-09-18
6
导读:我复刻并开源了全网爆火的 Jev(多模态版)

我复刻并开源了全网爆火的 Jev(多模态版)

近日,由前 OpenAI 员工 Diogo Almeida 创立的公司推出了全新模型 Jev,迅速成为热议焦点。

Jev 是一款具备低成本、低延迟、高并发特性的决策模型,能够接收文本与候选项输入,并快速输出决策结果。

随着 Jev 的发布,全网掀起了复刻热潮,各类 OpenJev 项目相继涌现。笔者也进行了一项视觉化实验:Jev Visual,使模型能够基于图像进行选择、判断与打分,并支持本地运行。

项目地址如下,欢迎体验与 Star:

https://github.com/hr98w/jev-visual

什么是 Jev

Jev 是由 TypeSafe 推出的决策模型。用户只需提供当前状态与问题,模型即可直接返回可供程序调用的结果。其核心能力主要包含以下三种:

• Choice:做选择。 例如判断下一步应点击哪个按钮。
• Score:打分。 依据预设等级,评估线索的价值程度。
• Noul:判断真假。 以 0~1 的数值表示命题成立的概率,例如“任务已完成”。

上述三类任务可在单次请求中并行处理,结果直接交付代码执行。Jev 的优势在于实现了低成本、低延迟且高并发的 LLM 决策,其输出不再是冗长的 Token 序列,而是简洁的选项(如 ABC)或二元判断(Yes/No)。

发布后,围绕 Jev 的讨论与应用实验迅速增加,涵盖了 Browser Use、AI 交易等热门方向。

jev-trader 尝试将其应用于链上交易:读取订单簿数据,决策买入或卖出,并由程序执行挂单。尽管高频交易最具话题性,但其实际可靠性尚待验证。

Browser Use 推出的 jev-ultrafast 项目,利用 Jev 选择下一步操作及页面元素。演示显示,一次包含文本输入与页面等待的 Google Flights 航班搜索耗时约 7.1 秒。

fast-jev-compaction 获得了 Jev 开发团队的认可,该项目将 Jev 的分类器引入 Coding Agent 的压缩(compaction)环节。


然而,目前的 Jev 仅支持文本与结构化状态输入,尚无法直接处理图像。 即便是官方展示的 Doom 游戏演示,输入模型的也是游戏状态数据而非画面。

那么,能否构建一个支持视觉的版本?

Jev 发布不久,社区便出现了OpenJev 等开源尝试:利用现有模型直接读取候选答案分数,对同一上下文仅计算一次,供多个问题复用,从而省去逐字生成答案的过程。

笔者借鉴上述思路,替换为支持视觉的 Qwen3.5-0.8B 模型,并利用 MLX 在 Mac 上运行。 图片与公共上下文预先计算一次,随后批量对不同问题的选项进行打分,最终由代码组装结果。

以下为两个 Demo 展示其功能:

AI 分拣工厂: 识别传送带截图中的物品,并选择对应的分拣通道。

打砖块: 分析游戏截图,判断球体所在区域编号,再由程序控制挡板移动。此为简化版的视觉分类玩法,目前尚未能稳定通关。


关于复刻原理的说明与免责:本项目仅在推理层复现了 Jev 的形式,其效率不及成熟推理框架,也非 Jev 的官方实现原理,但作为 inference 领域的入门实践仍具参考价值。


代码、运行方法及 Demo 均已开源,感兴趣的用户可在 Mac 上尝试,也欢迎大家 Star:

https://github.com/hr98w/jev-visual

【声明】内容源于网络
0
0
独立开发
技术变现,实现被动收入,SEO优化技巧,流量获取与变现,独立开发指南,网站搭建,niche站点,独立站,affiliate,广告,订阅
内容 93
粉丝 1
独立开发 技术变现,实现被动收入,SEO优化技巧,流量获取与变现,独立开发指南,网站搭建,niche站点,独立站,affiliate,广告,订阅
总阅读14.4k
粉丝1
内容93