大数跨境

深度|基元律动发布 NeoHorse-Jev,开源 Jev 综合评测第一

深度|基元律动发布 NeoHorse-Jev,开源 Jev 综合评测第一 Z Finance
2026-09-24
5
导读:不生成 Token 的模型,开源生态里杀出了一台「决策引擎」
你玩过贪吃蛇吗?
随着蛇身变长,活动空间被压缩,任何错误转向都可能导致游戏结束。如果让 AI 来玩,它需要每步重新审视盘面并实时决策。最近,一款 AI 模型完成了极限测试:3000 步,89 个目标,蛇身长度 95,存活到回合结束。
这意味着在数千次连续决策中,它不仅要走对当前步,还要避免把后续空间“走死”。
图 1|贪吃蛇演示:3,000 步、89 个目标、蛇身长度 95,存活到回合结束。右侧同步展示候选方向、概率与最终选择。
做出这一表现的是创业公司基元律动(tokenrhythm.ai)最新发布的轻量级模型 NeoHorse-Jev-4B。该团队由华为诺亚方舟实验室前主任王云鹤创办,研发重点为实时决策。作为仅 40 亿参数的模型,NeoHorse-Jev-4B 主打毫秒级响应,在六组基准测试中以 77.70 的综合 AVG 分数拿下开源参评模型第一。目前,模型权重、推理源码及部署示例已同步开源。

小身材大能量:用更少的参数,实现毫秒级“极速决策”

凭借更小的参数体积,NeoHorse-Jev-4B 展现出卓越的综合性能。在涵盖决策、迁移、知识与语义判断的六组基准测试中,它以 77.70 的综合 AVG 分数超越参数规模更大的 Open-Jev-9B(领先 2.03 分),位居开源模型榜首。尤其在 Nimble、VitaminC、MASSIVE 三项核心测试中,平均得分达 83.26 分,大幅提升 11.50 分,成功将语言理解力转化为可直调的“判断力”。
评测数据与说明:
  • 数据源自 9 月 24 日评测汇总,采用 vLLM 推理后端。
  • “第一”指本轮六组评测结果完整的参评开源模型,不代表各单项第一,且未覆盖市场全部开源 Jev 类模型。
在实用性上,NeoHorse-Jev-4B 让开发者能像调用传统函数一样接入决策能力。只需自然语言定义任务,模型即返回概率分布与量化分数。提供三种核心调用方式:
  • Choice(单选): 请求路由选择(如“路由给哪个下游工具?”)。
  • Noul(是非判断): 内容合规判断(如“UGC 是否合规?”)。
  • Score(打分评价): 搜索相关性打分(如“结果与意图相关度?”)。
这种设计将传统 if-else 规则封装为可直调的模型能力。与传统生成式模型不同,NeoHorse-Jev-4B 不直接生成答案,而是快速完成决策。
推理链路对比:
传统生成式模型:理解输入 → 逐 Token 生成答案 → 解析答案 → 执行。
NeoHorse-Jev-4B 路径:理解输入 → 返回候选概率 → 执行。
采用 prefill-only 推理,直接计算候选项概率,省去逐字生成延迟。在 1158 个真实文本请求测试中,32 并发下服务端平均决策耗时仅 74.3 ms,客户端完整请求耗时 273.3 ms。256 并发时,系统每秒成功处理 347.05 个请求。Jev 模型优化的是“判断”的成本与速度,使其能高频嵌入软件执行链路。

从游戏到具身智能:让每一次判断,都直接变成行动

贪吃蛇只是起点。从俄罗斯方块、Flappy Bird、四方麻将、炸弹人,到自动驾驶和机械臂仿真,NeoHorse-Jev-4B 通过“输入状态 - 比较候选 - 返回概率 - 驱动动作”的标准化接口,将毫秒级判断直接转化为业务行动。

1. 俄罗斯方块:一局消除 59 行

每个方块落下前,模型需在极短时间内评估所有落点与朝向组合。演示中,模型完成 190 次落子,消除 59 行,获得 6,500 分。
图 2|一局游戏的加速回放。右侧展示候选落点与朝向、对应概率及最终选择,结尾展示本局结果。

2. Flappy Bird:连续穿越 28 根管道

模型根据实时高度、速度及管道状态,持续输出动作策略。单次成功穿越 28 根管道,6 个回合平均通过 27.67 根。
图 3|Flappy Bird 的 12 秒回放节选。模型接收文字状态输入,右侧展示判断分数与动作。

3. 四方麻将:自摸胡牌收官

基于手牌与公共盘面,模型在候选动作中筛选概率。在 108 张牌规则的四方对局中,成功推演并以“自摸胡牌”收官。
图 4|简化 108 张规则的四方麻将演示。右侧显示候选动作概率。

4. 炸弹人竞技:动态对抗锁定胜局

面对三名对手与收缩的安全区,模型在“三个 AI + 一个规则机器人”的混战中持续决策,最终赢得比赛。
图 5|三个模型与一个规则机器人同场竞技的展示局。

5. 自动驾驶仿真:152 次决策零违规

在城镇道路仿真中,模型持续输出驾驶动作。记录 152 次决策后车辆到达终点,实现 0 次碰撞、0 次违规,展现出具备安全约束的任务执行能力。
图 6|城镇路线驾驶仿真回放。模型使用结构化状态输入。

6. 机械臂仿真:84 次决策成功开门

在 Meta-World 的 door-open-v3 任务中,模型结合多模态输入,经 84 次决策成功开门,状态显示 “SUCCESS”。值得注意的是,该模型未针对具身数据专门训练,证明了其决策接口具备跨场景迁移潜力。
图 7|Meta-World 的 door-open-v3 任务。84 次决策后,画面亮起“SUCCESS”。
这些演示表明,NeoHorse-Jev-4B 正在跨场景复用同一种调用范式,展示了模型能力从“回答问题”向“驱动动作”延伸的可能。

全量开源:让每个应用都能接入“极速判断力”

相比仅发布分数,基元律动更强调可用性。NeoHorse-Jev-4B 同步开源模型权重、推理源码与调用示例,支持 Python、命令行、HTTP 接入,兼容 vLLM、SGLang 部署,采用 Apache-2.0 协议,方便开发者直接集成与二次开发。此外,模型支持单张图片与文本联合输入,具备连接可见环境状态的能力。
目前,相关文件已上线 Hugging Face 与 ModelScope,代码与示例发布于 GitHub:
ModelScope:
https://www.modelscope.cn/collections/TokenRhythm/NeoHorse-Jev
HuggingFace:
https://huggingface.co/collections/TokenRhythm/neohorse-jev
GitHub:
https://github.com/TokenRhythm/NeoHorse
当判断能力被压缩进更小模型并以更低延迟调用,AI 进入软件与真实环境的方式将随之改变。最后,NeoHorse-Jev 还完成了一次“奔月”彩蛋,为这场技术发布增添了中秋气息。
【声明】内容源于网络
0
0
Z Finance
我们相信认知能够跨越阶层,致力于为年轻人提供高质量的科技和财经内容。
内容 920
粉丝 0
Z Finance 我们相信认知能够跨越阶层,致力于为年轻人提供高质量的科技和财经内容。
总阅读109.3k
粉丝0
内容920