大数跨境

Jev AI 的 10 类真实用例:从 Agent 路由到自动驾驶,低成本决策如何重塑软件

Jev AI 的 10 类真实用例:从 Agent 路由到自动驾驶,低成本决策如何重塑软件 AI大模型观察站
2026-10-08
6
导读:Jev AI 通过低成本、低延迟的结构化判断,为 Agent 路由、浏览器自动化、机器人控制、内容筛选、数据分类和业务分流等场景提供快速决策。本文整理 10 类真实用例,也分析其局限与工程实践。

大多数 AI 产品发布都面向所有人,Jev 则不然。它面向开发者和企业:他们的软件每天要做成千上万次小决策,而 Jev 做出每次决策的成本和速度都比 LLM 低数百倍、快数百倍。自发布以来,开发者已将它用于从广告拦截到自动驾驶模拟等各种场景。我整理了其中最有意思的例子,并将它们归为 10 类。

Jev 由 TypeSafe AI 打造。该公司由 Diogo Almeida 与 Erik Gafni、Sasha Sheng 共同创立。Almeida 此前曾在 OpenAI 从事 RLHF 和 InstructGPT 工作,这些研究帮助 ChatGPT 学会遵循指令。TypeSafe 在约两年的低调开发后,于 2026 年 9 月 15 日推出 Jev,同时宣布获得由 DCVC 领投的 4,000 万美元种子轮融资。

这个名字致敬经济学家 William Stanley Jevons。他发现,当某种东西变得更便宜时,人们对它的使用量会大幅增加。TypeSafe 将 Jev 称为 System One 模型,名称源自 Daniel Kahneman 关于快速、直觉思维的观点。



Jev 的工作方式简述

Jev 不聊天、不写文本,也不读取图像。你向它发送一个 state,也就是一些文本或 JSON,再附上几个 typed questions,它就会返回带有校准概率的结构化答案。问题分为三种类型:

  • Choice 从你提供的选项中选出一个,并为每个选项给出概率。

  • Score 按照你定义的有序量表对某项内容评分。

  • Noul 以单个概率给出是或否的答案。

所有问题都会在一次请求中并行运行,通常耗时 70 到 500 毫秒。输入费用为每百万 tokens 0.042 美元,输出免费。作为对比,Claude Opus 5 的输入费用为每百万 tokens 5 美元,输出费用为 25 美元;GPT-6 Astra 的输入和输出费用分别为 10 美元和 50 美元。

它有一些限制:

  • 上下文窗口为 32K。Jev 1.13 的总长度上限为 64K,其中 state 加上最长问题最多占 32K。

  • Choice 最多可包含 255 个选项。对于更多选项,可以先评分,再从中选择。

  • 不支持 streaming 和 tool calling。

TypeSafe 使用一种称为 RLCD 的方法训练 Jev,目标是让其概率与实际答对的频率相符。由于 Jev 只能返回你提供的选项,因此它无法编造列表之外的答案,但仍可能选错。TypeSafe 自行进行的基准测试显示,Jev 的速度是 LLM 的 193.6 倍,成本低 444.6 倍。独立测试通常得出的差距更小,但仍然很大。


1. Agent 基础设施与 Harness Engineering

这是采用率最高的类别。TypeSafe 将其称为 Harness Engineering,也就是用 Jev 快速检查,让围绕主 AI 模型构建的代码变得更智能。这包括选择模型、管理上下文、捕获错误、执行防护规则,以及对推理轨迹进行分类。Vercel 表示,在 Jev 发布后的几天内,它就成为其 AI Gateway 历史上采用速度最快的模型。

上下文管理

长时间的 AI 编码会话会堆满过时的工具输出。大多数 agent 会让 LLM 总结历史记录来解决这个问题,但这种方式速度慢,而且可能丢失准确的错误消息或文件路径等细节。

  • fast-jev-compaction 是一个 Claude Code 插件,也是发布演示中获赞最多的项目。它采用了不同方法:在压缩上下文时为每次工具调用及其结果评分,丢弃或缩短过时内容,并逐字保留其余内容。它在几天内就获得了 4,000 个 GitHub stars。一位早期用户表示,它能在约一秒内将一段接近 100 万 tokens 的 Claude 对话缩减到约 9 万 tokens。

  • jev-pruner 是一个配套插件,会在命令运行后、主模型读取输出前,精简嘈杂的 Bash 输出。

路由

模型路由是 Jev 的旗舰用途。

Vercel 将 Jev 接入 AI Gateway,并在 AI SDK 7 中推出了 evaluate 方法。这样,Jev 可以判断请求有多复杂,代码据此选择模型,再由 generateText 执行生成。

  • 开发者构建的路由器: jev-router 和 Switchboard 会为 Claude Code 与 Codex 的每一轮对话选择模型。其他项目包括选择最便宜且能力足够的模型的成本感知路由器、按语义路由 Web 请求的 Hono 路由器,以及由 Jev 回答 Choice、再由代码执行权限控制的 JevRouter。

  • 速度差异: 用户测得 Jev 的路由决策耗时约一秒,而使用结构化输出的常规 LLM 需要 4 到 14 秒。另一个项目记录到的决策耗时为 145 到 271 毫秒。

  • Skill 路由: TypeSafe 的 cookbook 会从 Nous Research 的 Hermes 目录中 182 个 skill 里,每轮最多选一个,也可以全部拒绝。jev-skill-router 插件将此能力引入 Claude Code,社区版本每次路由约需 0.001 美元。

防护规则与验证

由于每次检查的成本很低,你可以对每一条 LLM 输入、输出和工具调用都运行检查。团队可以借此发现 jailbreak、prompt injection、违反策略、数据泄露、工具调用错误和薄弱回答。

  • 筛查检索内容: Jev 在一次请求中为每段检索内容评分,代码会在这些内容到达回答模型前,删除包含隐藏指令的段落。

  • 引用检查: 一个 Choice 就能判断引文的上下文是否支持相关主张;置信度较低时,则将其交由人工审核。

  • Agent watchdog: jev-belay 和 Canny 等工具会标记缺乏证据却声称任务已完成的情况;其他工具则监控不可逆操作、偏离任务的工具调用以及卡住的循环。一项测试报告称,该方案以远低于 LLM judge 的延迟捕获了大多数攻击,同时误拦截很少。

  • 命令审批: 一项基于 153 条真实命令的概念验证报告称,决策速度提高了 8.7 倍,审批提示减少了 4.4 倍。

这些做法有一个共同模式:前序步骤生成 state,Jev 对其进行判断,代码根据判断采取行动,而主 LLM 只会看到通过筛选的内容。


2. 浏览器、电脑与手机自动化

Web 浏览 Agent

Jev 无需查看屏幕也能驱动浏览器。代码会将页面转换为带编号的可选操作列表,并附上 URL、标题、可见文本、目标和最近步骤。Jev 选出一项操作,再由普通代码执行点击。由于 Jev 不会编写文本,因此无法虚构按钮或编造 URL。只有需要输入内容时,才会由一个小型 LLM 介入。

Browser Use 以这种方式构建了 jev-ultrafast。它在 7.1 秒内完成了从苏黎世到伦敦的 Google Flights 搜索;与早期版本相比,任务中位耗时从约 9.5 秒降至 7.1 秒,浏览器调用次数也从 1,092 次减少到 101 次。其他项目包括 Jev for Chrome 和 Cline 浏览器插件。一位早期测试者表示,基于 Jev 的电脑操作速度是 GPT-6 Astra 的 5 倍左右,成本约为其千分之一。

桌面与手机控制

  • Mac 控制: 一个项目可以根据英文目标控制 Mac,每一步约需 0.0002 美元;它使用 OCR 读取屏幕,而不发送屏幕截图。

  • 语音与手势: 其他开发者构建了语音控制电脑操作,以及通过指向和说话来控制的画布。

  • 手机: Droidrun 的 mobile-jev 在一台真实 Android 手机上操作 Uber,用约 21 秒执行了 9 个动作,但在预订前停止了。JevDroid 使用 Android 无障碍树实现了类似方法。


3. 实时控制:游戏、无人机、机械臂与车辆

游戏

游戏成为最早的测试场景,因为它们需要快速、反复地做出决策。人们已将 Jev 接入 Doom、Subway Surfers、Smash Bros(与自己对战)、Super Mario Bros、Slay the Spire 2、Tetris、StarCraft、Pokémon Red 和 Jev Chess;Jev Chess 会与 Stockfish 对弈。

  • 速度: 在 Slay the Spire 2 中,Jev 约 0.7 秒就能选出行动,而大型推理模型每步耗时要长得多。

  • 成本: Doom 演示每秒约调用 10 次,TypeSafe 估算费用约为每小时 7 美元。

  • 与更大型模型协作: 在 Minecraft 中,一位测试者让 GPT-6 Astra 负责规划、Jev 负责快速操作,两者在 8 分 43 秒内击败末影龙,花费不到 1 美元。

无人机

  • 城市配送模拟: 一架 Three.js 无人机从一个停机坪起飞,穿过随机生成的城市,再降落到另一个停机坪,每次飞行约花费 0.01 美元,每次决策约耗时 200 毫秒。代码负责处理数学计算,并将高度、航向、速度、障碍物和前方最高建筑转换成简短的自然语言报告供 Jev 判断。

  • Jev Drone: 这架配备摄像头的 MuJoCo 无人机每秒运行 Jev 2.5 次。作者强调,Jev 接收的是 JSON,并不负责视觉处理。在一次运行中,基于规则的基线版本每次都会停在同一个障碍物前,而 Jev 版本则在约 47 秒内完成了全程。

  • 无人机团队: 多无人机实验室使用 Jev 做快速决策,并可在其上叠加较慢的策略层。

机械臂与车辆

  • 机械臂: 在 MuJoCo 中,Jev 和 Claude Opus 5 轮流控制模拟机械臂,由 Jev 选择每个动作、何时抓取和松开,以及何时停止。在另一项机器人对比测试中,Jev 控制循环完成任务的时间约为 GPT-6 的四分之一,API 成本约为其 1/315,但 GPT-6 少用了七个步骤。jev-askable-arm 项目控制一台模拟 Franka 机械臂,其中 Jev 每一步只选择一个基本动作,而不会直接发送原始电机命令。

  • Tesla 风格的自动驾驶: 开发者 Justin Schroeder 表示,他在不到一小时内用 Jev 重建了一个类似 Tesla Full Self Driving 的控制循环。开源成果 JevPilot 是一个 Three.js 驾驶模拟器,Jev 负责处理转弯、变道、路口和高速公路并线。在有交通时,它每秒最多决策四次;在空旷道路上则约每秒决策 1.5 次。它从代码准备好的转向和速度路径中进行选择。

  • 真实街道地图: jev_fsd 可以在真实城市道路上行驶。代码会提出最多 16 种机动方案,模拟每种方案未来三秒内的情况,并在 Jev 选择前剔除不安全方案。在路口附近,它每 250 毫秒做出一次决策。

  • 浏览器中的汽车: live-jev 是一个 2D 汽车模拟器,约每 200 毫秒向 Jev 提出四个问题;此外也有 3D 版本。


4. 信息流、浏览器扩展与注意力筛选

筛选信息流

Jev 的成本足够低,可以根据你自己的规则判断看到的每一条帖子。人们构建了:

  • 一个扩展,可根据你用自然语言编写的规则隐藏或折叠 X 帖子。

  • 一个 Doomscroll Filter,可将你所选领域的帖子分为 Read、Skim 或 Pass。

  • 一个 Chrome 扩展,可将帖子标记为 Substance、Humor、Chitchat、Promo、Junk 或 AI written,然后隐藏你不想看的内容。

  • 一个 LinkedIn Slop Filter,可为互动诱饵内容标注其概率;此外还有过滤回复型用户的工具,以及带彩色标签的自定义标注器。

清理页面

  • typesafe-adblock 会询问 Jev 页面中的每个元素是否为广告,并将其移除,从而把广告拦截变成一系列简单的是非判断。

  • jev-skip 会读取 YouTube 字幕以跳过赞助内容。在 23 个视频中,它捕捉到了众包 SponsorBlock 数据库标记的 77% 赞助时长,每个视频花费 0.0008 美元,而且无需依赖众包。用自然语言规则筛选推荐内容,是显而易见的下一步。

  • 浏览器之外: 一款 macOS 应用会按照你设定的规则整理 Downloads 文件夹,且只使用 Jev 作为模型。

这里的新变化在于规则由谁编写。平台一直以来都在决定审核标准;现在,每个人都能用自然语言编写自己的规则,而每次滚动时的检查成本不到一美分。


5. 内容、营销与增长

为草稿和视频评分

写作者可以在输入时获得反馈:

  • 一个分析器会在你停止输入半秒后为草稿评分,另一个则能在约一秒内回答关于帖子的 61 个问题。

  • TypeSafe Typewriter 会在每次按键时重新运行 16 项判断;如果使用 LLM,这样做会慢得多、成本也高得多。

  • Chrome 扩展会在发布前为草稿的病毒式传播潜力和清晰度评分。

判断文本是否像 AI 写的工具可能会错误标记那些本来就有这种写作习惯的人,因此更好的工具会显示概率,而不是直接下结论。

竞品与广告研究

  • 一项广泛传播的分析在约 40 秒内拆解了 37 个品牌的 724 条竞品广告,费用约为 0.09 美元。

  • 另一项分析在 40 秒内处理了 700 条实时广告。

  • 一些团队使用 Jev 筛选内容并挑选素材,再让其他模型生成最终广告。

大规模编辑审查

  • 在一项独立测试中,Every 的评估负责人 Mike Taylor 将 37 份文档分别交由 Jev 回答 21 个问题。Jev 在不到 0.7 秒内返回了全部 777 项判断,花费约四分之一美分。

  • 在后续测试中,研究者预先植入了写作问题。Jev 处理每段文本约需 0.35 秒,而 Claude Fable 5.1 需要 8.83 秒;Jev 的成本约为后者的 1/580。Jev 发现了七个问题中的六个,Fable 则发现了全部七个。

  • 另一项针对 6,003 项评分标准检查的研究发现,Jev 与 Fable 5.1 的判断一致率为 91.5%,每百万个答案的成本约为 160 美元,而 Fable 约为 33,000 美元。

SEO、销售与潜在客户

  • SEO 和 GEO: Agent 以低 90% 的成本审核客户网站并应用修复。其他工具会评估页面各部分的清晰度和页面内 SEO,还有一些 Rust 命令行工具被定位为 Semrush 替代品。

  • 销售: 一个示例在 40 秒内为 700 个潜在客户评分。团队会将公司资料、高管简介和入站消息与理想客户画像进行匹配,评估行业契合度和公司成熟度,识别痛点与购买意向,并研究哪些外联信号真正能促成演示预约。


6. 数据基础设施:数据库、搜索与 ETL

从商业角度看,这可能是最被低估的类别。零样本文本分类已经存在多年,但以这样的价格对整张表运行分类还是新鲜事。

数据库内部

  • Postgres: jev 扩展新增了 jev() 函数,无需索引或 embeddings,就能用自然语言搜索表格。另有一个 C 扩展可从 SQL 调用 Jev,而 jevql 则无需安装任何东西,就能在常规 Postgres 中实现相同思路。

  • MotherDuck: 内置的 prompt_jev 接收一列、一个问题和一组选项,然后通过批量处理为每一行加上标签。在 MotherDuck 自己的测试中,它以 89% 的准确率在 40 秒内为 100,000 行添加标签,花费约 0.50 美元。GPT-5.6 Terra 则耗时约 32 分钟,费用为 37.58 美元,准确率为 88%。

  • 企业需要注意的问题: 文本会发送到 TypeSafe 的 API,因此会离开组织的数据区域。

搜索与重排序

  • 重排序: 在 TypeSafe 的 cookbook 中,对 40 个法律查询各自的 30 段候选文本进行重排序后,首条结果的准确率从 5% 提升到 18%,前十条结果的准确率则从 38% 提升到 62%。

  • RAG: 团队用语义评分、排序和成对比较取代 embeddings,或将它们与 embeddings 结合使用。

  • Jev Search: Jev 会选择来源、时间范围和搜索词,再为结果排序并显示评分,不生成答案。

  • 语义 grep: jevgrep 可按含义筛选行,耗时约 200 毫秒,每行成本约为千分之一美分。jev-semgrep 将含义与 AND、OR、NOT 组合起来,也可以用日语查询搜索英文文本。

批量分类与提取(真实示例)

  • 将 1,018 篇 AI 论文按主题分组,花费 0.08 美元。

  • 先使用 OCR,再用 Jev 在 40 秒内整理 900 张图片。

  • 以每秒超过 1,500 行的速度筛选训练数据。

  • 将两个啤酒目录中的 450 对商品归为合并、保持未关联或交由人工处理。

  • 按专利、零售、生物医学和源代码类别树对项目进行分类。

一个巧妙的项目会将 SEC 年报分为 75 个行业组,然后根据 Jev 的置信度决定分类细致程度。置信度高时,给出精确分组;不确定时,则归入更宽泛的行业类别。简言之,置信度决定了粒度。

在信息提取中,正则表达式先找出候选电子邮件、电话号码或金额,再由 Jev 选出正确项,最后由代码进行清理。另一个项目通过两次请求为纯文本恢复 Markdown 格式。


7. 开发者工具与代码智能

代码审查

  • Jev Review 通过聚焦的 Jev 调用检查 Git diff 或整个代码库,并在本地仪表盘中展示结果。

  • 其他工具会标记有风险的 pull request,或判断编码 Agent 是否真正完成了工单、规格要求或 bug 修复。

  • Vercel CEO Guillermo Rauch 表示,在判断命令安全性时,Jev 的 p95 延迟最高比 GPT Luna 快 18 倍,准确度也更高。该项目的主要审查器仍由 LLM 驱动。

CI 与提交检查

  • 语义 lint: patdown 和 oxlint-plugin-jev 会根据用自然语言编写的规则检查代码,并标记违规项。

  • 提交门禁: jev-commit 会在不到一秒内检查提交消息是否与变更相符。

  • 文档 QA: 一个检查器会在每个步骤调用一次 Jev,以判断摩擦类型、严重程度和若干是非项。它会将不确定的答案标记为需要审核,并在超过设定严重程度时让构建失败;每个包含 40 个章节的页面成本不到一美分。

终端、编辑器与工具包

  • 一个 Zsh 工具会为最近 100 条不重复命令排序,并以灰色显示最匹配的命令及其评分。

  • 预测式启动器会根据你的按键推测你想做什么。

  • jkudish 开发的 Jev MCP 为 Agent 提供十种 Jev 工具,包括根据证据核查主张,以及在内容进入上下文前进行筛查。

  • jevcal 的唯一用途是校准阈值并监测漂移,这说明选择合适的置信度阈值与模型本身同样重要。


8. 业务运营:分流与路由

电子邮件与支持

电子邮件分流是最容易见效的场景之一:

  • 开发者曾用 3.5 美分处理 500 封电子邮件,也有人一次运行就分流了 1,500 封。

  • 在一项并排演示中,Jev 用 9.9 秒处理了 300 封电子邮件,共 5,400 项判断,费用为 0.0366 美元。同一时间里,DeepSeek V4.1 Flash 只处理了 10 封。

  • 在另一项测试中,Jev 用约 8 秒、三分之一美分处理了 100 张支持工单;当时 Gemini 还停留在第 20 张工单,预计总成本约为 20 美分。

  • 诚实地说,Bryo AI 的 CTO 发现 Gemini 在电子邮件分流上的准确度略高,但成本高出 10 到 20 倍。

支持团队使用 Jev 按问题、产品和意图对工单分类;从通话记录中提取承诺和跟进事项;检测紧急程度、挫败情绪、流失风险和退款请求;并根据策略检查回复。一种常见方案是级联处理:Jev 在 1.42 秒内为 100 封电子邮件分类,然后只将不确定的邮件发送给更大的模型。

招聘

  • 一个示例以 0.0005 美元将 400 家公司与一位候选人进行匹配。

  • 简历筛选器使用可编辑策略;标准变更时可免费重新评分。

  • 求职 Agent 也采用相同方法。

这些系统之所以有效,是因为不确定的案例有明确的后续处理方式。低概率答案会交由人工处理,审核决策中也会明确提供“不确定”选项。与要求每项都绝对准确相比,经过校准的准确率加上清晰的人工处理路径,更容易实现。


9. 泛在计算:家居、语音、传感器与工业

智能家居

HA-Jev 将 Jev 接入 Home Assistant。其作者认为,判断“衣物是不是洗好了,但还留在洗衣机里”这类问题,本质上是判断,而不是需要生成一段文字的任务。

  • 问题可以变成传感器,返回概率、所选选项或分数。

  • 四种操作 jev.noul、jev.choice、jev.score 和 jev.ask 可在自动化中运行。

  • 对话 Agent 处理语音命令,并可在信心不足时采用回退方案。

  • 添加阈值后,可以将概率转化为开关传感器,并用它触发自动化。

  • 每日预算会追踪调用次数、输入 tokens 和预估成本。一个示例问题预览使用了 350 个输入 tokens,成本约为 0.000015 美元。

语音与消息

  • 无需唤醒词: 一个助手可以持续聆听,并利用 Jev 的概率区分电脑命令与普通对话,从而避免将每句话都发送给完整语言模型所带来的成本。

  • 语音浏览:jev-voice-browser 处理部分语音的耗时约为 250 到 350 毫秒,因此浏览器通常能在你说完之前就开始操作。

  • 幻灯片: 另一个演示会自动切换到与演讲者当前讲述内容相匹配的幻灯片,无需点击器或键盘。

  • 消息: 一款 Android 应用读取当前可见的微信聊天内容,并发送一个批量请求,根据意图、情绪、0 到 3 分的紧急程度以及建议的回复立场对消息进行分类。它只显示三条简短备注,不会生成或发送回复。本地联系人列表提供关系背景,因此同一条消息来自伴侣还是同事,判断结果可能不同。

工业

工业应用仍处于相对早期阶段,因为工业数据大多是数值,而 Jev 最擅长处理文本和结构化 state。预处理层可以将读数和机器事件转换成描述,再交由 Jev 判断;HA-Jev 展示的就是类似方法。

早期目标包括:

  • 对交接班日志和维护记录分类。

  • 去重并排列 SCADA 警报。

  • 审查质量检查记录。

  • 检查作业许可合规性。

  • 判断异常是否需要人工介入。

闭环安全系统和需要精确数值计算的任务仍不属于 Jev 的预期用途。jeva


10. 金融、法律、科学与受监管工作

交易

Jev Trader 会询问 Jev 是否应对链上订单簿的每个区块买入或卖出,然后根据决策下限价单。另一位开发者更进一步,给了 Jev 10,000 美元进行交易。该实验没有公布最终盈亏数字,但它表明,即使 Jev 判断对了市场方向,入场、出场、仓位规模和风险管理仍然可能决定交易成败。

金融犯罪、风险与保险

  • 银行可以审查交易描述、KYC 文件和警报历史,在杂乱记录中匹配个人与公司,并按风险排列警报。

  • 保险公司可以对首次出险报告和理赔员记录分类,发现信息缺失与欺诈信号,并决定哪些理赔可以自动处理。

  • 一位从业者构建了 30 个决策工作流和七个 Agentic SOC 工作流,但在能够适当衡量误报率之前,仍将资金转移、主机隔离和拒绝决策交由常规代码处理。

法律与科学

  • 法律团队可以对合同、申报文件和营销主张分类,发现缺失条款或被禁止的主张,并将高风险发现上报给律师。

  • 研究人员可以筛选系统综述论文、为访谈和调查文本片段添加标签、检查引用是否支持相关主张,并标记缺失的方法学细节。例如,Paper Radar 能在约 5 秒内判断 50 篇论文,成本约为 0.002 美元。

将文本转化为经典 ML 的特征

最不起眼的想法,可能最终最有价值。Jev 能将自由文本转换成概率分数,作为数据列与结构化数据结合起来,用于在存在真实结果数据的场景中训练常规模型。TypeSafe 的 autoresearch cookbook 就用这种方式改进 CatBoost 模型。在需求预测中,你可以从咨询和评论中提取购买意向、紧急程度、供应顾虑和竞争压力,再将这些分数与销售历史一同输入模型。


Jev 的薄弱之处

TypeSafe 公布了 Jev 已知的 9 个弱点:按字面理解、数学与数字、日期与时间、间接提问、包含无关细节的大型 state、对抗性内容、相互矛盾的指令、相关问题之间的一致性,以及文本生成。

其中六个最常遇到:

  • 计数: 数量越大,错误越多;因此应针对每个项目分别提问,再用代码求和。

  • 将数字作为数值处理: 颜色名称比十六进制代码更有效,因此应先在代码中转换数值。

  • 日期: 将月份、日期和年份拆分为 Choice 问题提取,再用代码比较日期。

  • 上下文过多: 无关信息会降低准确率,因此发送前应先过滤。

  • 诱导性输入: 隐藏指令可能影响答案。在一项社区测试中,直白的注入尝试没有改变 30 条危险命令中的任何一条,而伪造权威身份的消息则改变了 3 条。

  • 概率不一致: 同一个退款问题作为 Noul 时评分为 0.22,作为 Choice 时则为 0.01;一个问题与其反向表述的概率之和达到 1.19。不要在不同问题类型之间沿用同一个阈值。


Jev 如何连接到你的工具

Jev 本身不会调用工具。它会返回带类型的答案和概率,由你的代码决定执行什么操作。实际上,连接工具通常意味着将其加入选项列表,并在代码中处理选中的结果。

常见配置有四种:

  • 封装 Jev 的 MCP server 让现有 Agent 能使用 Jev 进行分类、评分、检查、匹配和筛查。

  • 由 Jev 选择 MCP 工具 可以让 Jev 无需 LLM 就从可用选项中选择合适工具;之后 LLM 可填写真正开放式的参数。

  • 原生集成,例如 SQL 函数、Home Assistant 操作和 Postgres 扩展,会让 Jev 的决策成为平台本身的一部分。

  • 实时循环 会在决策需要低延迟时使用 Jev 快速的 SDK 模式。

对于参数,Jev 可以从对话或 state 中选取已有文本,例如城市名称或准确引文,但不能编造新文本。参数也可以是固定的 Choice,例如摄氏或华氏。这意味着 Jev 可能选错已有段落,但无法凭空捏造段落。


开始构建之前

  • 访问权限仍然有限。 目前需要加入候补名单;此外也可以通过 Vercel AI Gateway、OpenRouter 和 Cloudflare 使用 Jev。

  • TypeSafe 不采用标准基准测试。 该公司认为,实验室会调整模型以赢得基准测试,因此在自己的数据上测试才是判断模型是否适用的唯一可靠方法。

如果 Jevons 的判断是对的,最大的变化将来自软件开始处理那些过去因为单次成本太高而被忽略的小决策;起点可能就是像忘记取出洗衣机里的衣物这样平常的小事。



【声明】内容源于网络
0
0
AI大模型观察站
专注于人工智能大模型的最新进展,涵盖Transformer架构、LLM训练优化、推理加速、多模态应用等核心技术领域。通过深度解析论文、开源项目和行业动态,揭示大模型技术的演进趋势,助力开发者、研究者和AI爱好者把握前沿创新。
内容 434
粉丝 0
AI大模型观察站 专注于人工智能大模型的最新进展,涵盖Transformer架构、LLM训练优化、推理加速、多模态应用等核心技术领域。通过深度解析论文、开源项目和行业动态,揭示大模型技术的演进趋势,助力开发者、研究者和AI爱好者把握前沿创新。
总阅读15.4k
粉丝0
内容434