大数跨境

对标 Jev,支持多模态|解读 Cloudflare Clef 决策模型技术架构

对标 Jev,支持多模态|解读 Cloudflare Clef 决策模型技术架构 苏哲管理咨询
2026-10-03
29
导读:Cloudflare 发布开源决策模型 Clef Typesafe 的 Jev 决策模型。决策模型不同于通用 LLM:它专注结构化决策分类,输出带概率的强类型结果,无需频繁重训新增分类标签,嵌入智能体

编者摘要:Cloudflare 发布开源决策模型 Clef(含 Clef、Clef-flash)以及配套 RL 微调平台,对标 Typesafe 的 Jev 决策模型,采用 Apache2.0 协议开源,并且完全兼容 Jev API,可低成本迁移。决策模型不同于通用 LLM:它专注结构化决策分类,输出带概率的强类型结果,无需频繁重训新增分类标签,嵌入智能体链路完成工单分流、域名判定等程序化决策。

Clef 以 Qwen 为基座,采用非自回归推理架构,仅做 prefill,并行对候选选项打分,搭配两阶段注意力路由;创新提出 RLCD 校准决策强化学习,优化概率校准,抑制分布偏移。相比 Jev,Clef 新增视觉编码器,支持图文分类,上下文窗口扩大至 64k(Jev 为 32k)。Clef-flash 主打极致低延迟,中位推理延迟仅 38.8ms;Clef 主模型精度更高,在 43 项评测中多项指标超越 Jev。内部落地案例:威胁情报域名识别,网页渲染分类耗时 2.2s,远快于通用大模型 gpt-oss-120b 的 4.7s。

Clef 部署于 Cloudflare Workers AI 边缘 GPU,网络延迟更低。企业数据默认不读取、不存储、不用于训练。配套 RL 微调平台初期由前线部署工程师 FDE 团队提供人工调优服务,后续上线自助平台,复用 AI Gateway、Containers、Trainer 等 Cloudflare 原生组件,支持客户基于自有业务数据微调并重新部署模型。适用场景包括客服工单分级、安全事件判定、爬虫识别、内容安全审核等垂直业务,在智能体工作流中承担快速决策环节。

10 个关键问题 Q&A

  1. 什么是决策模型?
    决策模型用于分类决策,输出带概率的强结构化结果,嵌入智能体完成自动判断,区别于开放生成式 LLM。
  2. Clef 和 Jev 核心差别是什么?
    Clef 支持图像输入、64k 上下文窗口;Jev 仅文本、32k 上下文,Clef 推理架构与 RLCD 优化进一步提升性能。
  3. Clef 为什么推理速度更快?
    采用非自回归架构,不逐 token 生成文本,prefill 后并行对候选 schema 选项打分。
  4. Clef 基座模型是什么?
    Clef 基于 Qwen3.8-27B,Clef-flash 基于 Qwen3.5-9B。
  5. RLCD 是什么?
    校准决策强化学习,奖励精准输出、对相邻有序选项给部分分数,抑制分布偏移,优化概率输出。
  6. Clef 可以本地部署吗?
    可以,HuggingFace 开源,Apache2.0 协议,本地可运行。
  7. Clef 典型业务场景?
    客服工单分级、域名威胁分类、爬虫良莠判定、票据处理、内容安全审核。
  8. RL 微调平台由哪些组件构成?
    AI Gateway、Workers AI、Cloudflare Containers、Trainer、BYO 模型部署。
  9. Clef 企业数据安全策略?
    默认不读取、存储、利用用户请求数据训练,使用微调产品除外。
  10. Clef-flash 适用场景?
    对延迟极度敏感的高吞吐决策场景,牺牲少量精度换取极低推理延迟。

附录 Cloudflare 发布 Clef:开源决策模型与全新 RL 微调平台

过去几周,决策模型(例如 Typesafe 发布的 System One 模型 Jev)引发大量热议。分类模型早已存在,而 Jev 为 AI 领域引入了一类全新的决策模型:它能够低成本、快速且稳定地输出受限结构化结果,在工作流需要做决策时嵌入使用。这类模型可基于任意输入运行,无需持续重训模型来新增分类类别。

这和大语言模型(LLM)形成鲜明对比:LLM 输出大多具有非确定性,但开放能力强,可完成推理、生成文本与工具调用,适合智能体任务。

今天,我们正式发布两款由 Cloudflare 自研训练的决策模型:Clef与Clef-flash。Clef 在 Jev 决策基准评测榜单上目前排名领先,完整评测结果可访问评测页面查看。模型更智能、推理更快,并且完全兼容 Jev API,你可以直接试用托管版本;同时以 Apache 2.0 协议开源,可本地部署实验。

除此之外,我们很高兴推出全新的强化学习(RL)产品,支持客户针对自身业务场景微调 Clef 模型。

什么是决策模型?

决策模型通过分类,依据概率输出结果,帮助智能体决定后续动作。 举个例子:输入一条客服消息,询问该消息是否紧急、应由哪个团队处理。决策模型返回带概率的结构化结果,业务代码就可以依据结果流转工单、触发升级,或转人工处理。 这意味着智能体做决策时,不一定需要人工介入:智能体可以自动收集上下文、自主决策执行任务,必要时再转交人工。

在 Cloudflare 内部,威胁情报团队已经在测试 Clef,用于网站域名分类。将域名输入 Clef(搭配 Browser Run),模型可快速判定域名所属类别,例如:95% 概率为时尚网站、85% 概率属于电商,钓鱼网站概率<1%。 Clef 完成网页拉取、渲染与分类仅需 2.2 秒。作为对比,我们最快的通用大模型 gpt-oss-120b 在相同工作流耗时 4.7 秒,且仅输出 2 个分类结果。延迟直接减半,这能显著优化威胁情报流程,更快识别恶意 / 合法域名。 推广到所有需要快速程序化决策的场景,即可搭建强大智能体工作流,实现自主判断、推理与执行。

命名由来:乐理中,谱号(Clef)写在五线谱开头,定义各线间音高。决策模型与之类似,用于界定上下文范围,以及后续对应的动作;同时名称里的 CF 取自 Cloudflare。

Clef 和其他决策模型有何不同?

决策模型赛道日趋拥挤,但 Clef 具备多项独特特性。

  1. 搭载视觉编码器,可接收图像并完成视觉内容分类;而当前 Jev 仅支持文本分类。
  2. 上下文窗口达到64k(Jev 为 32k),支持输入更长状态信息用于分类。
  3. 精度强,在多类质量基准上与市面上其他决策模型相比具备竞争力。

下面是基于 Jev 决策索引定义的决策类基准测试结果:

Benchmark
Clef
Clef-flash
Jev(DiffusionGemma)
Kev-9B
Laya
BFCL · case exact
98.47
98.76
95.75
96.52
38.13
ToolRet · nDCG@10
69.19
66.43
65.28
61.21
12.69
API-Bank · accuracy
91.93
93.11
88.19
83.66
11.41
Home appliances · case exact
82.95
97.73
52.27
42.05
0.00
When2Call · accuracy
72.37
65.58
80.97
75.44
11.94
BANKING77 · macro-F1
94.20
90.93
79.74
74.28
14.29
CLINC150+OOS · macro-F1
97.43
66.77
89.27
83.49
3.19
BRIGHT · nDCG@10
45.91
39.26
47.52
42.94
19.90
Amazon ESCI · macro-F1
57.48
57.39
55.21
53.37
24.40
PhishNChips · accuracy
79.60
75.05
62.55
85.35
50.15

我们同时在 WorkflowEvals 基准集开展测试,Clef 在 4 项任务中 3 项超越 Jev。值得一提,Clef-flash 在推理速度大幅提升的前提下,仍保持优秀性能。

Workflow
Clef
Clef-flash
Jev
Invoice processing 票据处理
64.7
57.1
61.8
Customer service 客服
76.3
77
76.0
Security incidents 安全事件
62.9
61.7
61.7
Agent trace observability 智能体链路可观测性
68.5
69.8
71.6

在全部 43 项评测中,Clef 系列模型延迟表现领先(Laya 虽然速度极快,但评测质量明显更低):

延迟指标
Clef
Clef-flash
Jev
Kev-9B
Laya
Median latency・ms 中位延迟
209.3
38.8
524.1
84.4
5.8
p95 latency・ms P95 延迟
238.6
122.4
536.0
211.2
222.5

除模型本身低延迟优势外,Clef 托管在 Workers AI 平台。依托 Cloudflare 边缘 GPU 基础设施,网络延迟更低,决策速度更快。你可以将 Clef 嵌入智能体决策的核心链路,搭配 Workers AI 上的大模型执行后续动作。

API 调用示例

curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
  -X POST \
  -H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
  -d '{
    "model": "clef",
    "state": "Checkout has been failing for every customer for the last hour.",
    "questions": {
      "urgent": { "type": "noul", "instructions": "Is this support request urgent?" },
      "team": {
        "type": "choice",
        "instructions": "Which team should handle this request?",
        "criteria": {
          "billing": "Payments, invoices, and refunds",
          "technical": "Outages, errors, and configuration",
          "sales": "Plans and upgrades"
        }
      },
      "severity": {
        "type": "score",
        "instructions": "How severe is the customer impact?",
        "criteria": ["No impact", "Minor", "Major", "Critical"]
      }
    }
  }'

Clef 和 Jev 一样输出强类型结构化结果,API 完全兼容,迁移成本极低。大版本 Clef 侧重高精度;Clef-Flash 适合对延迟高度敏感的决策场景。模型已面向企业就绪;默认情况下,我们不会读取、存储你的请求与返回结果,也不会拿这些数据训练模型(如果你选择使用微调产品则另说)。你现在就可以上手体验 Clef 模型,或前往 HuggingFace 下载。

如果你需要针对特定业务场景调优 Clef,我们提供微调服务:初期由前线部署工程师(FDE)团队提供人工支持;后续上线自助微调平台,客户可自行训练并在 Cloudflare 上重新部署模型。

Clef 的训练方式

Jev 发布当周,我们就发布自研决策模型 Demo。Demo 展示了如何改造 DiffusionGemma,通过暴露 LLM 生成的对数概率,输出确定性概率。我们的初始方案建立在社区研究者 mmastrac 的独立研究之上,他在 ML 社区持续分享新思路,并向 vLLM 推理引擎提交 PR,增强 DiffusionGemma 能力。

Clef 延续这套思路,但选用不同基座模型。当前以 Qwen 作为骨干基座,经过后训练适配决策模型场景。推理阶段,Clef 仅对 Qwen 做 prefill 填充,并行对合法 Schema 选项打分;决策步骤非自回归,不再逐 token 生成中间文本,因此速度远高于自回归 LLM。Clef 与 Clef-flash 不通过生成中间文本来产出结构化答案,而是直接从骨干网络表征中提取 Schema 选项。

这套架构采用独特的两阶段注意力路由机制:每个合法选项提取与提示词相关的上下文,各个字段参数之间、字段与原始输入载荷之间在打分前做交叉注意力计算。借助词法先验,模型能在多个候选选项间保留语义意图。整体架构融合选项专属证据路由、跨字段联合注意力与绑定 Schema 约束打分。

  • Clef:冻结 Qwen3.8-27B 基座,联合优化路由头 + rank-256 低秩适配器
  • Clef-flash:冻结 Qwen3.5-9B 基座,同样联合优化路由头与 LoRA

后训练阶段,使用标签平滑交叉熵处理合法 Schema 输出,搭配 Brier 损失优化概率校准。训练数据集来自内部合成数据,打乱字段顺序、提示词与 Schema 结构。 我们还提出RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)作为第二优化目标:对有序相邻选项给予部分得分奖励,奖励完全匹配的输出记录,同时增加参考惩罚,抑制分布偏移,获得更好准确率与泛化能力。

最终 Clef 实现多项创新:提升分类精度,约束模型仅输出概率而不做文本生成,速度超越 Jev 以及原始 Qwen 基座模型。

微调如何拓展 Clef 能力

Cloudflare 内部大量业务场景需要微调 Clef 嵌入智能体工作流:例如内容安全工单评估、客服工单分流、Bot 产品中判定爬虫是良性 / 恶意爬虫。 这类场景高度垂直,我们拥有多年标注决策数据,可训练专用分类器。微调模型的代价是通用性能会有所下降,换取特定领域更高精度。Cloudflare 拥有超过 15 年跨域网络数据,微调后的模型在对应场景比通用 Clef 更快、更准。内部团队已经在探索 Clef 后训练方案,打造 ML 模型提升全公司业务流程效率。这些内部场景,正是 FDE 微调团队与本次 RL 产品的落地基础。

全新 RL 服务

我们提供服务,由 FDE 专家团队帮客户针对业务场景微调 Clef。后续,我们将基于项目实践,搭建自助平台:客户采集数据、微调模型、重新部署,全部在 Cloudflare 平台内完成。

该产品筹备已久:我们一直在搭建 AI 平台底层组件,支撑自定义 RL 产品。Jev 受到市场热烈关注,印证了市场对轻量、快速、专用分类模型的需求,因此我们选择以此方向探索 RL 环境。

底层复用 Cloudflare 已有平台组件:

  1. Cloudflare AI Gateway:转发全部 AI 流量,自动为业务场景构建请求数据集
  2. Cloudflare Workers AI:基于基础 Clef 模型生成 rollout 轨迹
  3. Cloudflare Containers:RL 沙箱,用于打分、回放智能体动作
  4. 【新增】Trainer:更新 Clef 微调权重
  5. Cloudflare Workers AI + BYO Model:在 Workers AI 重新部署微调后的模型

整合多项尚在迭代的 AI 平台组件:AI Gateway 采集流量数据、Containers 承载 RL 沙箱、收购 Replicate 后持续推进的 Workers AI 自带模型部署能力(Cog)。

即刻上手

今天,Workers AI 团队正式发布 Cloudflare 首款自研训练机器学习模型。项目仍处于早期,后续还有大量优化空间;但这是 AI 平台团队研发成果的一次精彩亮相。我们相信 Clef 将重塑智能体的使用方式,契合 Cloudflare “智能体云” 的使命。

如果你有特定业务场景,且已是 Cloudflare 客户,可登记 Clef RL 意向。 你可以直接试用托管在 Workers AI 上的 Clef 模型,也可前往 HuggingFace 下载本地实验;如有微调需求,欢迎联系我们。

ML 团队影响力持续增长,覆盖模型优化、训练研究等方向。如果你认同我们的使命,欢迎投递简历加入。

核心要点提炼

  1. 定位
    Clef 是 Cloudflare 开源决策模型(Clef / Clef-flash),对标 Typesafe Jev,用于智能体链路里的结构化分类决策,不做开放式文本生成,输出带概率的强类型结果。
  2. 差异化亮点
    • 支持视觉输入(Jev 当前仅文本)
    • 64k 上下文窗口(Jev 为 32k)
    • Clef-flash 延迟低至38.8ms 中位延迟,适合低延迟业务
    • 非自回归推理,并行打分,速度远快于普通 LLM
    • 基座为 Qwen,使用 RLCD 强化学习做概率校准
  3. 开源 & 许可
    Apache2.0,HuggingFace 开源,完全兼容 Jev API,可无缝迁移
  4. 配套产品
    全新 RL 微调平台,依托 Cloudflare 边缘基础设施,支持客户微调、部署专属 Clef;初期专家 FDE 支持,后续自助平台
  5. 内部落地案例
    威胁情报域名识别,相比通用大模型延迟减半,同时给出多分类概率
  6. 架构关键
prefill-only + 两阶段注意力路由,直接从模型表征对 schema 候选打分,不逐 token 生成文本。

【声明】内容源于网络
0
0
苏哲管理咨询
为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
内容 2285
粉丝 0
苏哲管理咨询 为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
总阅读55.6k
粉丝0
内容2.3k