编者摘要:Cloudflare 发布开源决策模型 Clef(含 Clef、Clef-flash)以及配套 RL 微调平台,对标 Typesafe 的 Jev 决策模型,采用 Apache2.0 协议开源,并且完全兼容 Jev API,可低成本迁移。决策模型不同于通用 LLM:它专注结构化决策分类,输出带概率的强类型结果,无需频繁重训新增分类标签,嵌入智能体链路完成工单分流、域名判定等程序化决策。
Clef 以 Qwen 为基座,采用非自回归推理架构,仅做 prefill,并行对候选选项打分,搭配两阶段注意力路由;创新提出 RLCD 校准决策强化学习,优化概率校准,抑制分布偏移。相比 Jev,Clef 新增视觉编码器,支持图文分类,上下文窗口扩大至 64k(Jev 为 32k)。Clef-flash 主打极致低延迟,中位推理延迟仅 38.8ms;Clef 主模型精度更高,在 43 项评测中多项指标超越 Jev。内部落地案例:威胁情报域名识别,网页渲染分类耗时 2.2s,远快于通用大模型 gpt-oss-120b 的 4.7s。
Clef 部署于 Cloudflare Workers AI 边缘 GPU,网络延迟更低。企业数据默认不读取、不存储、不用于训练。配套 RL 微调平台初期由前线部署工程师 FDE 团队提供人工调优服务,后续上线自助平台,复用 AI Gateway、Containers、Trainer 等 Cloudflare 原生组件,支持客户基于自有业务数据微调并重新部署模型。适用场景包括客服工单分级、安全事件判定、爬虫识别、内容安全审核等垂直业务,在智能体工作流中承担快速决策环节。
10 个关键问题 Q&A
- 什么是决策模型?
决策模型用于分类决策,输出带概率的强结构化结果,嵌入智能体完成自动判断,区别于开放生成式 LLM。 - Clef 和 Jev 核心差别是什么?
Clef 支持图像输入、64k 上下文窗口;Jev 仅文本、32k 上下文,Clef 推理架构与 RLCD 优化进一步提升性能。 - Clef 为什么推理速度更快?
采用非自回归架构,不逐 token 生成文本,prefill 后并行对候选 schema 选项打分。 - Clef 基座模型是什么?
Clef 基于 Qwen3.8-27B,Clef-flash 基于 Qwen3.5-9B。 - RLCD 是什么?
校准决策强化学习,奖励精准输出、对相邻有序选项给部分分数,抑制分布偏移,优化概率输出。 - Clef 可以本地部署吗?
可以,HuggingFace 开源,Apache2.0 协议,本地可运行。 - Clef 典型业务场景?
客服工单分级、域名威胁分类、爬虫良莠判定、票据处理、内容安全审核。 - RL 微调平台由哪些组件构成?
AI Gateway、Workers AI、Cloudflare Containers、Trainer、BYO 模型部署。 - Clef 企业数据安全策略?
默认不读取、存储、利用用户请求数据训练,使用微调产品除外。 - Clef-flash 适用场景?
对延迟极度敏感的高吞吐决策场景,牺牲少量精度换取极低推理延迟。
附录 Cloudflare 发布 Clef:开源决策模型与全新 RL 微调平台
过去几周,决策模型(例如 Typesafe 发布的 System One 模型 Jev)引发大量热议。分类模型早已存在,而 Jev 为 AI 领域引入了一类全新的决策模型:它能够低成本、快速且稳定地输出受限结构化结果,在工作流需要做决策时嵌入使用。这类模型可基于任意输入运行,无需持续重训模型来新增分类类别。
这和大语言模型(LLM)形成鲜明对比:LLM 输出大多具有非确定性,但开放能力强,可完成推理、生成文本与工具调用,适合智能体任务。
今天,我们正式发布两款由 Cloudflare 自研训练的决策模型:Clef与Clef-flash。Clef 在 Jev 决策基准评测榜单上目前排名领先,完整评测结果可访问评测页面查看。模型更智能、推理更快,并且完全兼容 Jev API,你可以直接试用托管版本;同时以 Apache 2.0 协议开源,可本地部署实验。
除此之外,我们很高兴推出全新的强化学习(RL)产品,支持客户针对自身业务场景微调 Clef 模型。
什么是决策模型?
决策模型通过分类,依据概率输出结果,帮助智能体决定后续动作。 举个例子:输入一条客服消息,询问该消息是否紧急、应由哪个团队处理。决策模型返回带概率的结构化结果,业务代码就可以依据结果流转工单、触发升级,或转人工处理。 这意味着智能体做决策时,不一定需要人工介入:智能体可以自动收集上下文、自主决策执行任务,必要时再转交人工。
在 Cloudflare 内部,威胁情报团队已经在测试 Clef,用于网站域名分类。将域名输入 Clef(搭配 Browser Run),模型可快速判定域名所属类别,例如:95% 概率为时尚网站、85% 概率属于电商,钓鱼网站概率<1%。 Clef 完成网页拉取、渲染与分类仅需 2.2 秒。作为对比,我们最快的通用大模型 gpt-oss-120b 在相同工作流耗时 4.7 秒,且仅输出 2 个分类结果。延迟直接减半,这能显著优化威胁情报流程,更快识别恶意 / 合法域名。 推广到所有需要快速程序化决策的场景,即可搭建强大智能体工作流,实现自主判断、推理与执行。
命名由来:乐理中,谱号(Clef)写在五线谱开头,定义各线间音高。决策模型与之类似,用于界定上下文范围,以及后续对应的动作;同时名称里的 CF 取自 Cloudflare。
Clef 和其他决策模型有何不同?
决策模型赛道日趋拥挤,但 Clef 具备多项独特特性。
-
搭载视觉编码器,可接收图像并完成视觉内容分类;而当前 Jev 仅支持文本分类。 -
上下文窗口达到64k(Jev 为 32k),支持输入更长状态信息用于分类。 -
精度强,在多类质量基准上与市面上其他决策模型相比具备竞争力。
下面是基于 Jev 决策索引定义的决策类基准测试结果:
|
|
|
|
|
|
|
|---|---|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
我们同时在 WorkflowEvals 基准集开展测试,Clef 在 4 项任务中 3 项超越 Jev。值得一提,Clef-flash 在推理速度大幅提升的前提下,仍保持优秀性能。
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
在全部 43 项评测中,Clef 系列模型延迟表现领先(Laya 虽然速度极快,但评测质量明显更低):
|
|
|
|
|
|
|
|---|---|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
除模型本身低延迟优势外,Clef 托管在 Workers AI 平台。依托 Cloudflare 边缘 GPU 基础设施,网络延迟更低,决策速度更快。你可以将 Clef 嵌入智能体决策的核心链路,搭配 Workers AI 上的大模型执行后续动作。
API 调用示例
curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
-X POST \
-H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
-d '{
"model": "clef",
"state": "Checkout has been failing for every customer for the last hour.",
"questions": {
"urgent": { "type": "noul", "instructions": "Is this support request urgent?" },
"team": {
"type": "choice",
"instructions": "Which team should handle this request?",
"criteria": {
"billing": "Payments, invoices, and refunds",
"technical": "Outages, errors, and configuration",
"sales": "Plans and upgrades"
}
},
"severity": {
"type": "score",
"instructions": "How severe is the customer impact?",
"criteria": ["No impact", "Minor", "Major", "Critical"]
}
}
}'
Clef 和 Jev 一样输出强类型结构化结果,API 完全兼容,迁移成本极低。大版本 Clef 侧重高精度;Clef-Flash 适合对延迟高度敏感的决策场景。模型已面向企业就绪;默认情况下,我们不会读取、存储你的请求与返回结果,也不会拿这些数据训练模型(如果你选择使用微调产品则另说)。你现在就可以上手体验 Clef 模型,或前往 HuggingFace 下载。
如果你需要针对特定业务场景调优 Clef,我们提供微调服务:初期由前线部署工程师(FDE)团队提供人工支持;后续上线自助微调平台,客户可自行训练并在 Cloudflare 上重新部署模型。
Clef 的训练方式
Jev 发布当周,我们就发布自研决策模型 Demo。Demo 展示了如何改造 DiffusionGemma,通过暴露 LLM 生成的对数概率,输出确定性概率。我们的初始方案建立在社区研究者 mmastrac 的独立研究之上,他在 ML 社区持续分享新思路,并向 vLLM 推理引擎提交 PR,增强 DiffusionGemma 能力。
Clef 延续这套思路,但选用不同基座模型。当前以 Qwen 作为骨干基座,经过后训练适配决策模型场景。推理阶段,Clef 仅对 Qwen 做 prefill 填充,并行对合法 Schema 选项打分;决策步骤非自回归,不再逐 token 生成中间文本,因此速度远高于自回归 LLM。Clef 与 Clef-flash 不通过生成中间文本来产出结构化答案,而是直接从骨干网络表征中提取 Schema 选项。
这套架构采用独特的两阶段注意力路由机制:每个合法选项提取与提示词相关的上下文,各个字段参数之间、字段与原始输入载荷之间在打分前做交叉注意力计算。借助词法先验,模型能在多个候选选项间保留语义意图。整体架构融合选项专属证据路由、跨字段联合注意力与绑定 Schema 约束打分。
-
Clef:冻结 Qwen3.8-27B 基座,联合优化路由头 + rank-256 低秩适配器 -
Clef-flash:冻结 Qwen3.5-9B 基座,同样联合优化路由头与 LoRA
后训练阶段,使用标签平滑交叉熵处理合法 Schema 输出,搭配 Brier 损失优化概率校准。训练数据集来自内部合成数据,打乱字段顺序、提示词与 Schema 结构。 我们还提出RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)作为第二优化目标:对有序相邻选项给予部分得分奖励,奖励完全匹配的输出记录,同时增加参考惩罚,抑制分布偏移,获得更好准确率与泛化能力。
最终 Clef 实现多项创新:提升分类精度,约束模型仅输出概率而不做文本生成,速度超越 Jev 以及原始 Qwen 基座模型。
微调如何拓展 Clef 能力
Cloudflare 内部大量业务场景需要微调 Clef 嵌入智能体工作流:例如内容安全工单评估、客服工单分流、Bot 产品中判定爬虫是良性 / 恶意爬虫。 这类场景高度垂直,我们拥有多年标注决策数据,可训练专用分类器。微调模型的代价是通用性能会有所下降,换取特定领域更高精度。Cloudflare 拥有超过 15 年跨域网络数据,微调后的模型在对应场景比通用 Clef 更快、更准。内部团队已经在探索 Clef 后训练方案,打造 ML 模型提升全公司业务流程效率。这些内部场景,正是 FDE 微调团队与本次 RL 产品的落地基础。
全新 RL 服务
我们提供服务,由 FDE 专家团队帮客户针对业务场景微调 Clef。后续,我们将基于项目实践,搭建自助平台:客户采集数据、微调模型、重新部署,全部在 Cloudflare 平台内完成。
该产品筹备已久:我们一直在搭建 AI 平台底层组件,支撑自定义 RL 产品。Jev 受到市场热烈关注,印证了市场对轻量、快速、专用分类模型的需求,因此我们选择以此方向探索 RL 环境。
底层复用 Cloudflare 已有平台组件:
-
Cloudflare AI Gateway:转发全部 AI 流量,自动为业务场景构建请求数据集 -
Cloudflare Workers AI:基于基础 Clef 模型生成 rollout 轨迹 -
Cloudflare Containers:RL 沙箱,用于打分、回放智能体动作 -
【新增】Trainer:更新 Clef 微调权重 -
Cloudflare Workers AI + BYO Model:在 Workers AI 重新部署微调后的模型
整合多项尚在迭代的 AI 平台组件:AI Gateway 采集流量数据、Containers 承载 RL 沙箱、收购 Replicate 后持续推进的 Workers AI 自带模型部署能力(Cog)。
即刻上手
今天,Workers AI 团队正式发布 Cloudflare 首款自研训练机器学习模型。项目仍处于早期,后续还有大量优化空间;但这是 AI 平台团队研发成果的一次精彩亮相。我们相信 Clef 将重塑智能体的使用方式,契合 Cloudflare “智能体云” 的使命。
如果你有特定业务场景,且已是 Cloudflare 客户,可登记 Clef RL 意向。 你可以直接试用托管在 Workers AI 上的 Clef 模型,也可前往 HuggingFace 下载本地实验;如有微调需求,欢迎联系我们。
ML 团队影响力持续增长,覆盖模型优化、训练研究等方向。如果你认同我们的使命,欢迎投递简历加入。
核心要点提炼
- 定位
Clef 是 Cloudflare 开源决策模型(Clef / Clef-flash),对标 Typesafe Jev,用于智能体链路里的结构化分类决策,不做开放式文本生成,输出带概率的强类型结果。 - 差异化亮点
-
支持视觉输入(Jev 当前仅文本) -
64k 上下文窗口(Jev 为 32k) -
Clef-flash 延迟低至38.8ms 中位延迟,适合低延迟业务 -
非自回归推理,并行打分,速度远快于普通 LLM -
基座为 Qwen,使用 RLCD 强化学习做概率校准 - 开源 & 许可
Apache2.0,HuggingFace 开源,完全兼容 Jev API,可无缝迁移 - 配套产品
全新 RL 微调平台,依托 Cloudflare 边缘基础设施,支持客户微调、部署专属 Clef;初期专家 FDE 支持,后续自助平台 - 内部落地案例
威胁情报域名识别,相比通用大模型延迟减半,同时给出多分类概率 - 架构关键

