模型The Decoder AI·原文 2026年10月3日

Cloudflare发布Clef与Clef-flash决策模型,标称 39 毫秒延迟并兼容Jev API

两款基于Qwen的决策模型运行在Workers AI上,以Apache-2.0许可在Hugging Face开放,Cloudflare称Clef-flash中位延迟约 39 毫秒,并称“人类不一定需要留在智能体决策回路中”。

AI解读:Cloudflare做了一套专门给AI智能体做选择用的模型,叫Clef和Clef-flash。它不写长文回答,只输出一个简短分类和对应概率,比如把用户留言标成“紧急”并指定该由哪个团队处理,后面的代码就能据此派单或升级。

这套东西的卖点是快。Cloudflare自报Clef-flash中位延迟约 39 毫秒,Clef约 209 毫秒,而它对照的Jev超过 524 毫秒。它同时保留Jev兼容的API,明显是冲着切换成本去的。

对做客服、风控、网页分类的团队,这意味着可以用更快、更便宜的方式做自动分流,不用每次都调大语言模型生成一段文字再解析。但概率分类不等于不会选错,Cloudflare的基准和延迟都是自家报告,真实效果还得看独立验证。

Cloudflare发布了两款面向AI智能体的决策模型Clef与Clef-flash,主打的不是生成文字,而是给输入快速返回分类和概率。Cloudflare在声明中称,“人类不一定需要留在智能体决策回路中”,智能体可以自行收集上下文、做决定并执行,必要时再交给人类。

决策模型在输入上同时回答多个预设问题,每个选项给出一个概率。Cloudflare举的例子是:收到一条客服消息,Clef判断其紧急程度并识别应由哪个团队处理,下游代码据此路由工单、触发升级或转给人工。

Cloudflare自报Clef-flash中位延迟约 39 毫秒,Clef约 209 毫秒,作为对照的TypeSafe AI的Jev为 524 毫秒出头。Cloudflare称在 43 项基准测试中,Clef与更小的Clef-flash都快于所有相关竞品决策模型。

定位:语言模型与传统分类器之间

Cloudflare把决策模型描述为填补大语言模型与传统分类器之间的空档。语言模型能推理和调用工具,但输出不稳定且可能较慢;传统分类器快,但每增加一个新类别就需要重新训练。

Clef的命名来自音乐中的谱号,谱号给五线谱上的线赋予音高,Cloudflare用这个类比说明决策模型为后续动作设定框架。文章也点出,Clef与Jev的读音相近,可能并非巧合。

Cloudflare将Clef视为对TypeSafe AI的Jev模型的直接回应,并保持API完全兼容,以便客户切换。

  • 决策模型一次调用可回答多个预设问题,每个答案返回一个概率。
  • 根据Cloudflare说法,其威胁情报团队已用Clef分类网站:一个域名被判定为时尚网站的概率 95%、为在线商店的概率 85%、为钓鱼网站的概率低于 1%。
  • 同一案例中,抓取、渲染并分类该网站耗时 2.2 秒,而该公司最快的通用语言模型耗时 4.7 秒且只返回两个类别。
  • Cloudflare称Clef可处理图像,而Jev目前仅限文本;Clef的 64,000 token上下文窗口是Jev的两倍。

技术底座:基于Qwen,沿用RLCD训练

据Cloudflare,Clef基于Qwen3.8-27B,Clef-flash基于更小的Qwen3.5-9B。训练期间基础模型保持不变,Cloudflare用自家合成数据训练额外组件,这些组件从模型内部计算中推导出答案选项和概率。

Cloudflare还使用了自己变体的RLCD(Reinforcement Learning for Calibrated Decisions),即TypeSafe训练Jev所用的方法。RLCD训练模型在一次调用中回答多个关于输入的问题,目标是让给出的概率与答案实际正确的频率相符。

Cloudflare此前曾尝试用DiffusionGemma从语言模型内部计算中推导固定决策值。

自报基准:Clef与Jev的准确率对比

Cloudflare在自家基准及Jev Decision Index上称Clef领先。文章列出了部分准确率数字:API Bank上Clef为 91.93、Clef-flash为 93.11、Jev为 88.19、DiffusionGemma为 83.66、Jev Kev 9B为 56.30、Laya为 11.41;When2Call上分别为 72.37、65.58、80.97、75.44、49.62、11.94;PhishNChips上分别为 79.60、75.05、62.55、85.35、50.75、50.15。

Cloudflare自报数字称,Clef决策质量最高,Clef-flash则以远低于Jev的延迟接近其准确率。这些数字均来自Cloudflare自身,文章未给出独立验证结果。

微调服务与内部用途

随发布一同推出的还有一项强化学习服务,允许客户针对自己的任务微调Clef。初期由一支前向部署工程师团队与客户一起完成微调,自助平台计划稍后推出。

客户可通过AI Gateway记录请求来构建数据集,并在充当RL沙箱的容器中评估这些请求。新的trainer组件让客户能将微调后的模型部署到Workers AI。Cloudflare使用其在 2025 年底收购的Replicate的技术来运行自定义模型。计划中的自助平台将记录生产数据、用强化学习微调Clef,并直接重新部署定制模型。

Cloudflare表示计划内部使用Clef做滥用报告审核、支持请求分类,以及区分有益与有害的机器人。两款模型运行在Cloudflare的Workers AI平台上,并以Apache-2.0许可证在Hugging Face提供。

背景:Jev与OpenAI Decisions API在前

这一路线由TypeSafe AI推广,该公司由前OpenAI研究员Diogo Almeida创立,于 9 月中旬推出Jev。TypeSafe将Jev宣传为“没有幻觉”的模型,但文章指出,这只保证它停留在预设答案选项内,并不能防止它选错答案。

9 月下旬,OpenAI跟进推出基于GPT-6 Luna的Decisions API,同样接受文本或图像形式的上下文。

文章称Cloudflare主要运营内容分发、DNS和安全服务的全球网络,其自研AI模型此前关注度不高,近期AI相关新闻集中在让网站所有者控制访问,例如 7 月允许站点运营者按用途拦截或放行AI机器人。

信息来源

The Decoder AI原始来源