Cloudflare开源Clef决策模型,边缘GPU以毫秒延迟承接智能体路由
10月1日,Cloudflare发布Clef与Clef-flash两款开源决策模型,并同步推出配套的强化学习微调平台。与生成文本的大语言模型不同,决策模型不写句子,而是读取一段输入状态与一组预设问题,直接返回每个选项的概率,让代码据此路由工单、阻断请求或升级给人工。Cloudflare称其为“系统一”模型,定位在智能体工作流的热路径上做快速、可校准的二选一或多选一判断。

在性能上,Clef基于约27B参数构建,中位延迟209毫秒;更小的Clef-flash仅9B参数,p95延迟低至122毫秒,较同类领先的Jev模型最高快约13倍。两项模型均以Apache 2.0许可证在Hugging Face开源权重,并兼容Jev的API,开发者只需改动端点即可从闭源方案切换过来。Cloudflare表示,在自身威胁情报团队的真实测试中,Clef用一个带浏览器的流程对域名分类,耗时2.2秒,而最快的通用大模型gpt-oss-120b需要4.7秒且只给出两类结果。
这一发布让“决策模型”从一个小众概念迅速成为智能体技术栈里的独立一层。Cloudflare的逻辑是:当智能体每一步都要判断“该调哪个工具”“是否安全”“要不要升级”,用昂贵的前沿大模型去生成解释既不必要也不经济;把这类结构性判断题交给轻量、开源、可本地部署的决策模型,既能压低延迟与成本,也让大模型的算力集中到真正需要推理的环节。同日,AWS也开源了自家的Strands Decider 2B,决策模型赛道在一周内由一家创业公司扩张到多家云巨头。
对开发者而言,开源权重意味着可以把模型跑在自己的GPU上,并用Cloudflare新推出的强化学习平台基于私有工作流数据微调,不再被按token计费的闭源API绑定。不过需要注意,决策模型的强项在分类与路由,复杂推理仍是前沿大模型的领地;在涉及高后果的判断时,把它和人工审核、确定性代码组合使用,才是稳妥的生产架构。随着边缘算力与开源生态成熟,这类“给智能体做决定”的模型,可能成为AI应用里最常被调用、却最少被注意的基础设施。
读者评论 (3)
想参与讨论?请 登录 后发表评论。
209ms 比人反应还快,真怕它先于你做出“正确”的决定。
小模型负责分流确实聪明,但真正怕的是边缘侧一跑错就把事故放大,得留个兜底
这思路挺对,把“选路”这种简单活交给小模型,大模型专心搞复杂事,能省不少钱