智能体长出「第二层大脑」:Cloudflare把「该不该做」从大模型里拆了出来

智能体跑起来之后,最先超支的往往不是生成答案的那一步,而是答案之外的一连串小判断——这条工单该派给谁、这次调用算不算越权、该不该把人叫回来。10 月 1 日,Cloudflare 开源了 Clef 与 Clef-flash 两款「决策模型」,把这一类判断从通用大模型手里拆出来,做成一个可以独立调用、独立计费、独立微调的层。它不是又一版更大的模型,而是一版「只说几个字」的模型。
决策模型不写文本,只回答带类型的问题
决策模型的工作方式和聊天模型完全不同。它不生成文本流,而是接收一段状态(一条客服消息、一个网页、一段智能体执行轨迹),再接收一组带类型的问题,然后为每个可选答案返回一个概率。Cloudflare 的 Clef 支持三类问题:是非题返回「是」的概率;选择题在若干命名选项间分配概率并给出置信度;评分题按有序量表给出概率加权分数。一次请求最多可以带 64 个问题和 4 张图片,下游软件直接读概率做分支,不需要去解析模型写出来的句子。
Clef 与 Clef-flash:参数、延迟与许可
参数与实测数据也都公开了。Clef 基于 Qwen3.8-27B 后训练而来,Clef-flash 基于 Qwen3.5-9B,两者都是 65536 token 上下文,保留了骨干的视觉编码器,输入可以是文本、JSON、图片甚至视频,权重以 Apache-2.0 许可发布在 Hugging Face,同时托管在 Workers AI 上。Cloudflare 用自家 43 次基准跑出的中位延迟是:Clef 209.3 毫秒,Clef-flash 38.8 毫秒,而同一批测试里 TypeSafe AI 的 Jev 是 524.1 毫秒。在威胁情报工作流里,抓取、渲染并给一个域名分类,Clef 用了 2.2 秒,而它最快的通用大模型用了 4.7 秒,还只分出了两个类别。
把路由和分诊从大模型里挪走的账
为什么要把这一层单独拆出来,账很简单。智能体每走一步都可能触发一次路由、一次工具选择或一次护栏判断,这些判断本身不难,但量大、重复、要求一致;每次都用前沿大模型去做,延迟和单价都摊不平。决策模型给出的答案空间是封闭的,因此可以便宜、可以快,也可以被量化校准。训练上有几个细节值得记:Cloudflare 冻结了骨干,只用一个小的 joint schema head 做路由与打分,用 rank-256 低秩适配器优化,损失函数是标签平滑交叉熵配合 Brier 损失,再加一个他们称为 RLCD 的强化学习目标——给相邻的有序选项部分得分,并用参考惩罚防止分布漂移。
三周内三家入场,源头是 TypeSafe 的 Jev
这条路不是 Cloudflare 先走出来的。概念来自 TypeSafe AI,由前 OpenAI 研究者 Diogo Almeida 创立,他在 ChatGPT 背后的 RLHF 工作中做过贡献。TypeSafe 在 9 月 15 日发布了 Jev,自称「System One 模型」,直接放弃字符串生成,因此输出天然类型安全、在答案空间内无法产生幻觉,定价为输入每百万 token 0.042 美元、输出免费,宣称在决策类任务上比前沿大模型快 40 到 200 倍。9 月底,OpenAI 在 Decisions API 里跟进了同一思路;10 月 1 日 Cloudflare 成为三周内第三家入场者,也是这一批里唯一把权重开放出来的一家。Dealroom 记录的开发者评论是「从没见过一个想法传播得这么快」。
基准成绩单,以及反方的声音
成绩单并非一边倒,这点需要如实标注。Cloudflare 自报 Clef 在自家 Decision Index 的十个决策基准里拿下七个,BANKING77 上 macro-F1 为 94.20(Jev 79.74),CLINC150+OOS 为 97.43(Jev 89.27);但知识型基准是 Jev 领先,GPQA Diamond 上 78.3 对 48.0、MMLU-Pro 上 82.7 对 65.9。Cloudflare 发布的延迟数据同样来自自家测试,未被独立复现。早期开发者的对比结论也比较混杂:有人发现 Clef 的每 token 价格高于 Jev,在自家任务上准确率也不总是更好。Jev 那边也有第三方佐证——Vercel 把命令安全分类器从某个 OpenAI 模型换成 Jev 后,报告了 5 到 18 倍的提速与更准的判定。
概率不等于正确:校准的边界
最容易被误读的一点是「概率」。校准良好的概率不代表模型是对的,它只保证答案落在预先设定的选项之内——如果设计选项的人漏掉了一类情况,决策模型照样会自信地从剩下的选项里挑一个。所以把人类移出闭环的前提,是这些概率在真实业务流里长期站得住,而这恰恰是独立测试还没有给出的部分。对工程团队来说,合理的做法是把决策模型当作可回退的一层:先让它处理那些答错代价低、事后可复核的判断,把审计日志、置信度阈值和人工兜底保留在自己的系统里。
对 GEO 与内容生态的连带影响
还有一个常被忽略的连带影响:当越来越多软件把「怎么做」交给大模型、把「该不该做」交给决策模型,整个链路就出现了两个可被追责的接口。第一个是输入状态——智能体看到的究竟是什么信息;第二个是概率判定——它在什么阈值上放行。前者决定了 AI 依据什么信息作决定,后者决定了这个决定有多容易被解释。对做 GEO 与 AI 可见度的团队来说,这意味着优化对象要从「怎么写更容易被引用」,下探到「被引用的信息是否可核实、是否经得起复核」。AI 系统一旦开始对自己的判断给出概率,信源质量就不再只是曝光问题,而是成了风控参数。
分层之后,智能体的账才算得清
把这件事压缩成一句话:智能体的能力正在分层,贵的模型负责难的部分,便宜且可校准的模型负责多而轻的部分。对开发者,它意味着架构里要多留一个「决策层」,并想清楚哪些判断可以外包给概率;对采购方,它意味着评估清单上要加一栏延迟与单位成本;对内容与 GEO 从业者,它意味着 AI 的每一次取舍,最终都会追溯到某一段可核实的文字上。Clef 是开源的,这一点比它的基准分数更值得注意——当一个想法被三家公司在三周内重复实现,并且其中一家把权重放出来,它通常就不再是概念,而是下一轮基础设施的默认件。
想了解 Clef 的骨干模型,可以看我们对 通义千问 的收录页;Clef 与 Clef-flash 的开放权重发布在 Hugging Face 的收录页。
(文 / AI30媒体部 | 2026年10月4日)



