一句话:把「做选择」从大模型手里拆出来,交给一个快而专的模型

Cloudflare 近期发布 Clef 与 Clef-flash 两款决策模型,思路很直接:当智能体只需要在一组有限的预定义答案里做判定时,不必每次都调用动辄上千毫秒的大语言模型,而是交给一个专门输出概率分布的轻量模型,中位延迟可以压到 39 毫秒。换句话说,它把智能体回路里「选择」这一步,从通用生成模型手里拆了出来,变成一道又快又便宜的本地判定。这对那些需要高频、自动、无人工干预做限定的 Agent 而言,是一次工程上的减负。

传统大模型调用 与 Clef 决策模型 传统 LLM 判定延迟数百毫秒起常需人工复核 Clef 决策模型中位 39 毫秒可无人干预判定 适用:选项有限的分类、路由、放行等限定判定不适用:开放生成、需要推理或长上下文的任务延迟与成本是工程指标,可靠性还需独立校验
图 1|Clef 把「选择」变成一道低延迟判定,但只覆盖选项有限的场景。

Clef 是什么:给有限选项打分的决策模型

和通用大模型不同,Clef 不负责「写一段话」,而是针对开发者预先定义好的一组答案,输出每个答案的概率。智能体在运行时把当前状态喂给它,拿到一个概率分布,再按阈值决定走哪条分支。这种「决策模型」的定位,类似于把分类器做进 Agent 的执行回路:它能判断「这条工单该转给谁」「这个请求能不能放行」「这句话属于哪一类意图」,而不必让大模型现编一个理由。Cloudflare 把它定位为让 Agent 在无人干预下行动的引擎。

为什么重要:人类在环的成本,正在被延迟与规模放大

很多生产级 Agent 卡住的地方,不是不会做,而是要不要让人确认。每一次人工介入,都意味着一次等待、一次上下文切换、一次成本。当智能体每天要处理上万次同类判定,把其中限定范围内的那部分自动化,省下的不只是延迟,还有一整条人工审核链。Clef 的价值不在于取代大模型,而在于把那些「其实不需要大模型」的判定挪出来,让贵的模型只用在真正需要推理的地方。这是一种典型的成本控制思路,也呼应了近几个月行业对「控制平面」与「按结果计费」的讨论。

Clef 在智能体回路中的位置 感知状态 Clef 判定 执行动作 越界判定(开放、高风险)→ 交回大模型或人工 39 毫秒级判定,把热路径从大模型调用中解放出来
图 2|限定范围内的判定走 Clef,越界的回到大模型或人工;回路因此更短。

39 毫秒意味着什么:把判定压进热路径

39 毫秒的中位延迟,在工程上意味着这个判定可以放在请求的关键路径里,而不会明显拖慢体验。对实时客服、风控分流、内容路由这类「每一步都要快」的场景,延迟从几百毫秒降到几十毫秒,往往决定了这套自动化能不能真的上线。Cloudflare 把这类模型放进自己的边缘网络,也符合它一贯的产品逻辑:把计算推到离用户最近的地方。需要说明的是,延迟是厂商自测口径,真实业务里的端到端耗时还受调用链与上游影响。

适用边界:预定义答案里的自主,不是无界自由

必须划清边界。Clef 的自主,是「在开发者给好的选项里选」,不是「自己决定能做什么」。一旦任务超出预定义答案集合,或者需要解释、推理、生成,它就不合适。这也正是它安全的来源:能力被框在选项集合里,出错半径可控。对想把 Agent 真正无人化的团队,这类决策模型适合做「限定向导」,而不是做「总指挥」。把它当成总指挥,恰恰是把自主权放到了最不可控的地方。

风险与校准:概率高不等于可以对

决策模型输出的是概率,而概率高不代表一定对,尤其在分布偏移或对抗样本下。把它接进生产,需要配套阈值、回退与监控:哪些判定允许全自动、哪些必须留人工兜底、错了怎么追溯。Cloudflare 强调「无需人在环」是能力描述,不等于「无需治理」。对金融、医疗这类错一次代价高的行业,概率模型的上线仍需留审计与急停。关于 Clef 的定价、可用区域与评测基准,官方及行业暂未披露更多细节。

结语

Clef 的意义,是给智能体工程补了一块常被忽略的拼图:把「做选择」从大模型里拆出来,变成一道低延迟、可量产的判定。它不会让 Agent 更聪明,但可能让更多 Agent 真的跑起来——前提是团队清楚哪些选择该交给它,哪些必须自己留着。