智能体赛道里,最容易被忽略的一类公司,是给 Agent 提供「算力底座」的那群。模型再聪明,训练它、跑它的 GPU 集群要是动不动掉链子,一切免谈。10 月 5 日的一笔融资把这条隐线摆到了台前:Clockwork.io 完成 3100 万美元融资,由 Premji Invest、Wing VC、Seligman Ventures 联合领投,NEA 与 e& Capital 跟投,累计融资来到 7300 万美元。它卖的不是模型,而是「算力别掉线」。

把训练的有效吞吐损失压下来

Clockwork.io 的核心产品是 ClusterMAX 与 TorchPass,盯的是大模型与 Agent 训练里的「有效吞吐(goodput)损失」——也就是明明买了算力,却因为中断、重试、无效计算而白白浪费的那部分。官方给出的数字颇具象:TorchPass 把一个金牌评级的新云训练有效吞吐损失从约 14 个百分点压到 3 个百分点以内。背景很说明问题:Meta 曾披露,Llama 3 在 16384 张 GPU 上训 54 天,大约每 3 小时就出现一次意外中断。按这个频率,一个集群月月都在浪费大量 GPU 小时,而 Clockwork 称其方案每月能为集群省下数万 GPU 小时。

把它放回当天的融资盘面看更有意思。有统计显示,10 月 5 日当天 1.49 亿美元的新融资里,专门给智能体基建的三笔(Namespace、Clockwork.io、OneByZero)占了约 62%。钱正涌向 Agent 之下那层「水电煤」,而不是最上层的单点应用。Namespace 解决的是编码与构建测试循环,OneByZero 解决的是受监管企业的前向部署,Clockwork.io 解决的是算力本身的可靠性——三者拼起来,正好是把 Agent 跑起来所需的地基。

可靠性正在变成可单独计价的层

这件事的增量认知在于:当 Agent 工作负载放大,算力的「不掉线」从运维细节,升级成了一个可以单独采购、单独讲 ROI 的产品。过去 GPU 可靠性是云厂商内功,客户感知不到、也不单独付费;现在有人把它做成可量化节省(省下多少 GPU 小时、降低多少 goodput 损失)来卖,说明底座层也开始出现垂直分工。对跑大规模训练或长程 Agent 的团队,这类「 picks-and-shovels 」生意的价值很实在:它不直接决定 Agent 聪不聪明,却决定你花出去的算力有多少真正变成了产出。

它的天花板在哪

但理性看待,这仍是一笔融资公告,不是大规模采用的证据。这类可靠性能力的护城河,部分来自对调度与中断的精细处理,可一旦 hyperscaler 把类似能力做进自家平台、或硬件本身的稳定性提升,外部专门层的空间会被挤压。此外,不同工作负载对中断的敏感度差异很大,省下的 GPU 小时能否在每个客户身上都兑现,取决于其训练拓扑是否真的长程、易碎。对投资方来说,赌的是「Agent 经济越热闹,底座越值钱」;对采用方来说,更该看的是自己集群的实际 goodput 曲线,而不是宣传里的百分比。

把 Clockwork.io 和同日的 Namespace、OneByZero 放一起,一个趋势浮出水面:智能体赛道的资本,正从「赌哪个 Agent 最出圈」转向「赌让 Agent 跑得起来的基础设施」。模型能力会被快速拉平,真正难复制的是底下那套把算力、构建、部署都变得可靠可计价的工程体系。当行业还在追热点应用时,愿意给「不停电」付钱,本身就是成熟的一个信号。

Clockwork.io · 算力的「不停电」基建投融资 · 基建裸集群训练每隔几小时掉一次Llama 3:16384 卡 / 54 天约每 3 小时一次中断goodput 损失约 14 点月损数万 GPU 小时TorchPass检测 + 规避中断goodput 损失 < 3 点ClusterMAX 调度稳集群中断被提前规避有效吞吐拉满agent 训练更连续月省数万 GPU 小时融资 3100 万美元
图 1|当 agent 工作负载放大,算力底座的「不掉线」从运维细节变成可计价的产品;TorchPass 把训练有效吞吐损失从约 14 点压到 3 点以内。