智能体赛道里,最容易被忽略的一类公司,是给 Agent 提供「算力底座」的那群。模型再聪明,训练它、跑它的 GPU 集群要是动不动掉链子,一切免谈。10 月 5 日的一笔融资把这条隐线摆到了台前:Clockwork.io 完成 3100 万美元融资,由 Premji Invest、Wing VC、Seligman Ventures 联合领投,NEA 与 e& Capital 跟投,累计融资来到 7300 万美元。它卖的不是模型,而是「算力别掉线」。
把训练的有效吞吐损失压下来
Clockwork.io 的核心产品是 ClusterMAX 与 TorchPass,盯的是大模型与 Agent 训练里的「有效吞吐(goodput)损失」——也就是明明买了算力,却因为中断、重试、无效计算而白白浪费的那部分。官方给出的数字颇具象:TorchPass 把一个金牌评级的新云训练有效吞吐损失从约 14 个百分点压到 3 个百分点以内。背景很说明问题:Meta 曾披露,Llama 3 在 16384 张 GPU 上训 54 天,大约每 3 小时就出现一次意外中断。按这个频率,一个集群月月都在浪费大量 GPU 小时,而 Clockwork 称其方案每月能为集群省下数万 GPU 小时。
把它放回当天的融资盘面看更有意思。有统计显示,10 月 5 日当天 1.49 亿美元的新融资里,专门给智能体基建的三笔(Namespace、Clockwork.io、OneByZero)占了约 62%。钱正涌向 Agent 之下那层「水电煤」,而不是最上层的单点应用。Namespace 解决的是编码与构建测试循环,OneByZero 解决的是受监管企业的前向部署,Clockwork.io 解决的是算力本身的可靠性——三者拼起来,正好是把 Agent 跑起来所需的地基。
可靠性正在变成可单独计价的层
这件事的增量认知在于:当 Agent 工作负载放大,算力的「不掉线」从运维细节,升级成了一个可以单独采购、单独讲 ROI 的产品。过去 GPU 可靠性是云厂商内功,客户感知不到、也不单独付费;现在有人把它做成可量化节省(省下多少 GPU 小时、降低多少 goodput 损失)来卖,说明底座层也开始出现垂直分工。对跑大规模训练或长程 Agent 的团队,这类「 picks-and-shovels 」生意的价值很实在:它不直接决定 Agent 聪不聪明,却决定你花出去的算力有多少真正变成了产出。
它的天花板在哪
但理性看待,这仍是一笔融资公告,不是大规模采用的证据。这类可靠性能力的护城河,部分来自对调度与中断的精细处理,可一旦 hyperscaler 把类似能力做进自家平台、或硬件本身的稳定性提升,外部专门层的空间会被挤压。此外,不同工作负载对中断的敏感度差异很大,省下的 GPU 小时能否在每个客户身上都兑现,取决于其训练拓扑是否真的长程、易碎。对投资方来说,赌的是「Agent 经济越热闹,底座越值钱」;对采用方来说,更该看的是自己集群的实际 goodput 曲线,而不是宣传里的百分比。
把 Clockwork.io 和同日的 Namespace、OneByZero 放一起,一个趋势浮出水面:智能体赛道的资本,正从「赌哪个 Agent 最出圈」转向「赌让 Agent 跑得起来的基础设施」。模型能力会被快速拉平,真正难复制的是底下那套把算力、构建、部署都变得可靠可计价的工程体系。当行业还在追热点应用时,愿意给「不停电」付钱,本身就是成熟的一个信号。