过去一周,AI 行业流传最广的财务数字,不是哪轮融资的金额,而是一个毛利:-50%。据彭博 9 月 21 日报道,估值 156 亿美元的法律 AI 公司 Harvey,毛利率从年初的约 50% 一路跌到 6 月的负 50%——卖一美元的软件服务,成本大约一块半。把这门生意从亏损里捞回来的,是一个底座来自中国开源权重模型的自有模型。整件事的来龙去脉,值得每个做智能体产品的人掰开看。

账是怎么崩的

时间线不复杂。Harvey 的产品按席位向律所收固定年费,用多用少一个价;它的模型成本端却跟着 OpenAI 和 Anthropic 的 token 账单走。这两件事原本相安无事,直到今年 3 月——Harvey 发布了一次重要的智能体更新,律所里从一周跑一次查询的合伙人,变成了让尽职调查智能体通宵啃整个数据室的团队。据彭博援引知情人士的说法,客户用量飙升,公司今年的 token 用量涨了约二十倍,毛利率随之从年初约 50% 的水平,到 6 月跌成负 50%。

麻烦的地方在于:收入涨得并不慢。媒体汇编口径显示其 ARR 从年初约 1.9 亿美元涨到年中超过 4 亿美元;而联合创始人此前在 5 月的公开口径是约 3 亿美元。两组数字归因口径不同、未经审计,暂且并列放着——但无论取哪个,结论一致:收入翻倍,成本涨得比收入更快,智能体的每一次多轮调用、每一次重读上下文、每一次重试,都在成本端留下记号,而定价端纹丝不动。

Harvey 2026 年毛利率过山车(彭博报道口径)50%0-50%年初约 50%3 月智能体更新6 月 -50%8 月 Tenet 上线重新转正同期 token 用量涨约二十倍;ARR 口径:年初约 1.9 亿美元,年中媒体汇编口径超 4 亿美元
图 1|用量涨二十倍、收入翻倍,毛利却从 50% 打到 -50%:定价结构与成本曲线的错位是根因。

修复方案:不是砍成本,是分诊

8 月,Harvey 发布了自有模型 Tenet。它的底座不是从零训练,而是月之暗面(Moonshot AI)的 Kimi K3 开源权重——公司工程博客称,团队与 Fireworks 的研究团队一起,针对长程法律工作做了后训练。按公司口径,部分审阅类任务的单位成本降到约十分之一,某个功能的单次查询成本下降约 90%;彭博报道称,切换之后毛利率在 8 月重新转正。

这里有一个容易被误读的地方:Tenet 上线不等于 Harvey「离开」了前沿模型。Anthropic 侧的说法是,Harvey 最复杂的任务仍然依赖 Claude Opus;Harvey 自己的平台也允许律所在多个模型之间路由。真正的动作是把任务分布拆开——大批量、重复性高的审阅工作挪到便宜的自有模型上,真正难的推理留在前沿模型那里。这不是独立宣言,是分诊台。

Tenet 上线后的分诊路由:把贵活和便宜活分开智能体任务进来按难度与类型分诊大批量常规工作Tenet:Kimi K3 开源权重底座与 Fireworks 联合后训练公司口径:部分审阅任务单位成本约十分之一最难的推理任务继续走 Claude OpusAnthropic 口径:复杂任务仍依赖不是「离开前沿模型」,是分诊同浪潮:Abridge 基于英伟达开源模型建临床模型,Decagon 八成流量走自有模型怀疑声也有:Menlo 合伙人把「人人自研模型」的叙事称作表演,护城河要看任务分诊是否真量得准
图 2|修复不是砍成本,是重新画任务难度分布:便宜的模型接量,贵的模型留难题。

这不是一家公司的遭遇

同一篇彭博报道里,还有一串名字在走同一条路:医疗记录公司 Abridge 宣布基于英伟达开源模型为临床场景自建基础模型;客服智能体公司 Decagon 称八成查询已经走自有模型;金融科技公司 Ramp 与 Rogo 开始探索自训模型——Ramp 联席 CEO Karim Atiyeh 说,过去训练专属模型在经济上不成立,但随着 6 月 7.5 亿美元融资落袋、开源权重性能大幅跃升,「这个逻辑正在逆转」。红杉资本与 General Catalyst 等机构也在推波助澜。怀疑的声音同样存在:Menlo Ventures 的一位合伙人把「人人都要自研模型」的叙事称为表演(cosplay),认为多数公司并没有训练模型的真实需求。

两端都有道理,分歧的根源在于各自盯着不同的成本结构。对用量平稳、任务单一的产品,自研模型的固定投入确实不值;但对智能体产品,用量曲线随功能迭代随时可能跳变——Harvey 的 3 月就是明证。一位投资人的评论说得更刻薄:把 GMV 改名叫 ARR,是这轮行业里最大的注水;那些「一年做到 1 亿美元 ARR」的标题,经不起月度报表和毛利的核验。这话针对的不只是 Harvey,而是所有用收入叙事掩盖成本结构的智能体公司。

留给行业的三道算术题

把 Harvey 的过山车抽象一下,是三道每个智能体团队都躲不开的算术题。其一,定价结构要跟成本结构同构:按席位收固定费、按 token 付变动成本,中间的敞口会随智能体化持续放大——连 Uber 都被媒体曝出因鼓励工程师放开用 Claude Code,4 月就烧完了全年 AI 预算(报道口径)。其二,监控指标要换:看「每次调用多少钱」没用,要看「每个完成的任务多少钱」,并且按任务类型、按版本分别记——Harvey 从信号出现到毛利率过零线,中间隔了好几个月。其三,模型路由的前提是知道任务难度分布:把一切路由给好模型只是一行配置,代价要等账单来了才知道。

对照着看,法律 AI 这门生意的另一面也在给出参照:竞品 Legora 公司口径称月活律师 13 万、覆盖 2100 家律所、ARR 突破 2 亿美元,媒体报道其正在洽谈新一轮融资。两家公司一个在修成本结构,一个在冲规模指标,而资本市场对两者的定价都不低——这恰恰说明,智能体应用层的估值逻辑还没被毛利表约束。值得一提的是,厂商侧已经出现镜像动作:SAP 的 AI Units、微软的 Copilot Credits、按解决次数与业务成果计费的 Salesforce,都在把「用量」写进对客户端的价目表。客户端开始按量收钱,成本端却没有按量对冲,Harvey 只是把这道裂缝撞开了给大家看。

Harvey 的故事里没有反派。模型按 token 收费没有错,按席位卖订阅也没有错,错的是默认智能体的用量会像人类用户一样平稳。开源权重模型的性能跃升,把「自研分诊模型」从主权叙事变成了 CFO 议题——这是这轮过山车留下的、比 -50% 这个数字更持久的东西。至于 Harvey 转正后的具体毛利水平、Tenet 承接的流量占比,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。