长程智能体任务有个不太体面的经济学事实:跑得越久,账单里为「死上下文」付的比例越高。一个编码智能体修一个顽固 bug,会读文件、跑测试、看报错、改函数、再跑测试——几轮下来,早期的猜测、过期的日志、同一异常的第六次解释都还挂在上下文里,每次推理都要重新背一遍。MIT 衍生的初创公司 Subconscious 想把这部分死重直接在推理服务层清掉。9 月 22 日,这家总部位于剑桥(波士顿地区)的公司宣布完成 510 万美元融资,横跨种子前与种子轮,由 MassVentures 领投,Foothill Ventures、Underscore VC、E14 Fund、Oakseed Ventures 与 Agent Fund 参与。

两位创始人分别管研究与商业:Hongyin Luo 是 MIT CSAIL 的研究者,也是其论文《Beyond Context Limits: Subconscious Threads for Long-Horizon Reasoning》(2025 年 7 月)的一作;CEO Jack O'Brien 是连续创业者,曾在 Google 做软件工程师。学术底子加本地资本——MassVentures 是马萨诸塞州的机构——是这个故事的地区底色。

OrangeLine:在推理服务层压缩上下文,而不是在应用层做摘要长程智能体轨迹:几百步、几十万 token,大量内容几轮之后就不再被需要消息打分轨迹推进时逐条评估低相关片段就地压缩GPU 内修剪 KV运行中释放显存同一批卡继续跑双侧缓存复用切点后缀状态保留后文无需重编码与既有前缀缓存的差别:常规方案只复用切点之前,这里切点两侧都可复用定位:替换 vLLM / SGLang 的推理层组件,云上与自托管均可部署厂商口径:有效上下文 500 万 token 以上,同卡并发提升 2.3 倍
图 1|干预点在 serving 层:让模型少背已经没用的上下文,而不是让应用层做摘要。

OrangeLine 干了什么

公司的核心产品是名为 OrangeLine 的推理运行时,定位是 vLLM、SGLang 这类推理框架的替换件,为智能体轨迹而非一问一答的聊天负载调校。机制上分三层:消息打分——轨迹推进时逐条评估内容的相关性;就地压缩——低相关片段在 GPU 上被压缩处理,KV 缓存在运行中被修剪、显存被释放,同一批卡因此能接着跑而不是中途换页;双侧缓存复用——常规前缀缓存只复用切点之前的内容,OrangeLine 在剪掉一段后保留后缀的 KV 状态,切点之后的 token 无需重新编码。

产品形态上,它同时提供云端与自托管部署,配套一族带「Marathon」后缀的开放权重模型,包括 Qwen3.8 27B、Nemotron 3 Ultra、GLM 5.3 与 DeepSeek V4 Vision——模型与运行时协同设计,源自前述论文中的 Thread Inference Model(TIM)路线:把推理组织成任务、子任务与结论的树,而非线性序列。

数字好看,但要打折听

厂商口径的数字相当激进:有效上下文超过 500 万 token;相同芯片与模型下持续吞吐提升 3.5 倍、长任务成本下降约八成、并发能力提升 2.3 倍;计费示例里 75 万有效上下文的任务,计费 token 从 2.816 亿压到 0.962 亿,单次智能体运行比 Opus 5 便宜 6.3 倍、比标准 GLM-5.3 便宜 2.9 倍。代码评测对照是 DeepSWE 上跑 GLM-5.2:解题率 46% 对标准推理设施的 44%,平均成本 2.79 美元对 3.92 美元。另有案例称一个 20 人团队从 Claude 切到其托管的 GLM-5.2 后,月支出从 4 万美元降到 6 千美元。

长任务账单的三种砍法:路由、压缩、外挂记忆模型路由 / 分诊常规活给便宜模型难题留给前沿模型干预点:调度层代表:Harvey Tenet运行时压缩上下文死重就地清掉模型照旧,负载变轻干预点:serving 层代表:本篇 Subconscious外挂记忆产品应用侧选存与取数据层找答案干预点:数据层代表:向量库记忆件厂商给出的对照:DeepSWE 上 GLM-5.2 解题率 46% 对 44%,平均成本 2.79 美元对 3.92 美元两个百分点与三成成本差的组合尚需第三方复现,评测细节未公开案例口径保留:某 20 人团队月支出 4 万美元降到 6 千美元,但同期连模型也换了,压缩的贡献无法单独分离——这恰是判断此类基建叙事时要抠的地方
图 2|三条路线干预点不同、可叠加:Subconscious 押的是最底下一层,也最难被看见。

这些数字有两个共性的保留项:其一,全部为厂商自述,评测集与复现细节未公开,两个百分点的解题率差加三成成本差的组合,需要第三方在同等条件下复算;其二,那个降本 85% 的案例里模型和基础设施同时换了,压缩本身的贡献无法单独分离。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

但把这条融资放进近期的时间线里,方向感是成立的。就在同一周,Harvey 的毛利率过山车说明应用层正在用模型路由治理长任务账单;而 Subconscious 给出的是更底层的同一道题的另一种解法——应用层换便宜模型,服务层让模型少背没用的上下文。三条路线(路由、运行时压缩、外挂记忆件)干预点不同、可以叠加,谁吃掉哪一段成本,接下来一年会很值得看。