长程智能体任务有个不太体面的经济学事实:跑得越久,账单里为「死上下文」付的比例越高。一个编码智能体修一个顽固 bug,会读文件、跑测试、看报错、改函数、再跑测试——几轮下来,早期的猜测、过期的日志、同一异常的第六次解释都还挂在上下文里,每次推理都要重新背一遍。MIT 衍生的初创公司 Subconscious 想把这部分死重直接在推理服务层清掉。9 月 22 日,这家总部位于剑桥(波士顿地区)的公司宣布完成 510 万美元融资,横跨种子前与种子轮,由 MassVentures 领投,Foothill Ventures、Underscore VC、E14 Fund、Oakseed Ventures 与 Agent Fund 参与。
两位创始人分别管研究与商业:Hongyin Luo 是 MIT CSAIL 的研究者,也是其论文《Beyond Context Limits: Subconscious Threads for Long-Horizon Reasoning》(2025 年 7 月)的一作;CEO Jack O'Brien 是连续创业者,曾在 Google 做软件工程师。学术底子加本地资本——MassVentures 是马萨诸塞州的机构——是这个故事的地区底色。
OrangeLine 干了什么
公司的核心产品是名为 OrangeLine 的推理运行时,定位是 vLLM、SGLang 这类推理框架的替换件,为智能体轨迹而非一问一答的聊天负载调校。机制上分三层:消息打分——轨迹推进时逐条评估内容的相关性;就地压缩——低相关片段在 GPU 上被压缩处理,KV 缓存在运行中被修剪、显存被释放,同一批卡因此能接着跑而不是中途换页;双侧缓存复用——常规前缀缓存只复用切点之前的内容,OrangeLine 在剪掉一段后保留后缀的 KV 状态,切点之后的 token 无需重新编码。
产品形态上,它同时提供云端与自托管部署,配套一族带「Marathon」后缀的开放权重模型,包括 Qwen3.8 27B、Nemotron 3 Ultra、GLM 5.3 与 DeepSeek V4 Vision——模型与运行时协同设计,源自前述论文中的 Thread Inference Model(TIM)路线:把推理组织成任务、子任务与结论的树,而非线性序列。
数字好看,但要打折听
厂商口径的数字相当激进:有效上下文超过 500 万 token;相同芯片与模型下持续吞吐提升 3.5 倍、长任务成本下降约八成、并发能力提升 2.3 倍;计费示例里 75 万有效上下文的任务,计费 token 从 2.816 亿压到 0.962 亿,单次智能体运行比 Opus 5 便宜 6.3 倍、比标准 GLM-5.3 便宜 2.9 倍。代码评测对照是 DeepSWE 上跑 GLM-5.2:解题率 46% 对标准推理设施的 44%,平均成本 2.79 美元对 3.92 美元。另有案例称一个 20 人团队从 Claude 切到其托管的 GLM-5.2 后,月支出从 4 万美元降到 6 千美元。
这些数字有两个共性的保留项:其一,全部为厂商自述,评测集与复现细节未公开,两个百分点的解题率差加三成成本差的组合,需要第三方在同等条件下复算;其二,那个降本 85% 的案例里模型和基础设施同时换了,压缩本身的贡献无法单独分离。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
但把这条融资放进近期的时间线里,方向感是成立的。就在同一周,Harvey 的毛利率过山车说明应用层正在用模型路由治理长任务账单;而 Subconscious 给出的是更底层的同一道题的另一种解法——应用层换便宜模型,服务层让模型少背没用的上下文。三条路线(路由、运行时压缩、外挂记忆件)干预点不同、可以叠加,谁吃掉哪一段成本,接下来一年会很值得看。