DevDay 上 OpenAI 端出的 GPT-6.1 Sol,容易被误读成「又一个更快的小模型」。它的真实意义不在基准高低,而在单位成本:在同等口径下,Sol 的 token 价格约为 GPT-6 Astra 的五分之一,并跑在一条标称每秒三百 token 的高速通道上。对要做多步智能体的团队,这条曲线比任何榜单都更关键——因为常驻智能体要持续跑成千上万步,单步成本一旦掉下来,按 token 计费的多步循环才真正跑得动。
把 Sol 放回模型家族里看,它延续的是一条「中坚层」思路:不追最顶的榜单,而是在精度可接受的前提下把成本与延迟压到能常驻跑。过去一年多家实验室都在做类似的事——把前沿能力往更小、更便宜的模型上蒸馏或后训练,让高频的智能体循环不必每次都调最贵的旗舰。Sol 的特别之处,是它把这条思路明明白白绑到了 agentic workflow 上,而不是通用聊天。这也解释了为什么它和 Dots 这类常驻智能体是同一场发布里的两条线:一条把智能体做出来,一条把跑智能体的成本放开。
把数字摆开看。OpenAI 给出的口径里,Sol 在低推理努力下把困难提示的事实错误率从 11.4% 压到 7.7%,整体精度落在 Astra 的 1.9% 以内。也就是说,它牺牲的只是极少量的顶级精度,换来的却是五分之一的单价和每秒三百 token 的吞吐。这里有个前提要讲清楚:峰值性能需要把调用路由到那条 Ultrafast 高速通道,标准配额下可能触发动态回落。对高频率的编码智能体、终端实时 coding agent,这类持续低延迟生成才是刚需,而不是偶尔跑一次的重磅推理。
为什么这件事要和智能体绑在一起说?因为 Sol 的官方定位就是 coding、computer use 和企业工作流——这些全都是多步、反复调用模型的场景。Dots 这类常驻在 Slack、Teams 里持续跑的智能体,每一轮都要规划、调工具、做复核,是一个不断消耗 token 的循环。当每步成本降到 Astra 的五分之一,长期常驻才从「烧钱实验」变成「可负担的默认形态」。换句话说,Sol 不是让智能体更聪明,而是让智能体更便宜地反复跑——这正是规模化的开关。
把视角拉宽,Sol 反映出一条正在成形的行业规律:智能体落地的瓶颈,越来越多地从「模型够不够强」转到「每一步够不够便宜」。过去一年,各家的发力点之一是把前沿能力往更小、更便宜的模型上蒸馏或后训练,让高频 agentic 循环不必每次都调最贵的旗舰。对做产品的团队,选型时该问的不再是「哪个模型分最高」,而是「在目标工作流里,每成功一步的单位成本与延迟是多少」。Sol 这类高速子旗舰,正是冲着这个问题的。
当然也别把它神化。Sol 的取舍是明确的:它追的是 Astra 九成九以上的精度,而非超越;高速通道的可用性取决于路由与配额,并非免费午餐。对延迟不敏感、一次性重推理的任务,旗舰仍更合适。更务实的读法,是把 Sol 看作「智能体经济学」里的一块拼图——当常驻、多步、跨应用的智能体成为默认形态,一个便宜且够快的中坚模型,比偶尔惊艳的旗舰更能决定这类产品能不能规模化。
落到工程决策,建议是:先把要常驻跑的工作流拆成「每步在干什么、每步成本多少」来算账,再决定旗舰与子旗舰怎么配比。对绝大多数高频、低延迟、容得下轻微精度折损的环节,像 Sol 这样的子旗舰可能是更优解;把旗舰留给真正需要深度推理的少数关键步。智能体的成本结构,往往就是这么一分一厘抠出来的。