5.5 家族的第二款:定位与定价
当地时间 9 月 28 日,Anthropic 发布 Claude Sonnet 5.5,这是 Claude 5.5 系列自上周 Opus 5.5 之后的第二款模型,定位中档,面向日常企业任务:编码、文档创建、演示文稿与表格。定价与上一代 Sonnet 5 完全持平——每百万输入词元 2 美元、输出 10 美元、缓存读取 0.2 美元;模型已在 Claude 平台上线,并同步登陆亚马逊云科技、谷歌云与微软 Azure,接口标识为 claude-sonnet-5-5。路透社的报道口径还提到,这家公司正处在上市筹备阶段,Sonnet 5.5 是其产品线扩张动作的一部分。
效率是这次升级的主线。官方口径称 Sonnet 5.5 运行速度较 Sonnet 5 提升逾三成,且由于完成同样工作所需词元更少,实际任务成本最高可降三成——注意这两组数字都是厂商自述,实际账单取决于具体负载结构。按标价推算,同样的任务量在 Sonnet 5.5 上的开销约为 Opus 5.5(输入 4 美元、输出 20 美元每百万词元)的一半以下。面向高吞吐场景的 Haiku 5.5 也已宣布在途,5.5 家族的三档梯队就此成形。
跑分跳升,但要看清口径
最能说明代际差距的数字是 Terminal-Bench 4.0:Sonnet 5.5 得分 70.6%,上一代 Sonnet 5 只有 10.3%。不过官方脚注给了两条限定:Opus 5.5 的成绩按 Xhigh 努力档报告,而 Sonnet 5.5 在 Max 档的分数反而低于 Xhigh 档;另一项 FrontierCode 评测(衡量代码改动能否不经人工编辑直接合并)中,Cognition 检查的两个案例里,模型更频繁地调用代码评审技能、把审查拆给多个子代理,导致超时或超出任务范围的额外编辑而丢分。把低分的归因写进脚注,而不是只挑好看的数字,这份评测透明度本身值得记录。Artificial Analysis 还披露,其预发布部署曾存在一个影响结构化输出请求的缺陷,可能压低 GDPval-AA 与 AA-Briefcase 成绩,现已修复。
安全防护向旗舰看齐
能力升级伴随安全配置的同步抬升。网络安全方面,Sonnet 5.5 的攻防能力较 Sonnet 5 有明显跃升,Anthropic 给它配了一套与 Opus 5.5 类似的防护:常规开发中的找 bug、修 bug 不受影响,更高风险的网络安全任务会被显式回退到上一代 Sonnet 5 处理;网络防御者后续可申请扩容后的网络验证计划,按分级获取更高级能力。生物安全沿用 Sonnet 5 的既有护栏,多数科研、教育与临床请求不受影响。更值得留意的是防蒸馏:针对用海量假账号在工业规模上「抽取」模型能力的攻击,Sonnet 5.5 成为 Sonnet 系列里发布时即搭载防推理提取安全分类器的型号,并扩展了「保留思考」机制,让思维链与创建账号绑定、不可拆分转移。全平台继续支持零数据保留。
中档战场与发布节奏的张力
中档模型是企业预算的主力消耗区,也是各家价格竞争的正面战场。路透社口径称 Anthropic 企业客户约占其业务八成,客户名单包括 Salesforce、Databricks、高盛与诺和诺德——这些客户买的就是「够用、便宜、稳定」的中档模型,Sonnet 5.5 的定价不变加效率提升,等于在中档位发起一轮隐性降价。同场竞技的还有 OpenAI 与谷歌的同档产品,后者近期也在快速迭代。
另一层张力来自节奏本身:首席执行官阿莫代伊本月初刚呼吁全球 AI 界放慢前沿能力的发布速度、让安全工作跟上,而 Anthropic 自己在一个月内连发两款 5.5 模型。两件事并不直接矛盾——发布节奏与能力边界是两回事——但它把一个现实问题摆在台面上:安全承诺与商业节奏的平衡点,最终由每家公司自己拿捏。从 Opus 到 Sonnet 再到即将到来的 Haiku,5.5 家族的完整落地速度,恰好可以作为观察这家公司言行一致程度的样本。迁移方面有一个小变更:以关闭思考模式运行 Sonnet 的开发者需要切换到新的 between_tools 设置,官方文档已给出迁移指引。