五次延期之后的登场

据多家媒体报道,xAI 于 9 月 21 日发布新一代模型 Grok 4.7,此前该模型的发布至少推迟过五次。马斯克 8 月中旬曾放话它将「超过市面上所有模型」,9 月中旬口径收缩为「大致相当于 Claude Opus 5.0」,到发布当天,宣传语已经变成「智能、速度与低成本的有力组合」。预期管理一路收缩的轨迹,本身就是一个值得记录的样本。

配置上,据第三方报道,Grok 4.7 参数规模约 2.1 万亿,较上代 Grok 4.6 的 1.5 万亿增长约四成(xAI 官方规格页未公布确切数字);上下文窗口 50 万词元;API 定价维持每百万词元输入 2 美元、输出 6 美元不变,超过 20 万词元的请求上浮至 4/12 美元,另有速度加倍、价格同倍的 Fast 档。模型已上线 Grok 应用、xAI API、Cursor、Grok Build 与 OpenRouter 等渠道,并在发布当天进入 GitHub Copilot 全部套餐。

跑分:自报与复测之间的落差

xAI 自报的对比表里,Grok 4.7 相较上代全面进步:CursorBench 4.0 从 40.4% 升至 46.3%,DeepSWE v1.1 从 65.2% 升至 71.0%,Terminal-Bench 4.0 从 20.3% 升至 38.0%,电气工程评测 EEBench 达到 64.0%,法律评测 Harvey Legal Agent 拿到 19.6%,GDPval 的 Elo 得分为 1695。不过在这张自报表格里,Claude Fable 5.1 仍在多数行次领先,Terminal-Bench 一项 Fable 5.1 高出近 20 个百分点。

独立复测的落差更值得注意:评测机构 Artificial Analysis 在标准化条件下复测 Terminal-Bench 4.0,Grok 4.7 仅得 26%,而同表 GPT-6 Astra 为 60%、Claude Fable 5.1 为 55%。自报 38% 与复测 26% 之间的 12 个百分点,正是「各家在自选最高推理档位下自测」与「统一条件复测」之间的距离——这也是为什么每一份厂商对比表都需要独立口径交叉验证。

Terminal-Bench 4.0:自报 38% vs 独立复测 26%GPT-6 Astra(复测)60%Fable 5.1(复测)55%Grok 4.7(自报)38.0%Grok 4.7(AA 复测)26%词元膨胀:单任务平均输出 Grok 4.6 约 3.6 万 → Grok 4.7 约 8.1 万(AA 口径)自报口径为厂商自选推理档位,复测为标准化条件;单任务成本约 3.74 美元高于输出单价更贵的 GPT-5.6 Sol(约 1.99 美元)
Terminal-Bench 4.0 口径对比与单任务输出词元膨胀

价格牌的另一种算法

定价没有涨,账单未必。Artificial Analysis 的口径显示,Grok 4.7 在 xHigh 档位下完成一项智能指数任务平均输出约 8.1 万词元,而 Grok 4.6 在 High 档位约为 3.6 万——同样的任务,输出量多出逾一倍。折算下来,Grok 4.7 单任务成本约 3.74 美元,反而高于输出单价更贵的 GPT-5.6 Sol(约 1.99 美元)。单价便宜与总账便宜,在这代模型上分道扬镳:强化学习刻意加权长任务,「过度思考」带来的词元膨胀,正在成为低价模型的新型隐性成本。Fast 档把这个问题放得更大——速度加倍、价格加倍,而词元消耗本身没有变少。

SpaceX 数据入模

训练侧的一个新变量是数据:据报道,xAI 此次将 SpaceX 的星链卫星遥测数据、制造记录与工程故障日志纳入训练集,用以提升模型对硬件与物理系统的推理能力。这解释了它在电气工程评测上的相对强势,也提示了一条差异化路线——用自有工程闭环数据构建别人难以复制的语料护城河。故障日志这类「负样本」入模对硬件相关任务的实际增益,值得单独跟踪。

冷静看:位置与定位

综合各口径,Grok 4.7 在 Artificial Analysis 综合智能指数取得 46 分,处于第二梯队前列,与前沿阵营仍有可见差距;马斯克在发布后也坦承智能体编程仍排在 Anthropic 与 OpenAI 之后。它的定位更接近「够用、便宜、到处可用」:适合对精度不敏感的高频编码辅助、生态内集成与容灾备选。至于预告中的 Grok 4.8、4.9 与 Grok 5,均未给出时间表。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。