10 月 6 日上架:一次横跨七个入口的图像模型换装
谷歌于 10 月 6 日正式发布图像生成与编辑模型 Nano Banana 2.1,API 模型 ID 为 gemini-nano-banana-2.1,同步在 Gemini 应用、搜索 AI Mode、AI Studio、Flow、Stitch、Google Ads 与企业端平台铺开。配套动作相当决绝:上一代 Nano Banana 2 的稳定 API(gemini-3.1-flash-image)定于 10 月 29 日停服,开发者只有约三周时间迁移并重测提示词。三周内下线老模型,既说明谷歌对新版本的替换信心,也说明图像生成这条产品线已进入高速迭代的节奏——上一代 2 月才发布,八个月后就被自己的继任者逼退。
价格账本:图便宜了一半,图以外的东西贵了
这轮更新最硬的数字在定价页。图像输出词元单价从每百万 60 美元降到 30 美元,1K 分辨率单图从约 0.067 美元降到 0.0336 美元,2K 从 0.101 美元降到 0.0504 美元,批量接口再打对折。但另两行在涨价:输入词元从 0.50 美元涨到 1.50 美元,文本与思考输出从 3 美元涨到 7.50 美元。按第三方以谷歌定价页复算的例子,一条 1000 词元提示词返回一张 1K 图,2.1 约 0.035 美元、上一代约 0.068 美元——单请求确实省近一半。但对每次调用都塞入多张参考图、长 PDF 或视频的工作流,输入涨三倍会明显吃掉让利;4K 单图价格多家报道写 0.0756 美元,而谷歌定价页按 3780 词元计约 0.11 美元,口径尚未统一。
能力面:蒙版编辑、参考图与文字渲染
功能侧的变化集中在可控性。2.1 支持最多 14 张参考图(官方口径为至多 10 个物体与 4 个人物保持一致),蒙版编辑允许用户圈选局部、只改选中区域;1K/2K/4K 输出、最高 8:1 的宽高比、可调思考档位(默认 medium)以及联网检索真实世界主体,也都列入了模型卡。文字渲染是谷歌重点宣传的方向:官方信息图事实性得分从上一代的 0.179 提到 0.521。需要强调,这些成绩全部出自谷歌自评——人评 Elo 总分 1050(开启思考)对比上一代 990 与更贵的 Nano Banana Pro 935,独立评测尚未跟进,第三方竞技场榜单目前仍把它排在 GPT Image 2.5 各版本之后。
自家文档打架:底座到底是哪个模型
一个值得记录的细节是谷歌自家文档口径不一:DeepMind 发布的模型卡写明 2.1 基于 Gemini 3.6 Flash,而 Gemini API 文档却把它描述为对上一代底层 Gemini 3.1 Flash Image 的更新,两者显然不能同时成立,截至发稿谷歌未作澄清。模型卡同时坦承短板:1K 分辨率下小字仍易模糊,人物与参考形象未必完全一致,空间方位与三维推理是弱项。把自评高分与自曝短板放在一起读,比单看任何一组数字都更接近真实水位。
把图像生成打成日常耗材
跳出版本本身,这次调价的行业含义更清晰:当单图成本压到几美分级,图像生成便从按次购买的创意工具变成按量计费的生产耗材,产品目录图、本地化横幅、信息图这类高频低单值场景会先迁移。价格战同样在升级——OpenAI 的图像模型与中国开源权重阵营都在压价,谷歌这次等于把牌桌上的公共价格又向下砸了一档。对开发者,真正的算账单位已不是单图价格,而是含参考图与思考词元的整请求成本;对谷歌自家更贵的 Pro 档,除非写实需求出现明显分化,否则存在的理由正在变薄。官方及行业暂未披露更多细节,后续将持续跟进迭代动态。