谷歌发布了新一代图像模型 Nano Banana 2.1。该模型属于 Gemini 3 系列,基于 Gemini 3.6 Flash,知识截止日期为 2026 年 3 月。按以往命名方式,Nano Banana 2.1 也可被视作 Gemini 3.6 Flash Image。
这次更新把重点放在图像生成与编辑能力上,包括蒙版局部编辑、主体一致性、文字渲染和最高 4K 直出,同时把出图价格降到 Nano Banana 2 的一半。开发者目前已经可以在 AI Studio 中调用,模型名为 gemini-nano-banana-2.1。
Nano Banana 2.1 的定位:Flash 级模型,主打图像生成与编辑
根据原文信息,Nano Banana 2.1 仍是 Gemini 3 系列成员,但其表现已经超过自家旗舰 Nano Banana Pro。官方基准测试显示,这一版本在视觉设计、图像编辑和一致性方面表现突出。
原文同时提到,Nano Banana 2.1 在小文本渲染、3D 推理和事实性方面仍有改进空间。不过,对于需要图像生成和编辑服务的用户,这次更新已经覆盖了几个核心能力:
- 以较高精度和控制力创建、编辑图像,并支持多次快速迭代;
- 为海报和复杂图表生成清晰文字;
- 支持长上下文的现实世界知识;
- 支持跨多种语言的本地化文字渲染。
榜单表现提升,多图编辑排到第 4
在 Arena 榜单中,Nano Banana 2.1 的多项成绩较上一代明显提升。原文给出的排名如下:
- 多图编辑第 4;
- 文生图第 5;
- 单图编辑第 6。
其中,多图编辑榜单中排在它前面的只剩 OpenAI 的三款 GPT Image 模型。作为对比,上一代 Nano Banana 2 在这三个榜单上的排名分别是第 7、第 11 和第 14。

结合价格变化,原文认为谷歌这次明显在强化性价比路线。
蒙版局部编辑:圈定区域后只改局部
这次更新的一项核心能力是蒙版编辑。按照原文描述,用户可以直接圈定图像中的某个区域,只修改被选中的部分,其他区域保持不变。
原文指出,这类能力在传统 AI 生图流程中一直较难实现。过去如果用户要求把图中某个局部元素替换成另一种样式,模型往往需要重新生成整张图,其他部分是否保持一致并不稳定。Nano Banana 2.1 则把这一过程改成了更明确的局部编辑方式,可用于换衣服、替换招牌、去除背景路人等场景。
文中举了网友 ibexdream 的三轮测试。第一轮先生成一张纸币图像,画面中是一位托腮沉思的老哲人,头发向后延展成一座迷宫。第二轮在原图基础上修改,把编号从「№ 1098471」改成「NB-21098471」,替换两侧小字,在人物手中加入一根香蕉电话,并在下方增加「IN BANANA WE TRUST」飘带。第三轮则把整张纸币改成油画风格。原文称,对比前后结果,迷宫、长袍和胡子等主体元素保持不变。
模型卡评分中,Nano Banana 2.1 在蒙版编辑项目上得到 1049 分,比 Nano Banana 2 高 84 分,比 Pro 高 122 分。原文还提到,即便不开启思考模式,2.1 在各项指标上也压过 Pro。

主体一致性提升,最多支持 14 张参考图
另一项升级集中在主体一致性,也就是多轮生成或多场景生成时,人物和物体不轻易「变脸」。
原文称,这一项是本次涨分最明显的能力。多人物一致性得分达到 1106 分,比 Nano Banana 2 高出 128 分。开发者最多可以输入 10 张物体参考图和 4 张人物参考图,总计 14 张参考图,让模型按参考内容生成。
文中提到,网友 BG-VC 用一张模特照片,加上上衣、半裙、包、鞋、耳环五件单品参考图,要求模型一次生成 6 个不同场景的照片。结果显示,6 张图中的姿势虽然不同,但脸部、服装、包和耳环都保持一致,适合电商图等连续素材场景。
画质与信息图能力同步提升
原文称,Nano Banana 2.1 生成的画面更接近实拍。官方样图中,包括挂满水珠的甲虫,以及粉色房屋外楼梯上的绿裙人物,视觉上都更接近真实照片。
除了画面质感,信息图生成也是这次更新的一部分。原文提到,模型在制作信息图前,可以先调用谷歌网页搜索和图片搜索查找资料,再进行生成。
在谷歌自动评测中,Nano Banana 2.1 的信息图事实准确分为 0.521,Nano Banana 2 为 0.179,Pro 为 0.265。按原文说法,这意味着在生成科普图等内容时,图中事实性错误会减少。

价格下调:1K 出图 0.034 美元,4K 出图 0.076 美元
价格是这次更新最直接的变化之一。原文给出的计费方式是,出图按每百万 token 30 美元收取,正好是 Nano Banana 2 的一半。
- 1K 图像价格从 0.067 美元降到 0.034 美元;
- 4K 图像价格从 0.151 美元降到 0.076 美元。
这一价格与 7 月主打低价的 Nano Banana 2 Lite 相同。
不过,输入和思考相关费用有所上调:
- 输入价格从每百万 token 0.5 美元涨到 1.5 美元;
- 文字和思考输出价格从 3 美元涨到 7.5 美元。
原文将这一变化概括为,谷歌把成本重点从「画」转向了「想」。
上线范围:AI Studio 已可调用,旧版 API 将于 10 月 29 日关停
开发者已经可以在 AI Studio 中直接选择 Nano Banana 2.1,模型名为 gemini-nano-banana-2.1。

同时,之前的 Nano Banana 2 API 将在 10 月 29 日关停。
面向普通用户的产品接入也已启动。原文列出的上线渠道包括:
- Gemini App;
- 搜索 AI 模式;
- Flow;
- 设计工具 Stitch;
- Google Ads;
- Gemini 企业平台。
这些服务从当天起陆续上线。原文还提到,在谷歌 App 中,用户点击搜索框下方的香蕉图标即可体验。
上线后测试:与 GPT Image 2.5、GPT Image 2 的对比集中在细节、速度和成本
模型上线不到一小时,X 平台上已经出现多组测试。
Mark Kretschmann 给出的测试提示词要求一张图中同时包含人群、杂物、清晰可见的文字以及雨天反光,用来观察复杂元素组合后是否仍接近真实照片。
Luis Catacora 则要求模型生成一块茶馆菜单板,并把同一款「茉莉绿茶」用英语、日语、阿拉伯语和印地语四种文字同时写出,一次完成出图。

Lad 的测试更偏向细节控制。他要求画面中同时出现细线纹身、3 条项链、一排耳饰、手链,以及一副能透出眼睛的有色墨镜,并把同一提示词分别交给 Nano Banana 2.1 和 GPT Image 2.5。原文称,在这组对比中,Nano Banana 2.1 把纹身、项链、耳饰和手链都画到了指定位置,但墨镜没有正确上色,人物脸部还出现一片晒红效果。
Pankaj Kumar 选择的对手是 GPT Image 2。他让两个模型绘制同一场景:书桌上的一块手表。原文描述称,Nano Banana 2.1 的结果更像自然光下的随手拍,GPT Image 2 的结果则像开了台灯的精修广告图,表盘也被改成了镂空机芯。
在速度和成本方面,AI/ML API 平台准备了 5 个提示词,让 Nano Banana 2.1 和 GPT Images 2.5 各生成一张图。结果显示:
- Nano Banana 2.1 平均每张图耗时 11 秒,成本 0.044 美元;
- GPT Images 2.5 平均每张图耗时 50 秒,成本 0.069 美元。
Hugo Plat 又设计了 4 道太空题,包括旋涡星系、超大质量黑洞、类星体,以及把整个太阳系装进一张图,分别交给 Nano Banana 2.1 和 GPT Image 2.5。4 张图合计成本中,Nano Banana 2.1 为 0.178 美元,GPT Image 2.5 为 0.284 美元。原文提到,在同一道黑洞题上,Nano Banana 2.1 的画面更克制,GPT Image 2.5 则把星云和火焰效果拉得更满。
中文文字渲染改善,但仍有瑕疵
在中文表现上,原文援引博主归藏的测试称,Nano Banana 2.1 生成的文字更清楚,错字明显减少,排版也更整洁,相比 GPT 的结果没有那么强的破碎感。原文还提到,他认为该模型相较 GPT 的一个优势是可以直接输出 4K 图像。

不过,原文也给出了一处问题案例:在「传承与新生」旁边的一行竖排小英文中,放大后已经变成乱码。
图像竞争焦点转向改图与多轮编辑
原文回顾称,4 月 GPT Image 2 上线时,在同一 Arena 的文生图榜单上领先 Nano Banana 2 达 240 分。到 9 月,OpenAI 又推出 Images 2.5,主打指定区域修改和多轮修改稳定性。
不到一个月后,谷歌发布 Nano Banana 2.1,也把重点押在局部编辑和多轮一致性上。原文认为,这与电商、广告和品牌设计等场景的实际需求有关:一张图往往需要反复修改十几版,到了后几轮还能保持稳定,比第一版是否惊艳更重要。
也因此,谷歌这次把 Nano Banana 2.1 直接接入 Google Ads 和企业平台,目标用户指向高频改图的商业客户。
参考资料为谷歌 AI Studio 在 X 平台发布的信息。原文署名显示,编辑为摩西、大卫,文章来自微信公众号「新智元」(ID:AI_era),作者为 ASI 启示录。

