『写在前面』
Google旗下的生图模型Nano Banana其实有很多个版本,比如Nano Banana Pro、Nano Banana 2 Lite、Nano Banana 2等等。每个模型有着不同的名字,在能力和价格上有所区别,很多人可能猛地一看会分不清楚谁是谁,我们可以看一个简单的对比:
今天凌晨,Google发布了最新的Gemini Nano Banana 2.1 (gemini-nano-banana-2.1),是目前Google最新和最强的图片生成和对话式智能修图模型,也是之前Nano Banana 2(Gemini 3.1 Flash Image)的更新版本。
PS:AI不用睡觉,也不让媒体人睡觉,服了……
——短剧研究僧

『香蕉杀回来了?』
图片数字资产的好坏,对AI短剧的成片质量有着至关重要的影响。每一次生图底模的迭代,都会给AI短剧的创作流程和质量带来质的飞跃。
Google的Nano Banana系列刚发布的时候,可以说是一个里程碑式的模型,把当时生图模型的能力一下子抬到了一个全新的维度。但在目前生图创作的实践中。后来,OpenAI旗下的GPT Image 2.5已经用一个又一个的案例证明了自身的强大实力,在实践中比Nano Banana 2.0要强上不少,成为了目前最主流的生图模型。
很多时候为了节约成本,哪怕我们在生成视频的模型不会用最好的(太贵了),但是生成图片资产,特别是角色、场景,我们一般都还是会选用最好图片模型来进行制作,这可以极大地降低你在生视频中的试错成本和重抽的概率。
Nano Banana 2.1的发布给「谁是最强生图大模型?」带来了新的悬念。它在实战中与GPT Image 2.5到底孰强孰弱?到底哪个大模型更适合短剧的创作流?
我们大致能从Nano Banana 2.1的更新功能上窥见一二。
『多参+蒙版』
根据Nano Banana 2.1的文档描述:它支持多图融合,最多可使用14张参考图片,保持最多4个角色的一致性以及最多10个对象的逼真度,以下是一个简单的对比。
这一改动对于我们在生成复杂场景的图片资产以及同一角色在多场景多服装多姿态变化的时候,能增加我们对于画面的控制能力。
1K(Nano Banana 2.1不支持512像素 (0.5K)分辨率),同时「改善了1K、2K和4K输出分辨率下的视觉质量和真实感」,这改动需要进行实际的测试才能感知到具体变化如何。而类似「修复了在 2K 和 4K 分辨率下,宽屏和全景宽高比(1:4、4:1、1:8、8:1)的平铺伪影」这样的改动我们知道就好了,大概率我们没什么机会能用到。
『输入便宜但输出贵了』
价格一定是我们最关心的因素,没有之一。
小僧做了一个表来横向对比Nano Banana四个最主要系列:Nano Banana 2.1、Nano Banana Pro、Nano Banana 2、Nano Banana 2 Lite 的价格(以上顺序按模型能力由高到低排列)。
特别说明:
1、该价格来自Google官方的Gemini API文档;
2、由于「免费层级」无法使用Nano Banana 2.1,所以价格全部来自于付费层级,单位是「美元 / 100 万 token」;其中,单张价格按官方给出的图片 token 消耗进行换算。换算口径:0.5K=747 token,1K=1120 token,2K=1680 token,4K=2520 token。
我们对四个模型在「标准档」的输入输出进行横向对比结果更加直观(绿色标记代表「最低价」):
对比下来我们可以发现:
Nano Banana 2.1 除了「出图」本身,哪都贵!
从输出端来看:
Nano Banana 2.1的图像输出价格 $30,是全系列的最低档(和 Lite 并列),Nano Banana 2 是它的 2 倍,Nano Banana Pro 是它的 4 倍。
而在输入端,则完全反了过来:
Nano Banana 2.1 是最贵的那一档($1.50),比上一代Nano Banana 2($0.50)贵3倍,比Nano Banana 2Lite ($0.25)贵6倍,仅次于Nano Banan Pro($2.00)。
文本与思考输出同理:Nano Banana 2.1 的价格是$7.50,是Nano Banana 2Lite ($1.50)的5 倍、Nano Banana 2 ($3.00)的 2.5 倍。
我们不难看出,Nano Banana 2.1 相对于上一代,让用户把花钱的地方从「画图」挪到了「说话」:虽然出图本身砍半,但提示词、参考图、思考这些周边成本全都涨了。
这可能是 Nano Banana 2.1 定价上最容易被人忽视的陷阱,也是为什么小僧认为它更适合「短提示词 + 批量出高分辨率」而不适合「长对话式反复修图」的最大原因——很有可能你辛辛苦苦省下的钱因为多聊上两句又给花掉了……而后者,恰恰是做精品图片数字资产最常见的使用场景。所以大家在使用过程中一定要注意,在保证效果的前提下,在实现不同的功能时候考虑选择更加合适(便宜)的模型。
『Google Vs OpenAI』
那Google的Nano Banana和OpeAI的GPT-Image到底谁更贵?
小僧也特地去官方API了解了价格,由于两家计价模式存在明显差异:
Google 按输出分辨率定价(1K/2K/4K 各有固定 token 数,跟画质档无关);
OpenAI 按质量档位定价(low→max 五档,token 数随画质变化,尺寸另算);
所以以下对比仅能作为参考,一切以实际使用过程中的计费为准:
为了更加直观地表达,我们做了一个单张价格的天梯图(以1K(1024*1024)为例),可以看到不同模型之间的价格对比(仅作参考)。
『小僧说』
AI就是一个永无止境的内卷,从生图模型到生视频模型,伴随着AI一次又一次的进化,内容创作变得越来越简单。
就像最近很火的用「Claude生成视频」一样,大家总能找到一些新的玩法和切入点,这也和每家模型的独特的训练方式以及特异化训练方向密不可分,所以我们也不知道未来会不会有一个模型异军突起,把一众我们熟悉的前浪狠狠地拍死在沙滩上。
国庆期间,小僧也看了不少的海外AI短剧。说实话,呈现的效果比小僧想象中要好上太多。排除擦边的部分不说,同样的头部AI精品短剧,已经领先了国内AI精品短剧一个较大的身位。
当国内还在继续婆婆妈妈你侬我侬的时候,海外AI短剧已经走到了Next level。
同样的一批人制作,为什么会出现质量上如此巨大的区别?这可能是一个更加值得关注的话题。
都看到这了,如果觉得小僧写的还不错,随手点个赞、在看、转发三连吧!如果想第一时间收到小僧的推送也可以点个⭐~
谢谢你看小僧的原创文章,咱们下次再见!


