
去年惊艳四座的Nano Banana,今天凌晨再次放出大招。
谷歌正式推出了它最新一代的模型,Nano Banana 2(Gemini 3.1 Flash Image)。
这一次的升级,从性能、可用性、细节控制与普及度上全面进阶。

谷歌CEO皮查伊发帖声称:
“这是我们迄今为止最出色的图像模型。”

更理解世界
Nano Banana 2 融合了 Gemini 对世界的深度理解能力,同时结合实时网页搜索。
来看看皮查伊举的这个很有代表性的例子,Window Seat。
当你指定一个地点,让模型生成从那扇窗往外看的画面时,模型会:
- 自动理解地理位置
- 拉取当地实时天气
- 生成符合当前世界状态的场景
- 支持 2K / 4K 输出
图像生成,不再只是风格化幻想,带有了时间与空间坐标的视觉构建。
性价比拉满
之前,Banana Pro 生成一张1K图要0.134美元,接近1元人民币一张。批量生成场景下,成本压力极大。
现在Banana 2 把同样1K图的价格降至0.067美元,大概0.5元人民币,直接砍半。
4K价格,也由0.24美元降至0.151美元,整体成本结构明显优化。
生成速度也明显缩短,体感提升很明显。
另外,Banana 2宽高比选项也更全,
新增 4:1、1:4、8:1 和 1:8 格式,进一步拓展了图像生成的场景适配能力。


主体一致性
谷歌官方给出的规格是,单工作流最多 5 个角色保持一致,多达14个对象保真。
过去图像生成最大的问题之一,就是‘第一张很好看,第二张就对不上’。
现在一致性能力明显增强,叙事创作和多画面连续输出的可行性直接up!

拿我们的IP也实测了一下,确实不错。


这张有点小瑕疵,我们的优悠和布里奇没能一致= =
精准遵循指令
看看这个案例。

提示词:
show me a where’s waldo set in ancient Venice, but instead of waldo it is an otter wearing a blue striped pilots outfit.
(给我画一张古代威尼斯场景中的《瓦尔多在哪里》,瓦尔多是一只穿着蓝色条纹飞行员服装的水獭。)
指令本身包含了几层难点:
- 画面风格参考《Where’s Waldo》(高度细节、密集人群)
- 场景限定为“古代威尼斯”
- 主角替换为“一只穿蓝色条纹飞行员制服的水獭”
- 必须在大量人物中保持唯一性
这对模型来说是一个综合能力测试,如此复杂的场景,结果还真只有一个水獭。
文本生成能力
这一代的另一个重点,是文字。
Nano Banana 2 被明确定位为:可以生成清晰、可读、可商用的图像文字。
无论是海报;贺卡;品牌标语,文字不再糊、不再歪、不再随机乱码。

视觉质量提升
能够生成更生动真实的光影效果,让画面的明暗过渡、光线落差和立体感更接近真实世界的视觉体验;同时在细节清晰度上也有明显跃升。
对需要高保真视觉输出的广告、展示图、品牌物料等场景来说,是实实在在的进步。

当然,Nano Banana 2仍有些瑕疵,在较长段文字、字号偏小的情况下,文字清晰度偶尔会出现模糊,中文还是有鬼画符出现,
当生成轮次很多、参考图元素非常复杂时,细节层面仍可能出现个别偏差。
在这个AI时代里,保持好奇,保持创造,保持对未知的热情,
愿我们都能借助这些新的能力,把自己的想法,变成真实可见的风景。
欢迎大家在评论区分享你发现的新玩法。



