搜索结果:

返回

Nano Banana 2 上线:图像生成,开始接入真实世界

谷歌种的新款香蕉香不香?

AI 速览

谷歌种的新款香蕉香不香? 去年惊艳四座的Nano Banana,今天凌晨再次放出大招。 谷歌正式推出了它最新一代的模型,Nano Banana 2(Gemini 3.1 Flash Image)。 这一次的升级,从性能、可用性、细节控制与普及度上全面进阶。


去年惊艳四座的Nano Banana,今天凌晨再次放出大招。


谷歌正式推出了它最新一代的模型,Nano Banana 2(Gemini 3.1 Flash Image)。


这一次的升级,从性能、可用性、细节控制与普及度上全面进阶。



谷歌CEO皮查伊发帖声称:

“这是我们迄今为止最出色的图像模型。”


更理解世界


Nano Banana 2 融合了 Gemini 对世界的深度理解能力,同时结合实时网页搜索。


来看看皮查伊举的这个很有代表性的例子,Window Seat。



当你指定一个地点,让模型生成从那扇窗往外看的画面时,模型会:


  • 自动理解地理位置
  • 拉取当地实时天气
  • 生成符合当前世界状态的场景
  • 支持 2K / 4K 输出


图像生成,不再只是风格化幻想,带有了时间与空间坐标的视觉构建。


性价比拉满


之前,Banana Pro 生成一张1K图要0.134美元,接近1元人民币一张。批量生成场景下,成本压力极大。


现在Banana 2 把同样1K图的价格降至0.067美元,大概0.5元人民币,直接砍半。


4K价格,也由0.24美元降至0.151美元,整体成本结构明显优化。


生成速度也明显缩短,体感提升很明显。


另外,Banana 2宽高比选项也更全,

新增 4:1、1:4、8:1 和 1:8 格式,进一步拓展了图像生成的场景适配能力。


主体一致性


谷歌官方给出的规格是,单工作流最多 5 个角色保持一致,多达14个对象保真。


过去图像生成最大的问题之一,就是‘第一张很好看,第二张就对不上’。


现在一致性能力明显增强,叙事创作和多画面连续输出的可行性直接up!



拿我们的IP也实测了一下,确实不错。


这张有点小瑕疵,我们的优悠和布里奇没能一致= =


精准遵循指令


看看这个案例。



提示词:

show me a where’s waldo set in ancient Venice, but instead of waldo it is an otter wearing a blue striped pilots outfit.

(给我画一张古代威尼斯场景中的《瓦尔多在哪里》,瓦尔多是一只穿着蓝色条纹飞行员服装的水獭。)


指令本身包含了几层难点:


  1. 画面风格参考《Where’s Waldo》(高度细节、密集人群)
  2. 场景限定为“古代威尼斯”
  3. 主角替换为“一只穿蓝色条纹飞行员制服的水獭”
  4. 必须在大量人物中保持唯一性

这对模型来说是一个综合能力测试,如此复杂的场景,结果还真只有一个水獭。



文本生成能力


这一代的另一个重点,是文字。


Nano Banana 2 被明确定位为:可以生成清晰、可读、可商用的图像文字。


无论是海报;贺卡;品牌标语,文字不再糊、不再歪、不再随机乱码。


视觉质量提升


能够生成更生动真实的光影效果,让画面的明暗过渡、光线落差和立体感更接近真实世界的视觉体验;同时在细节清晰度上也有明显跃升。


对需要高保真视觉输出的广告、展示图、品牌物料等场景来说,是实实在在的进步。



当然,Nano Banana 2仍有些瑕疵,在较长段文字、字号偏小的情况下,文字清晰度偶尔会出现模糊,中文还是有鬼画符出现,

当生成轮次很多、参考图元素非常复杂时,细节层面仍可能出现个别偏差。


在这个AI时代里,保持好奇,保持创造,保持对未知的热情,

愿我们都能借助这些新的能力,把自己的想法,变成真实可见的风景。


欢迎大家在评论区分享你发现的新玩法。


聊聊数字化转型?

聊聊数字化转型,联系极客上线

一同向上生长

Growing upward together

聊聊你的想法

  • APP定制
  • 小程序定制
  • Web定制
  • AI Agent定制
  • 企业数字化转型
  • 其他