首页 > 教程资讯 > 教程详情

Google DeepMind 发布 Nano Banana 2.1 模型卡:图像生成与编辑能力全面提升

AI 与前沿 编辑部小鹿 2026-10-09
文章分享

2026 年 10 月 6 日,Google DeepMind 正式发布了 Nano Banana 2.1 的模型卡。作为 Gemini 3 系列的新成员,Nano Banana 2.1 是一款基于 Gemini 3.6 Flash 的多模态推理模型。该模型能够接收并理解文本和图像输入,并输出图像与文字。根据官方公布的截至 2026 年 10 月的评测结果,Nano Banana 2.1 在图像生成和图像编辑的诸多基准测试中,成绩均优于同系列的 Nano Banana 2 和 Nano Banana Pro。

模型核心参数

根据模型卡披露的信息,Nano Banana 2.1 具备长上下文处理能力,其输入上下文窗口最长可达 100 万(1M)token。在输出端,该模型可生成 4K token 的图像输出,以及最高 6.4 万(64K)token 的文本输出。

官方自测成绩

Google DeepMind 采用人类并排比较(SxS human eval)获取 Elo 分数等方法对模型进行了系统评估。根据发布方自测数据,Nano Banana 2.1 在多项指标上表现优异。

文生图表现

在文生图的整体偏好(Overall Preference)评测中,Nano Banana 2.1 开启思考(Thinking)版本的得分为 1050 ±14,不开启思考(No Thinking)版本为 1015 ±13。作为对比,Nano Banana 2(Gemini 3.1 Flash Image)得分为 990 ±7,Nano Banana Pro(Gemini 3 Pro Image)得分为 935 ±8。

在信息图事实准确度(Infographic Factuality)方面,Nano Banana 2.1(Thinking)得分为 0.521,不开启思考版本为 0.328,这两项成绩均高于 Nano Banana 2 的 0.179 和 Nano Banana Pro 的 0.265。

图像编辑能力

在编辑类评测中,Nano Banana 2.1(Thinking)的多角色一致性(Multi-Character Consistency)得分为 1106 ±14,高于 Nano Banana 2 的 978 和 Nano Banana Pro 的 1011。此外,在通用编辑、单角色一致性、涂鸦/蒙版编辑(Mask/Ink-Based Editing)、风格化以及多参考图编辑等各项基准测试中,Nano Banana 2.1(Thinking)的得分也全面领先于上述两款对照模型。

已知局限与安全性

模型已知局限

Google 在模型卡中列出了 Nano Banana 2.1 目前已知的一系列局限性:

  • 在文本渲染上,小字(在 1k 模型下经常出现模糊)以及长段落文字的渲染表现仍然较差。
  • 图像编辑时,输入图与生成图之间的角色一致性并不总是完美的。
  • 在基于涂鸦或蒙版的编辑中,模型对指令有时只执行了一部分。
  • 模型偶尔会出现空间方位(例如左右)混淆的情况。
  • 模型在世界知识、3D 推理和事实准确性方面仍然存在局限。
  • 此外,模型可能会出现幻觉等基础模型的普遍问题,并伴有偶尔的响应变慢或超时。

安全与评估结论

在安全性方面,根据官方评测,Nano Banana 2.1 达到了 Google 要求的儿童安全上线门槛。在整体内容安全策略表现上,与 Gemini 3 Flash 相比,其表现相近或有所改善。

关于前沿安全(Frontier Safety)评估,Google 沿用了此前对 Gemini 3.1 Pro 和 Gemini 3.7 Flash 的评估结果。由于这两款模型均未达到任何追踪或关键能力阈值(Tracked or Critical Capability Levels),Google 称 Nano Banana 2.1 同样不太可能达到这些前沿安全风险阈值。

来源