Nano Banana 2:支持 14 张参考图的对话式编辑
MidassAI Team · 2026年9月1日 · 9 分钟阅读

Nano Banana 2 (Gemini 3.1 Flash Image) 不仅是一个文生图接口——它是一个支持后续轮次输入的多模态编辑器。Google 文档指出每个提示词最多支持 14 张输入图像,且在使用 API 时能通过对话式编辑保持跨轮次的视觉上下文。
分辨率层级(提示前选定)
| 层级 | 典型用途 | 成本说明 |
|---|---|---|
| 512px | 缩略图,快速布局探测 | Token 消耗最低 |
| 1K | 社交媒体,博客头图 | 默认平衡 |
| 2K | 类印刷营销材料 | 输出 Token 较高 |
| 4K | 产品主图,精细文字 | 最慢;需核对字号排版 |
每个项目选定一次层级。从 512 探索直接跳至 4K 交付而不重新检查构图会浪费 Token。
十四张参考图而不丢失身份
用自然语言分配角色:
以下为参考图分配示例:
Image 1–2: face and hair identity (ignore backgrounds).
Image 3: jacket fabric swatch only.
Image 4: lighting reference from a sunset plate.
Generate subject in a rainy alley, same identity, new wardrobe from Image 3.更多参考图≠更多控制。将 distinct subjects 控制在场景所需范围内——通常 3–5 张图加文字 brief 胜过塞满附件。
对话式编辑轮次(API 思维模型)
第 1 轮:生成基础场景。
第 2 轮:Change only the sign text to "OPEN". Keep architecture and rain unchanged.
第 3 轮:Warm color grade +10%. Do not move camera.
每轮应仅更改 一个维度(文字、服装、色调、裁剪)。多请求段落会导致模型平均化处理冲突。
使用 google-genai 的开发者应保持 同一对话会话,以便 Thought Signatures / 视觉上下文得以延续——轮次间 dropped to stateless calls 会重置构图。
网络 grounding 与参考图编辑
Google Search grounding 回答事实性提示(today's weather in Seoul reflected in windows)。参考图编辑 回答身份提示(this exact person, new outfit)。在一轮中混合两者是有效的,但需明确说明哪些输入是事实性的,哪些是身份性的。
仅当时间敏感事实至关重要时启用 grounding——否则延迟会增加而无收益。
排版检查
Nano Banana 2 仍然奖励用于字体的引用字符串:A neon sign reading "MIDASS" 胜过未引用的全大写乱码。对话式色调更改后,请在缩放检查中重新验证拼写——发光效果会在导出前隐藏错误。
失败模式
| 问题 | 修复 |
|---|---|
| 第 3 轮面部漂移 | 每轮用原始肖像参考图重新锚定 |
| 编辑文字时背景切换 | 明确添加 keep background pixels unchanged |
| 4K 模糊 | 用更锐利的镜头语言在 2K 再生成,然后升级层级 |
迷你检查清单
- 为交付目标选定层级
- 参考图已裁剪并标注角色
- 每轮对话仅做一个更改
- 仅当事实具有时间敏感性时使用 grounding
vs Nano Banana Pro
当需要在复杂图表上获得最大单次拍摄保真度时使用 Pro;当需要紧密迭代循环和多轮编辑时使用 Flash Image (NB2)。许多制作组在 NB2 中生成,然后仅对英雄静帧进行一次 Pro 传递。
前提条件与设置
在启动多轮会话之前,确保您的 Google Cloud 项目已启用 Vertex AI API 并具有 models.generateContent 权限。您需要一个附加到支持图像生成端点的计费账户的有效 API 密钥。验证您调用的是特定的 gemini-3.1-flash-image 模型字符串;旧版 Flash 变体缺乏复杂身份保留所需的 14 图像上下文窗口。
本地测试最好使用 google-genai SDK 0.5 或更高版本的 Python 脚本,因为 SDK 会自动管理会话状态。保持环境变量安全,并确认您的配额允许高分辨率输出 Token,因为 4K 生成消耗的容量比标准缩略图请求显著更多。
扩展提示工作流
- 初始化聊天会话,设置
temperature=0.7以平衡创意与对参考资产的严格遵循。将max_output_tokens设置为 4096 以容纳高分辨率图像数据而不被截断。 - 将您的主要身份参考图作为第一个内容部分上传,标记为
system_instruction: "Maintain facial geometry from Image 1"。随后是严格按材料类型标记的次要纹理参考,例如denim或leather。 - 执行第一次生成,带有负面提示约束:
no background changes, no lighting shifts。这在模型渲染主体时锁定环境。 - 对于第二轮,仅修改提示描述中的
color_grade参数。使用具体值,如increase saturation by 15%,而不是模糊术语如make it pop。 - 通过请求原始 PNG 输出而不是压缩 JPEG 来完成导出,以保持标牌和服装细节上的文字清晰度。
常见错误
- 会话重置: 在轮次之间关闭聊天对象会迫使模型从头重新推断上下文,导致身份漂移。修复: 在整个编辑循环中将聊天会话对象保留在内存中。
- 上下文过载: 在第一个提示中附加所有 14 张图像会混淆注意力机制。修复: 逐步引入参考;仅当特定元素需要修改时才添加新资产。
- 模糊的修改请求: 要求
improve the look会触发无关区域的幻觉变化。修复: 使用边界框描述或明确的图层指令隔离编辑目标,如modify only the foreground subject。
在 MidassAI 中尝试
您可以使用 MidassAI Studio 中的可视化界面复制此多轮编辑管道,无需编写代码。该平台自动处理会话持久性和参考 labeling,让您可以专注于迭代设计而非 API 状态管理。在此开始您的项目:https://www.midassai.com/studio/nano/