MidassAI
开始创作

Nano Banana 2:支持 14 张参考图的对话式编辑

MidassAI Team · 2026年9月1日 · 9 分钟阅读

Try Nano Banana in MidassAI
Nano Banana 2:支持 14 张参考图的对话式编辑

Nano Banana 2 (Gemini 3.1 Flash Image) 不仅是一个文生图接口——它是一个支持后续轮次输入的多模态编辑器。Google 文档指出每个提示词最多支持 14 张输入图像,且在使用 API 时能通过对话式编辑保持跨轮次的视觉上下文。

分辨率层级(提示前选定)

层级 典型用途 成本说明
512px 缩略图,快速布局探测 Token 消耗最低
1K 社交媒体,博客头图 默认平衡
2K 类印刷营销材料 输出 Token 较高
4K 产品主图,精细文字 最慢;需核对字号排版

每个项目选定一次层级。从 512 探索直接跳至 4K 交付而不重新检查构图会浪费 Token。

十四张参考图而不丢失身份

用自然语言分配角色:

以下为参考图分配示例:

Image 1–2: face and hair identity (ignore backgrounds).
Image 3: jacket fabric swatch only.
Image 4: lighting reference from a sunset plate.
Generate subject in a rainy alley, same identity, new wardrobe from Image 3.

更多参考图≠更多控制。将 distinct subjects 控制在场景所需范围内——通常 3–5 张图加文字 brief 胜过塞满附件。

Try Nano Banana in MidassAI

对话式编辑轮次(API 思维模型)

第 1 轮:生成基础场景。 第 2 轮:Change only the sign text to "OPEN". Keep architecture and rain unchanged. 第 3 轮:Warm color grade +10%. Do not move camera.

每轮应仅更改 一个维度(文字、服装、色调、裁剪)。多请求段落会导致模型平均化处理冲突。

使用 google-genai 的开发者应保持 同一对话会话,以便 Thought Signatures / 视觉上下文得以延续——轮次间 dropped to stateless calls 会重置构图。

网络 grounding 与参考图编辑

Google Search grounding 回答事实性提示(today's weather in Seoul reflected in windows)。参考图编辑 回答身份提示(this exact person, new outfit)。在一轮中混合两者是有效的,但需明确说明哪些输入是事实性的,哪些是身份性的。

仅当时间敏感事实至关重要时启用 grounding——否则延迟会增加而无收益。

排版检查

Nano Banana 2 仍然奖励用于字体的引用字符串:A neon sign reading "MIDASS" 胜过未引用的全大写乱码。对话式色调更改后,请在缩放检查中重新验证拼写——发光效果会在导出前隐藏错误。

失败模式

问题 修复
第 3 轮面部漂移 每轮用原始肖像参考图重新锚定
编辑文字时背景切换 明确添加 keep background pixels unchanged
4K 模糊 用更锐利的镜头语言在 2K 再生成,然后升级层级

迷你检查清单

  • 为交付目标选定层级
  • 参考图已裁剪并标注角色
  • 每轮对话仅做一个更改
  • 仅当事实具有时间敏感性时使用 grounding

vs Nano Banana Pro

当需要在复杂图表上获得最大单次拍摄保真度时使用 Pro;当需要紧密迭代循环和多轮编辑时使用 Flash Image (NB2)。许多制作组在 NB2 中生成,然后仅对英雄静帧进行一次 Pro 传递。

前提条件与设置

在启动多轮会话之前,确保您的 Google Cloud 项目已启用 Vertex AI API 并具有 models.generateContent 权限。您需要一个附加到支持图像生成端点的计费账户的有效 API 密钥。验证您调用的是特定的 gemini-3.1-flash-image 模型字符串;旧版 Flash 变体缺乏复杂身份保留所需的 14 图像上下文窗口。

本地测试最好使用 google-genai SDK 0.5 或更高版本的 Python 脚本,因为 SDK 会自动管理会话状态。保持环境变量安全,并确认您的配额允许高分辨率输出 Token,因为 4K 生成消耗的容量比标准缩略图请求显著更多。

扩展提示工作流

  1. 初始化聊天会话,设置 temperature=0.7 以平衡创意与对参考资产的严格遵循。将 max_output_tokens 设置为 4096 以容纳高分辨率图像数据而不被截断。
  2. 将您的主要身份参考图作为第一个内容部分上传,标记为 system_instruction: "Maintain facial geometry from Image 1"。随后是严格按材料类型标记的次要纹理参考,例如 denimleather
  3. 执行第一次生成,带有负面提示约束:no background changes, no lighting shifts。这在模型渲染主体时锁定环境。
  4. 对于第二轮,仅修改提示描述中的 color_grade 参数。使用具体值,如 increase saturation by 15%,而不是模糊术语如 make it pop
  5. 通过请求原始 PNG 输出而不是压缩 JPEG 来完成导出,以保持标牌和服装细节上的文字清晰度。

常见错误

  • 会话重置: 在轮次之间关闭聊天对象会迫使模型从头重新推断上下文,导致身份漂移。修复: 在整个编辑循环中将聊天会话对象保留在内存中。
  • 上下文过载: 在第一个提示中附加所有 14 张图像会混淆注意力机制。修复: 逐步引入参考;仅当特定元素需要修改时才添加新资产。
  • 模糊的修改请求: 要求 improve the look 会触发无关区域的幻觉变化。修复: 使用边界框描述或明确的图层指令隔离编辑目标,如 modify only the foreground subject

在 MidassAI 中尝试

您可以使用 MidassAI Studio 中的可视化界面复制此多轮编辑管道,无需编写代码。该平台自动处理会话持久性和参考 labeling,让您可以专注于迭代设计而非 API 状态管理。在此开始您的项目:https://www.midassai.com/studio/nano/

相关文章

Try Nano Banana in MidassAI