MidassAI
Start Creating

Nano Banana 2:支援 14 張參考圖的對話式編輯

MidassAI Team · 2026年9月1日 · 9 min read

Try Nano Banana in MidassAI
Nano Banana 2:支援 14 張參考圖的對話式編輯

Nano Banana 2(Gemini 3.1 Flash Image)不僅是文字轉圖片的端點,它更是一個支援後續互動的多模態編輯器。Google 文件指出每個提示最多可接受 14 張輸入圖片,若正確使用 API,對話式編輯能在多輪互動中保持視覺上下文。

解析度層級(提示前請先選擇)

Tier 典型用途 成本註記
512px 縮圖、快速佈局探測 Token 消耗最低
1K 社群媒體、部落格主圖 預設平衡
2K 類印刷行銷素材 輸出 Token 較高
4K 產品主圖、精細字體 最慢;需驗證字體大小

每個專案選擇一次層級。若從 512 探索直接跳至 4K 交付而未重新檢查構圖,會浪費 Token。

十四張參考圖而不丢失身份特徵

用 plain language 分配角色:

例如,您可以這樣分配角色:

Image 1–2: face and hair identity (ignore backgrounds). Image 3: jacket fabric swatch only. Image 4: lighting reference from a sunset plate. Generate subject in a rainy alley, same identity, new wardrobe from Image 3.

參考圖越多≠控制力越強。將 distinct subjects 限制在場景所需數量——通常 3–5 張圖片加上文字簡報勝過塞滿附件。

Try Nano Banana in MidassAI

對話式編輯輪次(API 思維模型)

以下是多輪編輯的提示範例:

Turn 1: generate base scene.
Turn 2: `Change only the sign text to "OPEN". Keep architecture and rain unchanged.`
Turn 3: `Warm color grade +10%. Do not move camera.`

每一輪應只改變一個維度(文字、服裝、色調、裁剪)。多請求段落會導致模型平均化衝突。

使用 google-genai 的開發者應保持相同的對話工作階段,以便 Thought Signatures / 視覺上下文得以延續——在各輪之間切換為無狀態呼叫會重置構圖。

網路 Grounding 與參考圖編輯

Google Search Grounding 用於回答事實性提示(today's weather in Seoul reflected in windows)。參考圖編輯 用於回答身份提示(this exact person, new outfit)。在同一輪中混合兩者有效,但需註明哪些輸入是事實性的還是身份性的。

僅在時間敏感的事實很重要時啟用 Grounding——否則延遲會增加卻無益處。

字體檢查

Nano Banana 2 仍然獎勵用於字體的引用字串:A neon sign reading "MIDASS" 勝過未引用的大寫亂碼。對話式色調變更後,請在縮放檢查時重新驗證拼寫——发光效果會在导出前隱藏錯誤。

常見失敗模式

問題 修正方法
第 3 輪臉部漂移 每輪使用原始肖像參考圖重新錨定
編輯文字時背景切換 明確添加 keep background pixels unchanged
4K 模糊 以更銳利的鏡頭語言在 2K 重新生成,然後升級層級

簡易檢查清單

  • 為交付目標選擇層級
  • 參考圖已裁剪並標記角色
  • 每輪對話僅變更一項
  • 僅在事實具時間敏感性時啟用 Grounding

與 Nano Banana Pro 比較

當您需要複雜圖表的最大單次拍攝保真度時使用 Pro;使用 Flash Image (NB2) 進行緊密迭代循環和多輪編輯。許多生產組在 NB2 中生成,然後僅對主圖進行一次 Pro 傳遞。

先決條件與設定

在啟動多輪工作階段之前,確保您的 Google Cloud 專案已啟用 Vertex AI API,並具有 models.generateContent 的權限。您需要一個附加到支援圖片生成端點的付費帳戶的有效 API 金鑰。驗證您是否呼叫了特定的 gemini-3.1-flash-image 模型字串;舊版 Flash 變體缺乏複雜身份保留所需的 14 張圖片上下文窗口。

本地測試最好通過使用 google-genai SDK 版本 0.5 或更高版本的 Python 腳本進行,因為 SDK 會自動管理工作階段狀態。保護環境變量並確認您的配額允許高解析度輸出 Token,因為 4K 生成消耗的容量顯著高於標準縮圖請求。

擴展提示工作流

  1. 初始化聊天工作階段,設定 temperature=0.7 以平衡創意與對參考資產的嚴格遵循。設定 max_output_tokens 為 4096 以容納高解析度圖片數據而不截斷。
  2. 上傳您的主要身份參考圖作為第一個內容部分,標記為 system_instruction: "Maintain facial geometry from Image 1"。隨後跟著嚴格按材料類型標記的次要紋理參考圖,例如 denimleather
  3. 執行第一次生成,帶有負面提示約束:no background changes, no lighting shifts。這會在模型渲染主體時鎖定環境。
  4. 對於第二輪,僅修改提示描述中的 color_grade 參數。使用具體值如 increase saturation by 15% 而非模糊術語如 make it pop
  5. 通過請求原始 PNG 輸出而非壓縮 JPEG 來完成导出,以保留標牌和服裝細節的文字清晰度。

常見錯誤

  • 工作階段重置: 在各輪之間關閉聊天對象會迫使模型從頭重新推斷上下文,導致身份漂移。修正: 在整個編輯循環中將聊天工作階段對象保留在記憶體中。
  • 過載上下文: 在第一個提示中附加所有 14 張圖片會混淆注意力機制。修正: 逐步引入參考圖;僅在需要修改該特定元素時添加新資產。
  • 模糊的修改請求: 要求 improve the look 會觸發無關區域的幻覺變更。修正: 使用邊界框描述或明確的圖層指令(如 modify only the foreground subject)隔離編輯目標。

在 MidassAI 中嘗試

您可以使用 MidassAI Studio 中的視覺界面複製此多輪編輯管道,無需編寫代碼。平台自動處理工作階段持久性和參考圖標記,讓您可以專注於迭代設計而非 API 狀態管理。在此開始您的專案:https://www.midassai.com/studio/nano/

Related articles

Try Nano Banana in MidassAI