Nano Banana 2:支援 14 張參考圖的對話式編輯
MidassAI Team · 2026年9月1日 · 9 min read

Nano Banana 2(Gemini 3.1 Flash Image)不僅是文字轉圖片的端點,它更是一個支援後續互動的多模態編輯器。Google 文件指出每個提示最多可接受 14 張輸入圖片,若正確使用 API,對話式編輯能在多輪互動中保持視覺上下文。
解析度層級(提示前請先選擇)
| Tier | 典型用途 | 成本註記 |
|---|---|---|
| 512px | 縮圖、快速佈局探測 | Token 消耗最低 |
| 1K | 社群媒體、部落格主圖 | 預設平衡 |
| 2K | 類印刷行銷素材 | 輸出 Token 較高 |
| 4K | 產品主圖、精細字體 | 最慢;需驗證字體大小 |
每個專案選擇一次層級。若從 512 探索直接跳至 4K 交付而未重新檢查構圖,會浪費 Token。
十四張參考圖而不丢失身份特徵
用 plain language 分配角色:
例如,您可以這樣分配角色:
Image 1–2: face and hair identity (ignore backgrounds). Image 3: jacket fabric swatch only. Image 4: lighting reference from a sunset plate. Generate subject in a rainy alley, same identity, new wardrobe from Image 3.
參考圖越多≠控制力越強。將 distinct subjects 限制在場景所需數量——通常 3–5 張圖片加上文字簡報勝過塞滿附件。
對話式編輯輪次(API 思維模型)
以下是多輪編輯的提示範例:
Turn 1: generate base scene.
Turn 2: `Change only the sign text to "OPEN". Keep architecture and rain unchanged.`
Turn 3: `Warm color grade +10%. Do not move camera.`每一輪應只改變一個維度(文字、服裝、色調、裁剪)。多請求段落會導致模型平均化衝突。
使用 google-genai 的開發者應保持相同的對話工作階段,以便 Thought Signatures / 視覺上下文得以延續——在各輪之間切換為無狀態呼叫會重置構圖。
網路 Grounding 與參考圖編輯
Google Search Grounding 用於回答事實性提示(today's weather in Seoul reflected in windows)。參考圖編輯 用於回答身份提示(this exact person, new outfit)。在同一輪中混合兩者有效,但需註明哪些輸入是事實性的還是身份性的。
僅在時間敏感的事實很重要時啟用 Grounding——否則延遲會增加卻無益處。
字體檢查
Nano Banana 2 仍然獎勵用於字體的引用字串:A neon sign reading "MIDASS" 勝過未引用的大寫亂碼。對話式色調變更後,請在縮放檢查時重新驗證拼寫——发光效果會在导出前隱藏錯誤。
常見失敗模式
| 問題 | 修正方法 |
|---|---|
| 第 3 輪臉部漂移 | 每輪使用原始肖像參考圖重新錨定 |
| 編輯文字時背景切換 | 明確添加 keep background pixels unchanged |
| 4K 模糊 | 以更銳利的鏡頭語言在 2K 重新生成,然後升級層級 |
簡易檢查清單
- 為交付目標選擇層級
- 參考圖已裁剪並標記角色
- 每輪對話僅變更一項
- 僅在事實具時間敏感性時啟用 Grounding
與 Nano Banana Pro 比較
當您需要複雜圖表的最大單次拍攝保真度時使用 Pro;使用 Flash Image (NB2) 進行緊密迭代循環和多輪編輯。許多生產組在 NB2 中生成,然後僅對主圖進行一次 Pro 傳遞。
先決條件與設定
在啟動多輪工作階段之前,確保您的 Google Cloud 專案已啟用 Vertex AI API,並具有 models.generateContent 的權限。您需要一個附加到支援圖片生成端點的付費帳戶的有效 API 金鑰。驗證您是否呼叫了特定的 gemini-3.1-flash-image 模型字串;舊版 Flash 變體缺乏複雜身份保留所需的 14 張圖片上下文窗口。
本地測試最好通過使用 google-genai SDK 版本 0.5 或更高版本的 Python 腳本進行,因為 SDK 會自動管理工作階段狀態。保護環境變量並確認您的配額允許高解析度輸出 Token,因為 4K 生成消耗的容量顯著高於標準縮圖請求。
擴展提示工作流
- 初始化聊天工作階段,設定
temperature=0.7以平衡創意與對參考資產的嚴格遵循。設定max_output_tokens為 4096 以容納高解析度圖片數據而不截斷。 - 上傳您的主要身份參考圖作為第一個內容部分,標記為
system_instruction: "Maintain facial geometry from Image 1"。隨後跟著嚴格按材料類型標記的次要紋理參考圖,例如denim或leather。 - 執行第一次生成,帶有負面提示約束:
no background changes, no lighting shifts。這會在模型渲染主體時鎖定環境。 - 對於第二輪,僅修改提示描述中的
color_grade參數。使用具體值如increase saturation by 15%而非模糊術語如make it pop。 - 通過請求原始 PNG 輸出而非壓縮 JPEG 來完成导出,以保留標牌和服裝細節的文字清晰度。
常見錯誤
- 工作階段重置: 在各輪之間關閉聊天對象會迫使模型從頭重新推斷上下文,導致身份漂移。修正: 在整個編輯循環中將聊天工作階段對象保留在記憶體中。
- 過載上下文: 在第一個提示中附加所有 14 張圖片會混淆注意力機制。修正: 逐步引入參考圖;僅在需要修改該特定元素時添加新資產。
- 模糊的修改請求: 要求
improve the look會觸發無關區域的幻覺變更。修正: 使用邊界框描述或明確的圖層指令(如modify only the foreground subject)隔離編輯目標。
在 MidassAI 中嘗試
您可以使用 MidassAI Studio 中的視覺界面複製此多輪編輯管道,無需編寫代碼。平台自動處理工作階段持久性和參考圖標記,讓您可以專注於迭代設計而非 API 狀態管理。在此開始您的專案:https://www.midassai.com/studio/nano/