Nano Banana 2: Konversationelle Bearbeitungen mit 14 Referenzen
MidassAI Team · 1. September 2026 · 5 min read

Nano Banana 2 (Gemini 3.1 Flash Image) ist nicht nur ein Text-zu-Bild-Endpoint – es ist ein multimodaler Editor, der Folgeschritte akzeptiert. Google dokumentiert bis zu 14 Eingabebilder pro Prompt und konversationelle Bearbeitungen, die den visuellen Kontext über Schritte hinweg erhalten, wenn die API korrekt verwendet wird.
Auflösungstufen (vor dem Prompts auswählen)
| Stufe | Typische Verwendung | Kostenhinweis |
|---|---|---|
| 512px | Thumbnails, schnelle Layout-Tests | Geringster Token-Verbrauch |
| 1K | Social, Blog-Heroes | Standard-Balance |
| 2K | Drucknahe Marketingmaterialien | Höhere Output-Token |
| 4K | Produkt-Hero, feine Typografie | Langsamst; Typografie bei Größe prüfen |
Wählen Sie die Stufe einmal pro Projekt. Der Sprung von 512-Exploration direkt zu 4K-Delivery ohne erneute Überprüfung der Komposition verschwendet Token.
Vierzehn Referenzen ohne Identitätsverlust
Weisen Sie Rollen in natürlicher Sprache zu:
Hier ist ein Beispiel für die Rollenzuweisung in natürlicher Sprache:
Image 1–2: face and hair identity (ignore backgrounds). Image 3: jacket fabric swatch only. Image 4: lighting reference from a sunset plate. Generate subject in a rainy alley, same identity, new wardrobe from Image 3.
Mehr Referenzen ≠ mehr Kontrolle. Begrenzen Sie distinct Subjekte auf das, was die Szene benötigt – oft schlagen 3–5 Bilder plus ein Text-Brief das Maximieren von Anhängen.
Konversationelle Bearbeitungsschritte (API-Denkenmodell)
Turn 1: Basisszene generieren.
Turn 2: Change only the sign text to "OPEN". Keep architecture and rain unchanged.
Turn 3: Warm color grade +10%. Do not move camera.
Jeder Schritt sollte eine Dimension ändern (Text, Garderobe, Gradierung, Crop). Multi-Request-Absätze führen dazu, dass das Modell Konflikte mittelt.
Entwickler, die google-genai verwenden, sollten die gleiche Konversationssitzung beibehalten, damit Thought Signatures / visueller Kontext erhalten bleiben – der Wechsel zu zustandslosen Aufrufen zwischen den Schritten setzt die Komposition zurück.
Web Grounding vs. Referenzbearbeitungen
Google Search Grounding beantwortet faktische Prompts (today's weather in Seoul reflected in windows). Referenzbearbeitungen beantworten Identitäts-Prompts (this exact person, new outfit). Beides in einem Schritt zu mischen ist valide, aber spezifizieren Sie, welche Eingaben faktisch vs. identitätsbezogen sind.
Aktivieren Sie Grounding nur, wenn zeitkritische Fakten wichtig sind – sonst steigt die Latenz ohne Vorteil.
Typografie-Überprüfung
Nano Banana 2 belohnt immer noch quoted strings für Typografie: A neon sign reading "MIDASS" schlägt unquoted ALL CAPS Mush. Überprüfen Sie nach einer konversationellen Gradierungsänderung die Schreibweise bei einer Zoom-Pass erneut – Glow-Effekte verbergen Fehler bis zum Export.
Fehlermodi
| Problem | Lösung |
|---|---|
| Gesicht driftet bei Turn 3 | Jedes Mal mit der originalen Porträt-Referenz neu verankern |
| Hintergrund tauscht beim Text-Edit | keep background pixels unchanged explizit hinzufügen |
| 4K weich | Bei 2K mit schärferer Lens-Language neu generieren, dann Stufe hochskalieren |
Mini-Checkliste
- Stufe für Delivery-Ziel gewählt
- Referenzen beschnitten und mit Rolle labeln
- Eine Änderung pro konversationellem Schritt
- Grounding nur bei zeitkritischen Fakten
Vs. Nano Banana Pro
Verwenden Sie Pro, wenn Sie maximale Single-Shot-Fidelität bei komplexen Diagrammen benötigen; verwenden Sie Flash Image (NB2) für enge Iterationsschleifen und Multi-Turn-Bearbeitungen. Viele Produktions-Sets generieren in NB2, dann ein Pro-Pass nur für Hero-Stills.
Voraussetzungen und Einrichtung
Stellen Sie vor dem Starten von Multi-Turn-Sitzungen sicher, dass Ihr Google Cloud-Projekt die Vertex AI API mit Berechtigungen für models.generateContent aktiviert hat. Sie benötigen einen gültigen API-Key, der mit einem Abrechnungskonto verknüpft ist, welches Image-Generation-Endpoints unterstützt. Verifizieren Sie, dass Sie den spezifischen Modell-String gemini-3.1-flash-image aufrufen; ältere Flash-Varianten lacks das 14-Bild-Kontextfenster, das für komplexen Identitätserhalt required ist.
Lokales Testing funktioniert am besten durch Python-Skripte unter Verwendung des google-genai SDK Version 0.5 oder höher, da das SDK den Sitzungsstatus automatisch verwaltet. Halten Sie Environment-Variablen secure und bestätigen Sie, dass Ihr Quota High-Resolution-Output-Token erlaubt, da 4K-Generierungen significantly more Kapazität verbrauchen als Standard-Thumbnail-Anfragen.
Erweiterter Prompt-Workflow
- Initialisieren Sie die Chat-Sitzung mit
temperature=0.7, um Kreativität gegen strikte Einhaltung der Referenz-Assets zu balancieren. Setzen Siemax_output_tokensauf 4096, um High-Resolution-Bilddaten ohne Truncation zu accommodieren. - Laden Sie Ihre primäre Identitäts-Referenz als ersten Content-Part hoch, labeln Sie sie
system_instruction: "Maintain facial geometry from Image 1". Folgen Sie dies mit sekundären Textur-Referenzen, strikt nach Materialtyp labeln, wiedenimoderleather. - Führen Sie die erste Generation mit einer Negative-Prompt-Constraint aus:
no background changes, no lighting shifts. Dies lockt die Environment, während das Modell das Subjekt rendert. - Für den zweiten Schritt, modifizieren Sie nur den
color_grade-Parameter in Ihrer Prompt-Beschreibung. Verwenden Sie spezifische Werte wieincrease saturation by 15%statt vager Begriffe wiemake it pop. - Finalisieren Sie den Export, indem Sie das raw PNG-Output anfordern statt komprimiertem JPEG, um Text clarity auf signage und wardrobe details zu preserve.
Häufige Fehler
- Sitzungs-Reset: Das Schließen des Chat-Objekts zwischen Schritten zwingt das Modell, Kontext from scratch neu zu inferieren, causing identity drift. Lösung: Persistieren Sie das Chat-Sitzungs-Objekt im Memory throughout den gesamten Editing-Loop.
- Kontext-Überladung: Das Anhängen aller 14 Bilder im ersten Prompt confuses den Attention-Mechanismus. Lösung: Führen Sie Referenzen progressiv ein; fügen Sie neue Assets nur hinzu, wenn das specific Element Modification erfordert.
- Vage Modifikations-Anfragen: Das Anfragen von
improve the looktriggert halluzinierte Changes across unrelated areas. Lösung: Isolieren Sie das Edit-Ziel using Bounding-Box-Beschreibungen oder explizite Layer-Instructions wiemodify only the foreground subject.
Probieren Sie dies in MidassAI
Sie können diese Multi-Turn-Bearbeitungs-Pipeline replizieren, ohne Code zu schreiben, indem Sie die visuelle Oberfläche in MidassAI Studio verwenden. Die Plattform handled Session-Persistence und Referenz-Labeling automatisch, allowing Sie, sich auf iteratives Design zu focusen statt API-State-Management. Starten Sie Ihr Projekt hier: https://www.midassai.com/studio/nano/