MidassAI
Start Creating

Nano Banana 2 : Modifications conversationnelles avec 14 références

MidassAI Team · 1 septembre 2026 · 6 min read

Try Nano Banana in MidassAI
Nano Banana 2 : Modifications conversationnelles avec 14 références

Nano Banana 2 (Gemini 3.1 Flash Image) n'est pas seulement un endpoint texte-vers-image : c'est un éditeur multimodal qui accepte des tours de conversation. Google documente jusqu'à 14 images d'entrée par prompt et des modifications conversationnelles qui conservent le contexte visuel d'un tour à l'autre lors d'une utilisation correcte de l'API.

Hiérarchie de résolution (à choisir avant le prompt)

Niveau Usage typique Note de coût
512px Miniatures, tests de mise en page rapides Consommation de tokens minimale
1K Réseaux sociaux, images de blog Équilibre par défaut
2K Marketing proche de l'impression Tokens de sortie plus élevés
4K Héro produit, typographie fine Plus lent ; vérifiez la typographie à cette taille

Choisissez le niveau une fois par projet. Passer de l'exploration 512 à la livraison 4K sans revérifier la composition gaspille des tokens.

Quatorze références sans perte d'identité

Attribuez des rôles en langage clair :

Voici comment structurer les rôles des images :

Image 1–2: face and hair identity (ignore backgrounds). Image 3: jacket fabric swatch only. Image 4: lighting reference from a sunset plate. Generate subject in a rainy alley, same identity, new wardrobe from Image 3.

Plus de références ≠ plus de contrôle. Limitez les sujets distincts à ce dont la scène a besoin : souvent 3 à 5 images plus un brief texte valent mieux que maximiser les pièces jointes.

Try Nano Banana in MidassAI

Tours de modification conversationnelle (modèle mental API)

Tour 1 : générer la scène de base.

Voici les commandes pour les tours suivants :

Turn 2: `Change only the sign text to "OPEN". Keep architecture and rain unchanged.` Turn 3: `Warm color grade +10%. Do not move camera.`

Chaque tour doit modifier une dimension (texte, garde-robe, étalonnage, recadrage). Les paragraphes multi-demandes poussent le modèle à moyenner les conflits.

Les développeurs utilisant google-genai doivent conserver la même session de conversation pour que les Thought Signatures / le contexte visuel soient maintenus : passer à des appels stateless entre les tours réinitialise la composition.

Ancrage web vs modifications par référence

L'ancrage via Google Search répond aux prompts factuels (today's weather in Seoul reflected in windows). Les modifications par référence répondent aux prompts d'identité (this exact person, new outfit). Mélanger les deux dans un seul tour est valide, mais précisez quelles entrées sont factuelles vs identitaires.

Activez l'ancrage uniquement lorsque les faits sensibles au temps comptent : sinon, la latence augmente sans bénéfice.

Passe de typographie

Nano Banana 2 récompense toujours les chaînes entre guillemets pour le texte : A neon sign reading "MIDASS" vaut mieux qu'un galimatias ALL CAPS non cité. Après un changement d'étalonnage conversationnel, revérifiez l'orthographe lors d'un passage au zoom : les effets de lueur cachent les erreurs jusqu'à l'export.

Modes de défaillance

Problème Solution
Le visage dérive au tour 3 Réancrez avec la référence portrait originale à chaque tour
L'arrière-plan change lors de l'édition de texte Ajoutez explicitement keep background pixels unchanged
4K flou Régénérez en 2K avec un langage d'objectif plus net, puis upscalez le niveau

Mini checklist

  • Niveau choisi pour la cible de livraison
  • Références recadrées et étiquetées par rôle
  • Un changement par tour conversationnel
  • Ancrage uniquement lorsque les faits sont sensibles au temps

vs Nano Banana Pro

Utilisez Pro lorsque vous avez besoin d'une fidélité maximale en un seul shot sur des diagrammes complexes ; utilisez Flash Image (NB2) pour des boucles d'itération serrées et des modifications multi-tours. De nombreux sets de production génèrent en NB2, puis un seul passage Pro pour les images héro uniquement.

Prérequis et configuration

Avant d'initier des sessions multi-tours, assurez-vous que votre projet Google Cloud a l'API Vertex AI activée avec les permissions pour models.generateContent. Vous avez besoin d'une clé API valide attachée à un compte de facturation prenant en charge les endpoints de génération d'images. Vérifiez que vous appelez la chaîne de modèle spécifique gemini-3.1-flash-image ; les anciennes variantes Flash n'ont pas la fenêtre de contexte de 14 images requise pour la rétention d'identité complexe.

Les tests locaux fonctionnent mieux via des scripts Python utilisant le SDK google-genai version 0.5 ou supérieure, car le SDK gère l'état de session automatiquement. Gardez les variables d'environnement sécurisées et confirmez que votre quota permet des tokens de sortie haute résolution, car les générations 4K consomment significativement plus de capacité que les demandes de miniatures standard.

Workflow de prompt étendu

  1. Initialisez la session de chat avec temperature=0.7 pour équilibrer créativité et adhérence stricte aux assets de référence. Définissez max_output_tokens à 4096 pour accommoder les données d'image haute résolution sans troncature.
  2. Téléchargez votre référence d'identité principale comme première partie de contenu, en la labelisant system_instruction: "Maintain facial geometry from Image 1". Suivez ceci avec des références de texture secondaires labelisées strictement par type de matériau, comme denim ou leather.
  3. Exécutez la première génération avec une contrainte de prompt négatif : no background changes, no lighting shifts. Cela verrouille l'environnement pendant que le modèle rend le sujet.
  4. Pour le second tour, modifiez uniquement le paramètre color_grade dans votre description de prompt. Utilisez des valeurs spécifiques comme increase saturation by 15% plutôt que des termes vagues comme make it pop.
  5. Finalisez l'export en demandant la sortie PNG brute au lieu de JPEG compressé pour préserver la clarté du texte sur la signalétique et les détails de la garde-robe.

Erreurs courantes

  • Réinitialisation de Session : Fermer l'objet chat entre les tours force le modèle à ré-inférer le contexte depuis zéro, causant une dérive d'identité. Solution : Persistez l'objet session de chat en mémoire tout au long de la boucle d'édition.
  • Surcharge de Contexte : Attacher les 14 images dans le premier prompt confond le mécanisme d'attention. Solution : Introduisez les références progressivement ; ajoutez de nouveaux assets uniquement lorsque cet élément spécifique nécessite une modification.
  • Demandes de Modification Vagues : Demander improve the look déclenche des changements hallucinés dans des zones non liées. Solution : Isolez la cible d'édition en utilisant des descriptions de bounding box ou des instructions de calque explicites comme modify only the foreground subject.

Essayez ceci dans MidassAI

Vous pouvez répliquer ce pipeline d'édition multi-tours sans écrire de code en utilisant l'interface visuelle dans MidassAI Studio. La plateforme gère la persistance de session et l'étiquetage des références automatiquement, vous permettant de vous concentrer sur le design itératif plutôt que sur la gestion d'état API. Démarrez votre projet ici : https://www.midassai.com/studio/nano/

Related articles

Try Nano Banana in MidassAI