Nano Banana 2: Ediciones Conversacionales con 14 Referencias
MidassAI Team · 1 de septiembre de 2026 · 6 min read

Nano Banana 2 (Gemini 3.1 Flash Image) no es solo un endpoint de texto a imagen; es un editor multimodal que acepta turnos de seguimiento. Google documenta hasta 14 imágenes de entrada por prompt y ediciones conversacionales que mantienen el contexto visual entre turnos al usar la API correctamente.
Niveles de resolución (elige antes de hacer el prompt)
| Nivel | Uso típico | Nota de costo |
|---|---|---|
| 512px | Miniaturas, pruebas rápidas de diseño | Menor consumo de tokens |
| 1K | Redes sociales, imágenes destacadas de blog | Equilibrio predeterminado |
| 2K | Marketing cercano a impresión | Tokens de salida más altos |
| 4K | Producto principal, tipografía fina | Más lento; verifica la tipografía a tamaño real |
Elige el nivel una vez por proyecto. Saltar de la exploración de 512 directamente a la entrega en 4K sin volver a verificar la composición desperdicia tokens.
Catorce referencias sin pérdida de identidad
Asigna roles en lenguaje natural:
Image 1–2: face and hair identity (ignore backgrounds).
Image 3: jacket fabric swatch only.
Image 4: lighting reference from a sunset plate.
Generate subject in a rainy alley, same identity, new wardrobe from Image 3.Más referencias ≠ más control. Limita los sujetos distintos a lo que la escena necesita; a menudo, 3–5 imágenes más un brief de texto superan el máximo de adjuntos.
Turnos de edición conversacional (modelo mental de API)
Turno 1: genera la escena base.
Turno 2: Change only the sign text to "OPEN". Keep architecture and rain unchanged.
Turno 3: Warm color grade +10%. Do not move camera.
Cada turno debe cambiar una dimensión (texto, vestuario, grado, crop). Párrafos con múltiples solicitudes hacen que el modelo promedie conflictos.
Los desarrolladores que usan google-genai deben mantener la misma sesión de conversación para que las Firmas de Pensamiento / contexto visual se mantengan; cambiar a llamadas sin estado entre turnos resetea la composición.
Contextualización web vs ediciones de referencia
La contextualización de Búsqueda Google responde a prompts factuales (today's weather in Seoul reflected in windows). Las ediciones de referencia responden a prompts de identidad (this exact person, new outfit). Mezclar ambos en un turno es válido, pero especifica qué entradas son factuales vs identidad.
Habilita la contextualización solo cuando los hechos sensibles al tiempo importan; de lo contrario, la latencia aumenta sin beneficio.
Pase de tipografía
Nano Banana 2 aún recompensa las cadenas entre comillas para el tipo: A neon sign reading "MIDASS" supera la masa de MAYÚSCULAS sin comillas. Después de un cambio de grado conversacional, vuelve a verificar la ortografía en un pase de zoom; los efectos de brillo ocultan errores hasta la exportación.
Modos de fallo
| Problema | Solución |
|---|---|
| La cara se desvía en el turno 3 | Vuelve a anclar con la referencia de retrato original en cada turno |
| El fondo cambia al editar texto | Añade keep background pixels unchanged explícitamente |
| 4K suave | Regenera en 2K con lenguaje de lente más nítido, luego escala el nivel |
Mini lista de verificación
- Nivel elegido para el objetivo de entrega
- Referencias recortadas y etiquetadas por rol
- Un cambio por turno conversacional
- Contextualización solo cuando los hechos son sensibles al tiempo
vs Nano Banana Pro
Usa Pro cuando necesites la máxima fidelidad de un solo disparo en diagramas complejos; usa Flash Image (NB2) para bucles de iteración ajustados y ediciones multi-turno. Muchos conjuntos de producción generan en NB2, luego un pase Pro solo para imágenes principales.
Prerrequisitos y configuración
Antes de iniciar sesiones multi-turno, asegúrate de que tu proyecto de Google Cloud tenga la API de Vertex AI habilitada con permisos para models.generateContent. Necesitas una clave de API válida adjunta a una cuenta de facturación que admita endpoints de generación de imágenes. Verifica que estás llamando a la cadena de modelo específica gemini-3.1-flash-image; las variantes Flash más antiguas carecen de la ventana de contexto de 14 imágenes requerida para la retención de identidad compleja.
Las pruebas locales funcionan mejor mediante scripts de Python usando la versión 0.5 o superior del SDK google-genai, ya que el SDK gestiona el estado de la sesión automáticamente. Mantén las variables de entorno seguras y confirma que tu cuota permita tokens de salida de alta resolución, ya que las generaciones 4K consumen significativamente más capacidad que las solicitudes de miniaturas estándar.
Flujo de prompt extendido
- Inicializa la sesión de chat con
temperature=0.7para equilibrar la creatividad con la adherencia estricta a los activos de referencia. Establecemax_output_tokensen 4096 para acomodar datos de imagen de alta resolución sin truncamiento. - Sube tu referencia de identidad principal como la primera parte del contenido, etiquetándola
system_instruction: "Maintain facial geometry from Image 1". Sigue esto con referencias de textura secundarias etiquetadas estrictamente por tipo de material, comodenimoleather. - Ejecuta la primera generación con una restricción de prompt negativo:
no background changes, no lighting shifts. Esto bloquea el entorno mientras el modelo renderiza el sujeto. - Para el segundo turno, modifica solo el parámetro
color_gradeen tu descripción de prompt. Usa valores específicos comoincrease saturation by 15%en lugar de términos vagos comomake it pop. - Finaliza la exportación solicitando la salida PNG cruda en lugar de JPEG comprimido para preservar la claridad del texto en señalización y detalles del vestuario.
Errores comunes
- Restablecimiento de sesión: Cerrar el objeto de chat entre turnos obliga al modelo a inferir el contexto desde cero, causando deriva de identidad. Solución: Persiste el objeto de sesión de chat en memoria durante todo el bucle de edición.
- Sobrecarga de contexto: Adjuntar las 14 imágenes en el primer prompt confunde el mecanismo de atención. Solución: Introduce referencias progresivamente; añade nuevos activos solo cuando ese elemento específico requiera modificación.
- Solicitudes de modificación vagas: Pedir
improve the lookdesencadena cambios alucinados en áreas no relacionadas. Solución: Aísla el objetivo de edición usando descripciones de bounding box o instrucciones de capa explícitas comomodify only the foreground subject.
Pruébalo en MidassAI
Puedes replicar este pipeline de edición multi-turno sin escribir código usando la interfaz visual en MidassAI Studio. La plataforma maneja la persistencia de sesión y el etiquetado de referencias automáticamente, permitiéndote enfocarte en el diseño iterativo en lugar de la gestión de estado de la API. Comienza tu proyecto aquí: https://www.midassai.com/studio/nano/