MidassAI
Start Creating

Nano Banana 2: Ediciones Conversacionales con 14 Referencias

MidassAI Team · 1 de septiembre de 2026 · 6 min read

Try Nano Banana in MidassAI
Nano Banana 2: Ediciones Conversacionales con 14 Referencias

Nano Banana 2 (Gemini 3.1 Flash Image) no es solo un endpoint de texto a imagen; es un editor multimodal que acepta turnos de seguimiento. Google documenta hasta 14 imágenes de entrada por prompt y ediciones conversacionales que mantienen el contexto visual entre turnos al usar la API correctamente.

Niveles de resolución (elige antes de hacer el prompt)

Nivel Uso típico Nota de costo
512px Miniaturas, pruebas rápidas de diseño Menor consumo de tokens
1K Redes sociales, imágenes destacadas de blog Equilibrio predeterminado
2K Marketing cercano a impresión Tokens de salida más altos
4K Producto principal, tipografía fina Más lento; verifica la tipografía a tamaño real

Elige el nivel una vez por proyecto. Saltar de la exploración de 512 directamente a la entrega en 4K sin volver a verificar la composición desperdicia tokens.

Catorce referencias sin pérdida de identidad

Asigna roles en lenguaje natural:

Image 1–2: face and hair identity (ignore backgrounds).
Image 3: jacket fabric swatch only.
Image 4: lighting reference from a sunset plate.
Generate subject in a rainy alley, same identity, new wardrobe from Image 3.

Más referencias ≠ más control. Limita los sujetos distintos a lo que la escena necesita; a menudo, 3–5 imágenes más un brief de texto superan el máximo de adjuntos.

Try Nano Banana in MidassAI

Turnos de edición conversacional (modelo mental de API)

Turno 1: genera la escena base. Turno 2: Change only the sign text to "OPEN". Keep architecture and rain unchanged. Turno 3: Warm color grade +10%. Do not move camera.

Cada turno debe cambiar una dimensión (texto, vestuario, grado, crop). Párrafos con múltiples solicitudes hacen que el modelo promedie conflictos.

Los desarrolladores que usan google-genai deben mantener la misma sesión de conversación para que las Firmas de Pensamiento / contexto visual se mantengan; cambiar a llamadas sin estado entre turnos resetea la composición.

Contextualización web vs ediciones de referencia

La contextualización de Búsqueda Google responde a prompts factuales (today's weather in Seoul reflected in windows). Las ediciones de referencia responden a prompts de identidad (this exact person, new outfit). Mezclar ambos en un turno es válido, pero especifica qué entradas son factuales vs identidad.

Habilita la contextualización solo cuando los hechos sensibles al tiempo importan; de lo contrario, la latencia aumenta sin beneficio.

Pase de tipografía

Nano Banana 2 aún recompensa las cadenas entre comillas para el tipo: A neon sign reading "MIDASS" supera la masa de MAYÚSCULAS sin comillas. Después de un cambio de grado conversacional, vuelve a verificar la ortografía en un pase de zoom; los efectos de brillo ocultan errores hasta la exportación.

Modos de fallo

Problema Solución
La cara se desvía en el turno 3 Vuelve a anclar con la referencia de retrato original en cada turno
El fondo cambia al editar texto Añade keep background pixels unchanged explícitamente
4K suave Regenera en 2K con lenguaje de lente más nítido, luego escala el nivel

Mini lista de verificación

  • Nivel elegido para el objetivo de entrega
  • Referencias recortadas y etiquetadas por rol
  • Un cambio por turno conversacional
  • Contextualización solo cuando los hechos son sensibles al tiempo

vs Nano Banana Pro

Usa Pro cuando necesites la máxima fidelidad de un solo disparo en diagramas complejos; usa Flash Image (NB2) para bucles de iteración ajustados y ediciones multi-turno. Muchos conjuntos de producción generan en NB2, luego un pase Pro solo para imágenes principales.

Prerrequisitos y configuración

Antes de iniciar sesiones multi-turno, asegúrate de que tu proyecto de Google Cloud tenga la API de Vertex AI habilitada con permisos para models.generateContent. Necesitas una clave de API válida adjunta a una cuenta de facturación que admita endpoints de generación de imágenes. Verifica que estás llamando a la cadena de modelo específica gemini-3.1-flash-image; las variantes Flash más antiguas carecen de la ventana de contexto de 14 imágenes requerida para la retención de identidad compleja.

Las pruebas locales funcionan mejor mediante scripts de Python usando la versión 0.5 o superior del SDK google-genai, ya que el SDK gestiona el estado de la sesión automáticamente. Mantén las variables de entorno seguras y confirma que tu cuota permita tokens de salida de alta resolución, ya que las generaciones 4K consumen significativamente más capacidad que las solicitudes de miniaturas estándar.

Flujo de prompt extendido

  1. Inicializa la sesión de chat con temperature=0.7 para equilibrar la creatividad con la adherencia estricta a los activos de referencia. Establece max_output_tokens en 4096 para acomodar datos de imagen de alta resolución sin truncamiento.
  2. Sube tu referencia de identidad principal como la primera parte del contenido, etiquetándola system_instruction: "Maintain facial geometry from Image 1". Sigue esto con referencias de textura secundarias etiquetadas estrictamente por tipo de material, como denim o leather.
  3. Ejecuta la primera generación con una restricción de prompt negativo: no background changes, no lighting shifts. Esto bloquea el entorno mientras el modelo renderiza el sujeto.
  4. Para el segundo turno, modifica solo el parámetro color_grade en tu descripción de prompt. Usa valores específicos como increase saturation by 15% en lugar de términos vagos como make it pop.
  5. Finaliza la exportación solicitando la salida PNG cruda en lugar de JPEG comprimido para preservar la claridad del texto en señalización y detalles del vestuario.

Errores comunes

  • Restablecimiento de sesión: Cerrar el objeto de chat entre turnos obliga al modelo a inferir el contexto desde cero, causando deriva de identidad. Solución: Persiste el objeto de sesión de chat en memoria durante todo el bucle de edición.
  • Sobrecarga de contexto: Adjuntar las 14 imágenes en el primer prompt confunde el mecanismo de atención. Solución: Introduce referencias progresivamente; añade nuevos activos solo cuando ese elemento específico requiera modificación.
  • Solicitudes de modificación vagas: Pedir improve the look desencadena cambios alucinados en áreas no relacionadas. Solución: Aísla el objetivo de edición usando descripciones de bounding box o instrucciones de capa explícitas como modify only the foreground subject.

Pruébalo en MidassAI

Puedes replicar este pipeline de edición multi-turno sin escribir código usando la interfaz visual en MidassAI Studio. La plataforma maneja la persistencia de sesión y el etiquetado de referencias automáticamente, permitiéndote enfocarte en el diseño iterativo en lugar de la gestión de estado de la API. Comienza tu proyecto aquí: https://www.midassai.com/studio/nano/

Related articles

Try Nano Banana in MidassAI