Hemos estado escuchando el término ‘nativamente multimodal‘En el espacio de IA durante más de un año, pero las empresas tardaron en desbloquear capacidades multimodales completas de sus modelos de IA hasta ahora. Google finalmente lanzó su último modelo «Gemini 2.0 Flash Experimental» con la capacidad de generar y editar imágenes nativo.
Ahora, es posible que se pregunte, ¿cuál es el gran problema con la generación de imágenes? La generación de imágenes de IA ha estado disponible con todos los principales chatbots de inteligencia artificial como chatgpt durante bastante tiempo. Bueno, cuando generamos imágenes AI en ChatGPT o Géminis, el aviso se enruta a un modelo especializado basado en difusión como Dall-E 3 o Imagen 3. Dichos modelos están entrenados en imágenes y diseñados solo para generar imágenes; Son como una extensión del modelo de IA principal y no son parte de él.
Sin embargo, los modelos de visión de lenguaje como Gemini son de forma nativa multimodal, lo que significa que pueden comprender, generar y modificar inherentemente tanto texto como imágenes. Hasta ahora, ninguna empresa de tecnología había puesto esta capacidad a disposición de los usuarios. Operai demostró su función nativa de generación de imágenes con GPT-4O en 2025, pero nuevamente, nunca fue lanzado.
Con la generación de imágenes nativas, obtienes mejor consistencia ya que los modelos multimodales están entrenados en un gran conjunto de datos de diferentes modalidades. Como resultado, tales modelos cuentan con una mejor comprensión de los conceptos y exhiben un conocimiento mundial más amplio.
Cómo usar la herramienta de relleno generativo de IA de Photoshop ahora mismo
Más allá de la generación de imágenes, puede editar sin problemas imágenes con indicaciones simples. Por ejemplo, puede cargar una imagen y pedirle al modelo que agregue gafas de sol, insertar texto legible, eliminar objetos y más a la imagen. Y a diferencia de los modelos de difusión que regeneran toda la imagen con cada nuevo aviso, los modelos multimodales nativamente mantienen la consistencia en múltiples modificaciones.
Generación de imágenes nativas con Gemini 2.0 Flash Experimental
Actualmente, la función de generación de imágenes nativas no está disponible para los usuarios generales. El modelo experimental Gemini 2.0 Flash con generación de imágenes nativas solo está disponible en el estudio de inteligencia artificial de Google (visita) gratis.
Después de obtener una vista previa del modelo en AI Studio, se lanzará en Gemini para que todos los usen en el futuro cercano. Sin embargo, probé el nuevo modelo Gemini con la generación de imágenes nativas, y fue una experiencia bastante emocionante.
Primero, comencé con una guía visual para mostrar la consistencia de la capacidad de generación de imágenes nativas de Gemini. Le pedí a Gemini que creara una guía visual sobre cómo hacer una tortilla, generando una imagen para cada paso del proceso.
Como puede notar, los resultados son muy consistentes entre las imágenes sin problemas técnicos. Incluso el tazón es el mismo en la segunda imagen. Finalmente, puede descargar las imágenes en la resolución 1024 x 680. De esta manera, puede crear una guía visual sobre lo que desee.
A continuación, le pedí a Gemini que creara una mesa estética y luego le dije que mostrara la mesa desde el ángulo de la cámara central. Hizo un trabajo perfecto. Después de eso, le pidí a Gemini a agregar una PlayStation a la mesa y darme una mirada más cercana. De nuevo, Géminis lo clavó. El modelo AI, como verá a continuación, también incluyó un reflejo de la PS5 en el espejo detrás de él.
Edición de imágenes nativas con Gemini 2.0 Flash Experimental
Para demostrar la edición de imágenes nativas, subí una imagen de mi galería y le pedí a Gemini 2.0 que quitara la copa de vino de la mesa. Después de eso, le dije a Gemini que agregara champiñones a la pizza, e hizo un trabajo maravilloso. Luego, solicité a Gemini a agregar un croissant y allí tienes la edición de imágenes de IA en gloria completa, gracias a la capacidad multimodal nativa de Gemini.
Luego, subí una imagen mía y le pedí a Gemini que agregara gafas de sol y luego agregué el texto «Moyens I/O» en mi camiseta. Ambos se hicieron bastante bien.
Por último, le pedí a Gemini que coloreara una imagen, y también funcionó muy bien. Quiero decir, la imagen salió más hermosa de lo que era antes, sin problemas extraños, artefactos o parte de la imagen que falta.

Hay muchos casos de uso que puede probar con la nueva capacidad multimodal de Gemini. Google ha hecho un trabajo encomiable con la generación y edición de imágenes nativas, y planeo usarlo más rigurosamente en las próximas semanas para probar sus límites.
Después del lanzamiento de VEO 2 para la generación de videos e Imagen 3 para la generación de imágenes especializada, parece que Google ha superado a OpenAI en muchas áreas; No solo la generación de texto de IA. Por lo tanto, sería interesante ver qué hace Operai al lado de reclamar el primer lugar con ChatGPT.
Apoya nuestro trabajo ❤️
Si te ha gustado este artículo, considera dejar una propina para ayudarnos a seguir publicando contenido de calidad.




























