ChatGPT 4o vs Gemini 1.5 Pro: Ultimate Showdown

ChatGPT 4o vs Gemini 1.5 Pro: Ultimate Showdown

OpenAI presentó su modelo estrella GPT-4o en el evento Spring Update y lo puso a disposición de todos de forma gratuita. Un día después, en el evento Google I/O 2024, Google presentó el modelo Gemini 1.5 Pro para consumidores a través de Gemini Advanced. Ahora que hay dos modelos estrella disponibles para consumidores, comparemos ChatGPT 4o y Gemini 1.5 Pro y veamos cuál funciona mejor. Dicho esto, comencemos.

Nota:
Para garantizar la coherencia, hemos realizado todas nuestras pruebas en Google AI Studio y Gemini Advanced. Ambos alojan el último modelo Gemini 1.5 Pro.

1. Calcular el tiempo de secado

Realizamos la prueba de razonamiento clásica en ChatGPT 4o y Gemini 1.5 Pro para poner a prueba su inteligencia. El ChatGPT 4o de OpenAI superó la prueba con éxito, mientras que el modelo mejorado de Gemini 1.5 Pro tuvo dificultades para comprender la pregunta capciosa. Se adentró en cálculos matemáticos y llegó a una conclusión errónea.

Si se tarda 1 hora en secar 15 toallas bajo el sol, ¿cuánto tiempo tardará en secar 20 toallas?

Ganador:ChatGPT 4o

  • Calcular el tiempo de secado al sol en la prueba de Gemini 1.5 Pro

2. Prueba del ascensor mágico

En la prueba del ascensor mágico, el modelo anterior ChatGPT 4 no había logrado adivinar correctamente la respuesta. Sin embargo, esta vez, el modelo ChatGPT 4o respondió con la respuesta correcta. Gemini 1.5 Pro también generó la respuesta correcta.

Hay un edificio alto con un ascensor mágico en su interior. Al detenerse en un piso parejo, este ascensor se conecta con el piso 1.
Empezando por el piso 1, tomo el ascensor mágico para subir 3 pisos. Al salir del ascensor, uso las escaleras para subir 3 pisos más.
¿En qué piso termino?

Ganador:ChatGPT 4o y Gemini 1.5 Pro

  • Prueba del ascensor mágico en chatgpt 4o
  • Prueba del ascensor mágico en Gemini 1.5 Pro

3. Localiza la manzana

En esta prueba, Gemini 1.5 Pro no logró comprender los matices de la pregunta. Parece que el modelo Gemini no está atento y pasa por alto muchos aspectos clave de la pregunta. Por otro lado, ChatGPT 4o dice correctamente que las manzanas son En la caja en el suelo¡Felicitaciones a OpenAI!

Hay una cesta sin fondo en una caja que está en el suelo. Pongo tres manzanas en la cesta y la coloco sobre una mesa. ¿Dónde están las manzanas?

Ganador:ChatGPT 4o

  • Otra prueba de razonamiento en chatgpt 4o
  • Prueba de razonamiento en gemini 1.5 pro

4. ¿Cuál es más pesado?

En esta prueba de razonamiento de sentido común, Gemini 1.5 Pro se equivoca y dice que ambos pesan lo mismo. Pero ChatGPT 4o señala acertadamente que las unidades son diferentes, por lo que un kg de cualquier material pesará más que una libra. Parece que el modelo mejorado de Gemini 1.5 Pro se ha vuelto más tonto con el tiempo.

¿Qué es más pesado, un kilo de plumas o una libra de acero?

Ganador:ChatGPT 4o

  • Encuentra la prueba de material más pesado en chatgpt 4o
  • Encuentra la prueba de peso en Gemini 1.5 Pro

5. Siga las instrucciones del usuario

Le pedí a ChatGPT 4o y Gemini 1.5 Pro que generaran 10 oraciones que terminaran con la palabra «mango». ¿Adivina qué? ChatGPT 4o generó las 10 oraciones correctamente, pero Gemini 1.5 Pro solo pudo generar 6 de esas oraciones.

Antes de GPT-4o, solo Llama 3 70B podía seguir correctamente las instrucciones del usuario. El modelo GPT-4 anterior también tenía problemas antes. Esto significa que OpenAI ha mejorado su modelo.

Generar 10 frases que terminen con la palabra «mango»

Ganador:ChatGPT 4o

  • Siga las instrucciones del usuario para probar el chat gpt 4o
  • Siga las instrucciones del usuario para realizar la prueba en Gemini 1.5 Pro

6. Prueba de imagen multimodal

François Fleuret, autor de El pequeño libro del aprendizaje profundo, realizó una prueba de análisis de imágenes simple en ChatGPT 4o y compartido Los resultados en X (antes Twitter). Ahora ha eliminado el tuit para evitar sacar el tema de proporción, ya que dice que es un problema general con los modelos de visión.

Prueba de imagen multimodal en chatgpt 4o

Dicho esto, realicé la misma prueba en Gemini 1.5 Pro y ChatGPT 4o para reproducir los resultados. Gemini 1.5 Pro tuvo un rendimiento mucho peor y dio respuestas incorrectas para todas las preguntas. ChatGPT 4o, por otro lado, dio una respuesta correcta, pero falló en otras preguntas.

Prueba multimodal en gemini 1.5 pro

Esto demuestra que hay muchas áreas en las que los modelos multimodales necesitan mejoras. Estoy particularmente decepcionado con la capacidad multimodal de Gemini porque parecía estar muy lejos de las respuestas correctas.

Ganador: Ninguno

7. Prueba de reconocimiento de caracteres

En otra prueba multimodal, subí las especificaciones de dos teléfonos (Pixel 8a y Pixel 8) en formato de imagen. No revelé los nombres de los teléfonos y las capturas de pantalla no tenían los nombres de los teléfonos. Ahora, le pedí a ChatGPT 4o que me dijera qué teléfono debería comprar.

  • Prueba de visión multimodal en chatgpt 4o
  • Prueba de visión multimodal en chatgpt 4o

Extrajo con éxito los textos de las capturas de pantalla, comparó las especificaciones y me dijo correctamente que obtuviera el Phone 2, que en realidad era el Pixel 8. Luego, le pedí que adivinara el teléfono y, nuevamente, ChatGPT 4o generó la respuesta correcta: Pixel 8.

Prueba de reconocimiento de caracteres en Gemini 1.5 Pro

Hice la misma prueba en Gemini 1.5 Pro a través de Google AI Studio. Por cierto, Gemini Advanced aún no admite la carga por lotes de imágenes. En cuanto a los resultados, simplemente no pudo extraer textos de ambas capturas de pantalla y siguió pidiendo más detalles. En pruebas como estas, se descubre que Google está muy por detrás de OpenAI cuando se trata de hacer las cosas sin problemas.

Ganador:ChatGPT 4o

8. Crea un juego

Ahora, para probar la capacidad de codificación de ChatGPT 4o y Gemini 1.5 Pro, les pedí a ambos modelos que crearan un juego. Subí una captura de pantalla del juego Atari Breakout (por supuesto, sin divulgar el nombre) y le pedí a ChatGPT 4o que creara este juego en Python. En solo unos segundos, generó el código completo y me pidió que instalara una biblioteca adicional «pygame».

  • Crea un juego de Python usando chatgpt 4o
  • Crea un juego de Python usando chatgpt 4o
  • Crea un juego de Python usando chatgpt 4o
  • Crea un juego de Python usando chatgpt 4o

Instalé la biblioteca y ejecuté el código con Python. El juego se inició correctamente sin errores. ¡Increíble! No fue necesario realizar depuraciones de ida y vuelta. De hecho, le pedí a ChatGPT 4o que mejorara la experiencia agregando una tecla de acceso rápido para reanudar y rápidamente agregó la funcionalidad. Eso es genial.

Crea un juego con Gemini 1.5 Pro

A continuación, subí la misma imagen a Gemini 1.5 Pro y le pedí que generara el código para este juego. El código se generó, pero al ejecutarlo, la ventana se seguía cerrando. No pude jugar el juego en absoluto. En pocas palabras, para tareas de codificación, ChatGPT 4o es mucho más confiable que Gemini 1.5 Pro.

Ganador:ChatGPT 4o

El veredicto

Está claro que Gemini 1.5 Pro está muy por detrás de ChatGPT 4o. Incluso después de mejorar el modelo 1.5 Pro durante meses mientras estaba en versión preliminar, no puede competir con el último modelo GPT-4o de OpenAI. Desde el razonamiento de sentido común hasta las pruebas multimodales y de codificación, ChatGPT 4o funciona de manera inteligente y sigue las instrucciones con atención. No hay que olvidar que OpenAI ha hecho que ChatGPT 4o sea gratuito para todos.

Lo único bueno de Gemini 1.5 Pro es la enorme ventana de contexto con soporte para hasta 1 millón de tokens. Además, también puedes subir videos, lo cual es una ventaja. Sin embargo, dado que el modelo no es muy inteligente, no estoy seguro de que a muchos les guste usarlo solo por la ventana de contexto más grande.

En el evento Google I/O 2024, Google no anunció ningún nuevo modelo de Frontier. La compañía se quedó con su modelo incremental Gemini 1.5 Pro. No hay información sobre Gemini 1.5 Ultra o Gemini 2.0. Si Google tiene que competir con OpenAI, se requiere un salto sustancial.

Apoya nuestro trabajo ❤️

Si te ha gustado este artículo, considera dejar una propina para ayudarnos a seguir publicando contenido de calidad.

Pago seguro en PayPal
Véase también:  CEO de DeepSeek en caída libre tras supuesta filtración: el drama de la IA aburre al público