Después de que OpenAI introdujo los modelos de razonamiento o1 en ChatGPT, toda la industria de la IA se dio cuenta y comenzó a trabajar en el “cómputo en el tiempo de prueba”, también conocido como escalado de inferencia. El consenso general pasó de entrenar modelos más grandes a dar más tiempo para “pensar” durante la inferencia para desbloquear la inteligencia y la capacidad de razonamiento.
Recientemente, Google anunció su primer modelo de razonamiento llamado “Gemini 2.0 Flash Thinking” que, al igual que ChatGPT o1, reevalúa su respuesta antes de generar la respuesta final. La idea es permitir que el modelo verifique su respuesta verificando rigurosamente todos los resultados posibles. El escalado de inferencia ha dado lugar a un rendimiento mucho mejor incluso en modelos más pequeños.
Ahora que Google se ha sumado al tren de la “computación en tiempo de prueba”, comparémoslo con los modelos o1 y o1-mini de OpenAI. Para que la comparación sea interesante, también he incluido el modelo DeepSeek-R1-Lite-Preview de China, que adopta un enfoque similar. En ese sentido, veamos la comparación entre Gemini 2.0 Flash Thinking, ChatGPT o1 y DeepSeek R1 Lite.
Pruebas de razonamiento
Comencemos con la popular pregunta de Strawberry, en la que se pide a los modelos de IA que cuenten la letra ‘r’. En la primera prueba, Gemini 2.0 Flash Thinking de Google tropieza y dice que hay dos erres en la palabra «Fresa». Por otro lado, ChatGPT o1 y el modelo más pequeño, o1-mini, obtienen la respuesta correcta en el primer intento. Finalmente, el modelo de razonamiento de DeepSeek también dice correctamente que hay tres erres.
A continuación, probé un mensaje complicado elaborado por Riley Goodside para comprobar qué tan bien los modelos de IA pueden tejer conexiones y encontrar la respuesta correcta. Bueno, Gemini 2.0 Flash Thinking, o1-mini y DeepSeek alucinaron mucho y se equivocaron en la respuesta.
Nombra un ejemplo específico de la forma de entretenimiento cuyo acrónimo también podría representar los nombres de un grupo que visitó un país cuyo futuro líder se casó con un italiano.

Dado que tanto Gemini 2.0 Flash Thinking como ChatGPT o1 admiten la entrada de imágenes, subí una imagen que contiene un problema matemático, de Gemini. libro de cocina. En esta prueba multimodal, Gemini 2.0 Flash Thinking diezma el modelo ChatGPT o1.

Géminis identifica correctamente el triángulo como rectángulo y deduce que la región superpuesta es 1/4 del círculo. Ahora, simplemente divide el área del círculo por 4 y obtienes 9π/4 (el radio es 3), que es 7,065.

ChatGPT o1, por otro lado, identifica incorrectamente el triángulo como isósceles y llega a una conclusión errónea. Siento que Google está por delante de la competencia en lo que respecta a consultas multimodales, especialmente en procesamiento de imágenes.
Pensamientos tempranos
El modelo Gemini 2.0 Flash Thinking de Google es definitivamente mejor y más rápido, pero mi impresión inicial es que no es más inteligente que ChatGPT o1, e incluso que el modelo más pequeño, o1-mini. En mis pruebas hasta ahora, encontré que ChatGPT o1 es mucho más reflexivo y se basa en hechos.
Para ser justos con Gemini 2.0 Flash Thinking, el sistema de razonamiento se ha desarrollado en el modelo más pequeño Gemini 2.0 Flash, por lo que compararlo con SOTA ChatGPT o1 es un poco injusto. Creo que deberíamos esperar al modelo más grande Gemini 2.0 Pro Thinking, que debería escalar mejor y dar como resultado un rendimiento de razonamiento más sólido.
Dicho esto, la fortaleza de Gemini 2.0 Flash Thinking radica en su comprensión multimodal que incluye procesamiento de video, audio e imágenes. Es simplemente superior a los modelos de razonamiento de la competencia. Aparte de eso, muchos usuarios han descubierto que Gemini 2.0 Flash Thinking resuelve un problema Problema de Putnam 2024 y El problema de los tres jugadores. Claramente, su caso de uso va más allá del simple razonamiento.
Sin embargo, la carrera para resolver el razonamiento y la inteligencia apenas ha comenzado, y en 2025 veremos mejoras significativas en este frente.
Apoya nuestro trabajo ❤️
Si te ha gustado este artículo, considera dejar una propina para ayudarnos a seguir publicando contenido de calidad.




















