La IA de Google acaba de tener oídos 1

La IA de Google acaba de tener oídos

Los chatbots con IA ya son capaces de “ver” el mundo a través de imágenes y vídeos. Pero ahora, Google ha anunciado funcionalidades de conversión de audio a voz como parte de su última actualización de Gemini Pro. En Gemini 1.5 Pro, el chatbot ahora puede «escuchar» archivos de audio cargados en su sistema y luego extraer la información de texto.

La compañía ha puesto a disposición esta versión de LLM como vista previa pública en su plataforma de desarrollo Vertex AI. Esto permitirá que más usuarios centrados en la empresa experimenten con la función y amplíen su base después de un lanzamiento más privado en febrero, cuando se anunció el modelo por primera vez. Originalmente, esto se ofreció solo a un grupo limitado de desarrolladores y clientes empresariales.

1. Desglosar + comprender un vídeo largo

Subí todo el concurso de volcadas de la NBA de anoche y pregunté qué volcada tenía la puntuación más alta.

¡Gemini 1.5 fue increíblemente capaz de encontrar el mate perfecto específico de 50 y los detalles solo con la comprensión del video de contexto extenso! pic.twitter.com/01iUfqfiAO

– Rowan Cheung (@rowancheung) 18 de febrero de 2024

Google compartió los detalles sobre la actualización en su Nube Próxima conferencia, que se está llevando a cabo actualmente en Las Vegas. Después de llamar al Gemini Ultra LLM que impulsa su chatbot Gemini Advanced el modelo más poderoso de su familia Gemini, Google ahora llama al Gemini 1.5 Pro su modelo generativo más capaz. La compañía agregó que esta versión aprende mejor sin ajustes adicionales del modelo.

Gemini 1.5 Pro es multimodal porque puede interpretar diferentes tipos de audio en texto, incluidos programas de televisión, películas, transmisiones de radio y grabaciones de conferencias telefónicas. Incluso es multilingüe porque puede procesar audio en varios idiomas diferentes. El LLM también puede crear transcripciones a partir de videos; sin embargo, su calidad puede no ser confiable, como lo menciona TechCrunch.

Cuando se anunció por primera vez, Google explicó que Gemini 1.5 Pro utilizaba un sistema de tokens para procesar datos sin procesar. Un millón de tokens equivalen aproximadamente a 700.000 palabras o 30.000 líneas de código. En formato multimedia, equivale a una hora de vídeo o unas 11 horas de audio.

Ha habido algunas demostraciones preliminares privadas de Gemini 1.5 Pro que demuestran cómo el LLM puede encontrar momentos específicos en la transcripción de un video. Por ejemplo, Rowan Cheung, entusiasta de la IA obtuvo acceso temprano y detalló cómo su demostración encontró una toma de acción exacta en una competencia deportiva y resumió el evento, como se ve en el tweet incluido arriba.

Sin embargo, Google señaló que otros primeros usuarios, incluidos United Wholesale Mortgage, TBS y Replit, están optando por casos de uso más centrados en la empresa, como la suscripción de hipotecas, la automatización del etiquetado de metadatos y la generación, explicación y actualización de código.

Apoya nuestro trabajo ❤️

Si te ha gustado este artículo, considera dejar una propina para ayudarnos a seguir publicando contenido de calidad.

Pago seguro en PayPal