En el evento Google Cloud Next 2024 en Las Vegas, Google anunció que Gemini 1.5 Pro estará disponible de forma general para todos los usuarios. El modelo tan esperado finalmente está en vista previa pública con una ventana de 1 millón de contexto, y usted ya no tienes que registrarte para la lista de espera para acceder al modelo Gemini 1.5 Pro.
Intenté acceder al modelo Gemini 1.5 Pro desde una nueva cuenta de Google y el modelo estuvo disponible sin esperar. Y todo esto está disponible de forma gratuita.
Dicho esto, no significa que puedas empezar a utilizar el modelo Gemini 1.5 Pro en el portal Gemini. Tendrás que dirigirte a aistudio.google.com (visita) para acceder al modelo actual. Después de unos meses de vista previa pública, el modelo estará disponible en el portal Gemini. Probablemente necesitarás una suscripción a Gemini Advanced para utilizar el modelo.
Tenga en cuenta que el modelo Gemini 1.5 Pro es un modelo de nivel medio Sin embargo, construido sobre la arquitectura MoE, supera fácilmente al modelo Gemini 1.0 Ultra más grande. Y en nuestra comparación con el modelo GPT-4, Gemini 1.5 Pro mostró capacidades notables en varias pruebas. Cuando Gemini 1.5 Pro debute en el portal Gemini, espere que funcione mejor que el modelo Opus de GPT-4 y Claude 3.
Aparte de eso, Gemini 1.5 Pro ahora puede procesar archivos de audio también. Puede cargar archivos de audio de reuniones o videos, y el modelo puede escuchar los archivos cargados sin la necesidad de generar una transcripción manualmente. Puede ser de gran ayuda para las personas que desean encontrar información rápida y estructurada en reuniones o debates de audio.
Géminis 1.5 Pro ya pude procesar videos e imágenes, y ahora también se admiten archivos de audio, lo que lo convierte en un potente modelo multimodal con una longitud de contexto de 1 millón de tokens. Probamos la capacidad de procesamiento de audio del modelo Gemini 1.5 Pro. Así es como fue.
Cómo procesar archivos de audio en Gemini 1.5 Pro
- Dirígete a aistudio.google.com (visita) en un navegador.
- A continuación, asegúrese de que «Géminis 1.5 Pro«El modelo está seleccionado en el menú desplegable.

- Después de eso, haga clic en «Audio”Menú en la fila superior y cargue su archivo de audio. Admite estos formatos de archivos de audio: FLAC, MIDI, MP3, M4A, OPUS, OGG, OGA, WAV y MID.

- Procesará el archivo de audio y lo consumirá. fichas.
- Ahora, empieza a hacer tus preguntasy Gemini 1.5 Pro encontrará la información del audio y responderá en consecuencia.

- La mejor parte es que genera la transcripción en un formato estructurado con etiquetas de diferentes ponentes. Y no alucina en absoluto.

Así es como puedes cargar y procesar archivos de audio en Gemini 1.5 Pro. Es realmente un modelo poderoso del equipo de Google DeepMind y estoy entusiasmado de que ahora esté disponible para el público en general sin ningún costo. Continúe, pruébelo y háganos saber su opinión en la sección de comentarios a continuación.
Apoya nuestro trabajo ❤️
Si te ha gustado este artículo, considera dejar una propina para ayudarnos a seguir publicando contenido de calidad.




















