Meta lanzó Llama 2 en el verano de 2023. La nueva versión de Llama está optimizada con un 40 % más de tokens que el modelo Llama original, duplicando la longitud de su contexto y superando significativamente a otros modelos de código abierto disponibles. La forma más rápida y sencilla de acceder a Llama 2 es a través de una API mediante una plataforma en línea. Sin embargo, si desea la mejor experiencia, lo mejor es instalar y cargar Llama 2 directamente en su computadora.
Con esto en mente, hemos creado una guía paso a paso sobre cómo usar Text-Generation-WebUI para cargar un Llama 2 LLM cuantificado localmente en su computadora.
¿Por qué instalar Llama 2 localmente?
Hay muchas razones por las que las personas eligen ejecutar Llama 2 directamente. Algunos lo hacen por cuestiones de privacidad, otros por personalización y otros por las capacidades sin conexión. Si está investigando, ajustando o integrando Llama 2 para sus proyectos, es posible que acceder a Llama 2 a través de API no sea lo adecuado para usted. El objetivo de ejecutar un LLM localmente en su PC es reducir la dependencia de herramientas de IA de terceros y usar IA en cualquier momento y en cualquier lugar, sin preocuparse por filtrar datos potencialmente confidenciales a empresas y otras organizaciones.
Dicho esto, comencemos con la guía paso a paso para instalar Llama 2 localmente.
Paso 1: Instalar la herramienta de compilación de Visual Studio 2019
Para simplificar las cosas, utilizaremos un instalador de un solo clic para Text-Generation-WebUI (el programa utilizado para cargar Llama 2 con GUI). Sin embargo, para que este instalador funcione, debe descargar Visual Studio 2019 Build Tool e instalar los recursos necesarios.
Descargar:Visual Studio 2019 (gratis)
- Continúe y descargue la edición comunitaria del software.
- Ahora instale Visual Studio 2019 y abra el software. Una vez abierto, marque la casilla Desarrollo de escritorio con C++ y pulsa instalar.
Ahora que tiene instalado el desarrollo de escritorio con C++, es momento de descargar el instalador de un solo clic Text-Generation-WebUI.
Paso 2: Instalar Text-Generation-WebUI
El instalador de un solo clic Text-Generation-WebUI es un script que crea automáticamente las carpetas necesarias y configura el entorno de Conda y todos los requisitos necesarios para ejecutar un modelo de IA.
Para instalar el script, descargue el instalador de un solo clic haciendo clic en Código > Descargar ZIP.
Descargar:Instalador de interfaz de usuario web para generación de texto (gratuito)
- Una vez descargado, extraiga el archivo ZIP a su ubicación preferida, luego abra la carpeta extraída.
- Dentro de la carpeta, desplácese hacia abajo y busque el programa de inicio adecuado para su sistema operativo. Ejecute los programas haciendo doble clic en el script correspondiente.
- Si está en Windows, seleccione ventanas de inicio archivo por lotes
- Para MacOS, seleccione inicio_macos concha de concha
- Para Linux, inicio_linux secuencia de comandos de shell.
- Es posible que su antivirus genere una alerta; esto no es un problema. El mensaje es solo un falso positivo del antivirus por ejecutar un archivo por lotes o un script. Haga clic en Corre de todos modos.
- Se abrirá una terminal y comenzará la configuración. Al principio, la configuración se detendrá y te preguntará qué GPU estás usando. Selecciona el tipo de GPU apropiado instalado en tu computadora y presiona Enter. Para aquellos que no tienen una tarjeta gráfica dedicada, selecciona Ninguno (quiero ejecutar modelos en modo CPU)Tenga en cuenta que ejecutar en modo CPU es mucho más lento en comparación con ejecutar el modelo con una GPU dedicada.
- Una vez que la configuración esté completa, puede iniciar Text-Generation-WebUI localmente. Puede hacerlo abriendo su navegador web preferido e ingresando la dirección IP proporcionada en la URL.
- La interfaz web ya está lista para usarse.
Sin embargo, el programa es solo un cargador de modelos. Descarguemos Llama 2 para que se inicie el cargador de modelos.
Paso 3: Descarga el modelo Llama 2
Hay varias cosas que se deben tener en cuenta al decidir qué iteración de Llama 2 se necesita. Estas incluyen parámetros, cuantificación, optimización de hardware, tamaño y uso. Toda esta información se encontrará indicada en el nombre del modelo.
- Parámetros: La cantidad de parámetros utilizados para entrenar el modelo. Los parámetros más grandes generan modelos más capaces, pero a costa del rendimiento.
- Uso: Puede ser estándar o chat. Un modelo de chat está optimizado para usarse como un chatbot como ChatGPT, mientras que el estándar es el modelo predeterminado.
- Optimización de hardware: Se refiere al hardware que mejor ejecuta el modelo. GPTQ significa que el modelo está optimizado para ejecutarse en una GPU dedicada, mientras que GGML está optimizado para ejecutarse en una CPU.
- Cuantización: Indica la precisión de los pesos y las activaciones en un modelo. Para la inferencia, una precisión de q4 es óptima.
- Tamaño: Se refiere al tamaño del modelo específico.
Tenga en cuenta que algunos modelos pueden estar organizados de forma diferente y es posible que ni siquiera muestren los mismos tipos de información. Sin embargo, este tipo de convención de nombres es bastante común en la biblioteca de modelos HuggingFace, por lo que vale la pena comprenderla.
En este ejemplo, el modelo puede identificarse como un modelo Llama 2 de tamaño mediano entrenado con 13 mil millones de parámetros optimizados para la inferencia de chat utilizando una CPU dedicada.
Para aquellos que utilizan una GPU dedicada, elija una GPTQ modelo, mientras que para aquellos que utilizan una CPU, elija GGMLSi quieres chatear con la modelo como lo harías con ChatGPT, elige charlarpero si quieres experimentar con el modelo con todas sus capacidades, utiliza el estándar modelo. En cuanto a los parámetros, debes saber que el uso de modelos más grandes proporcionará mejores resultados a expensas del rendimiento. Personalmente, te recomendaría que comiences con un modelo 7B. En cuanto a la cuantificación, utiliza q4, ya que solo es para inferencias.
Descargar:GGML (Gratis)
Descargar:GPTQ (Gratis)
Ahora que sabes qué iteración de Llama 2 necesitas, sigue adelante y descarga el modelo que quieras.
En mi caso, dado que lo estoy ejecutando en una ultrabook, usaré un modelo GGML optimizado para el chat. llama-2-7b-chat-ggmlv3.q4_K_S.bin.

Una vez finalizada la descarga, coloque el modelo en Generación de texto WebUI Main > modelos.

Ahora que ha descargado su modelo y lo ha colocado en la carpeta de modelos, es momento de configurar el cargador de modelos.
Paso 4: Configurar Text-Generation-WebUI
Ahora, comencemos la fase de configuración.
- Una vez más, abra Text-Generation-WebUI ejecutando el start_(tu sistema operativo) archivo (ver los pasos anteriores arriba).
- En las pestañas ubicadas sobre la GUI, haga clic en Modelo. Haga clic en el botón actualizar en el menú desplegable del modelo y seleccione su modelo.
- Ahora haga clic en el menú desplegable de la Cargador de modelos y seleccione AutomáticoGPTQ para aquellos que utilizan un modelo GTPQ y Transformadores c Para aquellos que utilizan un modelo GGML. Por último, haga clic en Carga para cargar su modelo.
- Para utilizar el modelo, abra la pestaña Chat y comience a probar el modelo.
¡Felicitaciones, has cargado exitosamente Llama2 en tu computadora local!
Pruebe otros LLM
Ahora que sabe cómo ejecutar Llama 2 directamente en su computadora usando Text-Generation-WebUI, también debería poder ejecutar otros LLM además de Llama. Solo recuerde las convenciones de nombres de los modelos y que solo las versiones cuantificadas de los modelos (generalmente de precisión q4) se pueden cargar en PC comunes. Hay muchos LLM cuantificados disponibles en HuggingFace. Si desea explorar otros modelos, busque TheBloke en la biblioteca de modelos de HuggingFace y debería encontrar muchos modelos disponibles.
Apoya nuestro trabajo ❤️
Si te ha gustado este artículo, considera dejar una propina para ayudarnos a seguir publicando contenido de calidad.



























