IAEXPLICADO FÁCIL3 MIN

IA de 4 u 8 bits: cómo hacer que un modelo quepa en tu ordenador y qué puedes perder

La cuantización reduce el espacio que ocupan los números de un modelo. Ahorra memoria, aunque el tamaño del archivo no basta para saber si funcionará bien.

Persona trabajando con un Mac Studio en un estudio, fotografía oficial de Apple
Imagen: Apple
01

El mismo modelo, con números menos precisos

Si una IA local no cabe en la memoria de tu ordenador, una versión cuantizada puede permitirte ejecutarla. Cuantizar consiste en representar sus pesos, los números ajustados durante el entrenamiento, con menos bits. El modelo ocupa menos, a cambio de aproximar valores que antes se guardaban con más precisión.

Hugging Face explica que estas técnicas intentan conservar la calidad mientras reducen los requisitos de memoria. No eliminan necesariamente conocimientos concretos ni resumen el modelo como se resume un documento. Cambian la representación de los números con los que calcula su respuesta.

Las etiquetas 4-bit y 8-bit indican esa precisión de almacenamiento. No son una nota de inteligencia. Dos modelos distintos no se pueden comparar solo por el número de bits, igual que tampoco basta con comparar el tamaño de sus archivos.

Vista frontal de un Mac Studio, ejemplo de ordenador de escritorio
Imagen: Apple
02

La cuenta útil y la memoria que falta

Un ejemplo teórico ayuda a calcular la escala. Ocho mil millones de pesos a 16 bits ocupan unos 16 GB decimales. A 8 bits serían unos 8 GB y a 4 bits, unos 4 GB. La cuenta es número de pesos × bits ÷ 8. Son estimaciones de los pesos, no requisitos completos del ordenador.

Los formatos reales añaden información auxiliar y pueden conservar algunas partes con más precisión. La documentación de bitsandbytes muestra precisamente que no todos los componentes tienen por qué convertirse al mismo formato. Por eso un archivo anunciado como de 4 bits no tiene que medir exactamente una cuarta parte del de 16 bits.

También hace falta espacio para el programa y para procesar la conversación. Ollama advierte de que ampliar el contexto aumenta la memoria necesaria. El contexto es el texto disponible para esa petición, no un recuerdo permanente. Si quieres situar el resto de requisitos, nuestra comparación de IA local y en la nube separa las responsabilidades del ordenador y del servicio remoto.

Conexiones y ventilación trasera de un Mac Studio
Imagen: Apple
03

Cómo escoger entre dos versiones

Compara versiones del mismo modelo y con la misma longitud de contexto. Empieza por una que tu aplicación declare compatible con tu equipo. Una descarga más pequeña puede ir más rápida o permitir que todo el modelo quepa en la gráfica, pero el método de cuantización y el software también influyen. No prometen una aceleración fija.

04

La comprobación antes de quedarte con una

Cuantizar tampoco equivale a hacer fine-tuning. El primero cambia cómo se representan los pesos y el segundo ajusta el comportamiento mediante entrenamiento adicional.

  • Descarga una versión identificada por su autor y compatible con tu aplicación. Comprueba modelo base, número de bits y memoria estimada.
  • Prueba las mismas tareas con respuestas verificables: resumir un texto conocido, extraer fechas o resolver un problema cuya solución tengas. No juzgues solo si escribe con soltura.
  • Observa el consumo durante una conversación del tamaño que usarás normalmente, no únicamente al cargar el modelo. En Ollama, ollama ps muestra la distribución entre CPU y GPU y el contexto asignado.
  • Si falta memoria, reduce el contexto o prueba un modelo menor. Si empeora la calidad que necesitas y tienes margen de memoria, compara una versión de mayor precisión.
00

La conversación empieza aquí

Accede con una cuenta de apoyo para comentar. Entrar

Todavía no ha comentado nadie. ¿Estrenas tú?

TU SIGUIENTE RUTA

Sigue tirando del hilo de Modelos y agentes de IA

Si este tema te interesa, estas tres piezas son el mejor lugar por el que seguir.

ABRIR EL TEMA COMPLETO
  1. 01Claude ya lidera el 26% del trabajo de I+D medido por Anthropic, pero todavía no construye modelos soloIA · 2 MIN
  2. 02Claude une el chat y Cowork: tus documentos ya no tienen que salir de la conversaciónIA · 3 MIN
  3. 03Subir un PDF no es entrenar una IA: qué cambia realmente con el fine-tuningIA · 3 MIN

SIGUE LEYENDO

También te puede interesar

PORTADA