El mismo modelo, con números menos precisos
Si una IA local no cabe en la memoria de tu ordenador, una versión cuantizada puede permitirte ejecutarla. Cuantizar consiste en representar sus pesos, los números ajustados durante el entrenamiento, con menos bits. El modelo ocupa menos, a cambio de aproximar valores que antes se guardaban con más precisión.
Hugging Face explica que estas técnicas intentan conservar la calidad mientras reducen los requisitos de memoria. No eliminan necesariamente conocimientos concretos ni resumen el modelo como se resume un documento. Cambian la representación de los números con los que calcula su respuesta.
Las etiquetas 4-bit y 8-bit indican esa precisión de almacenamiento. No son una nota de inteligencia. Dos modelos distintos no se pueden comparar solo por el número de bits, igual que tampoco basta con comparar el tamaño de sus archivos.

La cuenta útil y la memoria que falta
Un ejemplo teórico ayuda a calcular la escala. Ocho mil millones de pesos a 16 bits ocupan unos 16 GB decimales. A 8 bits serían unos 8 GB y a 4 bits, unos 4 GB. La cuenta es número de pesos × bits ÷ 8. Son estimaciones de los pesos, no requisitos completos del ordenador.
Los formatos reales añaden información auxiliar y pueden conservar algunas partes con más precisión. La documentación de bitsandbytes muestra precisamente que no todos los componentes tienen por qué convertirse al mismo formato. Por eso un archivo anunciado como de 4 bits no tiene que medir exactamente una cuarta parte del de 16 bits.
También hace falta espacio para el programa y para procesar la conversación. Ollama advierte de que ampliar el contexto aumenta la memoria necesaria. El contexto es el texto disponible para esa petición, no un recuerdo permanente. Si quieres situar el resto de requisitos, nuestra comparación de IA local y en la nube separa las responsabilidades del ordenador y del servicio remoto.

Cómo escoger entre dos versiones
Compara versiones del mismo modelo y con la misma longitud de contexto. Empieza por una que tu aplicación declare compatible con tu equipo. Una descarga más pequeña puede ir más rápida o permitir que todo el modelo quepa en la gráfica, pero el método de cuantización y el software también influyen. No prometen una aceleración fija.
La comprobación antes de quedarte con una
Cuantizar tampoco equivale a hacer fine-tuning. El primero cambia cómo se representan los pesos y el segundo ajusta el comportamiento mediante entrenamiento adicional.
- Descarga una versión identificada por su autor y compatible con tu aplicación. Comprueba modelo base, número de bits y memoria estimada.
- Prueba las mismas tareas con respuestas verificables: resumir un texto conocido, extraer fechas o resolver un problema cuya solución tengas. No juzgues solo si escribe con soltura.
- Observa el consumo durante una conversación del tamaño que usarás normalmente, no únicamente al cargar el modelo. En Ollama, ollama ps muestra la distribución entre CPU y GPU y el contexto asignado.
- Si falta memoria, reduce el contexto o prueba un modelo menor. Si empeora la calidad que necesitas y tienes margen de memoria, compara una versión de mayor precisión.
La conversación empieza aquí
Accede con una cuenta de apoyo para comentar. Entrar




Todavía no ha comentado nadie. ¿Estrenas tú?