← Biblioteca 02

llama.cpp quantize

llama.cppcuantizaciónQ4_K_L

Ficha

Tipo
documentación oficial
Autor / canal
ggml-org / llama.cpp
Idioma
inglés
Fecha
2026-06-05
Estado de evidencia
Compatible sin probar
Procedencia
Fuente primaria oficial

Abrir fuente original

Resumen original

La documentación de llama.cpp para quantize explica el paso de pesos de mayor precisión a representaciones GGUF cuantizadas, el compromiso entre tamaño y pérdida, y el uso de una importance matrix para orientar qué tensores merecen más precisión. También advierte que recuantizar un modelo ya cuantizado puede deteriorar la calidad más que partir de F16 o F32. Las opciones para elegir tipos de salida, embeddings y tensores concretos muestran que una etiqueta de cuatro bits no describe por sí sola toda la mezcla interna. Esta fuente es el punto de partida adecuado para documentar un baseline reproducible: archivo exacto, revisión de llama.cpp, receta de conversión e imatrix. No define Q4_K_L como un preset universal ni aporta resultados sobre Ornith, su arquitectura híbrida, su torre visual o su cabeza MTP. Tampoco demuestra que una mezcla sea más rápida o conserve mejor una tarea en el hardware local. En el Atlas se usa para separar el mecanismo general de cuantización de la validación del artefacto activo. Conviene leerla antes de convertir o comparar GGUF, especialmente si se pretende atribuir una regresión al cuantizador y no a diferencias de procedencia, plantilla o runtime.

Qué enseña

Cómo se cuantizan pesos en llama.cpp, qué papel cumple la imatrix y por qué hay mezclas por tensor.

Qué no demuestra

No define una receta universal Q4_K_L ni prueba calidad, velocidad o compatibilidad específica con Ornith.

Relación con Ornith

Ayuda a fijar el baseline Q4_K_L y a diseñar una comparación que cambie solo los pesos.

Resumen en audio

Leer transcripción del resumen