Ficha
- Tipo
- documentación oficial
- Autor / canal
- ggml-org / llama.cpp
- Idioma
- inglés
- Fecha
- 2026-06-05
- Estado de evidencia
- Compatible sin probar
- Procedencia
- Fuente primaria oficial
Resumen original
La documentación de llama.cpp para quantize explica el paso de pesos de mayor precisión a representaciones GGUF cuantizadas, el compromiso entre tamaño y pérdida, y el uso de una importance matrix para orientar qué tensores merecen más precisión. También advierte que recuantizar un modelo ya cuantizado puede deteriorar la calidad más que partir de F16 o F32. Las opciones para elegir tipos de salida, embeddings y tensores concretos muestran que una etiqueta de cuatro bits no describe por sí sola toda la mezcla interna. Esta fuente es el punto de partida adecuado para documentar un baseline reproducible: archivo exacto, revisión de llama.cpp, receta de conversión e imatrix. No define Q4_K_L como un preset universal ni aporta resultados sobre Ornith, su arquitectura híbrida, su torre visual o su cabeza MTP. Tampoco demuestra que una mezcla sea más rápida o conserve mejor una tarea en el hardware local. En el Atlas se usa para separar el mecanismo general de cuantización de la validación del artefacto activo. Conviene leerla antes de convertir o comparar GGUF, especialmente si se pretende atribuir una regresión al cuantizador y no a diferencias de procedencia, plantilla o runtime.
Qué enseña
Cómo se cuantizan pesos en llama.cpp, qué papel cumple la imatrix y por qué hay mezclas por tensor.
Qué no demuestra
No define una receta universal Q4_K_L ni prueba calidad, velocidad o compatibilidad específica con Ornith.
Relación con Ornith
Ayuda a fijar el baseline Q4_K_L y a diseñar una comparación que cambie solo los pesos.