Ficha
- Tipo
- pull request oficial
- Autor / canal
- ikawrakow / ggml-org
- Idioma
- inglés
- Fecha
- 2023-06-05
- Estado de evidencia
- Demostrado
- Procedencia
- Fuente primaria oficial
Resumen original
La pull request 1684 introduce históricamente los K-quants en llama.cpp y documenta esquemas de dos a seis bits, implementaciones para distintas rutas de cómputo y mezclas de precisión. Sus tablas relacionan tamaño y perplexity en modelos LLaMA de la época, aportando una base técnica para entender que el número nominal de bits no determina por sí solo el resultado: importan los bloques, las escalas y qué matrices reciben más precisión. Como registro de ingeniería, demuestra que estos formatos fueron incorporados y evaluados en aquel contexto. No valida las etiquetas comunitarias posteriores que añaden sufijos como L, ni prueba que los resultados históricos se trasladen a Qwen3.5, Ornith o al hardware actual. Tampoco cubre cuantización de KV ni el estado recurrente de una arquitectura híbrida. Para el Atlas, esta fuente explica el linaje de la familia K y ayuda a no tratar Q4_K_L como una caja negra. Conviene leerla cuando se necesita comprender el origen de los K-quants o interpretar tablas antiguas de perplexity. La decisión moderna debe apoyarse además en la documentación y el artefacto fijados, seguida de pruebas pareadas por dominio.
Qué enseña
El origen de los K-quants, sus bloques y la relación histórica entre tamaño y perplexity.
Qué no demuestra
No valida Q4_K_L moderno, KV Q4 ni rendimiento o calidad de Ornith.
Relación con Ornith
Da contexto al nombre del quant activo, sin convertir resultados LLaMA históricos en evidencia local.