← Biblioteca 02

k-quants

llama.cppcuantizaciónK-quants

Ficha

Tipo
pull request oficial
Autor / canal
ikawrakow / ggml-org
Idioma
inglés
Fecha
2023-06-05
Estado de evidencia
Demostrado
Procedencia
Fuente primaria oficial

Abrir fuente original

Resumen original

La pull request 1684 introduce históricamente los K-quants en llama.cpp y documenta esquemas de dos a seis bits, implementaciones para distintas rutas de cómputo y mezclas de precisión. Sus tablas relacionan tamaño y perplexity en modelos LLaMA de la época, aportando una base técnica para entender que el número nominal de bits no determina por sí solo el resultado: importan los bloques, las escalas y qué matrices reciben más precisión. Como registro de ingeniería, demuestra que estos formatos fueron incorporados y evaluados en aquel contexto. No valida las etiquetas comunitarias posteriores que añaden sufijos como L, ni prueba que los resultados históricos se trasladen a Qwen3.5, Ornith o al hardware actual. Tampoco cubre cuantización de KV ni el estado recurrente de una arquitectura híbrida. Para el Atlas, esta fuente explica el linaje de la familia K y ayuda a no tratar Q4_K_L como una caja negra. Conviene leerla cuando se necesita comprender el origen de los K-quants o interpretar tablas antiguas de perplexity. La decisión moderna debe apoyarse además en la documentación y el artefacto fijados, seguida de pruebas pareadas por dominio.

Qué enseña

El origen de los K-quants, sus bloques y la relación histórica entre tamaño y perplexity.

Qué no demuestra

No valida Q4_K_L moderno, KV Q4 ni rendimiento o calidad de Ornith.

Relación con Ornith

Da contexto al nombre del quant activo, sin convertir resultados LLaMA históricos en evidencia local.

Resumen en audio

Leer transcripción del resumen