← Biblioteca 02

Tipos de KV cache y flags de llama.cpp

llama.cppKV cachecuantización

Ficha

Tipo
código oficial
Autor / canal
ggml-org / llama.cpp
Idioma
inglés
Fecha
2026-09-12
Estado de evidencia
Demostrado
Procedencia
Fuente primaria oficial

Abrir fuente original

Resumen original

Este snapshot de common/arg.cpp enumera los tipos aceptados para la caché KV y define los argumentos de línea de comandos que configuran K y V por separado. La fuente demuestra, a nivel de código upstream, que llama.cpp contempla precisiones como F32, F16, BF16, Q8_0 y varios tipos Q4 o Q5 en esa revisión. También muestra que un valor no admitido produce un error explícito. Es útil porque obliga a separar la cuantización de pesos del GGUF de la memoria KV creada durante la inferencia: son decisiones distintas, con presupuestos y riesgos diferentes. El archivo no cuantifica ahorro, velocidad ni degradación, y el soporte sintáctico no garantiza estabilidad en todos los backends o arquitecturas. No prueba que KV Q4 preserve las capacidades de Ornith, que tres slots compartan memoria como se espera ni que el estado recurrente siga la misma representación. Para el Atlas, respalda la existencia de controles en el runtime y el diseño de un A/B donde los pesos permanezcan congelados mientras cambia únicamente K y V. Conviene consultarlo al construir el comando reproducible o investigar si un tipo de caché está realmente reconocido por una revisión concreta.

Qué enseña

Qué tipos de KV reconoce esa revisión de llama.cpp y cómo configurar K y V por separado.

Qué no demuestra

No demuestra ahorro, calidad, estabilidad ni concurrencia de Ornith con una combinación determinada.

Relación con Ornith

Fundamenta un A/B de KV Q4 frente a Q8 o F16 manteniendo fijo el GGUF.

Resumen en audio

Leer transcripción del resumen