Capítulo 2: Estado real de Ornith en llama.cpp. En este capítulo aprenderás qué está activo, qué está apagado y qué sigue sin una prueba reproducible. El punto de partida es concreto. llama.cpp sirve Ornith-1.5-9B en formato GGUF, cuantización Q4_K_L, con cache KV en Q4, tres slots configurados y sin mmproj externo. Esta es la línea base operativa del Atlas. La combinación está cargada y activa. Ese hecho importa porque permite trabajar desde un sistema real, no desde una receta copiada de una tarjeta de modelo. También importa lo que esa línea base no demuestra. No hay que asociarle una cifra de rendimiento mientras falten comandos, versión exacta, hash del artefacto, logs y repeticiones archivadas. Las métricas históricas de velocidad, latencia y multicontexto siguen pendientes de trazabilidad. Pueden servir como pista para reconstruir una prueba, pero no como resultado publicable. Q4_K_L describe la cuantización de los pesos del modelo. KV Q4 describe otra decisión: cómo se guarda el cache de atención durante la inferencia. Los tres slots indican capacidad configurada para atender más de una secuencia, pero no prueban tres cargas largas simultáneas. El servidor puede reservar tres espacios y, aun así, quedarse sin memoria o degradar su comportamiento cuando cada solicitud crece. Configuración y capacidad validada no son sinónimos. La ausencia de mmproj externo significa que el perfil activo es textual. llama.cpp puede manejar un proyector multimodal separado, pero aquí no se está cargando. Eso ahorra el costo de ese componente y evita presentar la visión como capacidad activa. Tampoco permite afirmar que los pesos visuales fueron eliminados del modelo principal. Para saber qué contiene exactamente el GGUF hace falta inspección tensorial, nombres de tensores y trazabilidad del archivo. Fuente A sostiene la observación local del servicio activo y conserva los límites: carga confirmada, rendimiento y calidad pendientes. Fuente B coincide con la configuración básica, pero también recoge mediciones históricas que no vienen acompañadas por un paquete reproducible completo. Consenso, por tanto, cubre Q4_K_L, KV Q4, tres slots y ausencia de mmproj externo. No cubre las cifras históricas ni amplía el alcance de la prueba. DFlash debe mantenerse separado de esta línea base. El archivo Ornith-1.5-9B-DFlash-Q4_K_M.gguf está presente, pero permanece apagado, no cargado y no validado. DFlash es un drafter auxiliar para decodificación especulativa. Su sola presencia no modifica al servidor activo, no acelera respuestas y no aporta una medición. Antes de activarlo habría que fijar el runtime, comprobar compatibilidad con el target, registrar consumo de memoria y medir aceptación, latencia y calidad bajo el mismo protocolo. MTP es otra ruta distinta. La arquitectura de Ornith declara una capa MTP integrada y los runtimes actuales tienen soporte upstream para mecanismos de ese tipo. Sin embargo, MTP no ha sido evaluado funcionalmente en el perfil local. No están confirmados su uso efectivo, su aceptación, su memoria adicional ni su utilidad con el GGUF activo. MTP integrado y DFlash externo no deben mezclarse en una sola etiqueta de “aceleración especulativa”. El soporte upstream merece una lectura cuidadosa. Que una versión reciente de llama.cpp incluya una función significa que existe una ruta en el proyecto. No demuestra que el binario instalado tenga ese cambio, que el artefacto local sea compatible o que la combinación resulte más rápida. Para pasar de soporte a evidencia local hay que fijar el commit o la versión, ejecutar el caso y guardar los resultados. El contraste con AWQ ayuda a ver el límite. En otra ruta de serving, AWQ W4A16 con KV INT4 completó una solicitud cercana a 261 mil tokens. Esa prueba no pertenece a llama.cpp ni valida el GGUF activo. Tampoco demuestra tres solicitudes largas concurrentes o calidad equivalente. Sirve como referencia para diseñar un A/B, no como un resultado transferible entre motores. El siguiente trabajo útil no es cambiar muchas variables a la vez. Primero hay que cerrar la trazabilidad de la línea base: hash del Q4_K_L, procedencia, licencia efectiva, comando completo, versión de llama.cpp, hardware, plantilla, parámetros de muestreo y logs. Después se puede repetir un conjunto fijo de tareas. Sólo entonces conviene comparar pesos, cache o decodificación especulativa, una variable por vez. Tampoco deben presentarse como logros la poda, la eliminación de idiomas o QLoRA. Son líneas de investigación con riesgos y requisitos propios. Ninguna describe el estado actual del servidor. El valor del Atlas está en resistir la tentación de sumar posibilidades futuras a una configuración que hoy hace algo más acotado: inferencia textual con un GGUF concreto. Confirmado hoy… llama.cpp mantiene activo Ornith Q4_K_L con KV Q4, tres slots y sin mmproj externo. DFlash está presente como archivo, apagado y sin validación local. Falta demostrar… La trazabilidad de rendimiento, la concurrencia larga real, la calidad comparada, el contenido tensorial exacto del GGUF y la utilidad funcional de MTP o DFlash. Siguiente capítulo… Separaremos pesos, KV cache, estado recurrente y visión para entender qué memoria ocupa cada componente y qué cambia al ajustar uno de ellos.