Ficha
- Tipo
- paper académico
- Autor / canal
- Jian Chen, Yesheng Liang y Zhijian Liu / UC San Diego
- Idioma
- inglés
- Fecha
- 2026-05-28
- Estado de evidencia
- Compatible sin probar
- Procedencia
- Fuente académica primaria
Resumen original
DFlash es un esquema de speculative decoding donde un modelo ligero de difusión por bloques propone varios tokens y el modelo objetivo verifica cuáles acepta. El paper describe entrenamiento, bloques de propuesta y resultados de aceleración en sus configuraciones, presentando el proceso como lossless respecto del target porque la verificación conserva la distribución del modelo principal. Esta fuente permite diferenciar DFlash de un kernel de atención y también de MTP integrado: ambos pueden participar en una ruta especulativa, pero no son el mismo artefacto ni comparten necesariamente costos o compatibilidad. Los resultados publicados no demuestran que el archivo disponible en el entorno local esté cargado, que corresponda al target activo, que el runtime lo acepte o que produzca beneficio en el hardware de Ornith. En el Atlas, el estado permanece compatible sin probar y el archivo local se registra únicamente como presente. Conviene leer el paper antes de diseñar un ensayo aislado, para saber qué medir: tasa de aceptación, costo del draft, latencia, throughput, memoria, estabilidad y calidad. No debe activarse en producción ni compararse con MTP cambiando varias variables a la vez.
Qué enseña
La arquitectura de DFlash y qué métricas determinan el beneficio de una ruta especulativa.
Qué no demuestra
No demuestra carga, compatibilidad, aceptación ni aceleración del archivo local.
Relación con Ornith
Define el protocolo para probar DFlash aislado sin cambiar el estado conservador del Atlas.