← Biblioteca 02

DFlash: Block Diffusion for Flash Speculative Decoding

DFlashspeculative decodingdestilación

Ficha

Tipo
paper académico
Autor / canal
Jian Chen, Yesheng Liang y Zhijian Liu / UC San Diego
Idioma
inglés
Fecha
2026-05-28
Estado de evidencia
Compatible sin probar
Procedencia
Fuente académica primaria

Abrir fuente original

Resumen original

DFlash es un esquema de speculative decoding donde un modelo ligero de difusión por bloques propone varios tokens y el modelo objetivo verifica cuáles acepta. El paper describe entrenamiento, bloques de propuesta y resultados de aceleración en sus configuraciones, presentando el proceso como lossless respecto del target porque la verificación conserva la distribución del modelo principal. Esta fuente permite diferenciar DFlash de un kernel de atención y también de MTP integrado: ambos pueden participar en una ruta especulativa, pero no son el mismo artefacto ni comparten necesariamente costos o compatibilidad. Los resultados publicados no demuestran que el archivo disponible en el entorno local esté cargado, que corresponda al target activo, que el runtime lo acepte o que produzca beneficio en el hardware de Ornith. En el Atlas, el estado permanece compatible sin probar y el archivo local se registra únicamente como presente. Conviene leer el paper antes de diseñar un ensayo aislado, para saber qué medir: tasa de aceptación, costo del draft, latencia, throughput, memoria, estabilidad y calidad. No debe activarse en producción ni compararse con MTP cambiando varias variables a la vez.

Qué enseña

La arquitectura de DFlash y qué métricas determinan el beneficio de una ruta especulativa.

Qué no demuestra

No demuestra carga, compatibilidad, aceptación ni aceleración del archivo local.

Relación con Ornith

Define el protocolo para probar DFlash aislado sin cambiar el estado conservador del Atlas.

Resumen en audio

Leer transcripción del resumen