← Biblioteca 02

Compact Language Models via Pruning and Knowledge Distillation

poda estructuradadestilaciónevaluación

Ficha

Tipo
paper revisado por pares
Autor / canal
Saurav Muralidharan et al. / NVIDIA
Idioma
inglés
Fecha
2024
Estado de evidencia
Compatible sin probar
Procedencia
Fuente académica primaria

Abrir fuente original

Resumen original

Minitron estudia cómo derivar modelos compactos mediante poda estructurada y recuperación con destilación. El trabajo considera profundidad, dimensión oculta, cabezas de atención y ancho del MLP; usa señales basadas en activaciones para estimar importancia y después entrena el estudiante con una señal de conocimiento del modelo mayor. Sus experimentos muestran que la forma estructural elegida y la recuperación importan tanto como el porcentaje retirado. La ventaja práctica de una arquitectura densa y regular es que puede ejecutarse con kernels comunes, a diferencia de patrones dispersos que ahorran parámetros sin reducir latencia. Sin embargo, los resultados corresponden a familias, escalas y presupuestos concretos; no demuestran transferencia directa a Ornith, que mezcla atención completa y lineal, e incluye visión y MTP. Tampoco autorizan a eliminar capas, dimensiones o capacidades sin una evaluación local. En el Atlas, Minitron se clasifica como compatible sin probar y aporta un diseño experimental: comparar depth-only y width-only, recuperar con destilación y medir por dominio. Conviene leerlo antes de comprometer recursos a una poda, para entender que el checkpoint recortado es solo el inicio y que la fase de recuperación y los gates determinan si el resultado es utilizable.

Qué enseña

Cómo combinar poda estructurada regular con destilación y comparar profundidad frente a anchura.

Qué no demuestra

No demuestra que sus ratios, rankings o ahorros se transfieran a Ornith.

Relación con Ornith

Es una referencia metodológica para un experimento sobre copia del modelo, con recovery y gates completos.

Resumen en audio

Leer transcripción del resumen