Ficha
- Tipo
- paper revisado por pares
- Autor / canal
- Saurav Muralidharan et al. / NVIDIA
- Idioma
- inglés
- Fecha
- 2024
- Estado de evidencia
- Compatible sin probar
- Procedencia
- Fuente académica primaria
Resumen original
Minitron estudia cómo derivar modelos compactos mediante poda estructurada y recuperación con destilación. El trabajo considera profundidad, dimensión oculta, cabezas de atención y ancho del MLP; usa señales basadas en activaciones para estimar importancia y después entrena el estudiante con una señal de conocimiento del modelo mayor. Sus experimentos muestran que la forma estructural elegida y la recuperación importan tanto como el porcentaje retirado. La ventaja práctica de una arquitectura densa y regular es que puede ejecutarse con kernels comunes, a diferencia de patrones dispersos que ahorran parámetros sin reducir latencia. Sin embargo, los resultados corresponden a familias, escalas y presupuestos concretos; no demuestran transferencia directa a Ornith, que mezcla atención completa y lineal, e incluye visión y MTP. Tampoco autorizan a eliminar capas, dimensiones o capacidades sin una evaluación local. En el Atlas, Minitron se clasifica como compatible sin probar y aporta un diseño experimental: comparar depth-only y width-only, recuperar con destilación y medir por dominio. Conviene leerlo antes de comprometer recursos a una poda, para entender que el checkpoint recortado es solo el inicio y que la fase de recuperación y los gates determinan si el resultado es utilizable.
Qué enseña
Cómo combinar poda estructurada regular con destilación y comparar profundidad frente a anchura.
Qué no demuestra
No demuestra que sus ratios, rankings o ahorros se transfieran a Ornith.
Relación con Ornith
Es una referencia metodológica para un experimento sobre copia del modelo, con recovery y gates completos.