Ficha
- Tipo
- paper revisado por pares
- Autor / canal
- Mengzhou Xia, Tianyu Gao, Zhiyuan Zeng y Danqi Chen
- Idioma
- inglés
- Fecha
- 2024
- Estado de evidencia
- Compatible sin probar
- Procedencia
- Fuente académica primaria
Resumen original
Sheared LLaMA aprende máscaras estructuradas para llevar un modelo LLaMA-2 7B a arquitecturas objetivo más pequeñas, retirando conjuntamente capas, cabezas y dimensiones ocultas o intermedias. Una parte central del método es fijar de antemano una forma densa ejecutable y adaptar la mezcla de datos durante el continued pre-training según la evolución de pérdidas por dominio. El trabajo muestra que la distribución usada para recuperar el modelo no es un detalle secundario: forma parte del resultado. También permite distinguir continued pre-training de destilación profesor-alumno, ya que su ruta principal no depende de imitar logits de un teacher. Sus experimentos se concentran en LLaMA y en dos tamaños objetivo; no demuestran que las máscaras, proporciones o mezcla dinámica funcionen en la arquitectura híbrida y multimodal de Ornith. Requiere además un presupuesto considerable de tokens tras la poda. Para el Atlas, la fuente aporta una alternativa a Minitron: elegir explícitamente la forma final y recuperar con datos, pero queda compatible sin probar. Conviene leerla cuando exista un tamaño o perfil de despliegue objetivo bien definido y se pueda financiar continued pre-training. No conviene usarla para justificar un recorte rápido sin reconstruir dependencias, corpus y evaluación.
Qué enseña
Cómo aprender una forma estructural objetivo y adaptar la mezcla de datos durante la recuperación.
Qué no demuestra
No demuestra transferibilidad de máscaras ni viabilidad económica para Ornith.
Relación con Ornith
Ofrece una ruta de poda con continued pre-training que debe compararse con destilación bajo igual presupuesto.