← Biblioteca 02

Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning

poda estructuradacontinued pre-trainingdatos

Ficha

Tipo
paper revisado por pares
Autor / canal
Mengzhou Xia, Tianyu Gao, Zhiyuan Zeng y Danqi Chen
Idioma
inglés
Fecha
2024
Estado de evidencia
Compatible sin probar
Procedencia
Fuente académica primaria

Abrir fuente original

Resumen original

Sheared LLaMA aprende máscaras estructuradas para llevar un modelo LLaMA-2 7B a arquitecturas objetivo más pequeñas, retirando conjuntamente capas, cabezas y dimensiones ocultas o intermedias. Una parte central del método es fijar de antemano una forma densa ejecutable y adaptar la mezcla de datos durante el continued pre-training según la evolución de pérdidas por dominio. El trabajo muestra que la distribución usada para recuperar el modelo no es un detalle secundario: forma parte del resultado. También permite distinguir continued pre-training de destilación profesor-alumno, ya que su ruta principal no depende de imitar logits de un teacher. Sus experimentos se concentran en LLaMA y en dos tamaños objetivo; no demuestran que las máscaras, proporciones o mezcla dinámica funcionen en la arquitectura híbrida y multimodal de Ornith. Requiere además un presupuesto considerable de tokens tras la poda. Para el Atlas, la fuente aporta una alternativa a Minitron: elegir explícitamente la forma final y recuperar con datos, pero queda compatible sin probar. Conviene leerla cuando exista un tamaño o perfil de despliegue objetivo bien definido y se pueda financiar continued pre-training. No conviene usarla para justificar un recorte rápido sin reconstruir dependencias, corpus y evaluación.

Qué enseña

Cómo aprender una forma estructural objetivo y adaptar la mezcla de datos durante la recuperación.

Qué no demuestra

No demuestra transferibilidad de máscaras ni viabilidad económica para Ornith.

Relación con Ornith

Ofrece una ruta de poda con continued pre-training que debe compararse con destilación bajo igual presupuesto.

Resumen en audio

Leer transcripción del resumen