# Transcripción del resumen de audio Fuente dieciocho: Sheared LLaMA. Este trabajo aprende máscaras estructuradas para transformar LLaMA-2 7B en modelos densos más pequeños y fija una arquitectura objetivo con menos capas, cabezas y dimensiones. Después recupera el modelo mediante continued pre-training y ajusta la mezcla de dominios según sus pérdidas. La enseñanza clave es que la selección de datos forma parte del método, no es un trámite posterior. También conviene distinguirlo de Minitron: aquí la recuperación principal no es destilación de logits. Para Ornith, el enfoque queda compatible sin probar; las máscaras de LLaMA no se pueden copiar a una arquitectura híbrida con visión y MTP. Conviene leerlo cuando ya exista un tamaño objetivo claro y presupuesto para muchos tokens de recuperación. No conviene elegirlo como recorte rápido. El experimento correcto vuelve a aprender dependencias y compara esta ruta con destilación usando el mismo presupuesto y gates. El paper ayuda a estimar el trabajo real, pero no autoriza ninguna eliminación local. > Texto original del Atlas; no es una transcripción del contenido de terceros.