← Biblioteca 02

LLM-Pruner: On the Structural Pruning of Large Language Models

poda estructuradaLoRAdependencias

Ficha

Tipo
paper revisado por pares
Autor / canal
Xinyin Ma, Gongfan Fang y Xinchao Wang
Idioma
inglés
Fecha
2023
Estado de evidencia
Compatible sin probar
Procedencia
Fuente académica primaria

Abrir fuente original

Resumen original

LLM-Pruner construye grupos de estructuras acopladas a partir de un grafo de dependencias, estima importancia con información de gradiente y elimina grupos completos antes de una recuperación ligera con LoRA. La idea resulta valiosa para modelos grandes porque una neurona, canal o cabeza rara vez vive aislada: sus dimensiones deben coincidir con proyecciones posteriores. El paper reporta retención parcial de métricas con una poda moderada en los modelos estudiados y degradación mayor cuando el recorte se vuelve agresivo. Sus promedios no equivalen a conservar todas las capacidades, y LoRA de recuperación no es lo mismo que destilación. El método fue probado en arquitecturas anteriores, no en Ornith ni en el patrón híbrido de Qwen3.5 con visión y MTP. En el Atlas, la fuente respalda la necesidad de mapear dependencias antes de tocar tensores y de medir tareas generativas además de clasificaciones. Queda compatible sin probar, no recomendado de forma automática. Conviene leerla cuando se necesite diseñar una herramienta que evite dimensiones incompatibles o comparar recovery con LoRA frente a otras opciones. Cualquier porcentaje debe recalibrarse con datos representativos y exportación real al runtime objetivo.

Qué enseña

Por qué la poda debe agrupar estructuras dependientes y cómo LoRA puede apoyar una recuperación ligera.

Qué no demuestra

No demuestra conservación universal ni compatibilidad plug-and-play con Ornith.

Relación con Ornith

Aporta un mapa conceptual de dependencias para no producir un checkpoint estructuralmente incoherente.

Resumen en audio

Leer transcripción del resumen