Ficha
- Tipo
- paper revisado por pares
- Autor / canal
- Xinyin Ma, Gongfan Fang y Xinchao Wang
- Idioma
- inglés
- Fecha
- 2023
- Estado de evidencia
- Compatible sin probar
- Procedencia
- Fuente académica primaria
Resumen original
LLM-Pruner construye grupos de estructuras acopladas a partir de un grafo de dependencias, estima importancia con información de gradiente y elimina grupos completos antes de una recuperación ligera con LoRA. La idea resulta valiosa para modelos grandes porque una neurona, canal o cabeza rara vez vive aislada: sus dimensiones deben coincidir con proyecciones posteriores. El paper reporta retención parcial de métricas con una poda moderada en los modelos estudiados y degradación mayor cuando el recorte se vuelve agresivo. Sus promedios no equivalen a conservar todas las capacidades, y LoRA de recuperación no es lo mismo que destilación. El método fue probado en arquitecturas anteriores, no en Ornith ni en el patrón híbrido de Qwen3.5 con visión y MTP. En el Atlas, la fuente respalda la necesidad de mapear dependencias antes de tocar tensores y de medir tareas generativas además de clasificaciones. Queda compatible sin probar, no recomendado de forma automática. Conviene leerla cuando se necesite diseñar una herramienta que evite dimensiones incompatibles o comparar recovery con LoRA frente a otras opciones. Cualquier porcentaje debe recalibrarse con datos representativos y exportación real al runtime objetivo.
Qué enseña
Por qué la poda debe agrupar estructuras dependientes y cómo LoRA puede apoyar una recuperación ligera.
Qué no demuestra
No demuestra conservación universal ni compatibilidad plug-and-play con Ornith.
Relación con Ornith
Aporta un mapa conceptual de dependencias para no producir un checkpoint estructuralmente incoherente.