← Biblioteca 02

ShortGPT: Layers in Large Language Models are More Redundant Than You Expect

poda estructuradacapasevaluación

Ficha

Tipo
paper revisado por pares
Autor / canal
Xin Men et al.
Idioma
inglés
Fecha
2025-07
Estado de evidencia
Compatible sin probar
Procedencia
Fuente académica primaria

Abrir fuente original

Resumen original

ShortGPT propone Block Influence, una medida basada en la similitud entre entrada y salida de cada bloque sobre un corpus de calibración, y elimina las capas consideradas menos influyentes. Su atractivo es operativo: calcular una línea base de poda de profundidad resulta más barato que una búsqueda estructural compleja y produce un modelo denso sencillo de ejecutar. La publicación distingue además entre evaluación de opción múltiple y generación, y documenta una limitación decisiva: recortes que parecen tolerables en algunos benchmarks pueden derrumbar tareas generativas. Por eso Block Influence debe interpretarse como herramienta de cribado, no como permiso para borrar capas. El trabajo no cubre Ornith, su patrón heterogéneo de atención, la torre visual ni MTP; tampoco demuestra que una similitud alta implique redundancia en todos los dominios o longitudes. Para el Atlas, ShortGPT refuerza la necesidad de gates separados y de observar tareas reales, no solo un promedio. Conviene leerlo antes de una prueba depth-only de bajo costo y para construir un diagnóstico inicial. Si se aplica a Ornith, habría que respetar macro-bloques, recalcular la métrica con datos representativos y detener el experimento ante regresiones generativas, multilingües o multimodales.

Qué enseña

Una línea base barata para estimar influencia de capas y la diferencia entre benchmarks y generación.

Qué no demuestra

No demuestra que una capa poco influyente sea prescindible en todos los dominios de Ornith.

Relación con Ornith

Puede servir como screening previo a una poda depth-only, nunca como autorización automática.

Resumen en audio

Leer transcripción del resumen