← Atlas

Biblioteca 02

12 fuentes nuevas, 12 resúmenes originales y 12 audios. Dos fuentes comunitarias están marcadas como anecdóticas.

Filtrar

documentación oficial · Fuente primaria oficial

llama.cpp quantize

ggml-org / llama.cpp

Cómo se cuantizan pesos en llama.cpp, qué papel cumple la imatrix y por qué hay mezclas por tensor.

Abrir ficha

pull request oficial · Fuente primaria oficial

k-quants

ikawrakow / ggml-org

El origen de los K-quants, sus bloques y la relación histórica entre tamaño y perplexity.

Abrir ficha

código oficial · Fuente primaria oficial

Tipos de KV cache y flags de llama.cpp

ggml-org / llama.cpp

Qué tipos de KV reconoce esa revisión de llama.cpp y cómo configurar K y V por separado.

Abrir ficha

model card comunitaria · Comunitaria anecdótica

Receta Q4_K_L en Qwen3-8B-GGUF

bartowski

Una definición concreta y verificable de Q4_K_L usada por un productor de GGUF.

Abrir ficha

paper revisado por pares · Fuente académica primaria

Compact Language Models via Pruning and Knowledge Distillation

Saurav Muralidharan et al. / NVIDIA

Cómo combinar poda estructurada regular con destilación y comparar profundidad frente a anchura.

Abrir ficha

paper revisado por pares · Fuente académica primaria

Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning

Mengzhou Xia, Tianyu Gao, Zhiyuan Zeng y Danqi Chen

Cómo aprender una forma estructural objetivo y adaptar la mezcla de datos durante la recuperación.

Abrir ficha

paper revisado por pares · Fuente académica primaria

LLM-Pruner: On the Structural Pruning of Large Language Models

Xinyin Ma, Gongfan Fang y Xinchao Wang

Por qué la poda debe agrupar estructuras dependientes y cómo LoRA puede apoyar una recuperación ligera.

Abrir ficha

paper revisado por pares · Fuente académica primaria

ShortGPT: Layers in Large Language Models are More Redundant Than You Expect

Xin Men et al.

Una línea base barata para estimar influencia de capas y la diferencia entre benchmarks y generación.

Abrir ficha

paper académico · Fuente académica primaria

LoRA: Low-Rank Adaptation of Large Language Models

Edward J. Hu et al. / Microsoft

El mecanismo de adaptadores de bajo rango sobre una base congelada y sus ventajas de entrenamiento.

Abrir ficha

paper y marco de evaluación · Fuente académica primaria

Holistic Evaluation of Language Models (HELM)

Percy Liang, Rishi Bommasani et al. / Stanford CRFM

Cómo evitar una evaluación unidimensional y declarar explícitamente escenarios y métricas ausentes.

Abrir ficha

paper académico · Fuente académica primaria

DFlash: Block Diffusion for Flash Speculative Decoding

Jian Chen, Yesheng Liang y Zhijian Liu / UC San Diego

La arquitectura de DFlash y qué métricas determinan el beneficio de una ruta especulativa.

Abrir ficha

video en español · Comunitaria anecdótica

Fine Tuning de Modelos de Lenguaje: Guía con Unsloth y QLoRA

Nichonauta

Un recorrido práctico en español por un pipeline Unsloth y QLoRA.

Abrir ficha