← Biblioteca 02

Holistic Evaluation of Language Models (HELM)

evaluacióngatescalidad

Ficha

Tipo
paper y marco de evaluación
Autor / canal
Percy Liang, Rishi Bommasani et al. / Stanford CRFM
Idioma
inglés
Fecha
2023-10-01
Estado de evidencia
Compatible sin probar
Procedencia
Fuente académica primaria

Abrir fuente original

Resumen original

HELM propone evaluar modelos en escenarios normalizados y múltiples dimensiones, entre ellas exactitud, calibración, robustez, fairness, bias, toxicidad y eficiencia. Su aportación central para este Atlas es de gobernanza: hace visibles las áreas no evaluadas y evita resumir calidad en una sola cifra. Aunque el marco original no contiene un perfil específico de Ornith ni todos los flujos agentic modernos, ofrece principios para construir gates por dominio y documentar cobertura. Una cuantización, adaptación o poda puede mejorar memoria mientras empeora herramientas, español, visión o seguridad; promediar esos resultados ocultaría una regresión crítica. HELM no demuestra que una batería concreta sea suficiente, no valida métricas históricas locales y no sustituye pruebas ejecutables cuando la salida tiene un criterio objetivo. Para Ornith, se usa como guía para separar texto, código, JSON, tool calling, contexto largo, estabilidad, visión y seguridad, además de registrar eficiencia. Conviene leerlo al diseñar el harness o antes de declarar que una técnica conserva calidad. La decisión de aprobación debe fijar umbrales antes de correr y comparar el candidato contra el baseline exacto, con procedencia y resultados por ítem.

Qué enseña

Cómo evitar una evaluación unidimensional y declarar explícitamente escenarios y métricas ausentes.

Qué no demuestra

No aporta por sí solo una batería completa ni resultados de Ornith.

Relación con Ornith

Fundamenta gates separados por dominio y el reporte de no-regresión frente al baseline.

Resumen en audio

Leer transcripción del resumen