Ficha
- Tipo
- paper y marco de evaluación
- Autor / canal
- Percy Liang, Rishi Bommasani et al. / Stanford CRFM
- Idioma
- inglés
- Fecha
- 2023-10-01
- Estado de evidencia
- Compatible sin probar
- Procedencia
- Fuente académica primaria
Resumen original
HELM propone evaluar modelos en escenarios normalizados y múltiples dimensiones, entre ellas exactitud, calibración, robustez, fairness, bias, toxicidad y eficiencia. Su aportación central para este Atlas es de gobernanza: hace visibles las áreas no evaluadas y evita resumir calidad en una sola cifra. Aunque el marco original no contiene un perfil específico de Ornith ni todos los flujos agentic modernos, ofrece principios para construir gates por dominio y documentar cobertura. Una cuantización, adaptación o poda puede mejorar memoria mientras empeora herramientas, español, visión o seguridad; promediar esos resultados ocultaría una regresión crítica. HELM no demuestra que una batería concreta sea suficiente, no valida métricas históricas locales y no sustituye pruebas ejecutables cuando la salida tiene un criterio objetivo. Para Ornith, se usa como guía para separar texto, código, JSON, tool calling, contexto largo, estabilidad, visión y seguridad, además de registrar eficiencia. Conviene leerlo al diseñar el harness o antes de declarar que una técnica conserva calidad. La decisión de aprobación debe fijar umbrales antes de correr y comparar el candidato contra el baseline exacto, con procedencia y resultados por ítem.
Qué enseña
Cómo evitar una evaluación unidimensional y declarar explícitamente escenarios y métricas ausentes.
Qué no demuestra
No aporta por sí solo una batería completa ni resultados de Ornith.
Relación con Ornith
Fundamenta gates separados por dominio y el reporte de no-regresión frente al baseline.