El UK AI Security Institute (AISI) está usando la infraestructura de EvalEval para divulgar resultados de evaluación con más contexto y opciones de reproducción. El anuncio en Hugging Face cubre cinco pruebas —HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro y Terminal-Bench 2.0— y datos de seis modelos de frontera. Las fichas reúnen resultados verificados, configuración y otra información metodológica para que lectores e investigadores puedan entender cómo se obtuvo cada cifra. Es un paso hacia la transparencia: los resultados publicados suelen mezclar formatos y detalles insuficientes para repetir una prueba. El propio artículo advierte que el protocolo y el cómputo de inferencia pueden cambiar los resultados. Por eso, las cifras deben compararse con atención a la configuración; el proyecto mejora la trazabilidad, pero no establece una puntuación única y definitiva para todos los modelos. Imagen ilustrativa: investigadora junto a equipo de evaluación electrónica en Oak Ridge National Laboratory; no es una fotografía del AISI ni de EvalEval.
AISI y EvalEval publican fichas para repetir evaluaciones de modelos
Imagen ilustrativa: Oak Ridge National Laboratory · CC BY 2.0
Fuente principal:
Hugging Face Blog →
Hugging Face Blog →
