NIST lanza programa de evaluación de modelos de IA con datos de prueba ciegos

NIST lanza programa de evaluación de modelos de IA con datos de prueba ciegos
El Instituto Nacional de Estándares y Tecnología de EE.UU. (NIST) ha inaugurado oficialmente la plataforma AITE (AI Technology Evaluation), un sistema de evaluación independiente para benchmarkear modelos de inteligencia artificial con conjuntos de datos de prueba que no han sido divulgados públicamente.

La plataforma utiliza datos ciegos — información que los desarrolladores de modelos no han visto durante el entrenamiento — para medir capacidades reales de razonamiento, resolución de problemas y generación de código. Este enfoque busca eliminar el "teaching to the test", una práctica donde los modelos se optimizan específicamente para pasar evaluaciones conocidas.

El programa incluye pruebas de múltiples dominios: matemáticas avanzadas, programación, razonamiento lógico, comprensión de lenguaje natural y generación de código seguro. Los resultados se publicarán trimestralmente y proporcionarán una comparación objetiva entre los principales modelos del mercado, incluyendo GPT, Claude, Gemini y modelos open-source.

La iniciativa responde a la creciente preocupación por la falta de estándares independientes en la industria de IA. "Actualmente, cada empresa publica sus propias métricas, que naturalmente muestran sus modelos como los mejores", señaló un director del NIST. "AITE proporcionará una medida objetiva y transparente para el público y los reguladores".

Fuente: [PYMNTS.com](https://www.pymnts.com/artificial-intelligence-2/2026/nist-launches-ai-model-evaluation-program/). Imagen: Unsplash.
Ver publicación