Microsoft y Hugging Face han presentado ThinkingBox, un entorno y conjunto de pruebas para evaluar agentes de IA que modifican registros mediante herramientas. En lugar de puntuar solo la respuesta escrita o las llamadas a funciones, comprueba el estado final de los datos y los efectos secundarios de cada tarea. Los autores han publicado el entorno y el conjunto de datos para que otros equipos puedan ejecutar las pruebas. El trabajo describe 507 procesos simulados de comercio, seguros, viajes, banca y consultoría. Cada tarea se ejecutó 20 veces desde un estado inicial limpio. Según los autores, una parte importante de los intentos fallidos terminó sin un error visible de la herramienta, aunque las comprobaciones encontraron valores incorrectos, cambios sobrantes o acciones pendientes. Las cifras describen esta prueba concreta; no equivalen a una tasa de fallo general de todos los agentes. La lección práctica es comprobar el resultado en el sistema antes de dar por completada una tarea automatizada. ThinkingBox permite estudiar la consistencia entre intentos, pero su utilidad fuera del laboratorio dependerá de que los procesos simulados se parezcan a los reales. Fuente principal: artículo conjunto de Microsoft y Hugging Face en el blog de Hugging Face.