Evaluación de agentes de IA: cómo saber si de verdad funciona
Para probar un agente de IA, dale tareas reales cuyo resultado puedas comprobar y cuenta cuántas veces lo consigue. Ese número es la tasa de éxito por tarea. Observa también qué tan consistente, rápido y costoso es el agente. Pruebas públicas como SWE-bench, GAIA, τ-bench y OSWorld comparan modelos; tu propio conjunto de 20–50 casos reales prueba tu agente.
Una demo muestra que un agente puede tener éxito una vez. La evaluación hace la pregunta que de verdad importa: ¿cada cuánto lo consigue, cuánto cuesta y cómo falla?
El número clave es la tasa de éxito por tarea. Elige un conjunto de tareas reales cuyo resultado puedas comprobar. Ejecuta el agente. Cuenta los aciertos. Los benchmarks públicos — pruebas compartidas que cualquiera puede ejecutar — funcionan igual. SWE-bench Verified prueba agentes de programación con reportes reales de errores de GitHub, verificados por las pruebas de cada proyecto [1]. GAIA prueba asistentes generales con preguntas que requieren herramientas y varios pasos para responderse [2]. τ-bench prueba agentes de atención al cliente que hablan con un cliente simulado, con reglas que no deben romper [3]. Y OSWorld prueba agentes que controlan una computadora, en tareas reales de escritorio [4].
Los benchmarks te ayudan a elegir un modelo. Dicen poco sobre tu tarea. Para eso, crea tu propio conjunto de pruebas. Incluso 20–50 casos reales con reglas claras de aprobado superan a la intuición. Puntúa el conjunto de la misma manera cada vez que cambies un prompt, una herramienta o un modelo [5]. Algunos resultados no se pueden comprobar automáticamente. La solución habitual es que un segundo modelo de IA califique la respuesta contra una lista de criterios — la gente lo llama "LLM como juez" (LLM-as-judge). Compara sus calificaciones con calificaciones humanas en una muestra antes de confiar en él.
Un éxito es una demo. Una tasa de éxito es una evaluación.
Qué esconde una tasa de éxito
Dos agentes con la misma puntuación media pueden comportarse de forma muy distinta. τ-bench tiene una medida llamada pass^k que lo muestra. Pregunta: si ejecutas la misma tarea k veces, ¿el agente tiene éxito todas las veces? Incluso los agentes fuertes caen con fuerza a medida que k crece [3]. Registra también el costo y la velocidad por tarea: un agente paga por cada paso que da, no solo por la respuesta final. Y lee las ejecuciones fallidas. Dónde se equivocó el agente importa más que cada cuánto. Elegir la herramienta equivocada, ignorar la salida de una herramienta y no saber nunca cuándo parar son problemas distintos con soluciones distintas. Solo puedes distinguirlos leyendo la ejecución.

Fuentes
- Jimenez et al. — SWE-bench: Can Language Models Resolve Real-World GitHub Issues?, arXiv 2310.06770, Oct 2023
- Mialon et al. — GAIA: A Benchmark for General AI Assistants, arXiv 2311.12983, Nov 2023
- Yao et al. (Sierra) — τ-bench: A Benchmark for Tool-Agent-User Interaction, arXiv 2406.12045, Jun 2024
- Xie et al. — OSWorld: Benchmarking Multimodal Agents in Real Computer Environments, arXiv 2404.07972, Apr 2024
- Claude docs — Define success criteria and build evaluations (platform.claude.com)
Preguntas frecuentes
¿Cómo se mide si un agente de IA funciona?
Dale al agente un conjunto de tareas reales cuyo resultado puedas comprobar. Cuenta cuántas veces lo consigue: esa es la tasa de éxito por tarea. Luego repite las ejecuciones para ver si se mantiene consistente, registra el costo y la velocidad por tarea, y lee las ejecuciones fallidas para ver dónde se equivocó el agente.
¿Qué benchmarks existen para agentes de IA?
SWE-bench Verified prueba agentes de programación con reportes reales de errores de GitHub. GAIA prueba asistentes generales con preguntas de varios pasos que requieren herramientas. τ-bench prueba agentes de atención al cliente que hablan con clientes simulados bajo reglas fijas. OSWorld prueba agentes que controlan una computadora en tareas reales de escritorio. Los benchmarks te ayudan a elegir un modelo; tu propio conjunto de pruebas comprueba tu agente.
¿Qué es pass^k?
Una medida de fiabilidad de τ-bench. Mide la probabilidad de que un agente tenga éxito en cada una de k ejecuciones repetidas de la misma tarea, no solo una vez. Incluso los agentes fuertes caen con fuerza a medida que k crece. Por eso una sola tasa media de éxito puede esconder una inconsistencia real.