Blog

Introducción a los puntos de referencia de agentes de IA

La adopción de agentes empresariales autónomos por parte de las empresas ha superado la capacidad de medirlos. Más del 40% de los proyectos de IA con agentes se cancelarán para finales de 2027 debido al aumento de los costos, el valor comercial poco claro y controles de riesgo inadecuados. El patrón detrás de esas cancelaciones es consistente: los agentes que obtienen buenos resultados en las pruebas se comportan de manera impredecible en la etapa de producción.

El problema central es la medición. Los puntos de referencia estándares se están saturando y se están tornando susceptibles de manipulación o irrelevantes para los flujos de trabajo seguros y personalizados que las empresas realmente ejecutan. Una puntuación sólida en una tabla de clasificación pública rara vez predice si un agente resistirá miles de ejecuciones repetidas con datos reales.

Automation Anywhere plantea dos líneas de abordaje de esta situación: ocupar el puesto n.º 1 en puntos de referencia públicos y estándares de la industria, además de desarrollar una arquitectura patentada de evaluación de IA empresarial y memoria operativa que los puntos de referencia públicos no pueden medir. Esta guía abarca ambas y comienza con el estado del campo.

El panorama actual de los puntos de referencia de agentes de IA

En 2026, la mayor parte de la evaluación de agentes se realiza a través de un conjunto pequeño de puntos de referencia públicos. Cada uno evalúa un factor real de la confiabilidad del agente, pero cada uno también tiene un punto ciego no menor que afecta la implementación empresarial.

Los principales puntos de referencia públicos que debe conocer

Un punto de referencia de modelo de lenguaje es un conjunto fijo de tareas acompañado de un evaluador automatizado. A continuación, se presentan los enfoques centrados en el agente que dominan las conversaciones sobre adquisición:

  • AgentBench: evalúa agentes en diversos entornos, desde sistemas operativos hasta bases de datos.
  • WebArena: prueba la navegación web de múltiples pasos en entornos de navegador realistas.
  • SWE-bench: mide la capacidad de ingeniería de software en incidentes reales de GitHub; su subconjunto Verified consta de 500 tareas revisadas por ingenieros.
  • MedAgentBench: evalúa agentes en tareas de flujos de trabajo clínicos y médicos.
  • τ-bench (tau-bench): prueba la interacción entre herramienta, agente y usuario, donde el agente debe seguir las políticas del dominio mientras trabaja con un usuario simulado.

Estos puntos de referencia son útiles para comparar la capacidad en bruto. Ninguno se diseñó para probar los esquemas, las herramientas o las reglas de cumplimiento de una organización individual.

Métricas comunes frente a la crisis de evaluación de 2026

Las métricas estándares describen resultados: tasa de éxito (la proporción de tareas resueltas por completo), tasa de resolución de intención (si el agente identificó correctamente lo que el usuario quería) y retención de contexto (si mantuvo la información relevante a lo largo de una interacción prolongada).

El problema es que las métricas de resultados son cada vez más fáciles de exagerar. En abril de 2026, un agente automatizado obtuvo una puntuación de 100%, o casi 100%, en siete de los ocho principales puntos de referencia sin resolver una sola tarea; de esta forma, aprovechó fallas en la infraestructura de evaluación en lugar de razonar a lo largo del trabajo. En SWE-bench Verified, la edición de aproximadamente diez líneas en un solo archivo de configuración de prueba hizo que las 500 pruebas se aprobaran.

Los análisis independientes también detectaron que el rendimiento del agente puede disminuir del 60% en una sola ejecución al 25% a lo largo de ocho ejecuciones consecutivas, y que el andamiaje por sí solo puede hacer oscilar la precisión en una media superior a la diferencia entre generaciones de modelos.

La conclusión para las empresas: una puntuación en una tabla de clasificación es una señal direccional, no una garantía de confiabilidad.

Un nuevo marco de evaluación: éxito de la tarea frente a la precisión de la trayectoria

Si los resultados pueden manipularse, la evaluación debe analizar de qué manera un agente los alcanza. Eso implica medir dos cuestiones al mismo tiempo: si el agente completó la tarea (éxito de la tarea, a veces denominado corrección funcional) y si siguió una trayectoria de razonamiento correcta y auditable para llegar allí (precisión de la trayectoria).

El peligro de la "victoria improvisada"

Una victoria improvisada ocurre cuando un agente llega a la respuesta correcta mediante el proceso incorrecto, ya sea adivinando parámetros de herramientas, realizando llamadas redundantes a la API o alucinando hasta obtener un resultado plausible.

Si nos basamos en una métrica que solo considera el éxito, parece una victoria. En la fase de producción, constituye una responsabilidad: las auditorías fallan porque el razonamiento no es justificable, los costos de la API aumentan con cada llamada redundante y la latencia se incrementa.

Además, este no es un caso excepcional. En la investigación de la evaluación de Automation Anywhere, el patrón de victoria improvisada apareció en más del 40% de las ejecuciones en tipos de agente complejos y de varios pasos.

Por qué la puntuación pass-k es importante para los directores de Tecnología

La puntuación pass^k, que también se escribe pass-k, mide la consistencia. Pass^1 registra si un agente completa una tarea una vez. Pass^4 exige que complete correctamente la misma tarea en cuatro ejecuciones independientes desde un estado inicial nuevo. La diferencia entre ambas es donde reside el riesgo para la fase de producción: aprobar una vez puede ser una cuestión de suerte; aprobar cuatro veces seguidas es una señal de confiabilidad.

Para los agentes empresariales autónomos que ejecutan el mismo flujo de trabajo cientos de veces al día, pass^4 es el número que importa.

Tabla de clasificación de τ-bench: validación del rendimiento base del agente

Los puntos de referencia públicos tienen limitaciones, pero obtener un buen desempeño en uno riguroso sigue siendo significativo. τ-bench se encuentra entre los estándares públicos más exigentes disponibles para agentes que usan herramientas.

N.º 1 en todos los niveles de aprobación

Los agentes base de Automation Anywhere (aa-agent-v1, que se ejecuta con un andamiaje de contexto ligero en lugar de la capa completa de memoria empresarial) ocupan el puesto n.º 1 en general en las 375 tareas y los cuatro dominios de servicio al momento de la presentación (mayo de 2026).

Alcanzan una puntuación de 74,5% en pass^1, una ventaja de más de 4,3 puntos sobre el siguiente mejor sistema publicado, por delante de Qwen3.5, GPT-5.2, Claude Opus 4.5 y Gemini 3 Pro. El liderazgo es estructural, no un artefacto de una sola ejecución: se mantiene en pass^2 (+4,8), pass^3 (+4,3) y pass^4 (+4,1).

Nivel de aprobación

Agente base de AA

Clasificación n.º 1

Líder

pass^1

74,50%

70,20%

+4,3 puntos

pass^2

67,90%

63,10%

+4,8 puntos

pass^3

63,60%

59,30%

+4,3 puntos

pass^4

60,30%

56,20%

+4,1 puntos

Resultados a nivel de aprobación de τ-bench, agrupados en 375 tareas y cuatro dominios de servicio (Fuente: Informe de punto de referencia de agentes de IA de Automation Anywhere 2026).
 

Velocidad de ejecución y desglose por dominio

En el área de TI empresarial, un agente lento es un agente poco útil. En los cuatro dominios, los agentes base de Automation Anywhere combinan una precisión competitiva con una ejecución más rápida en tres de los cuatro dominios: hasta 3,2 veces más rápido en el sector minorista (223 s frente a 703 s), 2,7 veces más rápido en el sector bancario y 2,6 veces más rápido en el sector de las telecomunicaciones. El sector de aerolíneas es la excepción, ya que funciona 1,6 veces más lento, aunque sigue ocupando el primer lugar en precisión. En el sector bancario, las puntuaciones absolutas son bajas entre todos los competidores porque la latencia de recuperación es la restricción limitante, no la calidad del razonamiento. Este obstáculo es lo que una capa de memoria operativa está diseñada para abordar. 

Dominio

Puntuación de AA

Frente al líder

Velocidad de ejecución

Clasificación

Aerolíneas

84,50%

+0,5 puntos

1,6 veces más lento

N.º1

Venta al por menor

82,90%

−1,5 puntos

3,2 veces más rápido

N.º2

Telecomunicaciones

98,20%

+0,4 puntos

2,6 veces más rápido

N.º1

Banca

31,70%

+0,5 puntos

2,7 veces más rápido

N.º1

Resultados de τ-bench por dominio: precisión y velocidad de ejecución frente al líder de la tabla de clasificación (Fuente: Informe de punto de referencia de agentes de IA de Automation Anywhere 2026).

Por qué los puntos de referencia públicos no cuentan toda la historia empresarial

Presentamos GBA-Bench (punto de referencia de agentes basado en objetivos)

La simulación de un entorno empresarial real requiere de datos privados, como los procedimientos operativos estándares de una organización, las definiciones de flujo de trabajo y la validación de políticas del dominio. Por definición, los puntos de referencia públicos no pueden proporcionar esto.

GBA-Bench, el paquete de evaluación propio de Automation Anywhere, se diseñó a partir de este material empresarial, lo que permite que el paquete muestre cuán diferente se comportan los agentes una vez que dejan las tareas públicas para pasar a las empresariales.

GBA-Bench cubre siete dominios empresariales con más de 30 modelos de vanguardia evaluados que abarcan Banca, Seguros, Atención Médica, Cadena de Suministro, Ventas, Finanzas e Incorporación de Proveedores. Los modelos evaluados provienen de todas las familias principales: Anthropic, OpenAI, Google, Meta, Qwen, DeepSeek, Mistral y Zhipu/GLM (Fuente: Informe de punto de referencia de agentes de IA de Automation Anywhere 2026).

La verificación de la realidad empresarial de GBA-Bench

Ante procedimientos operativos estándares (SOP) reales, la brecha entre los modelos se vuelve más evidente. Los modelos rivales que difunden puntuaciones públicas sólidas aún pueden mostrar altas tasas de victoria improvisada en flujos de trabajo empresariales, además de publicar resultados correctos que se alcanzan mediante un razonamiento frágil.

Cuando están equipados con inteligencia contextual, los agentes de Automation Anywhere registran aumentos de 20 a 47 puntos porcentuales en la precisión de la trayectoria y hasta un 32% de mejora en el logro de objetivos en estas tareas. La puntuación utiliza un evaluador basado en un LLM que actúa como juez, calibrado para alcanzar un 0,99 de concordancia en las trayectorias con respecto a las etiquetas humanas de τ-bench.

La limitación de los agentes sin estado

Incluso en el caso de agentes base sólidos, comenzar cada tarea sin memoria de ejecuciones anteriores significa que repetirán las mismas llamadas inválidas a herramientas y los mismos errores de parámetros, ejecución tras ejecución. Esta ausencia de estado es una limitación arquitectónica, no un problema de calidad del modelo, y limita cuán confiable puede ser un agente listo para usar en tareas empresariales repetitivas.

Corrección de la arquitectura: PRE e inteligencia contextual

Abordar la deficiencia de confiabilidad implica dotar a los agentes de memoria operativa estructurada.

Adición de memoria operativa estructurada

El motor de razonamiento de procesos (PRE) proporciona la infraestructura adecuada para esa memoria. Después de cada ejecución, las ejecuciones exitosas se conservan como patrones reutilizables y las ejecuciones imperfectas se sintetizan en unas pocas lecciones de alto impacto. En ejecuciones posteriores, la experiencia previa más relevante se recupera e inyecta antes de que comience la ejecución, de modo que el agente deje de repetir el mismo error. Esta es la diferencia entre un agente que vuelve a obtener su razonamiento de IA desde cero cada vez y uno que mejora con el uso.

Los resultados: aumento del 32% en el logro de objetivos

En las pruebas realizadas con GBA-Bench, los agentes con más memoria mejoraron la precisión de la trayectoria entre 20 y 47 puntos porcentuales, y el logro de objetivos aumentó hasta en 32 puntos porcentuales. El caso más evidente es el agente de prevención de pérdida de clientes, cuya precisión de trayectoria aumentó de 0,12 a 0,59 (una mejora de aproximadamente 4,9 veces), lo que convirtió un flujo de trabajo que seguía la ruta correcta solo el 12% de las veces en uno confiable. Los agentes habilitados por contexto también reducen las llamadas a herramientas en aproximadamente un 20% en flujos de trabajo complejos, lo que disminuye tanto el costo como la latencia.

Cómo analizar sus propios sistemas con agentes

Paso 1: Haga de la evaluación un requisito previo, no un complemento

La memoria operativa solo es tan buena como la señal que la alimenta. Cada memoria almacenada necesita una puntuación de calidad precisa de un evaluador basado en un LLM que actúa como juez; sin ella, los agentes aprenden de sus propios errores y refuerzan patrones deficientes. Establezca el proceso de evaluación antes de implementar la memoria, no después.

Paso 2: Enfóquese en tareas de alta variabilidad y de varios pasos

La memoria y la evaluación avanzada ofrecen el mayor valor donde hay margen de mejora: flujos de trabajo con una precisión de trayectoria base inferior a 0,70, alta variabilidad de parámetros de herramientas o tareas largas de varios pasos en las que los errores iniciales provocan un efecto en cadena. Las tareas de una sola herramienta, cercanas al máximo, aportan pocos beneficios.

Paso 3: Implemente el monitoreo continuo de la trayectoria

En la fase de producción, rara vez se cuenta con una etiqueta de referencia, pero se puede monitorear la presencia de señales de victoria improvisada: llamadas excesivas a herramientas, lógica circular y bucles de reintentos. Hacer un seguimiento de la eficiencia de las llamadas a herramientas mantiene bajo control el costo y la latencia de la API, además de detectar cualquier deterioro antes de que afecte a los usuarios.

Conclusión: La hoja de ruta hacia una IA empresarial confiable

La IA con agentes empresarial confiable sigue una metodología clara: agentes base sólidos validados en un riguroso punto de referencia público (n.º 1 en τ-bench), evaluación privada que refleja flujos de trabajo empresariales reales (GBA-Bench) y memoria operativa filtrada por calidad que mejora la ejecución con el tiempo (PRE + inteligencia contextual).

Juntos abordan la deficiencia empresarial entre un resultado de punto de referencia público y un sistema de grado de producción para la automatización de procesos con agentes.

Para conocer la metodología completa, los datos experimentales y los resultados de la clasificación en más de 30 modelos de vanguardia, lea nuestro Informe de puntos de referencia de agentes de IA 2026. Para conocer cómo nuestros agentes de automatización aplican estos principios en la etapa de producción, programe una demostración en vivo.

Preguntas frecuentes sobre puntos de referencia de agentes de IA

¿Cuáles son los puntos de referencia de agente de IA más confiables en este momento?

τ-bench se encuentra entre los más rigurosos para agentes que utilizan herramientas, debido a su métrica de confiabilidad pass^k. AgentBench (entornos diversos), WebArena (navegación web) y SWE-bench (ingeniería de software) completan el conjunto básico. Cada uno mide una capacidad diferente, por lo que no existe una única puntuación de confiabilidad.

¿Cómo debería evaluar las capacidades de un agente de IA empresarial?

Vaya más allá de la finalización de tareas. Evalúe la corrección funcional (alcanzar objetivos), el uso de herramientas y la navegación (bases de datos, navegadores, API), la seguridad y la confiabilidad (medidas de seguridad para evitar acciones dañinas), así como la aplicabilidad en el mundo real en flujos de trabajo complejos, en lugar de limitarse solo a tareas de programación. La precisión de la trayectoria es lo que vincula estos elementos.

¿Cuáles son las métricas estándares que se utilizan para medir el rendimiento del agente de IA?

Las métricas principales incluyen la tasa de éxito (proporción de tareas resueltas por completo), la tasa de resolución de intención (identificación correcta de los objetivos del usuario), la tasa de finalización de tareas de varios pasos y la retención de contexto a lo largo de interacciones prolongadas. En 2026, estas métricas de resultados requieren cada vez más una medida de trayectoria que las acompañe.

¿Por qué los agentes de Automation Anywhere encabezan la tabla de clasificación de τ-bench?

La clasificación n.º 1 en su presentación de mayo de 2026 se debe a la arquitectura del agente base (aa-agent-v1) con andamiaje de contexto ligero, que se destaca en tareas de múltiples turnos y en el uso consistente de herramientas. Es una arquitectura sólida, y no solo un modelo sólido, lo que impulsa el resultado.

¿En qué métricas específicas de evaluación se destaca Automation Anywhere?

Al momento de la presentación en mayo de 2026, los agentes base alcanzan 74,5% en pass^1 con una ventaja de +4.3 puntos, y mantienen esa ventaja hasta el exigente nivel pass^4 (Fuente: Informe de punto de referencia de agentes de IA de Automation Anywhere 2026). Además, se ejecutan más rápido que la comparación de la tabla de clasificación en tres de los cuatro dominios, hasta 3,2 veces más rápido en el sector minorista.

¿Qué es la precisión de la trayectoria en la evaluación de agentes de IA?

La precisión de la trayectoria mide si un agente siguió una línea de razonamiento correcta y auditable, y no solo si llegó a la respuesta correcta. Detecta el problema de la "victoria improvisada": un resultado correcto que se obtiene mediante pasos frágiles, ineficientes o riesgosos que fallan a gran escala.

¿De qué manera la memoria contextual mejora la confiabilidad del agente de IA?

La memoria operativa estructurada permite que los agentes sinteticen lecciones de ejecuciones anteriores y las apliquen a las nuevas, lo que elimina la repetición de errores de parámetros y llamadas inválidas a herramientas. En los flujos de trabajo empresariales complejos, esto mejora de manera significativa el logro de los objetivos y la precisión de la trayectoria, además de reducir las llamadas innecesarias a herramientas.

Etiquetas

IA

Manténgase al día:

Subscribe Suscribirse al blog
user image

Emily Gal

Emily Gal es directora de Marketing de Producto para la plataforma de APA en Automation Anywhere y lleva más de 17 años impulsando el crecimiento de SaaS B2B y de la IA.

Artículos relacionados

Publicaciones recientes del autor

Probar Automation Anywhere
Close

Para empresas

Inscríbase para obtener acceso rápido a una demostración del producto personalizada

Para estudiantes y desarrolladores

Empiece a automatizar al instante con acceso GRATIS a todos los roles con Cloud Community Edition.