IA sin exageraciones Desde la fase piloto hasta la implementación total, nuestros expertos trabajan con usted para garantizar resultados reales y repetibles. Comenzar
Soluciones con agentes destacadas
Cuentas por pagar Automatización de facturas: sin configuración. Sin código. Solo resultados. Más información
Incorporación de clientes Escalar flujos de trabajo KYC/AML. Más información
Atención al cliente Mantenga las listas de prioridad en movimiento, incluso en momentos de máxima carga. Más información
RCM de atención sanitaria La gestión del ciclo de ingresos que se ejecuta sola. Más información
Funciones de la plataforma
Obtener Community Edition: Empiece a automatizar al instante con acceso GRATIS a todos los roles con Cloud Community Edition.
Destacado
Distinción de líder en RPA en el Magic Quadrant™ de Gartner® de 2026.Reconocido como líder por octavo año consecutivo Descargar informe Descargar informe
Encuentre un socio de Automation Anywhere Explore nuestra red global de socios de confianza para que lo acompañen en su proceso de automatización Encontrar un socio Encontrar un socio
Event
Get ready for Imagine 2026
From agentic AI to end‑to‑end automation, be a part of the flagship event where our community gathers to build, learn, and lead. Register today
Countdown
Blog
Los puntos de referencia de agentes de IA miden si los sistemas autónomos pueden planificar, llamar a herramientas y completar tareas de varios pasos de manera confiable. En 2026, los puntos de referencia públicos se están saturando y son susceptibles de manipulación. Esta guía explica qué omiten, por qué la precisión de la trayectoria es importante y cómo las empresas deben evaluar agentes para la producción.
La adopción de agentes empresariales autónomos por parte de las empresas ha superado la capacidad de medirlos. Más del 40% de los proyectos de IA con agentes se cancelarán para finales de 2027 debido al aumento de los costos, el valor comercial poco claro y controles de riesgo inadecuados. El patrón detrás de esas cancelaciones es consistente: los agentes que obtienen buenos resultados en las pruebas se comportan de manera impredecible en la etapa de producción.
El problema central es la medición. Los puntos de referencia estándares se están saturando y se están tornando susceptibles de manipulación o irrelevantes para los flujos de trabajo seguros y personalizados que las empresas realmente ejecutan. Una puntuación sólida en una tabla de clasificación pública rara vez predice si un agente resistirá miles de ejecuciones repetidas con datos reales.
Automation Anywhere plantea dos líneas de abordaje de esta situación: ocupar el puesto n.º 1 en puntos de referencia públicos y estándares de la industria, además de desarrollar una arquitectura patentada de evaluación de IA empresarial y memoria operativa que los puntos de referencia públicos no pueden medir. Esta guía abarca ambas y comienza con el estado del campo.
En 2026, la mayor parte de la evaluación de agentes se realiza a través de un conjunto pequeño de puntos de referencia públicos. Cada uno evalúa un factor real de la confiabilidad del agente, pero cada uno también tiene un punto ciego no menor que afecta la implementación empresarial.
Los principales puntos de referencia públicos que debe conocer
Un punto de referencia de modelo de lenguaje es un conjunto fijo de tareas acompañado de un evaluador automatizado. A continuación, se presentan los enfoques centrados en el agente que dominan las conversaciones sobre adquisición:
Estos puntos de referencia son útiles para comparar la capacidad en bruto. Ninguno se diseñó para probar los esquemas, las herramientas o las reglas de cumplimiento de una organización individual.
Las métricas estándares describen resultados: tasa de éxito (la proporción de tareas resueltas por completo), tasa de resolución de intención (si el agente identificó correctamente lo que el usuario quería) y retención de contexto (si mantuvo la información relevante a lo largo de una interacción prolongada).
El problema es que las métricas de resultados son cada vez más fáciles de exagerar. En abril de 2026, un agente automatizado obtuvo una puntuación de 100%, o casi 100%, en siete de los ocho principales puntos de referencia sin resolver una sola tarea; de esta forma, aprovechó fallas en la infraestructura de evaluación en lugar de razonar a lo largo del trabajo. En SWE-bench Verified, la edición de aproximadamente diez líneas en un solo archivo de configuración de prueba hizo que las 500 pruebas se aprobaran.
Los análisis independientes también detectaron que el rendimiento del agente puede disminuir del 60% en una sola ejecución al 25% a lo largo de ocho ejecuciones consecutivas, y que el andamiaje por sí solo puede hacer oscilar la precisión en una media superior a la diferencia entre generaciones de modelos.
La conclusión para las empresas: una puntuación en una tabla de clasificación es una señal direccional, no una garantía de confiabilidad.
Si los resultados pueden manipularse, la evaluación debe analizar de qué manera un agente los alcanza. Eso implica medir dos cuestiones al mismo tiempo: si el agente completó la tarea (éxito de la tarea, a veces denominado corrección funcional) y si siguió una trayectoria de razonamiento correcta y auditable para llegar allí (precisión de la trayectoria).
Una victoria improvisada ocurre cuando un agente llega a la respuesta correcta mediante el proceso incorrecto, ya sea adivinando parámetros de herramientas, realizando llamadas redundantes a la API o alucinando hasta obtener un resultado plausible.
Si nos basamos en una métrica que solo considera el éxito, parece una victoria. En la fase de producción, constituye una responsabilidad: las auditorías fallan porque el razonamiento no es justificable, los costos de la API aumentan con cada llamada redundante y la latencia se incrementa.
Además, este no es un caso excepcional. En la investigación de la evaluación de Automation Anywhere, el patrón de victoria improvisada apareció en más del 40% de las ejecuciones en tipos de agente complejos y de varios pasos.
La puntuación pass^k, que también se escribe pass-k, mide la consistencia. Pass^1 registra si un agente completa una tarea una vez. Pass^4 exige que complete correctamente la misma tarea en cuatro ejecuciones independientes desde un estado inicial nuevo. La diferencia entre ambas es donde reside el riesgo para la fase de producción: aprobar una vez puede ser una cuestión de suerte; aprobar cuatro veces seguidas es una señal de confiabilidad.
Para los agentes empresariales autónomos que ejecutan el mismo flujo de trabajo cientos de veces al día, pass^4 es el número que importa.
Los puntos de referencia públicos tienen limitaciones, pero obtener un buen desempeño en uno riguroso sigue siendo significativo. τ-bench se encuentra entre los estándares públicos más exigentes disponibles para agentes que usan herramientas.
Los agentes base de Automation Anywhere (aa-agent-v1, que se ejecuta con un andamiaje de contexto ligero en lugar de la capa completa de memoria empresarial) ocupan el puesto n.º 1 en general en las 375 tareas y los cuatro dominios de servicio al momento de la presentación (mayo de 2026).
Alcanzan una puntuación de 74,5% en pass^1, una ventaja de más de 4,3 puntos sobre el siguiente mejor sistema publicado, por delante de Qwen3.5, GPT-5.2, Claude Opus 4.5 y Gemini 3 Pro. El liderazgo es estructural, no un artefacto de una sola ejecución: se mantiene en pass^2 (+4,8), pass^3 (+4,3) y pass^4 (+4,1).
Nivel de aprobación | Agente base de AA | Clasificación n.º 1 | Líder |
|---|---|---|---|
pass^1 | 74,50% | 70,20% | +4,3 puntos |
pass^2 | 67,90% | 63,10% | +4,8 puntos |
pass^3 | 63,60% | 59,30% | +4,3 puntos |
pass^4 | 60,30% | 56,20% | +4,1 puntos |
Resultados a nivel de aprobación de τ-bench, agrupados en 375 tareas y cuatro dominios de servicio (Fuente: Informe de punto de referencia de agentes de IA de Automation Anywhere 2026).
En el área de TI empresarial, un agente lento es un agente poco útil. En los cuatro dominios, los agentes base de Automation Anywhere combinan una precisión competitiva con una ejecución más rápida en tres de los cuatro dominios: hasta 3,2 veces más rápido en el sector minorista (223 s frente a 703 s), 2,7 veces más rápido en el sector bancario y 2,6 veces más rápido en el sector de las telecomunicaciones. El sector de aerolíneas es la excepción, ya que funciona 1,6 veces más lento, aunque sigue ocupando el primer lugar en precisión. En el sector bancario, las puntuaciones absolutas son bajas entre todos los competidores porque la latencia de recuperación es la restricción limitante, no la calidad del razonamiento. Este obstáculo es lo que una capa de memoria operativa está diseñada para abordar.
Dominio | Puntuación de AA | Frente al líder | Velocidad de ejecución | Clasificación |
|---|---|---|---|---|
Aerolíneas | 84,50% | +0,5 puntos | 1,6 veces más lento | N.º1 |
Venta al por menor | 82,90% | −1,5 puntos | 3,2 veces más rápido | N.º2 |
Telecomunicaciones | 98,20% | +0,4 puntos | 2,6 veces más rápido | N.º1 |
Banca | 31,70% | +0,5 puntos | 2,7 veces más rápido | N.º1 |
Resultados de τ-bench por dominio: precisión y velocidad de ejecución frente al líder de la tabla de clasificación (Fuente: Informe de punto de referencia de agentes de IA de Automation Anywhere 2026).
La simulación de un entorno empresarial real requiere de datos privados, como los procedimientos operativos estándares de una organización, las definiciones de flujo de trabajo y la validación de políticas del dominio. Por definición, los puntos de referencia públicos no pueden proporcionar esto.
GBA-Bench, el paquete de evaluación propio de Automation Anywhere, se diseñó a partir de este material empresarial, lo que permite que el paquete muestre cuán diferente se comportan los agentes una vez que dejan las tareas públicas para pasar a las empresariales.
GBA-Bench cubre siete dominios empresariales con más de 30 modelos de vanguardia evaluados que abarcan Banca, Seguros, Atención Médica, Cadena de Suministro, Ventas, Finanzas e Incorporación de Proveedores. Los modelos evaluados provienen de todas las familias principales: Anthropic, OpenAI, Google, Meta, Qwen, DeepSeek, Mistral y Zhipu/GLM (Fuente: Informe de punto de referencia de agentes de IA de Automation Anywhere 2026).
Ante procedimientos operativos estándares (SOP) reales, la brecha entre los modelos se vuelve más evidente. Los modelos rivales que difunden puntuaciones públicas sólidas aún pueden mostrar altas tasas de victoria improvisada en flujos de trabajo empresariales, además de publicar resultados correctos que se alcanzan mediante un razonamiento frágil.
Cuando están equipados con inteligencia contextual, los agentes de Automation Anywhere registran aumentos de 20 a 47 puntos porcentuales en la precisión de la trayectoria y hasta un 32% de mejora en el logro de objetivos en estas tareas. La puntuación utiliza un evaluador basado en un LLM que actúa como juez, calibrado para alcanzar un 0,99 de concordancia en las trayectorias con respecto a las etiquetas humanas de τ-bench.
Incluso en el caso de agentes base sólidos, comenzar cada tarea sin memoria de ejecuciones anteriores significa que repetirán las mismas llamadas inválidas a herramientas y los mismos errores de parámetros, ejecución tras ejecución. Esta ausencia de estado es una limitación arquitectónica, no un problema de calidad del modelo, y limita cuán confiable puede ser un agente listo para usar en tareas empresariales repetitivas.
Abordar la deficiencia de confiabilidad implica dotar a los agentes de memoria operativa estructurada.
El motor de razonamiento de procesos (PRE) proporciona la infraestructura adecuada para esa memoria. Después de cada ejecución, las ejecuciones exitosas se conservan como patrones reutilizables y las ejecuciones imperfectas se sintetizan en unas pocas lecciones de alto impacto. En ejecuciones posteriores, la experiencia previa más relevante se recupera e inyecta antes de que comience la ejecución, de modo que el agente deje de repetir el mismo error. Esta es la diferencia entre un agente que vuelve a obtener su razonamiento de IA desde cero cada vez y uno que mejora con el uso.
En las pruebas realizadas con GBA-Bench, los agentes con más memoria mejoraron la precisión de la trayectoria entre 20 y 47 puntos porcentuales, y el logro de objetivos aumentó hasta en 32 puntos porcentuales. El caso más evidente es el agente de prevención de pérdida de clientes, cuya precisión de trayectoria aumentó de 0,12 a 0,59 (una mejora de aproximadamente 4,9 veces), lo que convirtió un flujo de trabajo que seguía la ruta correcta solo el 12% de las veces en uno confiable. Los agentes habilitados por contexto también reducen las llamadas a herramientas en aproximadamente un 20% en flujos de trabajo complejos, lo que disminuye tanto el costo como la latencia.
La memoria operativa solo es tan buena como la señal que la alimenta. Cada memoria almacenada necesita una puntuación de calidad precisa de un evaluador basado en un LLM que actúa como juez; sin ella, los agentes aprenden de sus propios errores y refuerzan patrones deficientes. Establezca el proceso de evaluación antes de implementar la memoria, no después.
La memoria y la evaluación avanzada ofrecen el mayor valor donde hay margen de mejora: flujos de trabajo con una precisión de trayectoria base inferior a 0,70, alta variabilidad de parámetros de herramientas o tareas largas de varios pasos en las que los errores iniciales provocan un efecto en cadena. Las tareas de una sola herramienta, cercanas al máximo, aportan pocos beneficios.
En la fase de producción, rara vez se cuenta con una etiqueta de referencia, pero se puede monitorear la presencia de señales de victoria improvisada: llamadas excesivas a herramientas, lógica circular y bucles de reintentos. Hacer un seguimiento de la eficiencia de las llamadas a herramientas mantiene bajo control el costo y la latencia de la API, además de detectar cualquier deterioro antes de que afecte a los usuarios.
La IA con agentes empresarial confiable sigue una metodología clara: agentes base sólidos validados en un riguroso punto de referencia público (n.º 1 en τ-bench), evaluación privada que refleja flujos de trabajo empresariales reales (GBA-Bench) y memoria operativa filtrada por calidad que mejora la ejecución con el tiempo (PRE + inteligencia contextual).
Juntos abordan la deficiencia empresarial entre un resultado de punto de referencia público y un sistema de grado de producción para la automatización de procesos con agentes.
Para conocer la metodología completa, los datos experimentales y los resultados de la clasificación en más de 30 modelos de vanguardia, lea nuestro Informe de puntos de referencia de agentes de IA 2026. Para conocer cómo nuestros agentes de automatización aplican estos principios en la etapa de producción, programe una demostración en vivo.
τ-bench se encuentra entre los más rigurosos para agentes que utilizan herramientas, debido a su métrica de confiabilidad pass^k. AgentBench (entornos diversos), WebArena (navegación web) y SWE-bench (ingeniería de software) completan el conjunto básico. Cada uno mide una capacidad diferente, por lo que no existe una única puntuación de confiabilidad.
Vaya más allá de la finalización de tareas. Evalúe la corrección funcional (alcanzar objetivos), el uso de herramientas y la navegación (bases de datos, navegadores, API), la seguridad y la confiabilidad (medidas de seguridad para evitar acciones dañinas), así como la aplicabilidad en el mundo real en flujos de trabajo complejos, en lugar de limitarse solo a tareas de programación. La precisión de la trayectoria es lo que vincula estos elementos.
Las métricas principales incluyen la tasa de éxito (proporción de tareas resueltas por completo), la tasa de resolución de intención (identificación correcta de los objetivos del usuario), la tasa de finalización de tareas de varios pasos y la retención de contexto a lo largo de interacciones prolongadas. En 2026, estas métricas de resultados requieren cada vez más una medida de trayectoria que las acompañe.
La clasificación n.º 1 en su presentación de mayo de 2026 se debe a la arquitectura del agente base (aa-agent-v1) con andamiaje de contexto ligero, que se destaca en tareas de múltiples turnos y en el uso consistente de herramientas. Es una arquitectura sólida, y no solo un modelo sólido, lo que impulsa el resultado.
Al momento de la presentación en mayo de 2026, los agentes base alcanzan 74,5% en pass^1 con una ventaja de +4.3 puntos, y mantienen esa ventaja hasta el exigente nivel pass^4 (Fuente: Informe de punto de referencia de agentes de IA de Automation Anywhere 2026). Además, se ejecutan más rápido que la comparación de la tabla de clasificación en tres de los cuatro dominios, hasta 3,2 veces más rápido en el sector minorista.
La precisión de la trayectoria mide si un agente siguió una línea de razonamiento correcta y auditable, y no solo si llegó a la respuesta correcta. Detecta el problema de la "victoria improvisada": un resultado correcto que se obtiene mediante pasos frágiles, ineficientes o riesgosos que fallan a gran escala.
La memoria operativa estructurada permite que los agentes sinteticen lecciones de ejecuciones anteriores y las apliquen a las nuevas, lo que elimina la repetición de errores de parámetros y llamadas inválidas a herramientas. En los flujos de trabajo empresariales complejos, esto mejora de manera significativa el logro de los objetivos y la precisión de la trayectoria, además de reducir las llamadas innecesarias a herramientas.
Etiquetas
IAManténgase al día:

Emily Gal es directora de Marketing de Producto para la plataforma de APA en Automation Anywhere y lleva más de 17 años impulsando el crecimiento de SaaS B2B y de la IA.
Atención médica autónoma: la guía completa de las operaciones médicas impulsadas por la IA
Leer el blogIA en facturación y codificación médicas: de la automatización de tareas a la RCM con agentes
Leer el blogLa IA en el sector de los seguros: casos de uso prácticos y flujos de trabajo escalables
Leer el blog
Para empresas
Inscríbase para obtener acceso rápido a una demostración del producto personalizada
Para estudiantes y desarrolladores
Empiece a automatizar al instante con acceso GRATIS a todos los roles con Cloud Community Edition.