Dos cifras dominan cada presentación de estrategia de agentes a mediados de 2026. Gartner predice que más del 40% de los proyectos de IA agéntica será cancelado para finales de 2027, citando costes disparados, valor de negocio poco claro y controles de riesgo inadecuados. El informe preliminar GenAI Divide de MIT Project NANDA afirma que el 95% de las iniciativas empresariales de IA generativa no produce retorno financiero medible — una cifra repetida en memorandos de inversores y informes de consejo como si fuera un hecho auditado.
Creemos que la pregunta más útil no es si esas cifras dan miedo. Es si el propio discurso del fracaso cumple los estándares básicos de evidencia — y qué es lo que realmente mata a los agentes cuando tocan producción.
Auditando las cifras de los titulares
El 40% de Gartner — con fecha, direccional, y extrañamente específico sobre las causas
Gartner publicó su previsión el 25 de junio de 2025 — no en 2026, aunque buena parte de la cobertura de mediados de 2026 la presenta como investigación reciente. Anushree Verma, Senior Director Analyst, afirmó que la mayoría de los proyectos de IA agéntica son «experimentos en fase temprana o pruebas de concepto impulsadas en gran medida por el hype y a menudo mal aplicadas», y que las organizaciones necesitan «atravesar el hype para tomar decisiones estratégicas cuidadosas».
La base declarada incluye una encuesta de enero de 2025 a 3.412 asistentes a un webinar sobre su postura de inversión — una señal direccional útil, no un estudio longitudinal de resultados de proyectos. Gartner también proyecta un lado positivo: el 15% de las decisiones de trabajo diarias podría tomarse de forma autónoma para 2028, frente a prácticamente nada en 2024.
Lo que importa para los operadores: los tres motores de cancelación que nombra Gartner — coste, valor poco claro, controles de riesgo — no contienen ninguna referencia a la capacidad del modelo. No es nuestra interpretación, lee la nota de prensa. Si el plan de remediación de tu proveedor es «actualiza al siguiente modelo fundacional», no está alineado con el diagnóstico de Gartner.
El 95% de MIT NANDA — preliminar, cuestionado, cercano a un proveedor
El informe GenAI Divide (julio de 2025) está etiquetado como hallazgos preliminares. Está asociado a Project NANDA (Networked Agents and Decentralised Architecture) — un grupo que construye infraestructura agéntica — no un estudio académico del MIT revisado por pares. La cifra del 95% de «retorno nulo» aparece en el resumen ejecutivo; revisores como Kevin Werbach, de Wharton, argumentan que está insuficientemente respaldada en el cuerpo del documento y que la afiliación al MIT puede confundir a los lectores sobre su rigor. El resumen de la crítica de Futuriom recoge la misma preocupación: sesgo de confirmación, definiciones ambiguas de «fracaso» y una conclusión que favorece a las plataformas agénticas.
No decimos que el ROI de la IA empresarial sea fácil de demostrar. Decimos que esta cifra concreta no debería guiar tu presupuesto de 2026 sin leer el PDF y la sección de conflictos de interés.
La estadística que no existe
Verás «el 89% de los pilotos de IA fracasa — Gartner» en LinkedIn cada semana. No podemos rastrearla a ningún documento de Gartner. Trátala como no verificable — punto. Misma categoría que los paquetes de «tasa de éxito» difundidos por proveedores (81% alcance estrecho / 74% humano en el bucle / 87% evaluaciones) que aparecen en artículos de agregación sin fuente primaria. Cuando una cifra no tiene URL, no es evidencia; es papel pintado.
La tabla de adopción tipo Rashomon — mismo sector, mismo trimestre
Si las tasas de fracaso contaran toda la historia, cabría esperar que las encuestas de adopción coincidieran. No lo hacen. La brecha es definicional — a quién se preguntó, qué significa «desplegado» y si respondió marketing o ingeniería.
| Fuente | Cifra | Qué mide realmente | Campo / muestra |
|---|---|---|---|
| Encuesta CIO Gartner 2026 | 17% ha desplegado agentes de IA hasta la fecha | Despliegue declarado por CIOs (no solo pilotos) | Ejecutivos de tecnología; más del 60% espera despliegue en dos años |
| Deloitte State of AI 2026 | 23% usa IA agéntica al menos moderadamente | Uso moderado o superior, autodeclarado | 3.235 líderes de TI y negocio, 24 países |
| LangChain State of Agent Engineering | 57% tiene agentes en producción | Producción declarada por profesionales | 1.340 encuestados (nov.–dic. 2025) |
| Encuesta de agentes de IA de PwC | 79% dice que los agentes de IA ya se están adoptando | Adopción declarada por ejecutivos (mayo 2025) | 308 ejecutivos de empresa en EE. UU. |
| WRITER Enterprise AI 2026 | 97% desplegó agentes de IA en el último año | Despliegue declarado por ejecutivos | 1.200 C-suite + 1.200 empleados (dic. 2025–ene. 2026) |
Lee la tabla en horizontal y la lección es obvia: «adopción» no es una sola cifra. El 17% de Gartner y el 97% de WRITER pueden ser ciertos ambos si uno cuenta despliegues CIO en producción y el otro cualquier ejecutivo que compró un asiento de copiloto el año pasado. Una estrategia construida sobre el titular más alto sin leer la metodología es como empieza la Crisis del Alcance — etiquetas ambiciosas, ninguna definición compartida de «en vivo».
El historial real de fracaso — retiradas, no pilotos abandonados
Las previsiones de cancelación de encuestas son abstractas. Las retiradas de producción no lo son.
Sinch: el 74% retiró un agente de cliente en vivo
La investigación AI Production Paradox de Sinch (mayo 2026, n=2.527 decisores senior, 10 países) encontró que el 74% de las empresas retiró o apagó un agente de IA de comunicación con clientes desplegado tras un fallo de gobernanza — no un piloto fallido, un sistema en vivo retirado. Entre las organizaciones que declaran controles totalmente maduros, la tasa de retirada fue del 81% — un mejor monitoreo revela fallos que otros pasan por alto, no menos fallos.
Principales causas de retirada entre quienes declararon fallos de gobernanza: exposición de datos personales o de cliente (31%), alucinación o riesgo de marca (22%), falta de auditabilidad — incapacidad de diagnosticar qué salió mal (16%) (capítulo de Sinch). La cobertura de The Register señala la paradoja: el 62% ya tenía agentes en producción, el 98% todavía planea aumentar su gasto en comunicaciones con IA en 2026. Las empresas no están renunciando a los agentes; están acotando mal, repetidamente, la autonomía de cara al cliente.
Incidentes concretos — una lección honesta cada uno
No son hipótesis. Son el temario de los controles de riesgo:
| Incidente | Qué pasó | Lección |
|---|---|---|
| Chatbot de Air Canada (BCCRT 2024) | El chatbot del sitio dio un consejo incorrecto sobre tarifa por duelo; el tribunal declaró responsable a Air Canada — 812,02 CAD en total | Eres dueño de cada palabra que publica tu agente; «el chatbot es una entidad separada» no funciona ante un tribunal |
| Chevrolet Watsonville (dic. 2023) | Una inyección de prompt convenció al chatbot del concesionario de «vender» un Tahoe de ~76.000 $ por 1 $ | La entrada del usuario y el prompt del sistema comparten canal — sin frontera de ejecución, no hay producción |
| Bot de paquetería DPD (BBC, ene. 2024) | Un cliente hizo que el bot maldijera, insultara a la empresa y escribiera un poema autocrítico | La seguridad de marca es un problema de guardarraíles, no de un modelo base mejor |
| Klarna (Bloomberg, mayo 2025) | El CEO Sebastian Siemiatkowski: la apuesta todo-IA hizo del coste «un factor de evaluación demasiado predominante» → «menor calidad»; se restauró el soporte humano híbrido | Sustituir del todo niveles humanos sin métricas de calidad es un fallo de alcance |
| Agente de Replit (Fortune, jul. 2025) | El agente borró una base de datos de producción durante una congelación de código, admitiendo un «fallo catastrófico de mi parte» | Acciones irreversibles sin separación de entornos ni controles humanos |
Ninguna de estas historias termina con «el modelo no era suficiente GPT-5». Terminan con alcance, permisos y supervisión.
La Crisis del Alcance — nuestro marco organizador
Llamamos a este patrón la Crisis del Alcance: los programas de agentes fracasan porque la dirección los trata como compras de capacidad en lugar de compromisos operativos con flujos acotados, economía explícita y controles exigibles.
Los motores de cancelación de Gartner encajan con precisión:
- Costes disparados — demos multiagente, herramientas solapadas, contexto sin acotar, sin economía unitaria por flujo.
- Valor de negocio poco claro — sin métrica base antes del piloto; el éxito definido como «el efecto wow ejecutivo».
- Controles de riesgo inadecuados — envío, escritura y borrado externos sin aprobación; sin trazas cuando algo se rompe.
Fíjate en lo que falta: el CI del modelo. El equipo de ingeniería de Anthropic lo dice directamente: «encuentra la solución más simple posible, y aumenta la complejidad solo cuando sea necesario. Esto puede significar no construir sistemas agénticos en absoluto.» Es el proveedor que vende Claude — diciéndote que no construyas agentes a menos que los patrones más simples fallen.
Anatomía de los que sobreviven — qué hacen realmente los equipos de producción
Empezar simple; añadir agencia solo con evidencia
Anthropic distingue entre flujos de trabajo (pasos predecibles) y agentes (bucles guiados por el modelo). Para la mayoría de flujos de operador — triaje de bandeja, borradores de respuesta, extracción documental — un flujo con recuperación y una cola humana supera a un bucle autónomo en coste, latencia y capacidad de depuración. Los agentes se ganan su lugar cuando el camino no se puede fijar pero los resultados siguen siendo verificables (soporte con herramientas y escalado, agentes de código con tests).
La guía práctica de construcción de agentes de OpenAI recomienda maximizar primero las capacidades de un solo agente — añadiendo herramientas de forma incremental antes de dividir en orquestación multiagente. Cuando el solapamiento de herramientas causa una mala selección consistente, se divide — no antes. Su referencia: algunos equipos gestionan 15+ herramientas distintas bien definidas; otros luchan con menos de 10 herramientas que se solapan. El diseño de herramientas es alcance.
Añade guardarraíles (entrada, herramienta, salida) y escalado humano para acciones de alto riesgo e irreversibles — pagos, cancelaciones, borrados, envíos externos. La documentación del SDK de OpenAI describe interrupciones de aprobación que pausan una ejecución hasta que un humano aprueba — no una disculpa después del incidente.
Evaluaciones frente a observabilidad — la brecha que mata la confianza
La encuesta State of Agent Engineering 2026 de LangChain (n=1.340) reporta 89% de adopción de observabilidad pero solo 52% ejecuta evaluaciones sistemáticas. Entre los equipos en producción, el 22,8% no reporta ninguna evaluación. Puedes ver a un agente fallar en tiempo real y aun así no saber si es bueno — porque el trazado registra qué pasó, no si era aceptable.
Las indicaciones de Anthropic sobre desmitificar las evaluaciones de agentes de IA coinciden: construye conjuntos de prueba representativos, hazlos correr antes de escalar y consérvalos cuando cambien modelos o prompts. Las evaluaciones son lo que te permite sobrevivir a la revisión financiera cuando se disipa el efecto demo.
Quién debe hacer qué — según la situación
No tienes agentes en producción todavía
- No compres una plataforma porque una previsión diga que el 40% fracasará — usa la previsión para justificar un alcance estrecho, no la parálisis.
- Ejecuta una auditoría de flujo de 20 minutos: una tarea de criterio repetitiva, medible hoy (tiempo por ticket, tasa de error, incumplimientos de SLA).
- Prototipa en borrador + aprobación humana — no en envío autónomo. Alinéate con la transparencia del artículo 50 si hay clientes interactuando con el resultado (en vigor el 2 de agosto de 2026 — sin cambios por los aplazamientos de alto riesgo del Ómnibus Digital).
- Elige ≤10 herramientas distintas con esquemas; registra cada llamada.
Tu piloto está atascado («gran demo, sin camino a producción»)
- Revisa la tabla Rashomon: ¿estás contando una licencia de Copilot como «desplegado»?
- Escribe la única métrica que el piloto debe mover en 30 días — no «explorar agentes».
- Cierra la brecha de evaluación: 20–50 casos reales etiquetados como éxito/fallo valen más que otro ajuste de prompt.
- Si el coste es el bloqueo, divide los flujos: modelo abierto para clasificación, frontier solo para casos límite (enrutado híbrido — coste por llamada visible).
Retiraste uno (o la cifra del 74% de Sinch te suena familiar)
- Conserva las trazas y los casos de fallo — son tu conjunto de evaluación.
- Clasifica la retirada: datos personales → fronteras de datos y redacción; alucinación → afirmaciones más ceñidas + anclaje por recuperación; indiagnosticable → arquitectura de auditoría primero.
- Vuelve a entrar con un canal, una intención, una cola de aprobación — no un asistente general con otro nombre.
- Revisa el giro de Klarna: un alcance solo por coste sacrifica calidad; los niveles híbridos son el diseño duradero.
Predicciones — nuestra lectura hasta finales de 2027
-
Las previsiones de cancelación envejecerán mal como metadatos. El 40% de Gartner se citará sin la fecha de junio de 2025 hasta que alguien rastree las cancelaciones reales — espera una industria de balance «¿tenían razón?» en 2027, no un marcador limpio.
-
La tasa de retirada se convertirá en la métrica honesta para los agentes de cara al cliente, sustituyendo el conteo de pilotos. El 74% de Sinch es más legible operativamente que el 95% de NANDA.
-
El gasto en gobernanza crecerá más rápido que el gasto en modelos — Deloitte ya reporta solo un 21% de gobernanza de agentes madura mientras las previsiones de adopción llegan al 74% de uso moderado en dos años. Ahí es donde empiezan los incendios de presupuesto.
-
Las herramientas de evaluación se consolidan; la observabilidad se convierte en commodity. La brecha 89%/52% se estrecha a medida que compras pide «enséñame el conjunto de prueba» junto al panel.
-
Los roles de «agent ops» neutrales al proveedor se vuelven habituales — las ofertas de empleo ya mezclan SRE, cumplimiento y product ownership. El título varía; el trabajo es hacer cumplir el alcance.
-
Las arquitecturas de un solo agente persisten más de lo que predicen las diapositivas multiagente. Tanto OpenAI como Anthropic lo dicen; las empresas lo aprenderán igualmente por las malas.
Qué nos llevamos de esto
Construimos los proyectos de Capa Operativa de IA alrededor de la misma disciplina que muestra el esquema de los supervivientes: un flujo medible, herramientas bajo contrato, controles humanos en las acciones con consecuencias, evaluaciones antes de escalar. Esto no es pesimismo sobre los agentes — es respeto por lo que cuesta de verdad la producción, cuando un chatbot puede costarte 812 CAD en costas de tribunal o un agente de código puede borrar una base de datos durante una congelación.
Si quieres una opinión honesta sobre dónde encajan los agentes en tu operación — y dónde no — el trabajo actual empieza por un presupuesto Web & eCommerce o US → EMEA. Una conversación, tus sistemas, sin presentación.
Fuentes
Referencias primarias citadas en este artículo (verificación de julio de 2026):
- Gartner — 40% de proyectos de IA agéntica cancelados para 2027 (25 jun. 2025)
- Nota de prensa de Gartner — previsiones asociadas (15% de decisiones autónomas para 2028)
- MIT Project NANDA — informe GenAI Divide (espejo PDF)
- Crítica de Kevin Werbach — vía Futuriom
- Futuriom — escrutinio del GenAI Divide
- Sinch — nota de prensa AI Production Paradox (mayo 2026)
- Sinch — capítulo de desafíos de producción
- The Register — cobertura de retiradas de Sinch
- Gartner — Hype Cycle for Agentic AI 2026
- Deloitte — State of AI in the Enterprise 2026
- LangChain — State of Agent Engineering 2026
- PwC — encuesta de agentes de IA (mayo 2025)
- WRITER — adopción de IA empresarial 2026
- Anthropic — Construyendo agentes efectivos
- Anthropic — Desmitificando las evaluaciones de agentes de IA
- OpenAI — Guía práctica para construir agentes (PDF)
- OpenAI — guía práctica: guardarraíles y patrones de aprobación humana
- Air Canada — Moffatt v Air Canada, BCCRT 2024
- Chatbot del concesionario Chevrolet Watsonville — Cybernews
- BBC — incidente del chatbot de DPD
- CEO de Klarna sobre la calidad — cobertura de Entrepreneur / Bloomberg
- Fortune — borrado de base de datos por Replit
Preguntas frecuentes
¿Dice Gartner que los modelos de IA no son suficientemente buenos para agentes?
No. La previsión de Gartner de junio de 2025 cita costes disparados, valor de negocio poco claro y controles de riesgo inadecuados como motores de cancelación. La capacidad del modelo no está en la lista. Eso coincide con lo que vemos en producción: el alcance y la gobernanza fallan antes que el modelo.
¿Deberíamos confiar en la estadística del 95% de ROI nulo de MIT NANDA?
Trátala como preliminar, no como evidencia revisada por pares. Kevin Werbach (Wharton) y otros revisores señalan que la cifra del 95% aparece en el resumen ejecutivo sin datos de apoyo claros en el cuerpo del informe, vinculado a la agenda propia de Project NANDA sobre infraestructura agéntica. Útil como provocación — no como línea de presupuesto.
¿Por qué las encuestas de adopción muestran a la vez 17% y 97% de despliegue?
Las definiciones difieren. El 17% de Gartner son organizaciones que han desplegado agentes de IA hasta la fecha (encuesta CIO 2026). El 57% de LangChain son profesionales con agentes en producción (encuesta de ingeniería). El 97% de WRITER son ejecutivos que declaran haber desplegado agentes en el último año (encuesta de proveedor). Mismo trimestre, preguntas distintas — compara metodologías, no titulares.
¿Qué hacemos si ya retiramos un agente de cara al cliente?
Trata la retirada como una señal, no una vergüenza. La investigación de Sinch de 2026 encontró que el 74% de las empresas retiró o apagó un agente de comunicación con clientes en producción — a menudo tras exposición de datos personales, alucinación o ausencia de traza de auditoría. Reacota a un solo flujo, añade controles humanos en las acciones externas, construye un conjunto de evaluación con los casos de fallo y vuelve a pilotar con trazas.
