La nota de Gartner del 26 de febrero de 2025 prevé que hasta 2026 las organizaciones abandonarán el 60% de los proyectos de IA no respaldados por datos AI-ready. La misma nota se cita a menudo con un 63% relacionado — cuidád el tamaño muestral al citar; la dirección del argumento es clara.
Eso no es “comprad una base vectorial”. Es un diagnóstico de falta de preparación disfrazada de adopción.
La Ilusión de Preparación
Llamamos al patrón la Ilusión de Preparación, apoyándonos en el Data Readiness Index 2026 de Cloudera (n=1.270 líderes IT, campo 22 ene–3 mar 2026): el 96% declara IA en procesos nucleares y el 85% afirma tener una estrategia de datos clara, mientras casi el 80% admite que el acceso sigue limitando las iniciativas de IA y solo el 18% llama a sus datos plenamente gobernados. No fallan en querer IA. Fallan en notar que nunca estuvieron listos para alimentarla.
Deloitte suele situar datos y gobernanza abajo en índices de preparación (marcos ilustrativos ~40% / ~30% / talento ~20%). El matiz honesto: muchos encuestados siguen nombrando capacidades, no datos, como barrera nº 1. Ambos pueden ser ciertos.
Qué significa AI-ready en la práctica
- Encontrar la fuente de verdad del flujo.
- Acceder con mínimo privilegio.
- Calidad antes de recuperar.
- Estructura para retrieval — chunks, metadatos, preguntas de evaluación reales.
- Operar — monitor, dueño, cuando el agente miente.
El agente miente porque mienten los datos
RAGBench muestra spreads de alucinación fuertes por dominio y correlación relevante entre documento y respuesta. Subir de modelo sin arreglar retrieval es el camino del demo brillante y la producción decepcionante.
Contexto de mercado
Databricks (~5.400 M$ run-rate en comunicaciones feb 2026), Snowflake (NRR alto, ~124% en periodos recientes), Iceberg como formato de tabla de facto, MCP como seam de acceso (donación AAIF / Linux Foundation, 9 dic 2025). Catálogos abiertos ayudan a descubrir; no inventan dueños.
| Capa | Si falta, qué se rompe |
|---|---|
| Sistemas fuente | El agente inventa |
| Catálogo + calidad | Tabla equivocada / datos viejos |
| Seam MCP / API | Scrapers frágiles |
| Agente + evals | Degradación silenciosa |
Ángulo pyme / España
La Década Digital sigue mostrando retraso de intensidad digital en pymes frente al objetivo del 90% (resúmenes recientes ~73%). Kit Digital ha movido cientos de miles de ayudas y miles de millones; la relanzación 2026 (Orden TDF/39/2026) sigue comprando fontanería mientras escasean las operaciones AI-ready. Tarifas de mercado ilustrativas 800–1.500 €/día; contrastad con nuestros precios publicados de Discovery / piloto.
Quién debe hacer qué
Sin agentes: un flujo, tres sistemas, diez preguntas de eval.
Piloto inestable: medid hit-rate de retrieval antes de retocar prompts.
Proyecto abandonado: conservad fallos como set de eval; preguntad si faltaba modelo o datos AI-ready.
Predicciones
- “AI-ready” se vuelve checkbox vacío — pedid evidencia por flujo.
- Los catálogos MCP crecen más rápido que los estates gobernados.
- Iceberg + catálogos abiertos siguen siendo la vía pragmática mid-market.
- El gasto en RAG sube; las alucinaciones siguen en consejo.
- Quienes digan “Kit Digital = ya hicimos IA” redescubrirán la Ilusión en auditorías 2027.
Cierre
Tratamos los datos AI-ready con la misma disciplina: catálogo, reglas de calidad y evaluaciones — antes de la autonomía. Si queréis una lectura clara de si vuestro próximo agente tiene suelo de datos, el trabajo actual empieza por un presupuesto Web & eCommerce o US → EMEA.
Fuentes
Preguntas frecuentes
¿Qué entiende Gartner por datos AI-ready?
En lenguaje de operador: datos localizables, con permisos, calidad comprobada para el flujo, documentados para recuperación y monitorizados cuando el agente los toca — no un lago 'con IA en alguna parte'.
¿Los datos son siempre la barrera nº 1?
Depende de la encuesta. Deloitte suele puntuar bajo datos y gobernanza mientras muchos encuestados nombran talento como barrera principal. La Ilusión de Preparación es el hueco entre la estrategia declarada y el acceso gobernado.
¿Por qué alucina el agente con nuestros documentos?
La calidad de la recuperación condiciona la respuesta. Trabajos tipo RAGBench muestran spreads grandes de alucinación por dominio y correlación entre relevancia del documento y calidad de la respuesta. Un modelo más fuerte no arregla el chunk equivocado.
¿Por dónde empieza una pyme?
Un flujo: sistemas fuente, dueño, ruta de acceso, regla de calidad y diez preguntas de evaluación reales. Kit Digital financia fontanería; no inventa vuestro catálogo.
