← Volver a todos los insights

Datos y Analítica Publicado · 3 de julio de 2026

La calidad del dato es el techo, y ningún modelo lo sube

El MIT identificó la preparación de los datos como una de las tres causas de que el 95% de los pilotos no rindan. No es un problema que se arregle con un modelo mejor, porque no es un problema de modelo.

6 min de lectura

Hay una conversación que se repite: el sistema no rinde, el equipo propone cambiar de modelo, se cambia, y rinde prácticamente igual. Entonces se propone ajustar el modelo con datos propios. Y sigue igual.

Casi siempre el problema estaba antes.

Lo que dice la evidencia

El estudio The GenAI Divide del MIT, al explicar por qué el 95% de los pilotos no producen retorno, señala tres causas y la primera es la preparación de los datos. El fallo, escriben, casi nunca es el modelo.

Coincide con lo que encontramos en cada auditoría previa que hacemos.

Las cinco formas en que el dato te limita

1. No existe el dato que hace falta. Quieres predecir qué cliente va a irse, pero nadie registró nunca por qué se fue ninguno. No hay modelo que aprenda de un campo vacío.

2. Existe, pero cada uno lo rellena distinto. Tres comerciales, tres criterios para “cliente activo”. El modelo aprende el ruido de vuestros procesos internos, no el patrón del negocio.

3. Está repartido en sistemas que no se hablan. El ERP sabe lo que se facturó, el CRM lo que se prometió y una hoja de cálculo de operaciones lo que realmente pasó. Ninguno tiene la historia completa.

4. El histórico refleja decisiones, no realidad. Si durante cinco años se aprobaron créditos con un criterio sesgado, el modelo entrenado sobre ese histórico reproducirá el sesgo con eficiencia industrial.

5. Nadie es dueño de arreglarlo. El dato es de todos, o sea de nadie. Cuando aparece una inconsistencia, se documenta como excepción y se sigue.

Lo que ha cambiado (y lo que no)

Algo importante: los modelos actuales toleran el desorden mucho mejor que hace tres años. Texto libre, formatos inconsistentes, documentos escaneados — cosas que antes exigían un proyecto de limpieza previo hoy se procesan razonablemente bien.

Lo que no ha cambiado: si el dato no existe, o es sistemáticamente incorrecto, sigue sin haber nada que hacer. La tolerancia al ruido subió; la capacidad de inventar información que nunca se registró, no.

Esa distinción es la que permite decidir bien. Muchos proyectos que se descartaron por “primero hay que limpiar los datos” hoy son viables sin limpiar nada.

La auditoría de dos semanas

Antes de cotizar cualquier implantación hacemos una auditoría corta de datos. No por rigor académico: porque ahorra dinero al cliente.

Lo que mira:

  • ¿El dato que necesita el caso de uso existe? Y si existe, ¿desde cuándo y con qué cobertura?
  • ¿Cuánta variación hay en cómo se registra? Se mide con una muestra, no con una opinión.
  • ¿Qué porcentaje de registros está completo en los campos que importan?
  • ¿Hay una verdad de referencia contra la que medir? Sin ella no hay evaluación posible.
  • ¿Quién puede arreglar el origen si hace falta, y querrá hacerlo?

Dos semanas de esto evitan seis meses de modelado inútil. Es la recomendación más aburrida que damos y la que más veces nos han agradecido.

La regla práctica

Si no puedes explicar cómo se genera el dato, no construyas encima. Y si el proceso que lo genera está roto, arréglalo antes: sale más barato que cualquier modelo que intente compensarlo, y además mejora el negocio por su cuenta.

Fuentes

Siguiente paso

¿En qué punto está tu empresa para adoptar IA?

Evalúa la madurez de tu empresa en 5 minutos y recibe recomendaciones personalizadas y gratuitas.

¿Listo para ir más allá del hype?