← Volver a todos los insights

Tecnología Publicado · 8 de septiembre de 2026

El coste de la inferencia se ha desplomado (y tu business case está desactualizado)

Lo que en 2023 costaba unos 30 dólares por millón de tokens hoy cuesta menos de uno. Si descartaste un caso de uso por economía unitaria, los números que usaste ya no existen.

5 min de lectura

Hay una categoría entera de proyectos que las empresas descartaron entre 2023 y 2025 con una frase: “los números no salen”. Merece la pena reabrir esa carpeta, porque los números han cambiado más de un orden de magnitud.

La caída, medida

El rendimiento equivalente a GPT-4, que a principios de 2023 se vendía en torno a 30 dólares por millón de tokens, se paga hoy por debajo de un dólar. El índice de gasto en tokens de Silicon Data registró a principios de septiembre de 2026 un mínimo histórico de 0,97 dólares por millón de tokens, más de la mitad por debajo de su pico del verano: el coste medio de inferencia bajó desde unos 2,04 dólares a finales de mayo de 2026 hasta la franja de 1,16–1,18 a principios de agosto, y siguió cayendo.

Pocas materias primas en la historia de la computación han bajado a ese ritmo.

Por qué importa más de lo que parece

Un cambio de precio de 30x no es una mejora de margen. Es un cambio de qué es posible.

A 30 dólares por millón de tokens, sólo tenía sentido usar el modelo en el momento de máximo valor: una consulta puntual, una redacción final, una decisión cara. Todo lo demás salía a pérdida.

Por debajo de un dólar, cambia la forma de diseñar:

  • Puedes permitirte procesar todo el volumen, no una muestra. Clasificar los 400.000 tickets del año pasado deja de ser un proyecto y pasa a ser una tarde.
  • Puedes permitirte que el sistema se equivoque y reintente. Los patrones que consumen muchos tokens — autoconsistencia, verificación cruzada, un segundo modelo revisando al primero — dejan de ser un lujo académico.
  • Puedes permitirte el preprocesado caro. Enriquecer documentos en ingesta, generar resúmenes en varios niveles, mantener índices redundantes.

La arquitectura que era derrochadora en 2024 es hoy la correcta.

La trampa: el volumen se come el ahorro

Aquí es donde las empresas se estrellan. El precio unitario cae, sí — pero los patrones agénticos multiplican el consumo por tarea. Un agente que razona, llama herramientas, lee resultados y reintenta puede gastar cincuenta veces más tokens que una sola llamada para resolver lo mismo.

El resultado es una factura que sube mientras el precio por token baja. No es una contradicción: es la paradoja de Jevons aplicada a la computación.

Lo que hacemos en los proyectos: medir coste por resultado de negocio, no por token. “Cuánto nos cuesta procesar una factura de principio a fin” es una métrica útil. “Cuánto cuesta el millón de tokens” no te dice nada sobre si el proyecto se sostiene.

Y la otra salida: que no cueste nada

Para volúmenes altos y tareas acotadas, la inferencia en dispositivo o en servidor propio cuesta cero por consulta después de la descarga inicial del modelo. No es la respuesta para todo — los modelos pequeños no razonan como los frontera — pero para clasificación, extracción, enrutado y redacción estructurada la diferencia de calidad ya no justifica pagar por cada llamada.

Esto también resuelve conversaciones de privacidad que antes bloqueaban proyectos enteros: si el dato no sale de tu red, media docena de objeciones legales desaparecen.

Qué hacer esta semana

  • Recupera los casos de uso descartados por coste. Rehaz el cálculo con precios de hoy. Una parte va a salir.
  • Instrumenta el coste por transacción de negocio, no por llamada a la API.
  • Pon un tope y una alerta por flujo agéntico antes de ponerlo en producción, no después de la primera factura.
  • Evalúa un modelo pequeño propio para las tareas de alto volumen y bajo razonamiento. Suelen ser el 80% del tráfico.

El coste ha dejado de ser la razón por la que un proyecto de IA no sale. Cuando alguien te diga que no sale por dinero, pide ver los números — suelen ser de hace dos años.

Fuentes

Siguiente paso

¿En qué punto está tu empresa para adoptar IA?

Evalúa la madurez de tu empresa en 5 minutos y recibe recomendaciones personalizadas y gratuitas.

¿Listo para ir más allá del hype?