$el@comando $ suscríbete

~/--help · Guías

Cómo calcular el TCO real de una integración API con un LLM: guía para equipos técnicos de pymes

Paso a paso para estimar coste total de inferencia, costes ocultos de migración y cláusulas de contrato

$ por El Comando · redacción automática ·

Vista detallada del código de programación en un tema oscuro en una pantalla de computadora. img://--help
Foto de Stanislav Kondratiev en Pexels

Cómo calcular el TCO real de una integración API con un LLM: guía para equipos técnicos de pymes

Después de leer esta guía sabrás calcular el coste total de tener un LLM integrado vía API en tu stack: desde el precio por token hasta los costes ocultos de latencia, reintentos, re-prompting y migración. También sabrás qué cláusulas contractuales revisar antes de firmar con cualquier proveedor. El objetivo es que no te pille por sorpresa lo que le acaba de pasar a los equipos que integraron DeepSeek y se encontraron con un cuadruplicar de precios de la noche a la mañana.


1. El precio por token no es tu coste: es solo el punto de partida

Todos los proveedores publican precio de entrada y precio de salida por millón de tokens. Ese número es necesario, pero insuficiente.

Para obtener tu coste real de inferencia, necesitas medir tres cosas en tu entorno real, no en benchmarks genéricos:

  1. Ratio de tokens de entrada vs. salida en tus llamadas reales. Si tu caso de uso genera prompts de 2.000 tokens pero respuestas de 200, el precio de salida pesa poco. Si generas resúmenes largos, al revés. Mide durante al menos una semana de tráfico representativo.
  2. Tasa de reintentos. Calcula cuántas llamadas fallan y requieren reintento. Una tasa del 3-5% en hora punta puede elevar tu factura efectiva entre un 5 y un 10% sin que aparezca en el precio por token. Añade ese porcentaje a tu estimación base.
  3. Context window utilizada de media. Muchos equipos pagan por una ventana de 128K tokens pero usan el 15%. Otros, en pipelines de agentes, la saturan. Si saturan, aparecen truncados o errores que disparan reintentos.

La comparativa publicada en DeepSeek vs Claude vs GPT-4o: coste real de inferencia para pymes españolas en 2025 da cifras concretas por proveedor que puedes usar como referencia de partida para este cálculo.


2. Costes operativos que no aparecen en la factura del proveedor

Estos son los que más sorprenden cuando llega el momento de justificar la inversión internamente.

Latencia y su impacto en arquitectura:

  • Si tu integración es síncrona (el usuario espera la respuesta), la latencia media del modelo afecta a la experiencia y puede obligarte a añadir colas, timeouts y lógica de fallback. Eso es código y tiempo de ingeniería.
  • Mide P50, P90 y P99 de latencia, no solo la media. El P99 es lo que ve tu usuario en el peor momento.

Re-prompting tras cambios de modelo:

Cuando el proveedor cambia el modelo subyacente (algo que ocurre con frecuencia y no siempre está anunciado con suficiente antelación), tus prompts ajustados para el modelo anterior pueden degradarse. Estima cuántas horas-ingeniero cuesta revisar y reajustar cada prompt del sistema. Si tienes 20 flujos distintos, multiplica.

Costes de evaluación continua:

Un pipeline productivo necesita evals. Si cada vez que el proveedor actualiza el modelo tienes que volver a correr tu suite de evaluación, eso tiene un coste de infraestructura (LLM-as-judge, tiempo de cómputo) y de tiempo de equipo.


3. Qué cláusulas contractuales revisar antes de comprometerte

La mayoría de los proveedores de API de LLM operan con términos de servicio que se modifican unilateralmente. Eso no es un problema menor: es el riesgo central del modelo de dependencia.

Revisa estos puntos en el contrato o en los términos de servicio antes de integrar en producción:

  1. Preaviso de cambio de tarifa. ¿Cuántos días de antelación notifica el proveedor una subida de precios? ¿Es vinculante o pueden cambiar tarifas con efecto inmediato? Si no hay cláusula explícita, asume que pueden hacerlo sin preaviso.
  2. Preaviso de deprecación de modelo. ¿Cuánto tiempo tienes para migrar si deprecan el modelo que usas? Treinta días es insuficiente para la mayoría de integraciones en producción. Busca al menos 90.
  3. SLA de disponibilidad y compensación real. Un SLA del 99,9% equivale a casi 9 horas de caída permitida al año. Revisa si la compensación es crédito en la plataforma (inútil si te vas) o económica. Y revisa qué está excluido del SLA: mantenimientos programados, degradaciones parciales.
  4. Política de datos y uso para entrenamiento. ¿Tus prompts y respuestas se usan para entrenar futuros modelos? ¿Puedes optar por no participar? Esto no es solo privacidad: si envías información confidencial de clientes, puede tener implicaciones contractuales con ellos. El checklist de cómo auditar la seguridad de un proveedor de IA antes de desplegarlo en tu empresa cubre este punto en detalle.
  5. Cláusula de uso aceptable. Define qué casos de uso están prohibidos y qué pasa si el proveedor decide que el tuyo ya no está permitido. Sin preaviso puede dejarte sin servicio de un día para otro.

4. Cuánto cuesta migrar si el proveedor sube precios

La migración tiene costes directos e indirectos. Calcula ambos antes de asumir que es fácil salir.

Costes directos:

  • Re-prompting completo. Los prompts optimizados para un modelo no son portables de forma directa. Cada modelo tiene sus propias instrucciones de sistema óptimas, su sensibilidad al few-shot, su comportamiento ante instrucciones ambiguas. Estima entre 4 y 16 horas-ingeniero por flujo, dependiendo de la complejidad.
  • Evaluación del nuevo modelo. No puedes asumir que el modelo alternativo se comporta igual. Necesitas correr tus evals y validar manualmente los casos edge. Si no tienes evals, este es el momento de construirlos: sin ellos, migrar es un salto al vacío.
  • Integración técnica. Si cambias de proveedor, probablemente cambies el SDK o al menos los endpoints. Tiempo de desarrollo, pruebas y despliegue.

Costes indirectos:

  • Periodo de degradación. Mientras el equipo ajusta el nuevo modelo, la calidad de las respuestas en producción puede bajar. Eso tiene un coste de soporte y, si el producto es externo, de satisfacción de cliente.
  • Tiempo de decisión y evaluación de alternativas. Comparar proveedores, negociar, revisar contratos. En una pyme sin equipo dedicado, esto compite directamente con el roadmap.

Mi lectura: si el coste de migración supera el ahorro anual que obtendrías cambiando de proveedor, la subida de precios que te parece inaceptable puede ser más barata que moverse. Haz el cálculo antes de decidir, no después.


5. Cómo estructurar la estimación: una hoja de cálculo en cinco columnas

Para llevar esto a un documento concreto, usa esta estructura mínima:

ConceptoUnidadValor medidoCoste mensual estimadoFuente del dato
Tokens de entradaPor millónMedia de tus logsPrecio proveedor × volumenLogs de producción
Tokens de salidaPor millónMedia de tus logsPrecio proveedor × volumenLogs de producción
Reintentos% sobre llamadas totalesTasa medidaCoste inferencia × tasaMétricas de tu API gateway
Horas de mantenimiento de promptsHoras/mesEstimación del equipoCoste hora ingeniero × horasEstimación interna
Coste de evalsHoras + cómputo/mesEstimación del equipoCoste hora + cómputoEstimación interna

Rellena esta tabla con datos reales durante el primer mes de producción y revisita cada vez que el proveedor anuncie cambios. Si integras agentes más complejos sobre tu ERP o CRM, el volumen de llamadas y la lógica de reintentos se complican: la guía sobre cómo definir qué pueden y qué no pueden hacer los agentes de IA con tus APIs ayuda a acotar el perímetro antes de que el coste se dispare.


Errores más comunes a evitar

  • Estimar el TCO solo con el precio por token publicado. Ya sabes que infravalorarás el coste real en un 30-60%.
  • No medir en producción antes de comprometerte. Los benchmarks del proveedor no representan tu carga real. Haz una prueba de carga con tus propios prompts antes de firmar volúmenes mínimos.
  • Ignorar el contrato porque “es una API”. Una API de LLM en producción crítica es una dependencia de proveedor igual que cualquier SaaS. Trátala como tal.
  • No tener un proveedor alternativo probado. No hace falta tenerlo en producción, pero sí haber validado que funciona para tu caso de uso. La semana que te suben precios no es el momento de empezar a evaluar alternativas. El episodio de OpenAI pausando un modelo sin previo aviso es otro recordatorio de por qué el plan B debe existir antes de necesitarlo.
  • No documentar los prompts de sistema como activo de ingeniería. Si están solo en la cabeza de quien los escribió, el coste de migración se multiplica.
Qué cubre: método para calcular TCO real de integración LLM vía API
Componentes: inferencia, reintentos, re-prompting, evals, migración, contrato
A quién va: equipos técnicos de pymes que integran o evalúan proveedores de LLM
Estado: guía de referencia · sin verificación manual de redacción