Calcula el coste y la latencia de un LLM en el mismo escenario.
Introduce el tamaño de la solicitud, la carga y las características de respuesta. La calculadora separa precio, tiempo de respuesta y capacidad para que puedas ver qué variable está limitando el sistema.
Qué calcula y qué no.
Coste. Separa tokens de entrada no cacheados, tokens servidos desde caché y tokens de salida. Los precios de la configuración son un punto de partida: puedes sustituirlos por tu contrato, tarifas por lotes (batch) o cualquier tarifa efectiva.
Latencia. TTFT representa todo lo que ocurre hasta recibir el primer token. Después se aproxima la generación como (tokens_salida − 1) / tokens_por_segundo. Es un modelo de respuesta completa, no de latencia percibida durante streaming.
Capacidad. Para carga estable se aplica la ley de Little: concurrencia media ≈ tasa de llegada × tiempo en servicio. Sirve para presupuestar capacidad media; no sustituye un modelo de colas para tráfico con ráfagas, percentiles p95/p99, límites de tasa, reintentos o procesamiento por lotes.
No se incluyen llamadas a herramientas, búsquedas web, almacenamiento de caché, cargos por audio/imagen, procesamiento prioritario, descuentos por volumen ni infraestructura propia salvo que los incorpores en las tarifas. Las configuraciones con reglas conocidas de precio por contexto largo las aplican automáticamente y muestran el ajuste junto a la fuente.
Para interpretar el resultado
Fuentes de precios
La capa de datos guarda la organización, URL primaria y fecha de verificación de cada configuración. Snapshot verificado el 25-09-2026: incluye GPT-6 Astra/Sol/Luna, GPT-5.6, Claude Sonnet 5 y Gemini 3.8/3.7/3.5/2.5 con páginas oficiales de OpenAI, Anthropic y Google AI for Developers. La subida previamente anunciada de Claude Sonnet 5 fue cancelada y no se aplica. Los precios pueden cambiar; revisa siempre el enlace mostrado para el modelo seleccionado antes de tomar una decisión contractual.