Calcula el coste y la latencia de un LLM en el mismo escenario.
Introduce el tamaño de la solicitud, la carga y las características de respuesta. La calculadora separa precio, tiempo de respuesta y capacidad para que puedas ver qué variable está limitando el sistema.
Qué calcula y qué no.
Coste. Separa tokens de entrada no cacheados, tokens servidos desde caché y tokens de salida. Los precios de la configuración son un punto de partida: puedes sustituirlos por tu contrato, tarifas por lotes (batch) o cualquier tarifa efectiva.
Latencia. TTFT representa todo lo que ocurre hasta recibir el primer token. Después se aproxima la generación como (tokens_salida − 1) / tokens_por_segundo. Es un modelo de respuesta completa, no de latencia percibida durante streaming.
Capacidad. Para carga estable se aplica la ley de Little: concurrencia media ≈ tasa de llegada × tiempo en servicio. Sirve para presupuestar capacidad media; no sustituye un modelo de colas para tráfico con ráfagas, percentiles p95/p99, límites de tasa, reintentos o procesamiento por lotes.
No se incluyen llamadas a herramientas, búsquedas web, almacenamiento de caché, cargos por audio/imagen, procesamiento prioritario, descuentos por volumen ni infraestructura propia salvo que los incorpores en las tarifas. Las configuraciones con reglas conocidas de precio por contexto largo las aplican automáticamente y muestran el ajuste junto a la fuente.
Para interpretar el resultado
Fuentes de precios
La capa de datos guarda la organización, URL primaria y fecha de verificación de cada configuración. En esta versión se incluyen páginas oficiales de OpenAI, Anthropic y Google AI for Developers. Los precios pueden cambiar; revisa siempre el enlace mostrado para el modelo seleccionado antes de tomar una decisión contractual.