Herramientas · LLMs · 01

Calcula el coste y la latencia de un LLM en el mismo escenario.

Introduce el tamaño de la solicitud, la carga y las características de respuesta. La calculadora separa precio, tiempo de respuesta y capacidad para que puedas ver qué variable está limitando el sistema.

Modelo de costetokens × tarifa
Modelo de latenciaTTFT + generación
Modelo de capacidadley de Little

Modelo y precios

Las configuraciones usan precios públicos verificados; todas las tarifas siguen siendo editables.

Una solicitud

Tiempo medido hasta el primer token.
Velocidad de generación después del primer token.

Carga mensual y límites

Coste / solicitud entrada + caché + salida
Coste mensual
Tiempo de respuesta hasta el último token estimado
Concurrencia media necesaria carga media, sin modelar colas ni picos
De dónde sale el costepor solicitud
Entrada no cacheadaEntrada cacheadaSalida
De dónde sale el tiemporespuesta completa
TTFTGeneración posterior al primer token
TTFT
Generación
Capacidad aproximada
Holgura de capacidad
Método

Qué calcula y qué no.

Coste. Separa tokens de entrada no cacheados, tokens servidos desde caché y tokens de salida. Los precios de la configuración son un punto de partida: puedes sustituirlos por tu contrato, tarifas por lotes (batch) o cualquier tarifa efectiva.

coste = (Tin,no-cache × Pin + Tin,cache × Pcache + Tout × Pout) / 1.000.000

Latencia. TTFT representa todo lo que ocurre hasta recibir el primer token. Después se aproxima la generación como (tokens_salida − 1) / tokens_por_segundo. Es un modelo de respuesta completa, no de latencia percibida durante streaming.

tiempo_respuesta ≈ TTFT + (Tout − 1) / velocidad

Capacidad. Para carga estable se aplica la ley de Little: concurrencia media ≈ tasa de llegada × tiempo en servicio. Sirve para presupuestar capacidad media; no sustituye un modelo de colas para tráfico con ráfagas, percentiles p95/p99, límites de tasa, reintentos o procesamiento por lotes.

concurrencia_media ≈ solicitudes/segundo × segundos/solicitud

No se incluyen llamadas a herramientas, búsquedas web, almacenamiento de caché, cargos por audio/imagen, procesamiento prioritario, descuentos por volumen ni infraestructura propia salvo que los incorpores en las tarifas. Las configuraciones con reglas conocidas de precio por contexto largo las aplican automáticamente y muestran el ajuste junto a la fuente.

Fuentes de precios

La capa de datos guarda la organización, URL primaria y fecha de verificación de cada configuración. En esta versión se incluyen páginas oficiales de OpenAI, Anthropic y Google AI for Developers. Los precios pueden cambiar; revisa siempre el enlace mostrado para el modelo seleccionado antes de tomar una decisión contractual.