Herramientas · LLMs · 01

Calcula el coste y la latencia de un LLM en el mismo escenario.

Introduce el tamaño de la solicitud, la carga y las características de respuesta. La calculadora separa precio, tiempo de respuesta y capacidad para que puedas ver qué variable está limitando el sistema.

Modelo de costetokens × tarifa
Modelo de latenciaTTFT + generación
Modelo de capacidadley de Little

Modelo y precios

Las configuraciones usan precios públicos verificados; todas las tarifas siguen siendo editables.

Una solicitud

Tiempo medido hasta el primer token.
Velocidad de generación después del primer token.

Carga mensual y límites

Coste / solicitud — entrada + caché + salida
Coste mensual — —
Tiempo de respuesta — hasta el último token estimado
Concurrencia media necesaria — carga media, sin modelar colas ni picos
—
—
—
De dónde sale el costepor solicitud
Entrada no cacheadaEntrada cacheadaSalida
De dónde sale el tiemporespuesta completa
TTFTGeneración posterior al primer token
TTFT—
Generación—
Capacidad aproximada—
Holgura de capacidad—
Método

Qué calcula y qué no.

Coste. Separa tokens de entrada no cacheados, tokens servidos desde caché y tokens de salida. Los precios de la configuración son un punto de partida: puedes sustituirlos por tu contrato, tarifas por lotes (batch) o cualquier tarifa efectiva.

coste = (Tin,no-cache × Pin + Tin,cache × Pcache + Tout × Pout) / 1.000.000

Latencia. TTFT representa todo lo que ocurre hasta recibir el primer token. Después se aproxima la generación como (tokens_salida − 1) / tokens_por_segundo. Es un modelo de respuesta completa, no de latencia percibida durante streaming.

tiempo_respuesta ≈ TTFT + (Tout − 1) / velocidad

Capacidad. Para carga estable se aplica la ley de Little: concurrencia media ≈ tasa de llegada × tiempo en servicio. Sirve para presupuestar capacidad media; no sustituye un modelo de colas para tráfico con ráfagas, percentiles p95/p99, límites de tasa, reintentos o procesamiento por lotes.

concurrencia_media ≈ solicitudes/segundo × segundos/solicitud

No se incluyen llamadas a herramientas, búsquedas web, almacenamiento de caché, cargos por audio/imagen, procesamiento prioritario, descuentos por volumen ni infraestructura propia salvo que los incorpores en las tarifas. Las configuraciones con reglas conocidas de precio por contexto largo las aplican automáticamente y muestran el ajuste junto a la fuente.

Fuentes de precios

La capa de datos guarda la organización, URL primaria y fecha de verificación de cada configuración. Snapshot verificado el 25-09-2026: incluye GPT-6 Astra/Sol/Luna, GPT-5.6, Claude Sonnet 5 y Gemini 3.8/3.7/3.5/2.5 con páginas oficiales de OpenAI, Anthropic y Google AI for Developers. La subida previamente anunciada de Claude Sonnet 5 fue cancelada y no se aplica. Los precios pueden cambiar; revisa siempre el enlace mostrado para el modelo seleccionado antes de tomar una decisión contractual.