Herramientas · Voz · 10

Convierte tráfico de llamadas en coste mensual y capacidad necesaria.

Separa minutos conectados, audio enviado a STT, audio sintetizado, caracteres y tokens del modelo. Después dimensiona workers y límites de proveedor sin confundir llamadas simultáneas con peticiones TTS simultáneas.

Costetelefonía + media + STT + LLM + TTS
Volumenminutos y unidades facturables por componente
Capacidadpico de llamadas, workers y concurrencia de proveedor

Tráfico y uso

Fracción del tiempo conectado que realmente envías/facturas como audio STT. Pon 100% si mantienes audio continuo.
Fracción del tiempo conectado reproducida como TTS. Puede solaparse con audio del usuario durante barge-in.
Convierte volumen mensual en concurrencia media.
Debe venir de trazas o forecast; no puede reconstruirse desde la media mensual.

Capacidad

Capacidad medida de tu runtime, no un límite universal.
1 = una sesión STT persistente por llamada. Cámbialo si compartes, multiplexas o abres más de una.
Fracción de llamadas pico que generan audio TTS a la vez. No es el porcentaje de tiempo que el audio está sonando.
0 = no comprobar. Introduce el límite real de tu cuenta/proveedor si existe.
0 = no comprobar. Para WebSocket, usa la semántica de concurrencia documentada por tu proveedor.

Tarifas por uso

Supuesto editable para convertir minutos de audio del agente en caracteres TTS.

LLM por llamada

Coste mensual
Coste por llamadaincluye todas las partidas modeladas
Coste por minuto conectadocomparable entre escenarios de distinta duración
Minutos conectados
Audio facturable STT
Audio sintetizado
Telefonía
Media Streams
STT
TTS
LLM
Fijo por llamada
Concurrencia mediaPico/media:
Workers requeridossesiones objetivo / físicas:
Sesiones STT en pico
Peticiones TTS generando en pico
Snapshot de referenciaReferencia España · cascada

Tarifas y supuestos públicos verificados el 21-08-2026; edítalos para reflejar tu contrato, región y arquitectura.

Datos: 2026-08-21
Método

Coste y capacidad no comparten la misma unidad.

Facturación. Telefonía y Media Streams siguen tiempo conectado; STT depende del audio que realmente procesas; TTS puede facturarse por caracteres; el LLM por tokens. El porcentaje de audio STT debe representar tu pipeline real: si envías la pista completa, usa 100%, aunque el usuario guarde silencio.

monthly_cost = connected_min × (telephony + media) + stt_audio_min × STT + agent_chars/1000 × TTS + LLM_tokens + fixed_per_call

Concurrencia de llamadas. La media sale del volumen y las horas de servicio. El pico debe venir de trazas o forecast. Dimensionar solo con la media es insuficiente cuando la llegada de llamadas es irregular.

avg_concurrency = connected_minutes / service_minutes
workers = ceil(peak_calls / (sessions_per_worker × target_utilization))

STT. En una cascada típica, una llamada mantiene una sesión de transcripción persistente; por eso el preset usa 1 sesión STT por llamada activa. Es un supuesto editable. Twilio documenta una conexión WebSocket por Media Stream y un único stream bidireccional por llamada.

stt_concurrency ≈ peak_calls × stt_sessions_per_call

TTS. No uses el porcentaje de audio reproducido como concurrencia de proveedor. ElevenLabs documenta que, con WebSocket, solo cuenta el tiempo durante el que el modelo genera audio y señala que un límite de 5 puede soportar aproximadamente 100 conversaciones equilibradas. El 5% inicial reproduce esa heurística (5/100); es editable y no sustituye una medición p95/p99 de tus peticiones.

tts_concurrency ≈ peak_calls × generation_duty

Tarifas iniciales. A 21-08-2026: Twilio España publica 0,0178 USD/min para llamada saliente local y 0,0044 USD/min para Media Streams; OpenAI publica GPT Live Transcribe a 0,017 USD/min de audio y GPT-5.6 Luna a 0,20/1,20 USD por MTok de entrada/salida; ElevenLabs publica Flash/Turbo TTS a 0,05 USD por 1.000 caracteres. Todas las cifras siguen siendo editables.

No es una factura ni un SLA. No incluye número telefónico mensual, impuestos, recording, observability, tool calls, storage, transferencias, descuentos por volumen ni mínimos contractuales. Los límites de concurrencia dependen del plan/proveedor y deben introducirse desde tu cuenta real.

Para optimizar tiempo de respuesta, usa también el explorador de latencia de agentes de voz. Para comparar arquitecturas, consulta tres arquitecturas para agentes de voz.

Fuentes: Twilio Voice Spain · Twilio Media Streams · OpenAI GPT Live Transcribe · OpenAI GPT-5.6 Luna · ElevenLabs API pricing · ElevenLabs concurrency. Revisadas el 21-08-2026.