Convierte tráfico de llamadas en coste mensual y capacidad necesaria.
Separa minutos conectados, audio enviado a STT, audio sintetizado, caracteres y tokens del modelo. Después dimensiona workers y límites de proveedor sin confundir llamadas simultáneas con peticiones TTS simultáneas.
Tarifas y supuestos públicos verificados el 21-08-2026; edítalos para reflejar tu contrato, región y arquitectura.
Coste y capacidad no comparten la misma unidad.
Facturación. Telefonía y Media Streams siguen tiempo conectado; STT depende del audio que realmente procesas; TTS puede facturarse por caracteres; el LLM por tokens. El porcentaje de audio STT debe representar tu pipeline real: si envías la pista completa, usa 100%, aunque el usuario guarde silencio.
Concurrencia de llamadas. La media sale del volumen y las horas de servicio. El pico debe venir de trazas o forecast. Dimensionar solo con la media es insuficiente cuando la llegada de llamadas es irregular.
STT. En una cascada típica, una llamada mantiene una sesión de transcripción persistente; por eso el preset usa 1 sesión STT por llamada activa. Es un supuesto editable. Twilio documenta una conexión WebSocket por Media Stream y un único stream bidireccional por llamada.
TTS. No uses el porcentaje de audio reproducido como concurrencia de proveedor. ElevenLabs documenta que, con WebSocket, solo cuenta el tiempo durante el que el modelo genera audio y señala que un límite de 5 puede soportar aproximadamente 100 conversaciones equilibradas. El 5% inicial reproduce esa heurística (5/100); es editable y no sustituye una medición p95/p99 de tus peticiones.
Tarifas iniciales. A 21-08-2026: Twilio España publica 0,0178 USD/min para llamada saliente local y 0,0044 USD/min para Media Streams; OpenAI publica GPT Live Transcribe a 0,017 USD/min de audio y GPT-5.6 Luna a 0,20/1,20 USD por MTok de entrada/salida; ElevenLabs publica Flash/Turbo TTS a 0,05 USD por 1.000 caracteres. Todas las cifras siguen siendo editables.
Para optimizar tiempo de respuesta, usa también el explorador de latencia de agentes de voz. Para comparar arquitecturas, consulta tres arquitecturas para agentes de voz.
Fuentes: Twilio Voice Spain · Twilio Media Streams · OpenAI GPT Live Transcribe · OpenAI GPT-5.6 Luna · ElevenLabs API pricing · ElevenLabs concurrency. Revisadas el 21-08-2026.