Distribuye la ventana de contexto antes de superar el límite.
Una ventana grande sigue siendo un presupuesto finito. Separa instrucciones, esquemas de herramientas, historial, contexto RAG, mensaje actual, salida reservada y margen operativo para ver cuánto cabe antes de truncar o fallar.
Separa input, salida reservada y margen antes de calcular capacidad.
Presupuesto de input. La ventana configurada se reparte entre los tokens que ya llegan al modelo, la salida máxima que quieres permitir y un margen operativo explícito.
Demanda real. El input se desglosa para que un crecimiento de historial, un esquema de herramientas grande o más chunks RAG no quede oculto dentro de una única cifra.
Overflow. Si el input usado supera el input disponible, la herramienta muestra exactamente cuántos tokens hay que recuperar. No decide automáticamente qué eliminar: esa prioridad depende de tu producto. En su lugar muestra qué bloques podrían absorber la reducción.
Conversaciones largas. El número de turnos restantes es una aproximación lineal: margen de input actual dividido entre el crecimiento de historial que configures. Resumir, compactar o descartar mensajes cambia esa dinámica.
Semántica del límite. OpenAI documenta que el límite máximo de tokens combina input y output. En Responses, max_output_tokens limita la generación y la estrategia de truncado puede fallar o eliminar elementos del principio cuando el input excede la ventana. Por eso este planificador separa deliberadamente capacidad, reserva de salida y política de truncado.
No estima tokens a partir de caracteres ni palabras: introduce recuentos reales de tu tokenizador o telemetría. La tokenización depende del modelo y del idioma.
Fuentes primarias: OpenAI · What are tokens and how to count them? y OpenAI Responses API · create. Verificadas el 21-08-2026.