Herramientas · LLMs · 06

Distribuye la ventana de contexto antes de superar el límite.

Una ventana grande sigue siendo un presupuesto finito. Separa instrucciones, esquemas de herramientas, historial, contexto RAG, mensaje actual, salida reservada y margen operativo para ver cuánto cabe antes de truncar o fallar.

Ventanainput + salida + margen
Inputsistema + herramientas + historial + RAG + usuario
Presión futuramargen ÷ crecimiento por turno

Límite y reservas

No es una predicción: es el máximo que quieres proteger para la respuesta.
Reserva para variación de tokenización, contenido dinámico y sobrecarga no modelada.
Úsalo para aproximar cuándo una conversación larga empezará a presionar el contexto.

Qué entra en cada llamada

Contexto planificadoinput + salida reservada + margen
Límiteventana configurada para el escenario
Input disponibledespués de proteger salida y margen
Input restantenegativo significa overflow
Distribución de la ventana
Uso del input disponible
Overflow
Turnos hasta presión
Mayor bloque
Método

Separa input, salida reservada y margen antes de calcular capacidad.

Presupuesto de input. La ventana configurada se reparte entre los tokens que ya llegan al modelo, la salida máxima que quieres permitir y un margen operativo explícito.

input_disponible = ventana_contexto − salida_reservada − margen

Demanda real. El input se desglosa para que un crecimiento de historial, un esquema de herramientas grande o más chunks RAG no quede oculto dentro de una única cifra.

input_usado = sistema + herramientas + historial + RAG + usuario

Overflow. Si el input usado supera el input disponible, la herramienta muestra exactamente cuántos tokens hay que recuperar. No decide automáticamente qué eliminar: esa prioridad depende de tu producto. En su lugar muestra qué bloques podrían absorber la reducción.

Conversaciones largas. El número de turnos restantes es una aproximación lineal: margen de input actual dividido entre el crecimiento de historial que configures. Resumir, compactar o descartar mensajes cambia esa dinámica.

Semántica del límite. OpenAI documenta que el límite máximo de tokens combina input y output. En Responses, max_output_tokens limita la generación y la estrategia de truncado puede fallar o eliminar elementos del principio cuando el input excede la ventana. Por eso este planificador separa deliberadamente capacidad, reserva de salida y política de truncado.

No estima tokens a partir de caracteres ni palabras: introduce recuentos reales de tu tokenizador o telemetría. La tokenización depende del modelo y del idioma.

Fuentes primarias: OpenAI · What are tokens and how to count them? y OpenAI Responses API · create. Verificadas el 21-08-2026.