Herramientas · Arquitectura · 05

Manipula una cabeza de atención paso a paso.

Selecciona un token de consulta y observa cómo los scores previos a softmax se convierten en pesos de atención. Activa la máscara causal, cambia la concentración de la distribución y modifica un valor V para ver cómo cambia la salida.

01 · ScoresS = QKᵀ / √dₖ
02 · MáscaraŜ = S + M
03 · Normalizaciónα = softmax(Ŝ / T)
04 · Mezclasalida = Σ αⱼVⱼ

Secuencia

Se separan por espacios y se usan como etiquetas. No es el tokenizador de un modelo real. Máximo: 8 tokens.
Selecciona la fila cuya distribución quieres inspeccionar y editar.

Patrón de cabeza

Son patrones didácticos de scores, no cabezas extraídas de un Transformer entrenado.
1,00
La formulación original usa el escalado 1/√dₖ. Aquí T se añade después como control didáctico: softmax(Ŝ/T). T alta aplana; T baja concentra. T=1 recupera la normalización estándar de los scores ya enmascarados.
Consultafila seleccionada
Mayor pesoclave dominante tras softmax
Entropíaconcentración de la distribución
Tokens efectivosexp(entropía)
Salida V escalarΣ αⱼVⱼ en el ejemplo 1D
Claves permitidasdespués de la máscara
Matriz de atenciónfilas = consultas · columnas = claves
La misma consulta, tres patroneshaz clic para cambiar de head
De score a contribuciónedita S y V para la consulta seleccionada
Método

Un peso de atención, por sí solo, no demuestra por qué el modelo llegó a una salida.

Scaled dot-product attention. En un Transformer real, cada posición produce vectores query, key y value mediante proyecciones aprendidas. Los scores se obtienen con QKᵀ y se dividen por √dₖ antes de aplicar la máscara y softmax.

Attention(Q,K,V) = softmax(QKᵀ / √dₖ + M)V

Qué simula esta herramienta. Para mantener cada relación interpretable, los tres heads generan directamente una matriz sintética de scores S en el punto equivalente a QKᵀ/√dₖ. No son pesos de un modelo concreto. Puedes editar la fila seleccionada y comprobar qué hacen exactamente la máscara y la normalización.

Máscara causal. En un decoder autoregresivo, los scores hacia posiciones futuras se convierten en −∞ antes de softmax. Por eso su probabilidad final es exactamente cero.

Valores. Los V reales son vectores de muchas dimensiones. Aquí usamos un único escalar editable por token para que la operación final sea visible sin inventar coordenadas semánticas: la salida es la suma ponderada Σ αⱼVⱼ.

Multi-head. Una capa real ejecuta varias cabezas con proyecciones aprendidas distintas y después concatena/proyecta sus salidas. La comparación de tres patrones muestra por qué distintas cabezas pueden producir distribuciones diferentes, pero no pretende reproducir una capa entrenada.

Interpretación. Visualizar α permite inspeccionar qué posiciones mezcla una cabeza, pero no basta para atribuir causalmente una predicción. Jain y Wallace mostraron que distribuciones de atención muy distintas pueden producir predicciones equivalentes; Wiegreffe y Pinter señalaron después que la utilidad explicativa depende de cómo se defina y se evalúe «explicación». Por eso esta herramienta trata la atención como una operación interna inspeccionable, no como una explicación causal automática.

La temperatura T es un control educativo adicional y no sustituye el factor 1/√dₖ del Transformer original. Tampoco se modelan dropout, rotary/relative position biases, GQA/MQA, FlashAttention ni otras optimizaciones de implementación.

Fuentes: Vaswani et al. · Attention Is All You Need para scaled dot-product y multi-head attention; PyTorch · scaled_dot_product_attention para la semántica actual de máscara causal; Jain & Wallace · Attention is not Explanation y Wiegreffe & Pinter · Attention is not not Explanation para el debate sobre atención e interpretabilidad. Verificadas el 21-08-2026.