Manipula una cabeza de atención paso a paso.
Selecciona un token de consulta y observa cómo los scores previos a softmax se convierten en pesos de atención. Activa la máscara causal, cambia la concentración de la distribución y modifica un valor V para ver cómo cambia la salida.
Un peso de atención, por sí solo, no demuestra por qué el modelo llegó a una salida.
Scaled dot-product attention. En un Transformer real, cada posición produce vectores query, key y value mediante proyecciones aprendidas. Los scores se obtienen con QKᵀ y se dividen por √dₖ antes de aplicar la máscara y softmax.
Qué simula esta herramienta. Para mantener cada relación interpretable, los tres heads generan directamente una matriz sintética de scores S en el punto equivalente a QKᵀ/√dₖ. No son pesos de un modelo concreto. Puedes editar la fila seleccionada y comprobar qué hacen exactamente la máscara y la normalización.
Máscara causal. En un decoder autoregresivo, los scores hacia posiciones futuras se convierten en −∞ antes de softmax. Por eso su probabilidad final es exactamente cero.
Valores. Los V reales son vectores de muchas dimensiones. Aquí usamos un único escalar editable por token para que la operación final sea visible sin inventar coordenadas semánticas: la salida es la suma ponderada Σ αⱼVⱼ.
Multi-head. Una capa real ejecuta varias cabezas con proyecciones aprendidas distintas y después concatena/proyecta sus salidas. La comparación de tres patrones muestra por qué distintas cabezas pueden producir distribuciones diferentes, pero no pretende reproducir una capa entrenada.
Interpretación. Visualizar α permite inspeccionar qué posiciones mezcla una cabeza, pero no basta para atribuir causalmente una predicción. Jain y Wallace mostraron que distribuciones de atención muy distintas pueden producir predicciones equivalentes; Wiegreffe y Pinter señalaron después que la utilidad explicativa depende de cómo se defina y se evalúe «explicación». Por eso esta herramienta trata la atención como una operación interna inspeccionable, no como una explicación causal automática.
La temperatura T es un control educativo adicional y no sustituye el factor 1/√dₖ del Transformer original. Tampoco se modelan dropout, rotary/relative position biases, GQA/MQA, FlashAttention ni otras optimizaciones de implementación.
Fuentes: Vaswani et al. · Attention Is All You Need para scaled dot-product y multi-head attention; PyTorch · scaled_dot_product_attention para la semántica actual de máscara causal; Jain & Wallace · Attention is not Explanation y Wiegreffe & Pinter · Attention is not not Explanation para el debate sobre atención e interpretabilidad. Verificadas el 21-08-2026.