Ver

Aprende sin salir de la página.

Empieza por una explicación breve, manipula el mecanismo y abre el capítulo cuando necesites evidencia y profundidad. Cada pieza indica con claridad cuál es el siguiente paso.

01 · Construir intuición

Vídeos

Pulsa reproducir y continúa aquí. Los archivos solo se cargan cuando decides verlos.

Más explicaciones

5 explicaciones disponibles
Multimodalidad · 1:29

Arquitecturas para combinar texto, imagen, audio y vídeo

Identifica las familias de arquitectura y qué intercambios introduce cada una.

Profundizar en el capítulo →
Historia y fundamentos · 1:29

Escalar: datos, cómputo y parámetros

Conecta las tres variables que explican el salto hacia los modelos fundacionales.

Profundizar en el capítulo →
Infraestructura · 1:29

Energía, calor y conectividad fuera de la Tierra

Separa la promesa de los límites físicos que condicionan un datacenter orbital.

Profundizar en el capítulo →
Fundamentos · 1:29

Qué hace diferente a la IA generativa

Entiende cómo un modelo pasa de predecir a producir texto, imagen, audio o código.

Profundizar en el capítulo →
Economía e infraestructura · 1:29

La IA como una tecnología eléctrica

Relaciona adopción, productividad, energía y bienestar sin confundir impacto con PIB.

Profundizar en el capítulo →
02 · Elegir una pregunta

Rutas guiadas

No necesitas recorrer todo el archivo. Elige una pregunta y avanza de intuición a evidencia en tres pasos.

03 · Comprobar el mecanismo

Animaciones

Cambia variables, compara mecanismos y vuelve al capítulo cuando necesites evidencia.

01 · Razonamiento

Best-of-N: generar más candidatos y elegir mejor

Abrir capítulo →
Best-of-N: generar múltiples respuestas y elegir la mejor
La palanca más simple de test-time compute: más intentos independientes, mejor resultado esperado. Tres variantes con distintos criterios de selección.
Mismo prompt, N ejecuciones independientes con temperatura > 0. El criterio de selección determina qué variante es.
PROMPT
"Demuestra que la suma de los ángulos de un triángulo es 180°"
Candidato 1
"Traza una recta paralela al lado BC por el vértice A. Los ángulos alternos internos dan α = α', β = β'. La recta completa es 180°, luego α + β + γ = 180°."
0.91 ★ Seleccionado
Candidato 2
"Considera la suma de los ángulos exteriores que siempre es 360°. Como cada ángulo exterior + interior = 180°, para los tres vértices: 3×180° - (α+β+γ) = 360°, luego α+β+γ = 180°."
0.78
Candidato 3
"Por el postulado de Euclides, en geometría plana la suma de ángulos internos de cualquier polígono de n lados es (n-2)×180°. Para n=3, el resultado es 180°."
0.65
CRITERIO DE SELECCIÓN (PRM)
→ Candidato 1 seleccionado por mayor puntuación media de pasos intermedios
02 PRM frente a ORMComprueba qué cambia al evaluar el proceso o solo el resultado. Abrir interacción
PRMs vs ORMs: dos formas de enseñar a razonar
Process Reward Models evalúan cada paso. Outcome Reward Models evalúan solo el resultado. La diferencia es más profunda de lo que parece.
El PRM asigna una recompensa a cada paso intermedio de la cadena, no solo al final. Esto permite detectar y penalizar el razonamiento incorrecto aunque la respuesta final sea correcta por suerte.
Cadena de razonamiento del modelo
P1
"Necesito factorizar el denominador: x²-4 = (x-2)(x+2)"
PRM
+0.95
Correcto
P2
"Las raíces son x=2 y x=-2, que son singularidades"
PRM
+0.91
Correcto
P3
"Aplico fracciones parciales: A/(x-2) + B/(x+2), resolviendo A=1, B=1"
PRM
+0.31
Error detectado en P3
P4
"Integro cada fracción: ln|x-2| + ln|x+2| + C"
PRM
+0.58
Forma correcta, coeficientes erróneos
Resp.
"ln|x-2| + ln|x+2| + C"
ORM
+0.70
ORM: "parece una integral"
El PRM detectó el error en P3 aunque la respuesta final sea plausible. El ORM lo pasaría por alto si la forma general parece correcta.
Ver explicación y fuentes →
03 Alineamiento multimodal con ImageBindExplora cómo seis modalidades comparten un espacio mediante un ancla visual. Abrir interacción
Alineamiento por transitividad — de par imagen-texto a seis modalidades
Cómo ImageBind aprende un espacio compartido sin necesitar pares directos entre modalidades no visuales.
TEXTO
Texto
IMAGEN
Imagen
AUDIO
Audio
PROF
Profundidad
TERM
Térmico
IMU
IMU
VÍDEO
Vídeo
Millones de pares naturales existen para texto + imagen: pies de foto, descripciones de productos, artículos con imágenes. Para audio-texto: escasos y caros de etiquetar. Para profundidad-layout: requieren sensores especializados y trabajo humano. Las modalidades fuera del par texto-imagen quedan sin conexión en el espacio de representación.
transitividad par par par par par par
IMAGEN
ancla
TEXTO
Texto
AUDIO
Audio
PROF
Profundidad
TERM
Térmico
IMU
IMU
VÍDEO
Vídeo
Alineamiento por transitividad (línea punteada): ImageBind (2023) aprende el espacio usando solo los 5 tipos de pares que incluyen imagen. El modelo nunca ve un par audio↔texto directo, pero como ambos están alineados con imagen, quedan alineados entre sí.
Una consulta textual puede recuperar audio. Una imagen puede recuperar profundidad o térmico. Todas las modalidades quedan conectadas sin haberlo entrenado explícitamente.
CLIP / Par imagen-texto
Alineamiento binario
Solo recuperación imagen↔texto
N modalidades → N(N−1)/2 pares para conectarlas todas
2 modalidades conectadas
TEXTO
IMAGEN
pares necesarios para N=6
N(N−1)/2 = 15
ImageBind / Gemini Embedding 2
Alineamiento nativo multimodal
Recuperación cruzada entre cualquier par de modalidades
N modalidades → N pares (todos a través del ancla)
6+ modalidades conectadas
Gemini Embedding 2 (2026): texto, imagen, vídeo, audio y documentos como primitiva nativa
TEXTO
IMAGEN
AUDIO
PROF
VÍDEO
IMU
pares necesarios para N=6
N = 6
Nota: La asimetría en disponibilidad de datos explica la asimetría de capacidades. Los modelos comprenden imágenes mejor que audio, y audio mejor que documentos con layout complejo, porque los pares de entrenamiento de alta calidad son mucho más abundantes para imagen que para las otras modalidades.
Ver explicación y fuentes →
Siguiente paso

Del visual al modelo mental completo.

Cuando la intuición esté clara, continúa con la serie para revisar arquitectura, evidencia, referencias y límites.

Explorar todas las series →
Ver
Manipular
Profundizar