Todos los vídeos Multimodalidad 0:52

Alineamiento de pares a interacciones multimodales

Cómo aprende un modelo que señales distintas describen lo mismo y por qué los datos determinan la robustez del alineamiento multimodal.

Los enlaces con ?t= abren el vídeo en un segundo concreto.

Resumen del vídeo

Las ideas que debes retener

01

1. Pares imagen-texto: la base y sus límites

El punto de partida es el más sencillo conceptualmente: pares de imagen y texto que van juntos. Una fotografía con su pie de foto, una imagen de producto acompañada de su descripción, un…

02

2. Más allá del par: alineamiento de múltiples modalidades

Una de las observaciones más importantes de la última etapa del campo es que el alineamiento no necesita estar anclado en imagen-texto para funcionar. ImageBind lo demostró de forma…

03

3. Instrucción visual: el siguiente nivel

Los pares imagen-texto (y sus extensiones a otras modalidades) entrenan representaciones, pero no entrenan al modelo para seguir instrucciones. Para que un sistema pueda responder a "¿qué…