---
title: Arquitecturas de sistemas multimodales
seo_title: Arquitecturas de sistemas multimodales en vídeo
description: Cuatro familias de arquitectura multimodal, sus diferencias en calidad, coste y latencia, y cuándo conviene cada forma de combinar modalidades.
keywords: arquitecturas multimodales, fusión temprana tardía, ViT, encoder multimodal, decoder multimodal, LLaVA, GPT-4V, arquitectura IA generativa, visión transformer
date: '2026-04-02T00:00:00+00:00'
robots: index,follow,max-snippet:-1,max-image-preview:large,max-video-preview:-1
hide:
- toc
- navigation
video_watch_page: true
---


<div class="s5-video-watch" data-s5-video-watch data-video-id="videos-series-multimodalidad-iag-03-arquitecturas-md">
  <header class="s5-video-watch__header">
    <div class="s5-video-watch__crumbs">
      <a href="/videos/">Todos los vídeos</a>
      <span>Multimodalidad</span>
      <span>0:52</span>
    </div>
    <h1>Arquitecturas de sistemas multimodales</h1>
    <p>Cuatro familias de arquitectura multimodal, sus diferencias en calidad, coste y latencia, y cuándo conviene cada forma de combinar modalidades.</p>
  </header>

  <div class="s5-video-watch__player">
    <video controls crossorigin="anonymous" preload="metadata" poster="/series/multimodalidad-iag/03-arquitecturas.jpg" playsinline data-s5-watch-player>
      <source src="/series/multimodalidad-iag/03-arquitecturas.mp4" type="video/mp4">
      
      Tu navegador no soporta el elemento de vídeo.
    </video>
    <p>Los enlaces con <code>?t=</code> abren el vídeo en un segundo concreto.</p>
  </div>

  <section class="s5-video-watch__summary" aria-labelledby="video-summary-title">
    <div class="s5-video-watch__section-head">
      <span class="s5-eyebrow">Resumen del vídeo</span>
      <h2 id="video-summary-title">Las ideas que debes retener</h2>
    </div>
    <div class="s5-video-watch__snippet-grid">
      
      <article>
        <span>01</span>
        <h2>1. Encoder visual + conector + modelo de lenguaje</h2>
        <p>El enfoque más extendido en los últimos años consiste en tres componentes encadenados: un encoder visual que procesa la imagen y produce una representación de alta dimensión, un módulo de…</p>
      </article>


      <article>
        <span>02</span>
        <h2>2. Fusión mediante cross-attention</h2>
        <p>Flamingo, publicado por DeepMind en 2022, introdujo un enfoque diferente: en lugar de procesar la imagen antes del texto y pasar su representación como input, insertó capas de…</p>
      </article>


      <article>
        <span>03</span>
        <h2>3. Tokenización nativa multimodal</h2>
        <p>El tercer enfoque es el más radical: en lugar de conectar un encoder visual con un modelo de lenguaje mediante algún tipo de conector, el sistema discretiza las imágenes o el audio en…</p>
      </article>

    </div>
  </section>

  
  

  <aside class="s5-video-watch__source">
    <div>
      <span class="s5-eyebrow">Contexto y evidencia</span>
      <h2>Continúa con el artículo completo</h2>
      <p>El capítulo desarrolla el mecanismo, las fuentes primarias, los límites y las conexiones con el resto de la serie.</p>
    </div>
    <a class="s5-video-watch__source-link" href="https://5sigmas.com/series/multimodalidad-iag/03-arquitecturas/">Leer el artículo →</a>
  </aside>

  <section class="s5-video-watch__related" aria-labelledby="related-videos-title">
    <div class="s5-video-watch__section-head">
      <span class="s5-eyebrow">Siguiente paso</span>
      <h2 id="related-videos-title">Vídeos relacionados</h2>
    </div>
    <div class="s5-video-watch__related-grid">
      
<article>
  <a href="https://5sigmas.com/videos/series/multimodalidad-iag/05-riesgos/">
    <img src="https://5sigmas.com/series/multimodalidad-iag/05-riesgos.jpg" alt="" loading="lazy" width="1280" height="720">
    <span>Multimodalidad · 0:52</span>
    <strong>Riesgos de seguridad en sistemas multimodales</strong>
  </a>
</article>


<article>
  <a href="https://5sigmas.com/videos/series/multimodalidad-iag/04-evaluacion/">
    <img src="https://5sigmas.com/series/multimodalidad-iag/04-evaluacion.jpg" alt="" loading="lazy" width="1280" height="720">
    <span>Multimodalidad · 1:14</span>
    <strong>Evaluación de sistemas multimodales</strong>
  </a>
</article>


<article>
  <a href="https://5sigmas.com/videos/series/multimodalidad-iag/02-alineamiento/">
    <img src="https://5sigmas.com/series/multimodalidad-iag/02-alineamiento.jpg" alt="" loading="lazy" width="1280" height="720">
    <span>Multimodalidad · 0:52</span>
    <strong>Alineamiento de pares a interacciones multimodales</strong>
  </a>
</article>

    </div>
  </section>
</div>
