---
title: Quantization, paralelismo y trade-offs
seo_title: Quantization, paralelismo y trade-offs en vídeo
description: Quantization reduce bytes por parámetro; tensor y pipeline parallelism reparten cómputo y memoria. Cada elección mueve memoria, calidad, comunicación y latencia.
keywords: LLM quantization, tensor parallelism, pipeline parallelism, expert parallelism, context parallelism, FP8, INT4, AWQ, GPTQ
date: '2026-09-12T00:00:00+00:00'
robots: index,follow,max-snippet:-1,max-image-preview:large,max-video-preview:-1
hide:
- toc
- navigation
video_watch_page: true
---


<div class="s5-video-watch" data-s5-video-watch data-video-id="videos-series-llm-inference-engineering-economics-03-quantization-parallelism-memory-quality-tradeoffs-md">
  <header class="s5-video-watch__header">
    <div class="s5-video-watch__crumbs">
      <a href="/videos/">Todos los vídeos</a>
      <span>Otros temas</span>
      <span>0:36</span>
    </div>
    <h1>Quantization, paralelismo y trade-offs</h1>
    <p>Quantization reduce bytes por parámetro; tensor y pipeline parallelism reparten cómputo y memoria. Cada elección mueve memoria, calidad, comunicación y latencia.</p>
  </header>

  <div class="s5-video-watch__player">
    <video controls crossorigin="anonymous" preload="metadata" poster="/series/llm-inference-engineering-economics/03-quantization-parallelism-memory-quality-tradeoffs.jpg" playsinline data-s5-watch-player>
      <source src="/series/llm-inference-engineering-economics/03-quantization-parallelism-memory-quality-tradeoffs.mp4" type="video/mp4">
      
      Tu navegador no soporta el elemento de vídeo.
    </video>
    <p>Los enlaces con <code>?t=</code> abren el vídeo en un segundo concreto.</p>
  </div>

  <section class="s5-video-watch__summary" aria-labelledby="video-summary-title">
    <div class="s5-video-watch__section-head">
      <span class="s5-eyebrow">Resumen del vídeo</span>
      <h2 id="video-summary-title">Las ideas que debes retener</h2>
    </div>
    <div class="s5-video-watch__snippet-grid">
      
      <article>
        <span>01</span>
        <h2>Cuantización no significa que todo el modelo tenga la misma precisión</h2>
        <p>La notación habitual ya contiene información importante.</p>
      </article>


      <article>
        <span>02</span>
        <h2>La operación básica introduce error de representación</h2>
        <p>En una cuantización simétrica sencilla podemos escribir:</p>
      </article>


      <article>
        <span>03</span>
        <h2>Weight-only y weight+activation atacan cuellos distintos</h2>
        
      </article>

    </div>
  </section>

  
  <section class="s5-video-watch__chapters" aria-labelledby="video-chapters-title">
    <div>
      <span class="s5-eyebrow">Momentos clave</span>
      <h2 id="video-chapters-title">Ve directamente a una sección</h2>
    </div>
    <ol><li><a href="?t=0" data-s5-video-seek="0"><time>0:00</time><span>Menos bits reducen memoria y ancho de banda</span></a></li>
<li><a href="?t=12" data-s5-video-seek="12"><time>0:12</time><span>Paralelismo reparte el modelo entre dispositivos</span></a></li>
<li><a href="?t=24" data-s5-video-seek="24"><time>0:24</time><span>Optimizar una métrica desplaza otras</span></a></li></ol>
  </section>

  

  <aside class="s5-video-watch__source">
    <div>
      <span class="s5-eyebrow">Contexto y evidencia</span>
      <h2>Continúa con el artículo completo</h2>
      <p>El capítulo desarrolla el mecanismo, las fuentes primarias, los límites y las conexiones con el resto de la serie.</p>
    </div>
    <a class="s5-video-watch__source-link" href="https://5sigmas.com/series/llm-inference-engineering-economics/03-quantization-parallelism-memory-quality-tradeoffs/">Leer el artículo →</a>
  </aside>

  <section class="s5-video-watch__related" aria-labelledby="related-videos-title">
    <div class="s5-video-watch__section-head">
      <span class="s5-eyebrow">Siguiente paso</span>
      <h2 id="related-videos-title">Vídeos relacionados</h2>
    </div>
    <div class="s5-video-watch__related-grid">
      
<article>
  <a href="https://5sigmas.com/videos/series/evaluating-ai-systems-production/06-observability-failure-taxonomies-production-eval-repair-feedback-loops/">
    <img src="https://5sigmas.com/series/evaluating-ai-systems-production/06-observability-failure-taxonomies-production-eval-repair-feedback-loops.jpg" alt="" loading="lazy" width="1280" height="720">
    <span>Otros temas · 0:36</span>
    <strong>Observabilidad, taxonomías de fallos y feedback loops</strong>
  </a>
</article>


<article>
  <a href="https://5sigmas.com/videos/series/evaluating-ai-systems-production/05-online-evaluation-shadow-canary-ab-guardrails-regression-gates/">
    <img src="https://5sigmas.com/series/evaluating-ai-systems-production/05-online-evaluation-shadow-canary-ab-guardrails-regression-gates.jpg" alt="" loading="lazy" width="1280" height="720">
    <span>Otros temas · 0:36</span>
    <strong>Evaluación online: shadow, canary, A/B y regression gates</strong>
  </a>
</article>


<article>
  <a href="https://5sigmas.com/videos/series/evaluating-ai-systems-production/04-evaluacion-trayectorias-agentes-tools-exito-eficiencia-recuperacion-policy/">
    <img src="https://5sigmas.com/series/evaluating-ai-systems-production/04-evaluacion-trayectorias-agentes-tools-exito-eficiencia-recuperacion-policy.jpg" alt="" loading="lazy" width="1280" height="720">
    <span>Otros temas · 0:36</span>
    <strong>Trayectorias de agentes: éxito, eficiencia, recovery y policy</strong>
  </a>
</article>

    </div>
  </section>
</div>
