---
title: KV cache, jerarquía de memoria y continuous batching
seo_title: KV cache, jerarquía de memoria y continuous batching en vídeo
description: El KV cache intercambia memoria por menos cómputo repetido; paging y continuous batching coordinan capacidad, admisión y reutilización entre requests activos.
keywords: KV cache, PagedAttention, continuous batching, LLM serving, GPU memory, memory hierarchy, inference
date: '2026-09-12T00:00:00+00:00'
robots: index,follow,max-snippet:-1,max-image-preview:large,max-video-preview:-1
hide:
- toc
- navigation
video_watch_page: true
---


<div class="s5-video-watch" data-s5-video-watch data-video-id="videos-series-llm-inference-engineering-economics-02-kv-cache-memory-hierarchy-continuous-batching-pagedattention-md">
  <header class="s5-video-watch__header">
    <div class="s5-video-watch__crumbs">
      <a href="/videos/">Todos los vídeos</a>
      <span>Otros temas</span>
      <span>0:36</span>
    </div>
    <h1>KV cache, jerarquía de memoria y continuous batching</h1>
    <p>El KV cache intercambia memoria por menos cómputo repetido; paging y continuous batching coordinan capacidad, admisión y reutilización entre requests activos.</p>
  </header>

  <div class="s5-video-watch__player">
    <video controls crossorigin="anonymous" preload="metadata" poster="/series/llm-inference-engineering-economics/02-kv-cache-memory-hierarchy-continuous-batching-pagedattention.jpg" playsinline data-s5-watch-player>
      <source src="/series/llm-inference-engineering-economics/02-kv-cache-memory-hierarchy-continuous-batching-pagedattention.mp4" type="video/mp4">
      
      Tu navegador no soporta el elemento de vídeo.
    </video>
    <p>Los enlaces con <code>?t=</code> abren el vídeo en un segundo concreto.</p>
  </div>

  <section class="s5-video-watch__summary" aria-labelledby="video-summary-title">
    <div class="s5-video-watch__section-head">
      <span class="s5-eyebrow">Resumen del vídeo</span>
      <h2 id="video-summary-title">Las ideas que debes retener</h2>
    </div>
    <div class="s5-video-watch__snippet-grid">
      
      <article>
        <span>01</span>
        <h2>Qué guarda realmente el KV cache</h2>
        <p>En atención causal, cuando el modelo ya ha procesado un token, las proyecciones K y V de ese token no necesitan recalcularse desde cero en cada paso posterior. El runtime puede…</p>
      </article>


      <article>
        <span>02</span>
        <h2>Una fórmula útil para estimar memoria — con límites explícitos</h2>
        <p>Para un transformer autoregresivo de atención completa donde cada capa guarda K y V con forma estándar, una estimación del KV cache de una secuencia es:</p>
      </article>


      <article>
        <span>03</span>
        <h2>Ejemplo ilustrativo, no benchmark</h2>
        <p>Supongamos una arquitectura ficticia con:</p>
      </article>

    </div>
  </section>

  
  <section class="s5-video-watch__chapters" aria-labelledby="video-chapters-title">
    <div>
      <span class="s5-eyebrow">Momentos clave</span>
      <h2 id="video-chapters-title">Ve directamente a una sección</h2>
    </div>
    <ol><li><a href="?t=0" data-s5-video-seek="0"><time>0:00</time><span>El KV cache ocupa capacidad por secuencia</span></a></li>
<li><a href="?t=12" data-s5-video-seek="12"><time>0:12</time><span>Continuous batching recompone el batch en cada paso</span></a></li>
<li><a href="?t=24" data-s5-video-seek="24"><time>0:24</time><span>Paging convierte capacidad en páginas asignables</span></a></li></ol>
  </section>

  

  <aside class="s5-video-watch__source">
    <div>
      <span class="s5-eyebrow">Contexto y evidencia</span>
      <h2>Continúa con el artículo completo</h2>
      <p>El capítulo desarrolla el mecanismo, las fuentes primarias, los límites y las conexiones con el resto de la serie.</p>
    </div>
    <a class="s5-video-watch__source-link" href="https://5sigmas.com/series/llm-inference-engineering-economics/02-kv-cache-memory-hierarchy-continuous-batching-pagedattention/">Leer el artículo →</a>
  </aside>

  <section class="s5-video-watch__related" aria-labelledby="related-videos-title">
    <div class="s5-video-watch__section-head">
      <span class="s5-eyebrow">Siguiente paso</span>
      <h2 id="related-videos-title">Vídeos relacionados</h2>
    </div>
    <div class="s5-video-watch__related-grid">
      
<article>
  <a href="https://5sigmas.com/videos/series/evaluating-ai-systems-production/06-observability-failure-taxonomies-production-eval-repair-feedback-loops/">
    <img src="https://5sigmas.com/series/evaluating-ai-systems-production/06-observability-failure-taxonomies-production-eval-repair-feedback-loops.jpg" alt="" loading="lazy" width="1280" height="720">
    <span>Otros temas · 0:36</span>
    <strong>Observabilidad, taxonomías de fallos y feedback loops</strong>
  </a>
</article>


<article>
  <a href="https://5sigmas.com/videos/series/evaluating-ai-systems-production/05-online-evaluation-shadow-canary-ab-guardrails-regression-gates/">
    <img src="https://5sigmas.com/series/evaluating-ai-systems-production/05-online-evaluation-shadow-canary-ab-guardrails-regression-gates.jpg" alt="" loading="lazy" width="1280" height="720">
    <span>Otros temas · 0:36</span>
    <strong>Evaluación online: shadow, canary, A/B y regression gates</strong>
  </a>
</article>


<article>
  <a href="https://5sigmas.com/videos/series/evaluating-ai-systems-production/04-evaluacion-trayectorias-agentes-tools-exito-eficiencia-recuperacion-policy/">
    <img src="https://5sigmas.com/series/evaluating-ai-systems-production/04-evaluacion-trayectorias-agentes-tools-exito-eficiencia-recuperacion-policy.jpg" alt="" loading="lazy" width="1280" height="720">
    <span>Otros temas · 0:36</span>
    <strong>Trayectorias de agentes: éxito, eficiencia, recovery y policy</strong>
  </a>
</article>

    </div>
  </section>
</div>
