---
title: Routing, fallback, caching y serving adaptativo
seo_title: Routing, fallback, caching y serving adaptativo en vídeo
description: Un router asigna cada request según capacidad, calidad, coste y latencia; cache y fallback cambian la ruta sin eliminar verificación ni límites de política.
keywords: model routing, LLM routing, fallback, response cache, semantic cache, workload-aware serving, inference gateway, KV-aware routing
date: '2026-09-12T00:00:00+00:00'
robots: index,follow,max-snippet:-1,max-image-preview:large,max-video-preview:-1
hide:
- toc
- navigation
video_watch_page: true
---


<div class="s5-video-watch" data-s5-video-watch data-video-id="videos-series-llm-inference-engineering-economics-05-model-routing-fallback-caching-workload-aware-serving-md">
  <header class="s5-video-watch__header">
    <div class="s5-video-watch__crumbs">
      <a href="/videos/">Todos los vídeos</a>
      <span>Otros temas</span>
      <span>0:36</span>
    </div>
    <h1>Routing, fallback, caching y serving adaptativo</h1>
    <p>Un router asigna cada request según capacidad, calidad, coste y latencia; cache y fallback cambian la ruta sin eliminar verificación ni límites de política.</p>
  </header>

  <div class="s5-video-watch__player">
    <video controls crossorigin="anonymous" preload="metadata" poster="/series/llm-inference-engineering-economics/05-model-routing-fallback-caching-workload-aware-serving.jpg" playsinline data-s5-watch-player>
      <source src="/series/llm-inference-engineering-economics/05-model-routing-fallback-caching-workload-aware-serving.mp4" type="video/mp4">
      
      Tu navegador no soporta el elemento de vídeo.
    </video>
    <p>Los enlaces con <code>?t=</code> abren el vídeo en un segundo concreto.</p>
  </div>

  <section class="s5-video-watch__summary" aria-labelledby="video-summary-title">
    <div class="s5-video-watch__section-head">
      <span class="s5-eyebrow">Resumen del vídeo</span>
      <h2 id="video-summary-title">Las ideas que debes retener</h2>
    </div>
    <div class="s5-video-watch__snippet-grid">
      
      <article>
        <span>01</span>
        <h2>La política empieza por lo que no puede elegir</h2>
        <p>Antes de optimizar calidad, coste o latencia, una petición necesita un conjunto de candidatos elegibles.</p>
      </article>


      <article>
        <span>02</span>
        <h2>Model routing elige antes del primer intento</h2>
        <p>Con E(x) ya filtrado, el router puede elegir el candidato que maximiza una utilidad esperada. Una forma conceptual —no un estándar— es:</p>
      </article>


      <article>
        <span>03</span>
        <h2>Routing estático, reglas y routers aprendidos resuelven problemas distintos</h2>
        
      </article>

    </div>
  </section>

  
  <section class="s5-video-watch__chapters" aria-labelledby="video-chapters-title">
    <div>
      <span class="s5-eyebrow">Momentos clave</span>
      <h2 id="video-chapters-title">Ve directamente a una sección</h2>
    </div>
    <ol><li><a href="?t=0" data-s5-video-seek="0"><time>0:00</time><span>Routing separa workloads antes de servir</span></a></li>
<li><a href="?t=12" data-s5-video-seek="12"><time>0:12</time><span>Un cache hit evita trabajo cuando la clave es válida</span></a></li>
<li><a href="?t=24" data-s5-video-seek="24"><time>0:24</time><span>Fallback recupera el servicio bajo fallo o saturación</span></a></li></ol>
  </section>

  

  <aside class="s5-video-watch__source">
    <div>
      <span class="s5-eyebrow">Contexto y evidencia</span>
      <h2>Continúa con el artículo completo</h2>
      <p>El capítulo desarrolla el mecanismo, las fuentes primarias, los límites y las conexiones con el resto de la serie.</p>
    </div>
    <a class="s5-video-watch__source-link" href="https://5sigmas.com/series/llm-inference-engineering-economics/05-model-routing-fallback-caching-workload-aware-serving/">Leer el artículo →</a>
  </aside>

  <section class="s5-video-watch__related" aria-labelledby="related-videos-title">
    <div class="s5-video-watch__section-head">
      <span class="s5-eyebrow">Siguiente paso</span>
      <h2 id="related-videos-title">Vídeos relacionados</h2>
    </div>
    <div class="s5-video-watch__related-grid">
      
<article>
  <a href="https://5sigmas.com/videos/series/evaluating-ai-systems-production/06-observability-failure-taxonomies-production-eval-repair-feedback-loops/">
    <img src="https://5sigmas.com/series/evaluating-ai-systems-production/06-observability-failure-taxonomies-production-eval-repair-feedback-loops.jpg" alt="" loading="lazy" width="1280" height="720">
    <span>Otros temas · 0:36</span>
    <strong>Observabilidad, taxonomías de fallos y feedback loops</strong>
  </a>
</article>


<article>
  <a href="https://5sigmas.com/videos/series/evaluating-ai-systems-production/05-online-evaluation-shadow-canary-ab-guardrails-regression-gates/">
    <img src="https://5sigmas.com/series/evaluating-ai-systems-production/05-online-evaluation-shadow-canary-ab-guardrails-regression-gates.jpg" alt="" loading="lazy" width="1280" height="720">
    <span>Otros temas · 0:36</span>
    <strong>Evaluación online: shadow, canary, A/B y regression gates</strong>
  </a>
</article>


<article>
  <a href="https://5sigmas.com/videos/series/evaluating-ai-systems-production/04-evaluacion-trayectorias-agentes-tools-exito-eficiencia-recuperacion-policy/">
    <img src="https://5sigmas.com/series/evaluating-ai-systems-production/04-evaluacion-trayectorias-agentes-tools-exito-eficiencia-recuperacion-policy.jpg" alt="" loading="lazy" width="1280" height="720">
    <span>Otros temas · 0:36</span>
    <strong>Trayectorias de agentes: éxito, eficiencia, recovery y policy</strong>
  </a>
</article>

    </div>
  </section>
</div>
