Todos los vídeos Otros temas 0:36

Quantization, paralelismo y trade-offs

Quantization reduce bytes por parámetro; tensor y pipeline parallelism reparten cómputo y memoria. Cada elección mueve memoria, calidad, comunicación y latencia.

Los enlaces con ?t= abren el vídeo en un segundo concreto.

Resumen del vídeo

Las ideas que debes retener

01

Cuantización no significa que todo el modelo tenga la misma precisión

La notación habitual ya contiene información importante.

02

La operación básica introduce error de representación

En una cuantización simétrica sencilla podemos escribir:

03

Weight-only y weight+activation atacan cuellos distintos

Momentos clave

Ve directamente a una sección

  1. Menos bits reducen memoria y ancho de banda
  2. Paralelismo reparte el modelo entre dispositivos
  3. Optimizar una métrica desplaza otras