Quantization reduce bytes por parámetro; tensor y pipeline parallelism reparten cómputo y memoria. Cada elección mueve memoria, calidad, comunicación y latencia.
Los enlaces con ?t= abren el vídeo en un segundo concreto.
Resumen del vídeo
Las ideas que debes retener
01
Cuantización no significa que todo el modelo tenga la misma precisión
La notación habitual ya contiene información importante.
02
La operación básica introduce error de representación
En una cuantización simétrica sencilla podemos escribir:
03
Weight-only y weight+activation atacan cuellos distintos