Benchmarking: coste, throughput, latencia y energía
Un benchmark de inferencia sólo es comparable si fija workload, frontera de medida y hardware, y reporta distribución de latencia, throughput útil, coste y energía.
Los enlaces con ?t= abren el vídeo en un segundo concreto.
Resumen del vídeo
Las ideas que debes retener
Un benchmark es un protocolo, no un escalar
Para que un resultado sea interpretable necesitamos fijar, como mínimo, un contrato parecido a:
El workload debe parecerse al problema que quieres resolver
Una media de 512 tokens de entrada y 128 de salida no sustituye a una distribución.
Request rate y concurrencia no describen la misma carga
Un test con concurrency=64 suele operar como un loop cerrado: cuando una request acaba, otra ocupa su slot. Un test con una tasa de llegada fija o estocástica puede ser abierto: las nuevas…
Momentos clave