Todos los vídeos Otros temas 0:36

Benchmarking: coste, throughput, latencia y energía

Un benchmark de inferencia sólo es comparable si fija workload, frontera de medida y hardware, y reporta distribución de latencia, throughput útil, coste y energía.

Los enlaces con ?t= abren el vídeo en un segundo concreto.

Resumen del vídeo

Las ideas que debes retener

01

Un benchmark es un protocolo, no un escalar

Para que un resultado sea interpretable necesitamos fijar, como mínimo, un contrato parecido a:

02

El workload debe parecerse al problema que quieres resolver

Una media de 512 tokens de entrada y 128 de salida no sustituye a una distribución.

03

Request rate y concurrencia no describen la misma carga

Un test con concurrency=64 suele operar como un loop cerrado: cuando una request acaba, otra ocupa su slot. Un test con una tasa de llegada fija o estocástica puede ser abierto: las nuevas…

Momentos clave

Ve directamente a una sección

  1. El workload define qué se está midiendo
  2. Una frontera común hace comparables las métricas
  3. Aceptar requiere SLO, coste y restricciones juntos