Todos los vídeos Otros temas 0:36

Eval sets: curación, hard negatives, leakage y versionado

Un eval set fiable conserva provenance, separa bancos por función y congela una release; hard pairs y canales de leakage distintos prueban fallos distintos sin mutar la comparación.

Los enlaces con ?t= abren el vídeo en un segundo concreto.

Resumen del vídeo

Las ideas que debes retener

01

El objeto correcto: una versión del eval, no «el dataset»

Representemos una release de evaluación como:

02

La unidad mínima debe poder auditarse

Un caso debería permitir reconstruir, al menos:

03

Empieza por una hipótesis de cobertura

«Representativo» no significa «aleatorio» por defecto.

Momentos clave

Ve directamente a una sección

  1. Provenance y grouping preceden al split
  2. Hard positive y hard negative cruzan una sola frontera
  3. La release se congela; fallos nuevos alimentan v+1