Eval sets: curación, hard negatives, leakage y versionado
Un eval set fiable conserva provenance, separa bancos por función y congela una release; hard pairs y canales de leakage distintos prueban fallos distintos sin mutar la comparación.
Los enlaces con ?t= abren el vídeo en un segundo concreto.
Resumen del vídeo
Las ideas que debes retener
01
El objeto correcto: una versión del eval, no «el dataset»
Representemos una release de evaluación como:
02
La unidad mínima debe poder auditarse
Un caso debería permitir reconstruir, al menos:
03
Empieza por una hipótesis de cobertura
«Representativo» no significa «aleatorio» por defecto.