Localiza el fallo: recuperación, fidelidad, corrección o cobertura.
Etiqueta un conjunto sintético de contextos y afirmaciones para ver cómo cambia cada dimensión de evaluación por separado. El objetivo no es producir un único número mágico, sino distinguir si el sistema recupera mala evidencia, inventa sobre evidencia buena, responde incorrectamente o deja hechos importantes fuera.
—
—
Marca si cada pasaje es relevante para la pregunta.
Separa respaldo por evidencia de corrección frente a referencia.
No confundas “respuesta buena” con una única causa.
Relevancia del contexto es aquí una proporción determinista de pasajes manualmente etiquetados como relevantes. Sirve para aislar la calidad del material que llega al generador.
Fidelidad cuenta qué proporción de afirmaciones de la respuesta está respaldada por el contexto recuperado. Una afirmación puede ser verdadera en el mundo y aun así ser infiel al contexto si la evidencia suministrada no la soporta.
Corrección usa un juicio separado frente a una referencia o criterio externo. Eso evita tratar “está respaldado por el contexto” y “es correcto” como sinónimos.
Cobertura mide qué fracción de los hechos de referencia aparece en la respuesta. Una respuesta corta puede ser totalmente fiel y correcta, pero incompleta.
Incertidumbre. Cada proporción muestra un intervalo Wilson del 95% sobre las unidades etiquetadas. Con cinco afirmaciones, un 80% no tiene la misma estabilidad que un 80% calculado sobre miles. Solo debe interpretarse como intervalo estadístico si las unidades pueden tratarse como una muestra aproximadamente independiente y representativa; en este escenario sintético sirve para visualizar la fragilidad de muestras pequeñas. No calibra errores del anotador ni de un judge.
Diagnóstico. El aviso usa umbrales didácticos explícitos: relevancia del contexto < 50% y fidelidad, corrección o cobertura < 70%. Si fallan varias dimensiones, lo indica como fallo múltiple en vez de elegir una causa arbitrariamente. Estos umbrales no son gates recomendados para producción.
Score compuesto. Si necesitas ordenar configuraciones, puedes combinar las cuatro dimensiones con pesos explícitos. El playground normaliza los pesos y nunca presenta ese score como estándar. Si el objetivo de negocio exige fidelidad casi perfecta, debes reflejarlo en el peso o, mejor, usar un gate duro.
No es un LLM judge. RAGAS y ARES automatizan parte de la evaluación mediante modelos/jueces. Aquí las etiquetas son visibles y manipulables para estudiar causalmente qué dimensión cambia. Para evaluar producción necesitas un dataset representativo, criterios de anotación, calibración del evaluador y validación humana.
Fuentes: Es et al., RAGAS (EACL 2024) y Saad-Falcon et al., ARES (2023/2024). Ambos trabajos separan dimensiones como relevancia del contexto y fidelidad; ARES además enfatiza evaluación calibrada con anotaciones humanas.