Herramientas · RAG · 08

Localiza el fallo: recuperación, fidelidad, corrección o cobertura.

Etiqueta un conjunto sintético de contextos y afirmaciones para ver cómo cambia cada dimensión de evaluación por separado. El objetivo no es producir un único número mágico, sino distinguir si el sistema recupera mala evidencia, inventa sobre evidencia buena, responde incorrectamente o deja hechos importantes fuera.

Contexto¿la evidencia recuperada es relevante?
Fidelidad¿cada afirmación está respaldada?
Respuesta¿es correcta y cubre la referencia?

Referencia y cobertura

La cobertura mide completitud, no fidelidad.

Pesos del score compuesto

Mientras al menos un peso sea mayor que cero, los pesos se normalizan automáticamente. Si todos son cero, el score compuesto se desactiva. Es una ayuda de decisión configurable, no una métrica estándar ni una reproducción de RAGAS/ARES.

Relevancia del contexto
Fidelidad
Corrección
Cobertura de referencia
Contextos relevantes
Afirmaciones respaldadas
Afirmaciones correctas
Hechos cubiertos
Score ponderado
Diagnóstico
Qué mirar después

Evidencia recuperada

Marca si cada pasaje es relevante para la pregunta.

6 pasajes sintéticos
Respuesta generada

Separa respaldo por evidencia de corrección frente a referencia.

5 afirmaciones sintéticas
Método

No confundas “respuesta buena” con una única causa.

Relevancia del contexto es aquí una proporción determinista de pasajes manualmente etiquetados como relevantes. Sirve para aislar la calidad del material que llega al generador.

context_relevance = contextos_relevantes / contextos_recuperados

Fidelidad cuenta qué proporción de afirmaciones de la respuesta está respaldada por el contexto recuperado. Una afirmación puede ser verdadera en el mundo y aun así ser infiel al contexto si la evidencia suministrada no la soporta.

faithfulness = afirmaciones_respaldadas / afirmaciones_de_la_respuesta

Corrección usa un juicio separado frente a una referencia o criterio externo. Eso evita tratar “está respaldado por el contexto” y “es correcto” como sinónimos.

answer_correctness = afirmaciones_correctas / afirmaciones_de_la_respuesta

Cobertura mide qué fracción de los hechos de referencia aparece en la respuesta. Una respuesta corta puede ser totalmente fiel y correcta, pero incompleta.

reference_coverage = hechos_cubiertos / hechos_de_referencia

Incertidumbre. Cada proporción muestra un intervalo Wilson del 95% sobre las unidades etiquetadas. Con cinco afirmaciones, un 80% no tiene la misma estabilidad que un 80% calculado sobre miles. Solo debe interpretarse como intervalo estadístico si las unidades pueden tratarse como una muestra aproximadamente independiente y representativa; en este escenario sintético sirve para visualizar la fragilidad de muestras pequeñas. No calibra errores del anotador ni de un judge.

Diagnóstico. El aviso usa umbrales didácticos explícitos: relevancia del contexto < 50% y fidelidad, corrección o cobertura < 70%. Si fallan varias dimensiones, lo indica como fallo múltiple en vez de elegir una causa arbitrariamente. Estos umbrales no son gates recomendados para producción.

Score compuesto. Si necesitas ordenar configuraciones, puedes combinar las cuatro dimensiones con pesos explícitos. El playground normaliza los pesos y nunca presenta ese score como estándar. Si el objetivo de negocio exige fidelidad casi perfecta, debes reflejarlo en el peso o, mejor, usar un gate duro.

No es un LLM judge. RAGAS y ARES automatizan parte de la evaluación mediante modelos/jueces. Aquí las etiquetas son visibles y manipulables para estudiar causalmente qué dimensión cambia. Para evaluar producción necesitas un dataset representativo, criterios de anotación, calibración del evaluador y validación humana.

Fuentes: Es et al., RAGAS (EACL 2024) y Saad-Falcon et al., ARES (2023/2024). Ambos trabajos separan dimensiones como relevancia del contexto y fidelidad; ARES además enfatiza evaluación calibrada con anotaciones humanas.