Herramientas · RAG · 07

Mide el ranking que recuperas, no solo la respuesta final.

Manipula k, el umbral de relevancia y la profundidad de reranking sobre un ranking sintético visible. En paralelo, cambia chunk size y solape para ver cuánto material duplicas en el índice sin fingir que ese coste predice por sí solo la calidad semántica.

Precision@krelevantes recuperados ÷ k
Recall@krelevantes recuperados ÷ relevantes totales
nDCG@kganancia graduada con descuento por posición

Evaluación del ranking

0 mantiene el ranking inicial; un valor mayor reordena solo ese prefijo.
Recall necesita un denominador externo al top-k. Usa el total conocido para tu consulta.

Huella del chunking

Debe ser menor que el tamaño del chunk.
Precision@kpureza del top-k
Recall@kcobertura de relevantes conocidos
MRR@kposición del primer relevante
nDCG@korden + relevancia graduada
Relevantes dentro de k
Chunks estimados
Tokens indexados
Duplicación por solape
Stride
Lectura de métricas
Lectura de chunking

Separación deliberada: el panel de chunking calcula tamaño del índice y duplicación textual. No convierte chunk size u overlap en una supuesta mejora de relevancia. Para demostrar una mejora necesitas ejecutar el retriever sobre qrels reales.

los resultados dentro de k quedan resaltados
Método

Cada métrica responde una pregunta distinta.

Precision@k pregunta qué proporción de los primeros k resultados supera tu umbral de relevancia. Recall@k pregunta qué fracción de todos los relevantes conocidos consiguió recuperar ese top-k.

Precision@k = relevantes_en_top_k / k · Recall@k = relevantes_en_top_k / relevantes_totales

MRR@k solo depende de la posición del primer resultado relevante. Es útil cuando basta con encontrar una buena evidencia pronto, pero no distingue entre rankings excelentes y mediocres después de ese primer acierto.

MRR@k = 1 / rank_del_primer_relevante

nDCG@k admite relevancia graduada. Aquí se usa ganancia 2^rel − 1 y descuento logarítmico por posición, dividido por el DCG ideal del mismo conjunto de juicios.

DCG@k = Σ (2^relᵢ − 1) / log₂(i + 1) · nDCG@k = DCG@k / IDCG@k

Reranking. El laboratorio aplica un segundo score únicamente al prefijo que marques. Eso hace visible un patrón habitual: un retriever barato genera candidatos y un reranker más caro intenta mejorar el orden sin rescatar documentos que quedaron fuera del candidate set.

Chunking. El stride es chunk_size − overlap. Las ventanas solapadas aumentan el número de tokens indexados; esa redundancia puede ayudar a no cortar evidencia en un borde, pero también aumenta almacenamiento y candidatos redundantes. El laboratorio calcula esa huella exactamente para el corpus configurado y deja la calidad como una medición separada.

Juicios incompletos. Recall requiere conocer cuántos resultados relevantes existen. Si tus qrels son parciales, el denominador también lo es; no interpretes una cifra alta como cobertura absoluta del conocimiento.

Fuentes: Karpukhin et al. (DPR, EMNLP 2020), Lewis et al. (RAG, 2020), Thakur et al. (BEIR, 2021) y Järvelin & Kekäläinen (2002).