Mide el ranking que recuperas, no solo la respuesta final.
Manipula k, el umbral de relevancia y la profundidad de reranking sobre un ranking sintético visible. En paralelo, cambia chunk size y solape para ver cuánto material duplicas en el índice sin fingir que ese coste predice por sí solo la calidad semántica.
Separación deliberada: el panel de chunking calcula tamaño del índice y duplicación textual. No convierte chunk size u overlap en una supuesta mejora de relevancia. Para demostrar una mejora necesitas ejecutar el retriever sobre qrels reales.
Cada métrica responde una pregunta distinta.
Precision@k pregunta qué proporción de los primeros k resultados supera tu umbral de relevancia. Recall@k pregunta qué fracción de todos los relevantes conocidos consiguió recuperar ese top-k.
MRR@k solo depende de la posición del primer resultado relevante. Es útil cuando basta con encontrar una buena evidencia pronto, pero no distingue entre rankings excelentes y mediocres después de ese primer acierto.
nDCG@k admite relevancia graduada. Aquí se usa ganancia 2^rel − 1 y descuento logarítmico por posición, dividido por el DCG ideal del mismo conjunto de juicios.
Reranking. El laboratorio aplica un segundo score únicamente al prefijo que marques. Eso hace visible un patrón habitual: un retriever barato genera candidatos y un reranker más caro intenta mejorar el orden sin rescatar documentos que quedaron fuera del candidate set.
Chunking. El stride es chunk_size − overlap. Las ventanas solapadas aumentan el número de tokens indexados; esa redundancia puede ayudar a no cortar evidencia en un borde, pero también aumenta almacenamiento y candidatos redundantes. El laboratorio calcula esa huella exactamente para el corpus configurado y deja la calidad como una medición separada.
Juicios incompletos. Recall requiere conocer cuántos resultados relevantes existen. Si tus qrels son parciales, el denominador también lo es; no interpretes una cifra alta como cobertura absoluta del conocimiento.
Fuentes: Karpukhin et al. (DPR, EMNLP 2020), Lewis et al. (RAG, 2020), Thakur et al. (BEIR, 2021) y Järvelin & Kekäläinen (2002).