말씀선집 GraphRAG 연구/평가 지표 - Recall@K
Recall@K
분야: 정보검색(IR) · RAG 검색 평가
한 줄 정의: 정답 근거 전체 가운데 검색 결과 상위 K개 안에 찾아온 비율이다.
관련 문서: 말씀선집 GraphRAG 연구 · MRR · nDCG
1. 무엇을 측정하는가
Recall@K는 한 질문에 대해 미리 정한 관련 근거(relevant evidence) 전체 중 검색 상위 K개에 포함된 비율을 측정한다. RAG에서 이 지표는 “모델이 답변을 만들기 전에, 답의 근거가 될 원문을 충분히 가져왔는가”를 보는 기본 지표다. 값의 범위는 0부터 1까지이며, 1은 정답 근거를 모두 상위 K 안에 찾았다는 뜻이다.
<math>Recall@K(q) = \frac{|TopK(q) \cap G(q)|}{|G(q)|}</math>
- <math>q</math>: 평가 질문
- <math>TopK(q)</math>: 시스템이 질문 <math>q</math>에 대해 반환한 상위 K개 문단 또는 청크
- <math>G(q)</math>: 사람이 미리 정한 관련 근거 집합
2. 계산 예시
질문에 대한 정답 근거가 원문 문단 A·B·C 세 개이고, 시스템의 상위 5개 결과에 A만 포함되었다면 <math>Recall@5 = 1/3 = 0.333</math>이다. 상위 5개 중 A·B·C가 모두 있으면 1.000이다.
여기서 Hit@K와 혼동하지 않아야 한다. Hit@K는 관련 근거가 하나라도 상위 K에 있으면 1, 없으면 0으로 계산한다. 반면 Recall@K는 관련 근거가 여러 개인 복합 질문에서 얼마나 빠짐없이 가져왔는지를 측정한다.
3. 말씀선집 GraphRAG 적용
말씀선집 질의에서는 정답 근거를 단 하나로 고정하기보다 다음처럼 구분하는 편이 좋다.
- 핵심 근거: 답변의 직접 인용으로 반드시 필요한 문단
- 보조 근거: 시대·개념·사건 맥락을 보완하는 문단
- 대체 근거: 같은 내용을 다른 권·강연에서 명확히 설명한 문단
평가셋을 만들 때 질문마다 핵심 근거와 허용 가능한 대체 근거를 전문가가 지정하고, 모델별로 동일한 청크 단위·동일한 K·동일한 질문을 사용해야 한다. BM25, 벡터 RAG, Hybrid RAG, GraphRAG를 비교할 때 Recall@5와 Recall@10을 함께 보고하면, 적은 검색 결과에서도 근거를 놓치지 않는지와 K를 늘렸을 때 회수되는지를 구분할 수 있다.
4. 해석과 한계
Recall@K가 높으면 근거 누락 위험은 낮아지지만, 상위에 엉뚱한 결과가 많아도 높게 나올 수 있다. 또한 모든 관련 근거를 너무 넓게 지정하면 실제 사용자가 필요로 하지 않는 문단까지 정답으로 취급하게 된다. 따라서 Recall@K만으로 “좋은 RAG”라고 결론 내릴 수 없다.
- 상위 결과의 첫 근거가 얼마나 빠른지는 MRR로 본다.
- 여러 결과의 순위 품질과 근거 강도는 nDCG로 본다.
- 최종 답변은 인용 정확도, 맥락 충실성, 목회자 검수 가능성을 별도 평가한다.
5. 운영 원칙
- 청크 크기와 겹침 규칙을 먼저 고정한다. 청크가 작을수록 관련 근거 수가 늘어 Recall이 낮아질 수 있다.
- 답변 가능한 질문과 근거가 불충분해 답변을 보류해야 할 질문을 구분한다.
- 정답 근거 목록은 한 사람이 임의로 확정하지 말고, 최소 2인의 검수 또는 이견 기록 절차를 둔다.
- 값만 비교하지 말고, 누락된 근거가 핵심인지 보조인지 오류 사례를 함께 분석한다.
참고자료
- Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to Information Retrieval, 8장. 온라인 원문