말씀선집 GraphRAG 연구/평가 지표 - MRR

현 아카이브
Admin (토론 | 기여)님의 2026년 8월 5일 (수) 12:03 판 (MRR 검색 평가 지표 문서 등록)
(차이) ← 이전 판 | 최신판 (차이) | 다음 판 → (차이)
둘러보기로 이동 검색으로 이동

MRR (Mean Reciprocal Rank)

분야: 정보검색(IR) · RAG 검색 평가
한 줄 정의: 각 질문에서 처음 등장한 관련 근거의 순위 역수를 평균낸 값이다.
관련 문서: 말씀선집 GraphRAG 연구 · Recall@K · nDCG

1. 무엇을 측정하는가

MRR은 Mean Reciprocal Rank의 약자다. 질문마다 첫 번째 관련 결과가 몇 위에 나왔는지를 보고, 그 순위의 역수 <math>1/rank</math>를 평균낸다. 1위면 1.0, 2위면 0.5, 3위면 약 0.333이며, 평가 범위 안에 관련 결과가 없으면 0이다. 값의 범위는 0부터 1까지이고 높을수록 좋다.

<math>MRR = \frac{1}{|Q|}\sum_{q \in Q}\frac{1}{rank_q}</math>

  • <math>Q</math>: 평가 질문 집합
  • <math>rank_q</math>: 질문 <math>q</math>에서 처음 관련 결과가 나타난 순위

2. 계산 예시

세 질문에서 첫 관련 근거의 순위가 각각 1위, 2위, 상위 5개 안에 없음이라면 MRR은 <math>(1 + 1/2 + 0)/3 = 0.5</math>이다. 즉 이 시스템은 어떤 질문에서는 즉시 근거를 찾지만, 다른 질문에서는 상위 결과에서 찾지 못했다는 뜻이다.

MRR은 사용자가 보통 첫 번째 또는 몇 개의 결과만 확인하는 검색 환경에 특히 직관적이다. RAG에서도 생성 모델에 넣는 문단 수가 제한되어 있을 때, 첫 근거를 앞쪽에 배치하는 성능을 볼 수 있다.

3. 말씀선집 GraphRAG 적용

말씀선집 GraphRAG에서는 질문별로 직접 인용 가능한 핵심 근거의 기준을 먼저 정해야 한다. 예를 들어 “특정 용어가 어느 강연에서 어떤 뜻으로 설명되는가”라는 질문은 해당 뜻을 명시한 문단을 관련 결과로 판정할 수 있다. MRR이 높으면 목회자·연구자가 검색 결과의 첫 부분에서 직접 확인할 수 있는 원문 근거를 더 빨리 만날 가능성이 높다.

BM25, 벡터 RAG, Hybrid RAG, GraphRAG를 비교할 때에는 다음을 함께 공개한다.

  • 질문 수와 질문 유형(사실 확인·개념 관계·시대 변화·전역 주제)
  • ‘관련’ 판정 기준과 정답 근거의 문단 단위
  • 검색 상한 K 및 동점 처리 규칙
  • 각 질문 유형별 MRR과 전체 평균

4. 해석과 한계

MRR은 첫 관련 결과 하나만 본다. 첫 번째 근거가 1위에 있으면, 나머지 근거가 전혀 검색되지 않아도 그 질문의 점수는 1.0이다. 따라서 여러 문단을 함께 읽어야 하는 복합 질문, 다중 홉 질문, 시대별 변화 질문에서는 MRR만으로 충분하지 않다.

  • 근거를 얼마나 빠짐없이 회수하는지는 Recall@K를 함께 본다.
  • 1위·2위·3위 결과의 근거 강도가 서로 다를 때의 순위 품질은 nDCG로 본다.
  • 답변의 해석 타당성과 인용 정확도는 사람 검수로 평가한다.

5. 운영 원칙

  1. ‘관련’은 단순 키워드 일치가 아니라 질문에 답할 수 있는 원문 근거인지로 판정한다.
  2. 동일 내용의 중복 청크가 여러 순위를 차지하면 첫 결과만 좋아 보일 수 있으므로 중복 제거 정책을 명시한다.
  3. 관련 근거가 없는 질문을 평가셋에 포함할 경우, MRR 산정과 별도로 ‘적절한 답변 보류율’을 보고한다.
  4. 평균만 제시하지 말고, 1위·상위 3위·미검색 질문의 비율과 실패 사례를 함께 제시한다.

참고자료

  • Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to Information Retrieval, 8장. 온라인 원문