말씀선집 GraphRAG 연구/평가 지표 - nDCG
nDCG (Normalized Discounted Cumulative Gain)
분야: 정보검색(IR) · RAG 검색 평가
한 줄 정의: 관련성의 강도와 순위를 함께 반영해, 이상적인 순위와 비교한 정규화 점수다.
관련 문서: 말씀선집 GraphRAG 연구 · Recall@K · MRR
1. 무엇을 측정하는가
nDCG는 Normalized Discounted Cumulative Gain의 약자다. 모든 관련 결과를 똑같이 보지 않고, 더 직접적이고 신뢰할 수 있는 근거에는 더 높은 관련성 등급을 주며, 그 근거가 뒤로 갈수록 점수를 할인한다. 계산한 점수를 같은 질문에서 가능한 이상적 순서(IDCG)로 나누므로, 값은 일반적으로 0부터 1 사이가 되고 1에 가까울수록 이상적인 순위에 가깝다.
<math>DCG@K = \sum_{i=1}^{K}\frac{2^{rel_i}-1}{\log_2(i+1)}</math>
<math>nDCG@K = \frac{DCG@K}{IDCG@K}</math>
- <math>rel_i</math>: i위 결과의 관련성 등급
- <math>IDCG@K</math>: 같은 결과들을 가장 좋은 순서로 배치했을 때의 DCG@K
2. 계산 예시
관련성 등급을 0~3으로 정하고, 상위 3개 결과의 등급이 3·0·2라면 DCG@3은 <math>7/\log_2(2) + 0/\log_2(3) + 3/\log_2(4) = 8.5</math>이다. 같은 세 결과를 이상적으로 3·2·0 순서로 놓은 IDCG@3은 약 8.893이므로 nDCG@3은 약 0.956이다. 높은 등급의 근거를 거의 올바른 앞 순위에 두었다는 뜻이다.
3. 말씀선집 GraphRAG 적용
말씀선집 RAG의 관련성 등급은 단순 주제 유사도가 아니라 원문 근거의 역할을 반영해야 한다. 예를 들어 다음 기준을 사전에 합의할 수 있다.
| 등급 | 판정 예시 |
|---|---|
| 3 | 질문에 직접 답하는 원문 문단이며 권·강연·페이지 출처가 명확함 |
| 2 | 답을 강하게 뒷받침하지만 일부 해석·연결이 더 필요함 |
| 1 | 주제는 관련되나 질문의 직접 근거로는 부족함 |
| 0 | 관련이 없거나 오해를 낳을 수 있음 |
nDCG@5와 nDCG@10은 GraphRAG가 단순히 관련 문단을 많이 찾는지를 넘어, 더 강한 근거를 앞에 배치하는지 평가하는 데 유용하다. 특히 같은 개념이 여러 시대와 상황에서 다른 강조점으로 나타나는 말씀선집에서는, 비슷한 문단보다 질문의 시기·대상·맥락에 직접 맞는 문단을 위에 놓는 능력이 중요하다.
4. 해석과 한계
nDCG는 등급 기준에 민감하다. 검수자마다 ‘직접 근거’와 ‘보조 근거’를 다르게 판단하면 숫자가 흔들릴 수 있다. 따라서 등급 정의, 판정 예시, 이견 조정 절차를 평가 전에 공개해야 한다. 또한 nDCG가 높아도 원문 인용이 정확한지, 답변이 그 근거를 과장하지 않는지는 별도 평가해야 한다.
5. 운영 원칙
- 등급 0~3의 정의와 실제 판정 예시를 평가 매뉴얼에 고정한다.
- 한 질문에 대해 최소 2인의 평가자가 독립 판정하고, 불일치는 합의 또는 이견 기록으로 처리한다.
- 동일한 원문을 잘게 나눈 중복 청크가 상위를 독점하지 않도록 중복·인접문단 정책을 명시한다.
- 전체 평균뿐 아니라 질문 유형별 nDCG와 낮은 점수의 대표 사례를 분석한다.
- 검색 지표와 별도로 출처 표기 정확도, 맥락 충실성, 목회자 활용성 평가를 실시한다.
참고자료
- Järvelin, K., & Kekäläinen, J. (2002). Cumulated gain-based evaluation of IR techniques. ACM Transactions on Information Systems, 20(4), 422–446. https://doi.org/10.1145/582415.582418
- Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to Information Retrieval, 8장. 온라인 원문