말씀선집 GraphRAG 연구/평가 지표 - nDCG 문서 원본 보기
←
말씀선집 GraphRAG 연구/평가 지표 - nDCG
둘러보기로 이동
검색으로 이동
문서 편집 권한이 없습니다. 다음 이유를 확인해주세요:
요청한 명령은 다음 권한을 가진 사용자에게 제한됩니다:
사용자
.
문서의 원본을 보거나 복사할 수 있습니다.
= nDCG (Normalized Discounted Cumulative Gain) = '''분야:''' 정보검색(IR) · RAG 검색 평가<br> '''한 줄 정의:''' 관련성의 강도와 순위를 함께 반영해, 이상적인 순위와 비교한 정규화 점수다.<br> '''관련 문서:''' [[말씀선집 GraphRAG 연구]] · [[말씀선집 GraphRAG 연구/평가 지표 - Recall@K|Recall@K]] · [[말씀선집 GraphRAG 연구/평가 지표 - MRR|MRR]] == 1. 무엇을 측정하는가 == nDCG는 '''Normalized Discounted Cumulative Gain'''의 약자다. 모든 관련 결과를 똑같이 보지 않고, 더 직접적이고 신뢰할 수 있는 근거에는 더 높은 관련성 등급을 주며, 그 근거가 뒤로 갈수록 점수를 할인한다. 계산한 점수를 같은 질문에서 가능한 이상적 순서(IDCG)로 나누므로, 값은 일반적으로 0부터 1 사이가 되고 1에 가까울수록 이상적인 순위에 가깝다. <math>DCG@K = \sum_{i=1}^{K}\frac{2^{rel_i}-1}{\log_2(i+1)}</math> <math>nDCG@K = \frac{DCG@K}{IDCG@K}</math> * <math>rel_i</math>: i위 결과의 관련성 등급 * <math>IDCG@K</math>: 같은 결과들을 가장 좋은 순서로 배치했을 때의 DCG@K == 2. 계산 예시 == 관련성 등급을 0~3으로 정하고, 상위 3개 결과의 등급이 3·0·2라면 DCG@3은 <math>7/\log_2(2) + 0/\log_2(3) + 3/\log_2(4) = 8.5</math>이다. 같은 세 결과를 이상적으로 3·2·0 순서로 놓은 IDCG@3은 약 8.893이므로 nDCG@3은 약 0.956이다. 높은 등급의 근거를 거의 올바른 앞 순위에 두었다는 뜻이다. == 3. 말씀선집 GraphRAG 적용 == 말씀선집 RAG의 관련성 등급은 단순 주제 유사도가 아니라 원문 근거의 역할을 반영해야 한다. 예를 들어 다음 기준을 사전에 합의할 수 있다. {| class="wikitable" ! 등급 !! 판정 예시 |- | 3 || 질문에 직접 답하는 원문 문단이며 권·강연·페이지 출처가 명확함 |- | 2 || 답을 강하게 뒷받침하지만 일부 해석·연결이 더 필요함 |- | 1 || 주제는 관련되나 질문의 직접 근거로는 부족함 |- | 0 || 관련이 없거나 오해를 낳을 수 있음 |} nDCG@5와 nDCG@10은 GraphRAG가 단순히 관련 문단을 많이 찾는지를 넘어, '''더 강한 근거를 앞에 배치하는지''' 평가하는 데 유용하다. 특히 같은 개념이 여러 시대와 상황에서 다른 강조점으로 나타나는 말씀선집에서는, 비슷한 문단보다 질문의 시기·대상·맥락에 직접 맞는 문단을 위에 놓는 능력이 중요하다. == 4. 해석과 한계 == nDCG는 등급 기준에 민감하다. 검수자마다 ‘직접 근거’와 ‘보조 근거’를 다르게 판단하면 숫자가 흔들릴 수 있다. 따라서 등급 정의, 판정 예시, 이견 조정 절차를 평가 전에 공개해야 한다. 또한 nDCG가 높아도 원문 인용이 정확한지, 답변이 그 근거를 과장하지 않는지는 별도 평가해야 한다. * 모든 핵심 근거를 회수했는지는 [[말씀선집 GraphRAG 연구/평가 지표 - Recall@K|Recall@K]]로 본다. * 첫 핵심 근거의 도착 속도는 [[말씀선집 GraphRAG 연구/평가 지표 - MRR|MRR]]로 본다. * nDCG는 여러 결과의 질적 차이와 순서까지 함께 본다. == 5. 운영 원칙 == # 등급 0~3의 정의와 실제 판정 예시를 평가 매뉴얼에 고정한다. # 한 질문에 대해 최소 2인의 평가자가 독립 판정하고, 불일치는 합의 또는 이견 기록으로 처리한다. # 동일한 원문을 잘게 나눈 중복 청크가 상위를 독점하지 않도록 중복·인접문단 정책을 명시한다. # 전체 평균뿐 아니라 질문 유형별 nDCG와 낮은 점수의 대표 사례를 분석한다. # 검색 지표와 별도로 출처 표기 정확도, 맥락 충실성, 목회자 활용성 평가를 실시한다. == 참고자료 == * Järvelin, K., & Kekäläinen, J. (2002). Cumulated gain-based evaluation of IR techniques. ''ACM Transactions on Information Systems'', 20(4), 422–446. https://doi.org/10.1145/582415.582418 * Manning, C. D., Raghavan, P., & Schütze, H. (2008). ''Introduction to Information Retrieval'', 8장. [https://nlp.stanford.edu/IR-book/html/htmledition/evaluation-of-ranked-retrieval-results-1.html 온라인 원문] [[분류:말씀선집 GraphRAG 연구]] [[분류:RAG]] [[분류:정보검색 평가]]
말씀선집 GraphRAG 연구/평가 지표 - nDCG
문서로 돌아갑니다.
둘러보기 메뉴
개인 도구
로그인
이름공간
문서
토론
한국어
보기
읽기
원본 보기
역사 보기
더 보기
검색
둘러보기
대문
최근 바뀜
임의 문서로
미디어위키 도움말
특수 문서 목록
도구
여기를 가리키는 문서
가리키는 글의 최근 바뀜
문서 정보