말씀선집 GraphRAG 연구/평가 지표 - Recall@K 문서 원본 보기
←
말씀선집 GraphRAG 연구/평가 지표 - Recall@K
둘러보기로 이동
검색으로 이동
문서 편집 권한이 없습니다. 다음 이유를 확인해주세요:
요청한 명령은 다음 권한을 가진 사용자에게 제한됩니다:
사용자
.
문서의 원본을 보거나 복사할 수 있습니다.
= Recall@K = '''분야:''' 정보검색(IR) · RAG 검색 평가<br> '''한 줄 정의:''' 정답 근거 전체 가운데 검색 결과 상위 K개 안에 찾아온 비율이다.<br> '''관련 문서:''' [[말씀선집 GraphRAG 연구]] · [[말씀선집 GraphRAG 연구/평가 지표 - MRR|MRR]] · [[말씀선집 GraphRAG 연구/평가 지표 - nDCG|nDCG]] == 1. 무엇을 측정하는가 == Recall@K는 한 질문에 대해 미리 정한 '''관련 근거(relevant evidence) 전체''' 중 검색 상위 K개에 포함된 비율을 측정한다. RAG에서 이 지표는 “모델이 답변을 만들기 전에, 답의 근거가 될 원문을 충분히 가져왔는가”를 보는 기본 지표다. 값의 범위는 0부터 1까지이며, 1은 정답 근거를 모두 상위 K 안에 찾았다는 뜻이다. <math>Recall@K(q) = \frac{|TopK(q) \cap G(q)|}{|G(q)|}</math> * <math>q</math>: 평가 질문 * <math>TopK(q)</math>: 시스템이 질문 <math>q</math>에 대해 반환한 상위 K개 문단 또는 청크 * <math>G(q)</math>: 사람이 미리 정한 관련 근거 집합 == 2. 계산 예시 == 질문에 대한 정답 근거가 원문 문단 A·B·C 세 개이고, 시스템의 상위 5개 결과에 A만 포함되었다면 <math>Recall@5 = 1/3 = 0.333</math>이다. 상위 5개 중 A·B·C가 모두 있으면 1.000이다. 여기서 '''Hit@K'''와 혼동하지 않아야 한다. Hit@K는 관련 근거가 하나라도 상위 K에 있으면 1, 없으면 0으로 계산한다. 반면 Recall@K는 관련 근거가 여러 개인 복합 질문에서 '''얼마나 빠짐없이''' 가져왔는지를 측정한다. == 3. 말씀선집 GraphRAG 적용 == 말씀선집 질의에서는 정답 근거를 단 하나로 고정하기보다 다음처럼 구분하는 편이 좋다. * '''핵심 근거:''' 답변의 직접 인용으로 반드시 필요한 문단 * '''보조 근거:''' 시대·개념·사건 맥락을 보완하는 문단 * '''대체 근거:''' 같은 내용을 다른 권·강연에서 명확히 설명한 문단 평가셋을 만들 때 질문마다 핵심 근거와 허용 가능한 대체 근거를 전문가가 지정하고, 모델별로 동일한 청크 단위·동일한 K·동일한 질문을 사용해야 한다. BM25, 벡터 RAG, Hybrid RAG, GraphRAG를 비교할 때 Recall@5와 Recall@10을 함께 보고하면, 적은 검색 결과에서도 근거를 놓치지 않는지와 K를 늘렸을 때 회수되는지를 구분할 수 있다. == 4. 해석과 한계 == Recall@K가 높으면 근거 누락 위험은 낮아지지만, 상위에 엉뚱한 결과가 많아도 높게 나올 수 있다. 또한 모든 관련 근거를 너무 넓게 지정하면 실제 사용자가 필요로 하지 않는 문단까지 정답으로 취급하게 된다. 따라서 Recall@K만으로 “좋은 RAG”라고 결론 내릴 수 없다. * 상위 결과의 첫 근거가 얼마나 빠른지는 [[말씀선집 GraphRAG 연구/평가 지표 - MRR|MRR]]로 본다. * 여러 결과의 순위 품질과 근거 강도는 [[말씀선집 GraphRAG 연구/평가 지표 - nDCG|nDCG]]로 본다. * 최종 답변은 인용 정확도, 맥락 충실성, 목회자 검수 가능성을 별도 평가한다. == 5. 운영 원칙 == # 청크 크기와 겹침 규칙을 먼저 고정한다. 청크가 작을수록 관련 근거 수가 늘어 Recall이 낮아질 수 있다. # 답변 가능한 질문과 근거가 불충분해 답변을 보류해야 할 질문을 구분한다. # 정답 근거 목록은 한 사람이 임의로 확정하지 말고, 최소 2인의 검수 또는 이견 기록 절차를 둔다. # 값만 비교하지 말고, 누락된 근거가 핵심인지 보조인지 오류 사례를 함께 분석한다. == 참고자료 == * Manning, C. D., Raghavan, P., & Schütze, H. (2008). ''Introduction to Information Retrieval'', 8장. [https://nlp.stanford.edu/IR-book/html/htmledition/evaluation-of-ranked-retrieval-results-1.html 온라인 원문] [[분류:말씀선집 GraphRAG 연구]] [[분류:RAG]] [[분류:정보검색 평가]]
말씀선집 GraphRAG 연구/평가 지표 - Recall@K
문서로 돌아갑니다.
둘러보기 메뉴
개인 도구
로그인
이름공간
문서
토론
한국어
보기
읽기
원본 보기
역사 보기
더 보기
검색
둘러보기
대문
최근 바뀜
임의 문서로
미디어위키 도움말
특수 문서 목록
도구
여기를 가리키는 문서
가리키는 글의 최근 바뀜
문서 정보