Retrieval-Augmented Generation 논문 고1 학습용 단어집·표현 해석 리스트

현 아카이브
Maintenance script (토론 | 기여)님의 2026년 8월 6일 (목) 11:31 판 (RAG 논문 고1 영어학습 자료와 개별 낭독 등록)
(차이) ← 이전 판 | 최신판 (차이) | 다음 판 → (차이)
둘러보기로 이동 검색으로 이동

RAG 논문 영어학습 자료 · 학습 문서 목록 · 문서 작성 양식

파일:RAG Lewis 2020 고1학습용 단어집 표현해석리스트.docx

영어 낭독

아래에는 목록 전체를 듣는 버튼과, 각 단어·표현 옆의 개별 듣기 버튼이 있습니다.

핵심 단어 전체 듣기

표현·문장틀 전체 듣기


원문: Lewis, Patrick et al. (2020), Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks · arXiv PDF 19쪽 기준

학습 자료 고지. 이 문서는 고등학교 1학년 학습자가 논문의 영어를 읽도록 돕는 보조 자료입니다. ‘논문 속 뜻’과 한국어 풀이는 원문 논지를 바탕으로 쉽게 풀어 쓴 학습용 설명이며, 공식 번역이 아닙니다. 쪽수는 제공된 원문 PDF의 인쇄 쪽수(1–19) 기준입니다. 인용부호 안 영어는 원문에서 확인한 표현입니다. 일반화 학습 문장틀이라고 표시한 항목은 원문 직인용이 아닙니다.

0. 핵심 개념 먼저 잡기

RAG (retrieval-augmented generation)는 이미 학습된 언어 모델의 parametric memory(모델 매개변수에 담긴 지식)와, 문서 색인에서 찾아오는 non-parametric memory(검색 기반 지식)를 함께 쓰는 생성 모델이다. 논문은 입력 x에 맞는 문서 z를 retriever가 찾고, generator가 입력과 그 문서를 바탕으로 출력 y를 만든다고 설명한다(PDF 1–3쪽).

두 방식의 차이: RAG-Sequence는 출력 전체에 같은 검색 문서를 사용하고, RAG-Token은 출력 토큰마다 서로 다른 문서를 활용할 수 있다(PDF 2쪽).

왜 중요한가: 검색 가능한 문서 색인은 갱신·점검이 가능하므로, 모델만으로 답할 때보다 지식의 출처를 살피고 세계 지식을 바꾸기 쉬울 수 있다(PDF 1쪽, 7쪽).

1. 핵심 단어집 (28개)

원문 단어·표현 품사 쉬운 뜻 논문 속 뜻 듣기
retrieval n. 검색하여 찾아오기 입력 질문과 관련된 문서를 색인에서 찾아오는 과정이다. 1–3
augment v. 더해 보강하다 생성 모델에 검색한 문서를 추가 문맥으로 더하는 뜻이다. 1–2
generation n. 생성 모델이 답·문장 같은 출력 텍스트를 만들어 내는 일이다. 1–2
knowledge-intensive adj. 지식이 많이 필요한 외부 지식 없이 사람이 하기 어려운 과제를 가리킨다. 1
parametric memory n. phr. 매개변수형 기억 사전학습 seq2seq 모델의 매개변수에 저장된 지식이다. 1–3
non-parametric memory n. phr. 비매개변수형 기억 검색으로 접근하는 Wikipedia의 조밀 벡터 색인을 뜻한다. 1–3
explicit adj. 분명히 드러난 문서처럼 확인·검토할 수 있는 외부 지식 기억의 성격을 설명한다. 1
provenance n. 출처, 유래 모델의 판단이 어떤 지식에 근거하는지 추적할 수 있는 근거다. 1
hallucination n. 환각, 사실과 다른 생성 모델이 사실에 맞지 않는 내용을 만들어 낼 수 있는 문제다. 1, 5, 9
retriever n. 검색기 질문을 받아 관련 문서 passage의 분포를 반환하는 구성요소다. 2–3
generator n. 생성기 입력과 검색 문서, 앞선 토큰을 바탕으로 다음 토큰을 만드는 구성요소다. 2–3
dense vector index n. phr. 조밀 벡터 색인 Wikipedia 문서를 숫자 벡터로 저장해 검색하는 비매개변수형 기억이다. 1–3
passage n. 글의 한 구절, 문단 검색기가 반환하는 문서의 일부 텍스트 단위다. 1–3
latent variable n. phr. 잠재 변수 정답 문서라는 직접 정답표 없이, 학습에서 고려하는 검색 문서 z다. 2–3
marginalize v. 여러 경우를 합쳐 계산하다 서로 다른 검색 문서가 낸 예측을 확률적으로 합치는 계산을 말한다. 1–2
top-K adj. 상위 K개의 검색 결과 중 점수가 높은 K개 문서만 사용해 근사하는 방식이다. 1–3
token n. 텍스트 조각 생성 모델이 한 단계씩 예측하는 출력 단위다. 1–2
sequence n. 순서가 있는 열 여러 토큰으로 이루어진 전체 출력 문장·텍스트다. 1–2
fine-tune v. 미세 조정 학습하다 사전학습 모델을 특정 과제에 맞추어 추가 학습하는 일이다. 1–3
end-to-end adj./adv. 처음부터 끝까지 연결된 retriever와 generator를 따로 떼지 않고 함께 학습하는 방식이다. 1–3
supervision n. 정답 지도, 감독 신호 어떤 문서를 찾아야 하는지 직접 알려 주는 학습 신호를 뜻한다. 3–4, 6
extractive adj. 원문에서 뽑아내는 검색 문서 안의 답 문구를 그대로 추출하는 QA 방식이다. 1, 4–5
abstractive adj. 새 문장으로 요약·생성하는 문서 문구를 단순 복사하지 않고 자유 형식 텍스트로 답하는 방식이다. 4–5
factuality n. 사실성 생성 문장이 신뢰할 만한 외부 출처로 뒷받침되는지를 뜻한다. 4–5, 9
specificity n. 구체성 입력과 출력이 얼마나 긴밀히 연결되는지를 나타내는 평가 기준이다. 4–5
ablation n. 일부를 빼 보는 비교 실험 검색기를 고정하는 등 한 요소를 바꾸어 그 효과를 살피는 실험이다. 7
hot-swap v. 바로 교체하다 재학습 없이 색인을 바꾸어 최신 지식을 반영하는 사례를 설명한다. 7
interpretability n. 해석 가능성 검색한 원문을 사람이 읽을 수 있어 모델 근거를 살필 수 있는 성질이다. 8–9

2. 원문 기반 표현·문장 해석 (18개)

읽는 방법. ‘원문 인용’은 제공된 PDF에서 확인한 표현이다. ‘일반화 학습 문장틀’은 원문의 문장 구조를 익히도록 바꿔 쓴 것으로, 원문 직인용이 아니다.

영어 표현·문장 자연스러운 해석 문맥 설명 듣기
have been shown to + 동사 원문 인용 ~하는 것으로 밝혀져 왔다 사전학습 언어 모델이 매개변수에 사실 지식을 저장한다는 연구 결과를 소개한다. 1
their ability to + 동사 is still limited 원문 인용 그들이 ~하는 능력은 여전히 제한적이다 지식에 접근하고 정확히 다루는 데 한계가 있다는 문제 제기다. 1
provide provenance for their decisions 원문 인용 결정의 출처·근거를 제시하다 모델 답변이 어디에서 왔는지 보여 주기 어려운 문제와 연결된다. 1
combine A with B 원문 인용 A와 B를 결합하다 RAG는 매개변수형 기억과 비매개변수형 기억을 함께 쓴다. 1
accessed with a pre-trained neural retriever 원문 인용 사전학습 신경 검색기로 접근되는 Wikipedia 색인이 어떤 도구를 통해 읽히는지를 설명한다. 1
condition on + 명사 원문 인용 ~을 조건·문맥으로 삼다 generator가 입력과 검색 문서를 바탕으로 출력한다는 기술 표현이다. 1–2
treat z as a latent variable 원문 인용 z를 잠재 변수로 다루다 검색 문서를 직접 정답으로 주지 않고 확률 계산 안에서 다룬다는 뜻이다. 1–2
marginalize over + 명사 원문 인용 ~의 여러 경우를 합산해 고려하다 여러 검색 문서에 따른 seq2seq 예측을 모아 최종 확률을 구한다. 1–2
be fine-tuned on + 과제 원문 인용 ~ 과제에 맞게 미세 조정되다 RAG가 다양한 seq2seq 과제에 적용될 수 있음을 말한다. 1–2
from scratch 원문 인용 처음부터 새로 특정 과제용으로 처음부터 훈련하는 기존 구조와 대비한다. 1
without additional training 원문 인용 추가 학습 없이 사전학습된 접근 장치를 쓰면 지식 접근 능력이 이미 있다는 주장이다. 1
outperform + 비교 대상 원문 인용 ~보다 더 좋은 성능을 내다 RAG가 여러 QA 과제에서 기존 접근보다 성능이 좋았다는 결과에 쓴다. 1, 5
the same document is responsible for all tokens 원문 인용 같은 문서가 모든 토큰을 담당한다 RAG-Sequence의 가정: 출력 전체에 하나의 검색 문서를 사용한다. 1–2
can use different passages per token 원문 인용 토큰마다 다른 구절을 사용할 수 있다 RAG-Token은 출력의 각 부분에 서로 다른 문서를 활용할 수 있다. 1–2
rely purely on + 명사 원문 인용 오직 ~에만 의존하다 검색을 쓰지 않고 매개변수형 지식만 쓰는 Closed-Book QA를 설명한다. 4
can be corroborated by trusted external sources 원문 인용 신뢰할 만한 외부 출처로 뒷받침될 수 있다 논문에서 factuality를 정의할 때 쓰는 기준이다. 4
at the expense of + 명사 원문 인용 ~을 희생하는 대가로 더 많은 문서를 검색하면 Rouge-L은 높아지지만 Bleu-1에는 불리할 수 있음을 설명한다. 7
A is not only … but also … 일반화 학습 문장틀 — 원문 직인용 아님 A는 ~할 뿐 아니라 ~하기도 한다 논문 읽기에서 두 장점이나 기능을 함께 설명할 때 쓸 수 있는 일반 문장틀이다. 학습용 일반화

3. 읽기 확인: 짧은 원문 문장

“We combine a pre-trained retriever … with a pre-trained seq2seq model … and fine-tune end-to-end.” (PDF 1쪽, Figure 1 설명)

→ “사전학습된 검색기와 사전학습된 seq2seq 모델을 결합하고, 처음부터 끝까지 연결하여 미세 조정한다.” 핵심은 두 부품을 따로 쓰는 것이 아니라 함께 학습한다는 점이다.

“The non-parametric memory can be replaced to update the models’ knowledge as the world changes.” (PDF 1쪽)

→ “세상이 바뀌면 비매개변수형 기억을 교체하여 모델의 지식을 갱신할 수 있다.” 모델 자체를 다시 훈련하지 않고 색인을 바꾸는 장점을 말한다.

4. 스스로 확인하기

parametric memory와 non-parametric memory의 차이를 각각 한 문장으로 설명해 보세요.

RAG-Sequence와 RAG-Token은 검색 문서를 사용하는 방식에서 어떻게 다른가요?

논문이 말하는 provenance가 중요한 이유를 ‘답의 근거’라는 말로 설명해 보세요.

“RAG can be fine-tuned on any seq2seq task”에서 can be fine-tuned의 뜻을 한국어로 쓰고, 능동문으로도 바꾸어 보세요.

PDF 7쪽의 index hot-swapping 사례가 최신 정보 문제에 어떤 도움을 주는지 써 보세요.

5. 출처 및 검수 메모

원문 전문: 제공 파일 source-fulltext/RAG_Lewis_2020.pdf (직접 확인; 19쪽) · 공개 출처: https://arxiv.org/abs/2005.11401

위키 원문 안내 페이지: 가정연합 지역교회 구술사 AI아카이브 참고원문 - RAG

오디오/위키는 위의 API 차단 사유로 미게시이다. 따라서 이 문서는 로컬 검수용 Word·PDF 학습자료이며, 아직 최종 배포본이 아니다.