Whisper 음성인식 논문 고1 학습용 단어집·표현 해석 리스트: 두 판 사이의 차이

현 아카이브
둘러보기로 이동 검색으로 이동
Whisper 논문 고1 영어 학습자료 생성
 
Whisper 학습자료 오디오 재생기 적용
 
10번째 줄: 10번째 줄:
== 핵심 단어집 (24개) ==
== 핵심 단어집 (24개) ==
'''전체 단어 낭독'''
'''전체 단어 낭독'''
<audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_all_terms.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
[[File:whisper-radford-2022_all_terms.mp3|300px]]
{| class="wikitable" style="width:100%;"
{| class="wikitable" style="width:100%;"
! 원문 단어·표현 !! 품사 !! 쉬운 뜻 !! 논문 속 뜻 !! PDF 쪽 / 재생
! 원문 단어·표현 !! 품사 !! 쉬운 뜻 !! 논문 속 뜻 !! PDF 쪽 / 재생
|-
|-
| '''speech recognition''' || n. phr. || 음성 인식 || 말소리를 글자로 바꾸는 기술·과제다. || 1–3<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_01.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''speech recognition''' || n. phr. || 음성 인식 || 말소리를 글자로 바꾸는 기술·과제다. || 1–3<br>[[File:whisper-radford-2022_term_01.mp3|300px]]
|-
|-
| '''weak supervision''' || n. phr. || 약한 감독 학습 || 사람이 완전히 검증하지 않은 인터넷 자막·전사문도 학습 자료로 쓰는 방식이다. || 1–2<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_02.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''weak supervision''' || n. phr. || 약한 감독 학습 || 사람이 완전히 검증하지 않은 인터넷 자막·전사문도 학습 자료로 쓰는 방식이다. || 1–2<br>[[File:whisper-radford-2022_term_02.mp3|300px]]
|-
|-
| '''transcript''' || n. || 전사문, 녹취문 || 음성을 문자로 옮긴 텍스트이며, 모델이 예측할 목표가 된다. || 1–2<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_03.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''transcript''' || n. || 전사문, 녹취문 || 음성을 문자로 옮긴 텍스트이며, 모델이 예측할 목표가 된다. || 1–2<br>[[File:whisper-radford-2022_term_03.mp3|300px]]
|-
|-
| '''multilingual''' || adj. || 다국어의 || 여러 언어의 음성을 처리하도록 학습한 성질이다. || 1–3<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_04.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''multilingual''' || adj. || 다국어의 || 여러 언어의 음성을 처리하도록 학습한 성질이다. || 1–3<br>[[File:whisper-radford-2022_term_04.mp3|300px]]
|-
|-
| '''multitask''' || adj. || 여러 과제를 하는 || 전사, 번역, 언어 식별, 음성 구간 탐지 등을 함께 다룬다는 뜻이다. || 1–4<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_05.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''multitask''' || adj. || 여러 과제를 하는 || 전사, 번역, 언어 식별, 음성 구간 탐지 등을 함께 다룬다는 뜻이다. || 1–4<br>[[File:whisper-radford-2022_term_05.mp3|300px]]
|-
|-
| '''zero-shot transfer''' || n. phr. || 사전 예시 없이 전이하기 || 특정 평가 자료로 다시 학습하지 않고도 새 자료에서 수행하는 설정이다. || 1–2, 5<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_06.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''zero-shot transfer''' || n. phr. || 사전 예시 없이 전이하기 || 특정 평가 자료로 다시 학습하지 않고도 새 자료에서 수행하는 설정이다. || 1–2, 5<br>[[File:whisper-radford-2022_term_06.mp3|300px]]
|-
|-
| '''fine-tuning''' || n. || 미세 조정 학습 || 이미 학습한 모델을 특정 자료·과제에 맞게 추가 학습하는 과정이다. || 1–2<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_07.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''fine-tuning''' || n. || 미세 조정 학습 || 이미 학습한 모델을 특정 자료·과제에 맞게 추가 학습하는 과정이다. || 1–2<br>[[File:whisper-radford-2022_term_07.mp3|300px]]
|-
|-
| '''robustness''' || n. || 견고성 || 소음이나 낯선 자료처럼 조건이 바뀌어도 성능을 유지하는 성질이다. || 1–2, 6, 9<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_08.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''robustness''' || n. || 견고성 || 소음이나 낯선 자료처럼 조건이 바뀌어도 성능을 유지하는 성질이다. || 1–2, 6, 9<br>[[File:whisper-radford-2022_term_08.mp3|300px]]
|-
|-
| '''generalize''' || v. || 일반화하다 || 학습 때 보지 못한 다른 자료·환경에서도 잘 작동하다. || 1–2, 5<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_09.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''generalize''' || v. || 일반화하다 || 학습 때 보지 못한 다른 자료·환경에서도 잘 작동하다. || 1–2, 5<br>[[File:whisper-radford-2022_term_09.mp3|300px]]
|-
|-
| '''benchmark''' || n. || 성능 비교 기준 || 여러 모델의 성능을 비교하는 표준 평가 자료나 과제다. || 1, 5<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_10.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''benchmark''' || n. || 성능 비교 기준 || 여러 모델의 성능을 비교하는 표준 평가 자료나 과제다. || 1, 5<br>[[File:whisper-radford-2022_term_10.mp3|300px]]
|-
|-
| '''dataset''' || n. || 데이터셋 || 학습·검증·평가에 쓰는 자료의 모음이다. || 1–2<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_11.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''dataset''' || n. || 데이터셋 || 학습·검증·평가에 쓰는 자료의 모음이다. || 1–2<br>[[File:whisper-radford-2022_term_11.mp3|300px]]
|-
|-
| '''distribution''' || n. || 분포, 자료 조건 || 자료가 나온 환경·화자·언어 등의 특성이 이루는 범위를 말한다. || 1–2, 5<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_12.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''distribution''' || n. || 분포, 자료 조건 || 자료가 나온 환경·화자·언어 등의 특성이 이루는 범위를 말한다. || 1–2, 5<br>[[File:whisper-radford-2022_term_12.mp3|300px]]
|-
|-
| '''out-of-distribution''' || adj. || 학습 분포 밖의 || 학습 자료와 다른 조건의 자료를 가리킨다. || 5–6<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_13.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''out-of-distribution''' || adj. || 학습 분포 밖의 || 학습 자료와 다른 조건의 자료를 가리킨다. || 5–6<br>[[File:whisper-radford-2022_term_13.mp3|300px]]
|-
|-
| '''encoder-decoder''' || n. phr. || 인코더-디코더 || 소리 특징을 처리하는 부분과 텍스트를 내는 부분으로 이루어진 구조다. || 3<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_14.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''encoder-decoder''' || n. phr. || 인코더-디코더 || 소리 특징을 처리하는 부분과 텍스트를 내는 부분으로 이루어진 구조다. || 3<br>[[File:whisper-radford-2022_term_14.mp3|300px]]
|-
|-
| '''sequence-to-sequence''' || adj. || 시퀀스에서 시퀀스로 || 입력의 순서열을 출력의 순서열로 바꾸는 모델 방식이다. || 2–4<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_15.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''sequence-to-sequence''' || adj. || 시퀀스에서 시퀀스로 || 입력의 순서열을 출력의 순서열로 바꾸는 모델 방식이다. || 2–4<br>[[File:whisper-radford-2022_term_15.mp3|300px]]
|-
|-
| '''token''' || n. || 토큰, 텍스트 단위 || 모델이 순서대로 예측하는 텍스트 조각 또는 특별 표지다. || 3–4<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_16.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''token''' || n. || 토큰, 텍스트 단위 || 모델이 순서대로 예측하는 텍스트 조각 또는 특별 표지다. || 3–4<br>[[File:whisper-radford-2022_term_16.mp3|300px]]
|-
|-
| '''transcription''' || n. || 전사 || 들린 말을 같은 언어의 글로 옮기는 작업이다. || 2–4<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_17.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''transcription''' || n. || 전사 || 들린 말을 같은 언어의 글로 옮기는 작업이다. || 2–4<br>[[File:whisper-radford-2022_term_17.mp3|300px]]
|-
|-
| '''translation''' || n. || 번역 || 한 언어의 말을 다른 언어의 글로 옮기는 작업이다. || 2–4, 8<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_18.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''translation''' || n. || 번역 || 한 언어의 말을 다른 언어의 글로 옮기는 작업이다. || 2–4, 8<br>[[File:whisper-radford-2022_term_18.mp3|300px]]
|-
|-
| '''language identification''' || n. phr. || 언어 식별 || 입력 음성이 어떤 언어인지 알아내는 과제다. || 2–4, 8<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_19.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''language identification''' || n. phr. || 언어 식별 || 입력 음성이 어떤 언어인지 알아내는 과제다. || 2–4, 8<br>[[File:whisper-radford-2022_term_19.mp3|300px]]
|-
|-
| '''voice activity detection''' || n. phr. || 음성 구간 탐지 || 소리가 있는 구간에 실제 말이 있는지 판별하는 기능이다. || 2–4, 13<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_20.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''voice activity detection''' || n. phr. || 음성 구간 탐지 || 소리가 있는 구간에 실제 말이 있는지 판별하는 기능이다. || 2–4, 13<br>[[File:whisper-radford-2022_term_20.mp3|300px]]
|-
|-
| '''word error rate (WER)''' || n. phr. || 단어 오류율 || 예측 전사문과 기준 전사문의 단어 차이를 재는 지표다. || 5–6<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_21.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''word error rate (WER)''' || n. phr. || 단어 오류율 || 예측 전사문과 기준 전사문의 단어 차이를 재는 지표다. || 5–6<br>[[File:whisper-radford-2022_term_21.mp3|300px]]
|-
|-
| '''normalization''' || n. || 표준화 || 표기·구두점 차이 때문에 불필요하게 오류로 세지 않도록 텍스트 형식을 맞추는 과정이다. || 2, 5, 12, 21<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_22.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''normalization''' || n. || 표준화 || 표기·구두점 차이 때문에 불필요하게 오류로 세지 않도록 텍스트 형식을 맞추는 과정이다. || 2, 5, 12, 21<br>[[File:whisper-radford-2022_term_22.mp3|300px]]
|-
|-
| '''heuristic''' || n. || 경험 규칙 || 완벽한 이론 대신 실용적으로 오류를 줄이기 위해 만든 규칙이다. || 2, 13<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_23.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''heuristic''' || n. || 경험 규칙 || 완벽한 이론 대신 실용적으로 오류를 줄이기 위해 만든 규칙이다. || 2, 13<br>[[File:whisper-radford-2022_term_23.mp3|300px]]
|-
|-
| '''hallucination''' || n. || 환각, 근거 없는 생성 || 실제 음성과 관계없는 전사문을 모델이 만들어 내는 오류다. || 14<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_term_24.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''hallucination''' || n. || 환각, 근거 없는 생성 || 실제 음성과 관계없는 전사문을 모델이 만들어 내는 오류다. || 14<br>[[File:whisper-radford-2022_term_24.mp3|300px]]
|}
|}
== 원문 기반 표현·문장 해석 (16개) ==
== 원문 기반 표현·문장 해석 (16개) ==
'''전체 표현 낭독'''
'''전체 표현 낭독'''
<audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_all_phrases.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
[[File:whisper-radford-2022_all_phrases.mp3|300px]]
{| class="wikitable" style="width:100%;"
{| class="wikitable" style="width:100%;"
! 영어 표현·문장 !! 자연스러운 해석 !! 문맥 설명 !! PDF 쪽 / 재생
! 영어 표현·문장 !! 자연스러운 해석 !! 문맥 설명 !! PDF 쪽 / 재생
|-
|-
| '''trained simply to predict large amounts of transcripts of audio on the internet'''<br><small>원문 인용</small> || 인터넷에 있는 많은 음성 전사문을 예측하도록 단순히 학습된 || 모델 학습 자료와 기본 학습 목표를 소개한다. || 1<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_phrase_01.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''trained simply to predict large amounts of transcripts of audio on the internet'''<br><small>원문 인용</small> || 인터넷에 있는 많은 음성 전사문을 예측하도록 단순히 학습된 || 모델 학습 자료와 기본 학습 목표를 소개한다. || 1<br>[[File:whisper-radford-2022_phrase_01.mp3|300px]]
|-
|-
| '''generalize well to standard benchmarks'''<br><small>원문 인용</small> || 표준 벤치마크에 잘 일반화하다 || 학습하지 않은 평가 자료에서도 성능을 보인다는 주장이다. || 1<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_phrase_02.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''generalize well to standard benchmarks'''<br><small>원문 인용</small> || 표준 벤치마크에 잘 일반화하다 || 학습하지 않은 평가 자료에서도 성능을 보인다는 주장이다. || 1<br>[[File:whisper-radford-2022_phrase_02.mp3|300px]]
|-
|-
| '''without the need for any fine-tuning'''<br><small>원문 인용</small> || 어떤 미세 조정도 필요 없이 || 특정 자료에 맞춘 추가 학습 없이 평가했다는 뜻이다. || 1<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_phrase_03.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''without the need for any fine-tuning'''<br><small>원문 인용</small> || 어떤 미세 조정도 필요 없이 || 특정 자료에 맞춘 추가 학습 없이 평가했다는 뜻이다. || 1<br>[[File:whisper-radford-2022_phrase_03.mp3|300px]]
|-
|-
| '''work reliably “out of the box”'''<br><small>원문 인용</small> || 별도 설정 없이도 믿을 만하게 작동하다 || 논문은 다양한 환경에서 바로 쓸 수 있는 음성 인식을 목표로 든다. || 1<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_phrase_04.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''work reliably “out of the box”'''<br><small>원문 인용</small> || 별도 설정 없이도 믿을 만하게 작동하다 || 논문은 다양한 환경에서 바로 쓸 수 있는 음성 인식을 목표로 든다. || 1<br>[[File:whisper-radford-2022_phrase_04.mp3|300px]]
|-
|-
| '''the trade-off between quality and quantity'''<br><small>원문 인용</small> || 품질과 양 사이의 맞바꿈 || 더 많은 자료가 더 시끄럽거나 부정확할 수 있는 관계를 말한다. || 2<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_phrase_05.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''the trade-off between quality and quantity'''<br><small>원문 인용</small> || 품질과 양 사이의 맞바꿈 || 더 많은 자료가 더 시끄럽거나 부정확할 수 있는 관계를 말한다. || 2<br>[[File:whisper-radford-2022_phrase_05.mp3|300px]]
|-
|-
| '''scale weakly supervised speech recognition'''<br><small>원문 인용</small> || 약한 감독 음성 인식을 큰 규모로 확장하다 || 학습 자료 시간을 크게 늘리는 연구의 핵심 행동이다. || 2<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_phrase_06.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''scale weakly supervised speech recognition'''<br><small>원문 인용</small> || 약한 감독 음성 인식을 큰 규모로 확장하다 || 학습 자료 시간을 크게 늘리는 연구의 핵심 행동이다. || 2<br>[[File:whisper-radford-2022_phrase_06.mp3|300px]]
|-
|-
| '''detect and remove machine-generated transcripts'''<br><small>원문 인용</small> || 기계가 만든 전사문을 찾아 제거하다 || 학습 자료 속 자동 생성 자막을 거르는 방법을 설명한다. || 2<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_phrase_07.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''detect and remove machine-generated transcripts'''<br><small>원문 인용</small> || 기계가 만든 전사문을 찾아 제거하다 || 학습 자료 속 자동 생성 자막을 거르는 방법을 설명한다. || 2<br>[[File:whisper-radford-2022_phrase_07.mp3|300px]]
|-
|-
| '''break audio files into 30-second segments'''<br><small>원문 인용</small> || 음성 파일을 30초 구간으로 나누다 || 모델 학습에 쓰는 음성 단위를 설명한다. || 2<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_phrase_08.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''break audio files into 30-second segments'''<br><small>원문 인용</small> || 음성 파일을 30초 구간으로 나누다 || 모델 학습에 쓰는 음성 단위를 설명한다. || 2<br>[[File:whisper-radford-2022_phrase_08.mp3|300px]]
|-
|-
| '''condition on the history of text'''<br><small>원문 인용</small> || 앞선 텍스트의 내용을 조건·문맥으로 삼다 || 현재 음성 앞에 나온 전사문을 디코더의 문맥으로 더하는 방법이다. || 3<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_phrase_09.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''condition on the history of text'''<br><small>원문 인용</small> || 앞선 텍스트의 내용을 조건·문맥으로 삼다 || 현재 음성 앞에 나온 전사문을 디코더의 문맥으로 더하는 방법이다. || 3<br>[[File:whisper-radford-2022_phrase_09.mp3|300px]]
|-
|-
| '''a single model perform the entire speech processing pipeline'''<br><small>원문 인용</small> || 하나의 모델이 음성 처리 과정 전체를 수행하다 || 여러 기능을 따로 나누지 않고 한 모델로 처리하려는 목표다. || 3<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_phrase_10.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''a single model perform the entire speech processing pipeline'''<br><small>원문 인용</small> || 하나의 모델이 음성 처리 과정 전체를 수행하다 || 여러 기능을 따로 나누지 않고 한 모델로 처리하려는 목표다. || 3<br>[[File:whisper-radford-2022_phrase_10.mp3|300px]]
|-
|-
| '''evaluate Whisper in a zero-shot setting'''<br><small>원문 인용</small> || Whisper를 제로샷 설정에서 평가하다 || 각 평가 자료의 학습 데이터를 쓰지 않는 평가 방법이다. || 5<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_phrase_11.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''evaluate Whisper in a zero-shot setting'''<br><small>원문 인용</small> || Whisper를 제로샷 설정에서 평가하다 || 각 평가 자료의 학습 데이터를 쓰지 않는 평가 방법이다. || 5<br>[[File:whisper-radford-2022_phrase_11.mp3|300px]]
|-
|-
| '''penalizes all differences between the model’s output and the reference transcript'''<br><small>원문 인용</small> || 모델 출력과 기준 전사문의 모든 차이에 불이익을 준다 || WER가 사소한 표기 차이도 오류로 셀 수 있음을 설명한다. || 5<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_phrase_12.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''penalizes all differences between the model’s output and the reference transcript'''<br><small>원문 인용</small> || 모델 출력과 기준 전사문의 모든 차이에 불이익을 준다 || WER가 사소한 표기 차이도 오류로 셀 수 있음을 설명한다. || 5<br>[[File:whisper-radford-2022_phrase_12.mp3|300px]]
|-
|-
| '''approaches the ideal of equal performance on all datasets'''<br><small>원문 인용</small> || 모든 데이터셋에서 같은 성능이라는 이상에 가까워지다 || 자료가 바뀌어도 성능 차이가 작을수록 견고하다는 설명이다. || 6<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_phrase_13.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''approaches the ideal of equal performance on all datasets'''<br><small>원문 인용</small> || 모든 데이터셋에서 같은 성능이라는 이상에 가까워지다 || 자료가 바뀌어도 성능 차이가 작을수록 견고하다는 설명이다. || 6<br>[[File:whisper-radford-2022_phrase_13.mp3|300px]]
|-
|-
| '''performance improves with increasing dataset size'''<br><small>원문 인용</small> || 데이터셋 크기가 커질수록 성능이 좋아진다 || 자료 크기와 성능의 관계를 요약한 표의 제목이다. || 11<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_phrase_14.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''performance improves with increasing dataset size'''<br><small>원문 인용</small> || 데이터셋 크기가 커질수록 성능이 좋아진다 || 자료 크기와 성능의 관계를 요약한 표의 제목이다. || 11<br>[[File:whisper-radford-2022_phrase_14.mp3|300px]]
|-
|-
| '''reduce repetition looping'''<br><small>원문 인용</small> || 반복 루프를 줄이다 || 긴 음성을 전사할 때 같은 내용을 반복하는 오류를 줄이는 목적이다. || 13<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_phrase_15.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''reduce repetition looping'''<br><small>원문 인용</small> || 반복 루프를 줄이다 || 긴 음성을 전사할 때 같은 내용을 반복하는 오류를 줄이는 목적이다. || 13<br>[[File:whisper-radford-2022_phrase_15.mp3|300px]]
|-
|-
| '''A is robust to changes in B.'''<br><small>일반화 학습 문장틀 — 원문 직인용 아님</small> || A는 B의 변화에도 견고하다. || 학술 영어에서 조건 변화에도 성능을 유지함을 말하는 일반화 학습 문장틀이다. || 학습용 일반화<br><audio controls preload="none"><source src="https://www.cheonilgukwiki.org/index.php/Special:Redirect/file/whisper-radford-2022_phrase_16.mp3" type="audio/mpeg">오디오를 지원하지 않습니다.</audio>
| '''A is robust to changes in B.'''<br><small>일반화 학습 문장틀 — 원문 직인용 아님</small> || A는 B의 변화에도 견고하다. || 학술 영어에서 조건 변화에도 성능을 유지함을 말하는 일반화 학습 문장틀이다. || 학습용 일반화<br>[[File:whisper-radford-2022_phrase_16.mp3|300px]]
|}
|}
== 읽기 확인: 짧은 원문 문장 ==
== 읽기 확인: 짧은 원문 문장 ==

2026년 8월 6일 (목) 12:00 기준 최신판

Whisper 음성인식 논문 고1 학습용 단어집·표현 해석 리스트

이 문서는 고등학교 1학년 학습자를 위한 영어 읽기 보조 자료입니다. 원문 기반 뜻·한국어 풀이는 공식 번역이 아니며 제공된 원문 PDF를 바탕으로 쉽게 풀어 썼습니다. ‘원문 인용’은 원문에서 확인한 표현입니다. ‘일반화 학습 문장틀’은 원문 직인용이 아닙니다. 논문 : Radford, Alec et al. (2022), Robust Speech Recognition via Large-Scale Weak Supervision · arXiv:2212.04356v1 (PDF 28쪽) Word 다운로드 : 파일:Whisper Radford 2022 고1학습용 단어집 표현해석리스트.docx

핵심 개념

  • 목표: 많은 인터넷 음성 전사문으로 학습한 하나의 음성 처리 모델이, 특정 자료에 다시 맞추어 학습하지 않아도 다양한 조건에서 잘 작동하는지 살핀다(PDF 1–2쪽).
  • 자료 처리: 680,000시간의 다국어·여러 과제 자료를 사용하며, 자동 생성 전사문과 언어 불일치 자료를 거르려 한다(PDF 1–2쪽).
  • 하나의 모델, 여러 일: 전사·영어 번역·언어 식별·음성 구간 탐지를 특별 토큰으로 지정해 하나의 encoder-decoder Transformer가 처리한다(PDF 3–4쪽).
  • 평가: 제로샷 평가는 각 평가 데이터의 학습 자료를 쓰지 않고 새 환경에 얼마나 일반화하는지 본다. WER는 사소한 표기 차이도 오류로 셀 수 있다(PDF 5–6쪽).

핵심 단어집 (24개)

전체 단어 낭독

원문 단어·표현 품사 쉬운 뜻 논문 속 뜻 PDF 쪽 / 재생
speech recognition n. phr. 음성 인식 말소리를 글자로 바꾸는 기술·과제다. 1–3
weak supervision n. phr. 약한 감독 학습 사람이 완전히 검증하지 않은 인터넷 자막·전사문도 학습 자료로 쓰는 방식이다. 1–2
transcript n. 전사문, 녹취문 음성을 문자로 옮긴 텍스트이며, 모델이 예측할 목표가 된다. 1–2
multilingual adj. 다국어의 여러 언어의 음성을 처리하도록 학습한 성질이다. 1–3
multitask adj. 여러 과제를 하는 전사, 번역, 언어 식별, 음성 구간 탐지 등을 함께 다룬다는 뜻이다. 1–4
zero-shot transfer n. phr. 사전 예시 없이 전이하기 특정 평가 자료로 다시 학습하지 않고도 새 자료에서 수행하는 설정이다. 1–2, 5
fine-tuning n. 미세 조정 학습 이미 학습한 모델을 특정 자료·과제에 맞게 추가 학습하는 과정이다. 1–2
robustness n. 견고성 소음이나 낯선 자료처럼 조건이 바뀌어도 성능을 유지하는 성질이다. 1–2, 6, 9
generalize v. 일반화하다 학습 때 보지 못한 다른 자료·환경에서도 잘 작동하다. 1–2, 5
benchmark n. 성능 비교 기준 여러 모델의 성능을 비교하는 표준 평가 자료나 과제다. 1, 5
dataset n. 데이터셋 학습·검증·평가에 쓰는 자료의 모음이다. 1–2
distribution n. 분포, 자료 조건 자료가 나온 환경·화자·언어 등의 특성이 이루는 범위를 말한다. 1–2, 5
out-of-distribution adj. 학습 분포 밖의 학습 자료와 다른 조건의 자료를 가리킨다. 5–6
encoder-decoder n. phr. 인코더-디코더 소리 특징을 처리하는 부분과 텍스트를 내는 부분으로 이루어진 구조다. 3
sequence-to-sequence adj. 시퀀스에서 시퀀스로 입력의 순서열을 출력의 순서열로 바꾸는 모델 방식이다. 2–4
token n. 토큰, 텍스트 단위 모델이 순서대로 예측하는 텍스트 조각 또는 특별 표지다. 3–4
transcription n. 전사 들린 말을 같은 언어의 글로 옮기는 작업이다. 2–4
translation n. 번역 한 언어의 말을 다른 언어의 글로 옮기는 작업이다. 2–4, 8
language identification n. phr. 언어 식별 입력 음성이 어떤 언어인지 알아내는 과제다. 2–4, 8
voice activity detection n. phr. 음성 구간 탐지 소리가 있는 구간에 실제 말이 있는지 판별하는 기능이다. 2–4, 13
word error rate (WER) n. phr. 단어 오류율 예측 전사문과 기준 전사문의 단어 차이를 재는 지표다. 5–6
normalization n. 표준화 표기·구두점 차이 때문에 불필요하게 오류로 세지 않도록 텍스트 형식을 맞추는 과정이다. 2, 5, 12, 21
heuristic n. 경험 규칙 완벽한 이론 대신 실용적으로 오류를 줄이기 위해 만든 규칙이다. 2, 13
hallucination n. 환각, 근거 없는 생성 실제 음성과 관계없는 전사문을 모델이 만들어 내는 오류다. 14

원문 기반 표현·문장 해석 (16개)

전체 표현 낭독

영어 표현·문장 자연스러운 해석 문맥 설명 PDF 쪽 / 재생
trained simply to predict large amounts of transcripts of audio on the internet
원문 인용
인터넷에 있는 많은 음성 전사문을 예측하도록 단순히 학습된 모델 학습 자료와 기본 학습 목표를 소개한다. 1
generalize well to standard benchmarks
원문 인용
표준 벤치마크에 잘 일반화하다 학습하지 않은 평가 자료에서도 성능을 보인다는 주장이다. 1
without the need for any fine-tuning
원문 인용
어떤 미세 조정도 필요 없이 특정 자료에 맞춘 추가 학습 없이 평가했다는 뜻이다. 1
work reliably “out of the box”
원문 인용
별도 설정 없이도 믿을 만하게 작동하다 논문은 다양한 환경에서 바로 쓸 수 있는 음성 인식을 목표로 든다. 1
the trade-off between quality and quantity
원문 인용
품질과 양 사이의 맞바꿈 더 많은 자료가 더 시끄럽거나 부정확할 수 있는 관계를 말한다. 2
scale weakly supervised speech recognition
원문 인용
약한 감독 음성 인식을 큰 규모로 확장하다 학습 자료 시간을 크게 늘리는 연구의 핵심 행동이다. 2
detect and remove machine-generated transcripts
원문 인용
기계가 만든 전사문을 찾아 제거하다 학습 자료 속 자동 생성 자막을 거르는 방법을 설명한다. 2
break audio files into 30-second segments
원문 인용
음성 파일을 30초 구간으로 나누다 모델 학습에 쓰는 음성 단위를 설명한다. 2
condition on the history of text
원문 인용
앞선 텍스트의 내용을 조건·문맥으로 삼다 현재 음성 앞에 나온 전사문을 디코더의 문맥으로 더하는 방법이다. 3
a single model perform the entire speech processing pipeline
원문 인용
하나의 모델이 음성 처리 과정 전체를 수행하다 여러 기능을 따로 나누지 않고 한 모델로 처리하려는 목표다. 3
evaluate Whisper in a zero-shot setting
원문 인용
Whisper를 제로샷 설정에서 평가하다 각 평가 자료의 학습 데이터를 쓰지 않는 평가 방법이다. 5
penalizes all differences between the model’s output and the reference transcript
원문 인용
모델 출력과 기준 전사문의 모든 차이에 불이익을 준다 WER가 사소한 표기 차이도 오류로 셀 수 있음을 설명한다. 5
approaches the ideal of equal performance on all datasets
원문 인용
모든 데이터셋에서 같은 성능이라는 이상에 가까워지다 자료가 바뀌어도 성능 차이가 작을수록 견고하다는 설명이다. 6
performance improves with increasing dataset size
원문 인용
데이터셋 크기가 커질수록 성능이 좋아진다 자료 크기와 성능의 관계를 요약한 표의 제목이다. 11
reduce repetition looping
원문 인용
반복 루프를 줄이다 긴 음성을 전사할 때 같은 내용을 반복하는 오류를 줄이는 목적이다. 13
A is robust to changes in B.
일반화 학습 문장틀 — 원문 직인용 아님
A는 B의 변화에도 견고하다. 학술 영어에서 조건 변화에도 성능을 유지함을 말하는 일반화 학습 문장틀이다. 학습용 일반화

읽기 확인: 짧은 원문 문장

“The goal of a speech recognition system should be to work reliably ‘out of the box’ in a broad range of environments …” (PDF 1쪽)

“음성 인식 시스템의 목표는 폭넓은 환경에서 별도 설정 없이도 믿을 만하게 작동하는 것이어야 한다.” 여기서 out of the box는 제품을 꺼내 곧바로 쓸 수 있다는 비유다.

“We evaluate Whisper in a zero-shot setting without using any of the training data for each of these datasets …” (PDF 5쪽)

“각 데이터셋의 학습 데이터를 전혀 쓰지 않는 제로샷 환경에서 Whisper를 평가한다.” 폭넓은 일반화를 보려는 평가 설계다.

스스로 확인하기

  1. weak supervision이 이 논문에서 어떤 학습 자료를 뜻하는지 써 보세요.
  2. zero-shot transferfine-tuning의 관계를 한 문장으로 설명해 보세요.
  3. PDF 3–4쪽에서 하나의 모델이 처리하는 음성 처리 과제를 두 가지 이상 쓰세요.
  4. PDF 5쪽의 WER 설명을 바탕으로, 사소한 표기 차이가 평가에 왜 문제가 될 수 있는지 말해 보세요.
  5. PDF 13쪽의 긴 음성 전사에서 reduce repetition looping이 필요한 이유를 설명해 보세요.

원문 출처 및 고지