개념 정리

AI 더빙 원리: 음성 인식부터 타이밍 맞추기까지 네 단계로 이해하기

AI 더빙 원리는 네 단계로 요약됩니다. 원본 음성을 글자로 받아 적고(음성 인식), 그 문장을 다른 언어로 옮긴 뒤(기계 번역), 합성 음성으로 읽게 하고(음성 합성), 마지막으로 원래 장면 길이에 맞춰 배치합니다(타이밍 조정). 각 단계에서 어떤 일이 일어나는지, 한국어가 끼면 어디서 품질이 흔들리는지 차례로 살펴봅니다.

7분 분량 · 업데이트

참고: mydubly 화면은 현재 영어로만 제공됩니다. 한국어 음성 받아쓰기, 한국어 번역, 한국어 음성 생성은 지원되며 버튼만 영어로 표시됩니다.

AI 더빙은 자막과 무엇이 다른가

자막은 원래 목소리를 그대로 두고 화면 아래에 번역문을 띄우는 방식입니다. 더빙은 원래 목소리 대신 다른 언어의 목소리를 들려줍니다. 시청자 입장에서는 화면에서 눈을 떼지 않아도 내용이 귀로 들어오기 때문에 요리, 운동, 조립 설명처럼 손과 눈이 바쁜 영상에서 특히 편합니다.

전통적인 더빙은 번역가가 대본을 쓰고, 성우가 녹음실에서 장면을 보며 연기하고, 엔지니어가 믹싱하는 과정을 거칩니다. AI 더빙은 이 과정을 소프트웨어가 자동으로 이어 붙인 것입니다. 사람이 하던 일을 기계가 순서대로 대신할 뿐, 단계 자체는 크게 다르지 않습니다. 그래서 원리를 이해하면 결과물이 어색할 때 어느 단계에서 문제가 생겼는지 짐작할 수 있습니다.

전체 흐름을 먼저 정리하면 다음과 같습니다.

1단계 음성 인식
원본 음성을 시간 정보가 붙은 텍스트로 변환
2단계 기계 번역
구간별 텍스트를 목표 언어 문장으로 변환
3단계 음성 합성
번역문을 합성 음성으로 읽어 오디오 생성
4단계 타이밍 조정
합성 음성을 원본 구간 길이에 맞춰 배치하고 영상과 합침

1단계: 음성 인식으로 말을 글자로 바꾸기

첫 단계는 자동 음성 인식(ASR)입니다. 오디오를 아주 짧은 조각으로 잘라 소리의 특징을 숫자로 바꾸고, 신경망 모델이 그 패턴을 보고 어떤 단어가 말해졌을지 예측합니다. 요즘 모델은 소리만 보는 것이 아니라 앞뒤 문맥까지 함께 고려하기 때문에, 발음이 뭉개진 단어도 문장 흐름으로 어느 정도 복원합니다.

더빙에서 중요한 점은 텍스트와 함께 시간 정보가 나온다는 것입니다. "이 문장은 12.4초에 시작해서 15.1초에 끝난다" 같은 구간 정보가 있어야 나중에 번역된 음성을 같은 자리에 넣을 수 있습니다. 말이 없는 구간을 걸러내는 음성 활동 감지(VAD)도 이 단계에서 함께 쓰입니다.

이 단계에서 틀린 단어는 뒤의 모든 단계로 그대로 전달됩니다. 예를 들어 제품명 "라온"을 "라면"으로 잘못 들었다면 번역도 라면으로 나오고, 합성 음성도 당당하게 라면이라고 읽습니다. AI 더빙 품질의 상당 부분이 사실은 원본 녹음 품질에서 결정되는 이유입니다. 음성 인식의 기본 개념은 음성 인식이 작동하는 방식 (영어)에서 더 자세히 볼 수 있습니다.

2단계: 기계 번역으로 문장의 의미 옮기기

받아 적은 텍스트는 구간 단위로 번역됩니다. 신경망 번역은 단어를 하나씩 바꾸는 것이 아니라 문장 전체의 의미를 파악한 뒤 목표 언어로 다시 씁니다. 그래서 문장이 완결되어 있을수록 번역이 자연스럽고, 말하다가 끊긴 문장이나 "그거, 아까 그거" 같은 지시어가 많을수록 결과가 흔들립니다.

더빙용 번역에는 일반 문서 번역에 없는 제약이 하나 더 있습니다. 바로 길이입니다. 원문이 3초짜리 문장인데 번역문이 길어지면 읽는 데 5초가 걸릴 수 있습니다. 사람 번역가는 이럴 때 표현을 줄이거나 의역하지만, 기계 번역은 대체로 의미를 빠짐없이 옮기는 쪽을 택합니다. 이 차이가 4단계에서 말이 빨라지는 현상으로 이어집니다.

3단계: 음성 합성으로 글자를 다시 목소리로

번역문이 나오면 텍스트 음성 변환(TTS) 모델이 이를 읽습니다. 최신 TTS는 글자를 발음 단위로 바꾼 뒤, 억양과 길이, 강세를 예측해 실제 사람 목소리에 가까운 파형을 만들어 냅니다. 같은 문장이라도 어디에서 숨을 쉬고 어느 단어를 강조하느냐에 따라 느낌이 크게 달라지는데, 이 운율을 얼마나 자연스럽게 만드느냐가 TTS 품질의 핵심입니다.

음성 합성에는 크게 두 갈래가 있습니다. 미리 준비된 기본 음성 중에서 고르는 방식과, 원래 화자의 목소리를 학습해 비슷하게 만들어 내는 음성 복제 방식입니다. 두 방식의 장단점은 음성 복제와 기본 음성 비교 (영어)에서 정리하고 있습니다. 기본 음성은 누구의 목소리도 흉내 내지 않으므로 동의 문제에서 자유롭고, 대신 원래 화자의 개성은 사라집니다.

4단계: 타이밍 조정으로 원래 장면에 맞추기

마지막은 합성된 음성을 원래 구간에 끼워 넣는 작업입니다. 1단계에서 얻은 시작·끝 시간을 기준으로 번역 음성을 배치하고, 길이가 맞지 않으면 말 속도를 조절하거나 구간 사이의 여백을 활용합니다. 그 뒤 새 음성 트랙을 영상과 다시 합치면 더빙 영상이 완성됩니다.

길이 차이 예시

영어 원문 "Let's get started." 는 약 1초 분량입니다. 한국어로 "그럼 이제 본격적으로 시작해 보겠습니다."라고 옮기면 같은 1초 안에 읽기 어렵습니다. "바로 시작할게요."처럼 짧게 다듬어야 속도를 무리하게 올리지 않고 자리에 들어갑니다.

여기서 알아 둘 개념이 립싱크입니다. 립싱크는 화면 속 인물의 입 모양을 새 언어의 발음에 맞게 영상 자체를 수정하는 기술로, 타이밍 조정과는 다른 별도 단계입니다. 타이밍 조정은 소리의 시작과 끝을 맞출 뿐 입 모양까지 바꾸지는 않습니다. 립싱크가 어떤 기술인지는 AI 립싱크 설명 (영어)을 참고하세요.

한국어 더빙이 유독 까다로운 세 가지 이유

한국어는 AI 더빙에서 쉽지 않은 언어입니다. 기술이 부족해서라기보다 언어 구조 자체가 다른 언어와 달라서 생기는 문제가 많습니다.

  • 존댓말과 반말: 영어 "You can do it"은 "할 수 있어", "할 수 있어요", "하실 수 있습니다" 중 무엇이든 될 수 있습니다. 원문에는 높임 정보가 없으니 번역 모델이 문맥으로 추측해야 하고, 한 영상 안에서 말투가 오락가락하는 일이 생깁니다. 이 문제는 존댓말과 반말을 고르는 기준에서 따로 다룹니다.
  • 어순: 한국어는 서술어가 문장 끝에 옵니다. 영어 화자가 문장 앞부분에서 핵심을 말하며 손으로 가리키는 장면이 있으면, 한국어 더빙에서는 그 핵심 단어가 몇 초 늦게 나와 화면과 어긋나 보일 수 있습니다.
  • 외래어와 숫자: "API", "SaaS", "3.5GHz" 같은 표현을 영어식으로 읽을지 한국어식으로 읽을지는 TTS가 판단합니다. "2024년"을 "이천이십사 년"으로 읽는 것은 보통 문제없지만, 모델명이나 약어는 엉뚱하게 읽히기 쉽습니다.

반대로 한국어 영상을 다른 언어로 더빙할 때는 주어 생략이 문제가 됩니다. 한국어 화자는 "어제 갔는데 좋더라고요"처럼 누가 갔는지 말하지 않는 경우가 많고, 영어나 독일어는 주어를 반드시 넣어야 하므로 번역 모델이 주어를 추측해 채웁니다. 이 추측이 틀리면 "나는"과 "그들은"이 뒤바뀌는 오역이 생깁니다.

mydubly에서 AI 더빙이 진행되는 방식과 하지 않는 것

mydubly은 위의 네 단계를 브라우저에서 한 번에 처리하는 웹 앱입니다. 음성 인식은 오픈소스 음성 인식 모델인 Whisper를 기반으로 하고, 음성은 오픈소스 TTS 모델인 Chatterbox Multilingual로 만듭니다. 실제 사용 흐름은 다음과 같습니다(인터페이스는 영어입니다).

  1. 홈 화면의 영상 작업 공간 "Drop a video here"에 MP4, MOV, WebM, MKV, M4V 파일을 끌어다 놓습니다. 파일당 최대 2시간까지 가능합니다.
  2. 원본 언어는 "Source: Auto detect"로 자동 감지되며 직접 지정할 수는 없습니다.
  3. "Full translation output" 토글을 켜고 "Select language"에서 목표 언어를, "Select voice"에서 8가지 기본 음성 중 하나를 고릅니다. 음성 선택 창에서는 고른 언어로 짧은 샘플을 미리 들을 수 있습니다.
  4. "Translate video"를 누르고 작업이 끝날 때까지 탭을 열어 둡니다. 탭을 닫거나 다른 페이지로 이동하면 작업이 취소됩니다.
  5. 완료되면 "Download translated video"로 더빙 영상을, "Download subtitles"로 SRT 자막을 내려받습니다.

영상 파일 자체는 브라우저 밖으로 나가지 않습니다. 브라우저가 오디오만 추출해 HTTPS로 보내고, 번역된 음성을 받아 브라우저 안에서 영상과 다시 합칩니다. 업로드된 오디오와 결과물은 작업이 끝난 뒤 30분 안에 서버에서 삭제됩니다.

솔직하게 말하면 mydubly이 하지 않는 일도 분명합니다. 음성 복제를 하지 않으므로 원래 화자의 목소리를 재현하지 않습니다. 립싱크 기능이 없어 입 모양은 원본 그대로입니다. 화자 구분도 하지 않기 때문에 대담 영상이라도 모든 출연자가 같은 목소리 하나로 더빙됩니다. 감정 조절, 화면 속 글자 번역, 자막을 영상에 입히는 기능도 없습니다. 번역문을 앱 안에서 고치는 편집 화면도 없으니 대본을 다듬고 싶다면 내려받은 자막 파일을 편집기에서 수정해야 합니다. 더 자세한 기능 소개는 AI 더빙 도구 페이지 (영어)에 있습니다.

비용 계산 예시

5분짜리 제품 소개 영상을 한국어로 더빙하면 분당 50크레딧이 적용되어 250크레딧($0.25)입니다. 더빙은 파일당 최소 2분 요금이 붙으므로 1분짜리 짧은 영상도 100크레딧($0.10)이 듭니다. 가입 시 받는 100크레딧은 더빙 최소 요금과 같아서 2분 이내 영상 한 편은 무료로 더빙해 볼 수 있지만, 5분짜리 영상처럼 더 긴 영상은 충전이 필요합니다. 무료 크레딧을 자막이나 받아쓰기에 쓰면 최대 100분 분량까지 결과를 확인해 볼 수 있습니다.

더빙 결과물을 점검하는 실전 체크리스트

AI 더빙은 버튼 하나로 끝나지만, 공개하기 전에 한 번은 처음부터 끝까지 들어 보는 것이 좋습니다. 특히 아래 항목을 중심으로 확인하세요.

  • 고유명사: 회사명, 인명, 제품명이 제대로 읽혔는지 확인합니다. 잘못 읽힌 부분은 대개 1단계 받아쓰기에서 이미 틀린 경우가 많습니다.
  • 말투 일관성: 한국어로 더빙했다면 앞부분은 해요체인데 뒷부분이 합니다체로 바뀌지 않았는지 들어 봅니다.
  • 속도: 원문보다 번역문이 긴 구간에서 말이 지나치게 빨라지지 않았는지 확인합니다.
  • 숫자와 단위: 가격, 날짜, 치수는 화면 자막과 음성이 일치해야 신뢰를 잃지 않습니다.
  • 여러 화자: 화자가 두 명 이상이면 같은 목소리로 나오므로, 시청자가 누가 말하는지 헷갈리지 않을지 판단합니다.

문제가 많은 영상이라면 더빙 대신 자막으로 가는 것도 방법입니다. 자막은 시청자가 원래 목소리를 들으며 읽기 때문에 번역이 조금 어색해도 맥락으로 이해되는 경우가 많습니다. 유튜브용 자막 작업은 유튜브 자막 번역 가이드에서 이어서 볼 수 있습니다.

원본 녹음 단계에서 더빙 품질을 높이는 방법

네 단계 중 사용자가 가장 쉽게 개선할 수 있는 곳은 사실 첫 단계 이전, 즉 녹음입니다. 깨끗한 원본은 인식 오류를 줄이고, 인식 오류가 줄면 번역과 합성도 따라서 좋아집니다.

  • 배경 음악은 말소리보다 확실히 작게 깔고, 가능하면 편집 전 음성만 있는 버전으로 작업합니다.
  • 문장을 끝까지 말하는 습관을 들입니다. 문장이 완결되어야 번역 모델이 존댓말과 시제를 안정적으로 고릅니다.
  • 고유명사는 처음 등장할 때 또박또박 발음합니다. 화면에 글자로도 띄워 두면 시청자에게도 도움이 됩니다.
  • 두 사람이 동시에 말하는 구간은 줄입니다. 겹친 말은 인식도 번역도 어렵습니다.

결국 AI 더빙은 사람의 작업을 대신하는 자동화 파이프라인이고, 각 단계는 앞 단계의 결과에 기대고 있습니다. 원리를 알고 나면 어디에 손을 대야 결과가 좋아지는지 보이기 시작합니다.

자주 묻는 질문

AI 더빙과 TTS는 같은 건가요?

TTS는 텍스트를 음성으로 읽어 주는 기술 하나를 가리키고, AI 더빙은 그보다 넓은 과정입니다. AI 더빙에는 원본 음성을 받아 적는 음성 인식, 다른 언어로 옮기는 번역, TTS를 이용한 음성 합성, 원래 장면에 맞추는 타이밍 조정이 모두 포함됩니다. TTS는 그중 세 번째 단계에 해당합니다.

AI 더빙하면 제 목소리로 다른 언어를 말하게 할 수 있나요?

원래 목소리를 재현하려면 음성 복제 기술이 필요합니다. mydubly은 음성 복제를 하지 않고, 8가지 기본 음성 중 하나를 골라 더빙합니다. 본인 목소리가 꼭 필요하다면 번역 자막이나 번역 대본을 받아 직접 녹음하는 방법이 현실적입니다.

더빙 영상에서 입 모양이 안 맞는 이유는 무엇인가요?

타이밍 조정은 음성의 시작과 끝을 맞추는 작업이고, 입 모양은 영상 자체를 수정하는 립싱크 기술이 따로 있어야 바뀝니다. 언어마다 같은 의미를 말하는 데 필요한 음절 수와 입 모양이 다르기 때문에, 립싱크 없이 더빙하면 입 모양은 원래 언어 그대로 남습니다. 내레이션이나 화면 녹화처럼 얼굴이 크게 나오지 않는 영상에서는 이 차이가 덜 눈에 띕니다.

한국어 AI 더빙에서 말투가 중간에 바뀌는 건 왜 그런가요?

영어 같은 원문에는 높임 정보가 없어서 번역 모델이 문장마다 문맥을 보고 존댓말 수준을 추측합니다. 문장이 짧거나 앞뒤 맥락이 부족하면 구간마다 다른 선택을 할 수 있습니다. 자막 파일을 내려받아 말투를 통일한 뒤 확인하고, 더빙 결과가 마음에 들지 않으면 자막 버전을 쓰는 것도 방법입니다.

AI 더빙 비용은 영상 길이에 따라 어떻게 계산되나요?

mydubly은 구독 없이 선불 크레딧으로 결제하며, $1이 1,000크레딧입니다. 더빙은 시작된 1분마다 50크레딧이고 파일당 최소 2분 요금이 적용됩니다. 10분 영상이라면 500크레딧($0.50), 30분 영상이라면 1,500크레딧($1.50)입니다.

배경 소음이 많은 영상도 AI 더빙이 되나요?

작업 자체는 진행되지만 소음이 클수록 1단계 음성 인식에서 단어를 놓치거나 잘못 들을 가능성이 커집니다. 잘못 받아 적은 단어는 번역과 합성까지 그대로 이어지므로 결과물 품질이 떨어집니다. 가능하면 음성이 또렷한 원본으로 작업하고, 먼저 저렴한 받아쓰기로 인식 결과를 확인해 보는 것을 권합니다.