解説

AI 吹き替えの仕組み:音声認識から声づくり、尺合わせまでの4工程

AI 吹き替えの仕組みは、元の音声を文字にする「音声認識」、その文を訳す「翻訳」、訳文を声にする「音声合成」、声を元の映像の時間に収める「タイミング調整」の4工程の組み合わせです。それぞれの工程に得意・不得意があり、日本語では特に尺と文字数、敬語、漢字やカタカナ語の読みが仕上がりを左右します。

約8分で読めます · 更新日

ご注意:mydubly の操作画面は現在英語のみです。日本語音声の文字起こし、日本語への翻訳、日本語音声の生成には対応しています(ボタンの表記が英語になります)。

AI 吹き替えは「4つの技術のリレー」

従来の吹き替えは、翻訳者が台本を作り、声優がスタジオで映像に合わせて演じ、エンジニアが音を仕上げるという、人の手による工程でした。AI 吹き替えは、このうち翻訳と声の部分をそれぞれ別の AI 技術に置き換え、順番にバトンを渡していく仕組みです。

  1. 音声認識:元の動画の話し声を文字にし、いつ話しているかの時刻を記録する。
  2. 翻訳:文字になった発言を、目的の言語に訳す。
  3. 音声合成:訳した文を、人の声のような音声に変える。
  4. タイミング調整:作った音声を、元の発言があった時間に収まるよう配置する。

リレーなので、前の走者のミスは後ろに引き継がれます。音声認識で「会議」が「解雇」と聞き違えられれば、翻訳も音声もそのまま間違えます。仕上がりに違和感があったとき、どの工程で起きた問題かを見分けられると、対処がずっと楽になります。全体像はAI 動画翻訳の仕組み (英語)でも解説しています。

工程1:音声認識で「何を、いつ話したか」をつかむ

最初の工程では、音声認識モデルが話し声を文字に変えます。近年よく使われているのが、オープンソースの音声認識モデル Whisper です。多くの言語に対応し、話されている言語を自動で判別できるのが特徴です。

吹き替えで重要なのは、文字だけでなく「どこからどこまで話していたか」という時刻の情報です。無音の部分を検出して飛ばす仕組み(音声区間検出)を組み合わせると、発言ごとのまとまりと、その開始・終了時刻が得られます。この時刻が、後の工程で声を配置する「枠」になります。

この工程が苦手とするのは、雑音の多い録音、複数人の同時発話、聞き慣れない固有名詞です。精度の考え方はWhisper の文字起こし精度の記事で詳しく扱っています。

工程2:翻訳で「意味」を別の言語に移す

次に、発言のまとまりごとに目的の言語へ訳します。ここでの難しさは、話し言葉が書き言葉ほど整っていないことです。言い直し、途中で切れる文、「えーと」といったつなぎ言葉が混ざるため、文脈を踏まえて意味をくみ取る必要があります。

吹き替えの翻訳には、字幕とは別の制約もあります。字幕なら長い訳を2行に分けて表示できますが、吹き替えでは訳文を声に出したときの長さが、元の発言の時間に収まらなければなりません。翻訳の段階で簡潔な言い方が選ばれるかどうかが、後の工程の自然さに直結します。

工程3:音声合成で訳文を「声」にする

3つ目の工程は、テキストを読み上げる音声合成(TTS)です。mydubly では、オープンソースの多言語音声合成モデル Chatterbox Multilingual で声を生成しています。

最近の音声合成は、単語を一つずつつなげるのではなく、文全体を見て抑揚や間を付けるため、以前の機械音声に比べてずっと自然に聞こえます。ただし、怒っている、ささやいている、といった感情の細かい表現や、元の話し手の声質を引き継ぐことは、使う仕組みによって大きく異なります。声づくりの技術はAI 音声生成の仕組み (英語)で詳しく解説しています。

工程4:タイミング調整で映像の時間に収める

最後に、生成した声を元の発言があった時刻に並べます。訳した音声が元の発言より長い場合、一般的には話す速さを少し上げる、訳文を短くする、次の発言との間を詰める、といった方法で調整します。逆に短い場合は、無音の時間が生まれます。

注意したいのは、ここでいう調整は「時間」を合わせるもので、「口の形」を合わせるものではない点です。画面の人物の唇の動きまで訳した言葉に合わせる技術はリップシンクと呼ばれ、別の処理が必要になります。

日本語ならではの3つの課題

日本語が関わる AI 吹き替えでは、ほかの言語にはない課題があります。

まず尺と文字数の問題です。英語の短い一言が、日本語では長い説明になることがあります。「Got it」は「承知しました」、「Thanks for having me」は「お招きいただきありがとうございます」となり、声に出すと時間が延びます。英語から日本語への吹き替えでは早口に聞こえる箇所が出やすく、逆に日本語から英語では間が空きやすくなります。

次に敬語の一貫性です。同じ人物の発言が、ある場面では「です・ます」、別の場面ではくだけた口調になると、聞き手は違和感を覚えます。字幕より音声のほうが、この揺れが耳に残ります。

最後が読み間違いです。日本語には同じ漢字で読みが複数ある語や、英語由来のカタカナ語、アルファベットの略語が多く、音声合成が意図と違う読み方をすることがあります。

読み間違いが起きやすい例

「今日は」→「きょうは」か「こんにちは」か /「行った」→「いった」か「おこなった」か /「生物」→「せいぶつ」か「なまもの」か /「SaaS」「API」などの略語 → 一文字ずつ読まれるか単語として読まれるか

固有名詞の読み間違いへの対処はAI 音声が名前を読み間違えるとき (英語)も参考になります。

mydubly の AI 吹き替えでできること・できないこと

mydubly はブラウザで動く動画翻訳アプリで、上の4工程をまとめて行います。動画をドロップし、「Full translation output」をオンにして、「Select language」で翻訳先、「Select voice」で声を選び、「Translate video」を押す流れです。動画ファイル自体はブラウザの中にとどまり、送られるのは抽出された音声だけで、翻訳された音声トラックを元のタイミングに合わせて配置した動画もブラウザ内で組み立てられます。

対応言語
日本語、英語、韓国語、中国語など21言語(地域別の選択肢を含め25通り)。どの組み合わせにも翻訳可能
声
8種類の既成ボイス。選択画面で、選んだ言語でのサンプルを聞ける
出力
翻訳済みの動画(Download translated video)と音声(Download translated audio)
できないこと
話し手の声のクローン、リップシンク、話者ごとの声の使い分け、感情の指定、画面上の文字の翻訳
料金の計算例

吹き替えは1分50クレジットで、1ファイルの最低料金は2分ぶんの 100 クレジット($0.10)です。30分の講座動画なら 1,500 クレジット($1.50)。登録時の無料 100 クレジットはちょうど吹き替えの最低料金ぶんなので、2分以内の動画1本なら吹き替えを試せます。30分の講座動画のように長いものは、クレジットの追加が必要です。

元の話し手の声を残したい動画、複数の人物が掛け合う動画、口元がアップで映る動画には向きにくいのが正直なところです。逆に、ナレーション中心の解説動画や研修動画は相性がよい分野です。機能の詳細はAI 吹き替えのページ (英語)をご覧ください。

人の吹き替えとの使い分けを考える基準

AI と人のどちらが優れているかではなく、動画の目的で選ぶのが現実的です。

  • 公開範囲:社内研修や一時的な告知は AI、ブランドの顔になる広告やドラマ作品は人の声優、という分け方がよく見られます。
  • 感情表現の重要度:演技や感情の起伏が価値になる作品は、人の演技が欠かせません。
  • 更新頻度:内容が頻繁に変わる操作説明動画は、作り直しやすい AI のほうが運用しやすいことがあります。
  • 確認体制:AI を使う場合でも、目的の言語がわかる人が最後に聞いて確認できるかが前提です。

より詳しい比較はAI 吹き替えと人の吹き替え (英語)にまとめています。日本語と韓国語のように具体的な言語の組み合わせでの注意点は、韓国語の動画翻訳の記事も参考にしてください。

よくある質問

AI 吹き替えで自分の声を使うことはできますか?

技術としては、話し手の声を学習して再現する「ボイスクローン」と呼ばれる仕組みがあります。ただし mydubly にはこの機能はなく、用意された8種類の既成ボイスから選ぶ方式です。自分の声で多言語版を作りたい場合は、別の方法を検討する必要があります。

AI 吹き替えの日本語は自然に聞こえますか?

音声合成の技術は大きく進歩していますが、自然さは文の内容や長さ、固有名詞の多さによって変わります。mydubly では声を選ぶ画面で各ボイスの日本語サンプルを聞けるので、まずはサンプルで印象を確かめてください。仕上がった動画は、日本語のわかる人が最後まで聞いて確認することをおすすめします。

口の動きと声がずれるのはなぜですか?

AI 吹き替えのタイミング調整は、発言の時間の枠に声を収めるもので、唇の動きを合わせるものではないためです。言語が変われば口の形も変わるので、顔がアップで映る場面ではずれが目立ちます。mydubly には口の動きを合わせる機能はないため、ナレーション中心の動画で使うのが向いています。

背景の音楽や効果音はどうなりますか?

mydubly では AI による音声分離で元の話し声を取り除き、残った BGM や効果音を翻訳音声の下に重ねて、新しい声が話している間は自動で音量を下げます。分離は完璧ではなく、密度の高いミックスでは元の声がかすかに残ることがあり、歌詞のある曲は歌声も取り除かれます。BGM を自分で調整したい場合は、編集プロジェクトからセリフだけを書き出して吹き替え、ほぼ翻訳音声だけになった結果を編集ソフトで BGM と合わせてください。通常の吹き替えでダウンロードした音声には元の BGM がすでに含まれているため、そこに BGM を重ねると二重になります。

AI 吹き替えにかかる時間はどのくらいですか?

処理時間は動画の長さや混み具合によって変わるため、一律には言えません。mydubly では処理中にブラウザのタブを閉じたりページを移動したりするとジョブが取り消されるので、終わるまでタブを開いたままにしておいてください。取り消されたジョブのクレジットは返却されます。

吹き替えと字幕はどちらを選ぶべきですか?

どちらが上ということはなく、視聴者と場面で選びます。画面から目を離せない作業手順や、文字を読むのが負担な視聴者には吹き替え、話し手本人の声や雰囲気を残したい動画や、費用を抑えたい場合は字幕が向いています。両方を用意して視聴者に選んでもらう方法もあります。