Whisperの仕組みをざっくり理解する
Whisperは、OpenAIが公開したオープンソースの音声認識モデルです。大量の多言語音声とその書き起こしを学習しており、日本語を含む多くの言語の音声をテキストに変換できます。音声を一定の長さの区間に区切り、音の特徴を表すデータに変換したうえで、それに対応する文字列を順番に予測していく、という仕組みです。
ポイントは、Whisperが「音を一文字ずつ聞き取っている」のではなく、「この音の並びなら、こういう文が続く可能性が高い」と文脈ごと予測している点です。このため、自然な文章が出てきやすい反面、音がはっきりしない箇所でも、もっともらしい別の言葉で埋めてしまうことがあります。日本語の精度を考えるうえで、この性質を知っておくことが出発点になります。
Whisperにはモデルの大きさの異なる複数の版があり、large-v3-turboは、高精度なlarge-v3をもとに処理を軽くした版です。また、faster-whisperは、Whisperのモデルをより速く動かせるように実装し直したソフトウェアです。詳しくはWhisperの解説 (英語)やlarge-v3-turboの解説 (英語)をご覧ください。
日本語の文字起こしで誤りが出やすいポイント
英語と比べて、日本語には文字起こしを難しくする特徴がいくつかあります。代表的なものを整理しておきます。
- 同音異義語
- 「公園・講演・後援」「意思・意志・医師」など、音が同じで漢字が違う語は文脈頼みになる
- 固有名詞
- 人名・社名・地名は学習データに少ないものほど、よく似た一般的な語に置き換わりやすい
- 句読点
- 話し言葉には句読点がないため、読点の位置や文の区切りがずれることがある
- 数字の表記
- 「三」「3」「さん」のように、漢数字・算用数字・かなの選び方が一定しない
- 表記の揺れ
- 「いただく/頂く」「こと/事」など、同じ語でもかなと漢字の使い分けがばらつく
録音:「来週のこうえんの資料、確認しておいてください」 → 出力:「来週の公園の資料、確認しておいてください」。前後に「登壇」「スライド」などの言葉があれば「講演」と判断されやすくなりますが、短い発言だけでは文脈が足りず、別の漢字になることがあります。
文として自然に読めてしまう誤りほど、見落としやすい点に注意してください。句読点のずれについては文字起こしの句読点がおかしいときの対処 (英語)も参考になります。
精度を左右する録音側の要素
同じモデルでも、録音の条件が変わると結果は大きく変わります。文字起こしの結果に不満があるときは、まず次の点を確認してみてください。
- 雑音:空調、車の走行音、カフェのBGMなどは、声と重なると聞き取りを妨げます
- 反響:会議室や体育館のように音が響く場所では、声がぼやけて誤りが増えやすくなります
- 話者の重なり:二人以上が同時に話すと、どちらの発言も崩れたり、片方が丸ごと抜けたりします
- 話し方:早口、小声、語尾が消える話し方、強い方言は認識が難しくなります
- 音量:録音レベルが低すぎる音声や、逆に大きすぎて音が割れた音声は、どちらも不利です
- BGMや効果音:動画の場合、ナレーションの後ろで流れる音楽が大きいと影響が出ます
逆に言えば、口元に近いマイクで静かな部屋で録った音声なら、同じWhisperでも読みやすい結果になりやすいということです。ファイル形式の違い(MP3かWAVかなど)より、録音の環境のほうが影響は大きいと考えてよいでしょう。
「精度」を数字で語ることの難しさ
文字起こしの精度は、研究の世界では誤り率で測られることが一般的です。英語では単語単位の誤り率(WER)が使われますが、単語の区切りがない日本語では、文字単位の誤り率(CER)で評価されることが多くあります。仕組みは単語誤り率(WER)の解説 (英語)で紹介しています。
ただし、こうした数字は評価に使った音声の種類によって大きく変わります。ニュース原稿の読み上げで測った数字は、雑談だらけの飲み会の録音にはそのまま当てはまりません。また、同じ「1文字の誤り」でも、助詞の違いは読めば分かる一方、金額の桁の誤りは致命的です。自分の用途での精度を知りたいなら、実際に使う種類の録音を数本試し、どんな誤りがどのくらい出るかを自分の目で確認するのが確実です。
無音や雑音で起きる「存在しない文」に注意
Whisperには、無音や雑音の区間に、実際には話されていない文を出力してしまうことがあると知られています。動画の最後に「ご視聴ありがとうございました」のような、誰も言っていない定型句が現れる、同じ文が何度も繰り返される、といった現象です。
こうした誤りを減らすために、音声のない区間を事前に検出して処理から外す「音声区間検出(VAD)」という技術がよく組み合わされます。仕組みは音声区間検出の解説 (英語)、現象の詳細はWhisperの幻覚についての記事 (英語)で紹介しています。それでも完全には防げないため、長い無音のあとや動画の終わり付近は、録音と照らし合わせて確認しておくと安心です。
誤りを減らすための実践的な工夫
録音前・処理前・処理後のそれぞれでできることがあります。
- 録音前:話し手の近くにマイクを置き、静かな場所を選ぶ。複数人なら発言が重ならないよう進行する
- 処理前:動画のBGMが大きい場合は、可能ならBGMを下げた書き出しを使う。音量が極端に小さい録音は、編集ソフトで適度に持ち上げておく
- 処理後:固有名詞・数字・専門用語を検索して重点的に確認する。同じ誤りが繰り返し出る語は、テキストエディタの一括置換で直す
- 公開前:句読点と表記の揺れを、媒体の表記ルールに合わせてそろえる
AIの出力は、仕上げ方の分類でいえば、言いよどみが一部省かれた下書きに近いものです。どこまで整えるかの判断には素起こし・ケバ取り・整文の解説が役立ちます。
mydublyにおけるWhisperの使われ方
mydublyの文字起こしは、faster-whisper(large-v3-turboモデル)による音声認識をベースにしており、無音区間を飛ばす音声区間検出も組み合わせています。ブラウザで動画や音声を読み込むだけで使えるため、自分のPCにWhisperの環境を用意する必要はありません。
- 動画は「Drop a video here」、音声は「Drop audio here」にファイルをドロップします。
- 「Full translation output」(音声の場合は「Audio and text output」)をオフにして、文字起こしのみのモードにします。「Select language」では話されている言語と同じ言語を選ぶと、翻訳なしの文字起こしになります。
- 「Transcribe video」または「Transcribe audio」を押し、結果を「Download transcript」や「Download timestamped transcript」で保存します。
料金は文字起こしなら1分1クレジット(1ファイル最低5クレジット)で、50分のセミナー動画なら50クレジット($0.05)です。精度について、mydublyとして数値を示すことはしていません。上で説明したとおり、結果は録音の条件に大きく左右されるため、まずは登録時の無料100クレジットで、実際の録音を試してみてください。
自分でWhisperを動かす場合との違いも整理しておきます。ローカル環境では、モデルの種類を選んだり、言語を明示的に指定したり、用語のヒントを与えたりといった調整ができます。一方mydublyでは、話されている言語は自動で判定され、手動で言語を指定したり、専門用語の辞書を登録したりすることはできません。話者の区別もしないため、複数人の録音では名前を手作業で付ける必要があります。手軽さを取るか、細かな調整を取るか、用途に合わせて選んでください。1ファイル2時間を超える録音の扱いは長時間の文字起こしの記事、動画からの文字起こしの全体像は動画の文字起こしページ (英語)で紹介しています。
よくある質問
Whisperの日本語の精度は何パーセントくらいですか?
精度は録音の条件や話の内容で大きく変わるため、一つの数字で示すのは適切ではありません。静かな環境で一人がはっきり話す録音と、雑音の多い座談会では、結果がまったく違います。自分が実際に扱う種類の録音で試し、誤りの傾向を確認するのが確実です。
Whisperで句読点がおかしくなるのはなぜですか?
話し言葉には句読点そのものが存在しないため、モデルが文脈から推測して付けているからです。息継ぎの位置と文の区切りが一致しない話し方では、読点の位置がずれたり、長い一文になったりします。公開する文章では、最後に人が読み直して句読点を整えるのが基本です。
人名や専門用語を正しく認識させる方法はありますか?
ローカルでWhisperを動かす場合は、用語をヒントとして与える方法があります。mydublyにはこうした用語登録の機能がないため、出力後に検索と一括置換で直すのが現実的です。よく出てくる用語の一覧を手元に用意しておくと、確認作業が速くなります。
動画の最後に話していない文が出てくるのはなぜですか?
Whisperは無音や音楽だけの区間で、学習データによく出てくる定型句を出力してしまうことがあります。動画の締めくくりの挨拶のような文が現れるのはこのためです。音声区間検出で無音を除く工夫はされていますが、動画の終わり付近は録音と照らし合わせて確認してください。
mydublyで日本語を指定して文字起こしできますか?
mydublyでは話されている言語を自動で判定する仕組みで、言語を手動で選ぶことはできません。通常の日本語の録音であれば、そのまま日本語として認識されます。日本語と英語が頻繁に切り替わる録音では、聞こえたとおりに文字にされますが、誤りが増えることがあります。
large-v3とlarge-v3-turboでは日本語の精度は違いますか?
large-v3-turboはlarge-v3をもとに処理を軽くした版で、速さを重視した設計です。どちらが自分の録音に向くかは、録音の内容によって変わります。mydublyはlarge-v3-turboを使っており、モデルを切り替える機能はありません。
