AI音声・ナレーションの作り方
目次
映像だけAIで作っても、ナレーションや台詞が機械的だと一気に「生成物っぽさ」が出ます。AI音声は、文章を読むTTSだけでなく、話し方・感情・速度を調整したり、長尺をStudioで整えたり、多言語化したりできる段階まで来ています。MVの寸劇、解説動画、ショート動画、キャラクター紹介では特に効果が大きい工程です。
AI音声でできること
もっとも基本的なのはText to Speech、つまり文章から音声を作る機能です。台本を入力して声を選び、生成した音声を動画編集ソフトへ持っていきます。単なる読み上げだけでなく、サービスによっては笑い、ささやき、興奮した話し方などの表現を指示できます。
さらに、既存の声・演技を別の音色へ変えるSpeech to Speech、複数の音声を並べて長尺作品を整えるStudio、他言語への吹き替え・ローカライズなどもあります。対応言語や演技の指定方法はモデルごとに異なるため、日本語の台本を短く生成して読み方を確認します。
動画制作者がAI音声を使う場面
1. 解説ナレーション
AI動画の作り方、ニュース、ランキング、商品紹介のような動画では、説明を聞き取れるように、読み方と音量を確認します。毎回自分で録音しなくても、台本の修正後すぐ音声を作り直せるのがAI音声の強みです。
2. キャラクターの台詞
MVの前後に寸劇を入れる、キャラクターが一言しゃべる、複数人物が会話するといった使い方です。同じキャラクターへ同じ声を割り当てれば、映像だけでなく音でも人物を固定できます。
3. 海外向け吹き替え
日本語版を作った後、英語、中国語などへ展開する場合、字幕だけでなく音声まで変えると視聴体験が大きく変わります。特にShortsやTikTokでは画面内テキストを読む前に離脱されることもあるため、音声ローカライズが有効な場合があります。
4. 仮ナレーション
最終的には人間のナレーターを使う動画でも、編集段階の仮音声としてAIを使えます。台本の長さ、カットの尺、字幕の位置を先に決めてから本録音できるので、編集の手戻りを減らせます。
ElevenLabsを使う流れ
基本は難しくありません。台本を準備し、Text to Speechで声を選び、文章を生成して聞き比べます。長い文章を一気に生成するより、段落やセリフ単位で区切った方が、気に入らない部分だけ作り直せます。
台本は「読み上げ用」に直すのがポイントです。Web記事の文章をそのまま読むと、一文が長すぎたり括弧が多かったりして聞きづらくなります。1文を短くし、数字の読み方や英字表記を必要に応じてひらがな・カタカナへ直します。
動画編集側では、まず音声をタイムラインへ置いてから映像を合わせる方法がおすすめです。人は声の途中を不自然に切ると違和感を感じやすいため、先にナレーションの間を確定し、その間へAI動画や画像を並べます。
自然に聞かせるコツ
文章を「書き言葉」から「話し言葉」へ変える
一文に複数の話題を詰めず、聞き手が区切りを捉えられる長さにします。例えば「音声の生成後、字幕作成および音量調整を実施します」は「声ができたら、字幕を付けます。最後に音量をそろえます」と分けられます。
句読点を演出として使う
読点や句点は音声の間に影響します。重要な一言の前後を短い文へ分けるだけでも聞きやすくなります。生成モデルによっては音声タグや感情表現を使えるため、必要な場面だけ演技を強めます。
すべてを同じテンションにしない
30秒のショートなら勢いで押せますが、数分の解説動画ではずっと大声だと疲れます。導入は少し強め、説明は落ち着いて、結論だけ再び強くするなど、場面で変化を付けます。
音声だけで完成と考えない
編集時にBGM、環境音、効果音を入れると声の違和感が目立ちにくくなります。コンプレッサーやEQで音量をそろえるのも有効です。AI音声の品質だけではなく「動画全体の音」として整えます。
商用利用はできる?
ElevenLabsは公式ページで、有料プランには生成した音声の商用利用権が含まれると案内しています。YouTube動画、Podcast、広告、オーディオブック、映画、ゲーム、アプリなどが例として挙げられています。一方、無料プランは個人・非商用向けで、帰属表示も必要と説明されています。
ここで注意したいのは「サービス側が商用利用を許可している」ことと、「どんな声でも自由に作っていい」ことは別だという点です。他人の声を本人の許可なくクローンする、著名人本人が言っていない内容を本人の発言のように見せる、といった利用には別の権利や規約上の問題があります。
自分の声、自社キャラクター、許諾を受けた出演者など、利用権限が明確な素材を使うのが基本です。広告に使う場合は特に「本人が推奨しているように見える」表現を避ける必要があります。
AI音声だけでなく「字幕」とセットで作る
音声が完成したら、その音声を元に字幕を作ります。字幕は全文章をそのまま表示するより、1〜2行に短く切った方がスマホで読みやすくなります。声と字幕が同じタイミングで出ることで、無音視聴にも対応できます。
多言語展開では、日本語音声、英語音声、中国語音声を別々の動画として書き出す方法もあります。映像を共通化できれば、一度作ったAI動画を複数市場で使い回せます。ただし文化的なジョークやネットミームは直訳すると意味が消えるため、翻訳より「現地向けの言い換え」が必要です。
MVで歌声までAIにする場合
ナレーションと歌唱は別物です。楽曲そのものをAIで作るならSuno等の音楽生成サービス、台詞・ナレーションならElevenLabs、と役割を分けた方が分かりやすくなります。Sunoの有料プランでは、許可されたダウンロードを行った自作曲に商用利用権が付与されますが、無料曲や他人のRemixでは条件が異なります。
「曲はSuno、セリフはElevenLabs、映像はRunwayやVeo、仕上げはPremiere」というように複数サービスを組み合わせるのが、2026年のAI MV制作では自然な構成です。
実際に使う前のチェックリスト
- 収益化するなら有料プランの商用利用条件を確認したか
- クローンする声について本人の権利・許可を確認したか
- 台本に他人の著作物をそのまま大量利用していないか
- 広告の場合、実在人物が商品を推奨しているような表現になっていないか
- 長文を一括生成せず、修正しやすい単位へ分けたか
- 字幕・BGM・効果音まで含めた最終音量を確認したか
AI動画との組み合わせ例
30秒のキャラクター紹介動画なら、まず画像を1枚作り、Runwayなどで5秒程度の動きを複数生成します。その後、ElevenLabsで15〜20秒程度のセリフを作り、必要なカットだけリップシンク。最後にPremiereで声、映像、BGM、字幕を合わせます。
すべてのカットで喋らせる必要はありません。アップの2カットだけ口パクを合わせ、残りは歩く姿や背景を見せるだけでも十分MVになります。AIの高コスト工程を「目立つ場所だけ」に使うのが効率的です。