INMU KINGはどうやって作られた?

目次
  1. INMU KINGの制作について、確認できること
  2. 同じようなAI MVを作る場合の6工程
  3. 「使用AIを当てる」より、工程を分けて考える
  4. 同じ形式を作るなら、まず短い30秒MVから
  5. 次に読む記事
  6. 参考資料

作者であるやじゅまん氏の投稿では、Sunoと制作費への言及を確認できます。動画生成モデルや編集方法は、その投稿だけでは分かりません。ここでは作者が説明した情報と、同種のMVを作るための制作例を分けて紹介します。 当サイト独自の視点もありますのでご注意ください。

INMU KINGの制作について、確認できること

INMU KINGは2026年8月10日に「やじゅまん」氏が公開した楽曲・ミュージックビデオです。作品タイトルにはYAJU-MCという名義が使われています。ネット上では「何のAIで作ったのか?」という疑問が非常に多い一方、参照した投稿には、動画生成モデル名や詳しい制作工程は記載されていません。

ただし、やじゅまん氏は制作費について「動画部分で大体4万円くらい、Sunoなども含めると5万円弱」という趣旨の投稿をしています。ここから少なくとも、楽曲制作にSunoを利用したこと、動画部分に費用がかかったことを確認できます。生成回数や費用の内訳までは、この投稿から判断できません。

生成AI動画は、完成映像の長さだけを見て費用を考えると実態を見誤ります。5秒の完成カットでも、狙った映像になるまで複数回作り直す場合があります。人物の顔が変わる、手が崩れる、カメラが意図と逆へ動く、背景の文字が化ける、動きが弱い、といった失敗を捨てながら使えるカットだけを残すからです。

同じようなAI MVを作る場合の6工程

1. まず「何を見せる曲か」を決める

最初に必要なのはAIではなく構成です。4分のMVなら、イントロ、Aメロ、Bメロ、サビ、2番、間奏、ラスサビ、アウトロのように曲を区切り、それぞれで何を見せるのかを決めます。人物が歩く、群衆が集まる、王座に座る、別キャラクターが登場する、といった場面を先に表へ落とすだけで生成回数を大きく減らせます。

INMU KINGのように「元ネタを知っている人ほど細部で笑える」タイプでは、単に映像を豪華にするだけでは不十分です。どの歌詞でどの人物・語録・構図を出すのかという編集設計が作品の面白さになります。生成した構成案を使う場合も、歌詞と元ネタの対応を確認してからカット表にします。

2. 楽曲を作る

現在はSunoのような音楽生成サービスで、ジャンル、テンポ感、ボーカルの雰囲気、構成、歌詞を指定して楽曲を作れます。INMU KINGについては作者自身の制作費の投稿(2026年9月8日)でSunoへの言及が確認できます。

ただし、狙った曲を一発で出すより、複数案を生成して「サビはこの案」「声質はこの案」と比較する方が現実的です。商用利用を予定する場合はプラン条件にも注意が必要です。Sunoは2026年9月以降の規約で、原則として有料プランで許可されたダウンロードを行った自作曲に商用利用権を付与しています。無料利用で作った曲を、あとから有料プランへ入っただけで当然に商用化できるとは限りません。

3. キャラクターと画面の基準画像を作る

動画生成AIへ毎回テキストだけを入れると、カットごとに人物の顔・服装・体格が変わりやすくなります。そこで、まず「この人物はこの見た目」という基準画像を作り、その画像をImage to Videoへ渡す方法が有効です。

生成する静止画では、真正面だけでなく、横顔、全身、上半身、屋外、室内など数種類を用意すると後工程が楽になります。MVでは一つの長い動画を作るより、2〜10秒程度の短いカットを何十本も作って編集でつなぐ方が、失敗した場面だけ作り直せます。

4. 画像を短い動画へ変換する

2026年時点ではRunway Gen-4.5、GoogleのVeo 3.1系、Kling 3.0系、Adobe Firefly Videoなど、画像から動画へ変換できる選択肢が複数あります。たとえばRunway Gen-4.5はText to VideoとImage to Videoに対応し、2〜10秒のクリップを生成できます。Image to Videoでは、画像そのものの説明を繰り返すより「人物がどう動くか」「カメラがどう動くか」を書くのが公式の推奨です。

Adobe Fireflyでは自社モデルだけでなく、Runway Gen-4.5、Veo 3.1、Kling 3.0など複数のパートナーモデルを同じ制作環境から選べるようになっています。最初から1モデルへ固定せず、同じ基準画像を何種類かのモデルへ投げて、得意な場面だけ採用する作り方もできます。

5. 台詞や歌に合わせて人物を動かす

歌っている人物を作りたい場合、普通のImage to Videoだけでは口の動きと音声が一致しないことがあります。そこでリップシンクやパフォーマンスキャプチャを別工程として使います。RunwayのAct-Twoでは、人が演技した演技動画とキャラクター画像・動画を組み合わせ、表情、発話、身体の動きをキャラクター側へ転写できます。

ここで重要なのは、すべてのカットで完璧に口を合わせようとしないことです。MVは横顔、遠景、後ろ姿、群衆、建物、手元などを混ぜられます。顔のアップだけを必要な箇所に限定すると、制作コストを抑えながら完成度を上げやすくなります。

6. 最後は普通の動画編集が必要

生成AIから出てくるのは「素材」であって、MVそのものではありません。楽曲へ合わせてカットを切る、不要なフレームを削る、速度を変える、色味をそろえる、字幕を載せる、効果音を足す、といった最後の仕事は編集ソフトで行います。

PremiereにはFireflyを使った生成延長もあり、映像を最大2秒、音声を最大10秒延長できます。MVで「あと数フレームだけ欲しい」「カットの切り替えまで長さが足りない」といった場面には便利です。なお、音楽そのものを生成延長する機能ではなく、会話や音楽を含む素材には制限があります。

「使用AIを当てる」より、工程を分けて考える

AI動画を見ると「これはVeo?Kling?Runway?」と一つのモデル名を当てたくなります。しかし完成したMVでは、静止画と動画で別AIを使い、場面ごとにモデルを変え、口パクだけ別ツールを使い、最後に人間が編集している可能性があります。さらにアップスケールやフレーム補間まで含めれば、一本の動画に複数の生成モデルが混ざることは自然です。

そのためINMU KINGについても、公開されていない工程を映像だけから断定するのは避けるべきです。確認できるのは作者によるSunoと制作費への言及までで、動画モデル名は、参照した一次情報では確認できていません。

同じ形式を作るなら、まず短い30秒MVから

いきなり4分のMVを作ろうとすると、必要カット数が一気に増えます。最初はサビ30秒だけ作り、5秒カットを6本程度用意する方法がおすすめです。「基準画像を作る→6カット生成→曲へ合わせて編集」という一周を経験すれば、自分が最も時間を使う工程が分かります。

映像生成に時間がかかる人もいれば、キャラクター固定が難しい人、曲選びで迷う人もいます。ボトルネックが見えてから有料プランを選んだ方が、使わないAIへ課金し続ける失敗を減らせます。

次に読む記事

参考資料