プロンプト
シーンを自然言語で記述したものです。被写体、舞台、ライティング、カメラワーク、ムードをカバーします。最重要の入力項目であり、モデルはこのテキストを1語ずつ読み込みます。
Example: シネマティックな雨に濡れた夜の東京の街、レザージャケットの若い女性が振り返る、水たまりに映るネオン、ハンドヘルドでのゆっくりとしたプッシュイン、アンバーとティールのカラーグレード。
AIミュージックビデオクリップジェネレーター
シーンのプロンプトを入力するか、参照画像をアップロードするだけで、2分以内にシネマティックなミュージックビデオクリップを生成。Veo 3.1 Fast と Seedance Pro Fast を搭載しています。
Ctrl/Cmd + Enter で生成できます。初回の生成には30〜90秒かかる場合があります。
1つのシーンプロンプトや参照画像から、完成したミュージックビデオクリップを作ることに特化した AI ツールです。
スクリプトから動画を生成するツールとは、1つのシーンプロンプトを、ダウンロード可能な完成済みミュージックビデオクリップに変える特化型の AI 動画ツールです。ムードや舞台、キャラクターの動きといった短い説明文を入力し、モデルとアスペクト比を選ぶだけで、30〜90秒でシネマティックなクリップが届きます。ストーリーボードの準備も、シーンごとのクリック操作も、プロジェクトファイルの管理も不要です。「このショットの仕上がりはもう決まっている、あとはレンダリングするだけ」という場面のために作られたツールです。
このツールは、現在手に入る最高レベルの AI 動画モデルを2つ組み合わせています。Veo 3.1 Fast はテキストから動画を担当し、自然言語でシーンを描写すると、動き・ライティング・奥行きを備えたシネマティックなフレームを返します。Seedance Pro Fast は画像から動画を担当し、キャラクターのモックアップ、Nano Banana のレンダリング結果、過去のクリップの1フレームなどの静止画をアップロードすると、そのフレームにリアルな動きを与えます。どちらのモデルも標準の MP4 ファイルを出力するので、そのまま編集ソフトや SNS、ライブ映像の背景に使えます。
GetLyricVideo AI のワークフローでは、このツールはミュージックビデオスクリプトジェネレーターの次のステップに位置します。スクリプトジェネレーターが、曲全体の時間軸に沿った設計図(シーンの説明、画像プロンプト、動画プロンプト)を作成します。その中のシーンを実際に完成したクリップとして作りたいときに使うのが、このツールです。スクリプトの JSON からシーンを1つ貼り付けても、スクリプトを使わずに新しいプロンプトを入力してもかまいません。1回の実行で作るのは1本のクリップであり、完成動画ではありません。だからこそ、テンポや選択、最終的な編集は常にユーザーの手中にあります。

クリップの仕上がりを決めるのは6つの入力項目。ここを押さえれば、モデルは必要な情報をすべて受け取れます。
スクリプトから動画を生成する際、毎回6つの入力を使います。それぞれが被写体、フレーミング、動き、フォーマットといった出力の特定の要素を制御します。各項目の役割と、迷ったときの書き方を解説します。
シーンを自然言語で記述したものです。被写体、舞台、ライティング、カメラワーク、ムードをカバーします。最重要の入力項目であり、モデルはこのテキストを1語ずつ読み込みます。
Example: シネマティックな雨に濡れた夜の東京の街、レザージャケットの若い女性が振り返る、水たまりに映るネオン、ハンドヘルドでのゆっくりとしたプッシュイン、アンバーとティールのカラーグレード。
画像から動画モードでビジュアルの基準となる、任意の静止フレームです。Seedance Pro Fast はこのフレームを最初のショットとして使い、その上に動きを生成します。Veo 3.1 Fast では使用されません。
Example: スクリプトジェネレーターで生成した主人公の9:16ポートレートや、続きを作りたい過去のクリップの1フレームなど。
生成パイプラインを決めます。純粋なテキストから動画には Veo 3.1 Fast。フレームが既にある場合の画像から動画には Seedance Pro Fast。この選択はクリップごとのコストにも影響します。
Example: まったく新しいロケーションショットなら Veo 3.1 Fast。キャラクターのポートレートを動かしたいなら Seedance Pro Fast。
出力フレームの形状です。YouTube やワイド画面には16:9、TikTok・Reels・ショート動画には9:16、正方形の SNS 投稿には1:1。クリップが実際に視聴される場所に合わせて選びます。
Example: Instagram Reels のティーザーには9:16の縦型。YouTube のミュージックビデオ B ロールには16:9のワイド。
完成クリップの長さです。生成のほとんどは5〜12秒に収まります。短いクリップほど速くレンダリングでき、クレジットも少なく済みます。長いクリップは、カメラワークやストーリーの展開に余裕を持たせられます。
Example: 歌詞1行分の B ロールには8秒。複数のビートを含むイントロのロケーションショットには12秒。
納品物は、選択したアスペクト比と長さの標準 MP4 ファイルです。ダウンロードして任意の編集ソフトに取り込んだり、複数のクリップをつないで完全なミュージックビデオにしたりできます。
Example: MP4、1080p、16:9、8秒。DaVinci Resolve、Premiere、CapCut にそのまま取り込めるほか、直接アップロードも可能です。
アイデアからダウンロード可能なクリップまでの4ステップです。
Step 1
作りたいミュージックビデオの一瞬を、ムードや舞台、キャラクターの動きなどの短いプロンプトで入力します。自然言語をそのまま解釈できるので、撮影監督に伝えるつもりで書けば大丈夫です。
プロンプト例:シネマティックな雨に濡れた夜の街、レザージャケットの若い女性が振り返る、ゆっくりとしたハンドヘルドのプッシュイン、アンバーとティールのカラーグレード、9:16。
Tip: 被写体とカメラワークを文の前半に置くのがコツです。モデルは「広範囲のパノラマ」よりも「クローズアップ、ゆっくりとしたプッシュイン」のほうがきれいに再現します。
Step 2
純粋なテキストから動画には Veo 3.1 Fast を選択します。参照画像をアップロードすると、画像から動画の Seedance Pro Fast に切り替わります。アスペクト比(16:9、9:16、1:1)と長さ(5〜12秒)を選びましょう。
ゼロから新しいシーンを作るなら Veo 3.1 Fast。動かしたい静止フレームが既にあるなら Seedance Pro Fast。
Tip: アスペクト比は投稿先に合わせましょう。TikTok と Reels は9:16、YouTube は16:9。同じプロンプトを別の比率で使い回しても問題ありません。モデルはきれいに再生成してくれます。
Step 3
生成をクリックします。ほとんどのクリップは、モデルと長さに応じて30〜90秒で完成します。結果ページで進行状況をリアルタイムに確認でき、その場で MP4 をプレビューしてから採用するか再生成するかを決められます。
結果ページには、レンダリングされたクリップ、使用したプロンプト、ダウンロードボタンが表示されます。ブラックボックス的なキューも、メールを待つ必要もありません。
Tip: クリップが惜しい仕上がりのときは、最初からやり直すより、プロンプトを磨いて再生成するのがおすすめです。「被写界深度を浅く」を追加する、「ワイドショット」を外す、といった小さな言い換えで、2回目には狙いに近づくことが多いです。
Step 4
出力は標準の MP4 です。リリックビデオのタイムラインに組み込むことも、TikTok や Reels にティーザーとして投稿することも、ライブ映像の背景用に複数クリップをつなぐことも、統合ツールでオーディオと組み合わせて完全なミュージックビデオにすることもできます。
ダウンロード → DaVinci Resolve に取り込み → オーディオと同期 → 最終的なミュージックビデオを書き出し。編集せずに SNS へ直接アップロードしてもかまいません。
Tip: うまくいったプロンプトは保存しておきましょう。実績のあるプロンプトを少し調整して貼り付けるのが、同じプロジェクトで統一感のあるクリップを量産する最短ルートです。
歌詞のアイデアがあるならテキストから動画。フレームが既にあるなら画像から動画を選びましょう。

おすすめ:テキストプロンプトからシネマティックなシーンを作りたい場合
テキストから動画。参照画像は不要
Veo 3.1 Fast は、このツールのテキストから動画モードです。被写体、舞台、ライティング、カメラワークを自然言語で描写すると、入力フレームなしでシネマティックなクリップを生成します。歌詞の一行やムードのアイデア、スクリプトジェネレーターのプロンプトを出発点に、モデルが何を作り出すか見てみたいときに最適です。
Output: 16:9 ワイドまたは 9:16 縦型の8秒 MP4 クリップ — 1回の生成につき28クレジット

おすすめ:静止フレームに動きをつけて動かしたい場合
画像から動画。参照画像が必須
Seedance Pro Fast は、このツールの画像から動画モードです。Nano Banana のキャラクターレンダリング、過去のクリップのフレーム、ストック写真などの静止フレームをアップロードすると、その画像を基にリアルな動きを生成します。ビジュアルの基準になる画像が既にあり、それを活かしたいときや、テキストから動画だと主人公が思いどおりにならないときに使います。
Output: 16:9、9:16、1:1 から選べる5〜12秒の MP4 クリップ — 長さに応じて14〜42クレジット
以下は、1つのシーンプロンプトに対してこのツールが返す出力例です。

シーン03
あなたの名前を聞くたび、走って戻ってしまう
Generated clip
A finished MP4-style result preview with the same prompt, model, aspect ratio, and duration surfaced on the result page.
Model
Veo 3.1 Fast
Format
16:9
Duration
8s
Cost
28 credits
Preview the clip, download it, or retry once if the motion does not match the scene.
画像プロンプト
Cinematic rain-soaked street, neon signs, wet pavement reflections, emotional chorus close-up, teal and amber music video lighting.
動画プロンプト
Slow handheld push-in as the performer turns toward camera; subtle hair movement, rippling reflections, timed to the chorus beat.
実際の出力は、ダウンロード可能な MP4 クリップです。結果ページには使用したプロンプト、モデル、アスペクト比、長さも表示されるので、良い結果はそのまま再現し、惜しい結果は微調整して再生成できます。
スクリプトからの動画生成で制作時間を実際に短縮できる、4つのワークフローです。
歌詞の一行のムードに合うシネマティックな映像を、2分以内に生成できます。ロケハンもストック映像探しもショットごとのレンダリングも不要。プロンプトを入力し、クリップをプレビューし、タイムラインに入れるだけ。歌詞の一行に映像が必要なのに、撮影に半日もかけられない、まさにそのためのツールです。
本番の撮影前に、次のミュージックビデオのビジュアルアイデアを試せます。異なるプロンプトから3〜4パターンのクリップを生成して並べて比較し、ロケーションを予約する価値のある方向性を見極めましょう。以前は半日の撮影が必要だったコンセプトプレビューが、キーボード前の午後ひとときで完成します。
TikTok、Reels、YouTube Shorts 向けに、8〜12秒の縦型ティーザーを作成できます。9:16 でクリップを生成し、MP4 をダウンロードして SNS に直接アップロード。編集ソフトは不要です。歌詞の一行と組み合わせれば、そのまま公開できるティーザーが5分以内に完成します。
コンサートスクリーンにそのまま投影できる、アブストラクトにもナラティブにもできる映像です。12秒のクリップを複数連結し、曲のセクションに合わせて、ライブ中にループ再生できます。出力はクリーンな MP4 なので、Resolume、OBS、お使いの VJ ソフトにそのまま読み込めます。
汎用ツールを組み合わせる代わりに、専用のスクリプトから動画生成ツールを使うと、何が実際に変わるのかを解説します。
| 比較項目 | 手動編集(CapCut) | ChatGPT+Runway | このツール |
|---|---|---|---|
| 最初のクリップまでの時間 | ショットあたり30分以上(素材探し、カット、カラーデザイン、書き出し) | 2つのツールを行き来して5〜10分 | 1回の生成で30〜90秒 |
| シネマティックなチューニング | カラーグレードや速度変化、トランジションを手動で設定 | 別のチャット画面でプロンプトを調整 | ライティング、カメラワーク、カラーグレードをプロンプトに組み込み |
| テキストから動画と画像から動画 | ストック映像の検索のみ — 生成は不可 | 2つの別ツールで、プロンプト履歴は共有されない | 両モードを1つの画面で。参照画像のアップロードで自動切り替え |
| アスペクト比 | 比率ごとに再カット・再書き出し | Runway で比率ごとにプロンプトを再入力 | 16:9、9:16、1:1 を生成ごとに選択可能 |
| 長さの制御 | 長い素材からトリミング | Runway のプランで固定(3秒、5秒、10秒) | クリップごとに5〜12秒を選択可能 |
| ビジュアルの一貫性 | 素材の一致度に依存 | シーン間でブレる。キャラクターの固定も不可 | 参照画像でクリップ間の被写体を統一 |
| クリップあたりのコスト | ストック映像サブスク + 編集にかかる時間 | ChatGPT Plus + Runway Standard の月額料金 | Veo の8秒クリップは28クレジット、Seedance クリップは14〜42クレジット |
| 出力フォーマット | CapCut 書き出しの MP4 | Runway から MP4 を個別にダウンロード | 標準 MP4、直接ダウンロード、ウォーターマークなし |
スクリプトから動画生成ツールを使う前に知っておきたい実用的な回答をまとめました。
いいえ。シーンの説明文はプロンプト欄に直接入力できます。JSON の用意もスクリプトのセットアップも事前準備も不要です。保存済みスクリプトからシーンを1つ貼り付けても、ゼロからプロンプトを書いても、同じように動作します。
はい。参照画像をアップロードすると、ツールは自動的に Seedance Pro Fast に切り替わり、静止画を動画クリップに変換します。画像がクリップの最初のフレームになり、モデルがその上にリアルな動きを生成します。キャラクターのポートレートや過去のクリップのフレームが既にある場合に適したモードです。
Veo 3.1 Fast はテキストから動画のモデルです。シーンを言葉で描写すると、ゼロからシネマティックなクリップを生成します。Seedance Pro Fast は画像から動画のモデルで、参照画像が必須で、そのフレームを基に動きを生成します。プロンプトだけあって画像がない場合は Veo を、動かしたいフレームがある場合は Seedance を使いましょう。
ほとんどのクリップは、モデルと長さに応じて30〜90秒で完成します。短い Veo クリップが最も速く、長めの Seedance クリップは90秒ほどかかります。結果ページには進行状況がリアルタイムで表示されるので、プレビューとダウンロードの準備ができた瞬間がわかります。
Veo 3.1 Fast は8秒のクリップあたり28クレジットです。Seedance Pro Fast は長さに応じてクリップあたり14〜42クレジットです。新規アカウントには無料クレジットが付与され、生成前に結果ページで残りクレジットを確認できます。未使用のクレジットはアカウントに残ります。
各ジョブには1回の無料リトライが付いています。2回目でも思いどおりにならない場合は、プロンプトを磨くか別のモデルに変えて、新しい生成を始めましょう。「被写界深度を浅く」を追加する、「ワイドショット」を「クローズアップ」に変える、といった小さな言い換えで、2〜3回目には狙いに近づくことが多いです。
はい。出力は標準の MP4 ファイルなので、DaVinci Resolve、Premiere、CapCut、Final Cut など、どの編集ソフトにもそのまま取り込めます。統合ツール(近日公開)でオーディオと組み合わせて完全なミュージックビデオにしてもよいし、クリップを TikTok、Reels、Shorts にティーザーとして直接投稿してもかまいません。
Veo 3.1 Fast は16:9 ワイドと9:16 縦型に対応。Seedance Pro Fast は16:9、9:16、1:1 正方形に対応し、横型の YouTube、縦型の TikTok・Reels、正方形の SNS 投稿をカバーします。比率は生成のたびに選択できるので、同じプロンプトを3回実行し直す必要はありません。
これらのツールと組み合わせて、ミュージックビデオ制作のパイプライン全体を完成させましょう。
クリップ生成の前に、シーン、キャラクター、プロンプトを設計します。曲をアップロードして時間軸に沿った設計図を受け取り、シーンを1つスクリプトから動画生成ツールに貼り付けて制作しましょう。
どんなオーディオからも、正確に同期した LRC 歌詞ファイルを生成します。カラオケ、字幕ワークフロー、時間指定のテロップに、単語レベルのタイムスタンプを提供します。
生成したクリップを曲とタイミングに合わせて組み合わせ、完成したミュージックビデオを作ります。GetLyricVideo AI のワークフローに近日追加予定です。