Blog
Text-to-Video AI チュートリアル: プロンプトからプロのビデオまで
テキストからビデオへの変換は、まさにその名前の通りです。説明を入力すると、モデルがビデオを返します。そもそもカメラもストック映像も編集タイムラインもありません。言葉が入って動きが出てくる。
著者 Gürsu Yaman · muvi.video創設者 ·
Text-to-Video AI チュートリアル: プロンプトからプロのビデオまで
CTA ボタン: > Text-to-Video を無料で試す
Text-to-Video とは実際には何ですか
テキストからビデオへの変換は、まさにその名前の通りです。説明を入力すると、モデルがビデオを返します。そもそもカメラもストック映像も編集タイムラインもありません。言葉が入って動きが出てくる。
私は muvi.video を運営していますが、このカテゴリが非常に短い時間枠で「興味深いデモ」から「これを使ってクライアントの作業を出荷します」に移行するのを見てきました。その理由は、時間の経過とともに、基礎となるモデルの動き、照明、カメラの動作の理解が劇的に向上したためです。
このチュートリアルは、早く上達したい友人に私が教える内容の実践版です。ここでは、モデルが内部でどのように機能するか (プロンプトに重要なので簡単に説明します)、muvi.video での実際のプロンプトからビデオへのフロー、頼りになる 3 つのモデルから選択する方法、完全に機能する 3 つの例、および短い FAQ について説明します。
拡散モデルがビデオを生成する方法 (短いバージョン)
適切なプロンプトを作成するために博士号は必要ありませんが、メカニズムを理解すると、プロンプトが著しく改善されます。
テキストからビデオへのモデルは、純粋な視覚的なノイズから始まります。テレビの各フレームにわたる静的なノイズを考えてください。次に、テキスト プロンプトの指示に従って、一連のノイズ除去ステップが実行されます。各ステップで、少しのノイズが除去され、説明に一致する方向にピクセルが微調整されます。十分な手順を踏むと、一貫したフレームが現れます。このプロセスは拡散と呼ばれます。
このメカニズムの 3 つの結果によって、プロンプトの表示方法が決まります。
1. モデルは、曖昧なままにしておいたものをすべて埋めます。 もっともらしいシーンを統計的に再構築しているため、指定しないものはすべて、最も一般的なトレーニング データの答えで埋められます。 「女性」は一般的な女性になります。特異性とは制御です。 2. 動きは撮影されるのではなく、予測されます。 モデルは、オブジェクトとカメラがどのように動く傾向があるかを学習しました。カメラの動きに名前を付ける (「ゆっくりと前に進む」) ことが機能するのはこのためです。すでに認識されている動きのパターンから選択することになります。 3. 長くて忙しいシーンは困難です。 フレーム数が多く、動く被写体が多いほど、ノイズ除去がドリフトする可能性が高くなります。シンプルなシーンと短いクリップほど信頼性が高くなります。これが、モデルと期間の選択が言葉と同じくらい重要である理由です。
それがあなたに必要な理論のすべてです。それではワークフローに入りましょう。
muvi.video のスタートガイド
最も早い方法は、muvi.video を使用することです。セットアップは迅速です。
ステップ 1: アカウントを作成する
muvi.video にアクセスし、メール アドレスまたは Google アカウントでサインアップします。無料利用枠を使用すると、クレジット カードを必要とせず、限られた世代数でプラットフォームをテストできます。
ステップ 2: インターフェースを学ぶ
作業に入ると、ワークスペースは簡単になります。
- プロンプトフィールド: テキストの説明を入力します。
- モデル セレクター: ここでジョブを実行する AI モデルを選択します
- 設定パネル: アスペクト比、解像度、再生時間を設定します。
- 生成ボタン: ジョブを開始します
- ギャラリー: 完成したビデオが保存される場所
ステップ 3: 基本設定を理解する
すべてのモデルは、すべてのプロジェクトにとって重要な 3 つの設定を公開します。
- アスペクト比: 横向き (YouTube、ウェブ) で 16:9、縦向き (リール、TikTok、ショート) で 9:16、さらに正方形やその他の形式の場合は Seedance で追加の比率が追加されます。
- 解像度: Veo 3.1 では 1080p。 Seedance 2.0 では 480p または 720p (Seedance の開始/終了フレーム ジョブは最大 1440p に達します)。
- 期間: これはモデルが最も分岐する部分であり、モデルの選択に影響を与えます。次のセクションを参照してください。
セットアップはこれで終わりです。モデルを選択しましょう。
適切なモデルの選択
それぞれが明確なレーンを所有しているため、3 つのモデルを前面と中央に配置します。評判ではなく、ショットに必要なものを基準に選びましょう。
Veo 3.1、サウンド付きの短い映画のようなショット用
Veo 3.1 は、1080p、16:9 または 9:16 で 4、6、または 8 秒のクリップを生成します。その際立った機能は ネイティブ オーディオ です。環境音や、シーンに同期した画像と一緒に会話を生成することができます。また、高速、品質、ECL Image-to-Video モード、ECL Start/End Frame モードといったいくつかのバリエーションも提供しています。
洗練された 8 秒の映画のようなビートが必要な場合、ショットに同期したサウンドのメリットがある場合、または最終的なヒーロー品質の映像を作成している場合は、Veo 3.1 をお勧めします。さらに詳しくは、Veo 3.1 完全ガイド を参照してください。
Seedance 2.0、最長 15 秒の長時間撮影用
Seedance 2.0 は 4 ~ 15 秒の整数の継続時間を生成します。これは、Veo が 1 つのパスで生成できるよりも長いテイクが必要な場合に使用するモデルになります。 480p または 720p で 6 つのアスペクト比 (および最大 1440p の開始/終了フレーム ジョブ) をサポートします。そのバリエーションは幅広く、テキストからビデオ、画像からビデオ、最大で 9 つの画像参照、3 つのビデオ参照、3 つのオーディオ参照を受け入れる オムニリファレンス モードに加え、開始/終了フレーム モードがあります。
継続時間が優先される場合、キャラクターや製品をアンカーする複数の参照アセットがある場合、または 16:9 と 9:16 以外のアスペクト比が必要な場合は、Seedance 2.0 を使用してください。
Kling 3.0、定型化されたモーション用
Kling 3.0 は、厳密なフォトリアリズムではなく、様式化された、特徴的な外観が必要な場合に最適です。 T2V (テキストからビデオ)、I2V (画像からビデオ)、Kling O3 の 3 つのバリエーションで出荷されます。そのモーションには、クリエイティブな、アニメーション寄りの、アート志向のコンテンツに適した独特の表現力があります。
クイックデシジョンテーブル
| 必要 | モデル | なぜ |
|---|---|---|
| サウンド付きの 8 秒の映画のようなショット | Veo 3.1 | ネイティブオーディオ、1080p、洗練されたモーション |
| 8 秒を超えるテイク (最大 15 秒) | シーダンス 2.0 | 整数 4 ~ 15 秒の持続時間 |
| 複数の参照アセット (画像/ビデオ/オーディオ) | シーダンス 2.0 | オムニリファレンス: 9 画像 + 3 ビデオ + 3 オーディオ |
| 様式化された/表現力豊かな動き | クリング 3.0 | 独特の非フォトリアルな外観 |
| 正方形または非標準のアスペクト比 | シーダンス 2.0 | 6 つのアスペクト比 |
実際のワークフロー
ほとんどのプロジェクトでは、プロンプトを下書きして最初のパスを実行し、レビューして文言を修正してから、最終パスを実行します。実際に出荷するテイクに 1 世代を費やす前に、アイデアを安価に検証します。さらに詳しいプロンプト作成については、プロンプト作成ガイド および AI ビデオ ジェネレーター の概要をご覧ください。
効果的なプロンプトの作成
プロンプトはモデルよりも重要です。怠惰なプロンプトを備えた優れたモデルは、慎重なプロンプトには毎回負けます。これら 5 つの要素をカバーすれば、命中率はすぐに上がります。
1.被写体、シーンに誰がいるのか、または何がいるのか。 具体的にしてください。 「女」は弱い。 「紺のブレザーを着た銀髪ショートの40代女性」が強い。モデルは、あなたが与えたものでのみ機能します。
2.アクション、何が起こっているのか。 動きや出来事を説明します。 「立つ」ということは静的なものです。 「市場をゆっくりと歩き、新鮮な農産物を調べるために一時停止する」と、モデルにレンダリングする動的なコンテンツが与えられます。
3.設定、それが行われる場所。 環境が知覚品質を左右します。 「キッチン」は一般的なものです。 「銅製の鍋が天井から吊り下げられ、レースのカーテンを通した朝の光がある素朴なイタリアの農家のキッチン」は、鮮やかで具体的なシーンを作り出しています。
4.カメラ、どのように撮影されているのか ほとんどの人がスキップする要素、そして一般的なものと映画的なものとの違い。ショットのサイズ(「クローズアップ」対「ワイドショット」)、動き(「静止三脚」対「スロートラッキングショット」)、角度(「見上げるローアングル」対「オーバーヘッド」)、およびフォーカス(「浅い被写界深度」対「深いフォーカス」)に名前を付けます。
5.スタイルと雰囲気、どんな感じか。 美的かつ感情的なトーンを設定します。「映画的、温かみのある、親密な」、または「ドキュメンタリー スタイル、手持ち、ざらざらした」、または「クリーン、モダン、企業的」などです。
プロンプトの長さ
- 15 単語未満: 情報が不十分です。モデルは一般的な選択肢でギャップを埋めます。
- 30 ~ 80 語: スイート スポット。圧倒されることなく操縦するのに十分な詳細。
- 120 ワードを超える場合: モデルは後の命令を削除する可能性があります。最も重要な詳細を最初に記載します。
早めに追加する価値のある 2 つのテクニック
- 映画参照。 これらのモデルは、名前によって視覚スタイルを認識します。 「深いオレンジとティールのグレーディング、ワイドアナモフィックフレーミング」または「対称的な構成、パステルパレット」は、多くの説明言葉の短縮形として機能します。
- オーディオの方向 (Veo 3.1)。 Veo はネイティブ オーディオを生成するため、希望するサウンドを次のように説明します。「トタン屋根に降る穏やかな雨の音、遠くの雷鳴、音楽なし」。オーディオキューが結果を左右します。
3 つの実際の例: プロンプト → 設定 → モデル → なぜ
例 1: Instagram の製品ショーケース (Veo 3.1)
目標: コーヒー ブランドのリール用の洗練された垂直クリップ。
プロンプト: 「9:16 垂直方向。業務用マシンからゆっくりとエスプレッソが注がれる磁器カップのクローズアップ。表面に豊かなクレマが形成されます。蒸気がふわりと立ち上ります。カメラがわずかに後ろに下がると、ミニマルな大理石のカウンタートップが現れます。温かみのあるムーディーなサイド照明。エスプレッソを注ぐ音。贅沢で職人的な雰囲気。」
設定: 9:16 アスペクト比、1080p、8 秒、Veo 3.1。
どのモデルとその理由: Veo 3.1。ショットは短く映画的で、ブリーフでは注ぐ音の サウンド を要求します。Veo のネイティブ オーディオはそれを 1 つのパスで処理するため、別個のサウンド デザイン手順はありません。 1 つの製品のビートには 8 秒で十分であり、Veo の 4/6/8 の範囲内に正確に収まります。
レビューと反復: きれいな注ぎ動作、一貫したスチーム、スムーズな引き戻しを確認します。クレマが見にくい場合は、「天然マーブル入りのリアルなエスプレッソクレマ」を追加してください。投稿にロゴを追加します。
例 2: より長い旅行ヒーロー ループ (Seedance 2.0)
目標: 旅行サイトのヘッダー用の 12 秒の空撮背景ループ。
プロンプト: 「16:9。熱帯の島の近くのターコイズブルーの海の上をゆっくりと飛行するドローン空撮。左側の白い砂浜。穏やかな波が水面に模様を形成する。明るい日光、鮮やかな色、滑らかでループしやすい。人はいない。」
設定: 16:9 アスペクト比、720p、12 秒、Seedance 2.0。
どのモデルとその理由: Seedance 2.0。ブリーフィングでは 12 秒が必要ですが、これは Veo の上限である 8 秒よりも長いため、Seedance の整数 4 ~ 15 秒の範囲が適切なツールです。 Web バックグラウンド ループには同期されたオーディオは必要ないため、Veo のネイティブ サウンドを放棄してもコストはかかりません。ミュートされた埋め込みヘッダーには 720p で十分です。
レビューと投稿: ドローンのスムーズな動きと一貫した水の色を確認し、端をトリムして最初にクロスフェードしてきれいなループを作ります。 Web に最適化された MP4 をエクスポートします。
例 3: ソーシャル用の様式化されたスクロール ストッパー (Kling 3.0)
目標: 独特の外観を備えた、注目を集めるシュールなクリップ。
プロンプト: 「垂直9時16分。廃墟となったショッピングモールの中心に生えている巨大な古代の木。根が大理石の床を突き破る。砕けたガラスの天井から太陽光が差し込み、木の葉から神の光が差し込む。エスカレーターは苔と蔓で覆われている。絵画的で様式化された黙示録的な美しさ。」
設定: アスペクト比 9:16、Kling 3.0 (T2V バリアント)。
どのモデルとその理由: Kling 3.0。目標は、視覚的な スペクタクル であり、写真のようにリアルではなく、アートを指向しているように見える外観です。クリングの様式化された表現豊かな動きは、超現実的な前提と戦うのではなく、その前提に傾いています。同じシーンをサウンド付きでフォトリアルなバージョンにしたい場合は、Veo 3.1 に切り替えて 8 秒に短縮します。
レビューと投稿: ツリー構造が一貫していて、ライトが自然に動作することを確認します。短いテキストのオーバーレイ、関連するハッシュタグ、AI コンテンツの開示を追加します。
一般的な問題のトラブルシューティング
モデルは私のプロンプトの一部を無視します。: 長すぎるか、矛盾する命令が含まれている可能性があります。短くして最も重要な詳細を最初に置くと、モデルは後の指示を省略する傾向があります。複雑なシーンの場合は、個別のクリップを生成して一緒に編集します。
アーティファクトと視覚的な不具合: 1 つのシーンに多くのことを求めすぎます。被写体が多すぎ、速すぎ、詳細すぎます。簡素化します。登場人物が減り、アクションが遅くなり、持続時間が短くなり、長くなるにつれてドリフトが増加します。
キャラクターは毎回異なって見えます。: 参照がない場合、モデルは実行のたびにキャラクターを再発明します。非常に具体的にしてください (「灰色のひげと丸眼鏡をかけた 50 代のハゲの男性」)。実際の一貫性を実現するには、Seedance 2.0 のオムニリファレンス モードを使用し、画像リファレンスをフィードします。
カメラの動きがぎくしゃくしています。: 「ダイナミック カメラ」のような曖昧な用語では、予測できない結果が生じます。 「ゆっくりとドリー前進」、「安定したトラッキングショット」、「静止した三脚」を正確に行い、カメラの速度をシーンに合わせてください。
色が間違っているか、色あせています。: 「琥珀色とハニーゴールドのパレット、3500 ケルビン近くの暖色系の色温度」と具体的にするか、既知のビジュアル スタイルを参照してください。ポストでいつでも採点できます。
ビデオは一般的なように見えます。: これは即時的な問題です。あらゆる場所に、主題、アクション、環境、カメラ、スタイルなどの詳細を追加します。モデルはプロンプトと同じくらい具体的にのみ指定できます。
よくある質問
テキストからビデオへの変換にはどのモデルを使用すればよいですか?+
それはショット次第です。特にネイティブ オーディオが必要な場合は、1080p の短い映画クリップ (4、6、または 8 秒) には Veo 3.1 を使用してください。より長いテイクには Seedance 2.0 を使用してください。4 秒から 15 秒までの整数の長さを実行する場合、または複数のリファレンス アセットが必要な場合に使用します。 Kling 3.0 を使用して、様式化された表現力豊かなモーションを実現します。 3 つはすべて muvi.video で視聴できます。
1 つのテキストからビデオへのクリップの長さはどのくらいですか?+
Veo 3.1 では、クリップは 4、6、または 8 秒です。 Seedance 2.0 では、4 ~ 15 秒の任意の整数の長さを設定できます。それ以上の場合は、複数のクリップを生成し、タイムラインでまとめて編集します。
ビデオに音声を含めることはできますか?+
はい、Veo 3.1 では可能です。シーンに同期したネイティブのアンビエント サウンドとダイアログを生成するため、プロンプト内で直接オーディオを指示できます。 Seedance と Kling はビジュアルに重点を置いています。それらのサウンドトラックを投稿に追加します。
実際に出力をどの程度制御できますか?+
たくさん。プロンプトは、主題、アクション、設定、カメラの動き、照明、スタイル、および (Veo 3.1 の場合) オーディオを制御します。プロンプト以外にも、Seedance 2.0 のオムニリファレンス モードを使用すると、一貫性を保つために最大 9 つの画像リファレンス、3 つのビデオ リファレンス、および 3 つのオーディオ リファレンスを使用して結果を固定できます。
どのようなアスペクト比と解像度がサポートされていますか?+
Veo 3.1 は 16:9 または 9:16 で 1080p を出力します。 Seedance 2.0 は、480p または 720p で 6 つのアスペクト比をサポートし、開始/終了フレーム ジョブは最大 1440p に達します。ウェブと YouTube には 16:9、垂直ソーシャルには 9:16 を選択します。
テキストからビデオへの変換は無料で試せますか?+
muvi.video では、世代数が制限されており、クレジット カードは必要なく、無料でテストできます。有料プランでは、作成するビデオの生成量と商用ライセンスが追加されます。
動画は何に使用できますか?+
ソーシャル メディア、マーケティング クリップ、広告、Web サイトの背景、プレゼンテーション、ショート フィルム、製品のビジュアライゼーション、教育コンテンツ。 muvi.video の有料プランでは、生成したビデオには商用ライセンスが付属します。
初めてのテキストからビデオへのプロジェクトを開始する
muvi.video では、Veo 3.1、Seedance 2.0、および Kling 3.0 を 1 か所にまとめているため、あらゆるショットに適切なモデルを合わせることができます。プロンプトを入力し、モデルを選択し、ビデオを生成します。
CTA ボタン: > Text-to-Video を無料で試す
Related Guides
Text-to-Video AI チュートリアル: プロンプトからプロのビデオまで
テキストからビデオへの変換は、まさにその名前の通りです。説明を入力すると、モデルがビデオを返します。そもそもカメラもストック映像も編集タイムラインもありません。言葉が入って動きが出てくる。