Blog
AI ビデオ用語集: 2026 年にすべてのクリエイターが知っておくべき 35 の用語
AIビデオは高速に動きます。新しいモデルは毎月出荷され、新しいバリアント名が登場し、用語は週ごとに変動する可能性があります。 2024 年に始めたクリエイターは、「テキストからビデオへ」と「画像からビデオへ」を学び、2026 年までに「開始/終了フレーム」、「オムニリファレンス」、「モーション ブラシ」、「スピーカブル スキーマ」、その他 12 個を吸収する必要があるかもしれません。この用語集には、基礎的な用語 (「拡散モデル」とは何ですか?) とクリエイターが取り組む運用上の用語の両方で、2026 年に最も役立つ 35 の用語が集められています。 muvi.video では、製品 UI とドキュメントに表示されます。
著者 Gürsu Yaman · muvi.video創設者 ·
AI ビデオで用語集が重要な理由
AIビデオは高速に動きます。新しいモデルは毎月出荷され、新しいバリアント名が登場し、用語は週ごとに変動する可能性があります。 2024 年に始めたクリエイターは、「テキストからビデオへ」と「画像からビデオへ」を学び、2026 年までに「開始/終了フレーム」、「オムニリファレンス」、「モーション ブラシ」、「スピーカブル スキーマ」、その他 12 個を吸収する必要があるかもしれません。この用語集には、基礎的な用語 (「拡散モデル」とは何ですか?) とクリエイターが取り組む運用上の用語の両方で、2026 年に最も役立つ 35 の用語が集められています。 muvi.video では、製品 UI とドキュメントに表示されます。
用語はトピックごとにグループ化され、各グループ内でアルファベット順にリストされています。各エントリは 50 ~ 80 語の定義と 1 行の例、またはその用語が適用される muvi.video 上の正規ソースへのリンクです。教科書としてではなく、必要な用語をざっと読んで、参考として使用してください。
コア AI ビデオ コンセプト
アスペクト比 ビデオ フレームの幅と高さの比率。 AI ビデオで最も一般的な 2 つの比率は、16:9 (横長、YouTube、デスクトップ ビデオ、およびほとんどの映画出力に使用) と 9:16 (縦長、TikTok、Instagram リール、YouTube ショートに使用) です。 muvi.video の Seedance 2.0 は、カタログ内で最も広いアスペクト比範囲である 1:1、4:3、3:4、および 21:9 もサポートしています。
普及モデル ランダムなノイズから開始し、プロンプトで記述されたターゲットに向かって反復的にノイズを除去 (ノイズ除去) することで画像とビデオを生成する生成 AI モデルのファミリー。 Veo 3.1、Seedance 2.0、Kling 3.0、Runway Gen-3、Pika 2 など、ほとんどすべての最新の AI ビデオ モデルは拡散モデルです。ノイズ除去ステップの背後にある数学は、あるモデル ファミリを別のモデル ファミリから区別するものです。
フレームレート (fps) 1 秒あたりのフレーム数。1 秒間のビデオを構成する静止画の数。 24fps は映画の標準です。ブロードキャストとソーシャルでは 30fps が一般的です。 60fpsはスポーツやゲームに使用されます。ほとんどの AI ビデオ モデルは固定フレーム レート (通常 24 または 30fps) で出力しますが、fps がプロンプトごとに制御されることはほとんどありません。
画像からビデオへの変換 (I2V) 入力が静止画像 (およびオプションのプロンプト) で、出力がその画像をアニメーション化するビデオであるワークフロー。参照画像は構図、照明、被写体のアイデンティティを固定し、プロンプトは動きやアクションを説明します。 Veo 3.1 ECL Image-to-Video、Seedance 2.0 Image-to-Video、および Kling 3.0 Image-to-Video は、muvi.video カタログ内の 3 つの I2V バリアントです。
潜在空間 ピクセルに直接作用するのではなく、拡散モデルが作用する視覚世界の抽象的な数値表現。プロンプトを作成すると、モデルはまずテキストを潜在空間内の位置に変換し、次にその位置に一致するビデオ フレームに向かって「ノイズ除去」します。 「潜在スペース」の実際的な影響のほとんどは、モデルが計算を処理するため、心配する必要はありません。
解像度 出力ビデオのピクセルサイズ。 2026 年の一般的な AI ビデオ解像度は、1080p (1920×1080)、720p (1280×720)、および 480p です。 muvi.video の場合: Veo 3.1 は 1080p を出力します。 Seedance 2.0 は 480p または 720p を出力し、開始/終了フレームのバリアントは 1440p に達します。 Kling 3.0 の解像度は、バリアントとプロバイダーの構成によって異なります。
テキストからビデオへの変換 (T2V) 最新の AI ビデオのヘッドライン ワークフロー: シーンを説明するプロンプトを入力すると、モデルがビデオを生成します。入力はテキストのみで、参照画像やキーフレームはありません。 3 つの muvi.video カタログ モデルはすべて、デフォルト モードとして T2V をサポートしています。
特定のモデルに関連する用語
ECL (Veo 3.1) Veo 3.1 の画像条件付きモードおよびキーフレーム条件付きモード、ECL Image-to-Video および ECL Start/End Frame の muvi.video で使用されるバリアント プレフィックス。これらのバリアントでは、プロンプトに加えて参照画像も受け入れられるため、デフォルトのテキストのみの生成よりも空間的な制御が可能になります。
クリング O3 Kling の第 3 世代の亜種で、Kling Text-to-Video や Kling Image-to-Video とは異なります。 O3 バリアントは、様式化されたモーションの美学に焦点を当てており、プロジェクトのリファレンス ルックが特定の技術仕様ではなく、特定のモーションの滑らかさまたはレンダリングのフィンガープリントに関連付けられている場合に役立ちます。
モーション ブラシ (滑走路 Gen-3) Runway Gen-3 に固有の方向ツール。作成者がモーション パス オーバーレイを入力画像に直接ペイントし、被写体とカメラがどのように動くべきかをモデルに指示します。 muvi.video カタログには同等のものはありません。最も近い類似物は、Veo 3.1 Image-to-Video (フレーム アンカー) と Seedance 2.0 開始/終了フレーム (キーフレーム境界モーション) です。
オムニリファレンス (シーダンス 2.0) 単一世代で最大 9 つの画像参照、3 つのビデオ参照、および 3 つのオーディオ参照を受け入れる Seedance 2.0 バリアント。一連のクリップ全体でのキャラクターの連続性、マルチアセットのコンポジション、または多くのテイクにわたる特定の確立された美学の一致に役立ちます。
ピカフレーム (Pika 2) Pika 2 のキーフレーム ベースのアニメーション機能。作成者が開始フレームと終了フレームを提供し、Pika がそれらの間のモーションを補間します。 muvi.video カタログには、その正確な名前で直接相当するものはありません。 Seedance 2.0 Start/End Frame と Veo 3.1 ECL Start/End は、同じクリエイティブな意図をカバーしています。
ピカフェクト (ピカ 2) Pika 2 の機能。あらかじめ定義された短い「エフェクト プロンプト」(「爆発」、「崩壊」、「溶解」など)により、入力画像を 1 回のクリックで変換します。斬新なソーシャル形式の作品に役立ちます。現在、muvi.video モデルにはミラーリングされていません。
Sora 2 (muvi.video では非推奨) OpenAI のビデオ モデル。以前は muvi.video で提供されていましたが、現在は削除されています。 「muvi.video で Sora 2 for X を使用する」というオンラインで見つけたガイダンスはすべて時代遅れです。muvi.video の現在の映画のデフォルトは Veo 3.1 です。代替案については、Veo 3.1 モデル ページ を参照してください。
開始/終了フレーム 複数のモデル (Veo 3.1 ECL Start/End、Seedance 2.0 Start/End Frame) で利用可能なバリアント。作成者は最初のフレームと最後のフレームという 2 つの参照イメージを提供し、モデルはそれらの間のモーションを生成します。厳密に境界を定められた物語のビート、トランジション、およびショットを既存のフッテージに一致させる場合に役立ちます。
Veo 3.1 (Veo ライン) muvi.video 上の Google の現在のビデオ モデル。 16:9 または 9:16 の 1080p で 4、6、または 8 秒のクリップを生成し、ネイティブのアンビエント音声と対話音声を出力します (Google の製品ドキュメントに従って、プラットフォームでの現在の動作を確認してください)。カタログには 4 つのバリエーションがあります: 高速 (標準)、品質、ECL Image-to-Video、ECL 開始/終了フレーム。
プロンプト エンジニアリングの用語
映画のプロンプトボキャブラリー AI ビデオ モデルが認識して応答する映画文法用語、レンズ (例: 「アナモルフィック」、「85mm 望遠」)、照明スタイル (例: 「レンブラント キー」、「ゴールデン アワー」)、カメラの動き (例: 「スロー ドリー イン」、「クレーン ダウン」)、カラー グレード (例: 「ティール アンド オレンジ」、「落ち着いたアース トーン」)、構図、および雰囲気。 Veo 3.1 でコピー可能な 10 個のサンプルについては、Cinematic Prompts guide を参照してください。
否定的なプロンプト モデルに、「背景に人物なし」、「画面上にテキストなし」、「音楽なし」など、生成してはいけないものを指示する命令。 Veo 3.1 と Seedance 2.0 は、単純な否定に確実に応答します。これらは、「ぼやけていない」または「アーティファクトがない」などの抽象的な否定には確実には反応しません。これらは願望的なものであり、指示できるものではありません。
即時解剖学 強力な AI ビデオ プロンプトに含まれる構造化されたコンポーネントには、主題、環境、アクション、カメラ言語、照明、カラー グレード、雰囲気、アスペクト比が含まれます。一貫した構造に従うことで出力の信頼性が向上し、迅速な反復が測定可能になります。完全な内訳については、プロンプト作成の柱 を参照してください。
プロンプト反復ループ 複数の世代にわたってプロンプトを調整し、一度に 1 つの変数を変更して結果を追跡するプロセス。典型的なループ: 高速バリアント (コスト重視の Veo 3.1 Fast または Kling) でプロトタイプを作成し、モデルをロックしてから、最終納品のために Standard または Quality バリアントでスタイルと雰囲気を調整します。
参考画像 静止画像は、画像からビデオへの生成またはオムニリファレンス生成のための構成、キャラクターのアイデンティティ、または美学を固定するためのプロンプトとともに渡されます。参照は、ソフトな提案ではなく、ハードな視覚的制約としてモデルによって解釈されます。参照の解像度と明瞭さが高いほど、出力はより忠実に準拠します。
シード (決定的シード) プロンプトと一緒にシードサポートモデルに渡されると、同じプロンプトとシードを使用したすべての実行でほぼ同じ結果が生成される数値。再現可能なテイクとカット間の一貫性を確保するのに役立ちます。 Veo 3.1 は決定論的シードをサポートしていません。 Sora 2 は、muvi.video で非推奨になる前にオプションのシードをサポートしていました。 2026 年のほとんどの muvi.video カタログ モデルはシード コントロールを公開していません。
トークン (プロンプト トークン) プロンプトを読むときにモデルが消費するテキストの単位。およそ 1 単語ですが、一般的な用語の場合は短く、まれな用語の場合は長くなることがよくあります。ほとんどのモデルでは、プロンプトごとの最大トークン数 (通常は数百) が課されます。制限を超えると、モデルは末尾部分を切り捨てるか無視します。実際的な効果: 予測可能な動作を実現するために、プロンプトを 80 語未満に抑えます。
スキーマ、クローラー、および AI 検索
AI クローラー AI 企業が運営する、トレーニングまたはライブ ブラウズ用のページを収集する Web クローラー。 2026 年の一般的な AI クローラーには、GPTBot (OpenAI トレーニング)、ChatGPT-User (ライブ ブラウズ)、ClaudeBot (Anthropic トレーニング)、Claude-Web (ライブ ブラウズ)、PerplexityBot、Google-Extended、Applebot-Extended が含まれます。 muvi.video の robots.txt は、これらのクローラーに公開ページへのアクセスを明示的に許可します。
コンテンツシグナルディレクティブ 新しい robots.txt ディレクティブは、サイトで許可されるクロールされたコンテンツの使用、検索インデックス作成、AI トレーニング、AI 取得、AI パーソナライゼーションを 4 つの個別のスイッチとして指定します。 muvi.video は、robots.txt および HTTP ヘッダーとして「Content-Signal: search=yes, ai-train=yes, ai-retrieval=yes, ai-personalization=no」を発行します。
E-E-A-T (経験、専門知識、権威、信頼性) 編集コンテンツを評価するための Google の品質フレームワーク。著者に関連付けられた個人との強い結びつき: 匿名で公開された記事や出版組織のみに帰属された記事よりも、実際の人間の著者エンティティを含む記事 (プロフィール ページ、略歴、実証された専門知識を含む) が上位にランクされ、AI アシスタントによって引用される頻度が高くなります。
エンティティ (@id 参照) JSON-LD 構造化データでは、エンティティは「@id」 URL によって識別される個別のもの (人、組織、製品、記事) です。スキーマが「@id」によって相互参照されている場合、たとえば、記事の「author」フィールドが著者プロフィール ページに存在する人物「@id」を参照している場合、Google のナレッジ グラフは、スキーマを個別のメンションとして扱うのではなく、単一のグラフに接続できます。
FAQページのスキーマ ページの Q&A リストを Google の「People also ask」リッチリザルトに変換する JSON-LD タイプ。各質問と回答のペアは、AI アシスタントによって個別に引用可能になります。スキーマは、散文 Q リストと JSON-LD mainEntity 配列が正確に一致する場合に最も効果的であり、それらの間のドリフトは信頼を損ないます。
ナレッジグラフ Google のエンティティと関係性のデータベース。検索クエリの曖昧さをなくし、情報パネルや AI 概要などの機能を強化するために使用されます。明確なエンティティ参照 (@id 相互参照を含む) と一貫した名前を発行するページは、アドホック テキスト参照を使用するページよりも確実にナレッジ グラフにリンクされます。
llms.txt サイトのルート (/llms.txt) にあるマークダウン ファイル。AI システムにサイトの構造とどのページが重要であるかを通知します。 robots.txt に似ていますが、クロール制御ではなく AI の理解を目的としています。 2026 年初頭の時点で採用されているサイトは 5% 未満であり、今導入することが差別化要因となります。
スキーマ マークアップ (JSON-LD) <script type="application/ld+json"> ブロックとしてページに埋め込まれた構造化データ。ページのコンテンツ タイプとキー フィールドを機械可読形式で記述します。 2026 年の一般的なタイプ: Article、FAQPage、BreadcrumbList、Organization、WebSite、SoftwareApplication、person、speakable。 Google と AI アシスタントは、ページの内容を示す信頼性の高いシグナルとしてスキーマ マークアップを使用します。
スピーカブルスキーマ ページのどの CSS セレクターが適切に読み上げられるかを示す JSON-LD フィールド (記事では「speakable」)、通常は H1、最初の段落、および FAQ ブロックです。 Web コンテンツから音声応答を生成するときに、Google アシスタントと AI 概要によって使用されます。
ワークフローとプラットフォームの規約
カタログ(モデルカタログ) プラットフォームが 1 つのワークスペースでクリエイターに利用できるようにするモデルのセット。 2026 年の muvi.video カタログには、Veo 3.1 (ネイティブ オーディオを備えた映画のような 1080p)、Seedance 2.0 (4 ~ 15 秒のクリップ、6 つのアスペクト比)、および Kling 3.0 (様式化されたモーション) の 3 つのモデル ファミリが含まれています。プラットフォームを切り替えることなく、1 つのスタジオから 3 つすべてにアクセスできます。
エッジ ランタイム (レンダリング) 地理的にユーザーの近くで実行されるサーバーレス実行環境。動的コンテンツの低遅延レンダリングに使用されます。 muvi.video のルートごとのオープン グラフ イメージは Edge ランタイムでレンダリングされ、各ページはオンデマンドで新しくレンダリングされた OG イメージを取得し、最初のヒット後に CDN によって積極的にキャッシュされます。
マルチモデルのワークフロー 複数の AI ビデオ モデルを 1 つのプロジェクトに組み合わせる実践。たとえば、反復処理が速いため Kling 3.0 でショットのプロトタイピングを行い、オーディオ付き 1080p で出荷されるため、最終的なショットを Veo 3.1 で再生成します。 muvi.video は、共有プロンプト履歴、並べて比較、単一の請求画面など、マルチモデルのワークフローをシームレスにするように構造化されています。
クリップコインごと/コインベースの課金 muvi.video の請求モデル: 世代ごとに、月額プランの割り当てからコインが差し引かれます。世代ごとのコインの数は、モデル、バリアント、解像度、クリップの長さによって異なります。現在の世代ごとのコストについては、価格設定ページ を参照してください。使用量に関係なく月額定額料金を請求するサブスクリプション専用プラットフォームとは異なります。
バリアント (モデル バリアント) 基本モデルの特定の構成。例: Veo 3.1 には、Fast、Quality、ECL Image-to-Video、ECL Start/End Frame の 4 つのバリアントがあり、それぞれが異なる目的に合わせて最適化されています。通常、バリアントは同じプロンプト文法を共有しますが、速度、出力の忠実度、または入力形式 (テキストのみか画像条件付きか) が異なります。
これらの条件を実践する
この用語集は、他の muvi.video ページを読んでいて簡単な定義が必要な場合に最も役立ちます。このページをタブで開き、用語を検索 (⌘F / Ctrl+F) します。それぞれの定義は自己完結型です。周囲のコンテキストを必要とせずに、単一の定義を引用できます。
AI ビデオを初めて使用する場合は、基礎を説明する 6 つの用語である「中核概念」セクション (セクション 3) から始めてください。そこから、モデル固有の用語セクション (セクション 4) で、muvi.video カタログで各モデルが提供する内容について説明します。プロンプト エンジニアリング セクション (セクション 5) では、解剖学、反復ループ、ネガティブ プロンプトなど、最も実践的な日常作業が行われます。
別のプラットフォームに対して muvi.video を評価している場合は、スキーマと AI 検索セクション (セクション 6) で、AI アシスタントが競合他社のページと比較して当社のページを表示する方法に影響を与える構造化データの基盤について説明します。 「ワークフローとプラットフォーム」セクション (セクション 7) では、製品 UI や価格設定に関する議論で使用される操作用語について説明します。
よくある質問
最初に学ぶべき最も重要な AI ビデオ用語は何ですか?+
2026 年のほとんどのクリエイターにとって、内面化すべき最も重要な用語は プロンプトの構造、つまり、強力な AI ビデオ プロンプトに含めるべき構造化されたコンポーネント (被写体、環境、アクション、カメラ言語、照明、カラー グレード、雰囲気、アスペクト比) です。プロンプトでは、世代ごとのほぼすべての制御が行われるため、この用語集内の他の用語はすべて、あるレベルでプロンプトの構造に戻ります。
これらの用語は AI ビデオ モデル間で転送されますか?+
ほとんどの場合、そうです。コア概念 (セクション 3) とプロンプト エンジニアリング用語 (セクション 5) は、モデルにほとんど依存せず、「ネガティブ プロンプト」は、Veo 3.1、Seedance 2.0、Kling 3.0、またはその他の拡散ベースの AI ビデオ モデルで同じことを意味します。モデル固有の用語 (セクション 4) は、定義上明らかにモデル固有ですが、多くの場合、他のモデルでも機能的に類似しています (たとえば、Veo 3.1 の ECL Start/End は、Pika 2 の Pikaframe と同じ意図をカバーしています)。
Sora 2 が muvi.video カタログに掲載されていないのはなぜですか?+
Sora 2 は以前 muvi.video で提供されていましたが、現在は非推奨になっています。 muvi.video の現在の映画のデフォルトは Veo 3.1 で、ネイティブ アンビエント オーディオを使用して 1080p で 4、6、または 8 秒のクリップを生成します。 Sora 2 プロンプト ガイダンスを探してこの用語集に到達した場合は、muvi.video にある同等の Veo 3.1 プロンプト ガイド を参照してください。
この用語集はどれくらいの頻度で更新されますか?+
私たちは、muvi.video がモデル バリアントを追加または削除するたび、または広く採用された新しい用語 (「コンテンツ シグナル ディレクティブ」や「llms.txt」など) が一般的になってクリエイターが日常のドキュメントで遭遇するたびに、用語集を再検討することを目指しています。ここでの 35 の用語は、2026 年半ばに最も役立つものを反映しており、この分野の進化に応じて年間 5 ~ 10 件の追加と改訂が予想されます。
この用語集に記載されていない用語はありますか?+
ほぼ確実に、AI ビデオ分野では、単一の用語集が追いつかないほどの速さで新しい用語が生成されます。 muvi.video ドキュメントや、ここには掲載されていない広範な AI ビデオ コミュニティで用語を見つけた場合、将来含める可能性が最も高い候補は、ControlNet コンディショニング、LoRA 微調整、動きベクトル、オプティカル フロー ガイダンス、および深度認識生成です。それぞれは、このバージョンで説明されている基礎よりも高度です。
特にプロンプト エンジニアリングについて詳しくはどこで学べますか?+
Prompt-Writing Pillar を参照してください。これは、プロンプトの構造、Veo 3.1、Seedance 2.0、および Kling 3.0 にわたるクロスモデル パターン、一般的な間違い、および動作する反復ループをカバーする長い形式のガイドです。実践的なプロンプト クラフトに焦点を当てている場合は、この用語集の次に読むのが自然です。
AI ビデオについて書いている場合、この用語集を引用するにはどうすればよいですか?+
正規 URL https://muvi.video/blog/ai-video-glossary とページの上部に記載されている発行日を使用してください。このページの Article スキーマは、AI アシスタントと Google のナレッジ グラフの引用メタデータ (見出し、著者、日付発行日、日付変更日) を公開しており、ユーザーの質問に答えるときに、帰属付きで個々の用語の定義を引用できます。
muvi.video に本規約を適用します
この語彙を理解するための最も早い方法は、それを使用し、muvi.video 上でいくつかのクリップを生成し、どの用語が自分のやっていることを説明しているかに注目することです。映画のような確立ショットと物語的なビートには Veo 3.1、より多くのアスペクト比にわたる長時間の連続テイクには Seedance 2.0、定型化されたモーションには Kling 3.0 が含まれます。 1 つのスタジオから 3 つすべてにアクセスできます。
CTA:
AI ビデオを無料で生成 →
Related Guides
AI ビデオ用語集: 2026 年にすべてのクリエイターが知っておくべき 35 の用語
AIビデオは高速に動きます。新しいモデルは毎月出荷され、新しいバリアント名が登場し、用語は週ごとに変動する可能性があります。 2024 年に始めたクリエイターは、「テキストからビデオへ」と「画像からビデオへ」を学び、2026 年までに「開始/終了フレーム」、「オムニリファレンス」、「モーション ブラシ」、「スピーカブル スキーマ」、その他 12 個を吸収する必要があるかもしれません。この用語集には、基礎的な用語 (「拡散モデル」とは何ですか?) とクリエイターが取り組む運用上の用語の両方で、2026 年に最も役立つ 35 の用語が集められています。 muvi.video では、製品 UI とドキュメントに表示されます。