AIによる動画における多シーンにわたるキャラクターの一貫性をどのように実現するか?PixPixを用いて人物とカメラアングルの連続性を確保する

読了時間 19分
AIによる動画における多シーンにわたるキャラクターの一貫性をどのように実現するか?PixPixを用いて人物とカメラアングルの連続性を確保する

AIによる動画におけるキャラクターの一貫性の問題は、通常「最初の映像と似ているかどうか」ではなく、キャラクターが2つ目の場面や3つ目の構図、さらには4つ目の動作に移った後でも、顔立ち・年齢・髪型・服装・小道具などが依然として同一人物であるかどうかという点にあります。

本稿ではPixPixを用いて、複数のシーンに対応した再現可能なキャラクターワークフローを設計します。まずキャラクターのマスターデータを作成し、次にショットを分割、リファレンス素材を再利用、審査に合格した映像を引き継ぎ、各ショット後にアイデンティティのずれを確認します。なお、実行されていない生成プロセスについてはモデルによる実測データを示していません。具体的な入口や仕様、使用可能なモデルについては、現在のPixPix公式ページをご参照ください。

簡潔な結論:一貫性はモデルだけではなく、ワークフローによってもたらされます。

同一のAIキャラクターを複数の映像シーンで安定して登場させるためには、以下の4つのポイントを同時に整える必要があります。

  1. キャラクターのリファレンス画像を用いて、顔・髪型・体型の比率・服装・象徴的な小道具を固定する;

  2. 物語を短いショットに分割し、各ショットは一つの主要な動作のみを担うようにする;

  3. 毎回の生成時にキャラクターマスターデータを再び読み込み、必要に応じて前ショットの審査通過フレームも追加する;

  4. 各ショットが完了するたびにチェックを行い、小さな誤差が後のシーンへと伝播しないようにする。

本稿作成時点において、PixPixの公開ページにはさまざまなリファレンス駆動型のビデオモデルが掲載されています。まずはタスク別に絞り込むことで、「どのモデルが絶対に最適か」という問いから入るのではなく、効率的に検討できます。

主なタスク

優先的に試してみるべきモデル

公式に公開されている機能と選定理由

4~15秒程度の人物動作、明確なカメラワークと被写体の安定性

MiniMax H3

テキスト・画像・動画・音声のリファレンスに対応し、人物の一貫性・ショットの実行・物理的フィードバックを重視する

マルチモーダルリファレンス、ネイティブな音声、複雑なショットやストーリーボードの制御

Kling 3.0 Omni

テキスト・画像・動画・音声のリファレンスと生成・編集・音声・多ショット制御を同一のワークフローに統合する

15~30秒のナラティブ、複数のリファレンス、延長およびその後の編集

Seedance 2.5

公式資料では、マルチモーダルリファレンス、最大30秒の生成、さらに延長可能、1080P出力などを強調している

この表は、公式のポジショニングに基づいたタスク適合度の提案であり、同条件での実測によるランキングではありません。正式なプロジェクトでは、まず候補となる2つのモデルを選定し、同一のキャラクターリファレンス・ショットの指示文・アスペクト比・チェックリストを用いて3ショットのテストを実施した上で、修正回数を比較してください。

なぜキャラクターは異なるショットで別人になってしまうのか

単一の映像内でのずれ

キャラクターが1つのショット内で振り返ったり、手や小道具に隠れたり、素早い動きを見せたり、あるいはカメラが側面や背面から回り込んだりすると、モデルが利用できる顔の情報が減少します。その結果、目と目の間隔の変化、生え際の移動、襟元の形状変化、手に持つ小道具の形の変化、さらには動きの中で突然若く見えたり成熟して見えたりすることがよく起こります。

異なるシーン間でのずれ

新しいショットは、毎回新たな生成タスクです。単に「銀灰色の髪の女性、黒いスーツ」といった文言を繰り返すだけでは、モデルは人物というカテゴリそのものを学習するだけで、個々の固有のアイデンティティまでは捉えられません。さらに、新しい場所や光の条件、アングルが加われば、視覚的な証拠は一層変化します。そのため、たとえ二つ目のショットが「とても似ている」ように見えても、実はすでに同一のキャラクターではない可能性があります。

プロンプトは視覚的参照の代わりにはなりません

テキストは動作やシーン、カメラワークを説明するには適していますが、目の間隔や鼻筋の輪郭、衣服のシルエット、小道具の比率などを正確に描写するのは難しいものです。参照画像はモデルに直接的な視覚的基準を与えますが、テキストによるプロンプトは、このショットで何を変え、何を維持すべきかを示す役割を担います。

より確実な役割分担としては、参照画像が「彼女が誰なのか」を担当し、プロンプトが「彼女が今どこにいて、何をしているのか、どのように撮影されるのか」を説明する形が理想的です。

オリジナルキャラクターの連続性をまず確立する

本稿では、オリジナルの成人キャラクター「顧遥」を教材として使用します。彼女はビジュアルクリエイターで、銀灰色のレイヤードショートヘアを後ろにまとめた低いポニーテールにし、黒い細フレームのサングラスをかけ、右耳には彫刻のような印象のシルバーアクセサリーを装着しています。黒いハイネックのテクノロジー感あふれるスーツと黒いワイドレッグパンツを着こなし、黒い手袋をはめ、赤紫色の細縁を持つ黒いハンドバッグを常に携帯しています。

四つのショットは、順に黒いファッションスタジオ、雨の夜の街の通路、鏡面展示室、そして夕暮れの都市の屋上という場所で展開されます。場面やカメラアングルは変わりますが、人物のアイデンティティ、ポニーテールの輪郭、サングラス、右耳のアクセサリー、服装の構造、そしてハンドバッグの形状は必ず一貫して保持しなければなりません。

硬いアンカーと可変要素を区別する

タイプ

本ケースの内容

チェック方法

顔のアンカー

成人の楕円形の顔、同じ顔立ちの比率と顎ライン

正面と四分の三側からの母版を比較

ヘアスタイルのアンカー

銀灰色のレイヤードショートヘア、低いポニーテール、固定された毛先の輪郭

分け目、髪色、ポニーテールの位置を確認

衣装のアンカー

黒いハイネックのウエストシェイプトップ、ワイドレッグパンツ、手袋

肩線、ウエストライン、縫い目、パンツのシルエットをチェック

アクセサリーのアンカー

黒い細フレームのサングラス、右耳のシルバーイヤーカフ

左右の向き、比率、形状を確認

小道具のアンカー

赤紫色の細縁を持つ黒いハンドバッグ

サイズ、しっかりした輪郭、色の縁の位置をチェック

可変要素

場所、ショットサイズ、動作、天気、カメラの動き

各ショットでは必要な要素のみを変更する

参考画像は一枚ではなく、一組を用意する

正面の単独ポートレートだけでは、キャラクターの横顔や背面の服、全身のプロポーションを把握することはできません。少なくとも以下を準備することをお勧めします:

  • 正面半身像:顔の形、サングラス、髪型、イヤリングを確認する;

  • 四分の三全身像:体型、服装のシルエット、ハンドバッグの比率を確認する;

  • 側面像:振り向く、歩く、追従撮影などの動きをサポートする;

  • 背面像:ヘアスタイルの位置、肩ラインと上着の後ろ身頃を確認する;

  • 小道具のクローズアップ:ハンドバッグ、イヤリング、サングラスの構造を固定する。

参考画像には均一な光と明確な輪郭を使用し、強いフィルターで顔立ちを隠したり、キャラクターのマスターモデルに複数の衣装バージョンを混在させたりしないようにしましょう。

原创银灰发角色顾遥的全身母版、正面侧面与背面参考

キャプション:キャラクターマスターモデルには、顔、銀灰色のヘアスタイル、黒い細フレームのサングラス、右耳の銀色イヤリング、黒いハイネックスーツを同時に記録し、以降のシーンでもこの画像で身元を確認する。

PixPixでは、ショットごとのタスクに応じてビデオモデルを選択する

MiniMax H3:まずは短いショットでの被写体の安定性をテストする

PixPixのMiniMax H3公式ページによれば、現在はテキスト・画像・動画・音声の入力に対応しており、人物・動作・ショット・時間順序を処理できるほか、「被写体の安定性」を重点能力としています。公開されている生成仕様は4~15秒、最大2K解像度・24fpsで、具体的なオプションは生成モードによって異なります。

特に、追従撮影・パン・ティルト・リフト・回転など、明確なカメラワークや、人物・衣服・小道具が動きの中で安定して映る必要がある短いショットのテストに適しています。初回のテストでは、急な走行・360度回転・着替え・複雑な物体とのインタラクションなどを同時に含めないでください。

Kling 3.0 Omni:多様な参照と複雑な視聴覚タスクに対応

PixPixのKling 3.0 Omni公式ページでは、全モダリティ対応のビデオモデルとして位置づけられており、テキスト・画像・動画・音声の参照を組み合わせて、動画の生成・編集・ネイティブ音声・マルチショットのストーリーボード制御が可能であるとされています。

プロジェクトにおいて、人物・シーンのトーン・動作の参照・音声を同時に確定する必要がある場合、あるいは一つのタスク自体がより複雑なショット構成を含む場合には、候補に加えることができます。入力素材が多いほど、それぞれの参照が人物・動作・シーン・音声のいずれを担当しているかを明確に記述し、モデルによる引用関係の誤解を防ぐことが重要です。

Seedance 2.5:より長い物語と複数の参照の連携をテストする

PixPixのSeedance高画質能力説明によれば、Seedance 2.5は現在、最長30秒の生成、複数の画像・動画・音声の参照、さらに延長機能と1080P出力に対応しています。

ショットにおいて、より長い動作の展開や、人物とシーン間の連続性が必要な場合、あるいはその後も引き続き延長や調整を行う予定がある場合には、Seedance 2.5を優先的に試すことができます。ただし、尺が長いからといって人物が自然に安定するわけではありません。動作が複雑な場合は、まず短いバージョンで身元と動作構造を検証し、その後で最終的な仕様へ進むことをお勧めします。

物語を四つのチェック可能なショットに分割する

一貫性のテストは、最初から短編全体を生成するべきではありません。まず、違いが明確で管理可能な四つのショットを使い、徐々に難易度を上げていきましょう。

ショット

シーンと動作

主な変化

維持しなければならない

1

黒いスタジオの中景で、顧遥がマゼンタ色のライトフレームの前に立っているシーン

人物と小道具の設定

正面顔、髪のお団子、サングラス、イヤーカフ、服装とハンドバッグ

2

雨の夜の都市の通路を、カメラが側面後方から追うように歩くシーン

環境と動き

横顔、お団子の位置、上着の後ろ身頃、ハンドバッグの形状

3

鏡面展示室の低いアングルで、顧遥が透明な展示台を手で調整するシーン

姿勢と物とのインタラクション

年齢、体の比率、イヤーカフの位置、服装の構造

4

夕暮れ時の都市の屋上を広角で捉え、顧遥が街を見返すシーン

光と遠景

人物の輪郭、髪の色、黒い服装とハンドバッグの色の縁

カット1:まず人物と小道具を設定する

カット1では安定した中景を使用し、顧遥が黒いスタジオ内のマゼンタ色のライトフレームの前に立つ。このカットでは複雑な動作は求めず、正面顔、髪型、サングラス、服装、ハンドバッグが同時に成立しているかを確認することが重要である。

银灰发顾遥站在黑色摄影棚的洋红色灯框前

キャプション:最初のカットでは、はっきりとした四分の三顔とシンプルな手の動きで、人物・服装・小道具の基準を確立する。

カット2:環境を変え、歩行を加える

カット2では、人物を雨の夜の都市の通路へ移動させ、左後方から追う形で撮影する。横顔、お団子の位置、上着の後ろ身頃、黒いハンドバッグが依然として連続しているかどうかを確認する必要がある。

顾遥在洋红霓虹映照的雨夜城市廊道中侧后方行走

キャプション:場面や光、動きは変化しているが、人物の年齢、お団子の輪郭、サングラス、右耳のイヤーカフ、上着の構造、ハンドバッグの外形は引き続き維持されるべきである。

カット3:ポーズの変化と物とのインタラクションを追加する

カット3では、顧遥が鏡面展示室で透明な展示台を手で調整する場面を描く。低いアングル、鏡面反射、手によるインタラクションにより、体の比率や人物・手の変形のリスクが増大するため、ハンドバッグは安定した参照点として傍らに残しておく。

顾遥在洋红灯光的镜面展厅中调整透明展台

キャプション:鏡面反射と物とのインタラクションが同時に現れる場合、顔、お団子、イヤーカフ、服装の継ぎ目、手の接触関係、ハンドバッグの比率を逐一確認する必要がある。

カット4:遠景で人物の輪郭を検証する

カット4は、夕暮れ時の屋上を広角で映し、顧遥が街を背にして振り返る姿に切り替わる。遠景では顔の情報は薄れ、銀灰色の髪のお団子、サングラスの輪郭、黒いスーツのシルエット、そしてハンドバッグのマゼンタ色の縁取りによってこそ、その存在が認識される。

顾遥在暮色城市屋顶手持黑色手包回望

キャプション:最後のカットにおける主な変化は、ショットサイズと照明である。人物の輪郭や服の色面、小道具の色は、依然としてマスターフレームと一致させるべきだ。

カット1を通過した後、カット2へ進む。もしカット2において、横顔や髪のお団子、ハンドバッグがすでに変化している場合は、それをカット3の唯一の参照として使い続けてはならない。

各カットのプロンプトは、固定されたキャラクターIDブロックを用いて作成する。

汎用キャラクターIDブロック

以下は、本ケースのために設計された再利用可能なテンプレートであり、参考記事やいかなるモデルのオリジナルプロンプトでもない。

汎用テンプレート|キャラクターIDブロック

オリジナルの成人女性キャラクター、顧遥。楕円形の顔立ち、銀灰色のレイヤードショートヘアを後ろにまとめた低いお団子にし、黒い細フレームのサングラスを着用。右耳には彫刻的な印象のシルバーエアクリップを装着。黒いハイネックのウエストシェイプのテクノロジー感のあるトップス、黒いワイドパンツ、黒い手袋を身につけ、マゼンタ色の細縁を持つ硬めの黒いハンドバッグを持ち歩く。顔型、年齢、髪のお団子の位置、体型の比率、服の縫い目、サングラス、イヤリングの向き、ハンドバッグの構造はすべて同一のまま。衣装を変えず、アクセサリーも追加しない。

このキャラクターIDブロックは、各カットで繰り返し使用する。シーンのプロンプトには、場所、ショットサイズ、動作、カメラ、環境の動き、音響、そして終了状態のみを追加する。

カットプロンプトの構成

以下の順序で整理できる:

  1. シーンと時間;

  2. ショットサイズとカメラ位置;

  3. 主要な人物の動作一つ;

  4. カメラの動作一つ;

  5. 環境中に許容される動きのある要素;

  6. 音響の要件;

  7. キャラクターと小道具の不変項目;

  8. カット終了時のポーズと構図。

カット2の例

汎用テンプレート|雨夜の追跡撮影カット

雨夜の現代都市の回廊。地面には控えめな湿った反射が広がる。中~大全身ショットで、カメラは顧遥の左後方からゆっくりと平行して追う。顧遥はマゼンタ色の細縁を持つ黒いハンドバッグを手に、一定の歩調で前進し、途中でわずかにカメラの方へ振り返るだけ。雨粒や上着の裾、髪先が自然に揺れる一方で、背景は清潔に保たれ、他の人物は被写体に近づかない。キャラクターIDブロックに記載された顔型、年齢、銀灰色のお団子、黒い細フレームのサングラス、右耳のシルバーイヤクリップ、服の裁断、ハンドバッグの構造は一切変えない。カット終了時、顧遥は画面右側の三分割線に立ち、横顔とハンドバッグが完全に見える。

プロンプトには、「映画的」「衝撃的」「高級」などの抽象的な形容詞を繰り返し盛り込む必要はない。一貫性を保つためには、カメラの位置、キャラクターの動作数、変更不可の要素、そしてカットの終了地点を明確に示す方が効果的である。

前のカットが次のカットを助けるようにし、誤った情報を拡散しないようにする。

メインリファレンスと引き継ぎフレームはそれぞれ異なる役割を担う。

キャラクターのマスターフレームはメインリファレンスとして長期的なアイデンティティを担い、前のカットの承認済みフレームは補助リファレンスとして現在の衣装状態、光の方向、空間のつながりを管理する。新しいカットでは必ずキャラクターのマスターフレームを組み込み、前の出力フレームだけに頼ってはならない。

角色母版与审核通过的摄影棚画面共同指向下一段雨夜镜头

図注:マスターレイアウトは人物の身元を常に保持し、審査通過したフレームによって現在の衣装・小道具・背景の状態が補完されます。両者は共に次のショットへと引き継がれ、前のフレームだけが伝達されるわけではありません。

審査通過済みのクリーンなフレームのみを引き継ぐ

顔がはっきりと映り、モーションブラーがなく、手や小道具が完全で、衣装の構造が正しい画像を選択します。もしショットの最後のフレームでたまたま目を閉じていたり、何かに隠れていたり、形が歪んでいたりする場合は、その近くのより安定したフレームを視覚的参照として選び、編集時にトランジションを個別に処理してください。

定期的にキャラクターマスターレイアウトに戻る

前のショットから次のショットへと連続して引き継いでいると、わずかな変化が少しずつ積み重なっていきます。2~3ショットを終えた段階で、必ずキャラクターマスターレイアウトと再確認を行いましょう。明らかなずれが生じた場合は、マスターレイアウトやそれ以前の強力な参照フレームに戻って再生成し、誤ったフレームをそのまま使い続けることは避けます。

同じチェックリストで各ショットを検証する

動画が生成されたら、少なくとも以下の項目を確認してください:

チェック項目

合格基準

よくある失敗

顔の身元

目鼻立ち、年齢、顔の形が安定していること

目の間隔の変化、顔の若返り、鼻筋の再構築

髪型

銀灰色の髪色、分け目、毛先の乱れ、低いお団子ヘアの位置が一貫していること

お団子ヘアの左右入れ替え、突然髪が伸びたり色が変わったりすること

衣装

ハイネック上着の肩線、ウエストライン、縫い目、パンツのシルエットが一致していること

襟の変化、縫い目の消失、パターンのずれ

アクセサリー

サングラスの比率が安定しており、右耳に銀色のイヤーカフが存在し、向きも正しいこと

左右の入れ替え、繰り返し出現、または変形

小道具

黒いハンドバッグのサイズ、しっかりとした輪郭、そして洋紅色の縁が連続していること

バッグ本体が柔らかくなる、色の縁が入れ替わる、あるいは突然消えること

動作と物理現象

歩き方、布地、雨、接触関係が自然であること

滑り歩き、モディフィケーション、指がくっつくこと

カットのつなぎ目

前後のショットサイズ、視線、動きの方向は編集可能

人物の位置が急に変わったり、向きの軸が突然逆転したりする場合

顔の特徴や年齢、象徴的な服装や小道具は厳密なチェック項目であり、不適合であれば修正または再制作が必要です。背景にある小物の位置変化は通常ソフトな問題で、受け入れるかどうかはシーンのストーリーテリング次第です。

摄影棚雨夜廊道镜面展厅和暮色屋顶四个镜头的角色一致性检查板

図注:四つのカットを並べて確認すれば、一枚ずつ印象だけで判断するよりも、髪型の位置の入れ替わり、サングラスの比率の変化、イヤーカフの消失、服の縫い目のずれ、ハンドバッグの変形などを容易に発見できます。

キャラクターの一貫性を最も損なう六つのやり方

参考画像を繰り返さずに、テキストだけを繰り返す

同じプロンプトでは人物のカテゴリーしか保証できず、固有のアイデンティティを確実に維持することはできません。各カットごとに同一のマスターデータを再引用する必要があります。

一つのカットに過剰な動作を詰め込む

同時に走る、振り向く、ハンドバッグを開ける、手を伸ばして何かと触れ合う、しゃがむ、そして顔を上げるといった動作を同時に行うと、遮蔽や姿勢の変化が増えます。まず主要な動作を決め、その後のカットで次のステップを完成させましょう。

誤った終了フレームをそのまま後ろへ引き継ぐ

前のカットで既に髪型が伸びている場合、次のカットではその誤りが新たな基準となってしまいます。引き継ぎ前に必ず検収を行い、ずれが生じた場合はキャラクターのマスターデータに戻してください。

場所・照明・衣装・カメラアングルを同時に変更する

一度に多くの要素を変えると、どの要因がアイデンティティの変化を引き起こしたのか判別しにくくなります。テスト段階では、各カットごとに主要な難易度を一つだけ追加しましょう。

複数のキャラクターが一枚の参考画像を共有する

多人数のカットでは、顔の融合や衣装の交換、小道具のミスマッチが起きやすいです。各キャラクターには独立した参考資料を用意し、それぞれの空間的位置や相互作用の順序を明確にしてください。

まずは最高解像度を追求し、その後で人物を確認する

高解像度ではすでにずれてしまったアイデンティティを修復することはできません。反復可能な仕様でキャラクター・動作・カットをまず確認し、最終的な出力設定へ進みましょう。

よくある質問

一枚の人物写真だけで複数のシーンを含む動画を作ることは可能ですか?

テストを開始することはできますが、正面からの写真だけでは横顔や背面、全身の比率が分かりません。アングルが多いほど、多角度のキャラクターレファレンスや小道具のクローズアップを補足することが重要です。

PixPixの中で、キャラクターの一貫性を最も重視する動画モデルはどれですか?

タスクに応じた統一された答えはありません。短い動作や明確なカメラワーク、主体の安定性が求められる場合はH3を、多数の参照や音声、複雑なカット構成が伴う場合はKling 3.0 Omniを、さらに長いストーリー展開やマルチモーダルな参照が必要な場合はSeedance 2.5を試してみてください。最終的な選択は、同一条件下での三つのカットによるテスト結果に基づいて行いましょう。

前のカットの最後のフレームを使うと、顔が絶対に変わらないのでしょうか?

そうではありません。終了フレームは現在の衣装・照明・構図を伝える助けにはなりますが、動きのブレや目を閉じた状態、微細な形状の変化を引き継ぐ可能性もあります。あくまで補助的な参照として利用し、長期的なアイデンティティの基準は依然としてキャラクターマスターデータであるべきです。

途中で衣装を変えることは可能ですか?

可能です。ただし、衣装の変更は明確な劇的変化として定義してください。顔・髪型・年齢・体格の比率は維持しつつ、新しい衣装に対して新たに正面・側面・背面の参照資料を作成し、モデルに衣装の構造を推測させないようにしましょう。

複数の人物が会話する際、アイデンティティの混同をどう減らすか?

一人ひとりに独立した参考資料を用意し、まず単独のリアクションカットを生成した後、二人のミドルショットを処理します。プロンプトには人物の左右位置・視線・動作の順序を明記してください。それでも顔が混ざってしまう場合は、カットを分割して編集段階で会話のリズムを調整しましょう。

実在する人物の参考画像を使用する際の注意点は何ですか?

素材使用権および本人の許可を必ず確保し、無断で肖像を利用した誤解を招くコンテンツを作成しないようにしてください。公開や商業利用の前には、対象となるプラットフォームや地域の関連規則も確認しましょう。

まとめ

多シーンにおけるAI映像のキャラクターの一貫性は、一度の生成で偶然に得られるものではなく、検証可能な一連の制作手法によるものです。

キャラクターのマスターモデルを構築 → ハードアンカーを設定 → タスクごとにモデルを選択 → 各ショットで主要な変数を一つだけ追加 → マスターモデルの再利用と承認済みフレームの確認 → ショットごとの検収 → ドリフトが生じた場合は再度アンカリングを行う。

PixPixでプロジェクトを開始する際には、まず顧遥の4ショットテスト構成を自作のオリジナルキャラクターに置き換えることができます。最初の3ショットのみを生成すれば、正面・側面・動き・照明・小道具の安定性を十分に確認できます。その後に本編へと展開すれば、いきなり長編を生成するよりも、リワークコストを効果的に抑えることが可能です。

ECチーム向けに作られたAI画像生成ツール

新商品発売、広告配信、キャンペーンなどのマーケティングシーンで、商品画像・シーン画像・広告画像・ショート動画素材をAIで生成し、コンテンツ制作をより効率的に。