AI 视頻多場景角色一致性怎麼做?用 PixPix 鎖定人物與鏡頭銜接

閱讀需 10 分鐘
AI 视頻多場景角色一致性怎麼做?用 PixPix 鎖定人物與鏡頭銜接

AI 视頻角色一致性的问题,通常不是「第一條視頻像不像」,而是角色換到第二個地點、第三個景別和第四個動作以後,臉型、年齡、髮型、服裝與道具還能不能保持同一個人。

本文用 PixPix 設計一套可重複的多場景角色工作流:先建立角色母版,再拆分鏡頭、復用參考素材、交接審核通過的畫面,並在每個鏡頭後檢查身份漂移。文中沒有把尚未執行的生成過程寫成模型實測,具體入口、規格和可用模型請以 PixPix 當前頁面為準。

快速結論:一致性來自工作流,不只來自模型

想讓同一個 AI 角色穩定穿過多個視頻場景,需要同時做好四件事:

  1. 用角色參考圖固定臉、髮型、身材比例、服裝和標誌性道具;

  2. 把故事拆成短鏡頭,每個鏡頭只承擔一個主要動作;

  3. 每次生成都重新帶入角色母版,必要時再加入上一鏡頭的審核通過幀;

  4. 每完成一鏡就檢查,不讓小錯誤繼續傳到後面的場景。

截至本文整理時,PixPix 的公開頁面展示了多種參考驅動的視頻模型。可以先按任務篩選,而不是先問「哪個模型絕對最好」:

主要任務

可以優先測試

官方公開能力與選型理由

4–15 秒人物動作、明確運鏡與主體穩定

MiniMax H3

支持文字、圖片、視頻與聲音參考,強調人物一致性、鏡頭執行和物理反饋

多模態參考、原生聲音、複雜鏡頭或故事板控制

Kling 3.0 Omni

將文字、圖片、視頻、音頻參考與生成、編輯、聲音和多鏡頭控制放在同一工作流中

15–30 秒敘事、多張參考、延長與後續編輯

Seedance 2.5

官方資料強調多模態參考、最長 30 秒生成、繼續延長和 1080P 輸出

這張表是基於官方定位的任務匹配建議,不是同條件實測排名。正式項目應先選擇兩個候選模型,用同一套角色參考、鏡頭提示詞、畫幅和檢查表完成三鏡測試,再比較返工次數。

為什麼角色會在不同鏡頭裡變成另一個人

單條視頻內部漂移

角色在一個鏡頭裡轉頭、被手或道具遮擋、快速運動,或者攝影機繞到側後方時,模型可用的面部資訊會減少。常見結果包括眼距變化、髮際線移動、衣領重構、手裡的道具改變形狀,以及角色在運動中突然顯得更年輕或更成熟。

不同場景之間漂移

每個新鏡頭都是一次新的生成任務。只重複「銀灰髮女性、黑色套裝」這類文字,模型得到的是一個人物類別,而不是唯一身份。新地點、新光線和新角度還會進一步改變視覺證據,因此第二個鏡頭即使「很像」,也可能已經不是同一個角色。

提示詞不能替代視覺參考

文字適合說明動作、場景和運鏡,但很難精確描述眼睛間距、鼻梁輪廓、衣服剪裁和道具比例。參考圖為模型提供直接的視覺錨點;文字提示詞則負責說明本鏡頭要改變什麼、必須保持什麼。

更穩妥的分工是:參考圖負責「她是誰」,提示詞負責「她現在在哪裡、做什麼、鏡頭怎麼拍」。

先為原創角色建立連續性檔案

本文使用原創成年角色「顧遙」作為教學案例。她是一位視覺創意人,銀灰色層次短髮向後收成低髮髻,佩戴黑色窄框墨鏡,右耳有雕塑感銀色耳夾。她穿黑色高領科技感套裝與黑色闊腿褲,戴黑色手套,隨身攜帶一只帶洋紅色窄邊的黑色手包。

四個鏡頭依次發生在黑色時尚攝影棚、雨夜城市廊道、鏡面展廳和暮色城市屋頂。場景與鏡頭會變化,但人物身份、髮髻輪廓、墨鏡、右耳耳夾、服裝結構和手包外形必須保持一致。

區分硬性錨點與可變項

類型

本案例內容

檢查方式

面部錨點

成年橢圓臉型、相同五官比例和下顎線

對照正面與四分之三角度母版

髮型錨點

銀灰層次短髮、低髮髻與固定碎髮輪廓

檢查髮縫、髮色和髮髻位置

服裝錨點

黑色高領收腰上裝、闊腿褲與手套

檢查肩線、腰線、接縫和褲型

配飾錨點

黑色窄框墨鏡、右耳銀色耳夾

檢查左右方向、比例與形狀

道具錨點

帶洋紅色窄邊的黑色手包

檢查尺寸、硬挺輪廓和色邊位置

可變項

地點、景別、動作、天氣、攝影機運動

每個鏡頭只改變必要內容

準備一組而不是一張參考圖

單張正面肖像不能說明角色側臉、背面衣服和全身比例。建議至少準備:

  • 正面半身圖:確認臉型、墨鏡、髮型和耳夾;

  • 四分之三全身圖:確認身材、服裝剪裁和手包比例;

  • 側面圖:支持轉頭、行走和跟拍鏡頭;

  • 背面圖:確認髮髻位置、肩線與上裝後片;

  • 道具特寫:固定手包、耳夾和墨鏡結構。

參考圖使用均勻光線和清楚輪廓,不要用強烈濾鏡掩蓋五官,也不要在角色母版中混入多個服裝版本。

原创银灰发角色顾遥的全身母版、正面侧面与背面参考

圖注:角色母版同時記錄面部、銀灰髮髻、黑色窄框墨鏡、右耳銀色耳夾和黑色高領套裝,後續場景都回到這張圖核對身份。

在 PixPix 按鏡頭任務選擇視頻模型

MiniMax H3:先測試短鏡頭中的主體穩定

PixPix 的 MiniMax H3 官方頁面 當前說明其支援文字、圖片、視頻與聲音輸入,可處理人物、動作、鏡頭和時間順序,並將「主體穩定」作為重點能力。頁面公開的生成規格為 4–15 秒、最高 2K 與 24fps,具體選項以生成模式為準。

它更適合優先測試跟拍、推拉、搖移、升降或環繞等明確運鏡,以及人物與衣物、道具需要在運動中保持穩定的短鏡頭。第一次測試不要同時加入快速奔跑、360 度環繞、換裝和複雜物體交互。

Kling 3.0 Omni:處理多參考和複雜視聽任務

PixPix 的 Kling 3.0 Omni 官方頁面 將其定位為全模態視頻模型,可結合文字、圖片、視頻和音頻參考,並提供視頻生成、編輯、原生音頻與多鏡頭故事板控制。

當項目需要同時鎖定人物、場景基調、動作參考和聲音,或者一個任務本身包含更複雜的鏡頭組織時,可以把它列入候選。輸入素材越多,越需要寫清楚每份參考分別負責人物、動作、場景還是聲音,避免模型誤解引用關係。

Seedance 2.5:測試更長敘事與多參考銜接

根據 PixPix 的 Seedance 高清能力說明,Seedance 2.5 當前支援最長 30 秒生成、多張圖片及視頻和音頻參考、繼續延長與 1080P 輸出。

當鏡頭需要更長的動作鋪陳、人物與場景之間的連續關係,或後續仍要延長和調整時,可以優先測試 Seedance 2.5。時長更長並不等於人物自然更穩;如果動作複雜,仍建議先用較短版本驗證身份和動作結構,再進入最終規格。

把故事拆成四個可檢查的鏡頭

一致性測試不應該一開始就生成整支短片。先用四個差異明確但可控的鏡頭,逐步增加難度。

鏡頭

場景與動作

主要變化

必須保持

1

黑色攝影棚中景,顧遙站在洋紅燈框前

建立人物與道具

正臉、髮髻、墨鏡、耳夾、服裝與手包

2

雨夜城市廊道,攝影機側後方跟拍行走

環境與運動

側臉、髮髻位置、上裝後片、手包形狀

3

鏡面展廳低機位,顧遙伸手調整透明展台

姿勢與物件交互

年齡、身體比例、耳夾位置、服裝結構

4

暮色城市屋頂廣角,顧遙回望城市

光線與遠景

人物輪廓、髮色、黑色服裝與手包色邊

鏡頭 1:先建立人物與道具

鏡頭 1 使用穩定中景,顧遙站在黑色攝影棚的洋紅燈框前。這個鏡頭不追求複雜動作,重點是確認正臉、髮型、墨鏡、服裝和手包能否同時成立。

银灰发顾遥站在黑色摄影棚的洋红色灯框前

圖注:第一個鏡頭先用清楚的三分之四面部和簡單手部動作建立人物、服裝與道具基準。

鏡頭 2:改變環境並加入行走

鏡頭 2 將人物移到雨夜城市廊道,並從左後方跟拍。需要檢查側臉、髮髻位置、上裝後片與黑色手包是否仍然連續。

顾遥在洋红霓虹映照的雨夜城市廊道中侧后方行走

圖注:場景、光線和動作已經變化,但人物年齡、髮髻輪廓、墨鏡、右耳耳夾、上裝結構與手包外形仍需保持。

鏡頭 3:增加姿勢變化與物件交互

鏡頭 3 讓顧遙在鏡面展廳伸手調整透明展台。低機位、鏡面反射和手部交互會增加身體比例、重複人物與手部變形風險,因此手包作為穩定參照保留在身旁。

顾遥在洋红灯光的镜面展厅中调整透明展台

圖注:鏡面反射和物件交互同時出現時,應檢查臉、髮髻、耳夾、服裝接縫、手部接觸關係和手包比例。

鏡頭 4:用遠景驗證人物輪廓

鏡頭 4 切換到暮色屋頂廣角,顧遙背向城市並回頭。遠景中的面部資訊減少,更要依靠銀灰髮髻、墨鏡輪廓、黑色套裝剪影和手包洋紅色邊線維持識別。

顾遥在暮色城市屋顶手持黑色手包回望

圖注:最後一鏡主要變化是景別與光線;人物輪廓、服裝色塊和道具顏色仍應與母版一致。

鏡頭 1 通過後再進入鏡頭 2。若鏡頭 2 的側臉、髮髻或手包已經變化,不要繼續把它作為鏡頭 3 的唯一參考。

用固定身份塊編寫每個鏡頭的提示詞

通用角色身份塊

下面是為本案例設計的可復用模板,不是參考文章或任何模型的原始提示詞:

通用模板|角色身份塊

原創成年女性角色顧遙,成年橢圓臉型,銀灰色層次短髮向後收成低髮髻,佩戴黑色窄框墨鏡,右耳佩戴雕塑感銀色耳夾。她穿黑色高領收腰科技感上裝、黑色闊腿褲和黑色手套,攜帶一只帶洋紅色窄邊的硬挺黑色手包。保持相同臉型、年齡、髮髻位置、身材比例、服裝接縫、墨鏡、耳夾方向和手包結構,不換裝,不增加配飾。

這段身份塊應在每個鏡頭中重複。場景提示詞只追加地點、景別、動作、攝影機、環境動態、聲音和結束狀態。

鏡頭提示詞結構

可以按以下順序組織:

  1. 場景與時間;

  2. 景別與攝影機位置;

  3. 一個主要人物動作;

  4. 一個攝影機動作;

  5. 環境中允許運動的元素;

  6. 聲音需求;

  7. 角色與道具不可變化項;

  8. 鏡頭結束時的姿勢和構圖。

鏡頭 2 示例

通用模板|雨夜跟拍鏡頭

雨夜的現代城市廊道,地面有克制的濕潤反光。中大全身景,攝影機位於顧遙左後方,緩慢平行跟拍。顧遙手持帶洋紅色窄邊的黑色手包,以穩定步速向前行走,途中只輕微轉頭看向攝影機。雨水、上裝下擺和髮梢自然運動,背景保持乾淨且沒有其他人物接近主體。保持角色身份塊中的臉型、年齡、銀灰髮髻、黑色窄框墨鏡、右耳銀色耳夾、服裝剪裁和手包結構不變。鏡頭結束時,顧遙停在畫面右側三分線,側臉和手包完整可見。

提示詞裡不需要反覆堆疊「電影感、震撼、高級」等抽象形容詞。對一致性更有幫助的是明確攝影機在哪、角色做幾個動作、什麼必須不變,以及鏡頭在哪裡結束。

讓上一鏡幫助下一鏡,而不是傳播錯誤

主參考與交接幀承擔不同任務

角色母版是主參考,負責長期身份;上一鏡的審核通過幀是輔助參考,負責當前服裝狀態、光線方向和空間銜接。每個新鏡頭仍應帶入角色母版,不能只依賴上一個輸出幀。

角色母版与审核通过的摄影棚画面共同指向下一段雨夜镜头

圖注:母版持續負責人物身份,審核通過的畫格補充當前服裝、道具與場景狀態;二者共同進入下一鏡頭,而不是只傳遞上一畫格。

只交接乾淨的審核通過畫格

選擇面部清楚、沒有運動模糊、手和道具完整、服裝結構正確的畫面。若鏡頭最後一畫格恰好出現閉眼、遮擋或形變,可以選擇附近更穩定的一畫格作為視覺參考,並在剪輯中單獨處理轉場。

定期回到角色母版

連續把上一鏡頭傳給下一鏡頭,會讓微小變化逐步累積。完成兩到三個鏡頭後,應重新與角色母版核對;一旦出現明顯漂移,回到母版或更早的強參考重新生成,而不是繼續沿用錯誤畫格。

用同一張檢查表驗收每個鏡頭

每條影片生成後,至少檢查以下項目:

檢查項目

通過標準

常見失敗

面部身份

五官比例、年齡和臉型保持穩定

眼距變化、臉變幼、鼻樑重構

髮型

銀灰髮色、髮縫、碎髮和低髮髻位置一致

髮髻換邊、頭髮突然變長或變色

服裝

高領上裝的肩線、腰線、接縫與褲型一致

衣領變化、接縫消失、版型漂移

配飾

墨鏡比例穩定,右耳銀色耳夾存在且方向正確

左右互換、重複出現或變形

道具

黑色手包尺寸、硬挺輪廓和洋紅色邊線連續

包體變軟、色邊換位、憑空消失

動作與物理

步態、布料、雨水和接觸關係自然

滑步、穿模、手指黏連

鏡頭銜接

前後景別、視線和運動方向可剪輯

人物位置跳變、方向軸突然反轉

面部身份、年齡、標誌性服裝和道具屬於硬性檢查項,失敗就應修正或重做。背景小物的位置變化通常是軟性問題,是否接受取決於鏡頭敘事。

摄影棚雨夜廊道镜面展厅和暮色屋顶四个镜头的角色一致性检查板

圖注:把四個鏡頭並排檢查,比逐張憑印象判斷更容易發現髮髻換位、墨鏡比例變化、耳夾消失、服裝接縫漂移或手包變形。

最容易破壞角色一致性的六種做法

只重複文字,不重複參考圖

相同提示詞只能維持人物類別,不能可靠保存唯一身份。每個鏡頭都應重新引用同一套母版。

一個鏡頭塞入太多動作

同時奔跑、轉身、打開手包、伸手互動、蹲下和抬頭,會增加遮擋與姿態變化。先確定一個主要動作,再用後續鏡頭完成下一步。

把錯誤的結束幀一直往後傳

前一鏡頭的髮型已經變長,後續鏡頭會把錯誤當作新標準。交接前必須先驗收,出現漂移時回到角色母版。

同時更換地點、光線、服裝和機位

一次改變太多變量,很難判斷是哪一項導致身份變化。測試階段每個鏡頭只增加一個主要難點。

多角色共用一張參考圖

多人鏡頭容易發生臉部融合、服裝互換和道具錯配。應為每個角色準備獨立參考,並明確人物的空間位置與互動順序。

先追求最高分辨率,再檢查人物

高分辨率不能修復已經漂移的身份。先用適合迭代的規格確認角色、動作和鏡頭,再進入最終輸出設定。

常見問題

只用一張人物照片能完成多場景影片嗎?

可以開始測試,但正面照片沒有提供側臉、背面和全身比例。鏡頭角度越多,越應該補充多角度角色參考和道具特寫。

PixPix 裡哪個影片模型最適合角色一致性?

沒有脫離任務的統一答案。短動作、明確運鏡和主體穩定可以先測試 H3;多參考、聲音和複雜鏡頭組織可以測試 Kling 3.0 Omni;更長敘事和多模態參考可以測試 Seedance 2.5。最終選擇應來自相同條件下的三鏡測試。

使用上一鏡頭最後一幀就一定不會變臉嗎?

不會。結束幀能幫助傳遞當前服裝、光線和構圖,但也可能攜帶運動模糊、閉眼或細微形變。它應作為輔助參考,角色母版仍是長期身份標準。

角色可以在中途換裝嗎?

可以,但換裝應被定義為明確的劇情變化。保留臉、髮型、年齡和身體比例,同時為新服裝建立新的正面、側面和背面參考,不要讓模型自行推斷服裝結構。

多人物對話怎麼減少身份互換?

為每人準備獨立參考,先生成單人反應鏡頭,再處理雙人中景。提示詞中寫清人物的左右位置、視線和動作順序;若臉部仍互換,可以拆鏡頭後在剪輯階段建立對話節奏。

使用真實人物參考圖要注意什麼?

應確保擁有素材使用權和人物授權,不用未經許可的肖像製作誤導性內容。公開或商業使用前,還要檢查目標平台與地區的相關規則。

總結

多場景 AI 影片的角色一致性並非一次生成的運氣,而是一套可檢查的製作方法:

建立角色母版 → 划分硬性錨點 → 按任務選擇模型 → 每鏡只增加一個主要變量 → 復用母版與審核通過幀 → 逐鏡驗收 → 漂移時重新錨定。

在 PixPix 開始專案時,可以先用顧遙的四鏡測試結構替換成自己的原創角色。只生成前三鏡,就足以觀察正面、側面、運動、光線和道具是否穩定;通過後再擴展完整故事,比直接生成長片更容易控制返工成本。

為電商團隊打造的 AI 出圖工具

面向上新、投放和活動行銷場景,用 AI 生成商品圖、場景圖、廣告圖與短影音素材,讓內容生產更高效。