AI 视頻多場景角色一致性怎麼做?用 PixPix 鎖定人物與鏡頭銜接

AI 视頻角色一致性的问题,通常不是「第一條視頻像不像」,而是角色換到第二個地點、第三個景別和第四個動作以後,臉型、年齡、髮型、服裝與道具還能不能保持同一個人。
本文用 PixPix 設計一套可重複的多場景角色工作流:先建立角色母版,再拆分鏡頭、復用參考素材、交接審核通過的畫面,並在每個鏡頭後檢查身份漂移。文中沒有把尚未執行的生成過程寫成模型實測,具體入口、規格和可用模型請以 PixPix 當前頁面為準。
快速結論:一致性來自工作流,不只來自模型
想讓同一個 AI 角色穩定穿過多個視頻場景,需要同時做好四件事:
用角色參考圖固定臉、髮型、身材比例、服裝和標誌性道具;
把故事拆成短鏡頭,每個鏡頭只承擔一個主要動作;
每次生成都重新帶入角色母版,必要時再加入上一鏡頭的審核通過幀;
每完成一鏡就檢查,不讓小錯誤繼續傳到後面的場景。
截至本文整理時,PixPix 的公開頁面展示了多種參考驅動的視頻模型。可以先按任務篩選,而不是先問「哪個模型絕對最好」:
主要任務 | 可以優先測試 | 官方公開能力與選型理由 |
|---|---|---|
4–15 秒人物動作、明確運鏡與主體穩定 | MiniMax H3 | 支持文字、圖片、視頻與聲音參考,強調人物一致性、鏡頭執行和物理反饋 |
多模態參考、原生聲音、複雜鏡頭或故事板控制 | Kling 3.0 Omni | 將文字、圖片、視頻、音頻參考與生成、編輯、聲音和多鏡頭控制放在同一工作流中 |
15–30 秒敘事、多張參考、延長與後續編輯 | Seedance 2.5 | 官方資料強調多模態參考、最長 30 秒生成、繼續延長和 1080P 輸出 |
這張表是基於官方定位的任務匹配建議,不是同條件實測排名。正式項目應先選擇兩個候選模型,用同一套角色參考、鏡頭提示詞、畫幅和檢查表完成三鏡測試,再比較返工次數。
為什麼角色會在不同鏡頭裡變成另一個人
單條視頻內部漂移
角色在一個鏡頭裡轉頭、被手或道具遮擋、快速運動,或者攝影機繞到側後方時,模型可用的面部資訊會減少。常見結果包括眼距變化、髮際線移動、衣領重構、手裡的道具改變形狀,以及角色在運動中突然顯得更年輕或更成熟。
不同場景之間漂移
每個新鏡頭都是一次新的生成任務。只重複「銀灰髮女性、黑色套裝」這類文字,模型得到的是一個人物類別,而不是唯一身份。新地點、新光線和新角度還會進一步改變視覺證據,因此第二個鏡頭即使「很像」,也可能已經不是同一個角色。
提示詞不能替代視覺參考
文字適合說明動作、場景和運鏡,但很難精確描述眼睛間距、鼻梁輪廓、衣服剪裁和道具比例。參考圖為模型提供直接的視覺錨點;文字提示詞則負責說明本鏡頭要改變什麼、必須保持什麼。
更穩妥的分工是:參考圖負責「她是誰」,提示詞負責「她現在在哪裡、做什麼、鏡頭怎麼拍」。
先為原創角色建立連續性檔案
本文使用原創成年角色「顧遙」作為教學案例。她是一位視覺創意人,銀灰色層次短髮向後收成低髮髻,佩戴黑色窄框墨鏡,右耳有雕塑感銀色耳夾。她穿黑色高領科技感套裝與黑色闊腿褲,戴黑色手套,隨身攜帶一只帶洋紅色窄邊的黑色手包。
四個鏡頭依次發生在黑色時尚攝影棚、雨夜城市廊道、鏡面展廳和暮色城市屋頂。場景與鏡頭會變化,但人物身份、髮髻輪廓、墨鏡、右耳耳夾、服裝結構和手包外形必須保持一致。
區分硬性錨點與可變項
類型 | 本案例內容 | 檢查方式 |
|---|---|---|
面部錨點 | 成年橢圓臉型、相同五官比例和下顎線 | 對照正面與四分之三角度母版 |
髮型錨點 | 銀灰層次短髮、低髮髻與固定碎髮輪廓 | 檢查髮縫、髮色和髮髻位置 |
服裝錨點 | 黑色高領收腰上裝、闊腿褲與手套 | 檢查肩線、腰線、接縫和褲型 |
配飾錨點 | 黑色窄框墨鏡、右耳銀色耳夾 | 檢查左右方向、比例與形狀 |
道具錨點 | 帶洋紅色窄邊的黑色手包 | 檢查尺寸、硬挺輪廓和色邊位置 |
可變項 | 地點、景別、動作、天氣、攝影機運動 | 每個鏡頭只改變必要內容 |
準備一組而不是一張參考圖
單張正面肖像不能說明角色側臉、背面衣服和全身比例。建議至少準備:
正面半身圖:確認臉型、墨鏡、髮型和耳夾;
四分之三全身圖:確認身材、服裝剪裁和手包比例;
側面圖:支持轉頭、行走和跟拍鏡頭;
背面圖:確認髮髻位置、肩線與上裝後片;
道具特寫:固定手包、耳夾和墨鏡結構。
參考圖使用均勻光線和清楚輪廓,不要用強烈濾鏡掩蓋五官,也不要在角色母版中混入多個服裝版本。

圖注:角色母版同時記錄面部、銀灰髮髻、黑色窄框墨鏡、右耳銀色耳夾和黑色高領套裝,後續場景都回到這張圖核對身份。
在 PixPix 按鏡頭任務選擇視頻模型
MiniMax H3:先測試短鏡頭中的主體穩定
PixPix 的 MiniMax H3 官方頁面 當前說明其支援文字、圖片、視頻與聲音輸入,可處理人物、動作、鏡頭和時間順序,並將「主體穩定」作為重點能力。頁面公開的生成規格為 4–15 秒、最高 2K 與 24fps,具體選項以生成模式為準。
它更適合優先測試跟拍、推拉、搖移、升降或環繞等明確運鏡,以及人物與衣物、道具需要在運動中保持穩定的短鏡頭。第一次測試不要同時加入快速奔跑、360 度環繞、換裝和複雜物體交互。
Kling 3.0 Omni:處理多參考和複雜視聽任務
PixPix 的 Kling 3.0 Omni 官方頁面 將其定位為全模態視頻模型,可結合文字、圖片、視頻和音頻參考,並提供視頻生成、編輯、原生音頻與多鏡頭故事板控制。
當項目需要同時鎖定人物、場景基調、動作參考和聲音,或者一個任務本身包含更複雜的鏡頭組織時,可以把它列入候選。輸入素材越多,越需要寫清楚每份參考分別負責人物、動作、場景還是聲音,避免模型誤解引用關係。
Seedance 2.5:測試更長敘事與多參考銜接
根據 PixPix 的 Seedance 高清能力說明,Seedance 2.5 當前支援最長 30 秒生成、多張圖片及視頻和音頻參考、繼續延長與 1080P 輸出。
當鏡頭需要更長的動作鋪陳、人物與場景之間的連續關係,或後續仍要延長和調整時,可以優先測試 Seedance 2.5。時長更長並不等於人物自然更穩;如果動作複雜,仍建議先用較短版本驗證身份和動作結構,再進入最終規格。
把故事拆成四個可檢查的鏡頭
一致性測試不應該一開始就生成整支短片。先用四個差異明確但可控的鏡頭,逐步增加難度。
鏡頭 | 場景與動作 | 主要變化 | 必須保持 |
|---|---|---|---|
1 | 黑色攝影棚中景,顧遙站在洋紅燈框前 | 建立人物與道具 | 正臉、髮髻、墨鏡、耳夾、服裝與手包 |
2 | 雨夜城市廊道,攝影機側後方跟拍行走 | 環境與運動 | 側臉、髮髻位置、上裝後片、手包形狀 |
3 | 鏡面展廳低機位,顧遙伸手調整透明展台 | 姿勢與物件交互 | 年齡、身體比例、耳夾位置、服裝結構 |
4 | 暮色城市屋頂廣角,顧遙回望城市 | 光線與遠景 | 人物輪廓、髮色、黑色服裝與手包色邊 |
鏡頭 1:先建立人物與道具
鏡頭 1 使用穩定中景,顧遙站在黑色攝影棚的洋紅燈框前。這個鏡頭不追求複雜動作,重點是確認正臉、髮型、墨鏡、服裝和手包能否同時成立。

圖注:第一個鏡頭先用清楚的三分之四面部和簡單手部動作建立人物、服裝與道具基準。
鏡頭 2:改變環境並加入行走
鏡頭 2 將人物移到雨夜城市廊道,並從左後方跟拍。需要檢查側臉、髮髻位置、上裝後片與黑色手包是否仍然連續。

圖注:場景、光線和動作已經變化,但人物年齡、髮髻輪廓、墨鏡、右耳耳夾、上裝結構與手包外形仍需保持。
鏡頭 3:增加姿勢變化與物件交互
鏡頭 3 讓顧遙在鏡面展廳伸手調整透明展台。低機位、鏡面反射和手部交互會增加身體比例、重複人物與手部變形風險,因此手包作為穩定參照保留在身旁。

圖注:鏡面反射和物件交互同時出現時,應檢查臉、髮髻、耳夾、服裝接縫、手部接觸關係和手包比例。
鏡頭 4:用遠景驗證人物輪廓
鏡頭 4 切換到暮色屋頂廣角,顧遙背向城市並回頭。遠景中的面部資訊減少,更要依靠銀灰髮髻、墨鏡輪廓、黑色套裝剪影和手包洋紅色邊線維持識別。

圖注:最後一鏡主要變化是景別與光線;人物輪廓、服裝色塊和道具顏色仍應與母版一致。
鏡頭 1 通過後再進入鏡頭 2。若鏡頭 2 的側臉、髮髻或手包已經變化,不要繼續把它作為鏡頭 3 的唯一參考。
用固定身份塊編寫每個鏡頭的提示詞
通用角色身份塊
下面是為本案例設計的可復用模板,不是參考文章或任何模型的原始提示詞:
通用模板|角色身份塊
原創成年女性角色顧遙,成年橢圓臉型,銀灰色層次短髮向後收成低髮髻,佩戴黑色窄框墨鏡,右耳佩戴雕塑感銀色耳夾。她穿黑色高領收腰科技感上裝、黑色闊腿褲和黑色手套,攜帶一只帶洋紅色窄邊的硬挺黑色手包。保持相同臉型、年齡、髮髻位置、身材比例、服裝接縫、墨鏡、耳夾方向和手包結構,不換裝,不增加配飾。
這段身份塊應在每個鏡頭中重複。場景提示詞只追加地點、景別、動作、攝影機、環境動態、聲音和結束狀態。
鏡頭提示詞結構
可以按以下順序組織:
場景與時間;
景別與攝影機位置;
一個主要人物動作;
一個攝影機動作;
環境中允許運動的元素;
聲音需求;
角色與道具不可變化項;
鏡頭結束時的姿勢和構圖。
鏡頭 2 示例
通用模板|雨夜跟拍鏡頭
雨夜的現代城市廊道,地面有克制的濕潤反光。中大全身景,攝影機位於顧遙左後方,緩慢平行跟拍。顧遙手持帶洋紅色窄邊的黑色手包,以穩定步速向前行走,途中只輕微轉頭看向攝影機。雨水、上裝下擺和髮梢自然運動,背景保持乾淨且沒有其他人物接近主體。保持角色身份塊中的臉型、年齡、銀灰髮髻、黑色窄框墨鏡、右耳銀色耳夾、服裝剪裁和手包結構不變。鏡頭結束時,顧遙停在畫面右側三分線,側臉和手包完整可見。
提示詞裡不需要反覆堆疊「電影感、震撼、高級」等抽象形容詞。對一致性更有幫助的是明確攝影機在哪、角色做幾個動作、什麼必須不變,以及鏡頭在哪裡結束。
讓上一鏡幫助下一鏡,而不是傳播錯誤
主參考與交接幀承擔不同任務
角色母版是主參考,負責長期身份;上一鏡的審核通過幀是輔助參考,負責當前服裝狀態、光線方向和空間銜接。每個新鏡頭仍應帶入角色母版,不能只依賴上一個輸出幀。

圖注:母版持續負責人物身份,審核通過的畫格補充當前服裝、道具與場景狀態;二者共同進入下一鏡頭,而不是只傳遞上一畫格。
只交接乾淨的審核通過畫格
選擇面部清楚、沒有運動模糊、手和道具完整、服裝結構正確的畫面。若鏡頭最後一畫格恰好出現閉眼、遮擋或形變,可以選擇附近更穩定的一畫格作為視覺參考,並在剪輯中單獨處理轉場。
定期回到角色母版
連續把上一鏡頭傳給下一鏡頭,會讓微小變化逐步累積。完成兩到三個鏡頭後,應重新與角色母版核對;一旦出現明顯漂移,回到母版或更早的強參考重新生成,而不是繼續沿用錯誤畫格。
用同一張檢查表驗收每個鏡頭
每條影片生成後,至少檢查以下項目:
檢查項目 | 通過標準 | 常見失敗 |
|---|---|---|
面部身份 | 五官比例、年齡和臉型保持穩定 | 眼距變化、臉變幼、鼻樑重構 |
髮型 | 銀灰髮色、髮縫、碎髮和低髮髻位置一致 | 髮髻換邊、頭髮突然變長或變色 |
服裝 | 高領上裝的肩線、腰線、接縫與褲型一致 | 衣領變化、接縫消失、版型漂移 |
配飾 | 墨鏡比例穩定,右耳銀色耳夾存在且方向正確 | 左右互換、重複出現或變形 |
道具 | 黑色手包尺寸、硬挺輪廓和洋紅色邊線連續 | 包體變軟、色邊換位、憑空消失 |
動作與物理 | 步態、布料、雨水和接觸關係自然 | 滑步、穿模、手指黏連 |
鏡頭銜接 | 前後景別、視線和運動方向可剪輯 | 人物位置跳變、方向軸突然反轉 |
面部身份、年齡、標誌性服裝和道具屬於硬性檢查項,失敗就應修正或重做。背景小物的位置變化通常是軟性問題,是否接受取決於鏡頭敘事。

圖注:把四個鏡頭並排檢查,比逐張憑印象判斷更容易發現髮髻換位、墨鏡比例變化、耳夾消失、服裝接縫漂移或手包變形。
最容易破壞角色一致性的六種做法
只重複文字,不重複參考圖
相同提示詞只能維持人物類別,不能可靠保存唯一身份。每個鏡頭都應重新引用同一套母版。
一個鏡頭塞入太多動作
同時奔跑、轉身、打開手包、伸手互動、蹲下和抬頭,會增加遮擋與姿態變化。先確定一個主要動作,再用後續鏡頭完成下一步。
把錯誤的結束幀一直往後傳
前一鏡頭的髮型已經變長,後續鏡頭會把錯誤當作新標準。交接前必須先驗收,出現漂移時回到角色母版。
同時更換地點、光線、服裝和機位
一次改變太多變量,很難判斷是哪一項導致身份變化。測試階段每個鏡頭只增加一個主要難點。
多角色共用一張參考圖
多人鏡頭容易發生臉部融合、服裝互換和道具錯配。應為每個角色準備獨立參考,並明確人物的空間位置與互動順序。
先追求最高分辨率,再檢查人物
高分辨率不能修復已經漂移的身份。先用適合迭代的規格確認角色、動作和鏡頭,再進入最終輸出設定。
常見問題
只用一張人物照片能完成多場景影片嗎?
可以開始測試,但正面照片沒有提供側臉、背面和全身比例。鏡頭角度越多,越應該補充多角度角色參考和道具特寫。
PixPix 裡哪個影片模型最適合角色一致性?
沒有脫離任務的統一答案。短動作、明確運鏡和主體穩定可以先測試 H3;多參考、聲音和複雜鏡頭組織可以測試 Kling 3.0 Omni;更長敘事和多模態參考可以測試 Seedance 2.5。最終選擇應來自相同條件下的三鏡測試。
使用上一鏡頭最後一幀就一定不會變臉嗎?
不會。結束幀能幫助傳遞當前服裝、光線和構圖,但也可能攜帶運動模糊、閉眼或細微形變。它應作為輔助參考,角色母版仍是長期身份標準。
角色可以在中途換裝嗎?
可以,但換裝應被定義為明確的劇情變化。保留臉、髮型、年齡和身體比例,同時為新服裝建立新的正面、側面和背面參考,不要讓模型自行推斷服裝結構。
多人物對話怎麼減少身份互換?
為每人準備獨立參考,先生成單人反應鏡頭,再處理雙人中景。提示詞中寫清人物的左右位置、視線和動作順序;若臉部仍互換,可以拆鏡頭後在剪輯階段建立對話節奏。
使用真實人物參考圖要注意什麼?
應確保擁有素材使用權和人物授權,不用未經許可的肖像製作誤導性內容。公開或商業使用前,還要檢查目標平台與地區的相關規則。
總結
多場景 AI 影片的角色一致性並非一次生成的運氣,而是一套可檢查的製作方法:
建立角色母版 → 划分硬性錨點 → 按任務選擇模型 → 每鏡只增加一個主要變量 → 復用母版與審核通過幀 → 逐鏡驗收 → 漂移時重新錨定。
在 PixPix 開始專案時,可以先用顧遙的四鏡測試結構替換成自己的原創角色。只生成前三鏡,就足以觀察正面、側面、運動、光線和道具是否穩定;通過後再擴展完整故事,比直接生成長片更容易控制返工成本。

為電商團隊打造的 AI 出圖工具
面向上新、投放和活動行銷場景,用 AI 生成商品圖、場景圖、廣告圖與短影音素材,讓內容生產更高效。