
- 登入
- 註冊
AI 影片生成不穩定,指的是同一個角色在不同片段之間出現臉部、髮型、服裝、身體比例或畫風漂移,加上動作與品牌訊息對不上,導致素材無法剪成一支可交付的成品。要解決它,方向有三個:先建立角色三視圖當視覺基準,再把鏡位、運鏡、動作、情緒四個要素寫進提示詞,最後把你的專業整理成 AI 可讀的規則。
我在企業內訓現場最常聽到的一句話是:「工具都買了,錢也燒了,為什麼影片還是不能用。」帳單是真的,成品不能用也是真的。但拆到最後,卡點幾乎都不在模型,而在這三件事沒做。
生成一段五到十秒的影片,單次成本其實不高。真正把預算吃掉的是「重生成」。一個十五秒的口播片段抽卡二十次才勉強能用,等於同一秒鐘的畫面你付了二十次的錢,還沒算團隊等待與挑片的工時。
產業端也在講同一件事。NexusAi 在 2026 年的 AI 影片工作流程指南中直指,生成出來的片段與「可用的行銷資產」之間存在明顯落差,常見問題包括產品不一致、訊息不明確、動作錯誤,而且大多數 AI 生成片段仍然需要後製剪輯(NexusAi, 2026)。台灣行銷端的觀察更直接:當所有人都用同一套工具、輸入類似的關鍵字,產出的內容就會嚴重同質化,被演算法判定為低規內容鎖在流量池底部,白白浪費團隊薪資與時間成本(MarketersGo, 2026)。
換句話說,燒錢的不是 AI,是沒有前置作業的 AI。以下三件事,是我帶企業團隊時一定會先補齊的三塊地基。
很多人做數位分身,只丟一張自拍就要 AI 生成十個片段。第一段還算像,第三段鼻子變了,第五段連髮線都換了位置。這不是模型失常,是你只給了一個視角,其他角度全部由 AI 自行推測。
角色三視圖是動畫與遊戲產業行之有年的做法,指的是同一個角色的正面、側面、背面設定圖,用來固定五官、比例、髮型與服裝細節。放到 AI 影片生產上,它的功能就是給模型一份「這個人長這樣」的證據,而不是讓模型每次重新想像。
現在的做法已經不需要你會畫圖。市面上像 FlexClip、Pippit 都有現成的三視圖生成工具,能從一張參考圖產出全視角角色稿(FlexClip、Pippit)。真人分身則更簡單:直接用手機在同一光源、同一背景下拍三張。
| 項目 | 要拍到或寫清楚的內容 |
| 正面圖 | 五官、髮線、眉型、膚色、上半身比例,眼睛直視鏡頭 |
| 側面圖 | 鼻樑高度、下顎線、耳朵位置、後腦勺弧度 |
| 背面圖 | 髮尾長度、肩線寬度、服裝背面的版型與細節 |
| 表情頁 | 中性、微笑、專注、驚訝四種,讓口播不會只有一號表情 |
| 服裝與配件 | 整套穿搭、眼鏡、耳環、色票,用文字補上 hex 色碼最保險 |
實務上還有幾個小條件:三張圖要在同一次拍攝完成,光源固定、背景乾淨、不要中途換衣服。這聽起來很基本,但十個團隊裡有八個做不到,然後回頭怪 AI 不穩。
有了三視圖,還要在每一段提示詞裡用同一組「身份句」把角色鎖住。我固定用這個結構:
結尾那句負面指令很多人會省略,但它是差距最大的一句。國外創作者指南在整理角色一致性做法時,也把「勿更改臉部、髮型、服裝、年齡、身體比例」列為固定收尾(Elser AI, 2026)。我自己用 Gemini Omni 做角色一致性測試時,加與不加這句話,可用率差了將近一倍,完整過程我寫在這篇實作紀錄裡。
「一個女生在咖啡廳喝咖啡」這種提示詞,AI 一定生得出來,但生出來的東西你不能用。因為你只給了內容,沒給拍法。導演會問的四件事,你一件都沒回答。
| 要素 | 決定什麼 | 可直接抄的寫法 |
| 鏡位角度 | 觀眾站在哪裡看,以及畫面裡有多少資訊 | 中景、胸上特寫、過肩鏡頭、俯角 30 度、低角度仰拍 |
| 運鏡方式 | 畫面怎麼動,決定節奏與情緒推進 | 固定鏡頭、緩慢推近、環繞、手持輕晃、橫向平移 |
| 動作表現 | 角色在這幾秒裡做了什麼,一個片段只放一個主要動作 | 拿起杯子、翻開筆電、轉頭看向鏡頭、伸手指向螢幕 |
| 情緒表情 | 觀眾要接收到的感受,也是最容易被漏掉的一項 | 專注而放鬆、若有所思、眼神帶笑、微微皺眉 |
|
改寫前
一個女生在咖啡廳喝咖啡,感覺很悠閒。
結果:人物每次都不一樣,鏡頭亂飄,剪不進去。
|
改寫後
胸上特寫,鏡頭緩慢推近;三十歲女性坐在窗邊木桌,雙手捧起白色陶杯喝一口咖啡,隨後放下;表情專注而放鬆,眼神帶笑;午後側逆光,暖色調,淺景深。
結果:鏡位、運鏡、動作、情緒四項齊備,可用率明顯提升。
|
記一個順序就好:鏡位、運鏡、動作、情緒,再補光線與色調。四項寫滿之後,你會發現抽卡次數自然降下來,因為 AI 不需要猜。我用兩張照片做貓咪咖啡廣告時,就是靠這套順序把提示詞收斂到兩段,全部提示詞我公開在這裡。
還有一個常被忽略的細節:一個片段只放一個主要動作。想在五秒內塞進「走進來、坐下、打開電腦、開始說話」,模型會全部糊在一起。把它拆成四段,反而更快也更省。
前兩件事解決畫面,第三件事解決內容。很多團隊的影片畫面已經很漂亮,但業務看完會說「這不是我們家在講的東西」。因為 AI 手上沒有你的專業,只有網路上的平均值。
AI 不會讀心,它只會讀規則。你給它願望,它給你想像;你給它規則,它才給你成品。
這四層整理成一份文件,每次開新對話先貼上去,或建成專屬的知識庫。前置一次,後面每一支影片都在受益。這也是我在短影音腳本的四件事那篇提過的同一個邏輯:規則寫在前面,產出才會穩。
單獨做任何一件都會有改善,但真正讓成本降下來的是把它們接成固定流程。我帶企業團隊時用的順序是這樣:
第五步是最多人跳過、也最可惜的一步。靜態圖的生成成本遠低於影片,用它來當品管關卡,等於用最便宜的方式把錯誤擋在前面。
兩張(正面與側面)已經比一張穩很多,但背面決定髮尾與肩線,只要影片裡角色會轉身就一定需要。純口播的固定機位影片,正面加側面可以先上路。
重點不是長度而是覆蓋率。鏡位、運鏡、動作、情緒四項寫滿,通常五十到八十字就夠。堆一堆形容詞反而會讓模型抓不到重點。
可以,但要固定風格描述用詞。不同模型對「電影感」「寫實」的理解不同,中途換說法就會出現畫風跳動。混用時建議統一由同一組參考圖出發。
多半是內容層的問題。畫面對了但訊息、用語、產品事實沒對齊品牌,就會變成好看的陌生影片。把品牌、產品、受眾、禁用四層規則整理給 AI,這類狀況會大幅減少。
可以。真人分身用手機在同一光源下拍三個角度即可;虛擬角色可以用現成的三視圖生成工具,從一張參考圖產出全視角角色稿,再手動修掉不合的細節。
AI 影片一直抽卡、一直燒錢,很少是因為你買錯工具。它通常是三個缺口疊在一起:角色沒有基準、提示詞沒有鏡頭語言、AI 不認識你的專業。三個缺口都補起來之後,同樣的預算能產出的可用素材量會完全不同。
而且這三件事都是一次性投資。三視圖拍一次能用整年,規則文件寫一次能用在每一支影片,四要素的順序記起來就是你的肌肉記憶。真正貴的從來不是生成費用,是每一次重來。
如果你想把這三件事一次做熟,與其自己一個人抽卡試錯,不如找一場能當場動手做完的訓練。
![]() |
|
實體工作坊開放報名中
AI 影音自媒體訓練營
這不是一堂教你玩 AI 工具的課,是教你用 AI 分身經營自媒體。兩天課程裡,先定好人設定位、建立自己的話題池、寫出一份口播腳本,再用 AI 分身做成影音,最後接上從導流量到轉私訊的變現漏斗。
|
|
紀澄 Abby Chi
AI 商業影音講師 / 社群營運顧問
雲時代數位有限公司執行長,15 年品牌行銷實戰經驗。顧問專業領域涵蓋 AI 營運系統應用、品牌年度行銷策略、AI 商業廣告、Meta 社群營運策略、個人品牌經營。提供一對一諮詢服務,歡迎聯絡。 帶領團隊榮獲 行銷傳播傑出貢獻獎金獎、廣告流行語金句獎 4 座。
|