AI 影片生成一直抽卡、一直燒錢?問題出在這三件事

TL;DR
  • AI 影片做不出能用的成品,多半不是模型不夠強,而是三個環節沒補上:角色沒有視覺基準、提示詞缺少鏡頭語言、AI 不知道你的專業規則。
  • 角色三視圖(正面、側面、背面)是數位分身穩定的最低門檻,補上表情與服裝細節會更穩。
  • 一段可用的影片提示詞至少要寫滿四件事:鏡位角度、運鏡方式、動作表現、情緒表情。缺一個,AI 就自己補。
  • 把品牌規則、產品事實、受眾語言、禁用清單整理成 AI 讀得懂的規範,它才知道怎麼幫你。
  • 這三件事做完,重生成次數會明顯下降,預算才守得住。

AI 影片生成不穩定,指的是同一個角色在不同片段之間出現臉部、髮型、服裝、身體比例或畫風漂移,加上動作與品牌訊息對不上,導致素材無法剪成一支可交付的成品。要解決它,方向有三個:先建立角色三視圖當視覺基準,再把鏡位、運鏡、動作、情緒四個要素寫進提示詞,最後把你的專業整理成 AI 可讀的規則。

我在企業內訓現場最常聽到的一句話是:「工具都買了,錢也燒了,為什麼影片還是不能用。」帳單是真的,成品不能用也是真的。但拆到最後,卡點幾乎都不在模型,而在這三件事沒做。

為什麼 AI 影片會燒錢:成本不是花在生成,是花在重做

生成一段五到十秒的影片,單次成本其實不高。真正把預算吃掉的是「重生成」。一個十五秒的口播片段抽卡二十次才勉強能用,等於同一秒鐘的畫面你付了二十次的錢,還沒算團隊等待與挑片的工時。

產業端也在講同一件事。NexusAi 在 2026 年的 AI 影片工作流程指南中直指,生成出來的片段與「可用的行銷資產」之間存在明顯落差,常見問題包括產品不一致、訊息不明確、動作錯誤,而且大多數 AI 生成片段仍然需要後製剪輯(NexusAi, 2026)。台灣行銷端的觀察更直接:當所有人都用同一套工具、輸入類似的關鍵字,產出的內容就會嚴重同質化,被演算法判定為低規內容鎖在流量池底部,白白浪費團隊薪資與時間成本(MarketersGo, 2026)。

換句話說,燒錢的不是 AI,是沒有前置作業的 AI。以下三件事,是我帶企業團隊時一定會先補齊的三塊地基。

問題一:分身不像你,是因為沒做角色三視圖

很多人做數位分身,只丟一張自拍就要 AI 生成十個片段。第一段還算像,第三段鼻子變了,第五段連髮線都換了位置。這不是模型失常,是你只給了一個視角,其他角度全部由 AI 自行推測。

角色三視圖是什麼

角色三視圖是動畫與遊戲產業行之有年的做法,指的是同一個角色的正面、側面、背面設定圖,用來固定五官、比例、髮型與服裝細節。放到 AI 影片生產上,它的功能就是給模型一份「這個人長這樣」的證據,而不是讓模型每次重新想像。

現在的做法已經不需要你會畫圖。市面上像 FlexClip、Pippit 都有現成的三視圖生成工具,能從一張參考圖產出全視角角色稿(FlexClipPippit)。真人分身則更簡單:直接用手機在同一光源、同一背景下拍三張。

一份合格的角色設定要包含哪些

項目 要拍到或寫清楚的內容
正面圖 五官、髮線、眉型、膚色、上半身比例,眼睛直視鏡頭
側面圖 鼻樑高度、下顎線、耳朵位置、後腦勺弧度
背面圖 髮尾長度、肩線寬度、服裝背面的版型與細節
表情頁 中性、微笑、專注、驚訝四種,讓口播不會只有一號表情
服裝與配件 整套穿搭、眼鏡、耳環、色票,用文字補上 hex 色碼最保險

實務上還有幾個小條件:三張圖要在同一次拍攝完成,光源固定、背景乾淨、不要中途換衣服。這聽起來很基本,但十個團隊裡有八個做不到,然後回頭怪 AI 不穩。

配套的鎖定寫法

有了三視圖,還要在每一段提示詞裡用同一組「身份句」把角色鎖住。我固定用這個結構:

使用參考圖中的同一位角色,完整保留臉部特徵、髮型、服裝與身體比例。
場景:辦公室窗邊,午後自然光。
動作:轉身面向鏡頭,說話。
禁止更改:臉型、年齡、髮色、服裝、畫風。

結尾那句負面指令很多人會省略,但它是差距最大的一句。國外創作者指南在整理角色一致性做法時,也把「勿更改臉部、髮型、服裝、年齡、身體比例」列為固定收尾(Elser AI, 2026)。我自己用 Gemini Omni 做角色一致性測試時,加與不加這句話,可用率差了將近一倍,完整過程我寫在這篇實作紀錄裡。

問題二:提示詞不到位,少了鏡頭語言的四個要素

「一個女生在咖啡廳喝咖啡」這種提示詞,AI 一定生得出來,但生出來的東西你不能用。因為你只給了內容,沒給拍法。導演會問的四件事,你一件都沒回答。

四個要素分別在解決什麼

要素 決定什麼 可直接抄的寫法
鏡位角度 觀眾站在哪裡看,以及畫面裡有多少資訊 中景、胸上特寫、過肩鏡頭、俯角 30 度、低角度仰拍
運鏡方式 畫面怎麼動,決定節奏與情緒推進 固定鏡頭、緩慢推近、環繞、手持輕晃、橫向平移
動作表現 角色在這幾秒裡做了什麼,一個片段只放一個主要動作 拿起杯子、翻開筆電、轉頭看向鏡頭、伸手指向螢幕
情緒表情 觀眾要接收到的感受,也是最容易被漏掉的一項 專注而放鬆、若有所思、眼神帶笑、微微皺眉

同一個畫面,寫法差在哪

改寫前
一個女生在咖啡廳喝咖啡,感覺很悠閒。
結果:人物每次都不一樣,鏡頭亂飄,剪不進去。
改寫後
胸上特寫,鏡頭緩慢推近;三十歲女性坐在窗邊木桌,雙手捧起白色陶杯喝一口咖啡,隨後放下;表情專注而放鬆,眼神帶笑;午後側逆光,暖色調,淺景深。
結果:鏡位、運鏡、動作、情緒四項齊備,可用率明顯提升。

記一個順序就好:鏡位、運鏡、動作、情緒,再補光線與色調。四項寫滿之後,你會發現抽卡次數自然降下來,因為 AI 不需要猜。我用兩張照片做貓咪咖啡廣告時,就是靠這套順序把提示詞收斂到兩段,全部提示詞我公開在這裡

還有一個常被忽略的細節:一個片段只放一個主要動作。想在五秒內塞進「走進來、坐下、打開電腦、開始說話」,模型會全部糊在一起。把它拆成四段,反而更快也更省。

問題三:你沒把專業講清楚,AI 只好自己編

前兩件事解決畫面,第三件事解決內容。很多團隊的影片畫面已經很漂亮,但業務看完會說「這不是我們家在講的東西」。因為 AI 手上沒有你的專業,只有網路上的平均值。

AI 不會讀心,它只會讀規則。你給它願望,它給你想像;你給它規則,它才給你成品。

要餵給 AI 的四層規則

  1. 品牌層:語氣、人稱、視覺色票、字型、能講與不能講的立場。寫成一頁就好,但要具體到「我們稱呼客戶為夥伴,不用您」這種程度。
  2. 產品層:規格、售價、適用對象、與競品的實際差異。數字要正確,因為這是最常被 AI 編造的區塊。
  3. 受眾層:目標對象的職稱、痛點、他們自己會用的字。行銷人說「轉換率」,老闆說「有沒有變現」,這兩句寫進影片的效果差很多。
  4. 禁用層:不能出現的詞、不能承諾的效果、法規紅線。醫美、保健、金融這幾類產業尤其要先立這一層。

這四層整理成一份文件,每次開新對話先貼上去,或建成專屬的知識庫。前置一次,後面每一支影片都在受益。這也是我在短影音腳本的四件事那篇提過的同一個邏輯:規則寫在前面,產出才會穩。

一個可以直接改的訓練範本

你是我的品牌影音企劃。以下是規則,之後每一次產出都要遵守。
品牌語氣:專業但不端架子,用「我們」與「你」,不使用「您」。
產品事實:課程為六週線上直播,每週兩小時,售價 12,800 元,對象是有兩年以上經驗的行銷人。
受眾用語:他們說「跑不出量」「素材疲乏」,不說「內容效益低落」。
禁用:不得承諾具體成效數字,不得比較指名競品。
輸出格式:每個片段給我鏡位、運鏡、動作、情緒四行,加一行口白,長度控制在五秒。

把三件事串成一條可重複的流程

單獨做任何一件都會有改善,但真正讓成本降下來的是把它們接成固定流程。我帶企業團隊時用的順序是這樣:

  1. 建角色資產:一次拍好三視圖與四種表情,存成專案資料夾,日後所有影片共用。
  2. 寫規則文件:品牌、產品、受眾、禁用四層各寫一段,總長不超過一頁。
  3. 拆分鏡:一支三十秒影片拆成六個五秒片段,每段只放一個主要動作。
  4. 寫四要素提示詞:每段依鏡位、運鏡、動作、情緒的順序寫,開頭加身份句,結尾加負面指令。
  5. 先生圖再生影:關鍵幀先出靜態圖確認角色沒跑掉,確認後再轉動態,這一步能省掉大量無效生成。
  6. 統一後製:把片段接起來、調色、上字幕與配樂。剪輯這段也可以自動化,我實測過的做法在這篇自動剪片教學

第五步是最多人跳過、也最可惜的一步。靜態圖的生成成本遠低於影片,用它來當品管關卡,等於用最便宜的方式把錯誤擋在前面。

常見問題

Q角色三視圖一定要三張嗎,兩張可以嗎

兩張(正面與側面)已經比一張穩很多,但背面決定髮尾與肩線,只要影片裡角色會轉身就一定需要。純口播的固定機位影片,正面加側面可以先上路。

Q提示詞要寫多長才夠

重點不是長度而是覆蓋率。鏡位、運鏡、動作、情緒四項寫滿,通常五十到八十字就夠。堆一堆形容詞反而會讓模型抓不到重點。

Q同一支影片可以混用不同的 AI 影片工具嗎

可以,但要固定風格描述用詞。不同模型對「電影感」「寫實」的理解不同,中途換說法就會出現畫風跳動。混用時建議統一由同一組參考圖出發。

Q為什麼影片畫面很好看,客戶還是說不能用

多半是內容層的問題。畫面對了但訊息、用語、產品事實沒對齊品牌,就會變成好看的陌生影片。把品牌、產品、受眾、禁用四層規則整理給 AI,這類狀況會大幅減少。

Q沒有設計背景,做得出角色三視圖嗎

可以。真人分身用手機在同一光源下拍三個角度即可;虛擬角色可以用現成的三視圖生成工具,從一張參考圖產出全視角角色稿,再手動修掉不合的細節。

結論

AI 影片一直抽卡、一直燒錢,很少是因為你買錯工具。它通常是三個缺口疊在一起:角色沒有基準、提示詞沒有鏡頭語言、AI 不認識你的專業。三個缺口都補起來之後,同樣的預算能產出的可用素材量會完全不同。

而且這三件事都是一次性投資。三視圖拍一次能用整年,規則文件寫一次能用在每一支影片,四要素的順序記起來就是你的肌肉記憶。真正貴的從來不是生成費用,是每一次重來。

如果你想把這三件事一次做熟,與其自己一個人抽卡試錯,不如找一場能當場動手做完的訓練。

AI 影音自媒體訓練營實體工作坊封面|AI 商業影音講師紀澄 Abby Chi
實體工作坊開放報名中
AI 影音自媒體訓練營

這不是一堂教你玩 AI 工具的課,是教你用 AI 分身經營自媒體。兩天課程裡,先定好人設定位、建立自己的話題池、寫出一份口播腳本,再用 AI 分身做成影音,最後接上從導流量到轉私訊的變現漏斗。

  • 現場建好屬於你的 AI 分身角色資產,不用回家再自己摸索
  • 帶走可重複套用的提示詞結構,以及 9 套變現實戰配備
  • 把影音接上變現漏斗,讓內容不只是拿到觀看數

查看課程與報名


關於作者

紀澄 Abby Chi
紀澄 Abby Chi
AI 商業影音講師 / 社群營運顧問

雲時代數位有限公司執行長,15 年品牌行銷實戰經驗。顧問專業領域涵蓋 AI 營運系統應用、品牌年度行銷策略、AI 商業廣告、Meta 社群營運策略、個人品牌經營。提供一對一諮詢服務,歡迎聯絡。

帶領團隊榮獲 行銷傳播傑出貢獻獎金獎廣告流行語金句獎 4 座

預約諮詢

分享此內容: