
- 登入
- 註冊

AI 影片放大,指的是把已經生成好的低解析度影片(480P 或 720P)轉成 1080P 以上的規格。做法分兩種:一種是真的用模型逐格重建細節,另一種是傳統的高品質縮放,只是把像素算大、不生新東西。付費平台賣的是前者,但前者其實也能在自己電腦免費跑 — Real-ESRGAN 是開源專案,透過 NCNN/Vulkan 可以直接用本機顯卡運算,不綁 CUDA,官方說明列出的支援範圍涵蓋 Intel、AMD、NVIDIA,不需要上傳、不需要訂閱。
這篇要講的就是怎麼把這件事變成一個雙擊就能開的工具:為什麼值得把解析度往後挪、工具怎麼做出來、提示詞為什麼要寫成那個樣子,以及 AI 重建什麼時候會幫倒忙。
先把一個習慣拆掉:很多人開新專案的第一件事,是把解析度拉到平台允許的最高階,然後開始抽。這個順序是反的。
AI 影片的工作方式本來就是大量生、大量丟。一支真正能用的片段背後,通常躺著好幾支被刪掉的,而且越是要求角色一致、運鏡精準的案子,這個比例越難看。這代表你每付一次高解析度的錢,有很高的機率是付在一個等下就會被刪掉的檔案上。
而生成平台幾乎都按解析度分級計費,解析度越高單位成本越高,排隊等算圖的時間通常也越長。這兩件事疊在一起,抽卡階段就開最高階是最不划算的選擇。各家的實際級距與計價方式會隨版本調整,開始前自己到後台的用量說明確認一次比較準。
所以合理的順序是:試鏡頭、試運鏡、批量抽變體,這些全部在低解析度做,因為你在這個階段要判斷的是構圖對不對、動作順不順、角色有沒有飄,這些用 480P 就看得出來。等片段定案,再處理解析度。差別只在於,最後那一關要不要繼續付給平台。
| 階段 | 做什麼 | 成本 |
| 試片與抽卡 | 480P 或 720P 大量生成,確認構圖、運鏡、角色一致性 | 最低階點數,丟掉也不心疼 |
| 定案 | 選出真正要進剪輯的片段,其他全刪 | 零 |
| 放大交付 | 本機顯卡逐格 AI 重建,批次轉成 1920×1080 或 1080×1920 | 零,只花電腦運算時間 |
第三段是這篇的主題。它不需要上傳、不需要登入、不需要訂閱,因為模型跟工具鏈都是開源的:Real-ESRGAN 負責重建、FFmpeg 負責影片拆解與合成。卡住一般人的從來不是取得不到,是這些東西都只有命令列,沒有人會為了一次交付去背指令、寫批次腳本。
這就是 Codex 補上的那一塊。
2026 年 7 月起,原本獨立的 Codex app 併進了 ChatGPT 桌面版。現在一個桌面程式裡有 Chat、Work、Codex 三種模式,Mac 和 Windows 都有,所有方案都能用。裝好之後從左上角的選單切到 Codex 就對了。
Codex 和網頁版 ChatGPT 最大的差別在於,它能讀寫你電腦上的檔案、開終端機、安裝套件、執行程式。這也是為什麼同一段提示詞在網頁版只會得到一份程式碼,在 Codex 裡會得到一個可以雙擊打開的程式。
建議另外開一個乾淨的資料夾當專案目錄,不要直接丟在桌面或下載資料夾,之後找檔案會比較清楚。貼完提示詞按下送出,它會先檢查這台電腦的顯示卡、顯示記憶體與可用空間,再決定實作方式,接著去官方來源取得 Real-ESRGAN 權重與 FFmpeg,然後開始寫程式。過程中它會問你要不要允許下載或執行,同意就好。
這一版比單純縮放那種工具重很多,因為它要跑實測、比對樣本、量實際耗時。實際要跑多久取決於你電腦上缺多少東西,中間還會停下來等你同意,所以不要排在趕件的空檔做。結束時它會告訴你程式放在哪、桌面捷徑叫什麼,以及哪些項目是實測過的、哪些只是估算。
以下整段複製貼上即可。這一版是寫給 Windows 的,Mac 要改哪幾行寫在文末的常見問題。
如果你只丟一句「幫我做一個 AI 影片放大工具」,得到的多半是一份可以跑但不能用的東西:一次只能處理一支、輸出直接蓋掉原檔、遇到中文檔名就掛掉、跑到一半失敗整批停住。更麻煩的是另一種情況 — 它嘴上說做了 AI,實際上跑的是普通縮放,而你從解析度數字上完全看不出來。
這些不是模型笨,是你沒說。上面那段提示詞的每一個區塊,都在防一種具體的失敗:
| 區塊 | 它在防什麼 |
| 開頭那兩句 | 防它給你一篇教學。明講「直接完成可執行程式、測試、使用說明與桌面捷徑」,是把交付標準定義成「可以雙擊打開」,不是「理論上可行」。順便要求它先看你的硬體再決定做法,而不是套一份通用範本。 |
| AI 模型與引擎 | 這是全篇最重要的一塊,防的是「假 AI」。把模型名稱、執行引擎、來源與校驗碼全部寫死,再補上「不可偷偷改成普通縮放」「失敗時明確報錯,不假裝成功」。沒有這幾句,你很可能交出一批以為經過重建、其實只是被拉大的檔案。 |
| 處理模式 | 防兩種模式在介面上混在一起。AI 和非 AI 各自標示清楚,你才知道手上這支片到底經歷了什麼。最後那句「不要宣稱生成的細節一定等於原始真實資訊」,是讓工具自己對你誠實。 |
| 輸出設定 | 防畫質與時間軸被模型自己決定。直式橫式分開指定、黑邊不裁切、旋轉資訊要讀,這三條是短影音素材最容易出事的地方;幀率與時間碼那幾句,則是防影片變長、變短或音畫不同步。 |
| 介面 | 防它做成一次一支。批次、拖曳、進度、取消決定這工具是玩具還是能上工。這一版還多要了 3 秒預覽和同尺寸比較 — AI 重建是有風險的動作,先看三秒再決定要不要燒一整批的時間。 |
| 批次與效能 | 防它拿別人電腦的參數硬套在你的顯卡上,也防它為了跑快一點偷偷跳影格。最後那句「不要未實測就承諾處理速度」,是不讓它用漂亮數字唬你。 |
| 檔案保護 | 防你哪天按下去把客戶原檔洗掉。不覆寫、先寫暫存再改名、只清理本次的暫存、單支失敗不中斷整批,這四條是這段提示詞裡最沒得商量的。 |
| 測試要求與交付 | 防「說完成了但沒測過」。把測試案例逐條列出來它才會真的跑,而「不要只憑退出碼或解析度正確就宣稱成功」「明確區分已實作、已測試、估算值與未完成」這兩句,是要它交出一份誠實的驗收報告。 |
這個寫法可以搬到別的任務上。要 AI 交付一個東西而不是一份說明,順序就是:先定義交付標準,再定義使用情境,再定義不能發生的事,最後定義驗收方式。跟你發包給外包廠商時寫的規格書,是同一件事 — 而且你會發現,規格書裡最值錢的段落,從來都是「不可以發生什麼」。
|
想把整條 AI 影音工作流一次建起來
從腳本、分鏡、生成到後製交付,雲時代數位提供 AI 商業影音的導入顧問與製作服務,也承接企業內訓。 |
提示詞裡那些名詞不是隨便抄的,每一個都對應一個會被看出來的問題。你不需要記住它們,但知道在調什麼,之後要改比較有把握。
| 設定 | 在處理什麼 |
| realesr-general-x4v3 | Real-ESRGAN 官方說明把它描述成「通用場景的輕量小模型」。選它不是因為它最強,是因為題材不挑,而且輕到撐得住整批跑。它另外提供降噪強度的選項,用來避免畫面被過度平滑。 |
| NCNN/Vulkan | 讓模型跑在本機顯卡上的執行引擎。關鍵在於它走 Vulkan 而不綁 CUDA,官方說明列出的支援範圍涵蓋 Intel、AMD、NVIDIA。這是「不用付費、也不用特地買 N 卡」的技術前提。 |
| 原生 4 倍再縮回目標 | 模型名稱裡的 x4 就是放大倍率,官方也提供調整最終輸出尺寸的參數。提示詞讓它先用原生倍率重建、再縮到 1080,是為了讓模型跑在自己的設計倍率上。 |
| 雙模式並列 | 快速 AI 是真重建,一般放大是 Lanczos 縮放。保留後者是因為有些片段本來就乾淨,不需要冒重建的風險。重點是介面上要分得清楚,不能把縮放的結果當成 AI 成果交出去。 |
| libx264 + CRF 17 | 壓縮這關的起始設定。CRF 數字越小畫質越好、檔案越大,17 到 18 一般被視為接近視覺無損的區間。重建完再壓一次會二次劣化,所以這裡刻意比常見的預設值保守。 |
| 保留原始 FPS 與時間碼 | 影片拆成影格再合回去,最容易出事的就是時間軸:變長、變短或音畫不同步。要指定 FPS 也可以,但那是重複或刪減影格,不是 AI 補幀,工具必須標示清楚。 |
| 音訊優先複製 | 能不重壓就不重壓,音質零損失。只有格式不相容 MP4 時才轉 AAC。 |
這一段比前面都重要。換成真的 AI 重建之後,這件事不再是沒有代價的 — 它會動到畫面內容,用錯地方會讓你以為省了錢,其實交出去的東西變差了。
先講原理。模型做的不是把像素算大,是根據學過的大量畫面,推論「這個位置應該長什麼樣子」然後畫出來。所以它能補出髮絲、織紋、邊緣的銳利度,這些確實是新的細節。但那是推論出來的合理結果,不是原片本來就有的資訊。提示詞裡那句「不要宣稱生成的細節一定等於原始真實資訊」,講的就是這件事。
最容易出問題的位置也很固定:人臉五官、手指、文字招牌、商品上的 logo。這些地方原片資訊本來就少,模型只能靠推論補,補出來的結果可能很清楚、但跟原本不一樣。
| 適合交給 AI 重建 | 先預覽,或乾脆不要 |
| 片段已經定案、畫面乾淨,只是生成時選了低解析度 | 原片就有破圖、手指怪、結構錯,重建只會把錯的東西畫得更清楚 |
| 有壓縮雜訊、邊緣偏軟的素材,降噪強度可以調 | 人臉大特寫、商品 logo、招牌文字,這些位置最容易被補成不一樣的東西 |
| 一次要交十幾二十支,需要規格統一的批次輸出 | 需要每一格都跟原片完全對得上的鏡頭,例如尺寸承諾類廣告 |
| 客戶素材有保密要求,不能上傳到第三方平台 | 想靠放大掩蓋一支本來就該重抽的片段 |
右邊那欄不代表完全不能用,代表要先跑那個 3 秒預覽。工具裡留那個功能就是為了這件事:花三秒看一眼,比花一整批的時間跑完再發現臉不對划算太多。至於最後一列,如果底子有瑕疵、種子選錯、動作不對,正確的動作是拿同一組參考素材重新生成一次,不是在後面補救。放大處理的是解析度,不是內容本身的問題。
延伸閱讀:如果你的困擾是片段一直重抽、成本一直上去,這篇拆了三個真正的原因;剪輯那一段也能交給 Codex 做,流程在Codex 自動剪片教學;想看完整的生成端工作流,貓咪咖啡廳 AI 廣告的實作拆解有兩段提示詞全公開;平台選擇可以參考Lumina 一站式 AI 影音平台介紹。
Q這樣算真的 AI 放大嗎?跟平台賣的付費升頻差在哪?
是真的重建,用的是 Real-ESRGAN。能確定的差別是算力跑在哪裡、誰收費:這是開源專案,透過 NCNN/Vulkan 在你自己的顯卡上跑,所以不用付費也不用上傳。各家付費工具用的模型不同,效果差異要看素材實測,我沒有逐一比對過,不會說哪邊一定比較好。
Q授權可以商用嗎?
Real-ESRGAN 主專案採 BSD-3-Clause,NCNN/Vulkan 實作採 MIT,兩個都是寬鬆的開源授權。提示詞裡要求保留模型來源、版本、授權與 SHA256,就是為了讓這份資料留在交付內容裡。實際要用在商業案上,還是自己看一次授權條文,或問你的法務。
Q一定要有獨立顯卡嗎?內顯跑得動嗎?
Vulkan 不綁 CUDA,官方說明列出的支援範圍涵蓋 Intel、AMD、NVIDIA,所以不是「沒有 N 卡就不行」。但顯示記憶體會直接影響分塊大小和速度,配備差距很大,實際跑多快只能自己測。這也是提示詞第一句要它先檢查顯卡與顯示記憶體、再依實測決定參數的原因,不要套別人電腦的數字。
QAI 重建會不會把人臉或商品變形?
有可能,尤其是人臉特寫、手指、文字和 logo 這些原片資訊本來就少的位置。模型補的是「看起來合理」的細節,不是原本的資訊。所以提示詞裡要了 3 秒預覽和原片同尺寸比較:先處理三秒、對著看一眼,覺得臉沒跑掉再跑整批。這一步不要省。
Q我完全不會寫程式,這樣做得起來嗎?
可以。你要做的只有三件事:裝 ChatGPT 桌面版、貼提示詞、過程中同意它下載與執行。程式碼你不用看也不用改。真的跑出錯誤,把錯誤訊息貼回去給它,讓它自己修。
Q影片會被上傳到哪裡嗎?客戶素材有保密協議。
影片本身不會離開你的電腦,模型和 FFmpeg 都在本機跑。提示詞裡那句「全部影片在本機處理,不上傳、不串接付費 API」就是在鎖這件事。需要注意的是製作工具的那段對話本身是走雲端的,所以不要把客戶機密內容寫進提示詞裡。
QMac 可以用嗎?
可以,官方有釋出 macOS 版本的執行檔。要改的是提示詞裡跟 Windows 綁在一起的部分:開頭改成「請從零製作一個 macOS 通用 AI 影片批次放大工具」,介面那條的「Windows 桌面程式」改成 macOS,交付那條的「桌面捷徑」改成 Mac 上對應的開啟方式,其餘規格不用動。我自己是在 Windows 上跑的,Mac 的實際速度與相容性請以你跑出來的結果為準。
這件事真正的價值不在那個放大工具,而在於重新排了一次順序:把花錢的決策往後移到「已經確定要用」之後。生成階段用最便宜的規格大量試,定案之後的重建,交給自己電腦跑。省下來的不只是點數,還有等算圖的時間。
另外一層是,現在「有一個工具」和「會寫程式」已經不是同一件事了。你需要的是把需求講清楚的能力:交付長什麼樣、會被怎麼用、不能發生什麼、怎麼驗收。這四件事你在發包時本來就天天在寫,只是換一個對象。
省點數是技巧,能穩定交出東西才是本事。如果你想把這條線整個練起來,我有兩門課分別對應兩種目標。
![]() |
|
實體工作坊
AI短影音即戰班
這篇省下的是點數,省不掉的是把一支片從零做出來的手感。四小時實體工作坊,從品牌溝通、腳本撰寫、畫面生成、影片生成、配樂到剪輯組裝,當天做出一支品牌可以直接發布的 AI 短影音。 |
![]() |
|
實體工作坊
AI影音自媒體訓練營
如果你要的不是單支片,是長期經營自己的頻道。兩天的訓練營從一份口播腳本開始,帶你做出以你為主角的 AI 自媒體影音。不露臉也能做,會露臉也能省下拍攝。 |
不確定哪一門適合,可以直接用 LINE 問我。
|
紀澄 Abby Chi
AI 商業影音講師 / 社群營運顧問
雲時代數位有限公司執行長,16 年品牌行銷實戰經驗。顧問專業領域涵蓋 AI 營運系統應用、品牌年度行銷策略、AI 商業廣告、Meta 社群營運策略、個人品牌經營。提供一對一諮詢服務,歡迎聯絡。 帶領團隊榮獲 行銷傳播傑出貢獻獎金獎、廣告流行語金句獎 4 座。
|