AI 影片生 1080P 太貴:我用 Codex 做了一個本機放大工具

重點摘要
  • AI 影片的工作方式是大量生、大量丟。一支能用的片段背後通常躺著好幾支被刪掉的,而生成平台幾乎都按解析度分級計費,所以在抽卡階段就開最高階,等於把錢付在還不確定會不會留下的檔案上。
  • 我的做法是把解析度往後挪:生成階段用便宜的低解析度大量試,確定要用的片段才放大成 1080P,而且放大這段不回平台,在自己電腦跑。
  • 放大工具是用 Codex 做的,不是我寫程式。下載 ChatGPT 桌面版、切到 Codex、貼一段提示詞,它會檢查顯卡、裝環境、寫程式、跑實測、做出桌面捷徑。
  • 底層是 Real-ESRGAN 的 realesr-general-x4v3,透過 NCNN/Vulkan 跑本機顯卡,是真的逐格 AI 重建。工具同時保留一個非 AI 的 Lanczos 模式,兩者在介面上分開標示,不混為一談。
  • AI 重建生出來的細節是「看起來合理」,不等於原片真的有那個資訊。原片破圖、結構錯的,重建只會把錯的東西畫得更清楚,該重生成還是要重生成。

AI 影片放大,指的是把已經生成好的低解析度影片(480P 或 720P)轉成 1080P 以上的規格。做法分兩種:一種是真的用模型逐格重建細節,另一種是傳統的高品質縮放,只是把像素算大、不生新東西。付費平台賣的是前者,但前者其實也能在自己電腦免費跑 — Real-ESRGAN 是開源專案,透過 NCNN/Vulkan 可以直接用本機顯卡運算,不綁 CUDA,官方說明列出的支援範圍涵蓋 Intel、AMD、NVIDIA,不需要上傳、不需要訂閱。

這篇要講的就是怎麼把這件事變成一個雙擊就能開的工具:為什麼值得把解析度往後挪、工具怎麼做出來、提示詞為什麼要寫成那個樣子,以及 AI 重建什麼時候會幫倒忙。

為什麼不要一開始就開 1080P

先把一個習慣拆掉:很多人開新專案的第一件事,是把解析度拉到平台允許的最高階,然後開始抽。這個順序是反的。

AI 影片的工作方式本來就是大量生、大量丟。一支真正能用的片段背後,通常躺著好幾支被刪掉的,而且越是要求角色一致、運鏡精準的案子,這個比例越難看。這代表你每付一次高解析度的錢,有很高的機率是付在一個等下就會被刪掉的檔案上。

而生成平台幾乎都按解析度分級計費,解析度越高單位成本越高,排隊等算圖的時間通常也越長。這兩件事疊在一起,抽卡階段就開最高階是最不划算的選擇。各家的實際級距與計價方式會隨版本調整,開始前自己到後台的用量說明確認一次比較準。

所以合理的順序是:試鏡頭、試運鏡、批量抽變體,這些全部在低解析度做,因為你在這個階段要判斷的是構圖對不對、動作順不順、角色有沒有飄,這些用 480P 就看得出來。等片段定案,再處理解析度。差別只在於,最後那一關要不要繼續付給平台。

整套流程其實只有中間那段花錢

階段 做什麼 成本
試片與抽卡 480P 或 720P 大量生成,確認構圖、運鏡、角色一致性 最低階點數,丟掉也不心疼
定案 選出真正要進剪輯的片段,其他全刪
放大交付 本機顯卡逐格 AI 重建,批次轉成 1920×1080 或 1080×1920 零,只花電腦運算時間

第三段是這篇的主題。它不需要上傳、不需要登入、不需要訂閱,因為模型跟工具鏈都是開源的:Real-ESRGAN 負責重建、FFmpeg 負責影片拆解與合成。卡住一般人的從來不是取得不到,是這些東西都只有命令列,沒有人會為了一次交付去背指令、寫批次腳本。

這就是 Codex 補上的那一塊。

兩個步驟,把工具做出來

步驟一:下載 ChatGPT 桌面版,切到 Codex

2026 年 7 月起,原本獨立的 Codex app 併進了 ChatGPT 桌面版。現在一個桌面程式裡有 Chat、Work、Codex 三種模式,Mac 和 Windows 都有,所有方案都能用。裝好之後從左上角的選單切到 Codex 就對了。

Codex 和網頁版 ChatGPT 最大的差別在於,它能讀寫你電腦上的檔案、開終端機、安裝套件、執行程式。這也是為什麼同一段提示詞在網頁版只會得到一份程式碼,在 Codex 裡會得到一個可以雙擊打開的程式。

步驟二:開一個新資料夾,把提示詞貼進對話框

建議另外開一個乾淨的資料夾當專案目錄,不要直接丟在桌面或下載資料夾,之後找檔案會比較清楚。貼完提示詞按下送出,它會先檢查這台電腦的顯示卡、顯示記憶體與可用空間,再決定實作方式,接著去官方來源取得 Real-ESRGAN 權重與 FFmpeg,然後開始寫程式。過程中它會問你要不要允許下載或執行,同意就好。

這一版比單純縮放那種工具重很多,因為它要跑實測、比對樣本、量實際耗時。實際要跑多久取決於你電腦上缺多少東西,中間還會停下來等你同意,所以不要排在趕件的空檔做。結束時它會告訴你程式放在哪、桌面捷徑叫什麼,以及哪些項目是實測過的、哪些只是估算。

完整提示詞

以下整段複製貼上即可。這一版是寫給 Windows 的,Mac 要改哪幾行寫在文末的常見問題。

請從零製作一個 Windows「通用 AI 影片批次放大工具」。
請直接完成可執行程式、測試、使用說明與桌面捷徑,不要只提供程式碼或建議。先檢查這台電腦的顯示卡、顯示記憶體、可用空間及開發環境,再選擇合適的實作方式。
【用途】
處理我所有類型的 AI 影片,包括人物、商品、風景、室內、動物及動畫,不限定任何題材。
主要目標是:真正進行 AI 細節重建,同時盡量縮短處理時間。
【AI 模型與引擎】
1. 預設模型明確使用 Real-ESRGAN 的 realesr-general-x4v3 通用輕量模型。
2. 優先採用 NCNN/Vulkan 在本機 GPU 執行;FFmpeg/FFprobe 負責影片讀取、合成與驗證。
3. 不使用 VideoProc,不使用 Gen Detail v3,也不要將其他模型改名冒充。
4. 模型從官方來源取得,保留來源、版本、授權與 SHA256。
5. 若官方權重需要轉換格式,必須驗證轉換後模型與原始模型的數值一致性,並檢查實際輸出畫面。
6. AI 模式不可偷偷改成普通縮放,也不可為了加速而先降低來源解析度或跳過影格。
7. AI 失敗時明確顯示錯誤,不自動假裝處理成功。
【處理模式】
提供清楚區分的模式:
– 快速 AI:realesr-general-x4v3,設為預設。
– 一般放大:Lanczos 縮放,可選輕微銳化,明確標示非 AI。
如有加入重型 AI,請列為選配,不要設為預設。
快速 AI 可先進行模型原生 4 倍重建,再縮至目標尺寸。
不要宣稱生成的細節一定等於原始真實資訊。
【輸出設定】
1. 直式預設 1080×1920;橫式預設 1920×1080。
2. 正確處理手機影片旋轉資訊。
3. 保留畫面比例,不拉伸、不裁切;比例不同時補黑邊。
4. 預設保留原始 FPS、每格時間碼與播放速度,支援可變幀率。
5. 可選 24、25、30、50、60 FPS;清楚標示為重複/刪減影格,不是 AI 補幀。
6. 指定 FPS 時,不可因來源已達 1080P 就略過轉換。
7. MP4/H.264,品質以 libx264 CRF 17 為起始設定。
8. 可以實測 GPU 編碼以加速,但必須比較品質,不能直接視為與 CPU 編碼等效。
9. 音訊優先直接複製;不相容 MP4 時再轉 AAC。
10. 無音訊影片也必須正常處理。
【介面】
繁體中文 Windows 桌面程式,雙擊即可開啟。
支援:
– 一次多選影片。
– 拖曳影片加入清單。
– 避免重複加入。
– 移除選取、清空清單。
– 顯示來源解析度、平均 FPS、時長。
– 每支影片的狀態、進度與整批進度。
– 選擇輸出資料夾。
– 取消處理。
– 開啟輸出資料夾。
– 3 秒 AI 預覽:僅處理選取的一支影片。
– 原片與 AI 結果的同尺寸比較。
– 預覽完成後仍可處理完整影片。
【批次與效能】
預設依序處理,避免多支影片爭用顯示記憶體。
根據顯示記憶體實測分塊大小與批次大小,不要硬套其他電腦的參數。
優先減少重複載入模型、大型 PNG 壓縮與磁碟讀寫。
若能穩定實作,可讓模型持續載入並以記憶體傳遞影格。
所有加速都必須保留逐格 AI 處理與時間軸正確性。
不要未實測就承諾處理速度。
【檔案保護】
絕對不要覆寫原始影片。
預設輸出至原片旁的「1080P輸出」資料夾,也可指定集中輸出位置。
AI 成果命名為「原名_AI快速_1080P.mp4」。
預覽檔名標示預覽秒數。
同名檔案自動加 _2、_3 等編號。
先寫入唯一暫存檔,驗證成功後再轉成正式成果。
取消或失敗時,只清理本次工作建立的暫存檔。
保留已完成成果。
單支失敗後繼續下一支,提供錯誤原因與紀錄。
開始前檢查暫存空間。
【測試要求】
請實測並確認:
1. 直式、橫式及旋轉資訊。
2. 中文、空白及特殊字元檔名。
3. 有音訊、無音訊影片。
4. 可變幀率的影格數、時間碼與最後一格停留時間。
5. 指定 FPS 的實際輸出。
6. 同名檔案保護。
7. 處理途中取消及暫存清理。
8. AI 輸出不是黑畫面、破圖或明顯拼塊。
9. 輸出可完整解碼,影音同步。
10. 同一段真實素材的完整處理耗時,包含擷取、AI、存檔及編碼。
不要只憑程式退出碼或解析度正確,就宣稱 AI 處理成功。
用實際樣本比較人物、材質或文字細節,清楚說明可能的柔化、閃爍與生成瑕疵。
【交付】
– 可直接開啟的程式。
– 桌面捷徑。
– 原始碼及重建腳本。
– 模型來源與授權資料。
– 繁體中文使用說明。
– 功能/修改清單。
– 實測結果與比較樣本。
– 搬到其他電腦需要哪些檔案與環境。
正常使用應盡量不需要使用者操作命令列。
全部影片在本機處理,不上傳、不串接付費 API。
完成後明確區分:已實作、已測試、估算值及尚未完成項目。

這段提示詞為什麼要寫這麼長

如果你只丟一句「幫我做一個 AI 影片放大工具」,得到的多半是一份可以跑但不能用的東西:一次只能處理一支、輸出直接蓋掉原檔、遇到中文檔名就掛掉、跑到一半失敗整批停住。更麻煩的是另一種情況 — 它嘴上說做了 AI,實際上跑的是普通縮放,而你從解析度數字上完全看不出來。

這些不是模型笨,是你沒說。上面那段提示詞的每一個區塊,都在防一種具體的失敗:

區塊 它在防什麼
開頭那兩句 防它給你一篇教學。明講「直接完成可執行程式、測試、使用說明與桌面捷徑」,是把交付標準定義成「可以雙擊打開」,不是「理論上可行」。順便要求它先看你的硬體再決定做法,而不是套一份通用範本。
AI 模型與引擎 這是全篇最重要的一塊,防的是「假 AI」。把模型名稱、執行引擎、來源與校驗碼全部寫死,再補上「不可偷偷改成普通縮放」「失敗時明確報錯,不假裝成功」。沒有這幾句,你很可能交出一批以為經過重建、其實只是被拉大的檔案。
處理模式 防兩種模式在介面上混在一起。AI 和非 AI 各自標示清楚,你才知道手上這支片到底經歷了什麼。最後那句「不要宣稱生成的細節一定等於原始真實資訊」,是讓工具自己對你誠實。
輸出設定 防畫質與時間軸被模型自己決定。直式橫式分開指定、黑邊不裁切、旋轉資訊要讀,這三條是短影音素材最容易出事的地方;幀率與時間碼那幾句,則是防影片變長、變短或音畫不同步。
介面 防它做成一次一支。批次、拖曳、進度、取消決定這工具是玩具還是能上工。這一版還多要了 3 秒預覽和同尺寸比較 — AI 重建是有風險的動作,先看三秒再決定要不要燒一整批的時間。
批次與效能 防它拿別人電腦的參數硬套在你的顯卡上,也防它為了跑快一點偷偷跳影格。最後那句「不要未實測就承諾處理速度」,是不讓它用漂亮數字唬你。
檔案保護 防你哪天按下去把客戶原檔洗掉。不覆寫、先寫暫存再改名、只清理本次的暫存、單支失敗不中斷整批,這四條是這段提示詞裡最沒得商量的。
測試要求與交付 防「說完成了但沒測過」。把測試案例逐條列出來它才會真的跑,而「不要只憑退出碼或解析度正確就宣稱成功」「明確區分已實作、已測試、估算值與未完成」這兩句,是要它交出一份誠實的驗收報告。

這個寫法可以搬到別的任務上。要 AI 交付一個東西而不是一份說明,順序就是:先定義交付標準,再定義使用情境,再定義不能發生的事,最後定義驗收方式。跟你發包給外包廠商時寫的規格書,是同一件事 — 而且你會發現,規格書裡最值錢的段落,從來都是「不可以發生什麼」。

想把整條 AI 影音工作流一次建起來

從腳本、分鏡、生成到後製交付,雲時代數位提供 AI 商業影音的導入顧問與製作服務,也承接企業內訓。

預約諮詢

模型與品質設定在調什麼

提示詞裡那些名詞不是隨便抄的,每一個都對應一個會被看出來的問題。你不需要記住它們,但知道在調什麼,之後要改比較有把握。

設定 在處理什麼
realesr-general-x4v3 Real-ESRGAN 官方說明把它描述成「通用場景的輕量小模型」。選它不是因為它最強,是因為題材不挑,而且輕到撐得住整批跑。它另外提供降噪強度的選項,用來避免畫面被過度平滑。
NCNN/Vulkan 讓模型跑在本機顯卡上的執行引擎。關鍵在於它走 Vulkan 而不綁 CUDA,官方說明列出的支援範圍涵蓋 Intel、AMD、NVIDIA。這是「不用付費、也不用特地買 N 卡」的技術前提。
原生 4 倍再縮回目標 模型名稱裡的 x4 就是放大倍率,官方也提供調整最終輸出尺寸的參數。提示詞讓它先用原生倍率重建、再縮到 1080,是為了讓模型跑在自己的設計倍率上。
雙模式並列 快速 AI 是真重建,一般放大是 Lanczos 縮放。保留後者是因為有些片段本來就乾淨,不需要冒重建的風險。重點是介面上要分得清楚,不能把縮放的結果當成 AI 成果交出去。
libx264 + CRF 17 壓縮這關的起始設定。CRF 數字越小畫質越好、檔案越大,17 到 18 一般被視為接近視覺無損的區間。重建完再壓一次會二次劣化,所以這裡刻意比常見的預設值保守。
保留原始 FPS 與時間碼 影片拆成影格再合回去,最容易出事的就是時間軸:變長、變短或音畫不同步。要指定 FPS 也可以,但那是重複或刪減影格,不是 AI 補幀,工具必須標示清楚。
音訊優先複製 能不重壓就不重壓,音質零損失。只有格式不相容 MP4 時才轉 AAC。

AI 重建什麼時候幫你,什麼時候幫倒忙

這一段比前面都重要。換成真的 AI 重建之後,這件事不再是沒有代價的 — 它會動到畫面內容,用錯地方會讓你以為省了錢,其實交出去的東西變差了。

先講原理。模型做的不是把像素算大,是根據學過的大量畫面,推論「這個位置應該長什麼樣子」然後畫出來。所以它能補出髮絲、織紋、邊緣的銳利度,這些確實是新的細節。但那是推論出來的合理結果,不是原片本來就有的資訊。提示詞裡那句「不要宣稱生成的細節一定等於原始真實資訊」,講的就是這件事。

最容易出問題的位置也很固定:人臉五官、手指、文字招牌、商品上的 logo。這些地方原片資訊本來就少,模型只能靠推論補,補出來的結果可能很清楚、但跟原本不一樣。

適合交給 AI 重建 先預覽,或乾脆不要
片段已經定案、畫面乾淨,只是生成時選了低解析度 原片就有破圖、手指怪、結構錯,重建只會把錯的東西畫得更清楚
有壓縮雜訊、邊緣偏軟的素材,降噪強度可以調 人臉大特寫、商品 logo、招牌文字,這些位置最容易被補成不一樣的東西
一次要交十幾二十支,需要規格統一的批次輸出 需要每一格都跟原片完全對得上的鏡頭,例如尺寸承諾類廣告
客戶素材有保密要求,不能上傳到第三方平台 想靠放大掩蓋一支本來就該重抽的片段

右邊那欄不代表完全不能用,代表要先跑那個 3 秒預覽。工具裡留那個功能就是為了這件事:花三秒看一眼,比花一整批的時間跑完再發現臉不對划算太多。至於最後一列,如果底子有瑕疵、種子選錯、動作不對,正確的動作是拿同一組參考素材重新生成一次,不是在後面補救。放大處理的是解析度,不是內容本身的問題。

延伸閱讀:如果你的困擾是片段一直重抽、成本一直上去,這篇拆了三個真正的原因;剪輯那一段也能交給 Codex 做,流程在Codex 自動剪片教學;想看完整的生成端工作流,貓咪咖啡廳 AI 廣告的實作拆解有兩段提示詞全公開;平台選擇可以參考Lumina 一站式 AI 影音平台介紹

常見問題

Q這樣算真的 AI 放大嗎?跟平台賣的付費升頻差在哪?

是真的重建,用的是 Real-ESRGAN。能確定的差別是算力跑在哪裡、誰收費:這是開源專案,透過 NCNN/Vulkan 在你自己的顯卡上跑,所以不用付費也不用上傳。各家付費工具用的模型不同,效果差異要看素材實測,我沒有逐一比對過,不會說哪邊一定比較好。

Q授權可以商用嗎?

Real-ESRGAN 主專案採 BSD-3-Clause,NCNN/Vulkan 實作採 MIT,兩個都是寬鬆的開源授權。提示詞裡要求保留模型來源、版本、授權與 SHA256,就是為了讓這份資料留在交付內容裡。實際要用在商業案上,還是自己看一次授權條文,或問你的法務。

Q一定要有獨立顯卡嗎?內顯跑得動嗎?

Vulkan 不綁 CUDA,官方說明列出的支援範圍涵蓋 Intel、AMD、NVIDIA,所以不是「沒有 N 卡就不行」。但顯示記憶體會直接影響分塊大小和速度,配備差距很大,實際跑多快只能自己測。這也是提示詞第一句要它先檢查顯卡與顯示記憶體、再依實測決定參數的原因,不要套別人電腦的數字。

QAI 重建會不會把人臉或商品變形?

有可能,尤其是人臉特寫、手指、文字和 logo 這些原片資訊本來就少的位置。模型補的是「看起來合理」的細節,不是原本的資訊。所以提示詞裡要了 3 秒預覽和原片同尺寸比較:先處理三秒、對著看一眼,覺得臉沒跑掉再跑整批。這一步不要省。

Q我完全不會寫程式,這樣做得起來嗎?

可以。你要做的只有三件事:裝 ChatGPT 桌面版、貼提示詞、過程中同意它下載與執行。程式碼你不用看也不用改。真的跑出錯誤,把錯誤訊息貼回去給它,讓它自己修。

Q影片會被上傳到哪裡嗎?客戶素材有保密協議。

影片本身不會離開你的電腦,模型和 FFmpeg 都在本機跑。提示詞裡那句「全部影片在本機處理,不上傳、不串接付費 API」就是在鎖這件事。需要注意的是製作工具的那段對話本身是走雲端的,所以不要把客戶機密內容寫進提示詞裡。

QMac 可以用嗎?

可以,官方有釋出 macOS 版本的執行檔。要改的是提示詞裡跟 Windows 綁在一起的部分:開頭改成「請從零製作一個 macOS 通用 AI 影片批次放大工具」,介面那條的「Windows 桌面程式」改成 macOS,交付那條的「桌面捷徑」改成 Mac 上對應的開啟方式,其餘規格不用動。我自己是在 Windows 上跑的,Mac 的實際速度與相容性請以你跑出來的結果為準。

結論

這件事真正的價值不在那個放大工具,而在於重新排了一次順序:把花錢的決策往後移到「已經確定要用」之後。生成階段用最便宜的規格大量試,定案之後的重建,交給自己電腦跑。省下來的不只是點數,還有等算圖的時間。

另外一層是,現在「有一個工具」和「會寫程式」已經不是同一件事了。你需要的是把需求講清楚的能力:交付長什麼樣、會被怎麼用、不能發生什麼、怎麼驗收。這四件事你在發包時本來就天天在寫,只是換一個對象。

省點數是技巧,能穩定交出東西才是本事。如果你想把這條線整個練起來,我有兩門課分別對應兩種目標。

AI短影音即戰班:四小時實體工作坊,從腳本到剪輯完成一支可發布的 AI 短影音
實體工作坊
AI短影音即戰班

這篇省下的是點數,省不掉的是把一支片從零做出來的手感。四小時實體工作坊,從品牌溝通、腳本撰寫、畫面生成、影片生成、配樂到剪輯組裝,當天做出一支品牌可以直接發布的 AI 短影音。

看課程內容與報名梯次

AI影音自媒體訓練營:兩天從一份口播腳本做出以你為主角的 AI 自媒體影音
實體工作坊
AI影音自媒體訓練營

如果你要的不是單支片,是長期經營自己的頻道。兩天的訓練營從一份口播腳本開始,帶你做出以你為主角的 AI 自媒體影音。不露臉也能做,會露臉也能省下拍攝。

看課程內容與報名梯次

不確定哪一門適合,可以直接用 LINE 問我


關於作者

紀澄 Abby Chi
紀澄 Abby Chi
AI 商業影音講師 / 社群營運顧問

雲時代數位有限公司執行長,16 年品牌行銷實戰經驗。顧問專業領域涵蓋 AI 營運系統應用、品牌年度行銷策略、AI 商業廣告、Meta 社群營運策略、個人品牌經營。提供一對一諮詢服務,歡迎聯絡。

帶領團隊榮獲 行銷傳播傑出貢獻獎金獎廣告流行語金句獎 4 座

預約諮詢

分享此內容: