Appearance
我把上一篇刪掉的那一步,加了回來
一張空桌子、九個不一樣的房間,和一個 20 秒就能抓到的錯
作者:Ray 日期:2026 年 8 月 20 日
上一篇我寫的是怎麼刪掉關鍵幀——43 張圖、18 次重做、4 到 5 個小時,那一段不是變快了,是不存在了。
這一篇我要說:我把一個東西加了回來。
不是關鍵幀。是別的。而且我花了兩天才看懂它們的差別。
先看那張空桌子
我要做的是主題曲 MV 的一段,35 秒,三顆鏡頭。
我寫了三份 prompt,跑出來,看起來都對——角色沒崩、手沒有六根指頭、切鏡準時。技術上沒有任何問題。
然後我把它拿給人看,得到四個字:
「太乾了。」
三顆鏡頭全在同一張桌子前。同一個早上、同一個角度、只有一個女生和一隻貓。35 秒沒有任何變化。
我回去翻自己寫的 prompt,找到這句:
The desk is otherwise bare. 桌上除此之外是空的。
那不是模型生成的。那是我打的字。
我在解錯的問題
我為什麼會寫「桌上是空的」?
因為我腦子裡跑的是這種清單:
- 一支 clip 只給一個運鏡,多了會糊
- 切點不要超過一個,多了身份會漂
- 場景固定,減少變因
- 畫面裡東西越少,越不容易生出怪東西
每一條單獨看都對。它們都來自實測,都有道理。
但它們是「怎麼讓生成不出錯」的規則,不是「怎麼讓畫面好看」的規則。
我把分鏡當成一個工程問題在解。而工程問題的最佳解,是把所有會出錯的東西都拿掉——最後剩下一張空桌子和兩個角色。
穩定,而且沒有人想看。
兩種圖,長得一樣
重寫分鏡的時候我想通一件事。
上一篇刪掉的關鍵幀,和我現在要加回來的東西,產出物長得一模一樣:都是一張圖。
但它們在流程裡的位置完全不同。
關鍵幀是餵給模型的。 它是 I2VA 的第一格,模型從那一格往下演。沒有它,模型不知道畫面該長什麼樣。Ref2VA 讓這件事變得不必要——你給角色照片就好,構圖交給文字。
分鏡草圖是餵給你自己的眼睛的。 它不進模型,它進你的判斷。它回答的是「我寫的這段文字,變成畫面之後長什麼樣」。
我刪掉關鍵幀的時候,沒注意到自己順手也刪掉了第二種。
因為它們長一樣,我以為刪掉一個就是刪掉一個。
20 秒 vs 8 分鐘
加回來的方法很土:寫完 prompt,先用圖像模型生一張靜態的,看過再送去算影片。
九張草圖,一張約 20 秒。
跑完抓到三個錯。
第一個:公仔變成落地燈。
那是個桌上型的裝置,實體大約 16 公分。但在全景鏡頭裡,模型沒有尺度參照,就把它畫成地板上一顆 60 公分的發光物體。
我原本的 prompt 只寫 small ornament。模型對「small」沒有共識。
修法要三招疊:跟已知物體比(大約她的手掌長)、給絕對尺寸(16 公分)、明確排除(不是落地燈)。
第二個:夜景把貓的顏色洗掉了。
我在分鏡裡寫「房間唯一的光源是貓肚子的暖光」。聽起來很美。
結果整隻貓被自己的光染成橘色——奶油白的身體、左橘右灰的耳朵、眼睛的金環,全部消失,變成一團橘色。
沒有補光就沒有對照,物體只會呈現光源的顏色。這是攝影的基本常識,我卻在分鏡裡把它寫成規則。
加一道冷色月光就好了。但關鍵是那句話要寫成「因為有月光,所以貓的顏色讀得出來」——只寫「有月光」,模型會把它當背景,不會拿它來照東西。
第三個:兩張床。
一張圖裡出現了兩張床。她靠著一張,旁邊還有一張。
這個錯最有意思,因為它指向一個更深的問題。
場景也是資產
九張草圖,我是一張一張生的。
角色我有參考圖——女主角的照片、公仔的算圖,每張都餵進去。所以九張圖裡的人和貓都長一樣。
房間我沒有參考圖。
所以模型每一張都在重新編一個房間。九張圖,九個不一樣的房間。其中一張湊出了兩張床。
角色有資產,場景沒有。這個不對稱是根因,而我一直沒看見——因為我從來沒把「房間」當成一個需要被定義的東西。
補法很直接:生一張房間的定裝照。台灣的租屋處,單人床靠左、書桌在右邊窗下、木地板、窗外對面樓的電線和一塊「五金行」的招牌。乾淨的白天光線,看得清楚格局。
然後把它當第三個角色餵進每一支 clip。
接下來的事情有點神奇。 那張參考圖是白天拍的,但我要的是夜戲——她坐在地板上,房間只有一盞暖光。
文字寫夜,圖給白天。
跑出來是同一個房間的夜晚。床在左、桌在右、椅背同一件外套、地上同一本翻開的書、床邊同一個帆布袋,窗外連那塊「五金行」都在。只是天黑了。
參考圖鎖住幾何,文字控制光線。 一張日景撐起了整段的四個場景。
我在同一個坑裡跌了四次
回頭看兩天的紀錄,有一類錯我犯了四次:
| 我寫的 | 參考圖裡實際上 | 結果 |
|---|---|---|
| 眼睛是暗的、關著的 | 黑底 + 金環 + 高光 | 金環一起被抹黑,變成空眼窩 |
| 眼睛是亮的、淡的 | 黑底 + 金環 + 高光 | 方向相反的同一個錯 |
| 肚子沒有亮 | 肚子在發光 | 兩邊打架 |
| 沒有關節、不會動 | 一隻舉起的手 | 手照樣揮,而且畫面整體變差 |
共同點:我用形容詞去描述一個參考圖裡不存在的狀態。
文字在跟圖片搶,而圖片通常會贏。
最後一列還多犯一個錯——「沒有會動的部件」這句話裡有「會動」。模型沒有負向通道可以扣掉它,讀到的只有「moving parts」。
正解只有兩條:指向參考圖(as in Picture 1),或者去生一張那個狀態的圖。
後者是這個專案的合作者提的。她說:那就多做一張睡眼的參考圖吧。
一張圖解決了我三次改文字沒解決的事。
同一句話,兩個工具,相反的效果
還有一個發現值得單獨記。
修公仔尺寸的時候,我在圖像模型的 prompt 裡加了一句:
It must never look like a floor lamp.
有效。 尺寸立刻對了。
但這句話我不能搬到影片模型上。H3 在 ComfyUI 裡跑的是單一條件通道,沒有負向輸入。寫「不要像落地燈」等於把「落地燈」塞進條件裡。
同一句話,在生圖工具有效,在生影片工具會反效果。
工具的規則不能互相搬。 這聽起來很基本,但我在三個地方犯過——尺度錨點、冷色補光、場景參考,每一次都是在圖像那邊修好了,忘記同步到影片那邊。
帳單
六支 clip,主機開了 40 分鐘。
$2.09 一小時,總共 NT$45。成品 35.458 秒,每秒約 1.3 塊。
九張草圖的成本是幾角美金,時間三分鐘。
那三分鐘抓到的三個錯,每一個在影片階段都要 8 分鐘才會浮出來,而且抓到之後還要再花 8 分鐘重跑。
所以我到底加回了什麼
不是關鍵幀。關鍵幀還是不用畫——Ref2VA 那條路是通的,上一篇沒有寫錯。
我加回來的是**「先看一眼」**。
它剛好也是一張圖,所以我把它跟關鍵幀當成同一件事,一起刪掉了。
但關鍵幀是模型的輸入,草圖是你的輸入。刪掉前者省下四五個小時;刪掉後者,你會在八分鐘之後才發現桌上什麼都沒有。
上一篇的結論我到現在還同意:真正貴的從來不是 GPU。
只是這次貴的不是那四五個小時,是我對著一支跑好的片子才發現方向錯了。
想自己試一個下午:RunPod。
本文的實測環境為 RunPod 租用之 RTX PRO 6000 Blackwell($2.09/hr),影片模型為 MiniMax H3 開源權重於 ComfyUI 本地部署,分鏡草圖使用 Gemini 圖像模型。
本文的 RunPod 連結為推薦連結,透過它註冊我會獲得少量回饋,不影響你的價格。