9 月我們用 Seedance 2.5 的「影片編輯」做了一輪實測:同一條源片,每次只改一個變數,看模型到底改了什麼、沒改什麼。先把結論放在前面:
- **刪掉一個東西,一次就成;把一個東西換成另一個,連續失敗。**替換時模型會把新東西加進畫面,卻不刪舊的。
- 只要真改了一處,整幅畫面都會被重畫一遍,不只是你說的那一塊。
- 在圖上畫框、畫箭頭沒用,還可能被畫進成片。
- 時間碼時靈時不靈:18 秒的片子裡有效,4 秒的片子裡完全無效。
先說清「影片編輯」是什麼
在影片面板的「任務模式」裡選影片編輯,掛一段 4 到 30 秒的原片,然後直接寫你要改什麼。系統會在發出去的那份請求上自動補上編輯指令,你寫的提示詞一個字不會被改。輸出的時長和畫面比例都跟著原片走。
刪東西:一次成功的寫法
我們連續成功的幾次,都滿足下面五條:
- **一次只做一件事。**別在一條裡又刪、又換、又挪位置。
- 用文字說位置。「畫面右側桌面上的紅蘋果」,而不是在圖上圈出來。
- **說清刪掉之後那塊填什麼。**比如「用原有的牆面、門框、地面自然補全,不留殘影、模糊塊或人形輪廓」。不說的話,模型容易留下一團糊,甚至又補一個人進去。
- **把不許動的東西逐個列出來。**只說要改什麼,模型會順手改別的——我們遇到過人沒換成、畫面裡反而多出幾個人的情況。
- 整段只做一件事時,不寫時間碼。
一個按這五條寫的例子:
移除畫面右側桌面上的紅蘋果。移除後用原有的木紋桌面自然補全,不留殘影或模糊塊。左側的白色瓷杯、杯口的蒸汽、背景和光線都保持不變。
換東西:為什麼難
替換要求模型同時做三件事:刪掉原來的、生成新的、對上你給的參考圖。實測裡它只做到了中間那一件——新人物被加進了畫面,原來的人沒刪,畫面裡的人變多了。
如果一定要替換,寫法上至少要:
- 明確寫成兩步:「移除原有的 X,在原位置換成 Y」;
- 說清新物件站在哪、多大、朝哪邊。
但要說實話:替換我們目前還沒有穩定成功的樣本,別指望一次就成。
改了一處,整片都會被重畫
我們用「畫面和原片有多像」來量化(PSNR,數值越高越接近原片,40 dB 以上肉眼基本分不出區別):
| 做了什麼 | 和原片的相似度 |
|---|---|
| 什麼都不改(只寫「保持原片內容不變」) | 42.6 dB |
| 移除一個物體(三種完全不同的寫法) | 23.7~23.8 dB |
| 只讓改左邊 1/4,其餘明確要求不變 | 改的區域 24.1 dB,要求不變的區域 23.7 dB |
怎麼讀:模型能做到幾乎不動原片;可一旦真動了一處,整幅畫面都會被重畫,包括你明確要求不變的區域。這和措辭無關,三種寫法的結果相差不到 0.2 dB。
這帶來三個實際影響:
- **編輯的次數越多,人臉、服裝和質感漂得越厲害。**每一次都是整幅重畫。
- 但一條請求裡寫兩處改動,模型通常只執行第一處,我們測的三次都是這樣。多處改動只能分幾次跑,先改最要緊的那處。
- 只想改長片裡的一小段時:編輯按原片全長計價,全長也都會被重畫。把那一段單獨剪成一條(不短於 4 秒)再編輯,按道理既省錢、又不會動到其餘畫面。不過剪完再拼回去時銜接是否自然,我們還沒在長片上實測過。
框和箭頭:翻譯成文字
在參考圖上畫紅框圈人、畫黃箭頭指方向,模型讀不懂。官方的參考指南也提醒過:不要依賴印在圖片裡的標籤,使用網格圖時要明確要求模型不要畫出邊框、箭頭和線條——說明模型會把這些當成畫面內容畫出來。
正確做法是把框和箭頭翻譯成文字:「畫面深處走廊裡、身形比前景小、站在煙霧後方的那個人」。
時間碼:時靈時不靈
我們測了兩次,結果正好相反:
- 18 秒的片子,寫「00:00-00:05 保持不變 / 00:05-00:08 替換……」:改動確實落在 5 到 8 秒,前 5 秒幾乎沒動。
- 4 秒的片子(固定機位,左邊一隻瓷杯、右邊一個蘋果),同一句「移除蘋果」,只改時間碼的寫法:只寫後半段、前後兩段都寫、完全不寫。三種結果一模一樣——蘋果從第 0 秒就沒了,「00:00-00:02 保持原片內容不變」被完全無視。作為對照,前後兩段都寫「保持不變」時,蘋果還在,說明這個判斷方法本身是可靠的。
這兩次之間差了四個條件:片長、刪還是換、分幾段、改的是走動的人還是靜物,所以我們還分不開到底是哪一個造成的差別。最可疑的是片長——4 秒正好是編輯能接受的最短原片。
如果要用時間碼,按官方推薦寫成連續區間(0-5s: …、5-8s: …),從頭覆蓋到尾,中間不留空隙。
這輪實測的邊界
這輪實測沒法固定隨機種子,同樣的輸入每次跑出來都會有差別,所以我們每一組只拿「東西還在不在」這種是非題下結論,不比較小數點後的差別。上面的相似度數字只用來看量級。
