9 月我们用 Seedance 2.5 的「视频编辑」做了一轮实测:同一条源片,每次只改一个变量,看模型到底改了什么、没改什么。先把结论放在前面:
- **删掉一个东西,一次就成;把一个东西换成另一个,连续失败。**替换时模型会把新东西加进画面,却不删旧的。
- 只要真改了一处,整幅画面都会被重画一遍,不只是你说的那一块。
- 在图上画框、画箭头没用,还可能被画进成片。
- 时间码时灵时不灵:18 秒的片子里有效,4 秒的片子里完全无效。
先说清「视频编辑」是什么
在视频面板的「任务模式」里选视频编辑,挂一段 4 到 30 秒的原片,然后直接写你要改什么。系统会在发出去的那份请求上自动补上编辑指令,你写的提示词一个字不会被改。输出的时长和画面比例都跟着原片走。
删东西:一次成功的写法
我们连续成功的几次,都满足下面五条:
- **一次只做一件事。**别在一条里又删、又换、又挪位置。
- 用文字说位置。「画面右侧桌面上的红苹果」,而不是在图上圈出来。
- **说清删掉之后那块填什么。**比如「用原有的墙面、门框、地面自然补全,不留残影、模糊块或人形轮廓」。不说的话,模型容易留下一团糊,甚至又补一个人进去。
- **把不许动的东西逐个列出来。**只说要改什么,模型会顺手改别的——我们遇到过人没换成、画面里反而多出几个人的情况。
- 整段只做一件事时,不写时间码。
一个按这五条写的例子:
移除画面右侧桌面上的红苹果。移除后用原有的木纹桌面自然补全,不留残影或模糊块。左侧的白色瓷杯、杯口的蒸汽、背景和光线都保持不变。
换东西:为什么难
替换要求模型同时做三件事:删掉原来的、生成新的、对上你给的参考图。实测里它只做到了中间那一件——新人物被加进了画面,原来的人没删,画面里的人变多了。
如果一定要替换,写法上至少要:
- 明确写成两步:「移除原有的 X,在原位置换成 Y」;
- 说清新对象站在哪、多大、朝哪边。
但要说实话:替换我们目前还没有稳定成功的样本,别指望一次就成。
改了一处,整片都会被重画
我们用「画面和原片有多像」来量化(PSNR,数值越高越接近原片,40 dB 以上肉眼基本分不出区别):
| 做了什么 | 和原片的相似度 |
|---|---|
| 什么都不改(只写「保持原片内容不变」) | 42.6 dB |
| 移除一个物体(三种完全不同的写法) | 23.7~23.8 dB |
| 只让改左边 1/4,其余明确要求不变 | 改的区域 24.1 dB,要求不变的区域 23.7 dB |
怎么读:模型能做到几乎不动原片;可一旦真动了一处,整幅画面都会被重画,包括你明确要求不变的区域。这和措辞无关,三种写法的结果相差不到 0.2 dB。
这带来三个实际影响:
- **编辑的次数越多,人脸、服装和质感漂得越厉害。**每一次都是整幅重画。
- 但一条请求里写两处改动,模型通常只执行第一处,我们测的三次都是这样。多处改动只能分几次跑,先改最要紧的那处。
- 只想改长片里的一小段时:编辑按原片全长计价,全长也都会被重画。把那一段单独剪成一条(不短于 4 秒)再编辑,按道理既省钱、又不会动到其余画面。不过剪完再拼回去时衔接是否自然,我们还没在长片上实测过。
框和箭头:翻译成文字
在参考图上画红框圈人、画黄箭头指方向,模型读不懂。官方的参考指南也提醒过:不要依赖印在图片里的标签,使用网格图时要明确要求模型不要画出边框、箭头和线条——说明模型会把这些当成画面内容画出来。
正确做法是把框和箭头翻译成文字:「画面深处走廊里、身形比前景小、站在烟雾后方的那个人」。
时间码:时灵时不灵
我们测了两次,结果正好相反:
- 18 秒的片子,写「00:00-00:05 保持不变 / 00:05-00:08 替换……」:改动确实落在 5 到 8 秒,前 5 秒几乎没动。
- 4 秒的片子(固定机位,左边一只瓷杯、右边一个苹果),同一句「移除苹果」,只改时间码的写法:只写后半段、前后两段都写、完全不写。三种结果一模一样——苹果从第 0 秒就没了,「00:00-00:02 保持原片内容不变」被完全无视。作为对照,前后两段都写「保持不变」时,苹果还在,说明这个判断方法本身是可靠的。
这两次之间差了四个条件:片长、删还是换、分几段、改的是走动的人还是静物,所以我们还分不开到底是哪一个造成的差别。最可疑的是片长——4 秒正好是编辑能接受的最短原片。
如果要用时间码,按官方推荐写成连续区间(0-5s: …、5-8s: …),从头覆盖到尾,中间不留空隙。
这轮实测的边界
这轮实测没法固定随机种子,同样的输入每次跑出来都会有差别,所以我们每一组只拿「东西还在不在」这种是非题下结论,不比较小数点后的差别。上面的相似度数字只用来看量级。
