9月、Seedance 2.5 の動画編集について検証を行いました。同じ元動画を使い、毎回1つの条件だけを変えて、モデルが何を変え、何を残したかを確認しています。先に結論です。
- **何かを消すのは1回で成功。別のものに置き換えるのは失敗が続きました。**置き換えを頼むと、モデルは新しいものを画面に足すだけで、元のものを消しません。
- **1か所でも実際に変更すると、画面全体が描き直されます。**指示した部分だけではありません。
- 参照画像に枠や矢印を描いても効果はなく、そのまま映像に描き込まれることもあります。
- タイムコードは効いたり効かなかったり:18秒のクリップでは効き、4秒のクリップではまったく効きませんでした。
「動画編集」とは
動画パネルのタスクモードで動画編集を選び、4〜30秒の元動画を付けて、変えたい内容をそのまま書きます。上流に送るリクエストには編集の指示を自動で付け足しますが、あなたが書いたプロンプトは一文字も変えません。出力の長さとアスペクト比は元動画に合わせられます。
消す:1回で成功した書き方
続けて成功したときは、どれも次の5つを満たしていました。
- **1回に1つのことだけ。**1つのプロンプトで、消す・置き換える・動かすを同時にやらせない。
- **位置は言葉で説明する。**画像に丸を描くのではなく、「画面右側のテーブルの上にある赤いリンゴ」と書く。
- **消したあとに何で埋めるかを書く。**例:「元の壁、ドア枠、床で自然に補い、残像やぼやけ、人の輪郭を残さない」。書かないと、モデルはぼやけた塊を残したり、別の人を描き足したりしがちです。
- **変えてはいけないものを一つずつ挙げる。**変える内容だけを書くと、モデルは他のところまで変えてしまいます。人は置き換わらず、逆に人数が増えたこともありました。
- クリップ全体に同じ変更をするなら、タイムコードは書かない。
この5つに沿って書いた例:
画面右側のテーブルの上にある赤いリンゴを消してください。消したあとは元の木目のテーブル面で自然に補い、残像やぼやけを残さないでください。左側の白い磁器のカップ、カップから立つ湯気、背景と照明はそのままにしてください。
置き換える:なぜ難しいのか
置き換えでは、元のものを消す、新しいものを生成する、参照画像に合わせる、という3つを同時にこなす必要があります。検証では、モデルができたのは真ん中の1つだけでした。新しい人物は画面に追加され、元の人物は残ったままで、単に人が増えた映像になりました。
どうしても置き換えたい場合は、少なくとも次のように書いてください。
- 2つの手順として明記する:「元の X を消し、同じ位置に Y を置く」
- 新しい対象がどこに立ち、どのくらいの大きさで、どちらを向いているかを書く。
正直に言うと、置き換えが安定して成功した例はまだありません。1回で成功するとは期待しないでください。
1か所変えると、全体が描き直される
結果が元動画にどれだけ近いかを数値で測りました(PSNR:高いほど元に近く、40 dB 以上なら差はほぼ見分けられません)。
| 指示した内容 | 元動画との類似度 |
|---|---|
| 何も変えない(「元の内容をそのまま保つ」とだけ書く) | 42.6 dB |
| 物を1つ消す(まったく異なる3通りの書き方) | 23.7〜23.8 dB |
| 左1/4だけ変更し、残りは変えないよう明示 | 変更部分 24.1 dB、保護した部分 23.7 dB |
読み方:モデルは元動画をほぼそのまま残すことができます。ただ、1か所でも実際に変えると、変えないよう明示した部分も含めて画面全体を描き直します。書き方には左右されず、3通りの書き方の差は 0.2 dB 未満でした。
実際の影響は3つあります。
- **編集を重ねるほど、顔や衣装、質感がずれていきます。**編集のたびに画面全体が描き直されるためです。
- **ただし、1回のリクエストに2か所の変更を書くと、モデルはたいてい最初の1つしか実行しません。**試した3回はすべてそうでした。複数の変更は何回かに分けて実行し、一番大事なものから先に行ってください。
- 長いクリップの一部だけを変えたいとき:編集は元動画の全長で課金され、全長が描き直されます。その部分だけを別のクリップ(4秒以上)として切り出してから編集すれば、理屈の上では安く済み、ほかの部分にも手が入りません。ただ、切り出した部分を戻したときのつなぎ目が自然かどうかは、長いクリップではまだ検証していません。
枠と矢印:言葉に置き換える
参照画像に赤い枠で人物を囲んだり、黄色い矢印で方向を示したりしても、モデルには伝わりません。公式の参照ガイドにも、画像内に書かれたラベルに頼らないこと、グリッド画像を使う場合は枠線・矢印・線を描かないよう明示することが書かれています。つまり、モデルはそれらを映像の中身として扱うということです。
枠の代わりに言葉で書いてください。「画面の奥の廊下にいる、手前の人物より小さく見える、煙の向こうに立っている人」のように。
タイムコード:効くときと効かないとき
2回試して、正反対の結果になりました。
- 18秒のクリップで「00:00-00:05 変えない / 00:05-00:08 置き換え……」と書いた場合:変更は確かに5〜8秒の間に収まり、最初の5秒はほとんど動きませんでした。
- 4秒のクリップ(固定カメラ、左に磁器のカップ、右にリンゴ)で、同じ「リンゴを消す」指示のまま、タイムコードの書き方だけを変えました。後半だけ書く、前後両方書く、まったく書かない、の3通りです。結果は3つとも同じで、リンゴは0秒目から消え、「00:00-00:02 元の内容をそのまま保つ」は完全に無視されました。対照として、前後両方に「変えない」と書いたときはリンゴが残っていたので、判定方法そのものは信頼できます。
2回の検証では、クリップの長さ、消すか置き換えるか、区間の数、変える対象が動く人か静物か、の4つの条件が違っています。そのため、どれが差を生んだのかはまだ切り分けられていません。一番怪しいのは長さです。4秒は、編集で受け付けられる元動画のちょうど最短の長さだからです。
タイムコードを使うなら、公式が推奨する連続した区間で書いてください(0-5s: …、5-8s: …)。最初から最後まで隙間なくカバーします。
今回の検証の限界
今回はランダムシードを固定できなかったため、同じ入力でも実行するたびに結果が少しずつ変わります。そのため各結論は、「対象がまだ残っているか」のような○×で判定できる基準だけに基づいており、細かな数値の差は比べていません。上の類似度の数値は、桁の目安としてだけ見てください。
