ツール解説 · 小互解読

ByteDance公式「Seedance 2.5」プロンプトガイド:1文の基本構文から30秒動画まで、全テンプレートを収録

50件の参照素材にどう役割を割り当てるか、30秒動画をどう分割するか、映像の一部だけをどう直すか。タスク別の推奨記法が、コピー可能なテンプレートとして公式にまとめられました。

1分で要点
  • ByteDanceがSeedance 2.5のプロンプト記法を公式解説。一文生成、素材の割り当て、長尺動画の分割、編集、延長まで、タスクごとに公式テンプレートがあります。全例をこのページに収録しているので、そのまま使えます。
  • ガイド全体が教えているのは、実は一つだけです。モデルに推測させないこと。全編を貫く3つの構文を覚えれば、半分は理解したも同然です。
  • 最後には、モデルでは難しいことも率直に明記されています。公式が、直接生成を推奨しない項目もあります。
⚑ 出典はByteDance公式の「Seedance 2.5 プロンプトガイド」(中英2言語のLark文書)です。テンプレートと例は原文どおりに収録し、一部のチェック項目のみ簡潔に要約しました。公式は末尾で、例は記法を示すためのものであり、実際の結果は入力素材、タスクの複雑さ、生成パラメータに左右されると明記しています。
背景

まず知っておきたいSeedance 2.5の概要

ByteDanceは、Seedance 2.5の公開からわずか2日後に、公式プロンプトガイドを公開しました。一文での生成から、50件の参照素材の割り当て、30秒動画の分割、既存映像の一部だけを変える方法まで、タスクごとにそのまま使えるテンプレートを用意しています。即夢AIやAPIで動画を制作する人にとって、これは初の体系的な公式記法マニュアルです。これまでは、新機能の使い方をコミュニティー投稿から探るしかありませんでした。

初めて触れる人のために、まず概要を押さえましょう。Seedance 2.5はByteDanceのSeedチームが7月31日に公開した動画制作モデルです。1本の動画を、前世代の15秒から倍の30秒まで直接生成できます。1回に組み合わせられる参照素材も15件から50件へ増え、既存動画の編集と延長にも新たに対応しました。公開当日から即夢AIとDoubao Proで利用できます。機能が増えたことで、プロンプトの書き方も変わりました。素材には番号を付けて役割を割り当て、長尺動画は区間ごとに記述する必要があります。このガイドは、まさにその課題を解決するものです。

2.0と比べ、公式が挙げる主な進化は4つです。

01物語表現の拡張:30秒動画の直接生成、高忠実度の時間的延長
  • 1区間の上限を30秒へ拡大。カットのつながりが自然になり、後編集でつなぎ合わせなくても、感情の起伏や物語の進行を一つの動画として描けます。
  • 高忠実度の時間的延長にも対応します。人物、シーン、カメラの一貫性を維持したまま、短い素材をより長い動画へ自然に延ばせるため、制作効率と完成品質が向上します。テレビCM、ショートドラマ、ブランドストーリーなど、物語の完成度が重視される用途に特に適しています。
02オムニモーダル参照の拡張:50件のオムニモーダル参照素材に対応
  • 1回に入力できる上限を、50件のオムニモーダル素材(画像/動画/音声を自由に組み合わせ可能)へ引き上げました。登場人物一式、シーン一式、参照カット、ブランド音楽を一度に入力し、モデルが総合的に理解したうえで、意図に沿った動画を出力できます。
  • 複雑な素材を安定して維持する能力も向上しました。プロ向けの3Dホワイトモデル、商品パッケージ、ブランドVIなど、複雑なアセットも元の形を保って反映できます。事前に設計した内容やカメラワークを、そのまま再利用できます。
03高精度な動画編集:プロ品質の調整で制作を効率化
  • 動画の部分編集機能を追加しました。映像全体、カメラ、テンポを変えずに、背景、商品、人物などの一部だけを正確に変更できます。「1回制作し、複数版を納品する」運用が可能です。
  • 生成結果を修正、反復、納品できるようになり、後工程の手戻りを減らせます。代表例は、海外広告で人種、商品、コピーをすばやく差し替えるローカライズ、EC素材のSKU別一括展開、ブランドコンテンツのチャネル別バージョン制作です。
0410以上の言語をネイティブ対応、指示制御も強化
  • 10以上の言語にネイティブ対応します。世界中のクリエイターが、翻訳や追加の言語変換を介さず、母語で制作意図を記述できます。
  • 指示の理解力と制御力も向上しました。複雑なカメラワーク、感情の転換、多層的なシーン記述にも、より正確に従います。世界市場向けの制作と商用利用を支えます。
Seedance 2.5公式プロモーション動画(2分37秒)。少年の窓辺に浮かぶ光る紙飛行機から、即夢AIで一つのプロンプトを入力し、街全体をブロックの世界へ変える場面までを収録しています。全編がSeedance 2.5で生成されたことも画面内に明記されています。素材提供:ByteDance。

公開内容の詳しい解説、デモ動画、利用方法はこちらの記事にまとめています。

関連記事
ByteDanceがSeedance 2.5を公開:30秒を一括生成、1つの指示で50件の参照素材を制御
公開当日の詳細解説。機能、デモ動画、提供チャネル、価格情報をまとめています。

ガイド全体を読むと、すべてのテクニックが一つの原則に集約されていると分かります。モデルが推測する余地を、すべて明記して塞ぐことです。「〜だけを採用し、〜は採用しない」「終了時に画面で確認できるのは〜」「Xは@画像Nに対応する」という3つの頻出構文が、全編を貫いています。以降の各節でも繰り返し登場します。

基本

プロンプトを構成する6要素、必要なものだけ使う

基本式では、主体+動作または出来事が必須です。「誰または何が」「何をしているか」を示します。シーン環境、ビジュアルスタイル、カメラワークとカット、音声の4要素は任意です。不要なら省きます。動作はまず主要な流れを簡潔にまとめ、重要な部分だけ詳しく書きます。同じ動作を繰り返し記述しないでください。生成パラメータ(長さ、アスペクト比)はプロンプトに書かず、生成画面またはAPIで設定します。

主体+動作 + シーン環境 + ビジュアル + カメラ・カット + 音声
プロンプトを構成する6要素。塗りつぶしは必須、点線枠は任意です。不要なら省きます
基本テンプレート
<Subject> performs <primary action or event> in <scene and environment>.
The visuals feature <visual style>.
Use <shot size, camera angle, camera movement, or cuts>.
Audio includes <dialogue, ambience, sound effects, or music>.
<被写体>が<シーン・環境>の中で<主要なアクションや出来事>を行う。 映像は<ビジュアルスタイル>。 カメラは<ショットサイズ、アングル、カメラワーク、カット>を使う。 音声には<セリフ、環境音、効果音、音楽>を含む。
公式例 · 陶芸家
A ceramic artist finishes a pale blue cup in a studio at dawn, lifts it from the wheel, and places it in the center of a wooden shelf.
Soft morning light enters through the window. The wet clay has a delicate sheen, and the workbench remains tidy.
Begin with a medium shot of the wheel-throwing process, slowly push in toward the cup's surface texture, then cut to a frontal view of the shelf.
Retain the low hum of the pottery wheel, the friction of clay, and subtle indoor ambience.
陶芸家が夜明けのアトリエで淡い青の陶器カップを仕上げ、ろくろから持ち上げて木棚の中央に置く。 窓から柔らかな朝の光が差し込み、湿った粘土は繊細な光沢を帯び、作業台は整っている。 まずミディアムショットでろくろ成形を映し、カップ表面の質感へゆっくりプッシュインし、最後に棚の正面カットへ切り替える。 ろくろの低い回転音、粘土の摩擦音、室内のかすかな環境音を残す。

音声と文字を指定する4つの記号

プロンプトは基本的に自然言語で書けます。音楽、効果音、セリフ、字幕をさらに区別したい場合は、次の記号を使います。

内容記号
音楽()(穏やかなテンポのピアノ曲が流れる)
効果音<><遠くから鐘の音が聞こえる>
セリフ{}{こんにちは、おかえりなさい}
字幕【】【第1章:旅立ち】

字幕や音声を制御するときは、残すものと不要なものを明記します。

音声と字幕の直接指定
No background music. Keep only the characters' dialogue, ambience, and action sound effects.
No subtitles.
No audio at all.
BGMなし。人物のセリフ、環境音、動作の効果音だけを残す。 字幕は入れない。 音声は一切入れない。

セリフの言語を安定させる書き方

中国語以外のセリフを使う場合は、セリフの前に言語を明記します。

公式例 · セリフ言語の指定
The girl says softly in Japanese: {もう大丈夫です}
少女が日本語でそっと言う:{もう大丈夫です}

英語の文章なのにモデルが中国語で話す場合や、地域アクセントを指定したい場合は、次の式で補強します。

セリフ言語の強化式
Dialogue Language + Regional Variety or Accent + Delivery Style + Speaker + {Dialogue}

Dialogue language: American English. The girl says in natural, conversational American English: {I thought you weren't coming.}

Dialogue language: authentic Los Angeles English. The young man says in natural Los Angeles vernacular: {No way, you actually made it.}
セリフの言語 + 地域バリエーションや訛り + 話し方 + 話者 + {セリフ} セリフの言語:アメリカ英語。少女が自然な口語のアメリカ英語で言う:{I thought you weren't coming.} セリフの言語:ロサンゼルスらしいアメリカ英語。若い男性が自然なロサンゼルスの話し言葉で言う:{No way, you actually made it.}
素材

50件入力できても、安定域はずっと小さい

1回に最大50件の参照素材を組み合わせられます。4種類の素材にはそれぞれ入力上限がありますが、公式はそれより小さい「推奨範囲」も示しています。上限は機能上の限界であり、推奨範囲こそ安定域です。素材が増えるほど、安定性は下がりやすくなります。

素材タイプ入力範囲推奨範囲(安定域)
画像最大30枚、1枚4K以下主体画像は1〜8主体を推奨
動画最大10本、合計30秒以下1〜5主体、1本5〜10秒
音声最大10本、合計30秒以下タスクに直接関係するセリフ、声質、環境音、音楽のみ
動画編集動画と参照画像を併用元動画20秒以内、参照画像1〜5枚

推奨範囲を超えて試すこともできます。主体画像は9〜12主体、主体の音声・動画は6〜10主体、編集用の参照画像は6〜8枚まで拡張できます。安定性を高めるもう一つのポイントは、同じ主体を複数の角度から示す場合、複数の角度を1枚のコラージュにせず、1枚に1視点を載せることです。宣言は次のように書きます。

同一主体の複数視点を宣言する書き方
@Image 1 defines the front view of the same folding desk lamp.
@Image 2 defines the left-side structure of the same folding desk lamp.
@Image 3 defines the right-side structure of the same folding desk lamp.
@Image 4 defines the rear structure of the same folding desk lamp.
All four images define one folding desk lamp. The output must contain only one lamp throughout.
@画像1は同じ折りたたみデスクランプの正面外観を定義する。 @画像2は同じ折りたたみデスクランプの左側の構造を定義する。 @画像3は同じ折りたたみデスクランプの右側の構造を定義する。 @画像4は同じ折りたたみデスクランプの背面の構造を定義する。 4枚の画像は同一のデスクランプを定義しており、完成映像には常に1台だけ登場する。
素材

素材ごとに明記する:何を採用し、何を採用しないか

素材をアップロードしたら、各素材が何を提供するかを一つずつ宣言します。鉄則は3つです。対応関係を必ずプロンプト本文に書く。画像内に貼った文字ラベルだけに頼らない。どの素材がどの人物、小道具、シーンに対応するかをモデルに推測させない。「採用しない」はすべての素材に書く必要はありません。素材内の人物、背景、構図が誤って動画へ入り込みそうな場合だけ明記します。

@画像1 陶芸家 顔・髪型・前掛けだけ採用 ✕ 画像背景は採用しない @画像2 陶芸工房 作業台・窓・朝光だけ採用 ✕ 画像の人物は採用しない @動画1 動作テンポ 成形・持上げ・配置のテンポだけ採用 ✕ 人物・衣装・シーンは採用しない
素材の割り当て:素材ごとに対応線を引き、「何だけを採用するか」を明記します。混入しやすい要素は「採用しない」と書きます
素材の役割テンプレート
@Image 1 defines <subject>'s <appearance, clothing, structure, or material>.
@Video 1 defines <motion, camera movement, or pacing>.
@Audio 1 defines <character or sound type>'s <voice, dialogue, ambience, or music>.

<Subject> completes <primary action or event> in <scene>.
The visuals feature <visual style>, with <camera treatment>.
@画像1は<被写体>の<外見、服装、構造、素材>を定義する。 @動画1は<動き、カメラワーク、テンポ>を定義する。 @音声1は<キャラクターや音の種類>の<声、セリフ、環境音、音楽>を定義する。 <被写体>が<シーン>で<主要なアクションや出来事>を完了する。 映像は<ビジュアルスタイル>、カメラは<カメラ表現>。
公式例を見る(陶芸家・素材版)
@Image 1 defines the ceramic artist's facial features, hairstyle, and dark green apron. Do not use the image background.
@Image 2 defines the wooden workbench, window placement, and morning light of the pottery studio. Do not use the people in the image.
@Video 1 defines the pacing of throwing clay with both hands, lifting the cup, and placing it down. Do not use the person's identity, clothing, or scene from the video.

The ceramic artist finishes a pale blue cup in the pottery studio at dawn, lifts it from the wheel, and places it in the center of a wooden shelf.
Begin with a medium shot of the wheel-throwing process, then slowly push in toward the cup's surface texture. Retain the sound of the wheel, the friction of clay, and indoor ambience.
@画像1は陶芸家の顔立ち、髪型、深緑のエプロンを定義する。画像の背景は使わない。 @画像2は陶芸アトリエの木の作業台、窓の位置、朝の光を定義する。画像内の人物は使わない。 @動画1は両手でのろくろ成形、カップを持ち上げて置く動作のテンポを定義する。動画内の人物の顔・服装・シーンは使わない。 陶芸家が夜明けのアトリエで淡い青のカップを仕上げ、ろくろから持ち上げて木棚の中央に置く。 まずミディアムショットでろくろ成形を映し、カップ表面の質感へゆっくりプッシュイン。ろくろの回転音、粘土の摩擦音、室内の環境音を残す。

もう一つ注意があります。参照動画によって動作、カメラワーク、順序がすでに正確に決まっている場合は、継承する内容だけを説明してください。動作を一つずつ書き直す必要はありません。重複記述は、素材自体と競合するおそれがあります。

素材

数十件の素材を整理する:シーン別に割り当てる

素材が増えると、プロンプトの中心は人物、小道具、シーン、動作、音声の対応関係を明記することへ移ります。全素材を一文へ詰め込んでも意味はありません。公式は5段階の整理法を示しています。最終目標は、各シーンで正しい素材を選ばせることです。全素材を同時に登場させることではありません。

素材別の役割 主体の対応付け タイプ別整理 主体設定 シーン別割当
シーン1|修復室で確認、必要な素材だけ指定
修復担当者 標本箱 修復室 @動画1の開箱動作
記録担当者 記録ボード 展示室 他の素材は使わない
5段階の整理法は「シーン別の素材割り当て」に集約されます。各シーンで使う素材だけを指定し、それ以外には触れません

第1段階では、人物、商品、小道具を個別に命名し、それぞれの素材と結び付けます。

第1段階 · 主体を対応付ける書き方
<Character A> corresponds to @Image 1. Use only the appearance, hairstyle, and clothing.
<Character B> corresponds to @Image 2. Use only the appearance, hairstyle, and clothing.
<Prop A> corresponds to @Image 3. Use only the structure, material, and color.
<Scene A> references @Image 4. Use only the spatial layout, architecture, and lighting. Do not use the people in the image.
<人物A>は@画像1に対応。外見、髪型、服装だけを使う。 <人物B>は@画像2に対応。外見、髪型、服装だけを使う。 <小道具A>は@画像3に対応。構造、素材、色だけを使う。 <シーンA>は@画像4を参照。空間レイアウト、建築、光だけを使い、画像内の人物は使わない。
悪い例:「@画像1から@画像4で4人のキャラクターをそれぞれ定義する」。どの画像がどのキャラクターに対応するかが書かれておらず、結局モデルに推測させています。

第2段階では、素材が増えたらタイプ別に整理します。人物、小道具、シーン、動作と音声を、それぞれ別のグループに分けます。

第2段階 · タイプ別に整理する書き方
[Characters]
<Conservator> corresponds to @Image 1. Use only the appearance, hairstyle, and clothing.
<Registrar> corresponds to @Image 2. Use only the appearance, hairstyle, and clothing.
<Exhibition Installer> corresponds to @Image 3. Use only the appearance, hairstyle, and clothing.
<Guide> corresponds to @Image 4. Use only the appearance, hairstyle, and clothing.
Do not interchange the four characters' appearances, clothing, actions, positions, or dialogue.

[Props]
<Sample Case> corresponds to @Image 5 and belongs only to <Conservator>.
<Record Board> corresponds to @Image 6 and belongs only to <Registrar>.

[Scenes]
<Conservation Lab> references @Image 7. Use only the space, materials, and lighting.
<Gallery> references @Image 8. Use only the space, materials, and lighting.

[Motion and Audio]
@Video 1 defines the motion of <Conservator> opening <Sample Case>. Do not use the person or scene from the video.
@Audio 1 defines <Guide>'s voice and specified dialogue.
【人物】 <修復師>は@画像1に対応。外見、髪型、服装だけを使う。 <記録係>は@画像2に対応。外見、髪型、服装だけを使う。 <設営係>は@画像3に対応。外見、髪型、服装だけを使う。 <ガイド>は@画像4に対応。外見、髪型、服装だけを使う。 4人の外見、服装、動作、立ち位置、セリフを互いに入れ替えない。 【小道具】 <サンプルケース>は@画像5に対応し、<修復師>だけが持つ。 <記録ボード>は@画像6に対応し、<記録係>だけが持つ。 【シーン】 <修復室>は@画像7を参照。空間、素材、光だけを使う。 <展示室>は@画像8を参照。空間、素材、光だけを使う。 【動きと音】 @動画1は<修復師>がサンプルケースを開ける動きを定義する。動画内の人物とシーンは使わない。 @音声1は<ガイド>の声と指定セリフを定義する。

第3段階では、同じ人物を複数のシーンで複数素材から参照する場合、その人物の情報を一つの設定にまとめます。

第3段階 · 重要な主体を設定する書き方
[Subject Profile: Conservator]
Appearance and clothing: @Image 1.
Fixed prop: <Sample Case> from @Image 5.
Locations: <Conservation Lab> and <Gallery>.
Motion references: the case-opening motion from @Video 1 and the sample-placement motion from @Video 2.
Do not use: other characters' clothing. Do not give this character <Record Board> or guide equipment.
【被写体プロフィール:修復師】 外見と服装:@画像1。 固定小道具:@画像5の<サンプルケース>。 登場場所:<修復室>と<展示室>。 動きの参照:@動画1のケースを開ける動き、@動画2のサンプルを置く動き。 使わないもの:他の人物の服装。この人物に<記録ボード>やガイド機材を持たせない。

第4段階では、シーンごとに使用する素材、発生する出来事、終了状態だけを指定します。

第4段階 · シーン別に割り当てる書き方
Scene 1 | Inspection in the Conservation Lab
Use: <Conservator>, <Sample Case>, <Conservation Lab>, and the case-opening motion from @Video 1.
Event: <Conservator> opens <Sample Case> at the workbench and inspects the sample inside.
End state: <Conservator> remains on the inner side of the workbench. <Sample Case> stays beside the conservator's right hand, which is on the left side of the frame.

Scene 2 | Registration in the Gallery
Use: <Registrar>, <Record Board>, and <Gallery>.
Event: <Registrar> checks the number on <Record Board> beside the display case.
End state: <Registrar> still holds <Record Board> with both hands. No other character enters the display-case area.
シーン1|修復室での検査 使用:<修復師>、<サンプルケース>、<修復室>、@動画1のケースを開ける動き。 出来事:<修復師>が作業台でサンプルケースを開け、中のサンプルを検査する。 終了時:<修復師>は作業台の内側に留まり、サンプルケースは修復師の右手のそば、つまり画面左側にある。 シーン2|展示室での登録 使用:<記録係>、<記録ボード>、<展示室>。 出来事:<記録係>が展示ケースの横で記録ボードの番号を照合する。 終了時:記録ボードは<記録係>が両手で持ったまま。他の人物は展示ケースのエリアに入らない。
長尺動画

30秒動画:段階に分け、各段階では一つだけ変える

出来事の多い物語は連続する段階に分けます。各段階には、主要な状態変化を一つだけ割り当てます。その段階の終了時に、画面で直接確認できる状態も明記してください。花束を誰が持っているか、はさみをどちら側へ戻したか、といった情報です。「終了時」の行は、この記法全体の要です。モデルが確認できる画面上のアンカーになります。

段階1
出来事:花を整えて切る
終了時:花束は左手
段階2
出来事:包装しリボンを結ぶ
終了時:花束は机中央
段階3
出来事:受取棚に置く
終了時:花束は受取棚
長尺動画の骨格。各段階で主要な変化は一つだけ。「終了時」には画面で直接確認できる状態を書きます
30秒動画テンプレート
[Generation Goal]
Generate a <video type>. The central subject is <subject>, and the primary event is <story summary>.

[Stage 1]
Initial state: <initial state of characters, props, and scene>.
Primary event: <one primary action or event>.
End state: <character positions, prop ownership, or visible scene state>.

[Stage 2]
Continue from the previous stage: <state that must remain unchanged>.
Primary event: <one primary action or event>.
End state: <observable state>.

[Stage 3]
Primary event: <closing event>.
End state: <final visible state>.

[Maintain Consistency]
Keep <character identity, number of characters, clothing, prop ownership, spatial direction, and audio relationships> consistent.
【生成目標】 <動画タイプ>を生成する。中心となる被写体は<被写体>、主要な出来事は<ストーリー概要>。 【ステージ1】 開始時:<人物・小道具・シーンの初期状態>。 主要な出来事:<1つの主要なアクションや出来事>。 終了時:<人物の位置、小道具の持ち主、画面で見える状態>。 【ステージ2】 前のステージから継続:<維持すべき状態>。 主要な出来事:<1つの主要なアクションや出来事>。 終了時:<観察できる状態>。 【ステージ3】 主要な出来事:<締めの出来事>。 終了時:<最終的な画面の状態>。 【一貫性の維持】 <人物の同一性、人数、服装、小道具の持ち主、空間の向き、音の関係>を一定に保つ。
公式例を見る(花店の注文包装工程)
[Generation Goal]
Generate an instructional video showing a flower shop's order-packing process. <Florist> and <Store Assistant> arrange, wrap, and hand off a bouquet together.

[Stage 1]
Initial state: <Florist> stands behind the workbench. Loose flower stems, scissors, and wrapping paper lie on the tabletop.
Primary event: <Florist> arranges the stems and trims them to length.
End state: <Florist> holds the bouquet in the left hand, and the scissors are back on the right side of the workbench.

[Stage 2]
Continue from the previous stage: both characters retain the same identities and clothing, and <Florist> still holds the bouquet.
Primary event: <Store Assistant> unfolds the wrapping paper. <Florist> places the bouquet inside and ties it with a green ribbon.
End state: the wrapped bouquet lies flat in the center of the workbench, with the ribbon bow facing the camera.

[Stage 3]
Primary event: <Store Assistant> picks up the bouquet and places it on the pickup shelf.
End state: the bouquet is centered on the pickup shelf, and both characters stand behind the workbench inspecting the finished order.

[Maintain Consistency]
Keep <Florist> and <Store Assistant>'s identities, clothing, workbench orientation, scissors position, and bouquet ownership consistent.
【生成目標】 花屋の注文梱包の流れを見せる解説動画を生成する。<フローリスト>と<店員>が一緒に花束の整え・包装・受け渡しを行う。 【ステージ1】 開始時:<フローリスト>が作業台の後ろに立つ。台の上にばらの花茎、ハサミ、包装紙。 主要な出来事:<フローリスト>が花茎を整えて長さを切りそろえる。 終了時:花束は<フローリスト>の左手に、ハサミは作業台の右側に戻っている。 【ステージ2】 前のステージから継続:2人の同一性と服装は同じ、花束は<フローリスト>が持ったまま。 主要な出来事:<店員>が包装紙を広げ、<フローリスト>が花束を入れて緑のリボンを結ぶ。 終了時:包装済みの花束が作業台の中央に平置きされ、リボンの結び目がカメラを向く。 【ステージ3】 主要な出来事:<店員>が花束を持ち上げ、受け取り棚に置く。 終了時:花束は受け取り棚の中央にあり、2人は作業台の後ろで仕上がりを確認している。 【一貫性の維持】 <フローリスト>と<店員>の同一性、服装、作業台の向き、ハサミの位置、花束の持ち主を一定に保つ。