プロダクト発表 · 小互解読

ByteDance が Seedream 5.0 Pro を発表:1枚の画像から10層以上の独立レイヤーを分離、密な図表と実写を一発生成

クリック選択・囲み選択によるピンポイント編集と10種類以上の言語のネイティブレンダリングを追加、すでに火山方舟に実装済み、今後 Doubao・即梦に順次実装
1分で分かる速報
  • ByteDance の Seed チームがマルチモーダル画像生成モデル Seedream 5.0 Pro を発表、すでに火山方舟の体験センターに実装済みで、今後 Doubao・即梦に順次実装される。
  • 複雑な情報の可視化を新たにサポート:1枚の画像にタイムライン、図表、密な文字、実写写真を同時に組み込み、レイアウト済みのプロ仕様インフォグラフィックを一発生成。
  • 空間位置(Grounding)と領域セマンティック理解に基づき、クリック選択・囲み選択・スケッチレンダリング・色/素材の置換・複数画像の融合など精密な編集をサポート、さらに1枚の画像全体を10層以上の個別編集可能なレイヤーに分離できる。
  • 現実世界の光影・素材・肌のディテールの再現を強化、映画品質のポートレートも 3A ゲームのリアル系キャラクターも作れる。
  • 中国語、英語、フランス語、ドイツ語、ロシア語、日本語、韓国語、スペイン語、アラビア語など10種類以上の言語のネイティブな直接入力・生成に対応、アラビア語の右から左への連続筆記、スペイン語のアクセント記号など細かい組版も正しくレンダリングできる。
本記事は ByteDance Seed チームの公式発表内容に基づいて整理したものです。文中の機能説明・サンプル画像・動画はすべてメーカー提供であり、公式デモの結果です。第三者による独立した再現検証は行われていません。
1 発表

「描く」だけでなく「組む」も分かるようになった

ByteDance の Seed チームは本日(7月8日)マルチモーダル画像生成モデル Seedream 5.0 Pro を正式発表、すでに火山方舟の体験センターに実装済みで、この後 Doubao と即梦にも順次実装される。

前世代と比べて、テキストと画像の整合性、構造の妥当性、文字レンダリング、画面の美しさといった基礎能力を全体的にアップグレードしたうえで、4つの方向で新機能を追加した:複雑な情報をプロ仕様のレイアウトに組む、クリック選択・囲み選択による精密編集、現実の光影と質感の再現、10種類以上の言語のネイティブサポート。

注目すべき理由:インフォグラフィック生成は現在の AI 画像生成の中でも複雑度が最も高い領域の一つと公式は述べている。1回の生成の中でデータの正確さ、密な文字の間違いのなさ、レイアウトの妥当性、美しさを同時に担保しなければならないからだ。Seedream 5.0 Pro はタイムライン、図表、密な文字、実写写真を1枚の画像に詰め込めるうえ、完成した1枚の画像を自動で10層以上の個別編集可能な透過レイヤーに分離できる。
複雑な情報の可視化
データ・コンセプト・密な文字を一発でプロ仕様のレイアウトに組み、高密度コンテンツにそのまま使える。
インタラクティブな精密編集
クリック選択・囲み選択・スケッチ・色や素材の変更・レイヤー分離・複数画像融合を自由に組み合わせられる。
リアルな映像・ポートレートの質感
現実の光影・素材・肌のディテールを再現、CG 表現と写真的な質感の両方に対応。
ネイティブな多言語生成
10種類以上の一般的な言語を直接入力・高品質にレンダリングでき、現地の視覚的特徴にも合わせられる。

体験入口:火山方舟体験センター · ビジュアルモデル · 画像生成 · Doubao-Seedream-5.0-pro;Doubao アプリまたは PC 版 · AI 作成 · 画像生成 · モデル選択 Seedream 5.0 Pro;即梦ウェブ版 · 画像生成または Agent モード · 5.0 Pro を選択。プロジェクトページ seed.bytedance.com/seedream5_0_pro。

2 情報の可視化

1枚の画像にタイムライン・図表・実写写真を詰め込む

プロ向けのシーンでは、画像は単なる装飾ではなく情報そのものであることが多い。インフォグラフィックは1回の生成でデータ・密な文字・レイアウト構造・美しさすべてを正しく仕上げる必要があり、今回のアップグレードで重点的に磨かれたポイントだ。Seedream 5.0 Pro はまずユーザーの意図を読み取り、自ら論理的推論とレイアウト設計を完了してから、コンテンツを画面に組み込んでいく。

コア機能 · その1

同じ1枚の画像の中にタイムライン・折れ線グラフ・棒グラフ・円グラフと施設の実写を融合させ、情報の階層がはっきりして視覚的なメタファーも噛み合った、データ全体を空間的に統括する力を示せる。以下の「南極科学観測基地」インフォグラフィックは一発生成の結果だ。

南極秦嶺基地の科学観測インフォグラフィック、タイムライン・棒グラフ・円グラフ・折れ線グラフと基地本体の実写を含む
「南極秦嶺基地」インフォグラフィック:1枚の画像に科学観測のタイムライン、5基地の規模を示す棒グラフ、エネルギー円グラフ、月別日照量の折れ線グラフ、実写写真を組み込んでいる。出典:ByteDance Seed
この画像に使われた完全な Prompt
主题为南极秦岭站科考纪事可视化信息图,中心放置秦岭站建筑主体;四周环绕排布科考发展时间轴、五座科考站规模柱状图、站点能源饼图、月度日照折线图,辅以科研设备实拍、夏季气象面板、野外作业七步流程、实地采样摄影,多方面展示中国南极科考实景。

教育・科学普及のシーンでは事実の正確さがより高く求められる。モデルは「なぜ皆既月食の月は赤いのか」という原理を図解できるだけでなく、さまざまな鳥類の形態的特徴を抽出して整った格子状のレイアウトに組むこともできる。

皆既月食がなぜ赤いのかを説明する天文科学普及インフォグラフィック
Prompt:生成一张天文科普信息图,解释为什么月全食的月亮是红色的?
初心者向けバードウォッチング入門ガイドの自然科学普及インフォグラフィック、8種類の鳥をグリッドレイアウトで紹介
Prompt:《新手观鸟入门指南》自然科普信息图,清新配色网格排版,展示 8 种常见鸟类,附科学插画、中英文名、识别特征。

タイトル・割引詳細・開催期間などの階層が複雑な密な文字を含む「冬のクリスマスセールポスター」のようなケースでは、モデルはレトロな巻物の上に内容を疎密をつけて配置する:大量の英単語のスペルミスがなく、情報の優先度に応じて太字と筆記体を織り交ぜている。

冬のクリスマスセールポスター、レトロな巻物に密な英語文字を配置
クリスマスセールポスター:レトロな巻物に大量の英語を配置、タイトル・割引・時間の階層がはっきりしている。出典:ByteDance Seed

「ペットEC ファーストビュー」UI では、モデルは空間トポロジーへの理解も見せている:明快なナビゲーションバーと浮遊するカードを生成し、レイヤーをまたぐインタラクションも作り出した。ゴールデンレトリバーの前脚が右側の画像の枠を突き破り、実際に左側のボタンを押している様子で、そのままプロダクトのプロトタイプ画像として使える。

ペットEC ファーストビューUI、ゴールデンレトリバーの前脚が画像の枠を突き破り左側のボタンを押している
ペットEC ファーストビュー:ゴールデンレトリバーの前脚が枠を突き破り左側のボタンを押す、レイヤーをまたぐインタラクションと段階的な影を一発生成。出典:ByteDance Seed
レイヤーをまたぐインタラクションの Prompt
16:9 宠物电商首屏 UI,日落暖阳色调,分层阴影。顶部导航;左侧奶油米色背景,含文案、商品卡片、金黄胶囊按钮;右侧金毛图,3D 特效:金毛前爪冲破右框,搭在左侧按钮上。
3 メカニズム

言葉で「どこを直すか」が伝わらなくても、モデルは座標が読めるようになった

テキストだけの Prompt には本質的な限界がある:言葉は「何を生成するか」を伝えるのは得意でも、「どの部分を直すか」を正確に指定するのは苦手だ。しかしデザインは往々にして何度も微調整を重ねて磨き上げるもので、この段階では一文の説明だけでは足りなくなる。Seedream 5.0 Pro は制御信号を生成プロセスにネイティブに組み込んでおり、その核心が空間位置(Grounding)と領域セマンティックの理解だ。

Grounding とは何か

画像に座標地図を添付するようなものだ:モデルは画面内のあらゆる物体・文字・余白が具体的にどの座標位置にあるかを把握している。どこを囲んでも、モデルはその部分だけを動かし、隣接する内容を巻き込まない。「どこを直すべきか」も「そこが何であるか」も分かっている。

変更前 · ソファを囲む
特定:この部分は画面のどこか(座標)
理解:この部分は何か(セマンティック=ソファ)
この部分だけに修正指示を出す
変更後 · ソファだけが変わった
4 インタラクティブ編集

囲む、クリックする——座標が確実な修正指示に変わる

空間認識を手に入れたことで、モデルはクリック選択・囲み選択・枠選択・落書きから伝わってくる座標情報を、確定的な局所操作の指示に変換できるようになった。色や素材を変える、対象を増減するといった操作の後も、局所と全体の環境が自然に馴染み、パースも合っている。

コア機能 · その2

まず正確に位置を特定し、それから修正を実行する。デザイナーは微調整のたびに全体を描き直す必要がなく、半完成品に対して高頻度の局所修正ができる。一般ユーザーも感覚でざっくり囲んだりクリックしたりするだけで、高品質な画面を組み立てられる。

まず位置についての理解を見てみよう。「2026年新共通テスト数学解答」では、モデルは各問題を正確に識別し、問題の下の余白部分を特定して計算式を書き、答えを対応する解答欄に埋め込んだ。海外のメニューを中国語に翻訳する際も、レイアウトの位置を一対一で対応させられる。

数学の試験の解答、モデルが問題の下の余白を特定して計算式を書き込む
Prompt:帮我完成上述所有选择题,并写上对应的演算过程。答案填进每题下方的留白区。
海外のメニューを中国語に翻訳、レイアウトの位置を一対一で対応
Prompt:把菜单翻译成中文。翻译后的文字保持和原菜单位置一一对应。

色の変更、素材の変更、領域ごとの生成

対象の修正では、モデルは色編集と素材置換をサポートしており、Hex カラーコードを入力することも、外部のカラーサンプルを直接参照することもできる。下の画像は、ある画像の素材と別の画像のカラーサンプルに従って、3枚目の画像のソファを変更したものだ。

カラーサンプルと素材でソファの色と質感を置換
Prompt:请依据图 1 的材质和图 2 的色卡,修改图 3 中的沙发。出典:ByteDance Seed

領域を分離する能力もかなり高い。ユーザーが異なる色の枠で位置を囲むと、モデルはそれに対応する物品を生成する:赤い枠の中にはシャボン玉を眺める青い毛の怪獣、紫の枠の中には草の緑色の毛布、各要素が座標ごとに分かれて互いに干渉しない。

カラー枠による領域分離、赤枠に青い毛の怪獣、紫枠に緑の毛布を生成
領域分離:異なる色の枠で位置を囲むと、モデルはそれぞれ怪獣と毛布を生成する、それぞれが自分の座標に収まる。出典:ByteDance Seed

スケッチレンダリング:手描きの落書きを制御信号に

ユーザーが手描きした色ブロック、線、簡単なイラストも、精細なレンダリングを直接駆動できる。「三里小学校の遠足ポスター」では、大まかなレイアウトのスケッチを1枚渡すだけで、モデルは各エリアの意図を認識し、フェルト素材と縫い目の質感を再現、出発時刻や必需品といった文字をスケッチが指定した位置に正確に埋め込んだ。

三里小学校の遠足ポスター、大まかなスケッチからフェルト素材の完成品にレンダリング
スケッチレンダリング:大まかな1枚のスケッチを、フェルトの縫い目の質感を持つ遠足ポスターにレンダリング、文字はスケッチが指定した領域に収まった。出典:ByteDance Seed

複数の編集を自由に組み合わせ

これらの機能は重ねて使うこともできる。下の画像では、ユーザーはカボチャをダークグリーン(#3E4A2E)とサフランイエロー(#DB973E)の間の色に変え、同時に背景の書体を刺繍風の質感に変えるよう求めた。モデルは素材置換と色編集を同時に完了し、変更した部分は夏の午後の環境光と自然に馴染んでいる。

カボチャの色・素材置換と背景の刺繍風書体を組み合わせた編集
組み合わせ編集:カボチャを指定した Hex カラーで2色に変え、背景の書体を刺繍風の質感に変える、一度に同時完了。出典:ByteDance Seed
5 レイヤー分離

1枚のポスターが10数層に分離、メインの被写体まるごと差し替えも可能

これは今回のアップグレードの中で最も特徴的な機能の一つだ。一文の説明だけで、Seedream 5.0 Pro は完成した1枚の画像を独立したレイヤー群に分離でき、そのまま再加工可能なデザイン素材として直接出力できる。

コア機能 · その3

1枚のポスターがテキスト、主体、背景、環境装飾など10層以上の独立レイヤーに分離できる。主体に隠れていた背景部分は自動で補完・復元され、各層は透過度を保持したまま自由にドラッグ・拡大縮小でき、さらにコアの主体をまるごと新しい要素に差し替えることもできる。

以下のデモでは、1枚のオウムのポスターが10数層に分離され、オウムに隠れていた背景が補完され、最後にクリエイターは主体のオウムをそのままクジャクに差し替えた。

デモ:ポスター全体を10層以上の透過レイヤーに分離、背景を補完、主体のオウムをクジャクに差し替え。出典:ByteDance Seed

逆に、モデルは複数画像の融合もできる。複数の参照素材と1枚のベース画像を同時に入力すると、指示に従って異なる要素を同じシーンに組み合わせる。ビジュアルコラージュやアイデア発散の前段階の作業に向いている。

デモ:複数の参照素材を同じベース画像に融合、複雑なシーンを組み立てる。出典:ByteDance Seed
6 リアルな質感

光影・素材・肌のテクスチャで、写真のような画面に

Seedream 5.0 Pro は現実世界の光影、物体の素材、肌のディテールへの理解を強化しており、CG 表現と写真的な質感の両方が向上している。リアルさは光・物・人の3つを正確に再現できるかどうかにかかっている。

光影においては、モデルは高周波のディテールにおける微細な動きを捉えられる:薄暗い部屋にブラインド越しに差し込む「天使の梯子」、寿司のポスターで宙に舞う米粒と魚卵、モノクロフィルムに写った水しぶき、いずれも瞬間として定着できる。

ブラインドの天使の梯子、宙に舞う寿司の米粒と魚卵、モノクロフィルムの水しぶきの光影ディテール
光影のディテール:ブラインドの「天使の梯子」、宙に舞う米粒と魚卵、フィルムの水しぶき、画面には空間の奥行きとフィルムらしい階調感の両方がある。出典:ByteDance Seed

素材においては、モデルは実際の物理法則に従って反射・屈折・透光を処理する。下の画像左側の街並みのショーウィンドウでは、ガラス上のレトロなポスターが印刷の網点の質感を保持しており、ポスター・街並み・ガラスの反射の3層が虚実織り交ぜて重なっている。右側の「海辺の断崖ガラス別荘」は、金属・ガラス・石材・海水・木材の間で、室内の暖かい光と夕日、海面の複数の反射が柔らかく移り変わっている。

街並みのショーウィンドウのガラスの多重反射と海辺の断崖ガラス別荘の素材表現
素材と反射:ショーウィンドウのガラスに虚実3層が織り交ざり、ガラス別荘は複数の素材間で柔らかな多重反射の移り変わりを見せる。出典:ByteDance Seed

ポートレートにおいては、モデルは肌のディテールを繊細に再現しており、顔のしわや粗い肌質にも層があり、マットな顔の光影の移り変わりが柔らかい。実写映画のようなポートレートだけでなく、3A ゲーム(大手企業が高予算で作る、実写に近いリアリティの映画品質のゲーム大作)のリアル系キャラクターも作れ、衣装・肢体・環境光が統一された調和を見せる。

映画品質のリアルなポートレートと3Aゲームのリアル系キャラクターの肌のディテール表現
ポートレートと 3A キャラクター:顔のしわや粗い肌質に層があり、リアル系ゲームキャラクターの衣装と環境光が統一されている。出典:ByteDance Seed
父親が娘の髪を編む家庭的でリアルなポートレート、自然な光と肌の質感
別の公式事例:家庭のシーンでの父娘の触れ合いを描いたリアルなポートレート、肌の質感と自然光にも明らかな AI らしさは見られない。出典:ByteDance Seed プロジェクトページ

静止画にとどまらず、モデルは高度な写真表現もサポートしている。パンニングのシーンでは、自転車に乗る人物と車体はくっきりと鮮明で、背景の街並みは水平方向のモーションブラーがかかり、車輪のスポークは回転してぼやける。カメラの水平追従と車輪の高速回転という二重の運動関係を再現している。

パンニングで撮影されたサイクリスト、主体は鮮明で背景は水平モーションブラー、車輪は回転してぼやける
Prompt:摇拍一个骑行者,人物和自行车主体清晰,背景街道拉成水平方向的运动模糊,车轮辐条有旋转虚化,传递速度感。

複数画像の合成はこの制御力をさらに拡張する。複数の独立した人物写真を入力すると、モデルはそれぞれの顔の特徴を抽出し、指定した立ち位置で同じシーンに組み合わせ、光影が統一され質感の調和した集合写真を生成できる。

複数の人物写真を立ち位置に従って同じシーンに合成した集合写真
Prompt:将图 2 到图 6 的人物,参照图 1 站位合影,人物神态开心,背景有树和咖啡馆门店。
7 多言語

十数種類の言語を直接入力可能、アラビア語の連続筆記も正確

グローバルな創作は単に文字を翻訳するだけではなく、異なる市場の地域文化と視覚的特徴を伝えることでもある。中国語・英語のほか、Seedream 5.0 Pro はフランス語、ドイツ語、ロシア語、日本語、韓国語、スペイン語、アラビア語など10種類以上の一般的な言語のネイティブな直接入力・生成をサポートしている。

異なる言語で指示を入力すると、モデルは意味を理解するだけでなく、対応する文化的文脈における建築様式・人物の顔立ち・服装のディテールにもマッチさせ、画面を現地の雰囲気に馴染ませられる。

デモ:異なる言語での入力に応じて、建築・人物・服装がそれぞれの文化的文脈にマッチする。出典:ByteDance Seed

文字のレンダリングでは、モデルは異なる言語の組版ルールに自動で適応する。同じビジュアルレイアウトであっても、通常の中国語・英語をレンダリングできるだけでなく、アラビア語の右から左への連続筆記を処理し、スペイン語のアクセント記号(PASIÓN など)を再現できる。

同じビジュアルレイアウトでの多言語文字レンダリング比較、アラビア語の連続筆記とスペイン語のアクセントを含む
同じレイアウトでの多言語文字レンダリング:アラビア語の右から左への連続筆記、スペイン語のアクセント記号ともに正確に処理できる。出典:ByteDance Seed

以下は3つの言語の組版ルールを分解して見たもので、同じ単語が異なる書記システムでどう書かれるかの違いが直感的に分かる:

中国語 · 左から右
激情
通常の横書き、方形の文字が等幅に並ぶ。
アラビア語 · 右から左
شغف
行全体が右から左に流れ、文字がひと続きに連結する。
スペイン語 · アクセント記号
PASIÓN
Ó の上のアクセントが正確な位置に収まる必要がある。

(上図は組版ルールの説明図で、各言語の書字方向と記号の違いを理解する助けとなる。)

実際のケースに落とし込むと、公式プロジェクトページはさらに直感的な2つのサンプルを挙げている:一つはアラビア語の医療アプリの画面で、画面全体の文字が右から左に連続して並び、アイコンの位置もそれに合わせて反転している。もう一つはスペイン語の「死者の日」をテーマにしたポスターで、装飾の柄も組版も現地の祝祭の視覚的な慣習に沿っている。単に英語のテンプレートに翻訳を当てはめただけではない。

アラビア語の家庭医療クリニックアプリの画面、文字が右から左に並ぶ
アラビア語アプリの画面:全画面 RTL 組版、アイコンの並び順もそれに合わせて反転。出典:ByteDance Seed プロジェクトページ
スペイン語の死者の日をテーマにしたポスター、装飾スタイルが現地の祝祭の視覚に合致
スペイン語の祝祭ポスター:柄の装飾と組版のスタイルが「死者の日」の現地の視覚的慣習に合致している。出典:ByteDance Seed プロジェクトページ
8 実用面

クリエイターにとって、これらの機能はどこで使えるのか

公式の説明によれば、今回のアップグレードは主にモデルの空間構造の認識、高密度な文字レンダリング、多言語理解における基盤的な進歩に由来する。プロの制作現場に落とし込むと、いくつかの機能はそれぞれ手間を省ける場面に対応している。

10+
ネイティブサポートする言語の種類(中国語・英語のほか、フランス語・ドイツ語・ロシア語・日本語・韓国語・スペイン語・アラビア語など)
10+
1枚のポスターから自動で分離できる独立編集可能なレイヤー数

インフォグラフィックやポスターのような高情報密度のコンテンツは一発でプロ仕様のレイアウトを生成でき、デザイナーがゼロから組版する時間を省ける。クリック選択・囲み選択による局所編集にレイヤーのインテリジェントな分離を加えることで、デザイナーは全体を描き直すことなく半完成品に対して高頻度の微調整ができる。10種類以上の言語のネイティブ生成は、複数市場をまたぐローカライズされたビジュアル制作を支え、言語ごとに画面を作り直す必要がなくなる。

公式は現時点での限界についても説明している:複雑なインフォグラフィック生成、インタラクティブな精密編集では進歩を実現したが、より細かい粒度の文字レンダリング、ピクセルレベルの編集での一貫性については、依然として改善の余地があるという。

9 さらなる事例

プロジェクトページには事例の壁が丸ごと1枚、スタイルの幅は本記事よりずっと広い

公式アカウントに掲載されたこれらのデモのほかに、ByteDance Seed のプロジェクトページ自体にも一連の事例が掲載されており、実写写真、イラスト、キャラクターデザイン、UI から風景の大作まで横断していて、能力のカバー範囲は本記事で紹介したものより広い。いくつかピックアップして以下に掲載する、興味があれば飛んで事例の壁を全部見てほしい。

小麦粉を振りまくパン職人のリアルな写真、逆光と粉塵の質感
逆光のベーキングシーン、粉塵が舞い散る瞬間の質感
渓谷と川の風景写真
渓谷と川の風景、リアルな風景写真
騎兵の突撃を描いたコマ割りイラスト
騎兵突撃のコマ割りイラスト、複数コマの物語を一発生成
Seedreamをテーマにした雑誌の表紙デザイン、オウムのメインビジュアル
雑誌の表紙デザイン、図とテキストの階層と組版が一発で決まる
砂漠にいる幼竜のイラスト
ファンタジーイラスト:砂漠の幼竜、体毛と鱗のディテールがくっきり
鎧をまとった騎士のキャラクターデザイン立ち絵
ゲームキャラクター立ち絵:鎧をまとった騎士、素材がリアル
熱帯の島の空撮風景
熱帯の島の空撮、色彩の階層が豊か
トレイルランナーの動的な写真
トレイルランの動的なスナップ、泥水が飛び散るディテール
→ プロジェクトページで事例の壁をすべて見る
インフォグラフィック生成は、現在の AI 画像生成の中でも複雑度が最も高い領域の一つであり、1回の生成の中でデータの正確さ、密な文字に間違いがないこと、レイアウト構造の妥当性、プロフェッショナルな美しさを同時に担保することが求められる。 ByteDance Seed · Seedream 5.0 Pro 発表
出典:ByteDance Seed『「生成」だけでなく、「デザイン」も分かる|Seedream 5.0 Pro 発表』(2026年7月8日)、一部の事例画像はプロジェクトページ seed.bytedance.com/seedream5_0_pro から補足。文中の画像・動画はすべて公式デモの結果であり、第三者による独立した再現検証は行われていません。