製品リリース · 小互解説

Meta が Muse Image を発表:画像生成が自分で調べ、自分で修正し、評価は世界二位

同門の Muse Video 動画モデルも同時に予告、ネイティブ音声生成に対応済み、まもなくクリエイターに公開。

三十秒でわかる
  • Meta Superintelligence Labs が、ラボ設立以来初となる自社開発のメディア生成モデルを発表——正式公開の Muse Image と、プレビュー公開の Muse Video。
  • Muse Image は画像生成時に検索やコードのツールを呼び出して内容を検証し、ディテールをチェックする——画像生成を「調べながら描く」プロセスに変えた。
  • モデルは生成の途中で自己チェックし、下書きを直す。この自己修正の習慣は強化学習の訓練の中で自然に現れたもので、チームが意図して設計したわけではない。
  • Arena の人間評価ランキング(2026年7月5日時点)で、Muse Image はテキストから画像・単一画像編集・複数画像編集の三項目がいずれも二位、Muse Video はテキストから動画で三位。
  • Muse Image はすでに Meta AI App、meta.ai、米国の Instagram Stories、一部の国の WhatsApp で利用可能、Facebook もまもなく対応。Muse Video はまもなくクリエイターに公開。
本記事の内容は Meta AI 公式ブログ(2026年7月7日)に基づく。文中の win rate の比較や Elo ランキングは、いずれも Meta 内部の評価、またはそれが引用した第三者ランキング(Arena)のデータ。以下では整理に徹し、何を公開したか、それぞれがどう動くかを解き明かす。
1 リリース · 何なのか

Meta が自ら参入、自社開発の画像生成・動画生成モデルを二つ発表

Meta Superintelligence Labs は2026年7月7日に Muse Image と Muse Video を発表した。これはラボ設立以来初めて発表する自社開発のメディア生成モデルだ。

Muse Image はすでに正式公開、Muse Video は早期プレビューを公開。前者は画像生成モデル、後者は動画生成モデルで、両者は同じ事前学習のベースを共有する。

注目すべき点:Muse Image は画像生成時、調べ物をし、コードを書き、自分で下書きを直す助手のように一歩ずつ働く。そして Arena の人間評価ランキングでは、テキストから画像・単一画像編集・複数画像編集の三項目がいずれも二位に入った。

Muse Image 公式が示した生成結果の一部。出典:Meta AI Blog。

No.2
Arena 人間評価ランキングで Muse Image のテキストから画像・単一画像編集・複数画像編集の三項目の順位(2026年7月5日時点)
No.3
Arena 人間評価ランキングで Muse Video のテキストから動画の順位(2026年7月5日時点)
4つの入口
Muse Image はすでに Meta AI App、meta.ai、米国 IG Stories、一部の国の WhatsApp で利用可能、Facebook もまもなく対応
2 コア革新 · 調べながら描く

AI が絵を描くのに、調べながら、コードを書きながら、描ける

これまでの画像生成モデルは、あなたの一言をそのまま一枚の絵に写像するだけで、途中に照合の工程がなかった。Muse Image は画像生成を agentic(自分でツールを呼び、段階を追ってタスクを片付ける)なプロセスにした——まず検索やコードのツールを呼び出し、調べ、計算し、照合してから、画像を組み立てる。

二つのツール

コードを書く。強化学習の中で、Muse Image はコードを書き、実行して正確な図表や QR コードを生成し、レンダリング結果に基づいて画面を補正することを覚えた。読み取れる QR コードを描くには、実際にコードで QR コードを計算し、画像を開いて読み取れることを確認してから、画面に入れる。

ネット検索。さらに検索も覚え、生成した画像を現実の・リアルタイムの情報と揃える。検索をオンにすると、時事や現実の事実に依存するプロンプトでは、出力画像の事実の正確さが高まる。

Muse Image は Muse Spark とも連携でき、二つのモデルがツールを共有し、一緒にプランを立て、コードとメディア生成を組み合わせて GIF、画像付きウェブページ、遊べるビジュアルゲームを作る。

一つの例:会議ポスターに本当に読み取れる QR コードを描く

原文が挙げた場面はこうだ——韓国風マンガのタッチで、若い女性が ICML 2025 のポスターの前に立ち、meta.ai を指す QR コードを読み取る。モデルはこう一歩ずつ進めた:

画面を準備
韓国風マンガ · ICML 2025 ポスター
コードで QR コード生成
meta.ai を指す
画像を開く
本当に読めるか確認
シーン全体を合成
微調整:人物を
スマホ画面を見る姿に

左:初版、人物が QR コードを見つめる。右:モデルが自ら微調整した後、人物はスマホ画面を見る姿に変わり、タッチ・ポスター・QR コードのディテールはいずれもそのまま。出典:Meta AI Blog。

検索のオン・オフで、何が違うか

検索オフ

時事や現実世界の事実といった知識集約型のプロンプトでは、モデルは自分が覚えていることに頼るしかなく、間違えやすい。

検索オン

先にネットで裏を取ってから描くので、事実の正確さが高い(Meta 内部のアブレーション実験では、検索をオンにした側の win rate が高かった)。

さらなる agentic の事例(クリックで開く)
  • フラクタルポスター:まず Python で Julia 集合と Sierpinski 三角形を計算し、きれいなベース画像を合成、そこに中世スイス風のグリッドレイアウトをかぶせる。
  • 格闘パラパラアニメ:パンチや回避のコマを一枚ずつ生成、背景の光や人物のデザインを最後まで一貫させる。
  • ペット育成ミニゲーム:猫の幼年・少年・老年など六枚の画像を生成し、base64 に変換して HTML に直接埋め込み、外部ファイルに依存せず開けばすぐ遊べるウェブページを納品。
  • 2026年夏コーデ:まずファッションのトレンドと商品カタログを検索、そのまま注文できるコーデ画像を出す。
  • 月の形成インフォグラフィック:まずジャイアント・インパクト説の科学的な図解と事実を検索、六コマ縦並びのインフォグラフィックを描く。
  • 中古家具で部屋を模様替え:アップした部屋の写真と住んでいる都市に合わせて、Facebook Marketplace で合う中古家具を探し、完成イメージを出す。
フラクタルポスター生成プレビュー
フラクタルポスターの事例:コードでフラクタルを計算し、スイス風グリッドレイアウトをかぶせる。出典:Meta AI Blog。
3 コア革新 · 自己修正

この「自分で直す」習慣は、AI が訓練の中で自ら会得したもの

Muse Image は自身の思考連鎖モデルが結果を出す前に、一歩ずつ書き出す推論の過程。下書き用紙のメモのようなもの。(chain of thought)の中で、自分の作品を見返して改善する。この自己修正には三つの形がある:

部分だけ修正

細かいところが違えば、今の下書きを部分的に直す。

一から描き直し

広い範囲が間違っていれば、いっそ最初から一枚生成し直す。

やり方を変える

ツールに切り替える。たとえば検索したりコードを書いたりして、事実を正確にする。

自然発生

チームはこの挙動を設計していない。強化学習の訓練の中で自ら現れたものだ——モデルは、下書きを直すとより良い画像ができ、より高い報酬を得られると気づき、この一連の動作を自分で身につけた。

一つの例:雑誌レイアウトの中で、自ら数式の誤りに気づく

モデルが凝った雑誌ページを組んでいて、数学の証明・大見出し・人物写真をレイアウトに入れた後、見返した際に総和の数式で割り算の記号が抜けていることに気づき、こう訂正した:

修正前の雑誌ページの下書き、数式が S=n(n+1)2 となり割り算記号が抜けている
モデルが見返して直した雑誌ページ、数式が S=n(n+1)/2 に直され割り算記号が補われた

左:初稿、見出しの下の数式が "S = n(n + 1) 2" となり、割り算記号が抜けて意味が通らない。右:モデルが自ら見返して問題に気づき、"S = n(n + 1) / 2" に直し、ついでにレイアウトのディテールも改めて確認した。出典:Meta AI Blog。

自己修正のオン・オフで、何が違うか

自己修正オフ

一発生成で提出、下書きの小さな粗が完成画像に残る。

自己修正オン

生成の過程で自ら見返し、下書きを直すので、出力画像の質が高い(Meta 内部のアブレーション実験では、自己修正をオンにした側の win rate が高かった)。

4 テスト時の計算量

AI は考える時間が長いほど正確に描くが、効果はやがて頭打ちになる

言語モデルと同じく、Muse Image は画像を出す際に考えるほど、うまく描ける。テスト時の計算量モデルが実際に結果を出す前に、余分に費やすこの計算:多く推論し、多くツールを呼び、下書きを何度か直す。(test-time compute)を多く与えるほど、より多く推論し、より多くツールを呼び、より多く自己修正する。

たとえるなら

テスト時の計算量は、試験で下書きを何度もやり直し、答案を何度も見直すようなもの。長く考えるほど答えはたいてい正確になるが、見直しすぎると、追加の効果はどんどん小さくなる。

Meta はこう観察した——推論の強度を上げると、人間評価の Elo スコアもそれに伴って上がり、両者はほぼ対数線形の関係になる。面白いのは、この計算量が二つのかなり異なる作業にまたがっている点だ。推論はテキストの token を使い、生成は画像の token を使うが、最終的な質は両者を合わせた総計算量で決まる。

この計算量をどう使うかも肝心だ。Best-of-N(一度に何枚も生成し、最良の一枚を選ぶ)は、伸びは速いがすぐ頭打ちになる。同じ計算量をじっくり考える推論に使えば、ずっと上がり続ける。推論にさらにツールを加えれば、効果はさらに積み上がる。ツールはモデルが本来知らないものに手を伸ばさせるからだ。たとえば足りない参考資料を検索したり、コードを書いてディテールを正確にしたり。

同じ計算量でも、どこに使うかで見返りは大きく変わる
じっくり推論+ツール:上がり続ける Best-of-N:すぐ頭打ち 頭打ち 上がり続ける テスト時計算量 · 右ほど投入大(文字+画像 token 合計) 人間評価 Elo
イメージ図、原文の inference-time compute scaling の結論に基づき作成(傾向を示すもので正確な数値ではない)。
5 画像編集

画像の修正は、指した箇所だけ直せるようになった

Muse Image は画像を直す際、あなたが指定した箇所だけをいじり、他はそのまま。原文はいくつかの指示を挙げていて、どれも具体的だ:

「霧を消して、下のきれいな谷を見せて」
霧だけ晴らして谷を補い、空と構図はいじらない。
「この花の花びらを虹色のグラデーションに」
花びらの色だけ変え、花の形と背景はそのまま。
「この古い写真を修復して」
傷を補い、色を復元、人物と構図は元のまま。
「少し引きにして、犬のやらかしを見せて、後ろめたい表情に説明をつけて」
外側に画面を補い、元画像の外の文脈を足す。

看板の文字まで正確に差し替えられる

ある指示は、看板を "$3.00 ALL DAY" に、"no free parking" を "FREE PARKING ON WEEKENDS" に、電話番号を 555-5555 に変える、というもの。変えるのは文字だけで、他のレイアウトはいじらない:

元の看板
$2.50
NO FREE PARKING
555-1234
変更後の看板
$3.00 ALL DAY
FREE PARKING ON WEEKENDS
555-5555

イメージ:原文の看板文字の編集指示を再現し、「指した箇所だけ直す」正確な差し替えを示す。

何ラウンドも続けて直しても、前後で辻褄が合う

Muse Image は一ラウンドずつ直し続けられ、途中で崩れない。原文には最初から最後まで直し続ける対話があり、各ステップが前の画像の上に積み上がっている:

1この猫とこの犬で、二匹が仲良しで晴れた日にピクニックしている画像を、35mm レトロフィルム風で作って。
2さっきのピクニック画像を、温かみのあるカフェの壁に掛かった額縁にして。壁の前にはテーブル一つと空の椅子二脚。
3このカフェの外観を、店名つきで見せて。雰囲気は前の写真のカフェと揃え、窓からはあの額縁も見えるように。
4このカフェの店名で紙のメニューをデザインして、「ピクニック特別メニュー」を一品加え、写真と同じ猫と犬の小さなイラストを添えて。
5このメニューを、前の空きテーブルのアップの画像に置いて。

同じ猫・犬・カフェの要素が、五ラウンドの編集を通じて終始辻褄が合う。

原文にはもう一組、似たマルチラウンドの例がある——「リビングを Japandi 風に → でも一枚目のスタンドライトと棚は戻して → 最後にビフォーアフターの比較画像を作って」。各ステップが前のステップの出力の上に積み上がっている:

リビング改造のビフォーアフター比較:元のリビングと Japandi 風に変えたリビングを並べて比較
三ラウンドの編集後に自動生成されたビフォーアフター比較:左が元のリビング、右が Japandi 風に変えつつ元のスタンドライトと棚を残したバージョン。出典:Meta AI Blog。
6 複数画像の参照

一言に何枚もの参照画像を詰め込んでも、AI は正しく組み合わせる

Muse Image は何枚もの参照画像の要素——人、物体、服、スタイル、シーン——からそれぞれ一部を取り、一枚の新しい画像に組み立てられる。プロンプトの中で文字と画像を交ぜて書くこともできる。たとえば:[この人]を[この自転車]に乗せ、[この服]を着せ、[公園のベンチ]を通り過ぎさせ、全体を[ある画像]のタッチにする。

複数の参照画像 → 一枚の合成画像
自転車 公園ベンチ 参考タッチ 合成画像1枚
プロンプトに従い、各参照画像の要素を同じ一枚に組み込む。出典:Meta AI Blog の自転車・公園のベンチの事例。
Muse Image の複数画像参照の実際の生成結果:参照画像の自転車に乗り、参照画像の服を着た人が公園のベンチを通り過ぎる
プロンプトは「この人をこの自転車に乗せ、この服を着せ、公園のベンチを通り過ぎさせ、全体をある画像のタッチにする」。これは五枚の参照画像(人、自転車、服、シーン、タッチ)を組み合わせた実際の出力。出典:Meta AI Blog。
7 人間評価ランキング

人間の評価者は何点をつけたか

このランキングは Arena によるもの。多数の実際の人が「この画像・この動画はどちらが良いか」を二つずつ比べて投票し、ランキングのスコア(Elo)を算出する。スコアが高いほど多くの人がその結果を支持しているということで、アルゴリズムは対戦ゲームのランク帯に近い。2026年7月5日時点で、Muse シリーズの位置はこうだ:

カテゴリモデルArena 順位
テキストから画像Muse Image第2位
単一画像編集Muse Image第2位
複数画像編集Muse Image第2位
テキストから動画Muse Video第3位
Text-to-Image Arena 完全ランキングのトップ10
Single-Image Edit Arena 完全ランキングのトップ10
Multi-Image Edit Arena 完全ランキングのトップ10
Text-to-Video Arena 完全ランキングのトップ10

Meta 公式が示した完全ランキング(トップ10):画像三項目の一位はいずれも OpenAI の GPT Image 2(1280〜1466点)、Muse Image がそれに続いて二位。動画部門の一位は Google の Gemini Omni Flash(1527点)、二位は ByteDance の Seedance 2.0、Muse Video は三位(1459点)。スコアが高いほど人間評価者に支持されている。出典:Arena AI Leaderboard、2026年7月5日時点。

Muse Video は今のところプレビュー版。Meta は、プロンプトへの忠実さ・画面の忠実度・時間的な一貫性で競争力があるとし、まだ補っている二つの弱点も名指しした:音と映像の同期、速い動きの物理的な正確さ。

Muse Video の公式デモの一つ:パンダが草の斜面をでんぐり返しながら転がり落ちる。出典:Meta AI Blog。
8 実装と来歴の証明

今は誰が使えるか、そして画像が AI 製だとどう証明するか

Muse Image は本日すでに Meta AI App、meta.ai、米国の Instagram Stories、一部の国の WhatsApp で利用可能、Facebook もまもなく対応。Muse Video はまもなくクリエイターに公開され、Meta AI にも入り、ネイティブで音声生成に対応する。

画像が AI 製かどうかをどう調べるか:Content Seal

画像が AI 生成かどうかを判断できるよう、Muse Image には Content Seal という不可視の透かしシステムが組み込まれている。Meta AI App や meta.ai で Muse Image が生成した画像には、いずれも目に見えない来歴の印がつき、トリミング・圧縮・拡大縮小・スクリーンショットの後でも、この印は残る。Meta は、画像に Content Seal がついているか調べられる検出ツールもプレビューした。動画版の透かしもまもなく追随する予定だ。

不可視の印がついた画像は、いじられた後でも検出できる
元画像 トリミング 圧縮 拡大縮小 スクショ =目に見えない来歴の印(Content Seal)
トリミング・圧縮・拡大縮小・スクショの後も不可視の印は残り、検出ツールはこの画像が Meta AI 製かを調べられる。

Meta 自社製品に組み込まれると、何ができるか

Muse Image は Meta のソーシャルのエコシステムとつながっており、実装シーンはすでにいくつかある:

小規模店
マーケティング素材を直接生成(事例 @averyandme)、デザイナーやカメラマンを別途探す手間を省く。
Instagram ユーザー
公開アカウントの情報を組み合わせて自分の写真を再想像したり、IG 内で個人向けプリセットを使って画像を生成したり。
小規模店 @averyandme が Muse Image で生成したマーケティング広告素材
小規模店 @averyandme が Muse Image で直接生成したマーケティング広告素材。出典:Meta AI Blog。
Instagram の個人向け生成プリセット:「レトロカメラ」風のプリセットを選び、自撮りをそのままそのタッチの仕上がり画像に変える。出典:Meta AI Blog。
私たちはこの挙動を設計していない。強化学習の訓練の中で自ら現れたものだ。自己修正がより良い画像を生み、より高い報酬を得られる、ただそれだけの理由で。 Meta AI Blog · Introducing Muse Image and Muse Video
出典:Meta AI 公式ブログ『Introducing Muse Image and Muse Video』、2026年7月7日。文中の画像は同ブログより。ベンチマーク・win rate・Elo ランキングはいずれも Meta 内部の評価、またはそれが引用した第三者ランキング(Arena、2026年7月5日時点)。一部の説明図(テスト時計算量の曲線、複数画像合成、看板の文字、Content Seal の来歴)は原文の内容に基づいて作成したイメージ図で、原文の元画像ではない。