MiniMax、H3を公開・OSS化——1モデルで4モダリティー処理、音付き2K動画を生成
4モダリティーの素材を一文で指示し、2Kを主要モデルの数分の一の料金で生成。ただし「オープンソース」の範囲には要注意だ。
- 画像数枚、動画数本、音声1本を渡し、参照関係を一文で伝えるだけで動画が完成します。音声はネイティブステレオ。MiniMaxは動画生成を「素材への指示」に変え、ウェイトもHuggingFaceで公開しました。
- 標準出力は2Kで、料金は競合の1080pモデルの数分の一です。ただし今回の発表で最も誤解しやすいのは、システムのどの部分まで「オープンソース」なのかという点です。
- 中国企業が公開したモデルでありながら、利用対象外なのはEU、英国、韓国、米国です。中国本土ではダウンロードして利用できます。その理由はライセンスに明記されています。
画像・動画・音声を一文で指定、参照関係も自動解釈
MiniMaxが次世代動画生成モデルH3を発表し、ウェイトを公開した。テキスト、画像、動画、音声を同一コンテキストとして理解するフルモーダルモデルだ。ネイティブステレオ付き2K動画を直接生成でき、最長15秒、API料金は主要モデルの3分の1未満。
従来のAI動画制作は、用途ごとに専用ツールが必要だった。テキストから動画、画像から動画、カメラワーク制御と別々のモデルを使ってきた。H3はこれらを1モデルに統合。「何のどの部分を参照するか」を一文で指定すれば、素材間の関係を自動で解釈する。
公式の代表例では、次のようなプロンプトが使われています。
「動画1のヒッチコック風カメラワークを参照し、画像2のキャラクターに歌わせ、その声を音声3に同期させる。」
MiniMax公式発表の例
以下がモデルに渡した3つの素材と、生成された結果です。
1回で入力できる参考素材は、画像最大9枚、動画最大3本、音声最大3本。音声単独では入力できず、画像か動画との併用が必要。合計12ファイル以内だ。
2K、ステレオ、広告・EC・タイトル・ポスター—公式生成サンプル一覧
公式生成サンプルは2種類に分かれます。1つは基礎性能を示すもの(2K画質、ネイティブステレオ)、もう1つは用途を示すもの(タイトル、製品ページ、ポスター、広告)です。ステレオの生成サンプルはヘッドホンでの視聴をおすすめします。映像と音声を同じモデルが同時生成するため、後から音声を付ける必要はありません。
2Kが他社1080pの半額以下
公式料金は、2Kが1秒0.13ドル、768pが1秒0.08ドル。発表記事では「2K単価は主要モデルの3分の1未満」と説明している。第三者がまとめた競合料金と比較すると、以下のようになる。
競合の1080pを上回る2K解像度を、半額未満で提供する。この低価格と汎用性は、同じ設計判断に由来している。
1タスク1モデルの壁をH3が解体する
まず従来の構造を確認しよう。画像生成は用途ごとに専門モデルが必要で、テキストからの生成、編集、被写体参照、スタイル参照が別々に存在した。音声も、声・効果音・音楽と研究分野が分かれている。動画はさらに細分化され、テキストからの生成、画像からの生成、開始・終了フレーム制御、被写体参照、モーション参照、編集がそれぞれ独立していた。ユーザーは素材を移しながら複数ツールを接続する必要があり、モデル側も限られたドメインのデータしか学習していないため、タスクの境界が汎化の限界になっていた。
H3の第一原則は、この壁を取り払うことだ。事前学習の初日から、テキストからの画像・動画・音声生成を混合して学習する。動画は最初から音声付きで生成し、声・効果音・音楽も分離しない。「参照」や「編集」も固定タスクリストではなく、自然言語で表現する関係として扱う。学習素材はすべて実在の自然データを使用し、データ量に応じて性能が伸びる。言語がタスク汎化の架け橋になった。
タスク汎化を支える4技術
①素材の「関係」まで記述
生成モデルは「素材+説明」のペアから能力を学習する。H3は説明を関係レベルまで詳細化した。対象動画だけでなく、参照素材同士の関係、参照素材と対象の関係、複数ショットでの映像と音声の対応も記述する。公式名称はContextual Omni Representation。専用の理解パイプラインを構築し、学習素材1件につき平均約10万tokenの推論を行い、約4千tokenの精密な説明へ蒸留する。これは長編小説1冊分のテキスト量に相当し、H3が多様な指示を理解する土台になっている。
②H3-VAE——動画圧縮器を刷新
VAEは動画版zipだ。動画をモデルが処理できる「圧縮ファイル」へ変換し、生成後に映像へ戻す。圧縮率が高いほどモデルが扱うシーケンスは短くなり、コストも下がる。H3はこのzipアルゴリズムを全面的に書き直した。
新しい圧縮器は空間方向を16倍、時間方向を4倍に圧縮します。モデルへブロック単位で入力すると、空間方向の実効圧縮率は32倍です。実効シーケンス長は4分の1になり、学習・推論コストが大幅に低下しました。2Kを現実的なコストで処理できる鍵がここにあります。音声側では、左右のチャンネルを同じ圧縮器で個別に処理してから統合します。そのためステレオをネイティブに生成でき、サンプリングレートは32kHzです。
③ 生成本体:330億パラメータ、モダリティーを分けない単一ネットワーク
生成本体は330億パラメータの密なシングルストリームTransformerです。アテンション層とフィードフォワード層では、モダリティーをまったく区別しません。違いを残すのは入出力層とAdaLN分岐だけです。AdaLNは各層に「いま何の種類のコンテンツを生成しているか」という制御信号を送るバイパスパラメータです。33Bのうち約13BがAdaLN分岐にあり、この部分は事前計算してキャッシュできるため、推論時にロードする必要がありません。
モデルカードには、ほかにも2つの設計判断が記されています。1つ目は、テキスト・視覚エンコーダーにAlibabaがオープンソース化したQwen3-VL-32Bの完全な事前学習済みウェイトをそのまま使用し、第50層の隠れ状態を生成本体へ入力している点です。中国製オープンソースモデルを部品として相互利用しています。2つ目は、Hailuo 02で築いたアーキテクチャ上の利点を全面的に捨てたことです。タスク汎化を中心に設計するモデルには、その構造が不要な複雑さだったためです。「アーキテクチャの技巧は、モデルの定義を優先すべきだ」という判断です。学習では「理解」と「生成」という性質の異なる計算負荷を分離してスケジューリングし、エンドツーエンドの学習スループットを約30%向上させました。長いシーケンス向けのスパースアテンションはネイティブ学習されていますが、初回公開ではフルアテンション推論だけを提供しています。スパース実装は後日、別途公開するとしています。
④ 元素材を使って2Kへ再生成
従来は、専用の超解像モジュールで768p映像を拡大していました。つぶれた小さな文字や細かい質感は、モジュールが推測するしかありません。H3の2K化は別の方法です。元の参考素材を保持したまま、ベースモデルが768pの初稿全体をもう一度生成します。元のコンテキストが残っているため、小さな文字や細部を実際の情報から復元できます。これもタスク汎化の一例です。拡大もまた「生成」の一種として扱います。
3段パイプラインの中段のみ公開—前処理と2Kは公式APIが必要
完全なH3システムは3段のパイプラインです。今回ウェイトが公開されたのは、中間部分だけです。
各段を整理します。前段のContext-IRは、順序の定まらない入力—画像数枚、動画数本、指示文1つ—を構造化された説明へ変換し、生成モデルへ渡します。モデルカードには「最終出力の品質に極めて重要」と記されています。この部分はオープンソースではありません。多段階ワークフローと複数のホスト型モデルに依存するため、APIのみ提供しています。一方で、コミュニティーがこの層を自作できるよう、2種類のプロンプト作成ガイドも用意されています。中段のH3-Baseは実際に公開された部分です。FL2VAはテキストからの動画生成と開始・終了フレーム、Ref2VAはフルモーダル参照を担当します。いずれもCFG蒸留版、BF16精度で、出力は768pです。後段のRegenerate-2Kは「システムが複雑なため、準備が整い次第公開」とされ、現時点ではAPIのみです。
両端のAPI料金も公開されています。前処理のContext-IRはtoken課金で、入力100万token当たり0.9ドル、出力は3.6ドルです。768pから2Kへの再生成は出力時間に応じ、1秒0.05ドル。元素材の入力料金も別途発生します。つまり、ローカルで768pまで生成するならAPI費用はゼロです。公式と同等の2Kを得るには、1分当たり追加で約3ドルかかります。
デプロイ環境は公開初日から充実しています。SGLang、vLLM、diffusers、ComfyUIが同日対応し、公式生成サンプルコマンドでは4枚のGPUを使用します。必要なVRAM容量は公式に示されていません。ComfyUIもウェイト公開と同日にネイティブ対応し、H3の機能を5種類に分類しています。テキストからの動画生成、画像からの動画生成、開始・終了フレーム制御、参照動画生成、インプレース編集です。インプレース編集は既存ショットを直接変更し、全体の再生成を省けます。ワークフローテンプレートとチュートリアルは直接ダウンロードできます。
世界で利用可能、ただしEU・英国・韓国・米国を除外
ウェイトをダウンロードできても、どこでも利用できるとは限りません。ただし対象地域は、多くの人が最初に想像するものと逆です。H3は独自のコミュニティーライセンス(MiniMax H3 Community License)を採用しています。適用地域は「以下の地域を除く全世界」とされ、EU、英国、韓国、米国が除外されています。つまり中国本土は適用地域に含まれ、ダウンロードして利用できます。除外された4地域でウェイトを使うには申請書を提出し、MiniMaxがデプロイ用途とコンプライアンス対策を審査したうえで個別許諾を受ける必要があります。
- 中国本土を含む
- ダウンロード後すぐ利用、ファインチューニング、再配布が可能
- ライセンスと許容利用ポリシーの順守が必要
- EU / 英国 / 韓国 / 米国
- 公式申請書を提出し、用途とコンプライアンス対策の審査を受ける
- 承認後に個別ライセンスを取得
除外リストの考え方は明快です。規制が厳しい地域には、当面ウェイトを提供しないというものです。EUではAI法の執行が始まり、英国と韓国にも同様の不確実性があります。米国にはさらに別の事情があります。ライセンスQ&Aでは、自社が抱える訴訟に直接言及しています。
「米国ではAI規制が今も急速に変化しており、MiniMax自身も生成動画AIを対象とする著作権関連の訴訟に巻き込まれています。」
MiniMax H3ライセンスQ&A(当サイト訳)
Q&Aの最後には、現行の範囲は現在の規制環境を反映したものであり、「まだ提供できないのであって、永久に提供しないわけではない」と記されています。今後の変更は明示し、予告なしに更新しないと約束しています。
技術レポートは未公開—評価は保留
今後予定されているのは3点です。完全版の技術レポート(現時点では「soon」とだけ表示)、次世代Hシリーズへの自社Mシリーズ言語モデルの統合、モデル規模と視覚的忠実度の向上です。公式記事の末尾では課題も挙げています。マルチモーダル理解にはまだ大きな改善余地があり、一部の場面では視覚的な細部も改善が必要だとしています。自社評価に一定の留保を付けた形です。
技術レポートと第三者評価が出るまでは、「そのまま商用利用できる生成品質」「優れた指示追従」といった定性的な評価や、料金比較で名指しされていない「主要モデル」は、いずれもメーカー側の主張にとどまります。生成サンプルは上に掲載しているので、自分で確認できます。
画像・動画・音声を一文で指示—MiniMax H3が音付き2K動画を直接生成
MiniMaxがH3を発表し、ウェイトをHuggingFaceで公開しました。使い方、料金、オープンソースの範囲を図入りの1ページで解説します。
↓ 1ページで読了 · 動く図付き
MiniMaxは7月31日、次世代動画生成モデルH3を発表しました。文字、画像、動画、音声という4種類の素材を同じコンテキストとして読み、ネイティブステレオ付きの2K動画を直接生成します。最長15秒です。MiniMaxはHailuo(海螺)動画を手がける中国企業です。
従来のAI動画制作では、複数の専用モデル間で素材を移す必要がありました。テキストから動画を作るモデル、画像から動画を作るモデル、カメラワークを制御するモデルが別々だったためです。H3は事前学習の初日から、これらのタスクを混在させて学習しました。「何の、どの部分を参照するか」を自然言語で指定できるため、一文で意図を理解します。
モーション参照モデル → 書き出し
音声ツール → 合成
画像2のキャラクターに歌わせ、
声を音声3に合わせる
1回に入力できる参考素材は、画像が最大9枚、動画が最大3本、音声が最大3本です。音声は画像または動画との併用が必要で、合計12ファイル以内です。映像と音声を同じモデルが同時生成するため、後から音声を付ける必要はありません。
出力仕様と料金は明確に公開されています。
2Kを現実的なコストで処理できる理由の半分は、圧縮器にあります。H3は、動画をモデルが計算できる「圧縮ファイル」に変える部品を全面刷新しました。空間方向を元の1/32まで圧縮し、計算量を大きく削減しています。残りの半分は、拡大方法の変更です。
完全なH3システムは3段のパイプラインです。今回ウェイトが公開されたのは、中間部分だけです。
ローカルで768pまで生成するならAPI費用はゼロです。MiniMaxと同等の2Kには、前処理の文字量課金に加え、再生成で1秒0.05ドルがかかります。完成動画1分当たりの追加費用は約3ドルです。デプロイ環境は公開初日からそろい、ComfyUI、vLLM、SGLang、diffusersが同日対応しました。生成サンプルコマンドでは4枚のGPUを使います。
ウェイトをダウンロードできても、どこでも利用できるとは限りません。ただし対象地域は、多くの人が最初に想像するものと逆です。H3の独自コミュニティーライセンスは、適用地域を「以下を除く全世界」と定めています。
ダウンロード後すぐ利用
ファインチューニング・再配布可能
許容利用ポリシーの順守が必要
公式申請書を提出
用途とコンプライアンス対策を審査
承認後に個別許諾
ライセンスQ&Aの説明は、規制の厳しい地域には当面ウェイトを提供しないというものです。EUではAI法の執行が始まり、英国と韓国にも同様の不確実性があります。米国にはさらに事情があり、MiniMaxが生成動画AIを対象とする著作権訴訟に巻き込まれていることをQ&Aで明記しています。表現は「まだ提供できないのであって、永久に提供しないわけではない」です。
音声はまた別のツール。
- × テキスト→動画 → 書き出し
- × モーション参照 → 書き出し
- × 音声合成 → また書き出し
入力したのは一文だけ。
$20.16 / 分
$22.45 / 分
2K部分も非公開。
公式2KはAPI経由。
DLして使える。
除外4地域も含む。
ただし公開は3段の中段だけ。
