プロダクト発表 · 小互解読

美団がLongCat-2.0を発表、1.6兆パラメータモデルを全工程国産チップで訓練、NVIDIA GPU不使用

訓練には5万個超の国産AIチップ、35兆tokenを使用。ベンチマークの大半は美団の自社評価フレームワークによる測定で、重みはまだ実際にダウンロード公開されていない。
30秒で早わかり
  • 美団傘下のLongCatチームは2026年6月30日、LongCat-2.0を発表・オープンソース化した。総パラメータ1.6兆、token当たり活性化パラメータ約480億のMoE大規模モデルである。
  • 訓練と大規模デプロイは全工程、5万個超の国産AI ASICチップで構成されたクラスタ上で行われ、35兆token超をカバーした。NVIDIA GPUは一切使用していない。
  • アーキテクチャはLongCat-Flashをベースに、LongCatスパースアテンション(LSA)と1350億パラメータのN-gram Embeddingを新たに追加し、長文脈処理の高速化と推論時のメモリコスト削減を図っている。
  • 公式の自己測定ベンチマークによれば、SWE-bench Pro、SWE-bench Multilingualといったコード/Agentタスクで Gemini 3.1 Pro と GPT-5.5 を上回るが、Claude Opus 4.7・4.8には及ばない。IFEval、GPQA-diamondなど基礎能力ではトップモデルに後れを取っている。
  • 報道時点でモデルの重みはまだ実際にHuggingFaceに公開されておらず、ベンチマークの大半は美団が自社構築した評価フレームワーク内(in-house)で測定したものであり、第三者による独立した再現検証は今後の課題である。
これはベンダー発信のコンテンツである。技術的な詳細は美団LongCat公式ブログに基づき、ベンチマークの大半は美団自社構築の評価フレームワークによる測定(in-house)で、*印が付いたもののみ外部公開値である。美団は具体的な国産チップメーカー名を明かしておらず、モデルの重みは報道時点でまだ実際にダウンロード可能ではなく、第三者による独立した再現検証は今後の課題である。以下のデータ箇所ではその都度出典区分を明記し、逐一の断り書きは省く。
1何が起きたのか

美団は今回何をやったのか

美団傘下のLongCatチームは2026年6月30日、LongCat-2.0を発表・オープンソース化した。総パラメータ1.6兆、token当たり活性化パラメータ約480億の超大規模MoE(Mixture of Experts)言語モデルである。

最も特徴的なのはパラメータ量ではなく、それがどこで動いているかである。訓練と大規模デプロイの全工程は、5万個超の国産AI ASICチップで構成された「スーパーノード」クラスタ上に構築され、35兆token超をカバーしたが、NVIDIA GPUは一枚も使っていない。
🎯注目すべき理由:米国は2022年からAI半導体の対中輸出規制を実施している。公開報道の範囲では、これは完全に国産ハードウェアで訓練された、競争力のある兆パラメータ級モデルとしては初の事例である。システム最適化後の訓練スループットは素朴な実装比で35%超向上し、事前訓練の全工程でロールバックも回復不能なlossスパイクも発生しなかった。これは「代替ハードウェア上で最先端規模の訓練ができる」ことの直接的な証拠である。
1.6兆
総パラメータ量
5万+
国産AIチップ
35兆+
訓練token数
全工程国産計算クラスタで訓練 · NVIDIA GPU × 0

公式のコメントは「LongCat-2.0はすでに、我々が国産計算クラスタ上で大規模モデルを訓練する能力を備えていることを証明した」というもの。LongCatチームは2023年に発足したばかりで、最初のモデルも昨年末に発表されたばかりである。

2能力デモ

今、何ができるのか

パラメータ数やベンチマークはひとまず置いておこう。公式が示した「コードベース移行」のデモの方が、実際の能力を直感的に把握しやすい。あるプラグイン全体を新しいSDKに移植し、しかもきちんと動く状態にするというものだ。

1一度でコンテキスト全体を読み込む:コードベース全体と移行ドキュメントを同時に読み込む。断片だけを見るのではない。
2既存アーキテクチャを整理:プラグインが現状どう構成され、各部分がどう相互に呼び出し合っているかを把握する。
3新しいSDKへ書き直す:プラグイン全体を新インターフェースに沿って書き直し、既存の全機能を保持する。
4ついでにバグを発見:移行の過程で元のコードに潜んでいた問題を見つけて修正する。
5初回ビルドでコンパイル成功:人間が何度も手直しする必要のあるコードの山を生成するのではなく、一発で仕上がる。

公式はほかにも、コードエンジニアリング、Agentとリサーチ、コンテンツ生成といった複数のデモシナリオを示している。この種のタスクがモデルに求めるのは、超長文の入力を扱えることと、長い処理チェーンの中で一貫性を保つことの両方であり、これはまさにアーキテクチャ上重点的に磨き込まれた2つの方向性に対応している。以下の節で詳しく見ていく。

3ベンチマーク比較

ベンチマークは実際どの水準か

公式はLongCat-2.0と複数のトップクローズドモデルを、統一された評価フレームワークの中で比較している。強みと弱みがそれぞれどこにあるかを把握する方が、単一の数値を見るより有用だ。

LongCat-2.0とトップモデルのベンチマーク比較図
LongCat-2.0とGemini 3.1 Pro / GPT-5.5 / Claude Opusシリーズのベンチマーク比較。出典:LongCat公式ブログ / The Decoder
ベンチマークLongCat-2.0Gemini 3.1 ProGPT-5.5Opus 4.6Opus 4.7Opus 4.8
コード Agent
Terminal-Bench 2.170.870.7*73.8*-71.7*78.9*
SWE-bench Pro59.554.2*58.6*57.3*64.3*69.2*
SWE-bench Multilingual77.376.9*-77.8*80.5*84.8*
汎用Agent
FORTE †73.270.377.873.277.677.2
BrowseComp79.985.9*84.4*84.0*79.3*84.3*
RWSearch78.876.385.381.379.377.3
基礎能力
IFEval90.096.195.092.288.786.0
Writing Bench83.883.784.7-85.385.2
IMO-AnswerBench81.890.079.575.3*81.875.3
GPQA-diamond88.994.3*93.6*91.3*94.2*92.4
出典区分:*付きは外部公開の報告値、それ以外は美団が統一harness内で自己測定(in-house)した値。スコアは0~100に正規化。† FORTEは汎用Agentベンチマークである。
コード / Agent領域:LongCat-2.0は誰に勝り、誰に劣るか(SWE-bench Pro)
Opus 4.869.2
Opus 4.764.3
LongCat-2.059.5
GPT-5.558.6
Gemini 3.1 Pro54.2

読み解きは単純だ。強みはコードとAgentにあり、SWE-bench Pro(59.5)とSWE-bench Multilingual(77.3)ではGemini 3.1 ProとGPT-5.5を上回るが、Claude Opus 4.7・4.8には及ばない。基礎能力には明確な差があり、IFEval(90.0)、IMO-AnswerBench(81.8)、GPQA-diamond(88.9)といった項目ではGeminiとGPT-5.5に引き離されている。全面的に逆転したわけではなく、自らが重点的に磨き込んだ「コード+Agent」という領域で欧米トップモデルに追いつき、部分的に上回っただけで、純粋な知識と数学的推論ではまだ後れを取っている。また主流のagentフレームワークであるClaude Code、OpenClaw、Hermesにも深く適合している。

4問題の背景

長文処理はなぜ詰まるのか

Agentアプリケーションは、コードベース全体、文書全体といった超長文の入力を一気に読み込む必要性がますます高まっている。しかし長文を処理する際、モデルには避けて通れないコストの問題がある。

標準的な方法は、すべての単語を他のすべての単語と1対1で照合すること(アテンション)であり、文が長くなると照合回数は二乗のペースで急増する。スパースアテンションの発想は、全部を照合するのではなく、まず「インデクサー」を使って最も関連性の高いごく一部の単語を選び出し、そこに絞って重点的に計算するというものだ。

たとえて言うなら · スパースアテンションのインデックス

分厚い本の中から答えを探すのに似ている。まず目次を見て関連する章を選び出し、1ページ目から最後まで一字一句読んだりはしない。インデクサーとは、その「目次」に当たるものだ。

DeepSeekのスパースアテンション(DSA)は、きめ細かいスパース化でこの問題を解決しようとしたが、美団の実測によれば、DSA内の「Lightning Indexer(ライトニングインデクサー)」自体が依然としてボトルネックになっていることが分かった。その出力は不連続(ハードウェアに不親切)であり、しかもスコアリングのコストは依然として二乗のオーダーである。言い換えれば、目次を選び出す速度が十分ではなく、目次をめくる作業自体に手間がかかっているということだ。これこそ、次節のコアイノベーションが取り組む対象である。

5コアイノベーション・その一

LongCatはどうやって長文脈処理を高速化したか

LongCatスパースアテンション(LSA)は、あの詰まっていたインデクサーに対して、3つの直交する効率改善を施した。直交するとは、三者が互いに干渉せず、それぞれ個別にオン・オフできるという意味である。

Hero · LSA

核心となる発想は、インデクサーを丸ごと交換することではなく、3つの異なる角度から「目次をめくる」コストをそれぞれ下げることにある。メモリアクセスを整然とさせる、一度のインデックス計算を複数層に使い回す、スコアリングを粗くしてから細かくする——この3つの改造を重ねることで、インデックスのコストが薄まり、長文脈でも高速に動作する。

SI · Streaming-aware Indexing

「ハードウェアに整合した連続アクセス」と「動的なランダム選択」を組み合わせ、断片的なメモリアクセスを予測可能な順次読み出しへと再編成することで、HBMメモリのコアレスアクセスを実現し、実効帯域幅を引き上げる。同じ一群のtokenでも、読み出し方があちこち飛び回る状態から、一直線に読み進める状態に変わる。

改造前 · 断片的なランダムアクセス
改造後 · 順次読み出し
CLI · Cross-Layer Indexing

ある経験則を利用している。隣接する層同士のアテンションの顕著性は非常に安定している(隣接層が選びたがる単語はだいたい同じ)というものだ。そこで一度のインデックス計算を、推論時に連続する複数の層で使い回し、層ごとに毎回計算し直さないようにすることで、インデックスのコストを薄める。これは訓練時のクロスレイヤー蒸留によって実現している。

HI · Hierarchical Indexing

粗いスコアリングから細かいスコアリングへの2段階方式である。まずブロック単位の近似スコアリングで粗い候補抽出を行い、おおよそ関連性のある候補領域を絞り込む。その後、はるかに小さくなった候補の中できめ細かいtoken選択を行う。これにより、インデクサーが実際に処理すべき候補空間が毎回縮小される。LongCat-2.0では、HIは訓練不要でそのまま使用され、選定された超長文脈タスクにのみ適用される。

この仕組みはさらに、3ステップのMTP(マルチtoken予測)モジュールにも拡張され、投機的デコーディング(一度に複数の単語をまとめて予測し、当たれば時間を節約できる)の高速化に使われている。以下は公式が示したLSAの設計概要図である。

LongCatスパースアテンション(LSA)設計概要
LongCatスパースアテンション(LSA)設計概要:ストリーミング認識インデックス/クロスレイヤーインデックス/階層型インデックスという3つの直交する改造。出典:LongCat公式ブログ
6コアイノベーション・その二

パラメータをわずか10%未満増やすだけで、語彙空間を約100倍に拡大

2つ目のイノベーションはN-gram Embeddingと呼ばれる。その発想を一言でまとめると、新たに増やすパラメータをさらに多くのエキスパートに積み増すのではなく、「よく使われる語句の組み合わせ」を専門に記憶するために振り向けるというものだ。

たとえて言うなら · N-gram Embedding

通常のやり方は、モデルに一文字ずつ覚えさせることだ。N-gram Embeddingは、よく出てくる連続した組み合わせをまるごと1枚のカードとして記憶させる。モデルはよくある組み合わせを見た瞬間に認識でき、その都度つづり直す必要がない。英語を覚えるとき、26文字だけでなく、よく使う単語もまるごとカードとして覚えておき、見た瞬間に分かるようにするのと同じである。

LongCat-2.0はLongCat-Flash-Liteからこの設計を引き継ぎ、n-gramのサイズを5に設定して1350億個のN-gram Embeddingパラメータを組み込んだ。N-gram tokenの組み合わせによってembedding空間を約100倍に拡大し、より豊かな局所的文脈を捉えられるようにしている。重要なのは、これらのパラメータをどこに配分すべきかを決める2つのスケーリング原則である。

経路A · エキスパートを積み増し続ける

モデルのスパース度はN-gramを除いてもすでに約97%に達しており、すでに最適な効率点を過ぎている。同じ規模のパラメータをさらにMoEエキスパートに積み増しても、得られる効果はごくわずかである。

効果 ≈ 頭打ち
経路B · N-gram Embeddingに振り向ける

同じ規模のパラメータをよく使う語句の組み合わせの記憶に振り向けると、通常のエキスパートよりはるかに大きな効果が得られる。さらに推論時には、メモリI/Oをエキスパートから移すこともできる。

語彙 ×100

とはいえ多ければ多いほど良いわけでもない。実験では、N-gram Embeddingが総パラメータ予算の50%を超えると、エキスパートを積み増す方式に対する優位性が弱まることが分かった。そのためLongCat-2.0は、これを10%以下に厳格に抑え、十分な安全マージンを確保している。これがもたらす直接的なメリットは、推論時にパラメータをエキスパートからN-gram Embeddingへ移すことで、大バッチデコード時のメモリI/Oを削減し、生成を高速化できる点だ。

N-gram Embeddingアーキテクチャ概要
N-gram Embeddingアーキテクチャ概要:MoEと直交するスパース次元でパラメータを拡張する。出典:LongCat公式ブログ
7エンジニアリングシステム

国産チップの上でこれを安定して動かすことこそ、本当の難関だ

アルゴリズム面のイノベーションに加え、基盤となるエンジニアリングでも大量の適応作業が行われ、それによってこの仕組みがメモリ容量の小さい国産チップの上でも動作し、しかもトラブルを起こさないようになっている。公式も、成熟したNVIDIA GPUエコシステムに比べると、対応するソフトウェアコミュニティはまだそこまで成熟していないと認めている。

最大の制約はメモリ容量だ。彼らのアクセラレータは1枚あたりのメモリ容量がH800(80GB)よりも明らかに小さく、大規模運用においてメモリ容量が最大のボトルネックとなる。これへの対処は2つの方向に分かれる。並列方式をより細かくすることと、通信ドメインを大きくすることだ。

6D並列:N-gram Embedding専用の並列レーンを新設

TPテンソル並列
CPコンテキスト並列
EPエキスパート並列
DPデータ並列
PPパイプライン並列
EMBP新設:N-gram Embeddingを専用に高速化する並列NEW

スーパーノード(Superpod):高帯域通信ドメインを数百デバイス規模に拡張

RoCEネットワーク スーパーノードA・内部全結合の高帯域 スーパーノードB・最大48台のマシン
スーパーノード内部は全結合の高帯域接続で、スーパーノード間はRoCEネットワークを経由する。これにより高帯域通信ドメインを数百デバイス規模まで拡大し、「帯域を大量に消費する」TP/CP/EP並列に供給している。

同規模・同環境下では、このスーパーノードだけで事前訓練スループットに約30%の追加効果をもたらす。さらにメモリ最適化(ZeRO-1、選択的な再計算、OOM感知型オフローディング、パディングtokenを「ゼロエキスパート」にルーティングする手法)と、大規模デプロイ向けのMuonオプティマイザを加えることで、システム全体の最適化は素朴な実装比で35%を超える訓練スループット向上を実現している。

信頼性:毎回同じ結果を計算できるようにし、ハードウェアの誤りも検出する

やさしく言うと · 決定論的オペレータ/bit-flip検出

決定論的オペレータとは、同じ入力であれば毎回まったく同じ結果を計算し、ハードウェアのスケジューリング順序の違いによる微妙な差異が生じないようにするもので、問題の再現がしやすくなる。bit-flip検出は、ハードウェアがあるビットを意図せず反転させてしまう(0が1になる)といった計算誤りを自動的に発見し、速やかに検出する仕組みだ。

詳細を見る:本番運用レベルの信頼性のために施された見えない工夫
  • 決定性の強制:通信経路と計算経路の両方で決定性を強制し、Embedding、FA、LSA、MoE層をカバーする独自の決定論的オペレータ一式を開発し、再現性を保証している。
  • 数値的信頼性:すべてのreduction系オペレータを「二分木による分割累算」方式に変更し、浮動小数点誤差の蓄積を減らしている。実際のLLM負荷の下で高精度ベースラインを用いてアクセラレータの演算精度を検証し、計算集約的な一部のオペレータにはbit-flip検出を組み込んでハードウェアのビット反転を捕捉する。
  • 障害復旧:エンドツーエンドの監視によって障害検知、トラフィック切り替え、自動復旧を駆動し、人手の介入を必要としない。1本の障害リンクを切り離しても訓練には感知できるほどの影響はなく、修復されたリンクは負荷テストに合格して初めて再び組み込まれる。

公式は強調している。事前訓練の全工程でロールバックは一切なく、回復不能なlossスパイクも発生しなかったと。彼らはこれを「代替ハードウェアプラットフォーム上で最先端規模の訓練ができる」ことの直接的な証拠と位置づけている。

8デプロイとポストトレーニング

訓練から実際に使えるようになるまでには、もう一関門ある

1.6兆パラメータで、しかも100万トークンの文脈長でサービス提供しなければならない。訓練が完了しただけでは不十分で、実際に使えるプロダクトとしてデプロイでき、なおかつ複数の能力を同時に備えている必要がある。

ネイティブ100万トークン長文脈訓練

長距離タスクを強化するため、訓練にLSAを導入し、数千億token規模の100万トークン文脈データで訓練を行った。拡張方式にはall-gatherベースのCP並列を採用し、CPを512以上まで拡張することでネイティブな100万トークン長の訓練を実現している。データはget-batchの段階で再シャッフルされ、バランス型のCP戦略でシャーディングすることで負荷分散を保っている。

推論サービス:質問を読む工程と答えを出力する工程を分けて最適化

やさしく言うと · PD分離デプロイ(Prefill-Decode分離)

「あなたの質問を理解する」(prefill)と「一文字ずつ答えを吐き出す」(decode)という2つの段階を、別々のマシンに分けてそれぞれ最適化する。この2つのステップが必要とするハードウェアリソースの種類が異なるためだ。

Prefillノード · TTFT(最初の1文字までの遅延)を最適化
マルチノードのチャンク分割パイプライン並列(CPP)でEPドメインを縮小し、アテンションシーケンス並列(SP)を組み合わせることで、「質問を読む」工程で最初の1文字をより早く出力できるようにする。
Decodeノード · TPOT(1文字ごとの遅延)を最適化
KVPを使ってKV-cacheをデバイス間でシャーディングし、大きなEP度(EP128)を組み合わせることで、1枚あたりの重みメモリとエキスパートI/Oを削減し、「答えを出力する」工程が安定して持続するようにする。

ポストトレーニング:3組の「教師」から学び、1つのモデルへ融合する

Agentエキスパート

複雑な実環境下でのタスクの自律実行:正確なツール呼び出し、複数ターンにわたるAPIとのやり取りにおける信頼性の高いパラメータ解析、無限ループや重複呼び出しを抑える自己修正。

推論エキスパート

論理推論の深さを拡張し、問題の難易度に応じて計算リソースを適応的に配分することで、数学やSTEMの問題解決、マルチホップ推論での強さを高める。

対話エキスパート

人間へのアラインメントに専念する:きめ細かい指示追従、事実に関する幻覚の抑制、有用性を犠牲にすることなく境界を持った安全機構を構築する。

3組のエキスパートの最強の能力を、MOPDアーキテクチャによって最終モデルへ融合する
→ MOPD融合 → 強力なagent実行力/深い推論/高品質な対話を同時に備える
MOPDマルチエキスパートポストトレーニングアーキテクチャ概要
MOPDマルチエキスパートポストトレーニングアーキテクチャ概要。出典:LongCat公式ブログ
詳細を見る:推論側でさらに詰めた細部
  • モデル層:アテンションにabsorb計算方式を採用。indexerとMLA prologを並行ストリーム上でパイプライン化してインデックスのオーバーヘッドを隠蔽する。KV-cache並列(KVP)でKV-cacheをデバイス間にシャーディングする。ScMoEによってdenseブランチとMoEブランチを完全並列で実行する。
  • アクセラレータ層:Super Kernelによってカーネル内の起動オーバーヘッドをさらに削減する。Weight Prefetchは大きめのL2キャッシュを活用して重みを事前取得し、I/O遅延を直前のオペレータの計算の中に隠す。
  • 負荷分散:エキスパート並列負荷分散(EPLB)は、統計収集と配置計算をフォワードのクリティカルパスの外に置き、非同期で行う。
9持ち帰るべきこと

この数字を覚えておこう

本稿全体の規模に関する数字をここに集約した。これらはLongCat-2.0の「何が特別なのか」を理解するための足がかりとなる。

1.6兆
総パラメータ量
480億
token当たり活性化パラメータ
5万+
国産AI ASICチップ
35兆+
訓練データtoken数
35%+
訓練スループット向上(素朴実装比)
30%
スーパーノードによる追加スループット効果
1350億
N-gram Embeddingパラメータ
100倍
実質的な語彙空間の拡大
100万token
ネイティブ長文脈長

最後にもう一つ、はっきり覚えておくべきことがある。公式は「導入・オープンソース化した」とLongCat-2.0を称し、ブログにはGitHub(github.com/meituan-longcat/LongCat-2.0)、HuggingFace、オンライン試用(longcat.chat)、APIドキュメントへのリンクを掲載している。しかし報道時点では、重みはまだ実際にダウンロードできる状態ではなく、第三者が独立してベンチマークを再現できるかどうかは今後の課題である。上記のスコアの大半は美団が自社構築した評価フレームワーク内での自己測定値であり、横並び比較の際には余地を残しておくべきだ。

LongCat-2.0はすでに、我々が国産計算クラスタ上で大規模モデルを訓練する能力を備えていることを証明した。 LongCat公式技術ブログ
出典:LongCat公式技術ブログ(longcat.chat/blog/longcat-2.0/)およびThe Decoderの報道。技術的詳細は公式ブログに準拠し、地政学的・業界的な意義や外部検証の視点はThe Decoderによる。ベンチマークは*印の外部公開値を除き、すべて美団が統一評価フレームワーク内で自己測定(in-house)したものである。本稿は公開情報の解読であり、評価としての結論を構成するものではない。