研究解読 · 小互解読

Liquid AI が Antidoom を発表——推論モデルの「無限ループ」問題を、トークン1個の修正だけで解決、すでにオープンソース化

無限ループの起点となるトークン1個だけを微調整するだけで、2つのモデルのループ発生率がどちらも約1%まで下がった。
速覧
  • Liquid AI は2026年7月7日、Final Token Preference Optimization(FTPO)という手法でAI推論モデルの「無限ループ」を専門的に修復するAntidoomを発表した。無限ループとは、モデルが同じ一文(例えば「Wait, let me reconsider...」)を延々と繰り返し出力し、コンテキストウィンドウを使い切ってしまう現象を指す。
  • LFM2.5-2.6Bの初期チェックポイントでは、難易度の高い数学・コード問題でのループ発生率が10.2%から1.4%に低下。Qwen3.5-4Bではgreedyサンプリング下で22.9%から1%に低下した。
  • この手法は「ループを引き起こしたそのトークン1個」だけをピンポイントで再学習し、モデルがその位置で首尾一貫した別の候補語を選びやすくする。それ以外の出力分布にはほぼ影響を与えない。
  • 無限ループは3つのメカニズムが重なって生じる——過剰に学習された高頻度語(the、So、Wait など)がモデルの迷いどきに保険的な選択肢として選ばれる、上文の繰り返しがループ確率をどんどん1に近づける、低温度のgreedyサンプリングにはループから抜け出す出口がない、の3つだ。
  • 学習・検出・生成のコード一式はGitHubで公開されている(Liquid4All/antidoom)。READMEには完全なハイパーパラメータ選定ガイドが付属し、NVIDIA/CUDAとAMD Instinct MIシリーズ(ROCm)の両方をサポートする。
立場の明示:本稿が解説するのはLiquid AI公式のブログとオープンソースプロジェクトです。文中のループ発生率や評価スコアの向上などの数字はすべてベンダー自身による評価であり、現時点で第三者による独立した再現は行われていません。
1無限ループとは何か

AIも壊れたレコードのように詰まることがある

Liquid AIは2026年7月7日、AI推論モデルの「無限ループ」を専門的に修復するAntidoomを発表し、GitHubでコードを全面公開した。

無限ループ(doom loop)は推論モデルによくある失敗の1つだ。モデルはまず短い一文、例えば「Wait, let me reconsider...」を吐き出し、そのあとこの一文を延々と繰り返し、コンテキストウィンドウを埋め尽くすまで続ける。しかし答えは最後まで出てこない。小規模な推論モデルほど、長い思考連鎖と難しい問題でこの症状に陥りやすい。

reasoning trace · 難問を推論中

この問題の2ステップ目の導出をもう一度確認してみよう。

Wait, let me reconsider...

Wait, let me reconsider...

Wait, let me reconsider...

Wait, let me reconsider...

Wait, let me recons

(コンテキストウィンドウが埋め尽くされ、答えは最後まで出てこなかった)

数学の問題や1段のコードで詰まると、モデルはこうして同じ一文を繰り返し唱え続け、貴重なコンテキストがすべてその場での空回りに消費されてしまう。Antidoomが修復するのはまさにこの欠陥だ。
📊公式データ:LFM2.5-2.6Bの初期チェックポイントは難問でのループ発生率が10.2%から1.4%に低下。Qwen3.5-4Bはgreedyサンプリング下で22.9%から1%に低下。Liquid AIによれば、この手法はループ発生率を最大9割削減できるという。
2既存の対策

従来のやり方が根本解決にならない理由

Antidoom以前、無限ループへの対処法は主に2つの方向があり、それぞれに弱点があった。

1つ目はrepetition_penaltyを推論時に加える方法で、すでに出現した語の確率を一時的に下げるやり方だ。これは絆創膏のようなもので、再学習は不要だが、抑え方が無差別なため、正常な出力の質まで一緒に引き下げてしまう可能性がある。2つ目は強化学習(RL)で、ピンポイントでループに対処できるが、報酬設計を丹念に作り込み、高コストなオンラインrolloutサンプリングを回す必要がある。

手法やり方コスト副作用
repetition_penalty推論時に重複語の重みを一時的に下げる低い、学習不要正常な出力の質を損なう可能性
強化学習(RL)報酬信号でモデルを再学習高い、報酬設計とオンラインサンプリングが必要報酬設計を誤ると方向がずれる
Antidoomループの起点となるトークン1個だけを学習低い、LoRA+単一GPUで数時間それ以外の出力にはほぼ影響なし
3コアの発想

トークン1個だけ変える、他は一切いじらない

Antidoomは修復範囲を極限まで絞り込んだ。

まず無限ループが始まったそのトークンを特定し、そこだけモデルがより首尾一貫した別の候補語を選ぶよう学習させる。語彙表のそれ以外の部分の確率分布はほぼ元のままだ。モデル全体の出力の癖は変えず、ループを引き起こす接合点だけに精密なパッチを当てる。