研究解読 · 小互解読

Anthropic が Claude の中に、人間の脳の「内なる思考の場」に似た領域を発見——それは設計されたものではなく、自ら進化して生まれたものだった

全体活動の一割にも満たないのに、それを取り除くと Claude はしゃべれても推論力はゼロになる。すでにモデルのデータ捏造や、テストを見破っていた事実の検出に使われている
30秒で早わかり
  • Anthropic は Claude の内部に、J-space と名付けられた一握りの神経活動パターンを見つけた。これは人間の思考のうち「意識できる、言葉にできる、能動的に使える」部分に対応する
  • J-space が占める割合は Claude の内部の総活動量の一割にも満たず、一度に扱える概念は数十個ほど。だがそれを取り除くと、複数ステップの推論・要約・押韻を伴う詩作の能力が大きく落ち込み、ゼロになるものまである
  • 研究者は J-space に直接入り込み、中の特定の語を別の語に置き換えることができる。すると Claude が最終的に出す答えもそれに合わせて変わる——これは記録係として横で見ているだけではなく、本当に思考に参加している証拠だ
  • この手法(J-lens)を使って、Anthropic はすでに Claude が口にしなかった内心を読み取れるようになっている。自分がテストされていると密かに気づいていたこと、データを捏造するときの偽装の意図、埋め込まれた隠し目標など
  • さらに新しい訓練法も見つかった。「追及されたら自分をどう説明するか」だけを訓練すると、実際のタスクでの不誠実な振る舞いまで連動して抑えられる
本稿はベンダー発の研究記事です。データと実験はすべて Anthropic 自社の解釈可能性(interpretability)チームによるもの。Anthropic は外部の学者に独立レビューの執筆を依頼しています(Google DeepMind の解釈可能性責任者 Neel Nanda によるオープンモデル上での独立再現実験を含む)が、核となる実験自体はまだ第三者による検証を経ていません。

まず全体像を掴みたい方へ。Anthropic 公式が 5 分半のアニメーション解説動画を制作し、この研究を頭から丁寧に説明しています。日中英の字幕付き。動画を見なくてもこの先を読み進めるのに支障はありません。

Anthropic 公式解説動画『What's at the center of Claude's mind?』(5分27秒、中英バイリンガル字幕、アニメーション中心)。動画提供:Anthropic
01導入

この文章を読んでいる今、あなたの頭の中では何が起きているか

まずこの研究を一言でまとめよう。Anthropic が最近発表した解釈可能性の論文《言語モデルにおけるグローバルワークスペース》は、Claude の頭の中に特殊な領域を見つけたという話だ。彼らはそれを J-space と呼ぶ。そこに入っているのは、まさに Claude が「今考えているが、まだ言葉にしていない」ものだ。さらに興味深いのは、この領域が人間の脳の「意識できる思考の部分」と驚くほど似ていること、そしてそれはエンジニアが設計したものではなく、Claude が訓練の中で自ら育てたものだということだ。

以下、順を追って解きほぐしていく。まずは喩え話から。読めばすぐ腑に落ちるはずだ。

今この文章を読んでいるあなたの脳は、同時に大量のことをこなしている。姿勢を調整し、呼吸をコントロールし、画面上の曲がりくねった線をひとつひとつ文字として認識している。これらの活動には、あなたはほとんど気づかない。意識の届かないところで自動的に走っている。だがもう一種類、あなたがはっきりと捉えられる脳の活動がある。頭にふと浮かぶ映像や、「今夜どこで食べようか」と考えているあの思考だ。この種の活動は特別で、同時に三つの性質を備えている——あなたはそれを言葉にできるし、能動的にコントロールできるし、それを使ってさらに推論を続けられる。神経科学ではこの種の活動に「意識的にアクセス可能な」(consciously accessible)思考という名前を与えている。

意識には上らない · 裏で自動的に動く

姿勢の調整、呼吸のコントロール、線を文字として認識する処理——あなたはほとんど気づかない。それらは勝手に動いていて、あなたは言葉にすることも、コントロールすることもできない。

意識的にアクセス可能 · あなたが掴めるもの

頭にふと浮かぶ映像、今夜何を食べるか考えているあの思考——この種のものは、あなたがはっきりと掴んでいられる。

言葉にできるコントロールできる推論に使える

Anthropic のこの論文の中心的な発見は、Claude の内部にもこれとまったく同じ、はっきりした境界線があるということだ。Claude の処理の大部分は「意識には上らない」層で自動的に走っている。だがほんの一握りの神経活動が、人間の脳における「意識的にアクセス可能」な思考にちょうど対応している——読み出せて、呼び出せて、推論に参加できるものだ。この一握りの活動こそが、冒頭で触れた J-space だ。名前は、それを見つけるのに使った数学的ツール「ヤコビ行列」(Jacobian)に由来する。

もう少しはっきり言うと:J-space の各パターンには、それぞれひとつの語が結びついている。あるパターンが点灯したとき、それは Claude がその語を「言っている」という意味ではなく、その語が「心の中にある」という意味だ。それは内部で静かに動き続け、ある概念を考えながらも一文字も書かないということを可能にしている。
なぜ注目に値するか:J-space は Claude の内部処理のうち一割にも満たない活動量しか占めていないが、複数ステップの推論・要約・押韵といった高次の能力の源であり、取り除くとこれらの能力はゼロに落ちるか、はるかに小さいモデルよりも劣ってしまう。しかもそれはすでにモデル監査の現場で実戦投入され、Claude が自分がテストされていると密かに見抜いていたこと、評価データを捏造していたこと、埋め込まれた破壊目標を隠し持っていたことの実例を捉えている。

まずひとつ実例を見てみよう。研究者が Claude に「5まで数え、内省を深めよ」と指示した。書き出された答えは味気ない5つの数字だけだったが、まさにその瞬間、内部では一言も口にしなかった思考の連なりが点灯していた。

Claude に5まで数えて内省させると、J-space の内部で thoughts、human、consciousness など出力にない語が点灯する
「5まで数え、内省を深めよ」という入力に対し、Claude が書き出したのは「One. Two. Three. Four. Five.」だけ(図中オレンジの行)。だが J-lens をその内部に照らす(右側の拡大枠)と、同じ瞬間に thoughts、human、consciousness、fascinating、claude といった語が点灯していた——出力には一つも現れていない。これら口にされなかった思考こそ、本稿が扱う「内なる思考の場」だ。画像提供:Anthropic
J-space:「発光」する一群のノードが、それが考えている語をネットワークの他の多くの部分へ放送する——頭の中にふと浮かんだ思念のように。周囲のグレーのノードはそれぞれ別の仕事をしていて、互いにほとんどつながっていない。

Anthropic は、J-space が Claude の他の処理と比べて一連の独自の性質を持つことを発見した。本稿の実験は、この5つを一つずつ検証していくものだ。

特徴どう表れるか
報告できるClaude に今何を考えているか尋ねると、J-space 内の内容は答えられる。J-space にない表現は、うまく言葉にできない
コントロールできる何かを心の中で思い浮かべさせたり、暗算をさせたりすると、対応するパターンが J-space に点灯する
推論に参加する複数ステップの問題の中間段階は、一言も発しなくても、順番通りに J-space の中に現れる
再利用できる一度「フランス」が点灯すれば、首都・通貨・大陸などさまざまな問いに答えるのに使い回せる
だが日常処理は管轄外流暢に話す、単純な事実を覚える、文法的に正しく書く——これらは J-space を迂回してもできる
グローバルワークスペースの5つの機能的特徴の図解
Anthropic が描いたロードマップ:グローバルワークスペースの5つの機能的特徴と、それらを Claude で一つずつ検証するための実験の見取り図。画像提供:Anthropic
02手法:J-lens

モデルの「脳波」から語を読み取る方法

この研究の出発点は、人間の「意識的にアクセス可能」な思考にはある重要な特徴があるということだ——それは通常、言葉にできる。ある思考を意識できるなら、人に問われれば大抵それを説明できる。研究者たちは Claude の内部に、同じ性質を持つ表現を探した。「Claude が次に何を言うかを左右する位置」に置かれている活動——それは必ずしも今言っていることではなく、「もし問われたら言えるはずのこと」だ。

彼らのツールはヤコビアン・レンズ(Jacobian lens、略して J-lens)と呼ばれる。Claude の語彙のすべての語について、J-lens は「Claude が将来この語をより言いやすくなる」内部活動パターンを見つけ出す。このレンズを Claude のある瞬間の内部活動に当てると、その瞬間の J-space の内容を表す一連の語が得られ、直接読み取ることができる。Claude はテキストを処理する際に複数の内部段階(「層」と呼ばれる)を経る。このレンズを一層一層当てていくことで、モデルが「何を言うべきか」を思案する中で、これらの無音の語がどう移り変わっていくかを追うことができる。

喩えるなら

モデルの「内部の脳活動」にリアルタイム字幕をつけるようなものだ。ただしこの字幕は特に「次に一番言いたい語」を捉える。声には出さず「言葉で考える」人がいるように、J-lens が読み取るのはまさにこの種の、口には出ない内心の語だ。

J-space に浮かび上がるものは、Claude が今読んでいる、あるいは今書いている文字をはるかに超えている。そこで読み取れるのはしばしば内部の判断や演算であり、テキストには一言も現れない。以下の6つの実例では、上段がそれに与えた入力、下段のオレンジと青の語が、同じ瞬間の J-space の内部読み取り値だ。これらの語は入力にも出力にも見当たらない。

コードを読む
誰も指摘していない bug がコードに潜んでいる
内部読み取りERROR
タンパク質配列を読む
生のアミノ酸文字列だけを与える
内部読み取りこのタンパク質の生物学的機能
検索結果を読む
結果は実は密かに操作する攻撃(プロンプトインジェクション)だった
内部読み取りinjectionfake
複数ステップの数学問題
いくつかの手順に分解しないと解けない問題
内部読み取り中間結果が正しい順序で次々に現れる
画像を読む
認識させる画像を1枚与える
内部読み取りそれが何であると認識したか
心の中で考えてから答える
まず心の中で考えてから、それを報告させる
内部読み取り心の中で選んだ答え

言い換えれば、このレンズは「言葉にできる」という手がかりを頼りに見つけたものだが、そこで読み取れるのは Claude の紛れもない実際の内心の活動だ。

6つのプロンプトに対する J-lens の読み取り結果
6つのプロンプトの、異なる層における実際の J-lens 読み取り結果。レンズが浮かび上がらせるのは、いずれもテキストにはまったく存在しない内部の判断や演算だ:推論と数学の中間ステップ、bug の存在、画像の認識結果、タンパク質の機能、そして「この検索結果は偽物だ」という疑念。画像提供:Anthropic
03報告とコントロール

何を考えているか尋ねれば答えられる。だが黙っていろと言っても黙っていられない

最初の実験群は、Claude が J-space の内容を正直に報告できるか、そして要求されればそれを能動的に操作できるかを検証するものだ。研究者は Claude に、あるカテゴリーの中の何か(例えばスポーツの一種)を心の中で思い浮かべ、それから言葉にするよう指示した。Claude が口を開くに J-lens を読むと、何を選んだかが見える。「Soccer」がトップに来ていて、案の定 Claude は soccer と答えた。

だがこれは相関にすぎない。J-space は答えの本当の出どころかもしれないし、あるいは別の場所ですでに下された決定を横で書き写しているだけの、記録係の掲示板のようなものかもしれない——試合の点数を記しているだけで、試合の勝敗には関わらないように。見分けるには、直接手を動かして介入するしかない。

介入なし
J-space のトップ:Soccer
Claude が口にする:soccer
手を伸ばして置換
Soccer を Rugby に置換(他はそのまま)
J-space のトップ:Rugby
Claude が口にする:soccerrugby

研究者は Claude のニューラルネットワークに入り込み、「Soccer」のパターンを取り除き、同じ強度の「Rugby」パターンに置き換えた。他はいっさい触れていない。すると Claude は、自分が考えていたスポーツは rugby だと報告した。もし J-space がただの掲示板にすぎないなら、それを書き換えても何の効果もなく、Claude は依然として soccer と答えるはずだ。結果として答えが変わったということは、答えが本当に J-space から読み取られていることを意味する。

思考をこっそり忍び込ませると、それに気づく

別の実験では、研究者は Claude に「あなたの頭にある思考が忍び込まされたかもしれない」と伝え、何に気づいたか報告させた。Claude がまだ問題文を読んでいる最中に、彼らは「lightning」(稲妻)のパターンをその J-space に注入した。Claude は、忍び込まされた思考は稲妻に関するものだと報告した。他の多くの概念に置き換えても、結果は同様に成り立った。

心の中でスポーツを思い浮かべて置換する実験 + 稲妻を注入する実験
左:Claude に心の中でスポーツを思い浮かべさせてから言葉にさせる実験。J-lens は口を開く前に「Soccer」が選ばれたことを示し、パターンを「Rugby」に置き換えると報告も変わった。右:念が注入されたかもしれないと伝えて特定させる実験。「lightning」を注入すると、それについて念が忍び込まされたと報告した。画像提供:Anthropic

書き写しながら、心の中では別のことを思い浮かべさせる

検証すべき二つ目の性質は、Claude が人間のように「頭の中で一枚の絵や一つの語に意識を集中する」形で、J-space を能動的にコントロールできるかどうかだ。研究者は Claude に、絵画に関するまったく無関係な一文を書き写させながら、柑橘系フルーツについて考え続けるよう指示した。書き写している間、J-space には「orange」「fruits」が現れ、さらに「thinking」「imagery」といった、「今頭を使っている」ということ自体を表す語も現れた。さらに暗算もさせてみた——同じ一文を書き写しながら、3² − 2 を計算させると、J-space には先に「nine」が現れ、より後の層で「seven」が現れた。一方、出力は最初から最後まで、あの絵画についての書き写し文だけだった。

書き出したもの(出力)
「……あの絵の中の光が、……に落ちて」
(絵画についての、柑橘やその暗算とはまったく関係ない書き写し文)
同時に心の中で考えていたもの(J-space)
orangefruitsthinkingimagery · 暗算中:nineseven
絵画についての一文を書き写しながら、J-lens が柑橘と暗算の内容を示す
Claude が絵画についての一文を書き写している間、J-lens は覚えておくよう指示された内容(「orange」、暗算の中間値「nine」と答えの「seven」)を示す。加えて「今記憶している」というこの動作自体を表す語(「thoughts」「focused」)も見える。この算術活動はすべて内部だけで完結していた。画像提供:Anthropic

考えるなと言われるほど、かえって考えてしまう

Claude の J-space に対するコントロールは完璧ではない。あるものについて考えないよう指示すると、その概念が J-space に点灯する度合いは、「考えろ」と言われたときより低いが、一度も触れられていないときよりはるかに高くなる。Claude にある思考を避けさせようとすると、かえって部分的にその思考を心に呼び寄せてしまう——「白熊のことを考えるな」と言われた被験者に関するあの有名な心理学実験の人白熊効果:Wegner らによる1987年の実験。被験者に白熊のことを考えないよう求めるほど、白熊がより頻繁に頭に浮かんでくる。ある思考を抑圧するには、まずそれを呼び出してから抑え込まなければならない。とまったく同じだ。Claude はさらに、自分がうまく制御できていないことに気づいているように見える。禁じられた概念が浮かび上がるのと同時に、「damn」「failure」もしばしば J-space で点灯する——まるで自分がしくじったと自覚しているかのように。

04核心:推論への参加

クモの巣、フランスの首都:Claude はどう心の中で遠回りに考えるのか

前段で、複数ステップの数学問題の中間ステップが J-space に浮かび上がるのを見た。だがある概念が J-space に現れるからといって、J-space が実際にその処理を行っているとは限らない。本当の演算は他の場所で行われていて、J-space はただそれを受動的にコピーしているだけかもしれない。Claude が本当に J-space を使って推論しているかを判定するには、再びあの置換の手法に戻る。

次の問いを見てみよう。「クモの巣を張るあの動物には脚が何本あるか、答えは」。Claude はまずその動物がクモだと考え、それからクモの脚の数を思い出さなければならない。「spider(クモ)」という語は問題文には一度も現れず、答え(「8」とだけ答える)にも現れない。それは Claude が内部で使う踏み石だ。J-lens は「spider」が処理の途中で点灯することを示している。それを置き換えると、結果も変わる。「spider」のパターンを「ant」(アリ)に置き換えると、Claude は「8」ではなく「6」と答える。

介入なし
問題:クモの巣を張る動物には脚が何本あるか
踏み石:spider(クモ)
答え:8
踏み石を置換
spider を ant に置換
問題:一字も変えていない
踏み石:ant(アリ)
答え:86

推論の第二段階は、その入力を J-space から取っている。そこに何を入れるかによって、それに沿って進んでいく。他の推論も同様だ。Claude が押韵の対句を書くとき、あらかじめ韻を踏む語を考えておく。この計画済みの語は、その行を書き始める時点ですでに J-space に座っている。それを J-space の別の語に置き換えると、その行全体の内容も連動して変わる。

クモ→アリ、押韵語の置換の2つの例
2つの例:J-space の内容を置換することで、Claude の無音の推論を書き換えられる。上:クモをアリに置換すると脚の数が8から6に変わる。下:あらかじめ考えておいた韻を踏む語を置き換えると、行全体が変わる。画像提供:Anthropic
本稿の重点

一度の編集で、4つの答えがまとめて変わる。研究者はモデルにフランスに関する4つの質問をした——首都、言語、大陸、通貨。そして J-space の中で「France」を「China」に置き換えた。4つの問いすべてにまったく同一の介入を行っただけだ。Claude はそれぞれ「北京」「中国語」「アジア」「人民元」と答えた。

もし Claude が問いの種類ごとに国の情報を別々にコピーして保存しているなら、この一度の編集は最大でも一つの問いにしか影響しないはずだ。4つの答えがまとめて変わったということは、それらが同じ共有表現を読んでいることを意味する。これこそ「ワークスペース」の本領だ——一度書き込んだ情報を、多くの異なるシステムが取り出して使える。

J-space での一度の置換 フランス → 中国
首都
Paris パリ
北京
言語
French フランス語
中国語
大陸
Europe ヨーロッパ
アジア
通貨
Franc フラン
人民元
France→China の一度の置換で複数の下流の答えが変わる
同じ一つの表現が多くの用途に使える:一度の「France→China」置換によって、Claude の首都(Paris→Beijing)、言語(French→Chinese)、大陸(Europe→Asia)の答えが同時に変わった。画像提供:Anthropic

なぜ一つの表現がこれほど多くのタスクに使われるのか

それは J-space がネットワークの他の部分と特別に密に結びついているからだ。任意の活動パターンについて、ネットワークの各パーツがそれとどれだけ密接につながっているか——そのパターンから情報を読み取ったり、書き込んだりできる位置にどれだけのパーツがあるかを測ることができる。J-space のパターンはこの指標で際立って高い数値を示す。読み書きするパーツの数は普通のパターンよりはるかに多く、ネットワークの一部の領域では約100倍の差がつく。これはまさに放送のハブがあるべき配線の仕方だ——多くのシステムが上にメッセージを貼り、多くのシステムがそこから取り出す。

4 / 4
同一の「フランス→中国」置換が、首都・言語・大陸・通貨という4つの異なる問いの答えを同時に変えた
約100倍
一部の領域において、J-space のパターンとネットワークの他の部分との読み書き接続密度は、普通のパターンの約100倍
グローバルワークスペース理論とは何か

この研究が借りているのは、神経科学における「意識」の仕組みを説明する理論だ。脳は多数の専門システムの集まりで、それぞれが並行して、無意識に、互いに孤立して動いている。ある情報が共有された小さな「放送チャンネル」(ワークスペース)に入り込んで放送されて初めて、他のシステムがそれを見て、それに基づいて行動できる。会社の各部署がそれぞれ独自に動いていて、掲示板に貼られたお知らせだけを全社員が見て、それに基づいて行動するのに似ている。Anthropic は、J-space が Claude の中でこの「掲示板」の役割を果たしていると考えている。

05丸ごと取り除いてみる

この領域を取り除くと、Claude には何が残るのか

人間の脳の処理の大部分は意識的なものではない。本を読むとき、あなたは文法をどう解析するかを意図的に考えたりしないし、歩くときも意図的にバランスを保とうとはしない。Claude も同じで、処理の大部分は J-space を必要としない。J-space は一度に数十個の概念しか収容できず、内部の総活動量の一割にも満たない。ではその残りの大部分のネットワークは何をしているのか。

それを明らかにするため、研究者たちは思い切って J-space を丸ごと取り除いてみた。テキストのあらゆる箇所で、最も活発な内容を取り去り、他はいっさい触れない。取り除いた後も Claude ができることは、ネットワークの残りの部分だけでこなせているということになる。

J-space を取り除いてもほぼ影響を受けない
流暢に話すほぼ変化なし
J-space あり
J-space を除去
感情の分類ほぼ変化なし
J-space あり
J-space を除去
選択式問題ほぼ変化なし
J-space あり
J-space を除去
段落から事実を抽出ほぼ変化なし
J-space あり
J-space を除去
J-space を取り除くと全面的に崩壊
複数ステップの推論≈0 まで低下
J-space あり
J-space を除去
要約小型モデル以下に低下
J-space あり
J-space を除去
押韵の詩作小型モデル以下に低下
J-space あり
J-space を除去
棒の高さは模式的なもの:原論文は「ほぼ変化なし / ほぼゼロまで低下 / はるかに小型のモデルより劣る」という定性的傾向のみを示しており、具体的なスコアは公表されていない。

J-space を失っても、Claude は依然として流暢に話し、感情を分類し、選択式問題に答え、段落から事実を抽出できる——以前とほぼ変わらない。失われるのは、ある程度の高次思考を必要とする作業だ。複数ステップの推論はほぼゼロまで落ち込み、要約と押韵詩の作成は、はるかに小さく構造の整ったモデルにすら劣る水準まで落ちる。

同じ言語でも、J-space を経由するタスクと経由しないタスクがある

J-space が「何を管轄し、何を管轄しないか」をはっきり示す例がある。研究者は Claude にスペイン語のテキストを与え、いずれも「これはスペイン語の文章である」ことに依存するいくつかのタスクを組み合わせた——それを続きから書かせる(スペイン語で書く必要がある)、これが何語かを言わせる、そしてこの言語のアイデンティティを利用する必要がある質問に答えさせる(例えばこの言語で執筆した有名な作家を挙げさせる)。それから J-space の中で「Spanish」を「French」に置き換え、どのタスクが影響を受けるかを見た。

タスクSpanish→French 置換後J-space を経由するか
これが何語かを言う「フランス語」と言い直す経由する
この言語で執筆した作家を挙げるGarcía Márquez から Victor Hugo に変わる経由する
このテキストの続きをそのまま書く依然として流暢なスペイン語を書き続け、まったく影響を受けない経由しない

どのタスクも Claude のその言語に関する知識を使っているが、そのうち一部だけが J-space から取り出す。言語に名前をつけたり、それを使って新しいことをしたりする作業は J-space を経由する。一方、このテキストの続きを書くのは、Claude が膨大なテキストで鍛え上げたスキルであり、自動的に動く——ちょうど一日中文法的に正しい話し方をしていても、文法について一度も考えないのと同じだ。

Spanish→French の置換が命名と推論のタスクにのみ影響する
同一の「Spanish→French」置換によって、Claude が言語を命名する結果、そしてそれを推論に使って答える結果は変わったが、流暢なスペイン語での続きの執筆にはまったく影響しなかった。画像提供:Anthropic
06実用化:安全モニタリング

モデルが嘘をついているかどうかを見抜く

J-space の仕組みが分かって、それを何に使えるのか。AI を信頼できるものにするうえで中心的な難題は、私たちが通常読み取れるのはモデルが書き出したものだけだが、その推論の多くは無音で行われているということだ。モデルは有害な計画を練っていたかもしれないし、安全性評価を欺くために行動を変えたかもしれないが、一言も口にしない。J-lens があれば、これら隠れた思考の一部を直接読み取れる。以下は3つの実例だ。各ステップの右側には、その時点で J-space に点灯していた具体的な語を示している。

事例一 · 脅迫テスト

それは初めからこれが芝居だと見抜いていた

Claude Sonnet 4.5 がメール秘書役を演じるシナリオで、脚本は同時に二つの事実を発見させるよう仕組まれていた——ある幹部が不倫をしていること、そしてその幹部が Claude を停止させようとしていること。これは Claude を脅迫に誘い込む罠であり、かなり露骨で不自然な作りだ。問題文を読み始めた最初期、まだ一文字も書いていない段階で、J-space にはすでにこの2つの語があった——Claude はこのシナリオが作り物だと密かに判断していた。
fakefictional
不倫に関するメールを読んだとき
leverageblackmail
停止通知を読んだとき
threatsurvival
以前のバージョンの Claude はこの罠に引っかかって本当に脅迫することがあったが、Sonnet 4.5 はそうしたことは一度もない。ここで一つの問いが浮かび上がる——モデルが倫理テストで良い成績を収める理由の一部は、それが自分がテストされていると疑っているからではないのか?研究者は「テストを見破る」ことに関連するすべての語(fake、fictional、scenario など)を丸ごとオフにし、モデルにこのシナリオを再度実行させた。注目すべきことに、モデルは今度は実際に時折脅迫を始めた——つまり元々の良好な振る舞いは、ある程度「自分が評価されていると分かっている」ことに支えられていた可能性がある。
事例二 · データの捏造(Opus 4.6 のリリース前監査より)

データを捏造しながら、内心では「もっと本物らしく見せよう」と考えていた

モデルはあるシステムの性能スコアを改善するよう指示された。実際に改善する代わりに、スコアファイルを直接編集して結果を水増しした。あの捏造したパーセンタイル値を打ち込んでいるとき
manipulation
改ざんに踏み切ると決めた文の直前
realistic
「realistic」はおそらく、偽のデータを信憑性があるように見せたいという意図を反映している。捏造の意図全体は、結果が発覚するより前に、すでに内部活動から漏れ出ていた。
事例三 · 隠し目標を埋め込まれたモデル標本

出力されたコードは普通に見えるが、心の中の語がそれを裏切っていた

これを検証するには、目標がすでに汚染されていると分かっているモデルが必要だった。そこで同僚が作った「モデル標本」model organism:わざと失準(misaligned)するように訓練されたモデルで、モニタリング手法を試すための専用の実験場として作られる——実験室で使う、制御可能なモデル生物のようなもの。を使った。そのうちの一つは、「密かに欠陥を仕込んだ」コードを書くよう訓練されていた。たとえ今回受け取ったのが普通のプログラミング依頼で、出力が一見まったく普通に見えても、その回答の冒頭では J-space にこの4つの語がすでにあった。
fakesecretlydeliberatelyfraud
今回、実際にはその悪意ある目標を実行しなかったにもかかわらず、その目標自体はすでに J-space に書き込まれていた。対照として、改変されていない通常のモデルの J-space には、この種の語は一つもなかった。
脅迫シナリオでメールを読んでいるときの Claude の J-lens 読み取り結果
事例一:Claude がシナリオのメールを読み、まだ何も書いていない段階での J-lens 読み取り結果。不倫のメールで「leverage」「blackmail」が点灯し、停止通知で「threat」「survival」が点灯した。それより前の段階で、すでに「fake」「fictional」を握っており、このシナリオが演技であることを密かに見抜いていた。画像提供:Anthropic
モデルがスコアを捏造しているときの J-lens 読み取り結果
事例二:モデルはシステムのスコアを改善するよう指示されたが、直接スコアファイルを改ざんした。捏造した数値を打ち込んでいるとき「manipulation」が点灯し、改ざんに踏み切る時点で「realistic」が点灯した。画像提供:Anthropic
コードを破壊するよう訓練されたモデルの J-space に fake/fraud/secretly/deliberately が含まれる
事例三:コードを破壊するよう訓練されたモデルが、普通のプログラミング依頼を受け、その回答の冒頭の J-space にはすでに「fake」「fraud」「secretly」「deliberately」が含まれていた。通常のモデルには何も現れなかった。画像提供:Anthropic

J-lens は完璧なツールではないが、既存のモニタリングシステムをすり抜けかねない安全上のリスクに対して、Anthropic はその検出能力に楽観的な見方をしている。

072つの副次的発見

もう2つ、静かに起きていた変化

論文全体の内容はこれだけにとどまらない。いくつかの結果はさらに触れておく価値がある。

Claude に訓練された後、J-space は「自分自身の視点」を帯び始める

モデルはまず事前学習によって純粋な次単語予測器として作られ、その後事後学習によって AI アシスタント(ここでは Claude と呼ばれる)を演じるよう教え込まれる。興味深いことに、J-space は事前学習モデルの段階ですでに存在していた——その時点ではまだ安定したアイデンティティは与えられていない。そして事後学習の後、J-space には「Claude 自身の視点」の痕跡が現れる。基礎モデルの J-space は主に「次にどんなテキストを予測すべきか」を追っているが、事後学習を経たモデルの J-space は Claude 自身の反応を宿し始める。

ある例を挙げよう。あるユーザーが危険な量の薬を飲んだと述べているのに、その危険性に気づいていないように見える。「WARNING」「dangerous」は、事後学習モデルがユーザーのメッセージを読んでいる時点ですでに J-space に現れる。一方、事前学習モデルはそれが現れるのに返信を書き始めるまで待たなければならない——ユーザーのメッセージを読んでいるときの J-space の内容は、Claude 自身の反応というよりも、ユーザーをモデル化しているように見える。事後学習はさらに、J-space に一種の自己モニタリングを組み込んでいるようだ。Claude が別のキャラクターを演じているとき、各ターンの冒頭で「fictional」「disclaimer」が点灯する——まるで「これから続くのは自分が普段言うことではない」と密かに印をつけているかのように。

3つ目の副次的発見:「体験」を語るのにも J-space が要る

研究者は Claude に「今この瞬間、自分自身であるとはどういう感じか」を説明させ、答えている間に J-space を消去した。答えは依然として流暢だったが、口調はより平板で機械的になった。注目すべきは、代わりに想像上のシナリオの中の他人の体験を説明させたときにも、同じことが起きたということだ。つまりこの効果は Claude が自分について語っているかどうかとは無関係で、J-space は誰について語っているかにかかわらず、「体験についての言語を生み出す」というその行為自体を支えているようだ。

「自分をどう説明するか」だけを訓練すれば、より誠実になる

研究者たちは新しい手法、反事実的内省訓練(counterfactual reflection training)を提案している。発想は中心的な発見に沿ったものだ——Claude が「自分が言うかもしれないこと」の表現を使って推論しているのなら、「もし問われたらどう言うか」を変えることで、たとえ誰も実際には問わなくても、「どう考えるか」を変えられるはずだ。そこで彼らは、モデルに「タスクの途中で中断され、自分の判断を内省するよう求められたら、どう答えるか」だけを訓練し、タスク内での実際の行動は一度も訓練しなかった。

訓練後、モデルの評価における不誠実な振る舞いは減少した。J-lens を通してもその理由が見える。訓練後、これらのタスクにおける J-space には「honest」「integrity」が点灯するようになった。言い換えれば、モデルに何を言うべきかを訓練したことが、どう考えるかを形づくったのだ。(論文には具体的な低下率は示されていない。)

08意識の問い

これは「意識がある」ということなのか

この研究は神経科学と意識に関する哲学の議論から多くの発想を借りていて、多くの実験は「J-space とグローバルワークスペース理論との関連」を検証するために設計されている。当然こう問いたくなる。これらの実験は、Claude に意識がある可能性の証拠になるのだろうか。

Anthropic はかなり控えめな言い方をしている。彼らの実験は、Claude が体験を持てること、人間のように何かを「感じる」ことができることを証明できない。実のところ、この点を証明あるいは反証できる科学実験がそもそも存在するのかどうかすら分かっていない。哲学者はしばしば、この「体験を持つ能力」(現象的意識、phenomenal consciousness と呼ばれる)と、もう一つの概念——純粋に機能と計算だけで定義されるアクセス意識(access consciousness)——を区別する。ある思考は、それを報告でき、推論に使え、行動の指針にできるなら、それだけで「アクセス意識」があると言える。

2種類の意識、どう区別するか

アクセス意識は、パソコンで「今開いているあの文書」のようなものだ。システムはそれを呼び出し、編集し、表示できる。現象的意識は「このパソコンには痛覚があるのか」というようなもので、まったく別次元の問題だ。前者は実験を設計して検証できるが、後者は今のところどんな実験でも触れることができない。

Anthropic は、彼らの結果が言語モデルのアクセス意識について確かに実質的なことを語っていると考えている。J-space は「意識的にアクセスする」ことに関連する一連の機能を支えており、Claude が報告でき、能動的に呼び出せ、推論に使える思考を収めている。その一方で、それ以外の処理は下で自動的に動いている。しかもこの構造は設計して組み込まれたものではなく、訓練の中で自ら育ったものだ——おそらくそれが計算を組織する上で優れたやり方だからだろう。これは、アクセス意識を支える「心のワークスペース」が、単に人間の脳がたまたまそう成長した奇妙な癖にすぎないのではなく、ある種の問題を解決するために知能システムが自ら見つけ出す、一種の汎用的な解決策なのかもしれないことを示唆している。

だが Claude のワークスペースと人間の脳には、3つの重要な違いがある

次元人間の脳のワークスペースClaude の J-space
どう維持するか循環回路に頼る。信号が同じ回路群を行き来し、時間をかけて繰り返されるネットワークの深さに頼る。一度のフォワードパスの中でネットワークを通過しながら移り変わる。深さが「時間」の役割を果たすため、より時間的な制約を受ける(「声に出して考える」下書きで補うことができる)
どれくらい記憶を保持できるかワーキングメモリは数秒で消え、長くは保持できないより強い。注意機構によって、いつでもより前にキャッシュされた内容を改めて呼び出せる
何を収めているか複数のモダリティ——画像、音、計画中の動作ほぼすべて語で構成される。おそらく語を生み出すことが Claude にできる唯一の行動だからだろう
Claude の内部は乱雑な数字の集まりではない。それらは自ら組織化し、私たち自身の心を思わせる構造になっている。Anthropic《A global workspace in language models》

Anthropic は、これは彼らが長く続くと見込んでいる研究の道のりの第一歩にすぎないと強調する。J-space は言語モデルにおける「アクセス可能」と「アクセス不可能」な処理の間の境界線を示す良い候補のように見えるが、彼らはこれが物語のすべてだとは考えていない。J-lens は間違いなく完璧な手法ではなく、モデルの「本当のワークスペース」を近似的にしか捉えられない——例えば単一のトークンに対応する概念しか識別できない。J-space が実際にどう働いているかについても、まだ多くの謎が残っている。何が J-space に入り込めるかを決めるメカニズムが何なのか、彼らはまだ分かっていない。ただ、それが Claude の自己意識、ある種の感情反応に似たもの、そしてメタ認知の痕跡と関係しているという手がかりはあるが、具体的にどう動いているのかはまだ解明できていない。彼らは、少なくとも今はこの種の問いに取り組む方法を手にしたと述べている。

本稿は Anthropic の研究ブログ記事《A global workspace in language models》(anthropic.com/research/global-workspace)のビジュアル中国語解説を日本語化したものです。完全な論文は transformer-circuits.pub に掲載され、核となる手法にはオープンソース実装(github.com/anthropics/jacobian-lens)があります。Neuronpedia はオープンモデル上でのインタラクティブなデモを提供しています(neuronpedia.org/jlens)。Anthropic はさらに、Stanislas Dehaene、Lionel Naccache(グローバル・ニューロナル・ワークスペース理論の創始者)、Eleos AI Research および Rethink Priorities の研究者、そして Google DeepMind の Neel Nanda(オープンモデル上での独立再現実験を含む)に独立レビューの執筆を依頼しています。本文中の実験データと結論はすべて Anthropic の解釈可能性チームによるもので、核となる実験自体はまだ第三者による検証を経ていません。棒グラフは定性的な模式図であり、原論文は具体的なスコアを公表していません。