研究解説 · 小互解読

ユーザーが出力品質の低下を懸念、AnthropicがClaudeテキスト透かしの仕組みを公開

将来のClaudeは、単語選択に検証可能な統計的痕跡を残すだろう。これはClaudeが関与したかどうかの判断に役立つが、学校、プラットフォーム、裁判所が誰が作品を書いたかを判断する代わりにはならない。

1分で要点
  • Claudeのテキスト透かしは隠し文字ではなく、複数の妥当な候補から選択する際に、通常のランダムソースを鍵と前文によって決定されるランダムソースに置き換えるものである。
  • 完全な長文と翻訳のシグナルはより強く、短文、コード、事実の段落、軽い校正は確認が難しい。
  • 検出結果はClaudeが関与した可能性を示すだけで、ユーザーの身元を保持せず、作者、所有権、不正、コンテンツの真偽を判断することもできない。
  • テキストには統計的透かしが使用され、対応する画像とファイルにはC2PAソースクレデンシャルが使用される。

この透かしは一体どういうものなのか?

以前、AnthropicはClaudeが生成したテキストと対応するファイルに、機械で検出可能な目に見えないマークを追加すると発表していた。人間の目には見えないが、専用ツールを使って検証できる。

関連記事 AnthropicがClaudeのコンテンツ表示方式を公開――文章に見えない透かしを埋め込む 以前の発表では、表示を加える理由と、文章とファイルで異なる処理を説明した 記事を読む

この計画は多くの疑問を引き起こした。そこでAnthropicは、公式の技術解説を改めて公開し、次の三つの質問に集中的に回答した。この透かしとは何か、どのように機能するのか、出力品質を低下させるのか。

この変更はまず、コンプライアンス対応として始まった。EUはAI生成コンテンツの透明性要件の実施を開始し、Anthropicは他の機関と関連する実務規範に署名した。署名機関は全体で約190だが、すべてがモデルベンダーというわけではない。現時点では地域ごとにのみ安定して有効化できないため、透かし計画は開始時にグローバルに適用される。他の主要なモデル開発会社もそれぞれのマーキング方式を導入するだろう。

しかし、これはコンプライアンスチームだけに影響するわけではない。学校は宿題にClaudeが使われたかどうかを判断するために、出版社は原稿を確認するために、企業はコンテンツ審査プロセスに組み込むために、これを使うかもしれない。したがって、技術がどのように機能するかは最初の質問に過ぎず、より重要なのは、検出結果がどこまで証明できるかである。

まず、今回の変更を四つの文に要約する。

  • 透かしはテキストに隠された特殊文字ではなく、多くの単語選択によって形成される統計的規則である。
  • トークンを追加せず、ユーザーや組織のIDを保持せず、テキストを特定の会話に遡ることもできない。
  • 長いテキスト、完全な生成、翻訳はシグナルを蓄積しやすい。短文、コード、事実の段落、軽い校正は検出が難しい。
  • 透かしが検出されたということは、Claudeが関与した可能性が高いことを意味するだけで、Claudeが作者であることを意味するものではなく、不正、権利侵害、コンテンツの虚偽を自動的に証明するものでもない。
Claudeのテキスト透かしを表したAnthropic公式の手と羽根ペンのイラスト

この四つの文を理解した後、実際に最初に解き明かす必要があるのは、一見矛盾した質問である。何も追加していないのに、透かしは一体どこに隠されているのか?

どのように機能するのか?

モデルが単語を生成するたびに、通常「唯一の正解」に直面するわけではない。例えば「The weather today was cold and…」の後には、greyovercast も続くことができる。どちらも自然で、意味もほぼ同じである。通常の生成は、これらの妥当な候補からランダムに一つを選択する。

Claudeのテキスト透かしは、このランダム選択のソースを変更する。鍵と直前のいくつかの単語を組み合わせて、今回どの候補が選択されやすいかを決定する。単一の単語を見ても何もわからない。十分な数の選択を組み合わせると、鍵を持つ人は、この一連の結果がその選択規則に継続的に適合しているかをチェックできる。

これは、最終的なテキストにスタンプを押すというよりも、ランダムプロセスを再確認可能なサイコロに交換するようなものである。サイコロは依然として妥当な候補間でのみ選択され、透かしを残すために、一般的な overcast を、奇妙で不自然な単語に突然置き換えるようなことはしない。

Anthropicは特に nubilous の例を挙げている。これも「曇った」を意味するが、非常に珍しく、Claudeは通常ほとんど使用しない。透かしはこのような単語を候補に無理やり追加するのではなく、モデルがもともとどちらでも意味が通ると考える選択肢の間でのみ機能する。

まず、このプロセスを実際に体験してみよう。候補語とモデルが示す例示的な確率は常に同じで、最終的な選択を決定する乱数ソースのみを切り替える。

対話実験 · Same words, different dice

候補語はそのまま、選択を決めるサイコロだけを変える

新しい語も候補確率も変えず、選択の連なりを同じ鍵で照合できるようにする。

モデルの書きかけ “The weather today was cold and …” 意味が近い自然な次の語が複数ある。
overcast46%
grey34%
windy20%
nubilous追加しない
今回の選択 grey 通常の乱数値がgreyの確率区間に入った。
照合可能な信号(例) 通常の乱数には照合用の鍵がない
静的な結論:創作表現は候補が多く、鍵付き乱数から照合可能な規則を蓄積できる。コードや軽い校正は候補が少なく、信号も弱い。
説明用のシミュレーションであり、Claudeの検出器ではない。候補確率、乱数値、信号の進行はすべて例示。理解の構造はThariqの「Same Words, Different Dice」を参考にし、仕組みはAnthropicとSynthID-Textの公開説明に基づく。

Claudeは、Google DeepMindが2024年に『Nature』で発表したSynthID-Textのバージョンを使用している。この技術系統は、Scott Aaronson氏の2022年の提案まで遡ることができる。数世代にわたって共有される中核は、語彙を変更せず、「サイコロを振る」ソースのみを変更することである。生成時には多数の選択によって統計的バイアスが残り、検出時にはテキスト、鍵、および同じ規則を使用して一致度を計算する。生成モデルを再度呼び出す必要はない。

人生ゲームの類推で、これをさらに具体的に説明できる。通常のプレイでは毎回サイコロを振る。今度は、円周率の小数点以下のある桁から読み始め、その数字を順番に読んで歩数を決めるとする。プレイヤーはそれぞれのステップがランダムであると感じ、ボード、ルール、ゲーム体験は変わらない。しかし、後で完全な移動シーケンスを入手し、円周率と照合すれば、このゲームが通常のサイコロを使用していなかった可能性を判断できる。

仕組みが明確になったところで、当然の疑問が生じる。単語の選択を変えるだけで、コンテンツの品質は変わらないのだろうか?

出力品質は低下するのか?

Anthropicの社内テストでは、コンテンツ、創造性、読みやすさに実際の変化は観察されなかった。SynthID-Textの公開論文も、独立した方法論的証拠を提供している。Googleは、透かし入りと透かしなしのモデルを2,000万件近くのGemini応答に振り分けたが、二つのグループ間の高評価率と低評価率の差は統計的に有意ではなかった。管理された人間による並列比較でも、品質の違いは見つからなかった。

これは、あらゆる強度、あらゆる実装の透かしが本質的に無損失であることを意味するわけではない。SynthID-Text自体には、「検出しやすさ」と「分布の変更を少なくする」ことの間の設定上のトレードオフが存在する。ここで安全に導き出せる結論は、Anthropicが選択した実装は実際の品質への影響がないと主張しており、公開された方法は非歪曲構成が大規模に実行可能であることを証明している。Claudeの鍵、しきい値、および完全な構成は公開されていない。

ユーザー側でも、三つのことを確認できる。透かしは追加のトークンを生成しないため、追加料金は発生しない。生成速度への影響は無視できる程度である。透かし自体はユーザー、組織、チャット情報をエンコードしないため、「誰が尋ねたか」を回復することはできない。

エクスペリエンスへの影響が非常に小さいのに、なぜ検出結果を単純に「はい」または「いいえ」と書けないのか?透かしは、自由に選択できる多くの単語から証拠を蓄積する必要があるが、異なるタスクによってモデルに残される選択の余地は大きく異なるためである。

なぜ一部のテキストは検出されやすいのか?

完全に生成された長文では、モデルは同じくらい自然な複数の表現に繰り返し遭遇するため、透かしには多くの場所がある。翻訳も同様だ。ターゲット言語のほぼすべての単語を再選択する必要があるため、Claudeが生成した翻訳には透かしが含まれる。

しかし、校正は再創作ではない。テキストがもともと人間によって書かれ、Claudeがいくつかの句読点や文法上の誤りを修正しただけの場合、ほとんどの単語はClaudeによって選択されたものではないため、透かしが確認できないほど少なくなる可能性が高い。短いテキストにも同じ問題がある。サンプルが少なすぎて、統計的証拠が蓄積されない。

事実が密集したコンテンツとコードは、また別の制約がある。「2 + 2 =」の後に、透かしのために別の答えに変更することはできない。関数名、構文、正確な値もしばしば置き換える余地がない。コメントや説明文はシグナルを残す可能性があるが、プログラムが実行できるかどうかを本当に決定する部分では、透かしは通常より疎らである。

選択余地が信号密度を決める

Claudeを使えば必ず検出できるのではない。Claudeが実際に何語を選んだかが重要になる。

強め全面生成の長文選択が多く、標本も長い
強め翻訳目的言語の語をほぼ全て選び直す
弱め軽い校正少数の語と記号だけを直す
弱めコード / 事実 / 短文正しい候補も標本も少ない
「強め/弱め」は相対関係で、公開されたしきい値ではない。Anthropicは最短検出長を公開していない。

編集はシグナルをさらに薄める。軽微な変更は、おそらくすべてのパターンをすぐに消し去ることはないだろう。しかし、すべての文を完全に書き直すと、それを取り除くことができる。ここには公開された固定の文字数や編集比率はなく、実際の信頼度はテキストの長さ、コンテンツの種類、具体的な書き換え方法にも依存する。

したがって、「検出されない」ことは特に「Claudeが使用されていない」と解釈されるべきではない。次に、検出結果と結論の間の距離を明確にする必要がある。

検出結果は一体何を証明できるのか?

鍵を持つ検出器が答えることができるのは、このテキストの単語選択のシーケンスが、Claudeがその鍵を使用して生成したときの規則とどの程度一致しているかである。これは確率的な証拠であり、著者の署名ではない。

検出結果は二択の判決ではない

まず結果が支える最小限の結論を確認する。

規則を検出 Claudeが関与した可能性が高い 生成と大幅編集を区別できない
信号が不足 現在の標本では確認できない 人だけで書いた証明ではない
どちらの結果だけでも決められないもの:著者不正所有権真偽法的責任
透かしが検証するのは生成過程の確率的証拠で、作品の社会的・法的帰属ではない。

この区別は、実際の審査において非常に重要である。ある人は、最初にアウトラインを書き、Claudeに拡張させるかもしれない。また、Claudeに下書きさせた後に自分で書き直すかもしれない。あるいは、Claudeに文法を修正させるだけかもしれない。透かしが存在しても、「Claudeがゼロから書いた」と「Claudeが大幅に編集した」という二つのプロセスを区別することはできず、誰が作品を所有するか、誰が法的責任を負うかを決定することもできない。

逆もまた同様だ。検出されないことは、テキストが短すぎる、コードや事実が多すぎる、軽い校正のみ行われた、後で書き換えられた、同じ鍵と方法を持たない他のモデルが使用された、などの理由による可能性がある。これは「人間によるオリジナルの証明書」ではない。

これはまた、透かし検出とPangramなどの汎用AIテキスト検出器との違いを説明している。汎用検出器はClaudeの鍵を知らず、言い回し、構文、その他のスタイル特徴から推測するしかない。透かし検出は、生成時に積極的に埋め込まれた統計的パターンをチェックする。どちらも手がかりを提供する可能性があるが、証拠のソースは同じではない。

Anthropicはまだ、検出APIの具体的なリリース時期、しきい値、価格、または使用権限を公開していない。これらの詳細が明らかになるまでは、「何文字で必ず検出される」「精度は何%に達する」といった主張は、資料によって裏付けられていない。

テキストは統計的パターンに依存できるが、画像やファイルにはより直接的な媒体がある。メタデータだ。ここから、別の技術セットに入る。

テキスト透かしとファイルクレデンシャルは同じものか?

Claudeが対応するPNG、JPG、SVGなどのファイルを生成または処理するとき、ファイルのメタデータにC2PA Content Credentialが添付される。これは、暗号署名され、ファイルにバインドされた来歴レコードであり、互換性のあるツールで、ファイルが誰によって処理されたか、宣言が改ざんされたかどうかを検証できる。

どちらも「関与」を記録するが、入れ物は異なる

プレーンテキスト 統計的透かし
入れ物
単語選択の並び
検証
鍵付きスコア
弱点
短文と全面的な書き換え
画像とファイル C2PA証明
入れ物
ファイルのメタデータ
検証
暗号署名
弱点
メタデータを削除できる
共通の限界:どちらもClaudeの関与を記録するだけで、内容の真実性、著者、所有権は証明しない。
C2PAは検証可能な来歴声明と改変検知の関係を提供するが、声明自体の価値判断は行わない。

両者の共通点は、Claudeの関与を記録し、特定のユーザー IDを記録しないことだ。違いは、テキスト透かしが単語選択の統計に分散しているのに対し、C2PAクレデンシャルはファイルが運ぶ構造化されたメタデータであることだ。後者は削除でき、前者は十分な書き換えによって破壊できる。どのメカニズムも、それ単独でコンテンツの真実性、品質、または権利の帰属を証明することはできない。

したがって、今回のアップデートで最も重要な製品は、「AI製」のスタンプではなく、新しいタイプの来歴の手がかりである。プラットフォームとレビュー担当者に、検証できる証拠を一つ追加し、ユーザーに結論の強さを制御することを学ばせる。

検出結果は実際にどう使うべきか?

陽性の結果を見て、「Claudeがこのコンテンツに参加した可能性が高い」と言うことはできる。参加の程度、作者の貢献、ルール違反かどうかをさらに判断するには、バージョン履歴、編集履歴、タスク要件、および当事者の作業プロセスを組み合わせる必要がある。

陰性の結果を見て、「現在のサンプルは、十分なClaude透かし証拠を形成していない」としか言えない。テキストの長さ、タスクのタイプ、編集の程度、モデルのバージョン、検出機能が結果を変える可能性があるため、「完全に人間が書いた」と逆推論することはできない。

これがテキスト透かしの真の価値と限界だ。「これはAIが書いたように見える」という感覚を、鍵で検証可能な統計的判断に推し進めるが、確率的判断を社会的判決に格上げすることはない。

透かしはClaudeが関与した可能性を認識できるが、誰が著者か、誰が作品を所有するか、誰がコンテンツに責任を負うかを決定することはできない。

出典
How Claude’s text watermark worksAnthropic·一次資料を見る
当サイトの注記
Anthropic公式のテーマイラストをローカルに埋め込んだ。単語選択の実験と判断境界の図は、当サイトが公開資料に基づき作成した。対話内の候補確率、ランダム値、シグナルの進行はすべて説明用の例であり、Claudeの実際の確率、鍵、検出しきい値を示すものではない。