ユーザーが出力品質の低下を懸念、AnthropicがClaudeテキスト透かしの仕組みを公開
将来のClaudeは、単語選択に検証可能な統計的痕跡を残すだろう。これはClaudeが関与したかどうかの判断に役立つが、学校、プラットフォーム、裁判所が誰が作品を書いたかを判断する代わりにはならない。
- Claudeのテキスト透かしは隠し文字ではなく、複数の妥当な候補から選択する際に、通常のランダムソースを鍵と前文によって決定されるランダムソースに置き換えるものである。
- 完全な長文と翻訳のシグナルはより強く、短文、コード、事実の段落、軽い校正は確認が難しい。
- 検出結果はClaudeが関与した可能性を示すだけで、ユーザーの身元を保持せず、作者、所有権、不正、コンテンツの真偽を判断することもできない。
- テキストには統計的透かしが使用され、対応する画像とファイルにはC2PAソースクレデンシャルが使用される。
この透かしは一体どういうものなのか?
以前、AnthropicはClaudeが生成したテキストと対応するファイルに、機械で検出可能な目に見えないマークを追加すると発表していた。人間の目には見えないが、専用ツールを使って検証できる。
この計画は多くの疑問を引き起こした。そこでAnthropicは、公式の技術解説を改めて公開し、次の三つの質問に集中的に回答した。この透かしとは何か、どのように機能するのか、出力品質を低下させるのか。
この変更はまず、コンプライアンス対応として始まった。EUはAI生成コンテンツの透明性要件の実施を開始し、Anthropicは他の機関と関連する実務規範に署名した。署名機関は全体で約190だが、すべてがモデルベンダーというわけではない。現時点では地域ごとにのみ安定して有効化できないため、透かし計画は開始時にグローバルに適用される。他の主要なモデル開発会社もそれぞれのマーキング方式を導入するだろう。
しかし、これはコンプライアンスチームだけに影響するわけではない。学校は宿題にClaudeが使われたかどうかを判断するために、出版社は原稿を確認するために、企業はコンテンツ審査プロセスに組み込むために、これを使うかもしれない。したがって、技術がどのように機能するかは最初の質問に過ぎず、より重要なのは、検出結果がどこまで証明できるかである。
まず、今回の変更を四つの文に要約する。
- 透かしはテキストに隠された特殊文字ではなく、多くの単語選択によって形成される統計的規則である。
- トークンを追加せず、ユーザーや組織のIDを保持せず、テキストを特定の会話に遡ることもできない。
- 長いテキスト、完全な生成、翻訳はシグナルを蓄積しやすい。短文、コード、事実の段落、軽い校正は検出が難しい。
- 透かしが検出されたということは、Claudeが関与した可能性が高いことを意味するだけで、Claudeが作者であることを意味するものではなく、不正、権利侵害、コンテンツの虚偽を自動的に証明するものでもない。
この四つの文を理解した後、実際に最初に解き明かす必要があるのは、一見矛盾した質問である。何も追加していないのに、透かしは一体どこに隠されているのか?
どのように機能するのか?
モデルが単語を生成するたびに、通常「唯一の正解」に直面するわけではない。例えば「The weather today was cold and…」の後には、grey も overcast も続くことができる。どちらも自然で、意味もほぼ同じである。通常の生成は、これらの妥当な候補からランダムに一つを選択する。
Claudeのテキスト透かしは、このランダム選択のソースを変更する。鍵と直前のいくつかの単語を組み合わせて、今回どの候補が選択されやすいかを決定する。単一の単語を見ても何もわからない。十分な数の選択を組み合わせると、鍵を持つ人は、この一連の結果がその選択規則に継続的に適合しているかをチェックできる。
これは、最終的なテキストにスタンプを押すというよりも、ランダムプロセスを再確認可能なサイコロに交換するようなものである。サイコロは依然として妥当な候補間でのみ選択され、透かしを残すために、一般的な overcast を、奇妙で不自然な単語に突然置き換えるようなことはしない。
Anthropicは特に nubilous の例を挙げている。これも「曇った」を意味するが、非常に珍しく、Claudeは通常ほとんど使用しない。透かしはこのような単語を候補に無理やり追加するのではなく、モデルがもともとどちらでも意味が通ると考える選択肢の間でのみ機能する。
まず、このプロセスを実際に体験してみよう。候補語とモデルが示す例示的な確率は常に同じで、最終的な選択を決定する乱数ソースのみを切り替える。
候補語はそのまま、選択を決めるサイコロだけを変える
新しい語も候補確率も変えず、選択の連なりを同じ鍵で照合できるようにする。
Claudeは、Google DeepMindが2024年に『Nature』で発表したSynthID-Textのバージョンを使用している。この技術系統は、Scott Aaronson氏の2022年の提案まで遡ることができる。数世代にわたって共有される中核は、語彙を変更せず、「サイコロを振る」ソースのみを変更することである。生成時には多数の選択によって統計的バイアスが残り、検出時にはテキスト、鍵、および同じ規則を使用して一致度を計算する。生成モデルを再度呼び出す必要はない。
人生ゲームの類推で、これをさらに具体的に説明できる。通常のプレイでは毎回サイコロを振る。今度は、円周率の小数点以下のある桁から読み始め、その数字を順番に読んで歩数を決めるとする。プレイヤーはそれぞれのステップがランダムであると感じ、ボード、ルール、ゲーム体験は変わらない。しかし、後で完全な移動シーケンスを入手し、円周率と照合すれば、このゲームが通常のサイコロを使用していなかった可能性を判断できる。
仕組みが明確になったところで、当然の疑問が生じる。単語の選択を変えるだけで、コンテンツの品質は変わらないのだろうか?
出力品質は低下するのか?
Anthropicの社内テストでは、コンテンツ、創造性、読みやすさに実際の変化は観察されなかった。SynthID-Textの公開論文も、独立した方法論的証拠を提供している。Googleは、透かし入りと透かしなしのモデルを2,000万件近くのGemini応答に振り分けたが、二つのグループ間の高評価率と低評価率の差は統計的に有意ではなかった。管理された人間による並列比較でも、品質の違いは見つからなかった。
これは、あらゆる強度、あらゆる実装の透かしが本質的に無損失であることを意味するわけではない。SynthID-Text自体には、「検出しやすさ」と「分布の変更を少なくする」ことの間の設定上のトレードオフが存在する。ここで安全に導き出せる結論は、Anthropicが選択した実装は実際の品質への影響がないと主張しており、公開された方法は非歪曲構成が大規模に実行可能であることを証明している。Claudeの鍵、しきい値、および完全な構成は公開されていない。
ユーザー側でも、三つのことを確認できる。透かしは追加のトークンを生成しないため、追加料金は発生しない。生成速度への影響は無視できる程度である。透かし自体はユーザー、組織、チャット情報をエンコードしないため、「誰が尋ねたか」を回復することはできない。
エクスペリエンスへの影響が非常に小さいのに、なぜ検出結果を単純に「はい」または「いいえ」と書けないのか?透かしは、自由に選択できる多くの単語から証拠を蓄積する必要があるが、異なるタスクによってモデルに残される選択の余地は大きく異なるためである。
なぜ一部のテキストは検出されやすいのか?
完全に生成された長文では、モデルは同じくらい自然な複数の表現に繰り返し遭遇するため、透かしには多くの場所がある。翻訳も同様だ。ターゲット言語のほぼすべての単語を再選択する必要があるため、Claudeが生成した翻訳には透かしが含まれる。
しかし、校正は再創作ではない。テキストがもともと人間によって書かれ、Claudeがいくつかの句読点や文法上の誤りを修正しただけの場合、ほとんどの単語はClaudeによって選択されたものではないため、透かしが確認できないほど少なくなる可能性が高い。短いテキストにも同じ問題がある。サンプルが少なすぎて、統計的証拠が蓄積されない。
事実が密集したコンテンツとコードは、また別の制約がある。「2 + 2 =」の後に、透かしのために別の答えに変更することはできない。関数名、構文、正確な値もしばしば置き換える余地がない。コメントや説明文はシグナルを残す可能性があるが、プログラムが実行できるかどうかを本当に決定する部分では、透かしは通常より疎らである。
選択余地が信号密度を決める
Claudeを使えば必ず検出できるのではない。Claudeが実際に何語を選んだかが重要になる。
編集はシグナルをさらに薄める。軽微な変更は、おそらくすべてのパターンをすぐに消し去ることはないだろう。しかし、すべての文を完全に書き直すと、それを取り除くことができる。ここには公開された固定の文字数や編集比率はなく、実際の信頼度はテキストの長さ、コンテンツの種類、具体的な書き換え方法にも依存する。
したがって、「検出されない」ことは特に「Claudeが使用されていない」と解釈されるべきではない。次に、検出結果と結論の間の距離を明確にする必要がある。
検出結果は一体何を証明できるのか?
鍵を持つ検出器が答えることができるのは、このテキストの単語選択のシーケンスが、Claudeがその鍵を使用して生成したときの規則とどの程度一致しているかである。これは確率的な証拠であり、著者の署名ではない。
検出結果は二択の判決ではない
まず結果が支える最小限の結論を確認する。
この区別は、実際の審査において非常に重要である。ある人は、最初にアウトラインを書き、Claudeに拡張させるかもしれない。また、Claudeに下書きさせた後に自分で書き直すかもしれない。あるいは、Claudeに文法を修正させるだけかもしれない。透かしが存在しても、「Claudeがゼロから書いた」と「Claudeが大幅に編集した」という二つのプロセスを区別することはできず、誰が作品を所有するか、誰が法的責任を負うかを決定することもできない。
逆もまた同様だ。検出されないことは、テキストが短すぎる、コードや事実が多すぎる、軽い校正のみ行われた、後で書き換えられた、同じ鍵と方法を持たない他のモデルが使用された、などの理由による可能性がある。これは「人間によるオリジナルの証明書」ではない。
これはまた、透かし検出とPangramなどの汎用AIテキスト検出器との違いを説明している。汎用検出器はClaudeの鍵を知らず、言い回し、構文、その他のスタイル特徴から推測するしかない。透かし検出は、生成時に積極的に埋め込まれた統計的パターンをチェックする。どちらも手がかりを提供する可能性があるが、証拠のソースは同じではない。
Anthropicはまだ、検出APIの具体的なリリース時期、しきい値、価格、または使用権限を公開していない。これらの詳細が明らかになるまでは、「何文字で必ず検出される」「精度は何%に達する」といった主張は、資料によって裏付けられていない。
テキストは統計的パターンに依存できるが、画像やファイルにはより直接的な媒体がある。メタデータだ。ここから、別の技術セットに入る。
テキスト透かしとファイルクレデンシャルは同じものか?
Claudeが対応するPNG、JPG、SVGなどのファイルを生成または処理するとき、ファイルのメタデータにC2PA Content Credentialが添付される。これは、暗号署名され、ファイルにバインドされた来歴レコードであり、互換性のあるツールで、ファイルが誰によって処理されたか、宣言が改ざんされたかどうかを検証できる。
どちらも「関与」を記録するが、入れ物は異なる
- 入れ物
- 単語選択の並び
- 検証
- 鍵付きスコア
- 弱点
- 短文と全面的な書き換え
- 入れ物
- ファイルのメタデータ
- 検証
- 暗号署名
- 弱点
- メタデータを削除できる
両者の共通点は、Claudeの関与を記録し、特定のユーザー IDを記録しないことだ。違いは、テキスト透かしが単語選択の統計に分散しているのに対し、C2PAクレデンシャルはファイルが運ぶ構造化されたメタデータであることだ。後者は削除でき、前者は十分な書き換えによって破壊できる。どのメカニズムも、それ単独でコンテンツの真実性、品質、または権利の帰属を証明することはできない。
したがって、今回のアップデートで最も重要な製品は、「AI製」のスタンプではなく、新しいタイプの来歴の手がかりである。プラットフォームとレビュー担当者に、検証できる証拠を一つ追加し、ユーザーに結論の強さを制御することを学ばせる。
検出結果は実際にどう使うべきか?
陽性の結果を見て、「Claudeがこのコンテンツに参加した可能性が高い」と言うことはできる。参加の程度、作者の貢献、ルール違反かどうかをさらに判断するには、バージョン履歴、編集履歴、タスク要件、および当事者の作業プロセスを組み合わせる必要がある。
陰性の結果を見て、「現在のサンプルは、十分なClaude透かし証拠を形成していない」としか言えない。テキストの長さ、タスクのタイプ、編集の程度、モデルのバージョン、検出機能が結果を変える可能性があるため、「完全に人間が書いた」と逆推論することはできない。
これがテキスト透かしの真の価値と限界だ。「これはAIが書いたように見える」という感覚を、鍵で検証可能な統計的判断に推し進めるが、確率的判断を社会的判決に格上げすることはない。
透かしはClaudeが関与した可能性を認識できるが、誰が著者か、誰が作品を所有するか、誰がコンテンツに責任を負うかを決定することはできない。
Claude のテキスト透かしを一枚で理解
生成時の単語選択に使う乱数の出所を変え、検証可能な統計的痕跡を残す仕組みです。Claude の関与は示せても、著者や不正を断定することはできません。
まず正体を整理する
- 隠し文字ではないコピーや貼り付け、フォント変更で見つかる秘密の印ではありません。
- 統計的な規則多数の自然な単語選択が、鍵を持つ検出器で確認できるパターンになります。
透かしが文章に入るまで
- 自然な候補を保つモデルが元から自然だと判断した単語だけを候補にします。
- 乱数源を替える鍵と直前の語から、選択に使う乱数を決めます。
- 痕跡を蓄積する一語では分からなくても、長い列には規則が現れます。
- 鍵で検証する検出器が単語列と同じ規則の一致度を測ります。
現時点で品質低下は観察されていない
- 実トラフィック約2,000万件の Gemini 応答で、透かし有無による高評価・低評価の統計的有意差はありませんでした。
- 人による比較統制された並列評価でも、識別できる品質差は見つかりませんでした。
検出しやすさは選択の余地で変わる
- 信号が強い長文生成や翻訳は選択回数が多く、統計的証拠を蓄積しやすいです。
- 信号が弱い短文、コード、事実中心の文章、軽い校正は標本や言い換えの余地が少なくなります。
検出結果の読み方
- 陽性から言えることClaude がこの文章を処理した可能性が高い。
- 陽性でも決められないこと著者、不正、侵害、所有権、内容の真偽。
- 陰性から言えることこの標本には十分な Claude 透かし証拠がない。
- 陰性でも証明できないことClaude が一度も使われていない。
自然な単語選択が検出信号になるまで
モデルには元から複数の自然な言い方がある。
透かしは候補を変えず、乱数の発生源だけを変える。
一語では何も証明できない。十分な回数の選択があって初めて統計的痕跡が形成される。
自然な候補は壊れておらず、実際のトラフィックと人手による比較でも有意な品質差は見つからなかった。
選択の余地が小さく、サンプルが短いほど、信号は蓄積しにくい。
これは来歴の手がかりを提供するものであり、社会的・法的な判断を下すものではない。
