作者:王子伊,晚点 LatePost
編集|程曼祺
ビジネスロジックはテクノロジーロジックよりも重要である。
2026年9月10日、Anthropicは154ページの報告書を発表し、7つの中国のAIラボがClaudeに対する大規模な蒸留を行ったことを特定し、阻止したと述べた。
蒸留は本来、一般的なモデル訓練方法である。開発者はより強力なモデルでデータを生成し、そのデータを使って自社のモデルを訓練し、先行モデルを模倣させる。Anthropicは、許可なく、大規模かつ隠蔽的にモデルの能力を抽出する行為を「不正蒸留(illicit distillation)」と呼んでいる。
Anthropicによると、関連機関は先端モデルの出力を抽出する際に、明らかに規約違反となる手段、例えば盗まれたクレジットカード、ログイン認証情報、APIキーを使用して大量の偽アカウントを一括作成していたという。
報告書はさらに、一部の中国のモデル企業がユーザーのリクエストをClaudeに転送したり、サードパーティのルーティングサービスからユーザーの会話を購入し、そのデータをモデル訓練に使用していたと述べている。会話の一部には、氏名、企業データ、有効なアクセス認証情報が含まれていた。
これはAnthropicが「蒸留攻撃」を非難した初めてのケースではない。2026年2月には、DeepSeek、月之暗面(Moonshot AI)、MiniMaxが約2万4000の偽アカウントを通じてClaudeと1600万回以上のインタラクションを行ったと主張した。その後、Anthropicは防御線を強化した。OpenAIとGoogleも継続的に蒸留攻撃を特定し、対応している。
これらの対策は蒸留を防げるのだろうか?
オーストラリア・グリフィス大学の助教授である劉芸氏は疑問を呈する。彼は長年、人工知能とサイバーセキュリティを研究しており、かつてQuantstampのAI研究科学者を務めた。彼が参加した2023年のプロンプトインジェクション研究は、世界的なセキュリティ組織OWASPのLLM 01項目に参考文献として掲載されている。また、彼はAnthropicのセキュリティ脆弱性報奨金を2度受賞し、トップクラスの商用モデルに対する思考連鎖窃取攻撃を研究したこともある。
劉氏が自身の核心的な判断を共有する:
Anthropicを例にとると、米国の先端モデル企業は現在、主に3層の蒸留防御線を設定している:
(1)敵対的データ抽出を検出するための専用分類器を使用し、モデルが疑わしいリクエストを内生的に拒否するようにする。
(2)アーキテクチャ設計において思考連鎖を隠蔽または圧縮してから出力する。
(3)外部検出器を使用してデータ抽出を識別し、その後リクエストを中断するかアカウントを停止する。
反蒸留は疑似命題である。理論上、蒸留を根絶することは難しく、米国の先端モデル企業にとってより現実的な目標は、データ収集コストを引き上げ、競合他社の足を引っ張り、リードタイムを延ばすことである。
米国の先端モデル企業にとって、反蒸留が守るのはモデルの能力だけではない。彼らが守らなければならないのは、技術的優位性の上に築かれた商業的価値でもある。
劉氏は、米国の先端モデル企業の反蒸留行動を理解するには、ビジネスロジックがテクノロジーロジックよりも重要だと考える。
Anthropicは蒸留の疑いのある行動を特定できても、蒸留の確証を得るのは難しい
晚点 :Anthropicが9月10日に発表した報告書で、7つの中国のAIラボを不正蒸留で非難しました。ここでいう「蒸留攻撃」とは具体的に何を指すのでしょうか?
劉芸:現在主流の大規模言語モデルは、ユーザーの入力、中間推論の思考連鎖、モデルの出力の3つの部分から構成されています。現在、AnthropicやOpenAIは中間の思考連鎖を隠蔽し、最終的な回答のみを提供します。複雑な推論タスクにおいて、思考連鎖を引き出すこと自体が蒸留攻撃の一種です。
晚点 :推論軌跡やエージェントの完全な軌跡などのデータが、モデル能力の向上にとってなぜそれほど重要なのですか?
劉芸:思考連鎖は、より強力なモデルがすでに作成した解答例のようなものだと考えることができ、モデル訓練に使用できる高品質なデータです。
大規模言語モデルの性能は、パラメータ数(N)、データ量(D)、計算量(C)の3つによって決まります。パラメータ数は各社とも比較的急速に増加していますが、時間と計算資源が限られている中で、企業がより速くモデル能力を向上させるためには、より多くの高品質なデータが必要です。
しかし、複雑で長期的なタスクのための高品質なデータを構築することは非常に難しく、現実世界における価値ある訓練データはますます少なくなっています。そのため、一部の大規模言語モデル企業は、様々な方法でより高度なモデルを蒸留しています。
晚点 :どのようにして思考連鎖やより多くのタスク軌跡を引き出すのですか?
劉芸:これには様々なテクニックの組み合わせがあります。例えば、エンコーディング、ジェイルブレイク、プロンプトインジェクション、そして様々な催眠術を駆使して、AIにペルソナを設定し続け、自分は研究者であり、困難だが意義深い仕事をしており、そのタスク解決に集中する必要があると信じ込ませます。私は国内の人々とあまり交流していませんが、海外でAIをやっている人たちがこのように思考連鎖を再現していることを知っています。基本的に論文を見れば、皆さんの考え方は理解できます。
ネイティブな思考連鎖を直接取り出す以外にも、入力と出力に基づいて中間の思考連鎖を合成することも試みられています。一部のデータ企業は、長期的なタスクの思考連鎖を専門に販売しており、1つあたり800~1000元だそうです。
晚点 :Anthropic、OpenAI、Googleの中で、最も蒸留されているのはどれですか?
劉芸:現在の公開報道によれば、Anthropicでしょう。しかし、はっきりとは言えません。DeepSeek、GLM、Kimi、Anthropic、OpenAIの各社の思考連鎖の実際のテキストを見ましたが、言語スタイルに大きな違いはありませんでした。誰が誰を蒸留しているのかは断定できず、最初は彼らもDeepSeekを蒸留していた可能性があります。
晚点 :技術的には通常、どのように蒸留攻撃を特定するのですか?「このリクエスト群は蒸留のようだ」から「これは特定の組織による蒸留である」まで、どのような証拠連鎖が必要ですか?
劉芸:Anthropicは主に呼び出し動作に基づいて判断しています。例えば、特定のアカウントが突然大量のリクエストを送信し、特定の固定データセットを集中的に抽出するような場合です。
Anthropicはまず異常なアカウントを特定し、次に異なるアカウント間で共有されるパターン、例えば同じシステムプロンプトを探します。各社が使用するエージェントアーキテクチャ(ハーネス)が異なり、システムプロンプトも異なるため、背後にある企業を特定できます。例えば、プレフィックスキャッシングを利用することで、Anthropicはどのプロンプト群が同じキャッシュを共有しているかを発見でき、それが既知のシステムプロンプトと一致しなければ、蒸留者を容易に特定できます。
晚点 :異常アカウントを特定した後、Anthropicは自社のデータが特定のモデルの訓練に使用されたことをさらに確実に証明できますか?
劉芸:100%確実に証明するのは非常に困難です。ある企業がClaudeの蒸留を試みたと非難することはできても、特定のデータが実際に相手のモデルに入力されたことを証明するのは難しいのです。
GLM、Kimi、DeepSeekはすべてオープンソースモデルですが、オープンソースにされているのは重みだけで、データセットは公開されていません。そして、モデルの重みから蒸留の確証を得ることは非常に困難です。もしそれが可能なら、Anthropicは報告書であのように曖昧な表現をする必要はなく、中継局の運用について重点的に説明するだけだったでしょう。本質的には、ホワイトボックス的な方法で分析できないからです。
別の例を挙げると、大規模言語モデルに『ハリー・ポッター』第1巻の最初の100語を尋ねると、高い確率で答えてくれるでしょう。しかし、これはモデルが原著を直接訓練したことを意味するわけではなく、原文を引用したブログや書評を訓練した可能性もあります。
晚点 :つまり、「蒸留攻撃」は完全に証明することも、反証することも非常に難しいということですね。
劉芸:Anthropicはプラットフォーム側の呼び出し記録、アカウントの関連付け、インフラ情報を通じて、比較的強い帰属の証拠を形成することはできます。しかし、これは、最終的なモデル自体から、特定のClaudeデータ群が確かに訓練に使用されたことを証明することとは、全く異なる問題です。後者は技術的に非常に困難です。
反蒸留は競合他社の収集コストを引き上げるが、「巻き添え」で一般ユーザーに影響を与える可能性もある
晚点 :現在、米国の先端AI企業は、蒸留攻撃に対抗するためにどのような具体的な技術的手法を採用していますか?
劉芸:私は3つのカテゴリーに分類できると考えています。
第一に、組み込み型検出です。Anthropicはおそらく思考連鎖抽出に特化した分類器を持っており、思考連鎖に関連する状態が活性化されたことを検出すると、抽出行為を阻止できます。
第二に、プロダクトアーキテクチャによる隠蔽です。モデルは生の思考連鎖を出力せず、まず圧縮、要約してから出力します。
第三に、外部検出器です。例えば、出力内容が自身の思考連鎖と重複しているかどうかを確認し、ある漏洩閾値に達した場合、出力を停止します。同様の行動が増えると、アカウントは停止されます。
晚点 :Anthropicの報告書にはこれらの詳細は含まれていませんでしたが、どのようにしてご存知なのでしょうか?
劉芸:これは私自身の推測です。なぜなら、これらは比較的一般的な操作だからです。なぜAnthropicは自身のセキュリティ防御策をテストするために脆弱性報奨金プログラムを発表するのでしょうか?それは、誰かがプロンプトをジェイルブレイクしたことを発見すれば、すぐにそれを自身の分類器に訓練させるためです。そのため、次の攻撃はますます難しくなります。
晚点 :あなたはAnthropicのセキュリティ脆弱性報奨金を2度受賞されましたが、その時はどのようなプロセスでしたか?
劉芸:当時、私は約2~3週間かけて、主にAnthropicが認可したバグ報奨金プログラムの範囲内で、そのセキュリティ分類器に対する敵対的テスト(Adversarial Testing)を実施し、既存の防御を回避できる入力を探しました。突破はゼロかイチ、成功か失敗のみで、0.5の状態はありません。当時のタスクの目標は、Anthropicが指定した問題を取得することであり、思考連鎖の再現には直接関与しませんでした。ただし、一部のロジックは類似しています。
晚点 :蒸留攻撃を防ぐための措置は、通常の購読ユーザーに誤って影響を与えることはないのでしょうか?
劉芸:通常の購読ユーザーは問題ないはずです。リスク管理に引っかかるのは主に異常なユーザー、例えば中継局のアカウントや、Claude への攻撃を試みるアカウントです。
Anthropic の報告書には、湖南省の某大学の学部生2人が独自にネットワークセキュリティ用のエージェントを設計し、それを使って様々なウェブサイトを攻撃していた事例も開示されていたと記憶しています。
理論上、あなたが Anthropic とやり取りした全ての情報は、同社が調べようと思えば調べられます。
晚点 :では、Anthropic がユーザーに脅威の可能性があると判断した場合、ユーザーデータを取得・閲覧できるのでしょうか?
劉芸:これは各モデル企業の利用規約を具体的に見る必要があります。私の知る限り、Anthropic、OpenAI、Google は特定の Zero Data Retention(ZDR、ゼロデータ保持)メカニズムを提供しており、タスク処理後直ちにユーザーが入力したプロンプトと AI が生成した応答を破棄し、保存せず、保持せず、モデルトレーニングにも使用しないことを約束しています。この機能は主に条件を満たす API またはエンタープライズ顧客を対象としており、通常は申請または追加設定が必要です。一般ユーザーが Claude、ChatGPT、Gemini を使用する場合のデータ保持ポリシーは、各社のユーザー契約に従って実行され、厳格な ZDR と同等ではありません。
例えば、モデル企業があなたのデータを少し書き換えてトレーニングに使用した場合、それはあなたのデータを使用したことになるのでしょうか?
晚点 :つまり、最先端モデルはユーザーに課金して使用させつつ、ユーザーデータを利用してスケールアップを続ける可能性があるということですか?
劉芸:そうです。例えば、ユーザーが Claude Code や Codex でモデルの回答を修正する場合、これらのフィードバックは非常に価値のある報酬信号となり、後続のトレーニングを改善できます。
蒸留も同じ論理です。現在のモデルの後続トレーニングは主に強化学習に依存しており、鍵となるのは報酬信号です。モデル企業がより高性能なモデルの思考連鎖を入手することは、「大きな結果」を手に入れることに等しく、高品質な問題解決経路を直接得ることになります。これにより、盲目的な探索を減らし、モデルをより早く良好な状態に収束させ、時間と計算資源を節約できます。
晚点 :アメリカの最先端モデル企業が蒸留攻撃を防ぐための成功基準は何ですか?
劉芸:第一に、他社のモデルが近道を使ってトレーニングするのを防ぎ、自社モデルの優位性を維持することです。第二に、他社の蒸留コストやデータ収集コストを引き上げることです。同時に、ユーザーの通常利用への影響を最小限に抑えることです。
晚点 :防ぐことは可能ですか?
劉芸:防ぎきれないと思います。モデルは人が使えるようにする限り、漏洩のリスクがあります。
ただ、最近 OpenAI が9月10日に Agents API のパブリックベータ版を正式にリリースしたのを見ました。以前の Responses API とは異なり、ユーザーが入力を与え、大規模モデルが出力を返し、その間に思考連鎖が挟まる方式でした。Agents API のロジックは、ユーザーがタスクを与え、直接タスクの結果を得るというものです。中間の思考連鎖やエージェントハーネスのプロセスは隠蔽され、実行環境全体を販売するようなものです。ユーザーは細かいことを気にする必要がなくなり、タスク実行全体がより抽象化されます。このようなシナリオでは、蒸留攻撃を試みるとしても、コストが高くなる可能性があります。
反蒸留の真の動機:世論の掌握と評価額の保護
晚点 :蒸留はモデル能力を向上させる最適解だと思いますか?後発の複製速度は、最先端のイノベーション速度に永遠に追いつけないように思えますが?
劉芸:以前、2024年時点では、短期的にはモデル構造自体の革新が参入障壁(堀)になるとの見解を持っていました。その後、参入障壁は計算資源に拡大する可能性があります。さらにその後、参入障壁はインフラストラクチャとエネルギーになるでしょう。現在、おおよそこの傾向に沿って発展していると観察しています。
晚点 :蒸留は、あなたのこの参入障壁の推論のどの部分に分類できますか?
劉芸:計算資源に分類できると思います。理論上は、何度も試せば見つけ出せるかもしれませんが、時間的に許されない可能性があります。
晚点 :反蒸留が最終的に守るものは何ですか?
劉芸:反蒸留は疑似問題です。理論上、蒸留は防御不可能です。人間の性として、あなたを蒸留する効率が、自分でデータを構築してモデルをトレーニングする効率よりも高ければ、必ず先にあなたを蒸留しに来るからです。
晚点 :アメリカの最先端AI企業の反蒸留は、敗北が決まっている戦いだと思いますか?
劉芸:はい。私の見解はそういうことです。
晚点 :技術的に敗北が決まっているなら、なぜアメリカの最先端AI企業はそれに固執するのでしょうか?
劉芸:技術的優位性を維持するためです。最近、OpenAI は約1万のAIエージェントを使用し、88時間かけて7つの「ミレニアム問題」のうちの1つの数学的証明を完了したと発表しました。例を挙げると、DeepSeek が今年の年末に、ミレニアム問題7つ全てを解決したと発表し、さらに技術報告書で「OpenAI の10分の1のコストでタスクを完了した」と書いたとします。アメリカの投資家は、「なぜあなたはこれほど多くの資金を必要とし、しかも他社より成果が劣るのか」と問うかもしれません。OpenAI の評価額は下落する可能性があります。
つまり、OpenAI などのアメリカの最先端モデル企業の反蒸留行為の本質は、科学技術発展の論理だけでなく、商業論理に基づいています:
Anthropic は第一にデータを収集し、自社のデータフライホイールを構築すること、第二に自社のARRをより良く見せ、IPOに備えることです。
OpenAI の論理も同様です。OpenAI がなぜ皆にリセットカードを配り続けるのか――それは押すたびに皆にお金を配るようなものですが――データを収集し、財務諸表をより良く見せるためです。
晚点 :9月12日、Anthropic の創業者ダリオ・アモデイが、業界全体に最先端AIモデルの反復速度を落とすよう呼びかけました。どう思いますか?
劉芸:彼らは何らかのボトルネックを認識しているのだと思います。ボトルネックには3つの要因が考えられます。一つはデータ、二つ目は計算資源、三つ目はインフラ/エネルギーです。しかし、具体的にどのボトルネックかは、今のところ断言できません。3つの要因全てが関係している可能性もあります。
資本は全て利を追求します。理論上、AGI を作り出せれば世界を席巻できるのであれば、開発を止める理由はなく、ただ突き進んで AGI を実現すれば良いのです。彼らはおそらく何らかのボトルネックに直面し、AI 安全の名の下に、「AI は危険すぎる。まず座ってAI開発の制限方法について議論しよう」と訴えかけているのでしょう。
晚点 :最先端モデル企業が反蒸留を行う本質的な理由は何だと思いますか?
劉芸:競合他社の蒸留コストを引き上げ、自社の優位性を維持することです。彼らはおそらく、中国のモデルがすぐに追いついてくると判断しているものの、優位性を維持するためのより良い方法が思いつかず、制限を強化し、まず世論の高地を占拠するしかないのでしょう。
業界の共通認識としては、蒸留は大きなセキュリティ問題であり、知的財産の窃取に相当します。しかし、実用性の観点から言えば、これは本質的にAIの平等化です。蒸留は市場のバランスを迅速に取る方法の一つです。多くの競合他社がいるからこそ、あるモデル企業が独占し、一社が幅を利かせて、好きなように価格を設定することができないのです。
晚点 :蒸留の積極的な価値について触れられましたが、一方で蒸留は業界全体や一般ユーザーにどのような潜在的な害をもたらす可能性がありますか?
劉芸:業界にとっては、各社の出力スタイルが同質化し、モデルが教師モデル由来の特定の失敗パターンを継承することです。ユーザーにとっては、プライバシー漏洩のリスクがあります。
晚点 :全体として、蒸留の攻防を含むAIセキュリティ分野はどのような状態にあり、どのような課題に直面していると思いますか?
劉芸:私がより注目しているのは、AIセキュリティとビジネスインセンティブの間にある構造的な緊張関係です。
モデル企業は確かにセキュリティに多大なリソースを投入していますが、特定のシナリオでは、より厳格なセキュリティ対策がモデルの能力に影響を与えたり、製品リリースを遅らせたり、ユーザー体験を低下させたりする可能性があるため、セキュリティ目標と競争目標は常に完全に一致するとは限りません。したがって、重要なガバナンス問題は、セキュリティへの投資と企業のビジネスインセンティブをどのように一致させるかです。少なくとも短期的には、セキュリティ問題を解決しつつモデルの性能を犠牲にしない、エレガントな解決策を見つけることは困難です。
晚点 :蒸留攻撃は今後どのように発展すると思いますか?
劉芸:攻防は続き、動的なバランスに達するでしょう。いくつかの流派が現れる可能性があります。一つは、思考連鎖を必要とせず、直接蒸留を開始し、最先端モデルをどこまで蒸留できるかを探求するもの。二つ目は、思考連鎖が必要な場合に、ネイティブな思考連鎖を取得するもの。三つ目は、自分で思考連鎖を合成するものです。
晚点 :プライバシーデータの漏洩を避けるために、一般ユーザーに何かアドバイスはありますか?
劉芸:中継局を使わないことです。特定のモデルを使用する際に、自分のデータをトレーニングに使用することを許可するかどうかの選択肢がある場合は、許可しないを選んでください。それ以外にできることはあまり多くありません。結局のところ、向こうが刃物で、こちらが魚の身ですからね。


