訪問者の90%は人間ではない:30年続く映画データサイトの“切断”による生存

AIクローラーとエージェントのトラフィックが全体の90%を占めると、人間の訪問者はわずかになり、トラフィックは資産から負債に変わる。本記事は、映画データサイト「The Numbers」が30年続いた旧システムを放棄せざるを得ず再構築したことを基点に、マシントラフィックがサーバーを圧迫する背後にあるコストの論理とアーキテクチャの破綻を解き明かし、AI時代に従来のウェブサイトが直面する再構築の必要性とその判断の境界を推論する。

2026年3月5日、映画データサイトThe Numbersが突然オフラインになった。

30年運営され、約200万ページ、78396本の映画と236176人のデータを蓄積してきたデータベースにとって、これは定期的なメンテナンスによる停止ではなかった。その1週間後の3月13日、サイトは簡易版で復旧したが、過去のチャート、個別映画の詳細ページ、そして中核機能であるレポートビルダーはすべて削除された。

Stephen Followsの報道が創設者ブルース・ナッシュの言葉として伝えたところによると、これらすべての直接的な原因は、AIクローラーとエージェントのトラフィックが総トラフィックの90%を占め、サーバーが継続的に過負荷でクラッシュしたことにある。同時に、システムログにはバックドアを狙った悪意ある攻撃も記録されていた。その動機は予測市場に関係している可能性がある。PolymarketなどのプラットフォームがThe Numbersのデータを決済基準として利用しているため、データを先回りして入手することが取引上の優位につながるからだ。ただし、攻撃の具体的な技術的詳細や攻撃者の身元は現在に至るまで明らかにされておらず、ブルース・ナッシュ自身もこれ以上詳しくは述べていない。

人間の訪問者が端数になってしまうと、トラフィックは資産から負債に変わる。そこで核心的な問いが浮かび上がる。従来型のウェブサイトはすべてThe Numbersのような再構築に直面しているのか、その判断の境界線はどこにあるのか。

生き残りのための切断:30年のデータサイトが経験した8日間の機能停止

The Numbersはスタートアップ企業ではない。それは生きた化石だ。

1997年10月17日、ブルース・ナッシュはGeocities上にこのサイトを開設した。当時のインターネットはまだ荒野であり、ウェブページの数は少なく、検索エンジンも黎明期で、「クローラー」という言葉は今日のような不安を掻き立てる意味合いを持っていなかった。The Numbersは個人プロジェクトから徐々に業界ツールへと成長し、興行収入を追跡し、配給データを記録し、映画関係者やメディアに信頼できる数字のリファレンスを提供するようになった。

AIクローラーの大群が押し寄せる前、The Numbersの年間訪問者数は800万人を超えていた。垂直型データサイトとしては、かなり大きな規模だ。そのデータベースには、78396本の映画、178375件の配給記録、236176人の情報が格納され、総ページ数は約200万、ソースファイルは約16万件にのぼる。これらの数字は人間がブラウジングしていた時代には貴重なデータ資産であり、サイトのコアコンピタンスだった。しかし2026年3月のあの8日間、この老舗サイトは停電状態のような存続危機に見舞われた。

ブルース・ナッシュが明かしたところによると、旧システム時代には、チームの時間の90%がサイトの維持に費やされ、新機能の開発やデータの最適化には回らなかった。この数字自体が多くを物語っている。30年間稼働してきたシステムの技術的負債は、息が詰まるほどに積み上がっていたのだ。16万のソースファイルは、無数の依存関係、時代遅れのフレームワーク、忘れ去られたスクリプト、そして誰も手を出せない「ブラックボックス」モジュールを意味する。バグを一つ修正すれば新たなクラッシュを三つ引き起こし、機能を一つ追加すれば未知のサブシステムをダウンさせる可能性がある。

AIクローラーのトラフィックのピークが到来したとき、この旧アーキテクチャはまったく太刀打ちできなかった。

ここで理解すべき重要な技術的ポイントがある。従来のデータ型ウェブサイトのアーキテクチャは通常、人間のブラウジング向けに設計されている。一人のユーザーが一つのページにアクセスすると、サーバーは一度HTMLをレンダリングし、一度レスポンスを返し、ユーザーは数秒滞在した後に離脱する。このモードでは、人間のブラウジングには自然な「スロットリング」機構があるため、サーバーの同時接続負荷はコントロール可能だ。人間は読むのに時間を必要とし、1秒間に何百ものページをリクエストすることはない。

しかしAIクローラーには、こうしたスロットリングがない。それらはマシンの速度で動作し、極めて短時間に大量のリクエストを送ることができ、「読む」時間も、ページのレンダリング完了を待つ必要も、適切なリクエスト間隔さえも守らない。人間のブラウジング向けに設計された旧アーキテクチャが、マシンの速度で発せられる指数関数的なリクエストに直面したとき、その結果はサーバーの継続的な過負荷、データベースのコネクションプール枯渇、応答時間の急騰、そして最終的なクラッシュとなる。

この種の衝撃を受けたThe Numbersの旧システムには、もはや修正の余地がなかった。一つのクエリを最適化できても、16万のソースファイルには無数の非効率なクエリが潜んでいるかもしれない。サーバーを一台追加できても、旧アーキテクチャが水平スケーリングに対応していないかもしれない。キャッシュを追加しても、200万ページに及ぶロングテール分布ではキャッシュヒット率が極めて低い。旧システムにパッチを当てる限界費用は、まったく新しいインフラで再構築するよりもはるかに高い。

再開された簡易版サイトは、機能のアップグレードではなく、切断を伴う縮小だった。過去のチャートや詳細ページを削除したことは、大量のロングテールコンテンツを切り捨てることを意味する。それらのページこそ、構造化され直接消費できるデータを含んでいるため、AIクローラーが最も好んで抓取するターゲットなのだ。レポートビルダーを削除したことは、コアとなる有料ツールの性質を失わせ、プロダクトの商業的価値を犠牲にしてインフラの存続を確保したことを意味する。

この断固たる縮小の背後にあるのは、新しいトラフィックの前では旧アーキテクチャに修復の価値がまったくないという残酷な現実だ。30年の蓄積を放棄したこと自体が、「再構築の必要性」を判断する最良のサンプルなのだ。

1対3万8000の略奪:破られたトラフィックの暗黙の了解

The Numbersがなぜ押しつぶされたのかを理解するには、AIクローラーと従来の検索エンジン用クローラーの行動ロジックにおける本質的な違いを見極めなければならない。

かつてのインターネットの生態系では、サイトと検索エンジンの間に暗黙の価値交換の了解があった。サイトが検索エンジンにコンテンツのクロールを許可し、検索エンジンは検索結果を通じてサイトに人間の訪問者をもたらす。この了解は、比較的妥当な「交換比率」に基づいていた。Cloudflareのデータによると、Googleは1人の人間の訪問者を送るたびに、約5ページをクロールする。この比率が意味するのは、サイトが検索エンジンに対して支払う帯域幅のコストは、検索エンジンから還流する人間のトラフィックを通じて、つまり広告、サブスクリプション、ブランド露出などを通じて収益化できるということだ。これは採算の合う計算だった。

しかし、AIクローラーの登場は、このバランスを完全に破壊した。

同じくCloudflareのデータによれば、OpenAIは訪問者1人を送るたびに1000ページ以上をクロールし、Anthropicの交換比率は衝撃的な1対3万8000以上に達する。これは何を意味するか。AIクローラーはサーバーリソースを消費する一方で、同等の人間のトラフィックをほとんど還元しないということだ。データを持ち去り、モデルの訓練や検索要約の生成に使うが、ユーザーが最終的にそのデータを消費する場はサイト上ではない。ChatGPTで質問し、AI検索エンジンで要約を見る。サイトはデータサプライチェーンの見えない最下層のサプライヤーに過ぎない。

この一方的な略奪的クローリングは、トラフィック構造の逆転を直接的に引き起こす。

Cloudflare Radarのデータによると、2026年6月時点で、HTMLページリクエストに占めるボットの割合は57.5%に達し、人間のトラフィックは少数派となった。HUMAN Securityの2026年のレポートはさらに、エージェントトラフィックが2025年に7851%増加し、AIドリブントラフィック全体は187%増加したと指摘。オートメーショントラフィックの増加速度は人間のトラフィックの8倍に達している。ThalesのBad Bot Reportも同様の見解を示し、2025年にはボットが世界のウェブトラフィックの53%を占めたとしている。

これらの数字が総じて示す結論は、インターネットのトラフィック主体はすでに人間から機械に変わったということだ。

The Numbersのケースでは、トラフィックの90%が機械からのものだった。これらの機械の訪問者は広告をクリックせず、サブスクリプションを購入せず、いかなる商業的価値も生み出さないまま、実際に帯域幅と計算リソースを消費している。従来の「クロールを許しトラフィックを得る」というビジネスロジックは、1対3万8000という交換比率の前では完全に無力だ。データ型サイトの存続基盤――無料コンテンツで人間のトラフィックを惹きつけ、その人間のトラフィックで収益化するモデル――が、この不均衡なトラフィック構造によって揺るがされている。

さらに警戒すべきは、このトラフィック構造の変化が一時的なものではない点だ。AI検索、AIアシスタント、AIエージェントなど、ますます多くのAIアプリケーションがリアルタイムのデータ取得に依存するようになるにつれ、機械トラフィックの割合は上昇の一途をたどるだろう。Cloudflareのデータでは、2026年上半期のAIクローラーのリクエストのうち、52.3%が訓練用、34.2%が混合用途、10.1%が検索用で、ユーザーによってトリガーされたのはわずか2.6%にとどまる。これは、AIトラフィックの大多数が「受動的な応答」ではなく「能動的なクローリング」であり、人間のユーザーが減っても減少しないことを意味している。

計算不能なサーバーコスト:機械の訪問者の実際の費用

機械のトラフィックは実際にどれだけの費用がかかるのか?The Numbersは具体的な帯域幅やサーバーコストの金額を公表していないが、他の類似事例からその一端をうかがい知ることができる。

オープンソースのドキュメントホスティングプラットフォームであるRead the Docsは、公式ブログで衝撃的な数字を明らかにした。単一のAIクローラーが1か月で73TBの帯域幅を消費し、そのコストは5000ドルを超えたという。非営利組織にとって、これは存続を脅かしかねない追加支出だ。さらに腹立たしいのは、Read the Docsが、これらのクローラーが必ずしもrobots.txtのルールを守っていないことを発見した点だ。クローラーはサイトのクロール制限を無視し、自分たちのペースと方法でデータを取得できるのだ。

ウィキメディア財団の状況はより典型的だ。同財団の公式ブログによると、マルチメディアコンテンツの帯域幅需要は2024年初頭から50%増加したが、そのうち65%の高コストなトラフィックはボットによるもので、これらのボットはページビュー全体の35%に過ぎないという。これは、ウィキペディアが機械による訪問者のために不釣り合いなインフラコストを支払っていることを意味する。さらに深刻なのは、AIによる検索要約の普及により、ユーザーはWikipediaのページをクリックしなくても回答を得られるようになり、Wikipediaへの人間のトラフィックが2025年5月から8月にかけて前年同月比で8%減少したことだ。トラフィックコストが上昇する一方で、収益化可能な人間のトラフィックは減少しており、この「はさみ状」の差がコンテンツプラットフォームの利益を蝕んでいる。

维基百科の状況は、より深層にある問題を浮き彫りにしている。AIはウェブサイトの帯域幅を消費しているだけでなく、サイトへの人間のトラフィック流入経路をも断ち切っているのだ。AI検索エンジンが検索結果ページで直接回答のサマリーを表示すれば、ユーザーが元のリンクをクリックする理由はなくなる。これは、ウェブサイトがAIクローラーの帯域幅コストを負担しているだけでなく、AI検索サマリーの存在によって、本来還流するはずだった人間の訪問者までも失っていることを意味する。コスト上昇と収入減少という二重の打撃である。

中小チームにとっては、状況はさらに絶望的だ。コードホスティングサービス「SourceHut」の創業者Drew DeVaultはブログで怒りをあらわにし、毎週、運用時間の20%から100%をクローラー対策に費やしており、そのために週に数十回の短時間ダウンが発生していると述べた。彼の怒りは直接的かつリアルなものだ——「お前のコストを俺の顔に外部化するのをやめろ」。これは技術的な問題ではなく、公正さの問題なのだ。AI企業はデータ収集のコストをコンテンツ生産者に転嫁している。

LWNの編集者Jonathan Corbetは、このようなクローラートラフィックを「まさにDDoS攻撃だ」とまで断じている。従業員わずか7名のEコマース企業Triplegangersは、OpenAIのGPTBotが営業時間中に猛烈な勢いでクロールしたためにサイトがダウンし、CEOはこれを「基本的にDDoS攻撃だ」と語った。iFixitは、AnthropicのClaudeBotが1日で自社サイトに対し100万近いリクエストを送ってきたことを記録している。

これらの事例が証明しているのは、マシントラフィックは仮想的な数字ではなく、現実の帯域幅費用であり、現実のCPU占有であり、現実の運用人員の負担だということだ。The Numbersのサーバーが90%のマシントラフィックによって継続的に過負荷でクラッシュしていたとき、Bruce Nashが直面していたのは技術的な最適化の問題ではなく、帳尻の合わない生存問題だったのだ。

大まかな試算ができる。The Numbersの年間訪問者数が800万人を超え、マシントラフィックが90%を占めるとすれば、マシンリクエスト数は少なくとも数千万レベル、あるいはそれ以上になる(クローラーの取得深度は人間のブラウジングをはるかに超えるため)。たとえ1回あたりのリクエストコストがごくわずかでも、累積する帯域幅と計算リソースの消費は、エンタープライズ級のインフラを持たない独立系チームにとっては採算が合わなくなるのに十分だ。Bruce Nashが旧システムを放棄する選択をしたのは、彼が技術を理解していなかったからではなく、旧来のコスト構造のもとでは、そのサイトを維持できなくなっていたからだ。

最も脆弱なサイトとは?再構築の必要性を判断する境界線

The Numbersの崩壊は、すべてのウェブサイトが直ちに再構築しなければならないことを意味するのだろうか。答えはノーだ。再構築の必要性は、サイトのタイプとトラフィック構造に依存する。

最も脆弱なのは、The Numbersのようなデータ集約型サイトだ。それらには通常、いくつかの共通する特徴がある。

第一に、ロングテールページの多さだ。The Numbersには200万のページがあり、その一つひとつがAIクローラーの取得対象になりうる。ロングテールページが多ければ多いほど、クローラーの取得範囲は広がり、サーバーが応答しなければならないリクエストも増える。数十ページしかない企業のコーポレートサイトであれば、クローラーに狙われても、さほど帯域幅への圧力は生じない。

第二に、コンテンツが静的に取得可能であることだ。The Numbersのデータページはログインなしでアクセスでき、クローラーは構造化された興行収入データ、俳優情報、配給記録などを直接取得できる。このような「丸裸」のデータ露出は、AIクローラーにとって理想的なデータソースとなる。

第三に、人間のトラフィックによる収益化への依存度が高いことだ。The Numbersのビジネスモデルは「無料コンテンツで人間の訪問者を集め、人間の訪問者が広告収入または有料コンバージョンを生む」というロジックに基づいていた。トラフィックの90%がマシントラフィックになったとき、このビジネスロジックは機能不全に陥る——マシンは広告をクリックせず、サブスクリプションも購入しない。

Box Office MojoとIMDbは同種の映画データサイトだが、そのリスク耐性は独立運営のThe Numbersをはるかに上回る。Box Office MojoはAmazonに買収された後、エンタープライズ級のインフラに支えられており、独立系サイトをはるかに超えるトラフィックの負荷に耐えられる。IMDbも同様にAmazon傘下であり、ログインウォールと有料層(IMDbPro)を備えているため、中核的なデータの一部は認証の背後に隠されており、クローラーはThe Numbersに対するようには無制限に取得することができない。

相対的に安全なのは、以下のようなサイトだ。

インタラクティブ型サイト。ソーシャルプラットフォームのように、中核的なコンテンツがユーザーのインタラクションから生まれ、大量のデータがログインの背後に隠されているため、クローラーが大規模に取得することは困難だ。クローラーが公開ページを取得したとしても、ソーシャル関係の動的ネットワークを複製することはできない。

リアルタイムサービス型サイト。EコマースやSaaS製品などがこれにあたる。Eコマースサイトの在庫と価格はリアルタイムで変動するため、静的に取得したデータの価値は限定的であり、鮮度も極めて悪い。SaaS製品の中核的価値はデータではなくサービスにあり、クローラーがそのビジネスロジックやバックエンド統合を直接複製することはできない。

ペイウォールまたは認証機構を持つサイト。ログインウォールはそれ自体がトラフィックのフィルターであり、未認証のクローラーは限られた公開コンテンツしか取得できず、The Numbersに対して行われたようなサイト全体への無差別取得は不可能だ。

したがって、あるサイトが再構築のプレッシャーに直面しているかどうかを判断する鍵は、2つの指標にある。データ露出面とトラフィック収益化依存度だ。もしサイトのデータが容易に取得可能で(ログイン不要、静的コンテンツ、ロングテールページの多さ)、かつビジネスモデルがそれらのデータによってもたらされる人間のトラフィック(広告や無料から有料への転換)に大きく依存しているならば、そのサイトはAIクローラーの次の標的となる。このタイプのサイトにとって再構築とは、単なる技術アーキテクチャのアップグレードではなく、ビジネスロジックそのものの書き換えを意味する。すなわち、マシン訪問者が支配的となった世界で、新たなコスト分担と価値収益化のメカニズムをいかに見出すかということだ。

逆に、データ露出面が小さく(ログインウォールの背後、リアルタイム変動、インタラクション生成)、あるいはビジネスモデルが人間の閲覧数による収益化に依存していない(B2Bサービス、APIライセンス、エンタープライズ契約)のであれば、当面はThe Numbersのような切断手術的な再構築を必要としない。必要なのは基本的なトラフィック監視と防御であり、全面刷新ではない。

防衛線と活路:サイト運営者の対応パス

AIクローラーの濁流を前に、サイト運営者や開発者に何ができるだろうか。

最も直感的な反応はrobots.txtの修正だ。しかし現実には、この防衛線はすでに有名無実化している。Read the Docsの事例が示すように、多くのAIクローラーはrobots.txtのルールを平然と無視する。HUMAN Securityのレポートも、多数のクローラーが正規の身元を偽装して検知を回避していると指摘している。Cloudflareのデータによれば、現在AIクローラーのリクエストのうち、サーバー側で403ステータスコードによって積極的に拒否されているのはわずか7.9%に過ぎない。アプリケーション層のルールだけでは、インフラ層からのトラフィックの衝撃を防ぎきれなくなっている。

robots.txtの形骸化は、本質的にはそれが「紳士協定」であることに起因する。クローラー運営者の自発的な遵守に依存しているのだ。検索エンジンの時代、Googleなどの企業にはrobots.txtを遵守するビジネス上の動機があった。継続的なコンテンツ供給を得るために、ウェブサイトとの良好な協力関係を維持する必要があったからだ。しかしAI企業の動機は異なる。彼らはモデルを訓練するために可能な限り多くのデータを必要としており、robots.txtを遵守することは一部のデータソースを放棄することを意味する。それは激しいモデル競争において競争上の不利となる。ルールを守る代償がルールを破る代償を上回るとき、紳士協定は崩壊するのだ。

真の対応は、インフラ層から始めなければならない。

2025年7月、CloudflareはPay-per-Crawlメカニズムを発表し、ウェブサイトがAIクローラーの取得行為に対して課金できるようにした。同社の公式発表によれば、2026年9月15日より、Cloudflareは未課金の「混合用途」クローラーをデフォルトでブロックする。これは、業界レベルで価値交換メカニズムを再構築しようとする重要な試みである。もしAI企業がモデル訓練や検索サマリー提供のためにデータを必要とするならば、そのデータを取得するための帯域幅と計算リソースのコストを負担しなければならない、というものだ。このメカニズムの実効性はまだ見極める必要があるが、正しい方向性を示している。マシントラフィックのコストを、コンテンツ生産者からデータ消費者へと戻すことだ。

独立系サイト運営者や中小スタートアップチームにとって、対応パスはいくつかの層に分けられる。

第一層は識別だ。ログ分析を通じてAIトラフィックの割合と発生源を明確にし、サーバークラッシュを単純な事業成長のせいにしないことだ。多くのサイト運営者は、サイトが遅くなったりダウンしたりしたとき、まずサーバーのアップグレードやコードの最適化を考える。しかし、マシントラフィックが根本原因であると識別しなければ、サーバーのアップグレードは単により高いコストでクラッシュを先延ばしにするだけであり、対症療法に過ぎない。The Numbersの事例では、Bruce Nashがトラフィックの90%がマシン由来であることを発見した。この認識そのものが、意思決定の出発点だったのだ。

第二層は隔離だ。エッジコンピューティングとWAF(Webアプリケーションファイアウォール)ルールを活用し、マシントラフィックを静的キャッシュや軽量レスポンスに誘導して、データベースや動的レンダリングロジックへの直接的な衝撃を回避する。データ集約型サイトにとって、これは高頻度リクエストのページを静的ファイルとしてプリレンダリングし、クローラーが取得するのはキャッシュされたHTMLであり、リアルタイムクエリの結果ではないようにすることを意味する。これは根本的な問題を解決するものではないが、再構築のための時間を稼ぐことができる。

第三層はビジネスモデルの再構築だ。訪問者の90%がもはや人間でないならば、人間の閲覧数に基づく広告モデルは調整を迫られる。可能性のある活路としては、API有料アクセス(AI企業に構造化データインターフェースの対価を支払わせる)、データライセンス(データをAI企業に直接ライセンスする商品として提供する)、より強固なログインウォール(中核データを認証の背後に移し、露出面を減らす)などがある。これらの方向性はいずれも単純な技術調整ではなく、ウェブサイトのビジネスモデルそのものの再定義である。

The Numbers は、30 年にわたる旧システムを放棄するという代償を払って、業界全体に警鐘を鳴らした。AI が閲覧数の主役となった新時代において、トラフィックはもはや単純な資産ではなく、慎重に採算を見極めるべき負債となりうる。従来型ウェブサイトの再構築は、「やるかやらないか」ではなく、その損得をきちんと計算したうえで、いかにして新たな存続ラインを見つけ出すかという問題である。データ集約型で、人間によるトラフィック収益化に依存する独立系サイトにとって、The Numbers の「今日」は、そのまま自らの「明日」になるかもしれない。一方で、データの露出面が小さく、閲覧数での収益化に依存していないサイトが今なすべきことは、警戒を怠らず、トラフィック構造の変化を継続的にモニタリングし、機械によるトラフィックが真の負担となる前に、あらかじめ防御線を張っておくことだ。

インターネットのトラフィックの主役はすでに入れ替わった。ウェブサイトの所有者は、そろそろ再計算すべき時だ。

共有先:

著者:OmniTools

本記事はPANews入駐コラムニストの見解であり、PANewsの立場を代表するものではなく、法的責任を負いません。

記事及び見解は投資助言を構成しません

画像出典:OmniTools。権利侵害がある場合は著者へ削除をご連絡ください。

PANews公式アカウントをフォローして、強気・弱気相場を一緒に乗り越えましょう
関連トピック
PANews APP
Circleが2.5億枚のUSDCステーブルコインを新規鋳造
PANews 速報