ろぼいんブログ

AI系クローラーのユーザーエージェント文字列一覧

緑色のロボットが膝の上にノートパソコンを載せた状態で座っている画像

諸事情でAI系サービスのクローラーのユーザーエージェント文字列を調べたので記事にまとめました。

robots.txtでこれらのユーザーエージェントをブロックすることで、AI系のサービスにコンテンツが利用されるのを防げます。

広告

robots.txtについては、こちらの記事を参照してください。

目次

OpenAI

ソース:Overview of OpenAI Crawlers - OpenAI API

OAI-SearchBot

  • 説明:ChatGPT searchの検索結果でWebサイトをリンクしたり表示したりするために使用
  • ユーザーエージェント文字列:OAI-SearchBot/1.0; +https://openai.com/searchbotを含む
  • IPアドレスの範囲:https://openai.com/searchbot.json

ChatGPT-User

  • 説明:ユーザーがChatGPTまたはCustomGPTに質問すると、ChatGPT-UserエージェントでWebページにアクセスすることがある
  • ユーザーエージェント文字列:Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/bot
  • IPアドレスの範囲:https://openai.com/chatgpt-user.json

GPTBot

  • 説明:生成AI基盤モデルのトレーニングに使用される可能性のあるコンテンツをクロールするために使用
  • ユーザーエージェント文字列:Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.1; +https://openai.com/gptbot
  • IPアドレスの範囲:https://openai.com/gptbot.json

Google

ソース:Google's common crawlers | Google Search Central  |  Documentation  |  Google for Developers

Google-Extended

  • 説明:Geminiモデルのトレーニング、GeminiアプリとVertex AI上のGoogle検索によるグラウンディング(GeminiにGoogleの検索結果を入力すること)に使用
  • ユーザーエージェント文字列:Googleのほかのクローラーと同一のユーザーエージェント文字列を使うため、個別のユーザーエージェント文字列はない。ただし、robots.txtでGoogle-Extendedを拒否すると、Gemini関連のクローリングをブロックできる
  • IPアドレスの範囲:不明

Perplexity

ソース:Perplexity Crawlers - Perplexity

PerplexityBot

  • 説明:Perplexityの検索結果でWebサイトをリンクしたり表示したりするために使用
  • ユーザーエージェント文字列:Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot)
  • IPアドレスの範囲:https://www.perplexity.com/perplexitybot.json

Perplexity‑User

  • 説明:ユーザーがPerplexityに質問すると、Perplexity‑UserエージェントでWebページにアクセスすることがある
  • ユーザーエージェント文字列:Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Perplexity-User/1.0; +https://perplexity.ai/perplexity-user)
  • IPアドレスの範囲:https://www.perplexity.com/perplexity-user.json

Anthropic(Claude)

ソース:Does Anthropic crawl data from the web, and how can site owners block the crawler? | Anthropic Help Center

ClaudeBot

  • 説明:トレーニング利用できる可能性のあるWebコンテンツを収集するために使用
  • ユーザーエージェント文字列:不明だがClaudeBotを含む
  • IPアドレスの範囲:不明

Claude-User

  • 説明:ユーザーがClaudeに質問すると、Claude-Userエージェントを使用してWebサイトにアクセスすることがある
  • ユーザーエージェント文字列:不明だがClaude-Userを含む
  • IPアドレスの範囲:不明

Claude-SearchBot

  • 説明:オンラインコンテンツを分析して、検索応答の関連性と正確性を高めるために使用
  • ユーザーエージェント文字列:不明だがClaude-SearchBotを含む
  • IPアドレスの範囲:不明

xAI(Grok)

ソース:XユーザーのAviさん: 「xAI Grok pretends to be an iPhone when browsing, to not get blocked. but is this legit? "Mozilla/5.0 (iPhone; CPU iPhone OS 18_0 like Mac OS X) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/18.0 Mobile/15E148 Safari/604.1" This hack worked for me 10+ years ago.」 / X

  • 説明:GrokがWeb検索をするときに使用
  • ユーザーエージェント文字列:Mozilla/5.0 (iPhone; CPU iPhone OS 18_0 like Mac OS X) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/18.0 Mobile/15E148 Safari/604.1(公式の発表ではなくソースに示した個人の検証)
  • IPアドレスの範囲:不明

記事をシェア

Xに共有するBlueskyに共有するMisskeyに共有するLINEに共有するThreadsに共有する

フォローして最新情報を入手

Googleの優先ソースに追加すると、このサイトの記事をGoogleで見つけやすくなります。また、ぜひXやRSSフィードもフォローしてください。

Googleの優先ソースとして追加するGoogleの優先ソースとして追加するXのロゴ
広告
著者のアイコン画像

生まれた時から、母国語よりも先にJavaScriptを使っていました。ネットの海のどこにもいなくてどこにでもいます。

Webフロントエンドプログラマーとして、TypeScriptを用いたWebアプリやブラウザー拡張機能を制作。Xのシャドウバン検知ツール「Shadowban Scanner」やリンクカード復活ツール「Restore Link Card」を公開し、国内外のメディアで紹介されました。iGEM 2023ではJapan-UnitedチームのWikiを制作してGrand Prizeの獲得に貢献。ブログではXやSNSの最新ニュース、不具合の検証と対処法、フロントエンド開発の知見を発信しています。