robots.txt生成ツール

テンプレート、カスタムルール、AIボットのブロック、サイトマップ行を使って正しいrobots.txtを作成 — すぐにダウンロードできます。

1,101回閲覧

robots.txtが実際に行うこと

robots.txtは、ドメインのルートに置かれるプレーンテキストファイルで、検索エンジンのクローラーにどのURLを取得すべきでないかを、少数のディレクティブで伝えます:User-agent(そのルールがどのボットに適用されるか)、Disallow(スキップするパス)、Allow(より広いDisallowの中に設ける例外)、そしてSitemap(sitemap.xmlの所在)です。Googlebotのようなルールに従うクローラーは、クロールを始める前にこのファイルを読み、それに従います — これこそが、クロール予算を節約し、管理画面や検索結果ページ、フィルター済みURLをクロールキューから除外するのに役立つ理由です。

具体例:Disallow: /admin/Disallow: /search?を追加すると、Googlebotは限られたクロール予算をログイン画面やサイト内検索結果に費やすのをやめ、その予算を実際にインデックスしてほしいページに振り向けます。しかし、このツールが教えるために存在する重要な警告はこうです:robots.txtはセキュリティ対策ではありません。これは善意のボットを誘導するだけです — 悪意あるスクレイパーや競合他社のボット、あるいはブラウザを持つ誰でも、このファイルを単純に無視して禁止されたURLを直接リクエストできます。なぜなら、ファイル自体がyourdomain.com/robots.txtで求める誰にでも公開されているからです。

知っておくべきこと

これは本物の罠を生み出します:機密性の高いパスを検索結果から除外するためにDisallow: /secret-admin-panel/を追加すると、実際にはそのファイルを読むすべての人やボットにその正確なアドレスを公開してしまいます — これは隠すこととは正反対です。あるページが本当に非公開である必要があるなら、唯一の本当の保護策はアクセス制御です — パスワード、認証チェック、あるいは公開ホスティングから完全に取り除くこと — 決してrobots.txtではありません。別の問題として、あるURLをDisallowにしても、それがすでに検索インデックスに存在するか、外部からリンクされている場合には、インデックスから削除されません。ブロックされたページは、クローラーが内容を読むことを許可されなかったため通常は説明文なしで、それでも検索結果に表示され得ます。インデックスを防ぐ正しい手段はnoindexメタタグまたはHTTPヘッダーであり、これにはそもそもページがクロール可能である必要があります。

  • このファイルは必ずドメインのルートに置く必要があります(example.com/robots.txt) — サブディレクトリに置かれたコピーは無視され、各サブドメインにはそれぞれ専用のファイルが必要です。
  • このジェネレーターが扱う現代的な追加項目は、AI学習用クローラー(GPTBot、CCBot、Google-Extendedなど)をブロックするかどうかです。ブロックすると、あなたのコンテンツを将来のモデル学習データから守れますが、同時に、あなたのサイトを引用しリンクを返してくれるかもしれないAI生成の回答からも除外されてしまいます — 普遍的に正しい選択はなく、あなたの目標に基づくトレードオフがあるだけです。
  • sitemap.xmlを指すSitemapディレクティブは必ず含めてください — これは、クローラーに何をスキップすべきかを伝えるのではなく、コンテンツを見つける手助けを積極的に行うファイル内の唯一の行です。

よくある質問

robots.txtファイルは正確にどこに置く必要がありますか?

正確にドメインのルートです — yourdomain.com/robots.txt。yourdomain.com/blog/robots.txtのようなサブフォルダ内のコピーは、クローラーによって単純に無視されます。また、shop.yourdomain.comのような各サブドメインには、それぞれ専用のファイルが必要です。

robots.txtを使って非公開・機密のページを隠すことはできますか?

いいえ、そしてそうすることは逆効果になり得ます。このファイルは公開されているため、機密性の高いパスをDisallowの下に記載すると、それを読む誰にでも正確なURLを公開してしまいます。本当のプライバシー保護には、クローラーへの指示ではなく、ログインや認証チェックのようなアクセス制御が必要です。

あるURLをDisallowにすると、検索結果から消えますか?

必ずしもそうではありません。Disallowはクロールを止めるだけで、インデックスを止めるわけではありません — 他の場所からリンクされていれば、ページは表示可能な説明文なしで、それでもインデックスされることがあります。ページを実際に検索結果から削除するには、クローラーがまだアクセスできるページ上でnoindexメタタグまたはHTTPヘッダーを使用してください。

GPTBotのようなAI学習ボットはブロックすべきですか?

これは本物のトレードオフです。ブロックすることで、あなたのコンテンツが将来のモデル学習に使われるのを防げますが、同時に、あなたのサイトを引用しリンクしてくれるかもしれないAI生成の回答からも除外されます。パブリッシャーの意見はほぼ半々に分かれています — AI経由の紹介トラフィックがあなたのビジネスにとって重要かどうかで判断してください。

悪意あるボットやスクレイパーはrobots.txtに従いますか?

従いません。そしてこれがこのファイルの最大の限界です。robots.txtは完全に自主的な遵守に依存しています — Googlebotのような信頼できるクローラーはこれを尊重しますが、コンテンツや価格データ、メールアドレスを収集するために作られたスクレイパーは、通常これを完全に無視します。これは善意ある行為者へのガイダンスであり、悪意ある行為者への障壁ではありません。

コメント

まだコメントはありません — 最初のコメントを書いてみましょう!

関連ツール