Robots.txt 생성기

프리셋, 사용자 지정 규칙, AI 봇 차단, 사이트맵 줄까지 포함한 올바른 robots.txt를 만들어 바로 다운로드하세요.

조회수 1,106회

robots.txt가 실제로 하는 일

robots.txt는 도메인 루트에 위치한 일반 텍스트 파일로, 검색엔진 크롤러에게 어떤 URL을 가져가지 말아야 하는지 몇 가지 지시어로 알려줍니다: User-agent(규칙이 적용되는 봇), Disallow(건너뛸 경로), Allow(더 넓은 Disallow 안에서 예외로 두는 부분), Sitemap(sitemap.xml의 위치)입니다. Googlebot처럼 규칙을 준수하는 크롤러는 크롤링을 시작하기 전에 이 파일을 읽고 따르며, 바로 이 때문에 크롤링 예산을 절약하고 관리자 페이지, 검색 결과 페이지, 필터링된 URL을 크롤링 대기열에서 제외하는 데 효과적입니다.

구체적인 예를 들면, Disallow: /admin/Disallow: /search?를 추가하면 Googlebot은 제한된 크롤링 예산을 로그인 화면과 내부 검색 결과에 쓰지 않게 되고, 그 예산은 실제로 색인되기를 원하는 페이지에 쓰이게 됩니다. 하지만 이 도구가 존재하는 이유이기도 한 중요한 경고가 있습니다: robots.txt는 보안 수단이 아닙니다. 이는 선의를 가진 봇만 안내할 뿐입니다 — 악성 스크레이퍼, 경쟁사의 봇, 혹은 브라우저를 가진 누구든 이 파일을 무시하고 차단된 URL을 직접 요청할 수 있습니다. 파일 자체가 yourdomain.com/robots.txt에서 요청하는 누구에게나 공개적으로 제공되기 때문입니다.

알아두어야 할 사항

여기서 진짜 함정이 생깁니다: 민감한 경로를 검색 결과에서 제외하려고 Disallow: /secret-admin-panel/을 추가하면, 실제로는 그 정확한 주소를 이 파일을 읽는 모든 사람과 봇에게 공개하는 셈이 되어 오히려 숨기려던 것과 정반대의 결과를 낳습니다. 페이지가 정말로 비공개 상태를 유지해야 한다면 유일하게 실질적인 보호 수단은 접근 제어입니다 — 비밀번호, 인증 확인, 혹은 공개 호스팅에서 완전히 제거하는 것이지 robots.txt가 아닙니다. 또한 어떤 URL을 Disallow 처리해도, 그 URL이 이미 색인되어 있거나 외부에서 링크를 받고 있다면 검색 색인에서 제거되지 않습니다. 차단된 페이지는 여전히 검색 결과에 나타날 수 있으며, 대개 크롤러가 콘텐츠를 읽도록 허용된 적이 없기 때문에 설명 없이 표시됩니다. 색인 생성을 실제로 막는 올바른 방법은 noindex 메타 태그나 HTTP 헤더이며, 이는 페이지가 애초에 크롤링 가능해야 한다는 전제를 요구합니다.

  • 이 파일은 반드시 도메인 루트에 정확히 위치해야 합니다(example.com/robots.txt) — 하위 폴더에 둔 사본은 무시되며, 각 서브도메인마다 자체 파일이 필요합니다.
  • 이 생성기가 다루는 최신 항목은 AI 학습용 크롤러(GPTBot, CCBot, Google-Extended 등)를 차단할지 여부입니다. 이를 차단하면 콘텐츠가 향후 모델 학습 데이터에서 제외되지만, 동시에 여러분의 사이트를 인용하고 링크로 연결해 줄 수 있는 AI 생성 답변에서도 제외됩니다 — 보편적으로 올바른 선택은 없으며, 오직 목표에 따른 트레이드오프만 있을 뿐입니다.
  • 항상 sitemap.xml을 가리키는 Sitemap 지시어를 포함하십시오 — 이는 파일 안에서 크롤러에게 무엇을 건너뛸지 알리는 대신, 콘텐츠를 찾도록 적극적으로 도와주는 유일한 줄입니다.

자주 묻는 질문

robots.txt 파일은 정확히 어디에 두어야 하나요?

정확히 도메인 루트에 두어야 합니다 — yourdomain.com/robots.txt. yourdomain.com/blog/robots.txt처럼 하위 폴더에 둔 사본은 크롤러에게 그냥 무시됩니다. 그리고 shop.yourdomain.com처럼 각 서브도메인은 자체 파일이 필요합니다.

robots.txt로 비공개 페이지나 민감한 페이지를 숨길 수 있나요?

아니요, 오히려 역효과를 낼 수 있습니다. 이 파일은 공개되어 있으므로 민감한 경로를 Disallow 아래에 나열하면 그것을 읽는 모든 사람에게 정확한 URL을 알리는 셈이 됩니다. 진정한 비공개 상태는 크롤러 지시어가 아니라 로그인이나 인증 확인 같은 접근 제어가 필요합니다.

URL을 disallow 처리하면 검색 결과에서 사라지나요?

반드시 그런 것은 아닙니다. Disallow는 크롤링만 막을 뿐 색인 생성은 막지 않습니다 — 다른 곳에서 링크를 받고 있다면 페이지는 여전히 색인될 수 있으며, 대개 눈에 보이는 설명 없이 표시됩니다. 페이지를 실제로 검색 결과에서 제거하려면, 크롤러가 여전히 접근할 수 있는 페이지에 noindex 메타 태그나 HTTP 헤더를 사용하십시오.

GPTBot 같은 AI 학습용 봇을 차단해야 하나요?

이는 진정한 트레이드오프입니다. 차단하면 콘텐츠가 향후 모델 학습에 사용되는 것을 막을 수 있지만, 동시에 여러분의 사이트를 인용하고 링크할 수도 있는 AI 생성 답변에서도 제외됩니다. 퍼블리셔들은 거의 반반으로 나뉘어 있습니다 — AI를 통한 유입 트래픽이 사업에 중요한지에 따라 결정하십시오.

악성 봇이나 스크레이퍼도 robots.txt를 준수하나요?

아니요, 이것이 이 파일의 가장 큰 한계입니다. robots.txt는 전적으로 자발적인 준수에 의존합니다 — Googlebot 같은 평판 좋은 크롤러는 이를 따르지만, 콘텐츠나 가격 데이터, 이메일을 수집하도록 만들어진 스크레이퍼는 대개 이를 완전히 무시합니다. 이것은 선의의 참여자를 위한 안내일 뿐, 악의적인 참여자를 막는 장벽은 아닙니다.

댓글

아직 댓글이 없습니다 — 첫 댓글을 남겨보세요!

비슷한 도구