Generador de Robots.txt

Crea un robots.txt correcto con plantillas, reglas personalizadas, bloqueo de bots de IA y línea de sitemap — listo para descargar.

1.104 visitas

Lo Que robots.txt Realmente Hace

robots.txt es un archivo de texto plano en la raíz de tu dominio que indica a los rastreadores de los motores de búsqueda qué URL no deben obtener, usando un pequeño conjunto de directivas: User-agent (a qué bot se aplica la regla), Disallow (la ruta a omitir), Allow (una excepción tallada dentro de un Disallow más amplio), y Sitemap (dónde encontrar tu sitemap.xml). Los rastreadores bien portados como Googlebot leen este archivo antes de rastrear y lo respetan, que es exactamente por qué funciona para ahorrar presupuesto de rastreo y mantener fuera de la cola de rastreo las páginas de administración, las páginas de resultados de búsqueda y las URL filtradas.

Ejemplo concreto: añade Disallow: /admin/ y Disallow: /search?, y Googlebot dejará de gastar su presupuesto de rastreo limitado en tus pantallas de inicio de sesión y resultados de búsqueda internos, liberando ese presupuesto para las páginas que realmente quieres que se indexen. Pero aquí está la advertencia crítica que esta herramienta existe para enseñar: robots.txt no es una medida de seguridad. Solo guía a bots bien intencionados — un scraper malicioso, el bot de un competidor, o cualquiera con un navegador puede simplemente ignorar el archivo y solicitar directamente la URL no permitida, porque el propio archivo se sirve públicamente a cualquiera que lo pida en tudominio.com/robots.txt.

Lo Que Deberías Saber

Esto crea una trampa genuina: añadir Disallow: /panel-admin-secreto/ para mantener una ruta sensible fuera de los resultados de búsqueda en realidad publica su dirección exacta a cualquier persona o bot que lea el archivo, que es lo contrario de ocultarla. Si una página realmente necesita permanecer privada, la única protección real es el control de acceso — una contraseña, una comprobación de autenticación, o eliminarla por completo del alojamiento público — nunca robots.txt. Por separado, no permitir una URL no la elimina de un índice de búsqueda si ya está ahí o recibe enlaces externos; una página bloqueada aún puede aparecer en los resultados, normalmente sin descripción ya que al rastreador nunca se le permitió leer el contenido. La herramienta correcta para evitar la indexación es una etiqueta meta noindex o una cabecera HTTP, que requiere que la página sea rastreable en primer lugar.

  • El archivo debe estar exactamente en la raíz del dominio (ejemplo.com/robots.txt) — las copias colocadas en subdirectorios se ignoran, y cada subdominio necesita su propio archivo.
  • La incorporación moderna que gestiona este generador es si bloquear los rastreadores de entrenamiento de IA (GPTBot, CCBot, Google-Extended y similares). Bloquearlos mantiene tu contenido fuera de los datos de entrenamiento de modelos futuros, pero también te elimina de las respuestas generadas por IA que de otro modo podrían citarte y enlazar de vuelta a tu sitio — no hay una elección universalmente correcta, solo una contrapartida basada en tus objetivos.
  • Incluye siempre la directiva Sitemap apuntando a tu sitemap.xml — es la única línea del archivo que ayuda activamente a los rastreadores a encontrar tu contenido, en lugar de decirles qué omitir.

Preguntas Frecuentes

¿Dónde exactamente debe colocarse el archivo robots.txt?

Exactamente en la raíz del dominio — tudominio.com/robots.txt. Una copia dentro de una subcarpeta como tudominio.com/blog/robots.txt simplemente es ignorada por los rastreadores, y cada subdominio, como tienda.tudominio.com, necesita su propio archivo separado.

¿Puedo usar robots.txt para ocultar una página privada o sensible?

No, y hacerlo puede resultar contraproducente. El archivo es público, así que listar una ruta sensible bajo Disallow anuncia su URL exacta a cualquiera que lo lea. La privacidad real requiere control de acceso, como una comprobación de inicio de sesión o autenticación, no una directiva de rastreo.

Si no permito una URL, ¿desaparecerá de los resultados de búsqueda?

No necesariamente. Disallow solo detiene el rastreo, no la indexación — una página aún puede indexarse, a menudo sin descripción visible, si tiene enlaces desde otro lugar. Para eliminar realmente una página de los resultados de búsqueda, usa una etiqueta meta noindex o una cabecera HTTP en una página que los rastreadores aún puedan alcanzar.

¿Debería bloquear los bots de entrenamiento de IA como GPTBot?

Es una contrapartida genuina. Bloquearlos protege tu contenido de ser usado en el entrenamiento de modelos futuros, pero también te elimina de las respuestas generadas por IA que podrían citar y enlazar a tu sitio. Los editores están divididos casi por igual — decide según si el tráfico de referencia de IA importa para tu negocio.

¿Los bots maliciosos o los scrapers respetan robots.txt?

No, y esta es la mayor limitación del archivo. robots.txt depende por completo del cumplimiento voluntario — los rastreadores reputados como Googlebot lo respetan, pero los scrapers creados para recolectar contenido, datos de precios o correos electrónicos típicamente lo ignoran por completo. Es una guía para actores de buena fe, no una barrera contra los de mala fe.

Comentarios

Aún no hay comentarios — ¡sé el primero en escribir uno!

Herramientas Similares