Generador y Probador de Robots.txt

Crea un robots.txt con preajustes para bloquear rastreadores de IA, cerrar staging y WordPress, más un probador de reglas. Gratis, privado, sin subida.

🌐 English

Start from a preset:

Rule group 1

Generated robots.txt

Tester — is a path allowed for a given bot?

Checks the rule groups above (not the live site) against the path/bot you enter, using the longest-matching-rule-wins convention real crawlers follow.

🔒 Privado por diseño: todo funciona localmente en tu navegador; nada se sube nunca a ningún servidor.

Un acuerdo de caballeros de 1994, no un candado

El robots.txt empezó como una convención informal entre los autores de los primeros rastreadores web y siguió siendo informal durante décadas antes de escribirse por fin como estándar. Esa historia explica sus dos propiedades peor entendidas.

La primera: es enteramente consultivo. Un rastreador lee el archivo, decide respetarlo y se salta las rutas que has listado. Un rastreador al que le da igual sencillamente las pide. No hay ninguna imposición en ningún punto de la cadena, y por eso una línea Disallow se parece más a un cartel en una puerta que a una cerradura.

La segunda: es público por diseño. Tu robots.txt está en una URL fija y adivinable que cualquiera puede abrir. Escribir Disallow: /interno/exportaciones/ anuncia la existencia de ese directorio a toda persona que se le ocurra mirar. Si una ruta es sensible, este archivo es el sitio equivocado para nombrarla; bloquea el directorio padre o, mejor, pon autenticación de verdad delante.

Las dos cosas importan sobre todo para el preajuste de bloqueo de un entorno de pruebas. Sí mantiene fuera a los buscadores que se portan bien, que es el objetivo habitual, pero no hace el sitio privado en ningún sentido significativo.

Gana la coincidencia más larga, no la primera

Esta es la regla que pilla a casi todo el mundo. Lees un robots.txt de arriba abajo y parece la configuración de un cortafuegos, donde el orden decide el resultado. No lo es. Dentro del grupo de reglas que aplica a un bot se recogen todos los patrones Allow y Disallow que coinciden con la ruta pedida, y gana el que tenga más caracteres. Un empate en longitud se resuelve a favor de Allow.

WordPress da el ejemplo canónico. El patrón /wp-admin/ tiene 10 caracteres y /wp-admin/admin-ajax.php tiene 24, así que el Allow estrecho gana para ese único archivo y el Disallow amplio sigue cubriendo todo lo demás del directorio. Nada de ese resultado depende de qué línea escribiste primero, y mover el Allow por encima del Disallow no cambia nada.

Donde esto muerde es cuando supones lo contrario. Escribir Disallow: / seguido de Allow: /blog funciona, porque /blog es más largo que /. Escribir Disallow: /productos/oculto/ y esperar que un Allow: /productos/ posterior lo anule no funciona, porque el patrón Disallow es más largo. Por eso el comprobador está justo debajo del archivo generado y no como un añadido.

Qué informa realmente el comprobador

Escribes una ruta y un agente de usuario y recorre los mismos tres pasos que un rastreador. Elige el grupo de reglas más específico para ese bot, prefiriendo una coincidencia exacta de nombre sobre el grupo *. Recoge todos los patrones de ese grupo que coincidan con tu ruta. Después aplica gana-el- más-largo con el desempate a favor de Allow y te dice qué patrón lo decidió, citado literalmente para que encuentres la línea que hay que cambiar.

Dos casos de permitir-por-defecto conviene conocerlos, porque sorprenden a quien espera una respuesta de bloqueo. Si ningún grupo de reglas aplica al bot y no hay grupo *, la ruta se permite. Si un grupo sí aplica pero ninguno de sus patrones toca tu ruta, la ruta también se permite. El robots.txt no tiene denegación implícita: todo lo que no hayas prohibido está permitido.

Bloquear rastreadores de IA, y qué bloqueas en realidad

Uno de los preajustes lista once agentes de rastreo de IA. Antes de usarlo conviene saber que ese conjunto mezcla dos cosas distintas.

Están los rastreadores de entrenamiento, que recogen texto para entrenar modelos. Bloquearlos no te cuesta visitas, porque no envían visitantes. Y están los de recuperación, los que van a buscar una página en el momento en que alguien pregunta algo y pueden citarte y enlazarte. Bloquear esos sí tiene un coste en visibilidad, y es un coste que mucha gente se lleva por accidente al aplicar una lista entera sin mirarla.

La decisión razonable casi siempre es bloquear el entrenamiento y dejar pasar la recuperación. El preajuste es un punto de partida, no una recomendación cerrada: quita de la lista lo que quieras que te siga encontrando.

Construir el archivo y dónde tiene que vivir

  1. Elige un preajuste o empieza en blanco, y añade grupos de reglas con su agente de usuario.
  2. Añade líneas Allow y Disallow a cada grupo.
  3. Pon la URL de tu sitemap si tienes uno.
  4. Prueba rutas concretas en el comprobador de abajo antes de dar nada por bueno.
  5. Descarga el archivo.

El archivo tiene que servirse en https://tudominio.com/robots.txt, exactamente ahí, en la raíz del dominio. Un robots.txt en un subdirectorio no lo lee nadie, y cada subdominio necesita el suyo propio: el de ejemplo.com no dice nada sobre blog.ejemplo.com.

Si lo que estás preparando es el resto de las señales que lee un buscador, el generador de meta tags cubre las etiquetas de la página y el generador de datos estructurados el marcado de esquema.

Cómo funciona, en imágenes

Captura de pantalla de la herramienta Generador y Probador de Robots.txt con preajustes para permitir todo, bloquear rastreadores de IA, un bloqueo de entorno de pruebas y WordPress, y después grupos de reglas editables que admiten un user-agent por línea y componen el robots.txt debajo
Generador y Probador de Robots.txt en pleno proceso: preajustes para permitir todo, bloquear rastreadores de IA, un bloqueo de entorno de pruebas y WordPress, y después grupos de reglas editables que admiten un user-agent por línea y componen el robots.txt debajo.
Diagrama: dónde ocurre el trabajo en una página de SysFenix que no tiene ninguna entrada de archivo: la herramienta llega como JavaScript normal dentro de la página, calcula la respuesta en tu propio dispositivo y la muestra ahí mismo, de modo que la subida, la cola y el registro en servidor que necesita una herramienta online típica no ocurren nunca
Dónde ocurre el trabajo en una página de SysFenix que no tiene ninguna entrada de archivo: la herramienta llega como JavaScript normal dentro de la página, calcula la respuesta en tu propio dispositivo y la muestra ahí mismo, de modo que la subida, la cola y el registro en servidor que necesita una herramienta online típica no ocurren nunca.

Preguntas frecuentes

¿Qué hace realmente esta herramienta?

Te deja construir uno o varios "grupos de reglas" (una lista de user-agents más sus rutas Allow/Disallow y un crawl-delay opcional), además de una lista de URLs de sitemap, y los combina en un archivo robots.txt correctamente formateado que puedes descargar o copiar directamente a la raíz de tu sitio. Un probador integrado también comprueba si una ruta concreta está permitida o bloqueada para un bot concreto, usando la misma lógica de "la regla más larga gana" que usan los rastreadores reales.

¿Se sube mi información a algún sitio?

No. Todo (construir el archivo y ejecutar el probador) ocurre con JavaScript sencillo en tu navegador; nada se envía a ningún servidor. No hay nada que subir de entrada, ya que no existe ningún campo de subida de archivos.

¿El robots.txt bloquea realmente a los bots del acceso a mi sitio?

Robots.txt es solo orientativo, le dice a los rastreadores bien comportados (Google, Bing, y la mayoría de rastreadores de IA legítimos) qué rutas no deberían solicitar, y ellos eligen respetarlo. No es un mecanismo de control de acceso ni de seguridad. Un scraper malicioso, o cualquiera que ya conozca una URL, puede ignorar el robots.txt por completo y solicitar la página de todos modos, así que el preajuste "Cierre de staging" no hace realmente privado un sitio de staging, usa autenticación real (HTTP Basic Auth, una lista blanca de IPs, o una VPN) para eso.

¿Qué tan actualizada está la lista de bots del preajuste "Bloquear rastreadores de IA"?

Incluye los tokens de user-agent de rastreadores de IA más citados a fecha de 2026, GPTBot/ChatGPT-User/OAI-SearchBot (OpenAI), CCBot (Common Crawl), Google-Extended (la opción de exclusión de entrenamiento de IA de Google, distinta de Googlebot para indexación de búsqueda), Bytespider (ByteDance), ClaudeBot/anthropic-ai (Anthropic), PerplexityBot, Meta-ExternalAgent y Amazonbot. Las empresas de IA lanzan y renombran rastreadores con bastante frecuencia, así que trata esto como un buen punto de partida actual y no como una lista permanente y exhaustiva, siempre puedes añadir más bots al mismo grupo de reglas.

¿Cómo decide realmente el probador de "¿esta ruta está permitida?"?

Elige el grupo de reglas más específico que se aplica al bot que escribiste (una coincidencia exacta de nombre si existe, si no el grupo "*"), y luego busca cada regla Allow/Disallow de ese grupo cuyo patrón coincida con tu ruta. Gana el patrón coincidente MÁS LARGO (la misma regla que documentan Google y Bing), y si el Allow más largo y el Disallow más largo tienen exactamente la misma longitud, gana Allow. Si nada del grupo coincidente toca la ruta en absoluto, se permite por defecto.

¿Qué significan "*" y "$" dentro de una ruta?

"*" coincide con cualquier secuencia de caracteres (incluida ninguna), así que "/privado*" coincide con "/privado", "/privado/" y "/privado-notas.html" por igual. Un "$" final ancla la coincidencia al final exacto de la URL, "/*.pdf$" coincide con "/informe.pdf" pero no con "/informe.pdf?descarga=1", mientras que "/*.pdf" (sin "$") coincide con ambos. El resto de rutas se comparan como prefijo, y la comparación distingue mayúsculas de minúsculas.

¿Dónde pongo el archivo robots.txt terminado?

Guárdalo o cópialo como un archivo de texto plano llamado exactamente "robots.txt" y súbelo a la raíz de tu sitio web (por ejemplo https://ejemplo.com/robots.txt), no funcionará en una subcarpeta. La mayoría de hostings y creadores de sitios tienen un lugar específico para subirlo o pegarlo; consulta la documentación de tu proveedor si no estás seguro de dónde está.

Herramientas relacionadas