Generador de robots.txt

Crea el archivo robots.txt de tu sitio con reglas por robot (Allow, Disallow, Crawl-delay) y sitemaps, con plantillas rápidas. Copia o descarga al instante.

./generador-robots-txt
Plantillas
robots.txt
User-agent: *
Disallow:

Sitemap: https://tudominio.com/sitemap.xml

Todo se genera en tu navegador; nada se envía a ningún servidor.

Compartir

Qué hace esta herramienta

Construye el archivo robots.txt de tu sitio con una interfaz visual, sin que tengas que recordar la sintaxis. Defines grupos de reglas por robot (User-agent), añades Disallow y Allow, Crawl-delay si lo necesitas, y las líneas de Sitemap. Hay plantillas rápidas para los casos habituales, y el resultado se copia o se descarga listo para subir a la raíz de tu dominio.

Qué es y dónde va

robots.txt es un archivo de texto plano que vive en la raíz del sitio —siempre en tudominio.com/robots.txt, nunca en un subdirectorio— y es lo primero que consulta un rastreador educado antes de recorrer tu web. En él le dices qué zonas puede visitar y cuáles no.

El propósito real no es “esconder” páginas, sino dirigir el rastreo: evitar que los bots gasten tiempo en secciones sin valor para búsqueda (paneles de administración, resultados de búsqueda interna, URLs con filtros infinitos) y llevarlos a lo que sí importa, empezando por tu sitemap.

Cómo usarla

  1. Elige una plantilla o empieza en blanco.
  2. Crea un grupo con su User-agent (* para todos, o uno concreto como Googlebot).
  3. Añade las rutas a bloquear con Disallow y las excepciones con Allow.
  4. Añade la línea de Sitemap con la URL completa.
  5. Copia o descarga el archivo y súbelo a la raíz de tu dominio.

Las directivas, una a una

User-agent

Abre un bloque de reglas dirigido a un robot concreto. * significa “todos los robots”. Puedes tener varios bloques, uno genérico y otros específicos:

User-agent: *
Disallow: /admin/

User-agent: Googlebot
Allow: /

Disallow y Allow

Disallow marca las rutas que el robot no debe rastrear; Allow abre excepciones dentro de una zona bloqueada. La combinación permite bloquear una carpeta entera dejando accesible un archivo suyo:

User-agent: *
Disallow: /privado/
Allow: /privado/publico.html

Un Disallow: vacío significa “no bloquees nada”. Un Disallow: / bloquea el sitio entero — útil en un entorno de pruebas, catastrófico si se despliega por error a producción.

Sitemap

Independiente de los bloques de User-agent, apunta a tu mapa del sitio con la URL absoluta. Ayuda a que los buscadores lo descubran aunque no lo hayas enviado por sus herramientas para webmasters:

Sitemap: https://tudominio.com/sitemap.xml

Crawl-delay

Pide al robot que espere unos segundos entre peticiones, para no saturar un servidor modesto. Bing lo respeta; Googlebot lo ignora — la velocidad de rastreo de Google se ajusta desde Search Console. No hace daño incluirlo, pero no cuentes con que Google lo obedezca.

El malentendido que cuesta caro: robots.txt no oculta nada

Es el error más frecuente y el más dañino. Disallow no saca una página de Google. Solo impide que el bot la rastree. Si otros sitios enlazan esa URL, Google puede indexarla igualmente y mostrarla en los resultados sin descripción, con el poco atractivo texto “No hay información disponible sobre esta página”.

Peor aún: si bloqueas una página en robots.txt, el rastreador no puede leer la etiqueta noindex que hayas puesto dentro. Así que el bloqueo consigue justo lo contrario de lo que quieres.

La regla correcta:

  • Para que una página no aparezca en Google → etiqueta <meta name="robots" content="noindex"> (o cabecera X-Robots-Tag), y deja que el bot pueda leerla.
  • Para que un bot no gaste tiempo rastreando una zona sin valorDisallow en robots.txt.
  • Para proteger información sensible → ni una cosa ni la otra: autenticación de verdad. robots.txt es público; listar ahí tus carpetas privadas es un mapa para curiosos.

Errores habituales que conviene revisar

  • Ruta equivocada. El archivo tiene que estar en la raíz. tudominio.com/carpeta/robots.txt no lo lee nadie.
  • Bloquear CSS o JS. Google necesita renderizar la página para entenderla; si le bloqueas los estilos y los scripts, la evaluará peor.
  • Mayúsculas. Las rutas distinguen mayúsculas de minúsculas: /Admin/ y /admin/ no son lo mismo.
  • Dejar el Disallow: / de pruebas. El clásico despiste que borra un sitio entero del índice tras un despliegue.

Preguntas frecuentes

¿Para qué sirve el archivo robots.txt?

Es un archivo de texto que se coloca en la raíz del sitio (tudominio.com/robots.txt) y le indica a los rastreadores qué partes pueden o no pueden recorrer. Sirve para no malgastar el presupuesto de rastreo en secciones sin valor (paneles, filtros, resultados de búsqueda interna) y para apuntar a tu sitemap. Es una guía para bots educados, no un mecanismo de seguridad.

¿Disallow evita que una página aparezca en Google?

No de forma fiable. Disallow impide que el bot rastree la página, pero si otros sitios la enlazan, Google puede indexar la URL igualmente, mostrándola sin descripción. Para que una página no aparezca en los resultados usa la etiqueta meta robots noindex o una cabecera X-Robots-Tag, y deja que el rastreador pueda leerla. Bloquearla en robots.txt es justo lo que impide que vea el noindex.

¿Qué diferencia hay entre User-agent, Allow y Disallow?

User-agent nombra al robot al que se dirige el bloque de reglas (Googlebot, Bingbot, o * para todos). Disallow marca las rutas que ese robot no debe rastrear, y Allow permite excepciones dentro de una ruta bloqueada. Por ejemplo, se puede bloquear toda una carpeta con Disallow y dejar accesible un archivo concreto de dentro con Allow.

¿Debo incluir el sitemap en el robots.txt?

Sí, es recomendable. Añadir la línea Sitemap con la URL completa de tu sitemap ayuda a que los buscadores lo descubran aunque no lo hayas enviado por sus herramientas para webmasters. Puedes declarar varios sitemaps, y la línea es independiente de los bloques de User-agent.

¿Sigue sirviendo el Crawl-delay?

Es un caso a caso. Crawl-delay pide al robot que espere unos segundos entre peticiones, útil para servidores modestos. Bing y algunos otros lo respetan, pero Googlebot lo ignora: la velocidad de rastreo de Google se ajusta desde Search Console, no desde robots.txt. Ponerlo no hace daño, pero no cuentes con que Google lo obedezca.

Reseñas y valoraciones

Aún no hay reseñas. ¡Sé la primera persona en opinar!

Escribe una reseña

Tu calificación *