Guía Técnica de robots.txt y Estándar RFC 9309
El archivo robots.txt es un documento de texto plano ubicado en la raíz de un dominio (ejemplo: https://tusitio.com/robots.txt) que indica a los rastreadores web qué áreas del sitio web deben o no deben explorar. En 2022, la IETF formalizó esta especificación mediante el estándar RFC 9309 (Robots Exclusion Protocol), unificando las reglas de directivas, precedencia y coincidencia de rutas.
1. Rastreo frente a Indexación: Una distinción crítica
Uno de los errores más frecuentes en SEO técnico es confundir el rastreo con la indexación. Una regla Disallow impide que los motores de búsqueda descarguen o rastreen una URL. Sin embargo, si esa URL recibe enlaces externos o internos, Google puede llegar a indexar la URL sin leer su contenido. Para evitar que una página aparezca en los resultados de búsqueda, debe permitir que Googlebot la rastree y responder con la etiqueta <meta name="robots" content="noindex"> o la cabecera HTTP X-Robots-Tag: noindex. Google no admite directivas Noindex: dentro de robots.txt (retiradas oficialmente en 2019).
2. Precedencia de directivas y coincidencia de rutas (RFC 9309 §2.2.2)
Bajo el estándar RFC 9309, los rastreadores evalúan la longitud de los patrones que coinciden con la URL solicitada. La regla con el patrón coincidente más largo es la que se aplica. En caso de empate exacto de longitud entre una regla Allow y una regla Disallow, la directiva Allow tiene prioridad.
- Coincidencia por prefijo:
Disallow: /admin/bloquea /admin/ajustes, /admin/usuarios, etc. - Comodín (*):
Disallow: /*.pdfcoincide con cualquier ruta que contenga .pdf - Ancla de final de URL ($):
Disallow: /*.pdf$coincide con /doc.pdf pero NO con /doc.pdf?preview=1 - Sensibilidad a mayúsculas: Las rutas son estrictamente sensibles a mayúsculas.
Disallow: /Admin/no bloquea/admin/.
3. Realidad de Crawl-delay: Google e Yandex frente a otros buscadores
La directiva Crawl-delay no forma parte del núcleo de RFC 9309. Google ignora completamente Crawl-delay en robots.txt (la velocidad de Googlebot se gestiona algorítmicamente o en Search Console). Asimismo, Yandex ignora Crawl-delay para su buscador principal desde febrero de 2018 (se configura en Yandex Webmaster). No obstante, motores como Bingbot y herramientas como AhrefsBot o SemrushBot sí reconocen y aplican Crawl-delay para limitar la frecuencia de rastreo.
4. robots.txt NO es un mecanismo de seguridad ni control de acceso
robots.txt es un protocolo voluntario para rastreadores legítimos y es de acceso público universal. Nunca liste carpetas confidenciales o rutas secretas en robots.txt, ya que los atacantes revisan este archivo específicamente para descubrir endpoints privados. Para proteger áreas sensibles, utilice autenticación de servidor (HTTP Auth, sesiones, tokens o cortafuegos), no directivas de rastreo.