Un archivo robots.txt enumera las preferencias de un sitio web para el comportamiento de los bots. Indica a los bots qué páginas web deben y no deben acceder. Los archivos Robots.txt son sumamente importantes para las arañas web (crawler).
Después de leer este artículo podrás:
Contenido relacionado
Gestión de bots
Bots beneficiosos vs. bots perjudiciales
Gestionar los bots beneficiosos
Bots de spam
¿Qué es un bot?
Suscríbete a theNET, el resumen mensual de Cloudflare sobre las ideas más populares de Internet.
Copiar el enlace del artículo
Un archivo robots.txt es un conjunto de pautas para bots. Este archivo está incluido en los archivos fuente de la mayoría de los sitios web. Los archivos Robots.txt están destinados a gestionar las actividades de los bots, como las arañas web, aunque no todos los bots seguirán las instrucciones.
Pensemos que un archivo robots.txt es como un cartel de "Código de conducta" colocado en la pared de un gimnasio, un bar o un centro comunitario: el cartel por sí mismo no tiene la capacidad de obligar a cumplir las normas enumeradas, pero los "buenos" clientes las cumplirán, mientras que es probable que los "malos" no las cumplan y sean expulsados.
Un bot es un programa automatizado que interactúa con sitios web y aplicaciones. Un tipo de bot se llama bot rastreador web (crawler). Estos bots "rastrean" las páginas web e indexan el contenido para que pueda aparecer en los resultados de los motores de búsqueda. Un archivo robots.txt ayuda a gestionar las actividades de estos rastreadores web (crawlers) para que no sobrecarguen el servidor web que aloja el sitio ni indexen páginas que no están destinadas a la vista del público. Un archivo robots.txt también puede ayudar a gestionar las actividades de los bots rastreadores de IA, que a veces pueden exigir mucho más a los servidores web que los bots araña web (crawler) tradicionales.
Un archivo robots.txt es simplemente un archivo de texto sin código de marcado HTML (de ahí la extensión .txt). El archivo robots.txt se aloja en el servidor web como cualquier otro archivo del sitio web. De hecho, normalmente se puede ver el archivo robots.txt de cualquier sitio web escribiendo la URL completa de la página de inicio y añadiendo después /robots.txt, como https://www.cloudflare.com/robots.txt. El archivo no está vinculado a ninguna otra parte del sitio, así que no es probable que los usuarios se lo encuentren, pero la mayoría de los bots rastreadores web buscarán primero este archivo antes de rastrear el resto del sitio.
Aunque un archivo robots.txt proporciona instrucciones para los bots, no puede realmente hacerlas cumplir. Algunos bots, como las arañas web (crawler) o los bots de noticias, pueden intentar visitar primero el archivo robots.txt antes de ver cualquier otra página en un dominio, y pueden seguir las instrucciones. Otros bots ignorarán el archivo robots.txt o lo procesarán para identificar las páginas web que están prohibidas.
Un bot araña web que cumpla con el archivo robots.txt seguirá el conjunto de instrucciones más específico en el archivo robots.txt. Si hay comandos contradictorios en el archivo, el bot seguirá el comando más granular.
Una cosa importante que hay que tener en cuenta es que todos los subdominios necesitan su propio archivo robots.txt. Por ejemplo, mientras que www.cloudflare.com tiene su propio archivo, todos los subdominios de Cloudflare (blog.cloudflare.com, community.cloudflare.com, etc.) necesitan también el suyo.
En redes, un protocolo es un formato para proporcionar instrucciones o comandos. Los archivos robots.txt utilizan un par de protocolos diferentes. El protocolo principal se llama Protocolo de exclusión de bots. Es una forma de indicar a los bots las páginas web y recursos que deben evitar. Las instrucciones formateadas para este protocolo están incluidas en el archivo robots.txt.
El otro protocolo utilizado para los archivos robots.txt es el protocolo Sitemaps. Este se puede considerar un protocolo de inclusión de bots. Sitemaps muestran a un rastreador web qué páginas puede rastrear. Esto ayuda a garantizar que un bot rastreador no se pierda ninguna página importante.
Esta es una versión anterior del archivo robots.txt para www.cloudflare.com:
A continuación, desglosamos lo que todo esto significa.
Cualquier persona o programa activo en Internet tendrá un "agente de usuario", o un nombre asignado. Para los usuarios humanos, esto incluye información como el tipo de navegador y la versión del sistema operativo, pero no información personal; ayuda a los sitios web a mostrar contenidos compatibles con el sistema del usuario. Para los bots, el agente de usuario (en teoría) ayuda a los administradores del sitio web a saber qué tipo de bots están rastreando el sitio.
En un archivo robots.txt, los administradores del sitio web pueden proporcionar instrucciones específicas para determinados bots al escribir instrucciones diferentes para los agentes de usuario de los bots. Por ejemplo, si un administrador quiere que una determinada página aparezca en los resultados de búsqueda de Google, pero no en los de Bing, podría incluir dos conjuntos de comandos en el archivo robots.txt: un conjunto precedido por "User-agent: Bingbot" y un conjunto precedido por "User-agent: Googlebot".
En el ejemplo anterior, Cloudflare incluyó "User-agent: *" en el archivo robots.txt. El asterisco representa un comodín de "carácter comodín" y significa que las instrucciones se aplican a todos los bots, no a uno específico.
Los nombres de los agentes de usuario de los bots de los motores de búsqueda son los siguientes:
Google:
Bing
Baidu
El comando Disallow es el más común en el protocolo de exclusión de robots. Indica a los bots que no accedan a la página web o al conjunto de páginas web que siguen al comando. Las páginas no permitidas no están necesariamente "ocultas"; simplemente no son útiles para el usuario promedio de Google o Bing, por lo que no se les muestran. La mayoría de las veces, un usuario en el sitio web aún puede navegar a estas páginas si sabe dónde encontrarlas.
El comando Disallow puede utilizarse de varias maneras, varias de las cuales se muestran en el ejemplo anterior.
Como ejemplo, si Cloudflare quisiera bloquear a los bots para que no rastreen nuestro artículo "¿Qué es un bot?", dicho comando se escribiría de la siguiente manera:
Disallow: /learning/bots/what-is-a-bot/
Después del comando "disallow", la parte de la URL de la página web que sigue a la página principal, en este caso, "www.cloudflare.com" – está incluido. Con este comando en su lugar, los bots que cumplan con las instrucciones de robots.txt no accederán a https://www.cloudflare.com/learning/bots/what-is-a-bot/, y, por lo tanto, la página probablemente no aparecerá en los resultados de búsqueda de los motores tradicionales.
En ocasiones, es más eficiente bloquear varias páginas a la vez, en lugar de enumerarlas todas individualmente. Si todas se encuentran en la misma sección del sitio web, un archivo robots.txt puede limitarse a bloquear el directorio que las contiene.
Un ejemplo de lo anterior es:
Disallow: /__mesa/
Esto quiere decir que todas las páginas incluidas en el directorio __mesa no deben ser rastreadas.
Este comando tendría el siguiente aspecto:
Disallow:
Esto indica a los bots que pueden navegar por todo el sitio web, ya que nada está no permitido.
Disallow: /
El "/" aquí representa la "raíz" en la jerarquía de un sitio web, o la página desde la que parten todas las demás páginas, por lo que incluye la página de inicio y todas las páginas enlazadas desde ella. Con este comando, es posible que los bots de los motores de búsqueda no rastreen el sitio web en absoluto.
Permitir: Tal como cabría esperar, el comando "Permitir" indica a los bots que tienen permiso para acceder a una determinada página web o directorio. Este comando indica la preferencia del sitio web de permitir que los bots accedan a una página web específica, mientras que se prohíbe el acceso al resto de las páginas web en el archivo. No todos los motores de búsqueda reconocen este comando.
Crawl-delay: El comando crawl delay está diseñado para evitar que los bots araña de los motores de búsqueda sobrecarguen un servidor. Permite que los administradores especifiquen cuánto tiempo, en milisegundos, debe esperar el bot entre cada solicitud. A continuación, un ejemplo de comando Crawl-delay en el que se indica que debe esperar 8 milisegundos:
Crawl-delay: 8
Google no reconoce este comando, aunque otros motores de búsqueda a menudo sí lo hacen. En Google, los administradores pueden cambiar la frecuencia de rastreo de su sitio web en Google Search Console.
El protocolo Sitemaps ayuda a los bots a saber qué deben incluir en su rastreo de un sitio web.
Un Sitemap es un archivo XML con el siguiente aspecto:
Es una lista legible por máquinas de todas las páginas de un sitio web. Mediante el protocolo Sitemaps, se pueden incluir enlaces a estos sitemaps en el archivo robots.txt. El formato es: "Sitemaps:" seguido de la dirección web del archivo XML. Puedes ver varios ejemplos en el archivo robots.txt de Cloudflare de arriba.
Aunque el protocolo de los sitemaps ayuda a garantizar que los bots araña web no se pierdan nada al rastrear un sitio web, los bots seguirán su proceso de rastreo habitual. Los Sitemaps no obligan a los bots rastreadores a priorizar las páginas web de forma diferente.
La gestión de bots es fundamental para mantener un sitio web o una aplicación en funcionamiento, porque incluso la actividad de los bots beneficiosos puede sobrecargar un servidor de origen, ralentizando o tumbando una propiedad web. Un archivo robots.txt bien construido mantiene un sitio web optimizado para SEO y controla la actividad de bots bien comportados. Un archivo robots.txt no será muy efectivo para gestionar el tráfico de bots maliciosos.
A pesar de la importancia de robots.txt, en 2025 Cloudflare descubrió que solo el 37 % de sus 10 000 sitios web principales tenían un archivo robots.txt. Esto significa que un gran porcentaje, quizás la mayoría, de los sitios web no están utilizando esta herramienta. Para ayudar a estos sitios web, especialmente a aquellos que no desean que su contenido original se utilice para el entrenamiento de IA, Cloudflare ofrece "robots.txt gestionado". Este es un servicio que crea o actualiza el archivo robots.txt en nombre de un sitio web con la configuración deseada. Más información sobre robots.txt gestionados.
En ocasiones, un archivo robots.txt contendrá huevos de pascua: mensajes humorísticos que dejaron los desarrolladores porque sabían que los usuarios rara vez ven estos archivos. Por ejemplo, el archivo robots.txt de Youtube dice lo siguiente: "Creado en un futuro lejano (el año 2000) después del levantamiento robótico de mediados de los 90 que acabó con todos los humanos." El archivo robots.txt de Cloudflare dice: "Querido bot, sé amable."
# .__________________________.
# | .___________________. |==|
# | | ................. | | |
# | | ::[ Querido bot ]: | | |
# | | ::::[ sé amable ]:: | | |
# | | ::::::::::::::::: | | |
# | | ::::::::::::::::: | | |
# | | ::::::::::::::::: | | |
# | | ::::::::::::::::: | | ,|
# | !___________________! |(c|
# !_______________________!__!
# / \
# / [][][][][][][][][][][][][] \
# / [][][][][][][][][][][][][][] \
#( [][][][][____________][][][][] )
# \ ------------------------------ /
# \______________________________/
Google también cuenta con un archivo "humans.txt" en: https://www.google.com/humans.txt
Un archivo robots.txt es una lista de preferencias de un sitio web que define a qué partes pueden acceder los bots y está ubicada en los archivos fuente del sitio web. Indica a los bots autorizados, como los crawlers de buscadores, qué secciones del sitio pueden explorar y cuáles deben excluir, facilitando la administración del tráfico y el control del contenido indexado. También puede enumerar reglas para rastreadores de IA.
Una araña web (crawler) es un bot automatizado que visita e indexa páginas web para los motores de búsqueda, ayudando a los usuarios a encontrar contenido a través de los resultados de búsqueda.
El Protocolo de Exclusión de Robots es el formato para las instrucciones en un archivo robots.txt. El protocolo indica a las arañas web qué páginas web o recursos no deben acceder o rastrear en un sitio web.
"User-agent" indica a qué bot o grupo de bots se aplica un conjunto de instrucciones en un archivo robots.txt. "User-agent: *" significa que la regla se aplica a todos los bots.
El comando Disallow indica a los bots que no rastreen páginas o directorios específicos en un sitio web. Por ejemplo, "Disallow: /private/" indica a los bots que no deben acceder al directorio "private".
El protocolo Sitemaps permite a los propietarios de sitios web incluir enlaces a sus archivos XML de sitemaps en el archivo robots.txt, ayudando a los bots a descubrir qué páginas deben ser rastreadas.
Los bots buenos son más propensos a seguir las instrucciones de robots.txt; además, prestan servicios útiles. Las arañas web de los motores de búsqueda, por ejemplo, suelen respetar las reglas de robots.txt al indexar contenido para búsquedas. Los bots maliciosos a menudo ignoran el archivo robots.txt y pueden extraer contenido, atacar sitios web o enviar un exceso de solicitudes que incrementen los costos del sitio web.
El comando Crawl-delay le indica a los bots cuánto tiempo deben esperar entre solicitudes para evitar sobrecargar un servidor. No todos los bots respetan este comando: Googlebot, por ejemplo, no lo hace, aunque Google permite a los administradores de sitios web establecer una regla similar mediante Google Search Console.
Un archivo robots.txt bien diseñado puede mejorar el SEO al indicar a los bots rastreadores de motores de búsqueda qué páginas deben indexar, lo que ayuda a evitar que se indexe contenido no esencial o duplicado. Además, el archivo robots.txt puede ayudar a las arañas web a encontrar todas las páginas que deben indexar mediante Sitemaps.