Un archivo robots.txt enumera las preferencias de un sitio web para el comportamiento de los bots. Indica a los bots qué páginas web deben y no deben acceder. Los archivos robots.txt son más relevantes para los rastreadores web.
Después de leer este artículo podrás:
Contenido relacionado
Gestión de bots
Bots beneficiosos vs. bots perjudiciales
Gestionar los bots beneficiosos
Bots de spam
¿Qué es un bot?
Suscríbase a theNET, el resumen mensual de Cloudflare sobre las ideas más populares de Internet.
Copiar enlace del artículo
Un archivo robots.txt es un conjunto de directrices para bots. Este archivo está incluido en los archivos fuente de la mayoría de los sitios web. Los archivos robots.txt están destinados a gestionar las actividades de bots como los rastreadores web, aunque no todos los bots seguirán las instrucciones.
Pensemos que un archivo robots.txt es como un cartel de "Código de conducta" colocado en la pared de un gimnasio, un bar o un centro comunitario: el cartel por sí mismo no tiene la capacidad de obligar a cumplir las normas enumeradas, pero los "buenos" clientes las cumplirán, mientras que es probable que los "malos" no las cumplan y sean expulsados.
Un bot es un programa informático automatizado que interactúa con sitios web y aplicaciones. Un tipo de bot se denomina bot de rastreo web. Estos bots "rastrean" las páginas web e indexan el contenido para que aparezca en los resultados de los motores de búsqueda. Un archivo robots.txt ayuda a gestionar las actividades de estos rastreadores web para que no sobrecarguen el servidor web que aloja el sitio ni indexen páginas que no estén destinadas a la consulta pública. Un archivo robots.txt también puede facilitar la gestión de las actividades de los bots de rastreo de IA, que a veces pueden exigir mucho más a los servidores web que los bots de rastreo web tradicionales.
Un archivo robots.txt es simplemente un archivo de texto sin código de marcado HTML (de ahí la extensión .txt). El archivo robots.txt se aloja en el servidor web como cualquier otro archivo del sitio web. De hecho, normalmente se puede ver el archivo robots.txt de cualquier sitio web escribiendo la URL completa de la página de inicio y añadiendo después /robots.txt, como https://www.cloudflare.com/robots.txt. El archivo no está vinculado a ninguna otra parte del sitio, así que no es probable que los usuarios se lo encuentren, pero la mayoría de los bots rastreadores web buscarán primero este archivo antes de rastrear el resto del sitio.
Aunque un archivo robots.txt proporciona instrucciones para los bots, en realidad no puede hacer que se cumplan. Algunos bots, como los rastreadores web o los bots de noticias, pueden intentar visitar el archivo robots.txt antes de ver cualquier otra página de un dominio y seguir las instrucciones. Otros bots ignorarán el archivo robots.txt o lo procesarán para identificar las páginas web que están prohibidas.
Un bot de rastreo web que cumpla con el archivo robots.txt seguirá el conjunto de instrucciones más específico del archivo robots.txt. Si hay instrucciones contradictorias en el archivo, el bot seguirá la instrucción más detallada.
Una cosa importante que hay que tener en cuenta es que todos los subdominios necesitan su propio archivo robots.txt. Por ejemplo, mientras que www.cloudflare.com tiene su propio archivo, todos los subdominios de Cloudflare (blog.cloudflare.com, community.cloudflare.com, etc.) necesitan también el suyo.
En redes, un protocolo es un formato para proporcionar instrucciones o comandos. Los archivos robots.txt utilizan un par de protocolos diferentes. El protocolo principal se llama Protocolo de exclusión de bots. Es una forma de indicar a los bots las páginas web y recursos que deben evitar. Las instrucciones formateadas para este protocolo están incluidas en el archivo robots.txt.
El otro protocolo utilizado para los archivos robots.txt es el protocolo Sitemaps. Este se puede considerar un protocolo de inclusión de bots. Sitemaps muestran a un rastreador web qué páginas puede rastrear. Esto ayuda a garantizar que un bot rastreador no se pierda ninguna página importante.
Esta es una versión antigua del archivo robots.txt para www.cloudflare.com:
A continuación, desglosamos lo que todo esto significa.
Cualquier persona o programa activo en Internet tendrá un "agente de usuario", o un nombre asignado. Para los usuarios humanos, esto incluye información como el tipo de navegador y la versión del sistema operativo, pero no información personal; ayuda a los sitios web a mostrar contenidos compatibles con el sistema del usuario. Para los bots, el agente de usuario (en teoría) ayuda a los administradores del sitio web a saber qué tipo de bots están rastreando el sitio.
En un archivo robots.txt, los administradores del sitio web pueden proporcionar instrucciones específicas para determinados bots al escribir instrucciones diferentes para los agentes de usuario de los bots. Por ejemplo, si un administrador quiere que una determinada página aparezca en los resultados de búsqueda de Google, pero no en los de Bing, podría incluir dos conjuntos de comandos en el archivo robots.txt: un conjunto precedido por "User-agent: Bingbot" y un conjunto precedido por "User-agent: Googlebot".
En el ejemplo anterior, Cloudflare incluyó "User-agent: *" en el archivo robots.txt. El asterisco representa un comodín de "agente de usuario", y significa que las instrucciones se aplican a todos los bots, no a uno específico.
Los nombres de los agentes de usuario de los bots de los motores de búsqueda son los siguientes:
Google:
Bing
Baidu
El comando "disallow" es el más común en el protocolo de exclusión de robots. Indica a los bots que no accedan a la página web o al conjunto de páginas web que aparecen después del comando. Las páginas no permitidas no están necesariamente "ocultas", simplemente no son útiles para el usuario medio de Google o Bing, por lo que no se les muestran. La mayoría de las veces, un usuario del sitio web aún puede navegar a estas páginas si sabe dónde encontrarlas.
El comando Disallow puede utilizarse de varias maneras, varias de las cuales se muestran en el ejemplo anterior.
Como ejemplo, si Cloudflare quisiera bloquear a los bots para que no rastreen nuestro artículo " ¿Qué es un bot?", dicho comando se escribiría de la siguiente manera:
Disallow: /learning/bots/what-is-a-bot/
Después del comando «disallow», la parte de la URL de la página web que aparece después de la página de inicio, en este caso, "www.cloudflare.com", está incluida. Con este comando en su lugar, los bots que cumplan con las instrucciones de robots.txt no accederán a https://www.cloudflare.com/learning/bots/what-is-a-bot/, y, por lo tanto, es probable que la página no aparezca en los resultados de los motores de búsqueda tradicionales.
En ocasiones, es más eficiente bloquear varias páginas a la vez, en lugar de enumerarlas todas individualmente. Si todas se encuentran en la misma sección del sitio web, un archivo robots.txt puede limitarse a bloquear el directorio que las contiene.
Un ejemplo de lo anterior es:
Disallow: /__mesa/
Esto quiere decir que todas las páginas incluidas en el directorio __mesa no deben ser rastreadas.
Este comando tendría el siguiente aspecto:
Disallow:
Esto indica a los bots que pueden navegar por todo el sitio web, ya que nada está no permitido.
Disallow: /
La barra "/" representa aquí la "raíz" en la jerarquía de un sitio web, es decir, la página desde la que se ramifican todas las demás páginas, por lo que incluye la página de inicio y todas las páginas enlazadas desde ella. Con este comando, es posible que los bots de los motores de búsqueda no rastreen el sitio web en absoluto.
Permitir: tal como cabría esperar, el comando "Permitir" indica a los bots que pueden acceder a una determinada página web o directorio. Este comando indica la preferencia del sitio web de permitir que los bots accedan a una página web específica, mientras que se prohíbe el acceso al resto de las páginas web del archivo. No todos los motores de búsqueda reconocen este comando.
Crawl-delay: El comando crawl delay está diseñado para evitar que los bots araña de los motores de búsqueda sobrecarguen un servidor. Permite que los administradores especifiquen cuánto tiempo, en milisegundos, debe esperar el bot entre cada solicitud. A continuación, un ejemplo de comando Crawl-delay en el que se indica que debe esperar 8 milisegundos:
Crawl-delay: 8
Google no reconoce este comando, aunque otros motores de búsqueda a menudo sí lo hacen. En Google, los administradores pueden cambiar la frecuencia de rastreo de su sitio web en Google Search Console.
El protocolo Sitemaps ayuda a los bots a saber qué deben incluir en su rastreo de un sitio web.
Un Sitemap es un archivo XML con el siguiente aspecto:
Es una lista legible por máquinas de todas las páginas de un sitio web. Mediante el protocolo Sitemaps, se pueden incluir enlaces a estos sitemaps en el archivo robots.txt. El formato es: "Sitemaps:" seguido de la dirección web del archivo XML. Puedes ver varios ejemplos en el archivo robots.txt de Cloudflare de arriba.
Aunque el protocolo de los sitemaps ayuda a garantizar que los bots araña web no se pierdan nada al rastrear un sitio web, los bots seguirán su proceso de rastreo habitual. Los Sitemaps no obligan a los bots rastreadores a priorizar las páginas web de forma diferente.
La gestión de bots es fundamental para mantener un sitio web o una aplicación en funcionamiento, porque incluso la actividad de los bots beneficiosos puede sobrecargar un servidor de origen, ralentizando o inutilizando una propiedad web. Un archivo robots.txt bien diseñado mantiene un sitio web optimizado para el SEO y controla la actividad de los bots. Un archivo robots.txt no será muy efectivo para gestionar el tráfico de bots maliciosos.
A pesar de la importancia del archivo robots.txt, en 2025 Cloudflare descubrió que solo el 37 % de los 10 000 sitios web más importantes tenían un archivo robots.txt. Esto significa que un gran porcentaje, quizás la mayoría, de los sitios web no están utilizando esta herramienta. Para ayudar a estos sitios web, especialmente a aquellos que no desean que su contenido original se utilice para el entrenamiento de IA, Cloudflare ofrece "robots.txt gestionado". Este es un servicio que crea o actualiza el archivo robots.txt en nombre de un sitio web con la configuración deseada. Más información sobre robots.txt gestionado.
En ocasiones, un archivo robots.txt contendrá huevos de pascua: mensajes humorísticos que dejaron los desarrolladores porque sabían que los usuarios rara vez ven estos archivos. Por ejemplo, el archivo robots.txt de Youtube dice lo siguiente: "Creado en un futuro lejano (el año 2000) después del levantamiento robótico de mediados de los 90 que acabó con todos los humanos." El archivo robots.txt de Cloudflare dice: "Querido bot, sé amable."
# .__________________________.
# | .___________________. |==|
# | | ................. | | |
# | | ::[ Querido bot ]: | | |
# | | ::::[ sé amable ]:: | | |
# | | ::::::::::::::::: | | |
# | | ::::::::::::::::: | | |
# | | ::::::::::::::::: | | |
# | | ::::::::::::::::: | | ,|
# | !___________________! |(c|
# !_______________________!__!
# / \
# / [][][][][][][][][][][][][] \
# / [][][][][][][][][][][][][][] \
#( [][][][][____________][][][][] )
# \ ------------------------------ /
# \______________________________/
Google también cuenta con un archivo "humans.txt" en: https://www.google.com/humans.txt
Un archivo robots.txt es una lista de preferencias de un sitio web acerca del comportamiento de los bots, ubicada en los archivos fuente del sitio web. Proporciona orientación a los bots buenos, como los rastreadores web de los motores de búsqueda, sobre las partes del sitio web a las que pueden acceder y las que deben evitar, lo que ayuda a gestionar el tráfico y controlar la indexación. También puede incluir reglas para los rastreadores de IA.
Un rastreador web es un bot automatizado que visita e indexa páginas web para motores de búsqueda, lo que ayuda a los usuarios a encontrar contenido a través de los resultados de búsqueda.
El protocolo de exclusión de bots es el formato para las instrucciones en un archivo robots.txt. El protocolo indica a los rastreadores web qué páginas web o recursos no deben acceder o rastrear en un sitio web.
"User-agent" especifica a qué bot o grupo de bots se aplica un conjunto de instrucciones en un archivo robots.txt. "User-agent: *" significa que la regla se aplica a todos los bots.
El comando "disallow" indica a los bots que no rastreen páginas o directorios específicos en un sitio web. Por ejemplo, "Disallow: /private/" indica a los bots que no accedan al directorio "private".
El protocolo Sitemaps permite a los propietarios de sitios web incluir enlaces a sus archivos XML de sitemaps en el archivo robots.txt, lo que ayuda a los bots a descubrir qué páginas deben ser rastreadas.
Los bots buenos seguirán con mayor probabilidad las instrucciones de robots.txt; además, también realizan servicios útiles. Los rastreadores web de los motores de búsqueda, por ejemplo, suelen respetar las reglas de robots.txt cuando indexan contenidos para la búsqueda. Los bots malos a menudo ignoran el archivo robots.txt y pueden extraer contenidos, atacar sitios web o enviar un número excesivo de solicitudes que incrementan los costes del sitio web.
El comando "Crawl-delay" indica a los bots cuánto tiempo deben esperar entre solicitudes para evitar sobrecargar un servidor. No todos los bots respetan este comando. Googlebot, por ejemplo, no lo hace, aunque Google permite a los administradores de sitios web establecer una regla similar mediante Google Search Console.
Un archivo robots.txt bien estructurado puede mejorar el SEO, ya que indica a los bots de los motores de búsqueda qué páginas deben indexar, lo que ayuda a evitar que se indexe contenido no esencial o duplicado. Además, el archivo robots.txt puede ayudar a los rastreadores web a encontrar todas las páginas que deben indexar mediante Sitemaps.