¿Qué es el archivo robots.txt? | Cómo funciona un archivo robots.txt

Un archivo robots.txt enumera las preferencias de un sitio web para el comportamiento de los bots. Indica a los bots qué páginas web deben y no deben acceder. Los archivos robots.txt son más relevantes para los rastreadores web.

Objetivos de aprendizaje

Después de leer este artículo podrás:

  • Descubre qué es un archivo robots.txt
  • Entender cómo interactúan los bots con un archivo robots.txt
  • Explorar los protocolos utilizados en un archivo robots.txt, incluyendo el Protocolo de exclusión de bots y Sitemaps

Contenido relacionado


¿Quieres saber más?

Suscríbase a theNET, el resumen mensual de Cloudflare sobre las ideas más populares de Internet.

Revisa la política de privacidad de Cloudflare para saber más sobre cómo Cloudflare gestiona tus datos personales.

Copiar enlace del artículo

Defiéndete contra los ataques de bots como el relleno de credenciales y la apropiación de contenido con Cloudflare

¿Qué es Robots.txt?

El modelo OSI

Un archivo robots.txt es un conjunto de directrices para bots. Este archivo está incluido en los archivos fuente de la mayoría de los sitios web. Los archivos robots.txt están destinados a gestionar las actividades de bots como los rastreadores web, aunque no todos los bots seguirán las instrucciones.

Pensemos que un archivo robots.txt es como un cartel de "Código de conducta" colocado en la pared de un gimnasio, un bar o un centro comunitario: el cartel por sí mismo no tiene la capacidad de obligar a cumplir las normas enumeradas, pero los "buenos" clientes las cumplirán, mientras que es probable que los "malos" no las cumplan y sean expulsados.

Un bot es un programa informático automatizado que interactúa con sitios web y aplicaciones. Un tipo de bot se denomina bot de rastreo web. Estos bots "rastrean" las páginas web e indexan el contenido para que aparezca en los resultados de los motores de búsqueda. Un archivo robots.txt ayuda a gestionar las actividades de estos rastreadores web para que no sobrecarguen el servidor web que aloja el sitio ni indexen páginas que no estén destinadas a la consulta pública. Un archivo robots.txt también puede facilitar la gestión de las actividades de los bots de rastreo de IA, que a veces pueden exigir mucho más a los servidores web que los bots de rastreo web tradicionales.

¿Cómo funciona un archivo robots.txt?

Un archivo robots.txt es simplemente un archivo de texto sin código de marcado HTML (de ahí la extensión .txt). El archivo robots.txt se aloja en el servidor web como cualquier otro archivo del sitio web. De hecho, normalmente se puede ver el archivo robots.txt de cualquier sitio web escribiendo la URL completa de la página de inicio y añadiendo después /robots.txt, como https://www.cloudflare.com/robots.txt. El archivo no está vinculado a ninguna otra parte del sitio, así que no es probable que los usuarios se lo encuentren, pero la mayoría de los bots rastreadores web buscarán primero este archivo antes de rastrear el resto del sitio.

Aunque un archivo robots.txt proporciona instrucciones para los bots, en realidad no puede hacer que se cumplan. Algunos bots, como los rastreadores web o los bots de noticias, pueden intentar visitar el archivo robots.txt antes de ver cualquier otra página de un dominio y seguir las instrucciones. Otros bots ignorarán el archivo robots.txt o lo procesarán para identificar las páginas web que están prohibidas.

Un bot de rastreo web que cumpla con el archivo robots.txt seguirá el conjunto de instrucciones más específico del archivo robots.txt. Si hay instrucciones contradictorias en el archivo, el bot seguirá la instrucción más detallada.

Una cosa importante que hay que tener en cuenta es que todos los subdominios necesitan su propio archivo robots.txt. Por ejemplo, mientras que www.cloudflare.com tiene su propio archivo, todos los subdominios de Cloudflare (blog.cloudflare.com, community.cloudflare.com, etc.) necesitan también el suyo.

¿Qué protocolos se utilizan en un archivo robots.txt?

En redes, un protocolo es un formato para proporcionar instrucciones o comandos. Los archivos robots.txt utilizan un par de protocolos diferentes. El protocolo principal se llama Protocolo de exclusión de bots. Es una forma de indicar a los bots las páginas web y recursos que deben evitar. Las instrucciones formateadas para este protocolo están incluidas en el archivo robots.txt.

El otro protocolo utilizado para los archivos robots.txt es el protocolo Sitemaps. Este se puede considerar un protocolo de inclusión de bots. Sitemaps muestran a un rastreador web qué páginas puede rastrear. Esto ayuda a garantizar que un bot rastreador no se pierda ninguna página importante.

Ejemplo de archivo robots.txt

Esta es una versión antigua del archivo robots.txt para www.cloudflare.com:

ejemplo de archivo robots.txt

A continuación, desglosamos lo que todo esto significa.

¿Qué es un agente de usuario? ¿Qué significa 'User-agent: *'?

Cualquier persona o programa activo en Internet tendrá un "agente de usuario", o un nombre asignado. Para los usuarios humanos, esto incluye información como el tipo de navegador y la versión del sistema operativo, pero no información personal; ayuda a los sitios web a mostrar contenidos compatibles con el sistema del usuario. Para los bots, el agente de usuario (en teoría) ayuda a los administradores del sitio web a saber qué tipo de bots están rastreando el sitio.

En un archivo robots.txt, los administradores del sitio web pueden proporcionar instrucciones específicas para determinados bots al escribir instrucciones diferentes para los agentes de usuario de los bots. Por ejemplo, si un administrador quiere que una determinada página aparezca en los resultados de búsqueda de Google, pero no en los de Bing, podría incluir dos conjuntos de comandos en el archivo robots.txt: un conjunto precedido por "User-agent: Bingbot" y un conjunto precedido por "User-agent: Googlebot".

En el ejemplo anterior, Cloudflare incluyó "User-agent: *" en el archivo robots.txt. El asterisco representa un comodín de "agente de usuario", y significa que las instrucciones se aplican a todos los bots, no a uno específico.

Los nombres de los agentes de usuario de los bots de los motores de búsqueda son los siguientes:

Google:

  • Googlebot
  • Googlebot-Image (para imágenes)
  • Googlebot-News (para noticias)
  • Googlebot-Video (para vídeo)

Bing

  • Bingbot
  • MSNBot-Media (para imágenes y vídeos)

Baidu

  • Baiduspider

¿Cómo funcionan los comandos "Disallow" en un archivo robots.txt?

El comando "disallow" es el más común en el protocolo de exclusión de robots. Indica a los bots que no accedan a la página web o al conjunto de páginas web que aparecen después del comando. Las páginas no permitidas no están necesariamente "ocultas", simplemente no son útiles para el usuario medio de Google o Bing, por lo que no se les muestran. La mayoría de las veces, un usuario del sitio web aún puede navegar a estas páginas si sabe dónde encontrarlas.

El comando Disallow puede utilizarse de varias maneras, varias de las cuales se muestran en el ejemplo anterior.

Bloquear un archivo (es decir, una página web concreta)

Como ejemplo, si Cloudflare quisiera bloquear a los bots para que no rastreen nuestro artículo " ¿Qué es un bot?", dicho comando se escribiría de la siguiente manera:

Disallow: /learning/bots/what-is-a-bot/

Después del comando «disallow», la parte de la URL de la página web que aparece después de la página de inicio, en este caso, "www.cloudflare.com", está incluida. Con este comando en su lugar, los bots que cumplan con las instrucciones de robots.txt no accederán a https://www.cloudflare.com/learning/bots/what-is-a-bot/, y, por lo tanto, es probable que la página no aparezca en los resultados de los motores de búsqueda tradicionales.

Bloquear un directorio

En ocasiones, es más eficiente bloquear varias páginas a la vez, en lugar de enumerarlas todas individualmente. Si todas se encuentran en la misma sección del sitio web, un archivo robots.txt puede limitarse a bloquear el directorio que las contiene.

Un ejemplo de lo anterior es:

Disallow: /__mesa/

Esto quiere decir que todas las páginas incluidas en el directorio __mesa no deben ser rastreadas.

Permitir el acceso total

Este comando tendría el siguiente aspecto:

Disallow:

Esto indica a los bots que pueden navegar por todo el sitio web, ya que nada está no permitido.

Ocultar todo el sitio web a los bots

Disallow: /

La barra "/" representa aquí la "raíz" en la jerarquía de un sitio web, es decir, la página desde la que se ramifican todas las demás páginas, por lo que incluye la página de inicio y todas las páginas enlazadas desde ella. Con este comando, es posible que los bots de los motores de búsqueda no rastreen el sitio web en absoluto.

¿Qué otros comandos forman parte del Protocolo de exclusión de bots?

Permitir: tal como cabría esperar, el comando "Permitir" indica a los bots que pueden acceder a una determinada página web o directorio. Este comando indica la preferencia del sitio web de permitir que los bots accedan a una página web específica, mientras que se prohíbe el acceso al resto de las páginas web del archivo. No todos los motores de búsqueda reconocen este comando.

Crawl-delay: El comando crawl delay está diseñado para evitar que los bots araña de los motores de búsqueda sobrecarguen un servidor. Permite que los administradores especifiquen cuánto tiempo, en milisegundos, debe esperar el bot entre cada solicitud. A continuación, un ejemplo de comando Crawl-delay en el que se indica que debe esperar 8 milisegundos:

Crawl-delay: 8

Google no reconoce este comando, aunque otros motores de búsqueda a menudo sí lo hacen. En Google, los administradores pueden cambiar la frecuencia de rastreo de su sitio web en Google Search Console.

¿Qué es el protocolo Sitemaps? ¿Por qué está incluido en robots.txt?

El protocolo Sitemaps ayuda a los bots a saber qué deben incluir en su rastreo de un sitio web.

Un Sitemap es un archivo XML con el siguiente aspecto:

Ejemplo de Sitemap

Es una lista legible por máquinas de todas las páginas de un sitio web. Mediante el protocolo Sitemaps, se pueden incluir enlaces a estos sitemaps en el archivo robots.txt. El formato es: "Sitemaps:" seguido de la dirección web del archivo XML. Puedes ver varios ejemplos en el archivo robots.txt de Cloudflare de arriba.

Aunque el protocolo de los sitemaps ayuda a garantizar que los bots araña web no se pierdan nada al rastrear un sitio web, los bots seguirán su proceso de rastreo habitual. Los Sitemaps no obligan a los bots rastreadores a priorizar las páginas web de forma diferente.

¿Cómo se relaciona robots.txt con la gestión de bots?

La gestión de bots es fundamental para mantener un sitio web o una aplicación en funcionamiento, porque incluso la actividad de los bots beneficiosos puede sobrecargar un servidor de origen, ralentizando o inutilizando una propiedad web. Un archivo robots.txt bien diseñado mantiene un sitio web optimizado para el SEO y controla la actividad de los bots. Un archivo robots.txt no será muy efectivo para gestionar el tráfico de bots maliciosos.

A pesar de la importancia del archivo robots.txt, en 2025 Cloudflare descubrió que solo el 37 % de los 10 000 sitios web más importantes tenían un archivo robots.txt. Esto significa que un gran porcentaje, quizás la mayoría, de los sitios web no están utilizando esta herramienta. Para ayudar a estos sitios web, especialmente a aquellos que no desean que su contenido original se utilice para el entrenamiento de IA, Cloudflare ofrece "robots.txt gestionado". Este es un servicio que crea o actualiza el archivo robots.txt en nombre de un sitio web con la configuración deseada. Más información sobre robots.txt gestionado.

Huevos de Pascua de robots.txt

En ocasiones, un archivo robots.txt contendrá huevos de pascua: mensajes humorísticos que dejaron los desarrolladores porque sabían que los usuarios rara vez ven estos archivos. Por ejemplo, el archivo robots.txt de Youtube dice lo siguiente: "Creado en un futuro lejano (el año 2000) después del levantamiento robótico de mediados de los 90 que acabó con todos los humanos." El archivo robots.txt de Cloudflare dice: "Querido bot, sé amable."


#    .__________________________.
#    | .___________________. |==|
#    | | ................. | |  |
#    | | ::[ Querido bot ]: | |  |
#    | | ::::[ sé amable ]:: | |  |
#    | | ::::::::::::::::: | |  |
#    | | ::::::::::::::::: | |  |
#    | | ::::::::::::::::: | |  |
#    | | ::::::::::::::::: | | ,|
#    | !___________________! |(c|
#    !_______________________!__!
#   /                            \
#  /  [][][][][][][][][][][][][]  \
# /  [][][][][][][][][][][][][][]  \
#(  [][][][][____________][][][][]  )
# \ ------------------------------ /
#  \______________________________/

Google también cuenta con un archivo "humans.txt" en: https://www.google.com/humans.txt

Preguntas frecuentes

¿Qué es un archivo robots.txt?

Un archivo robots.txt es una lista de preferencias de un sitio web acerca del comportamiento de los bots, ubicada en los archivos fuente del sitio web. Proporciona orientación a los bots buenos, como los rastreadores web de los motores de búsqueda, sobre las partes del sitio web a las que pueden acceder y las que deben evitar, lo que ayuda a gestionar el tráfico y controlar la indexación. También puede incluir reglas para los rastreadores de IA.

¿Qué es un rastreador web?

Un rastreador web es un bot automatizado que visita e indexa páginas web para motores de búsqueda, lo que ayuda a los usuarios a encontrar contenido a través de los resultados de búsqueda.

¿Qué es el protocolo de exclusión de bots?

El protocolo de exclusión de bots es el formato para las instrucciones en un archivo robots.txt. El protocolo indica a los rastreadores web qué páginas web o recursos no deben acceder o rastrear en un sitio web.

¿Qué significa "User-agent" en un archivo robots.txt?

"User-agent" especifica a qué bot o grupo de bots se aplica un conjunto de instrucciones en un archivo robots.txt. "User-agent: *" significa que la regla se aplica a todos los bots.

¿Qué es el comando "disallow" en robots.txt?

El comando "disallow" indica a los bots que no rastreen páginas o directorios específicos en un sitio web. Por ejemplo, "Disallow: /private/" indica a los bots que no accedan al directorio "private".

¿Qué es el protocolo Sitemaps en robots.txt?

El protocolo Sitemaps permite a los propietarios de sitios web incluir enlaces a sus archivos XML de sitemaps en el archivo robots.txt, lo que ayuda a los bots a descubrir qué páginas deben ser rastreadas.

¿En qué se diferencian los bots malos de los buenos?

Los bots buenos seguirán con mayor probabilidad las instrucciones de robots.txt; además, también realizan servicios útiles. Los rastreadores web de los motores de búsqueda, por ejemplo, suelen respetar las reglas de robots.txt cuando indexan contenidos para la búsqueda. Los bots malos a menudo ignoran el archivo robots.txt y pueden extraer contenidos, atacar sitios web o enviar un número excesivo de solicitudes que incrementan los costes del sitio web.

¿Qué hace el comando "Crawl-delay" en robots.txt?

El comando "Crawl-delay" indica a los bots cuánto tiempo deben esperar entre solicitudes para evitar sobrecargar un servidor. No todos los bots respetan este comando. Googlebot, por ejemplo, no lo hace, aunque Google permite a los administradores de sitios web establecer una regla similar mediante Google Search Console.

¿Cómo afecta el archivo robots.txt a la optimización SEO?

Un archivo robots.txt bien estructurado puede mejorar el SEO, ya que indica a los bots de los motores de búsqueda qué páginas deben indexar, lo que ayuda a evitar que se indexe contenido no esencial o duplicado. Además, el archivo robots.txt puede ayudar a los rastreadores web a encontrar todas las páginas que deben indexar mediante Sitemaps.