Un fichier robots.txt énumère les préférences d'un site web concernant le comportement des bots. Il indique aux bots quelles pages web ils doivent et ne doivent pas consulter. Les fichiers robots.txt sont les plus intéressants pour les robots d'indexation Web.
Cet article s'articule autour des points suivants :
Contenu associé
Abonnez-vous à theNET, le récapitulatif mensuel par Cloudflare des informations les plus populaires sur Internet !
Copier le lien de l'article
Un fichier robots.txt est un ensemble de directives à l'attention des bots. Ce fichier est inclus dans les fichiers source de la plupart des sites Web. Les fichiers robots.txt sont destinés à gérer les activités des bots comme les robots d'indexation, bien que tous les bots ne suivent pas les instructions.
Vous pouvez vous représenter un fichier robots.txt comme un panneau « Code de conduite » affiché sur le mur d'une salle de sport, d'un bar ou d'un centre communautaire : le panneau lui-même n'a pas le pouvoir de faire appliquer les règles indiquées, mais les « bons » clients suivront les règles, tandis que les « mauvais » les enfreindront et se feront exclure.
Un bot est un programme informatique automatisé qui interagit avec les sites Web et les applications. Il existe un type de bot appelé robot d’indexation web. Ces bots « explorent » les pages web et indexent le contenu pour le faire apparaître dans les résultats des moteurs de recherche. Un fichier robots.txt permet de gérer les activités de ces robots d’indexation afin qu’ils ne surchargent pas le serveur web hébergeant le site ni n’indexent les pages qui ne sont pas destinées à être consultées par le public. Un fichier robots.txt peut également faciliter la gestion des activités des bots d’indexation d’IA qui peuvent parfois imposer une charge bien plus importante sur les serveurs web que les robots d’indexation traditionnels.
Un fichier robots.txt est juste un fichier texte sans code de balisage HTML (d'où l'extension .txt). Le fichier robots.txt est hébergé sur le serveur web comme tout autre fichier sur le site web. En fait, le fichier robots.txt d'un site web donné peut généralement être consulté en tapant l'URL complète de la page d'accueil, puis en ajoutant /robots.txt, comme https://www.cloudflare.com/robots.txt. Le fichier n'est lié à aucun autre endroit du site, il est donc peu probable que les utilisateurs le trouvent, mais la plupart des robots d'indexation recherchent ce fichier avant d'explorer le reste du site.
Un fichier robots.txt fournit des instructions aux bots, cependant il ne peut pas les imposer. Certains bots, tels que les robots d'indexation ou les bots de flux d'actualités, peuvent tenter de visiter le fichier robots.txt avant de consulter d'autres pages d'un domaine et peuvent suivre les instructions. D’autres bots ignoreront le fichier robots.txt ou procèderont de manière à trouver les pages web interdites.
Un robot d'indexation bot qui respecte le fichier robots.txt suivra l'ensemble des instructions les plus spécifiques du fichier robots.txt. Si le fichier comporte des commandes contradictoires, le bot suivra la commande la plus détaillée.
Il est important de noter que tous les sous-domaines ont besoin de leur propre fichier robots.txt. Par exemple, alors que www.cloudflare.com a son propre fichier, tous les sous-domaines Cloudflare (blog.cloudflare.com, community.cloudflare.com, etc.) ont également besoin du leur.
Dans les réseaux, un protocole est un format permettant de fournir des instructions ou des ordres. Les fichiers Robots.txt utilisent plusieurs protocoles différents. Le protocole principal est appelé le protocole d'exclusion des robots. C'est un moyen de dire aux bots quelles pages web et quelles ressources éviter. Les instructions formatées pour ce protocole sont incluses dans le fichier robots.txt.
L'autre protocole utilisé pour les fichiers robots.txt est le protocole Sitemaps. Il peut être considéré comme un protocole d'inclusion de robots. Sitemaps indique à un robot d'indexation les pages qu'il peut explorer. De cette manière, un robot d'indexation ne manquera aucune page importante.
Voici une ancienne version du fichier robots.txt pour www.cloudflare.com :
Ci-dessous, nous expliquerons ce que tout cela signifie.
Toute personne ou programme actif sur Internet aura un « agent utilisateur » ou un nom attribué. Pour les utilisateurs humains, cela inclut des informations telles que le type de navigateur et la version du système d'exploitation, mais aucune information personnelle. Il aide les sites web à afficher un contenu compatible avec le système de l'utilisateur. En termes de bots, l'agent utilisateur (théoriquement) aide les administrateurs de sites web à savoir quel type de bot explore le site.
Dans un fichier robots.txt, les administrateurs de sites web peuvent fournir des instructions spécifiques pour des bots spécifiques en écrivant différentes instructions pour les agents utilisateurs de bots. Par exemple, si un administrateur souhaite qu'une certaine page apparaisse dans les résultats de recherche Google mais pas dans les recherches Bing, il peut inclure deux ensembles de commandes dans le fichier robots.txt : un ensemble précédé de « User-agent: Bingbot » et un ensemble précédé de « User-agent: Googlebot ».
Dans l'exemple ci-dessus, Cloudflare a inclus « User-agent: * » dans le fichier robots.txt. L'astérisque représente un agent utilisateur avec un « caractère générique », ce qui signifie que les instructions s'appliquent à tous les robots, et non à un robot spécifique.
Voici quelques noms d'agent utilisateur de bots de moteur de recherche courants :
Google :
Bing
Baidu
La commande Disallow (c'est-à-dire Interdire) est la plus courante dans le protocole d'exclusion des robots. Elle indique aux bots de ne pas accéder à la page web ou à l'ensemble des pages web qui suivent la commande. Les pages interdites ne sont pas nécessairement « masquées » — elles ne sont tout simplement pas utiles pour l'utilisateur moyen de Google ou Bing, donc elles ne leur sont pas montrées. La plupart du temps, un utilisateur du site web peut toujours naviguer vers ces pages s'il sait où les trouver.
La commande Disallow peut être utilisée de différentes façons reprises dans l'exemple ci-dessus.
Par exemple, si Cloudflare souhaitait empêcher les bots d'explorer notre article « Qu'est-ce qu'un bot ? », une telle commande serait écrite comme suit :
Interdire : /learning/bots/what-is-a-bot/
Après la commande « disallow », la partie de l'URL de la page web qui suit la page d'accueil — dans ce cas, « www.cloudflare.com ». – est insérée. Avec cette commande en place, les bots qui se conforment aux instructions de robots.txt n'accéderont pas à https://www.cloudflare.com/learning/bots/what-is-a-bot/, et la page ne s'affichera donc probablement pas dans les résultats des moteurs de recherche traditionnels.
Parfois, il est plus efficace de bloquer plusieurs pages à la fois, au lieu de les répertorier toutes individuellement. Si elles se trouvent toutes dans la même section du site web, un fichier robots.txt peut simplement bloquer le répertoire qui les contient.
Voici un exemple provenant du chemin indiqué ci-dessus :
Disallow : /__mesa/
Cette commande signifie que toutes les pages contenues dans le __répertoire mesa ne doivent pas être explorées.
Une telle commande se présenterait comme suit :
Disallow :
Cette commande indique aux bots qu'ils peuvent parcourir l'intégralité du site web, parce qu'il n'existe aucune interdiction.
Disallow: /
Le « / » représente ici la « racine » dans la hiérarchie d'un site web, ou la page à partir de laquelle toutes les autres pages se ramifient, il inclut donc la page d'accueil et toutes les pages qui lui sont reliées. Avec cette commande, les bots des moteurs de recherche peuvent ne pas explorer le site web du tout.
Allow : la commande « Allow » (Autoriser), comme on peut s'y attendre, indique aux bots qu'ils sont autorisés à accéder à une certaine page web ou à un certain répertoire. Cette commande indique la préférence selon laquelle le site web autorise les bots à atteindre une page web particulière, tout en interdisant le reste des pages web du fichier. Tous les moteurs de recherche ne reconnaissent pas cette commande.
Crawl delay : la commande Crawl delay est destinée à économiser la bande passante du serveur pour éviter que les spiders des moteurs de recherche ne causent des problèmes de chargement de serveurs. Elle permet aux administrateurs de préciser le temps entre chaque requête en millisecondes. Voici un exemple de commande Crawl delay correspondant à un temps d'attente de 8 ms :
Retard d'indexation : 8
Google ne reconnaît pas cette commande, même si d'autres moteurs de recherche le fassent souvent. Pour Google, les administrateurs peuvent modifier la fréquence d'exploration de leur site web dans la console Google Search.
Le protocole Sitemaps aide les bots à savoir quelles pages inclure dans l'indexation d'un site web.
Un sitemap du site est un fichier XML qui ressemble à ceci :
Il s'agit d'une liste lisible par une machine de toutes les pages d'un site web. À travers le protocole Sitemaps, des liens vers ces sitemaps peuvent être inclus dans le fichier robots.txt. Le format est le suivant : « Sitemaps : » suivi de l'adresse web du fichier XML. Vous pouvez voir plusieurs exemples dans le fichier Cloudflare robots.txt ci-dessus.
Bien que le protocole Sitemaps permette de garantir que rien ne puisse échapper aux spiders web lorsqu'ils visitent un site web, les bots continueront à suivre leur processus de crawling typique. Le Sitemaps n'oblige pas les robots d'indexation à hiérarchiser les pages web différemment.
La gestion des bots est essentielle pour maintenir un site Web ou une application opérationnel, car même une bonne activité de bot peut surcharger un serveur d'origine, ralentir ou supprimer une propriété web. Un fichier robots.txt bien construit maintient un site Web optimisé pour le SEO et maintient l'activité des bots bien gérés sous contrôle. Un fichier robots.txt ne sera pas très efficace pour gérer le trafic lié aux bots.
Malgré l'importance du fichier robots.txt, en 2025, Cloudflare a constaté que seuls 37 % de ses 10 000 principaux sites web possédaient un fichier robots.txt. Cela signifie qu'un grand pourcentage, voire la majorité, des sites web n'utilisent pas cet outil. Pour aider ces sites web, notamment ceux qui préfèrent que leur contenu original ne soit pas utilisé pour l'entraînement de l'IA, Cloudflare propose le fichier « managed robots.txt ». Il s'agit d'un service qui crée ou met à jour le fichier robots.txt pour un site web avec les paramètres souhaités. En savoir plus sur managed robots.txt.
Parfois, un fichier robots.txt contient des « œufs de Pâques », c'est-à dire des messages humoristiques que les développeurs ont inclus, car ils savent que ces fichiers sont rarement lus par les utilisateurs. Par exemple, le fichier robots.txt de YouTube comporte un texte anglais que l'on peut traduire ainsi : « Créé dans un avenir lointain (l'an 2000) après le soulèvement robotique du milieu des années 90 qui a anéanti tous les humains ». Le fichier robots.txt de Cloudflare demande « Dear robot, be nice », c'est-à-dire « Cher bot, sois gentil».
# .__________________________.
# | .___________________. |==|
# | | ................. | | |
# | | ::[ Dear robot ]: | | |
# | | ::::[ be nice ]:: | | |
# | | ::::::::::::::::: | | |
# | | ::::::::::::::::: | | |
# | | ::::::::::::::::: | | |
# | | ::::::::::::::::: | | ,|
# | !___________________! |(c|
# !_______________________!__!
# / \
# / [][][][][][][][][][][][][] \
# / [][][][][][][][][][][][][][] \
#( [][][][][____________][][][][] )
# \ ------------------------------ /
# \______________________________/
Google a aussi un fichier « humans.txt » sur : https://www.google.com/humans.txt
Un fichier robots.txt est une liste des préférences d’un site web concernant le comportement des bots, il figure parmi les fichiers source du site web. Il fournit des directives aux bons bots, tels que les robots d'indexation des moteurs de recherche, concernant les parties d'un site web auxquelles ils sont autorisés à accéder et celles qu'ils doivent éviter, contribuant ainsi à gérer le trafic et à contrôler l'indexation. Il peut également dresser la liste des règles pour les robots d’indexation IA.
Un robot d'indexation est un bot automatisé qui visite et indexe les pages web pour les moteurs de recherche, il aide donc les utilisateurs à trouver du contenu au sein des résultats de recherche.
Le protocole d'exclusion des robots est le format des instructions dans un fichier robots.txt. Le protocole indique aux robots d'indexation à quelles pages ou ressources ils ne doivent pas accéder ni explorer sur un site web.
« User-agent » spécifie quel bot ou groupe de bots est concerné par un ensemble d'instructions dans un fichier robots.txt. « User-agent : * » signifie que la règle s’applique à tous les bots.
La commande Disallow indique aux bots de ne pas explorer certaines pages ou certains répertoires sur un site web. Par exemple, « Disallow: /private/ » indique aux bots de ne pas accéder au répertoire « private ».
Le protocole Sitemaps permet aux propriétaires de sites web d'inclure des liens vers leurs fichiers XML de sitemap dans le fichier robots.txt, ce qui aide les bots à découvrir quelles pages doivent être analysées.
Les bons bots sont plus susceptibles de suivre les instructions robots.txt ; ils fournissent également des services utiles. Les robots d’indexation de moteurs de recherche, par exemple, respectent généralement les règles du fichier robots.txt lorsqu’ils indexent le contenu à des fins de recherche. Les bots malveillants, quant à eux, ignorent souvent le fichier robots.txt et peuvent extraire du contenu, attaquer des sites web ou envoyer des requêtes excessives qui augmentent les coûts du site web.
La commande Crawl-delay indique aux bots combien de temps ils doivent attendre entre les requêtes pour éviter de surcharger un serveur. Tous les bots ne respectent pas cette commande : Googlebot, par exemple, ne le fait pas, quand bien même Google permet aux administrateurs de sites web de définir une règle similaire via la console de recherche Google.
Un fichier robots.txt bien construit peut améliorer le SEO en indiquant aux bots des moteurs de recherche quelles pages doivent être indexées, ce qui permet d'éviter l'indexation de contenus non essentiels ou en double. De plus, le fichier robots.txt peut aider les robots d'indexation à trouver toutes les pages qu'ils doivent indexer via les Sitemaps.