Disallow (robots.txt)
Disallow est la directive du fichier robots.txt qui interdit aux robots d'exploration l'accès à une URL, un répertoire ou un motif d'URL d'un site. Elle s'applique au crawl, pas à l'indexation : une page bloquée par Disallow peut encore apparaître dans les résultats de Google si d'autres pages la mentionnent, avec une URL sans description. Bien utilisée, elle protège le budget de crawl en écartant les sections sans intérêt pour les moteurs ; mal utilisée, elle empêche Google de voir des pages ou des ressources indispensables.
La directive Disallow est une instruction du fichier robots.txt qui indique aux robots d'exploration des moteurs de recherche les pages ou répertoires qu'ils ne doivent pas explorer. Elle contrôle l'accès des robots à certaines parties d'un site, sans interdire l'indexation des URL concernées.
Disallow permet aux propriétaires de sites de choisir quels robots peuvent explorer quelles parties de leur site, et de bloquer l'exploration des sections sans intérêt pour les moteurs (filtres de navigation, résultats de recherche interne, espaces de compte). Elle ne protège pas des informations confidentielles : le fichier robots.txt est public, et un robot malveillant ne le respecte pas. Une page privée se protège par une authentification, pas par le robots.txt.
Il convient de différencier les directives que vous pouvez utiliser en matière de SEO :
- Disallow : directive qui indique aux robots les pages ou les répertoires à ne pas explorer.
- Noindex : balise meta (ou en-tête HTTP X-Robots-Tag) placée sur une page pour demander aux moteurs de ne pas l'afficher dans les résultats de recherche. Elle n'a d'effet que si la page peut être explorée.
- Nofollow : attribut de lien ou balise meta qui demande aux moteurs de ne pas suivre les liens et de ne pas leur transmettre de popularité.
Comment formuler une directive Disallow ?
La formulation d'une directive Disallow est relativement simple. Elle suit généralement la structure suivante : Disallow: [chemin]. Le [chemin] représente l'URL ou le chemin d'accès que vous souhaitez bloquer aux robots d'exploration des moteurs de recherche.
Exemples pratiques d'utilisation de Disallow en SEO
Voici quelques exemples d'utilisation de la directive Disallow :
- Disallow: /admin/ bloque la partie "admin" du site, empêchant ainsi l'accès des robots d'exploration à cette section à toutes ses URL.
- Disallow: /images/ bloque le répertoire "images", empêchant les robots d'exploration d'accéder aux images du site (ce qui les fera disparaître de Google Images à terme).
- Disallow: /example.html bloque une page spécifique nommée "example.html".
- Disallow: /*.pdf bloque l'accès à tous les fichiers PDF du site.
Il est important de noter que Disallow (comme Allow) n'est qu'une instruction, et il revient aux robots d'exploration de décider s'ils respectent ou non cette instruction. Les robots d'exploration bien intentionnés, tels que Googlebot (robot de Google), suivront généralement les directives de Disallow, tandis que d'autres robots non autorisés peuvent ne pas les respecter.
Personnalisation des règles pour différents user-agents
Il est possible de personnaliser les règles de Disallow pour différents user-agents. Par exemple, vous pouvez spécifier des directives différentes pour les robots Googlebot et Bingbot :
User-agent: Googlebot Disallow: /admin/ User-agent: Bingbot Disallow: /images/
Cela permet de bloquer l'accès à certaines parties du site spécifiquement pour certains robots, tandis que d'autres robots peuvent avoir des règles différentes (si vous souhaitez par exemple avoir une approche différente entre votre stratégie de référencement pour Bing ou Google).
Optimisation du budget de crawl et de la qualité du contenu grâce à Disallow
L'utilisation de Disallow permet d'optimiser le budget de crawl des moteurs de recherche, ce qui compte surtout sur les sites de plusieurs dizaines de milliers de pages. En bloquant l'accès aux URL sans valeur (navigation à facettes, tris, recherche interne, paniers), on laisse les robots consacrer leurs ressources aux pages qui doivent se positionner. La directive Allow, plus spécifique, permet d'autoriser une exception à l'intérieur d'un répertoire bloqué.
Disallow aide également à se concentrer sur la création de contenu de qualité et pertinent d'un site Internet. En bloquant l'accès aux pages de moindre qualité ou non pertinentes, cela permet aux moteurs de recherche de mieux comprendre l'intention de votre site et de le positionner de manière optimale dans les résultats de recherche.
Comprendre les limites de Disallow en matière d'indexation
Disallow n'empêche pas l'indexation. Google peut indexer une URL bloquée s'il la découvre par des liens, en l'affichant sans description (« Aucune information n'est disponible pour cette page »). Pour retirer une page des résultats, il faut au contraire la laisser explorer et y placer une balise noindex, ou la protéger par un mot de passe. Bloquer par Disallow une page déjà en noindex est une erreur classique : Google ne peut plus lire la balise. Autre piège : bloquer les fichiers CSS et JavaScript empêche Google de rendre les pages correctement.
Conseils pour tester et optimiser le fichier robots.txt
Pour éviter les erreurs, il est recommandé de vérifier régulièrement le fichier robots.txt. Le rapport « robots.txt » de la Search Console (qui a remplacé l'ancien testeur fin 2023) montre les versions du fichier lues par Google et les erreurs d'analyse ; l'outil d'inspection d'URL indique si une page donnée est bloquée. Des outils comme Screaming Frog ou la bibliothèque open source de Google (robotstxt) permettent de tester des règles avant leur mise en ligne.
Pour aller plus loin
- Le fichier robots.txt : comment bien l'optimiser pour son référencement ? (guide Abondance)
- Fichier robots.txt : erreurs fréquentes et astuces (Réacteur)
Sources :
- Présentation du fichier robots.txt et guide (Google Search Central)
- Comment Google interprète la spécification robots.txt (Google Search Central)
- Créer et envoyer un fichier robots.txt (Google Search Central)
- RFC 9309: Robots Exclusion Protocol (IETF)
- Rappel sur les robots : le fichier robots.txt, un moyen flexible de contrôler la façon dont les robots explorent votre site Web (Google Search Central Blog), le 7 mars 2025
FAQ
Disallow empêche-t-il l'indexation d'une page ?
Non. Il empêche l'exploration. Si Google découvre l'URL par des liens, il peut l'indexer sans en connaître le contenu. Pour désindexer une page, il faut la laisser explorable et y placer une balise meta robots noindex (ou un en-tête X-Robots-Tag), puis, une fois retirée, la bloquer si on le souhaite.
Quelle est la différence entre Disallow et noindex ?
Disallow (robots.txt) agit sur l'exploration : le robot ne visite pas la page. Noindex (balise meta) agit sur l'indexation : le robot visite la page mais ne l'affiche pas dans les résultats. Les deux ne se combinent pas sur une même page, car le noindex doit être lu pour agir.
Comment bloquer tout un site avec Disallow ?
Avec User-agent: * suivi de Disallow: / (une barre oblique seule). C'est le réglage d'un site en préproduction, à ne jamais laisser en production : c'est l'une des causes les plus fréquentes de disparition d'un site après une mise en ligne.
Les robots des IA respectent-ils Disallow ?
Les principaux le déclarent : GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (pour l'entraînement de Gemini), PerplexityBot ou CCBot (Common Crawl) ont chacun un user-agent que l'on peut cibler. Bloquer Google-Extended n'a aucun effet sur le référencement classique ni sur les AI Overviews, qui dépendent de Googlebot.
En résumé
- Disallow : la directive du robots.txt qui interdit l'exploration d'une URL, d'un répertoire ou d'un motif.
- Syntaxe : User-agent: puis Disallow: /chemin/, avec des règles par robot et des exceptions via Allow.
- Crawl, pas indexation : une URL bloquée peut rester dans les résultats ; pour désindexer, laisser explorer et utiliser noindex.
- Usage : préserver le budget de crawl sur les grandes sections sans valeur, jamais bloquer les CSS et JS.
- Contrôle : le rapport robots.txt et l'inspection d'URL de la Search Console.
Abondance c'est aussi des audits SEO, un service de contenus et des formations en e-learning !
Publié le Mis à jour le
Autres définitions :
Les outils SEO pour vous aider



