Fichier robots.txt

Définition

Un point à connaître avant de se lancer : le budget de crawl (le temps que Google consacre à explorer votre site) n’est un vrai enjeu que pour les sites de grande taille. Pour un site de quelques dizaines ou centaines de pages bien structurées, Googlebot revient régulièrement sur l’ensemble du contenu sans contrainte particulière. Le fichier robots.txt reste néanmoins utile pour éviter le gaspillage sur des pages sans valeur (recherche interne, panier, espace privé), et surtout pour éviter les erreurs de blocage accidentel.

Pourquoi le fichier robot.txt est-il important pour le SEO ?

  1. Contrôler l’exploration du site

Il permet d’empêcher l’exploration de contenus inutiles (admin, pages de test, doublons…).

  1. Optimiser le budget de crawl
  1. Prévenir les erreurs d’indexation

Bien configuré, il réduit le risque que des pages techniques ou privées soient indexées.

Comment modifier le fichier robots.txt dans WordPress ?

Bonnes pratiques pour un fichiers robots.txt

Exemple de configuration recommandée

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://votresite.fr/sitemap.xml

Un rapide contrôle mensuel de ces réglages évite bien des mauvaises surprises.

Exemple de configuration recommandée pour un site e-commerce avec WooCommerce

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /panier/
Disallow: /commande/
Disallow: /*?ajouter-au-panier=*
Sitemap: https://votresite.fr/sitemap.xml

Erreurs courantes avec le fichier robots.txt

  • Bloquer les fichiers CSS et JS nécessaires au rendu : Google a besoin de charger ces ressources pour comprendre comment votre page s’affiche réellement. Les bloquer peut nuire à votre classement, en particulier sur mobile ;
  • Confondre disallow et noindex : une page bloquée par robots.txt (disallow) peut malgré tout apparaître dans les résultats si elle est liée ailleurs, juste sans description. Pour retirer une page de l’index, la balise noindex est le bon outil, pas robots.txt ;
  • Bloquer par erreur tout le site en production : la fameuse ligne Disallow: /, souvent utilisée pour un environnement de préproduction, oubliée lors de la mise en ligne définitive. Une vérification systématique après chaque migration évite ce risque ;
  • Considérer robots.txt comme une mesure de sécurité : ce fichier est public et consultable par n’importe qui à l’adresse /robots.txt. Ne jamais y révéler l’emplacement de pages sensibles que vous souhaitez garder confidentielles, ça reviendrait à en indiquer l’adresse.

Le blocage des robots IA, une pratique encore minoritaire chez les petites structures

Les chiffres varient beaucoup selon les études (de 13 % à près de 50 % des sites bloquant au moins un robot d’entraînement, selon la méthodologie et l’échantillon retenu), un écart trop large pour en tirer un pourcentage unique fiable. En revanche, un relevé français très récent, mené sur 90 sites de commerces et PME début septembre 2026, donne une image plus concrète et plus proche de la réalité du terrain : seulement 4 sites sur 90 bloquaient au moins un robot IA, et 30 n’avaient même aucun fichier robots.txt du tout, autorisant tout par défaut sans le savoir. (Sources : Info-Lux, relevé du 4 septembre 2026 sur 90 sites français, méthodologie transparente. Écart entre études internationales noté honnêtement, à traiter comme un ordre de grandeur très variable.)

Autre donnée française à retenir, sur le risque inverse : selon un audit spécialisé, 38 % des sites français bloqueraient involontairement au moins un robot IA majeur, généralement par une configuration Cloudflare ou un plugin de sécurité mal réglé, pas par choix délibéré. C’est exactement le genre d’erreur qu’on a corrigée ensemble sur ce site, un fichier physique qui empêchait tout réglage virtuel de s’appliquer.

FAQ – Fichier robots.txt

Le fichier robots.txt peut-il bloquer l’indexation d’une page ?

Non directement. Il empêche l’exploration, mais une page peut être indexée si elle est liée ailleurs. Utilisez noindex pour empêcher l’indexation.

Puis-je bloquer tout mon site avec robots.txt ?

Oui, avec Disallow: /, mais ce n’est conseillé que pour une préproduction ou en maintenance.

Est-ce obligatoire d’avoir un fichier robots.txt ?

Non, mais il est recommandé pour garder le contrôle sur le crawl de votre site. C’est également un des premiers fichiers que Google lit.

Faut-il bloquer le fichier robots.txt lui-même dans robots.txt ?

Non, ce serait contre-productif : le fichier robots.txt doit toujours rester accessible aux robots pour qu’ils puissent lire les instructions qu’il contient. C’est d’ailleurs l’un des tout premiers fichiers que Googlebot consulte en arrivant sur un site.

Quels sont les risques d’une mauvaise configuration du fichier robots.txt ?

Le risque le plus grave est de bloquer accidentellement l’exploration de tout le site (avec un Disallow: / oublié en production), rendant vos pages invisibles pour Google. Une configuration trop restrictive peut aussi empêcher l’exploration de ressources nécessaires à l’affichage (CSS, JS), pénalisant votre référencement mobile.

Stéphane Bataillard

Stéphane Bataillard

Formateur WordPress SEO et IA certifié Qualiopi

Formateur et webmaster WordPress indépendant à Paris depuis 2013 : plus de 800 stagiaires formés, Contributeur WordPress.

Qualiopi, Tosa WordPress, École du SEO
33 articles publiésSpécialités : WordPress, Web, SEO, Webmastering
Défiler vers le haut