Aller au contenu
Tous les articles
11 juillet 2026·4 min de lecture

Le fichier robots.txt expliqué : ce que vous bloquez et ce que vous ne bloquez pas sur un site pro

Ce que fait vraiment robots.txt, ce qu'il contrôle, et comment éviter de cacher tout votre site à Google par erreur.

robots.txt est un minuscule fichier texte placé à la racine de votre site, qui indique aux robots des moteurs de recherche où ils ont le droit de se promener. Ça paraît technique, mais la décision qui compte est simple : ce que vous laissez visible et ce que vous mettez de côté. Et c'est là que beaucoup de dirigeants commettent une erreur coûteuse — ils bloquent justement les pages qui devraient apparaître dans Google.

Bonne nouvelle : pas besoin d'être développeur pour comprendre. Dans cet article, je vous montre en langage clair à quoi sert robots.txt, à quoi il ne sert PAS (la partie que l'on confond le plus souvent), comment vérifier en deux minutes ce que contient votre propre site, et quand il vaut vraiment la peine d'y toucher. Sans jargon inutile.

Ce qu'est vraiment robots.txt

Imaginez un panneau à l'entrée d'un bâtiment : « Accueil et showroom — bienvenue ; entrepôt et comptabilité — interdit aux visiteurs. » C'est en gros ce que fait robots.txt pour les robots des moteurs de recherche (Googlebot et les autres).

C'est un simple fichier texte, toujours accessible à la même adresse : votre-domaine.com/robots.txt. Vous pouvez l'ouvrir dans votre navigateur dès maintenant et voir ce qui y est écrit — tout site public le montre à qui veut.

Les règles à l'intérieur ressemblent à ceci :

  • User-agent: * — « cette règle s'applique à tous les robots »
  • Disallow: /admin — « n'entrez pas dans la zone /admin »
  • Allow: / — « le reste est ouvert »

Les robots sérieux le lisent et le respectent. C'est une convention de bonne conduite, pas un cadenas — retenez-le, c'est important pour la section suivante.

La grande confusion : « bloqué » ne veut pas dire « caché »

C'est là que presque tout le monde se trompe. On croit qu'en mettant une page en Disallow, elle disparaît de Google. Faux — et cette confusion peut faire des dégâts.

Disallow dit aux robots « ne lisez pas le contenu de cette page ». Il ne dit pas « oubliez qu'elle existe ». Si un autre site pointe vers cette page, Google peut quand même afficher l'adresse dans les résultats, mais sans description — ça fait négligé et vous échappe.

Donc robots.txt n'est PAS une méthode de sécurité. N'y cachez pas de pages avec données sensibles, factures, espaces client ou quoi que ce soit que personne ne doit voir. Qui connaît l'adresse entre directement ; le fichier n'arrête personne.

  • Vous voulez qu'une page sorte vraiment de Google ? On utilise une balise « noindex » sur la page, pas robots.txt.
  • Vous voulez quelque chose de vraiment privé ? On le protège par mot de passe ou authentification, au niveau du serveur.

Ce qui mérite d'être bloqué et ce qui doit rester ouvert

Pour un site professionnel classique — présentation, services, portfolio, contact — la règle d'or est : laissez tout ouvert, ne bloquez que le fouillis technique.

Généralement à tenir à l'écart des robots :

  • les zones d'administration (ex. /wp-admin sur WordPress)
  • les pages panier, paiement, compte client d'une boutique
  • les résultats de recherche interne et filtres qui génèrent des milliers d'adresses en double
  • les fichiers techniques que personne ne cherche de toute façon

Ce qu'il ne faut JAMAIS bloquer si vous voulez des clients via Google :

  • la page d'accueil
  • les pages services et tarifs
  • les articles de blog
  • les fichiers CSS et JavaScript — Google en a besoin pour « voir » l'apparence du site ; si vous les bloquez, il peut croire que le site est cassé sur mobile

L'erreur classique est une seule ligne, « Disallow: / », restée de la phase de construction. Elle dit « n'indexez RIEN » et sort tout votre site des recherches.

Comment vérifier votre site en deux minutes

Pas besoin d'outils coûteux. Trois étapes :

1. Ouvrez votre-domaine.com/robots.txt dans votre navigateur. Si vous voyez « Disallow: / » tout seul, arrêtez — vous avez un problème à corriger d'urgence.

2. Allez sur Google et cherchez : site:votre-domaine.com. Cela vous montre quelles de vos pages Google connaît. S'il manque des pages importantes, quelque chose les bloque.

3. Utilisez Google Search Console (gratuit) — il possède un outil de test du robots.txt et vous dit exactement quelle page est bloquée et pourquoi.

Si vous êtes sur une plateforme clé en main (WordPress, Shopify, wpcom), robots.txt est souvent généré automatiquement et correctement dès le départ. Les problèmes surgissent quand quelqu'un l'a modifié à la main ou a laissé cochée l'option « décourager les moteurs de recherche » depuis la construction.

Quand vaut-il la peine d'appeler quelqu'un

Pour la plupart des sites pro, un robots.txt correct signifie en gros « n'y touchez pas, laissez la plateforme le générer ». La complexité arrive avec les grandes boutiques, les sites à nombreux filtres ou les migrations, où les adresses en double embrouillent vraiment Google.

Chez MPO Web Studio, quand nous construisons un site, nous le livrons avec robots.txt et indexation pensés dès le départ — pages de vente ouvertes, zones techniques fermées, sans la ligne fatale qui cache tout. Nous travaillons entièrement à distance, dans tout le pays, et nous pouvons d'abord vous construire une démo prête de votre site pour que vous voyiez le résultat avant de payer quoi que ce soit.

Si vous soupçonnez que votre site « n'apparaît pas sur Google » sans savoir par où commencer, écrivez-nous sur WhatsApp. Nous regarderons ensemble robots.txt et l'indexation et vous dirons honnêtement s'il s'agit d'une réparation de cinq minutes ou de quelque chose de plus sérieux — sans promesse de « première place garantie », car personne d'honnête ne peut la garantir.

Questions fréquentes

Ai-je absolument besoin d'un fichier robots.txt ?+

Ce n'est pas obligatoire. S'il est absent, les robots supposent qu'ils ont accès partout — ce qui, pour un simple site de présentation, convient souvent parfaitement. Un robots.txt devient utile quand vous voulez tenir à l'écart des zones techniques ou des pages en double.

J'ai mis une page en Disallow, mais elle apparaît toujours dans Google. Pourquoi ?+

Parce que Disallow empêche seulement la lecture du contenu, pas l'affichage de l'adresse. Si d'autres sites y pointent, Google peut la lister sans description. Pour la retirer complètement, il faut une balise « noindex » sur la page, pas une ligne dans robots.txt.

Puis-je cacher des pages privées (factures, données client) avec robots.txt ?+

Non, et c'est risqué d'essayer. robots.txt est public et ne bloque pas l'accès direct — qui connaît l'adresse entre quand même. Les données sensibles se protègent par mot de passe ou authentification serveur, pas par une règle de politesse pour robots.

Comment vérifier mon robots.txt tout de suite ?+

Ouvrez l'adresse de votre domaine suivie de /robots.txt dans un navigateur. Si « Disallow: / » apparaît seul, tout votre site est bloqué pour Google et doit être corrigé vite. Pour un diagnostic complet, utilisez Google Search Console, c'est gratuit.

J'ai modifié robots.txt. Combien de temps avant que Google le voie ?+

Les robots relisent le fichier régulièrement, généralement en quelques jours. Vous pouvez accélérer en demandant une réindexation dans Google Search Console. Ce n'est pas instantané, alors vérifiez deux fois votre modification avant de la publier.

Guide gratuit

7 erreurs qui font fuir vos clients de votre site

Laissez votre e-mail et recevez le guide ici, tout de suite. Sans spam.

En envoyant, vous acceptez la Politique de confidentialité.
Gratuit · sans engagement

Envie de voir à quoi ressemblerait le site de votre entreprise ?

Écrivez-nous sur WhatsApp et nous préparons GRATUITEMENT un site de démonstration au nom de votre entreprise. Vous le voyez d'abord — vous décidez ensuite.

Demander un site démo gratuitNous répondons sur WhatsApp en quelques minutes