Retour à l'accueil

Robots.txt et sitemap.xml : configuration de l'indexation

L'article décrit la configuration de robots.txt et sitemap.xml pour optimiser l'exploration par les moteurs de recherche. Les directives, la syntaxe, l'emplacement, la vérification et l'intégration sont couverts. Des exemples pour Google et Yandex sont fournis, y compris les extensions pour les médias.

Optimisation de l'exploration : robots.txt + sitemap.xml
Advertisement 728x90

Configuration optimale de robots.txt et sitemap.xml pour l'exploration

Un seul caractère dans robots.txt peut bloquer des sections clés d'un site web, entraînant une chute de trafic. Lors d'un projet récent, un répertoire de catalogue produits est devenu inaccessible aux robots d'exploration à cause d'une erreur de fichier — le trafic organique a diminué d'un tiers en deux semaines. Robots.txt gère l'accès des robots, tandis que sitemap.xml définit les priorités de balayage. Ces fichiers déterminent l'efficacité de l'indexation dans Google et Yandex.

Directives et syntaxe de robots.txt

Robots.txt est placé à la racine du site et contient des instructions pour les robots : Googlebot, YandexBot et autres. Directives principales :

  • User-agent : spécifie le robot. User-agent: * — pour tous, User-agent: Googlebot — uniquement Google.
  • Disallow : interdit un chemin. Disallow: /admin/ bloque un répertoire, Disallow: /search? — les URL avec paramètres de recherche.
  • Allow : autorise dans un répertoire bloqué. Exemple :
User-agent: *
Disallow: /catalogue/
Allow: /catalogue/page-principale/
  • Sitemap : lien vers le plan du site, en dehors des blocs User-agent.

Un slash à la fin de Disallow indique un répertoire. Sans slash — toute URL avec le préfixe. Robots.txt ne bloque pas l'indexation entièrement : les liens externes peuvent ajouter une page à l'index avec un avertissement. Pour noindex, utilisez des balises meta ou l'autorisation.

Google AdInline article slot

Exemple de base de robots.txt :

User-agent: *
Disallow: /admin/
Disallow: /panier/
Disallow: /search?
Disallow: /*?sort=
Disallow: /*?filter=
Allow: /
Sitemap: https://site.fr/sitemap.xml

Ce modèle bloque les sections de service et les paramètres de filtre.

Différences dans le support des directives

| Directive | Google | Yandex |

Google AdInline article slot

|---------------|--------|--------|

| User-agent | ✅ | ✅ |

| Disallow | ✅ | ✅ |

Google AdInline article slot

| Allow | ✅ | ✅ |

| Sitemap | ✅ | ✅ |

| Host | ❌ | ✅ |

| Crawl-delay | ❌ | ✅ |

| Clean-param | ❌ | ✅ |

La directive Host pour Yandex définit le miroir principal : Host: https://site.fr. Google l'ignore — utilisez Search Console.

Placement et vérification de robots.txt

  • Créez le fichier robots.txt dans un éditeur de texte (VS Code, Notepad++).
  • Téléversez à la racine : https://site.fr/robots.txt.
  • Pour les CMS :

- WordPress : Yoast SEO ou FTP.

- Bitrix : gestionnaire de fichiers du panneau d'administration.

- Tilda/Wix : paramètres du panneau.

  • Vérifiez l'accessibilité : ouvrez l'URL dans un navigateur (attendez du texte, pas 404/500).
  • Testez : Google Search Console (Exploration), Yandex.Webmaster (Analyse Robots.txt).

Les erreurs de syntaxe entraînent des lignes ignorées ou un comportement imprévisible.

Structure de sitemap.xml

Sitemap.xml liste les URL importantes pour la priorité d'exploration. Utile pour les sites avec >100 pages, mises à jour fréquentes ou pages orphelines.

Structure de base :

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://site.fr/</loc>
    <lastmod>2026-01-15</lastmod>
    <changefreq>daily</changefreq>
    <priority>1.0</priority>
  </url>
</urlset>

Balises :

  • loc : URL obligatoire.
  • lastmod : date de modification réelle.
  • changefreq : fréquence (daily/weekly ; Google ignore, Yandex considère).
  • priority : 0.0–1.0 pour l'ordre.

Limitations : 50 000 URL, 50 Mo. Pour plus — sitemap-index :

<?xml version="1.0" encoding="UTF-8"?>
<sitemapindex xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <sitemap>
    <loc>https://site.fr/sitemap-pages.xml</loc>
  </sitemap>
</sitemapindex>

Génération de sitemap.xml

  • CMS/plugins : WordPress (Yoast), Bitrix (Marketing). Mises à jour automatiques, mais vérifiez les URL inutiles.
  • Générateurs en ligne : pour les sites statiques, mises à jour manuelles.
  • Scripts : pour les SPA (Next.js + next-sitemap). Génère pendant la construction.

Placez à la racine ou spécifiez dans robots.txt.

Intégration des fichiers

  • Ajoutez à robots.txt : Sitemap: https://site.fr/sitemap.xml.
  • Soumettez à Google Search Console (Sitemaps) et Yandex.Webmaster (Indexation).
  • Vérifiez : les URL dans le sitemap ne doivent pas être dans Disallow, statut 200 OK.

Sitemaps avancés

Pour les médias :

Images :

<url>
  <loc>https://site.fr/article/</loc>
  <image:image>
    <image:loc>https://site.fr/images/photo.jpg</image:loc>
    <image:title>Description</image:title>
  </image:image>
</url>

Vidéo (fragment) :

<url>
  <loc>https://site.fr/page-video/</loc>
  <video:video>
    <video:thumbnail_loc>https://site.fr/miniature.jpg</video:thumbnail_loc>
  </video:video>
</url>

Améliore l'indexation dans Google Images et Yandex.Images.

Points clés à retenir

  • Robots.txt économise le budget d'exploration mais ne remplace pas noindex.
  • Sitemap accélère la découverte de nouvelles pages et structure le site.
  • Vérifiez toujours les conflits : les URL dans le sitemap doivent être accessibles.
  • Considérez les différences Google/Yandex dans les directives (Host, Clean-param).
  • Pour les grands sites, utilisez sitemap-index et les extensions médias.

— Editorial Team

Advertisement 728x90

Lire ensuite