Clustraly
SEO technique & Agent SEO

Auditeur robots.txt de l'Agent SEO : des règles dures et une matrice de régression qui verrouillent votre crawlabilité

Agent SEO Auditeur robots.txt (règles dures + matrice de régression) est une fonctionnalité du module SEO technique & Agent SEO de Clustraly. L'auditeur robots.txt applique des règles inviolables puis rejoue une matrice URL × bot sur vos vraies pages ; une seule erreur bloque la publication.

Chaque robots.txt proposé passe un audit à règles inviolables et une matrice de test sur vos vraies URLs face aux principaux crawlers. Si une page indispensable devient inaccessible ou qu'une zone privée fuit, rien n'est publié. L'IA propose, vous décidez.

Un garde-fou, pas un pari

Rien ne part en ligne si votre crawlabilité casse

Un robots.txt mal réglé peut fermer votre blog à Google ou ouvrir /admin aux robots. L'auditeur se place entre la proposition de l'agent et la mise en ligne : il valide le fichier exact, avant que vous ne décidiez.

Une seule erreur suffit à bloquer toute la proposition. Vous ne publiez jamais un robots.txt que l'audit n'a pas validé.

  • Audit exécuté avant toute proposition et avant toute publication
  • Une erreur bloque l'ensemble, pas de publication partielle
  • Vous gardez la décision finale, l'agent ne publie rien seul
Des règles inviolables

Six vérifications dures qui ne pardonnent aucune faute

L'audit exige au moins un groupe, un fichier sous 500 Ko, au moins une ligne Sitemap et toutes en URL absolue. Il refuse le blocage de la racine « / » pour un robot inconnu, tout chemin sensible listé, et toute règle qui bloquerait le paramètre lang= même déguisée en %-encoding, décodé avant contrôle.

  • Racine « / » jamais fermée au groupe générique (User-agent: *)
  • Sitemap présent et toujours en URL absolue http(s)
  • Chemins sensibles et blocages de lang= refusés
  • Taille bornée à 500 Ko, au moins un groupe valide
Une matrice, pas une supposition

Vos vraies pages testées contre les crawlers qui comptent

L'auditeur ne teste pas des exemples théoriques : il croise de vraies URLs de votre site — accueil, blog, article récent, CSS du thème actif, image média, sitemap, llms.txt — avec les crawlers majeurs comme Googlebot, Bingbot, GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Twitterbot et AhrefsBot.

Les cas qui n'existent pas chez vous sont ignorés : catégorie et langue secondaire ne sont testées que si vous en avez. La matrice colle à votre site réel, pas à un site générique.

  • URLs prélevées sur votre contenu et vos assets réels
  • Huit crawlers majeurs : moteurs, IA, social et SEO
  • Cas absents (catégorie, 2e langue) écartés automatiquement
Deux verdicts qui bloquent

Ni régression de crawl, ni fuite de zone privée

Deux fautes sont traquées. La régression : un robot indispensable ne peut plus atteindre une URL qui devait rester ouverte. La fuite : une adresse censée être fermée — /admin, /api, /search, une URL à paramètres utm_ — reste accessible.

Chaque URL porte une attente claire, autorisée ou bloquée, et le verdict est rendu par la même logique de décision que le testeur URL × Bot. Le moindre écart devient une erreur.

  • Régression détectée : page utile devenue inaccessible
  • Fuite détectée : /admin, /api, /search ou ?utm_ ouverts
  • Même moteur de décision que le testeur URL × Bot
Le même juge, deux fois

Audité à la proposition, ré-audité à la publication

Quand l'agent applique un ajustement autorisé, l'audit dur est rejoué ; s'il échoue, le brouillon déterministe et sûr est restauré. Au moment où vous cliquez pour publier, l'audit tourne à nouveau côté serveur, sur le contenu exact.

Cette frontière de confiance ne se contourne pas : un appel direct au serveur subit le même contrôle qu'un clic dans l'interface. Ce qui passe est vraiment sûr.

  • Ajustement risqué : brouillon sûr restauré automatiquement
  • Ré-audit côté serveur au moment du clic Publier
  • Contrôle identique depuis l'UI ou depuis un POST direct
Pourquoi ça compte

L'IA propose, l'audit tranche, vous décidez

L'Agent SEO compose un robots.txt déterministe et vous en explique chaque effet. L'auditeur, lui, ne négocie pas : il applique des règles dures et une matrice de régression sur vos vraies pages. Vous validez en connaissance de cause, jamais à l'aveugle.

FAQ

Questions fréquentes

Que se passe-t-il si l'audit trouve une seule erreur ?
La proposition entière est bloquée. Aucune publication partielle n'est possible : tant que l'erreur n'est pas levée, le robots.txt fautif ne remplace pas celui qui est en ligne.
L'audit teste-t-il de vraies URLs de mon site ?
Oui. La matrice de régression prélève de vraies pages — accueil, blog, article récent, CSS du thème actif, image média, sitemap, llms.txt — et les confronte aux crawlers majeurs. Les cas qui n'existent pas chez vous, comme une catégorie ou une langue secondaire, sont ignorés.
Puis-je contourner l'audit en publiant directement ?
Non. L'audit déterministe est rejoué côté serveur au moment de la publication, sur le contenu exact. Un appel direct subit le même contrôle qu'un clic dans l'interface ; le bouton désactivé de l'UI n'est qu'un rappel visuel.
Quelles fautes l'auditeur considère-t-il comme bloquantes ?
Une régression, quand un robot indispensable perd l'accès à une URL qui devait rester ouverte ; une fuite, quand une zone privée comme /admin ou /api reste accessible ; la racine « / » fermée au groupe générique ; l'absence de Sitemap absolu ; un chemin sensible listé ou un blocage du paramètre lang=.
Prêt à commencer ?

Publiez un robots.txt dont vous êtes sûr

Laissez l'Agent SEO composer, laissez l'auditeur vérifier, gardez la décision. Chaque robots.txt proposé passe des règles dures et une matrice de régression sur vos vraies pages avant d'arriver sous vos yeux. Vous validez ce qui protège votre référencement, vous écartez le reste.