Clustraly
SEO technique & Agent SEO

Registre de bots crawler : sachez qui explore votre site, décidez famille par famille

Agent SEO Registre de bots crawler est une fonctionnalité du module SEO technique & Agent SEO de Clustraly. Le registre de bots crawler est un catalogue versionné d'environ 90 robots d'exploration, classés en sept familles, qui pilote les autorisations de votre robots.txt.

Chaque robot est identifié — organisation, comportements, note — dans un catalogue tenu à jour. L'IA propose les nouveaux crawlers repérés sur le web ; vous confirmez ce qui entre.

Le catalogue

Environ 90 crawlers déjà identifiés, prêts à l'emploi

Vous ne partez jamais d'une page blanche. Le registre embarque un catalogue d'environ 90 robots d'exploration répartis en sept familles, chacun décrit par son organisation, ses comportements d'exploration (wildcards, crawl-delay) et une note explicative.

Ce catalogue est versionné : vous savez toujours de quelle édition vous partez et ce qu'elle couvre.

  • Environ 90 crawlers documentés au départ
  • Sept familles : entraînement IA, recherche IA, assistants IA, moteurs, réseaux sociaux, outils SEO, scrapers
  • Organisation, wildcards, crawl-delay et note par bot
  • Catalogue versionné, à édition datée
Le contrôle par famille

Vous décidez qui explore, famille par famille

Plutôt que de traquer chaque robot un par un, vous raisonnez par famille. Les familles du registre pilotent directement les groupes de votre robots.txt généré : les moteurs de recherche et les réseaux sociaux restent toujours autorisés, les scrapers sont toujours bloqués, et les outils SEO suivent votre politique.

Pour les familles d'IA, l'autorisation dépend de la posture que vous avez choisie — la matrice de posture tranche à votre place, sans que vous ayez à écrire une seule règle.

  • Moteurs et réseaux sociaux : toujours autorisés
  • Scrapers : toujours bloqués
  • Outils SEO : selon votre politique
  • Familles d'IA : selon votre posture GEO
Définir votre posture GEO
L'interrogation

Filtrez par famille et lisez la matrice d'autorisations

Vous voulez savoir ce que couvre une famille précise ? Le registre se filtre par famille et expose une matrice qui indique, pour chaque famille d'IA, ce que votre posture courante autorise ou bloque.

Cette même matrice alimente le composeur de robots.txt : ce que vous lisez à l'écran est exactement ce qui sera appliqué dans le fichier servi.

  • Filtre du registre par famille
  • Matrice d'autorisation des familles d'IA selon la posture
  • Lecture cohérente avec le robots.txt généré
La mise à jour

Le registre grandit quand le web change, vous gardez la main

De nouveaux crawlers apparaissent en permanence. La mission Veille de l'Agent SEO cherche sur le web les user-agents récemment documentés, écarte ceux déjà connus du registre, et vous propose les nouveaux à ajouter.

Rien n'entre sans vous : les ajouts que vous confirmez sont fusionnés au registre au moment de la lecture, aux côtés du catalogue d'origine. L'IA propose, vous décidez.

  • Veille web des nouveaux crawlers documentés
  • Bots déjà connus du registre écartés automatiquement
  • Ajouts fusionnés seulement après votre confirmation
  • Catalogue d'origine préservé intact
Lancer la mission Veille
Les garde-fous

Un socle stable, des ajouts tracés et sous votre contrôle

Le catalogue d'origine est une référence versionnée et stable : il n'est pas réécrit dans votre dos. Vos ajouts confirmés vivent à part et se combinent au socle seulement à la lecture, ce qui garde l'ensemble traçable.

Chaque famille appartient à une liste fermée et connue. Les autorisations restent donc lisibles et prévisibles quand elles se traduisent en groupes de robots.txt.

  • Socle d'origine versionné, jamais écrasé
  • Ajouts humains stockés séparément du catalogue
  • Familles limitées à une liste autorisée
  • Aucune fusion sans confirmation humaine
Pourquoi ça compte

L'IA propose, vous décidez

L'Agent SEO repère et documente les crawlers pour vous, mais aucun robot n'entre dans votre registre ni dans votre robots.txt sans votre confirmation. Le registre reste votre source de vérité : lisible, versionnée, sous votre contrôle.

FAQ

Questions fréquentes

Qu'est-ce que le registre de bots crawler ?
C'est le catalogue de référence des robots d'exploration de l'Agent SEO : environ 90 crawlers classés en sept familles, chacun décrit par son organisation, ses comportements et une note. Ce registre pilote les autorisations de votre robots.txt généré.
Comment le registre reste-t-il à jour ?
La mission Veille de l'Agent SEO cherche sur le web les nouveaux crawlers documentés et vous propose de les ajouter. Les ajouts que vous confirmez sont fusionnés au registre à la lecture, sans jamais écraser le catalogue d'origine.
Puis-je autoriser ou bloquer un type de bot précis ?
Vous raisonnez par famille. Les moteurs et les réseaux sociaux restent autorisés, les scrapers bloqués, les outils SEO suivent votre politique, et les familles d'IA dépendent de votre posture GEO. La matrice d'autorisations montre l'effet de chaque choix.
Le registre modifie-t-il directement mon site ?
Non. Le registre est une base de connaissance : il alimente le composeur de robots.txt, mais rien n'est publié tant que vous n'avez pas confirmé une proposition de l'Agent SEO.
Prêt à commencer ?

Gardez la maîtrise de qui explore votre site

Le registre de bots crawler vous donne une vue claire et à jour des robots qui parcourent le web, et un contrôle simple, famille par famille, sur ceux que vous laissez explorer votre site. L'Agent SEO fait le repérage et documente chaque crawler ; la décision, elle, reste la vôtre.