Outil gratuit · sans inscription
Quels robots d’IA peuvent accéder à votre site ?
Saisissez votre domaine : nous lisons votre robots.txt comme le font les robots (RFC 9309), puis indiquons pour chaque agent IA majeur s’il est autorisé, partiellement bloqué ou bloqué. Les agents de recherche IA et ceux qui consultent une page à la demande d’un utilisateur doivent y avoir accès pour que vos pages soient citées ; autoriser ou non les robots d’entraînement est un choix distinct.
Dernière vérification le 16 septembre 2026
Vérificateur de robots d’IA
Comment ça marche
Nous récupérons le fichier /robots.txt de votre domaine et analysons ses groupes user-agent, ses règles allow et disallow, ses jokers et ses lignes sitemap.
Pour chaque agent IA, nous appliquons le groupe correspondant le plus spécifique (ou le groupe *) et la règle correspondante la plus longue, sur votre page d’accueil et quelques chemins courants.
Vous obtenez un résumé en langage clair, une liste d’actions classée et un tableau indiquant l’opérateur, la finalité et le statut de chaque robot, avec un lien vers la documentation officielle de l’opérateur.
Questions fréquentes
Qu’est-ce qu’un robot d’IA ?
C’est un client automatisé exploité par une entreprise d’IA. Certains collectent du contenu pour entraîner des modèles (par exemple GPTBot ou ClaudeBot), d’autres construisent des index de recherche pour les réponses IA (par exemple OAI-SearchBot, Claude-SearchBot ou PerplexityBot), et d’autres ne consultent une page qu’à la demande d’un utilisateur (par exemple ChatGPT-User ou Claude-User).
Faut-il bloquer les robots d’IA ?
Cela dépend de vos objectifs. Si vous souhaitez être cité dans les réponses IA, autorisez les agents de recherche et ceux qui agissent à la demande des utilisateurs. Bloquer les robots d’entraînement est une décision commerciale distincte ; des opérateurs comme OpenAI, Anthropic et Google documentent des jetons séparés pour vous laisser le choix.
Comment bloquer uniquement l’entraînement IA ?
Ajoutez un groupe pour chaque jeton d’entraînement, par exemple « User-agent: GPTBot » suivi de « Disallow: / ». Google indique que son jeton Google-Extended contrôle l’utilisation pour l’entraînement et l’ancrage de Gemini, sans effet sur le classement dans la recherche Google.
robots.txt garantit-il qu’un robot n’accède pas au site ?
Non. robots.txt est une norme volontaire. Les opérateurs listés ici déclarent la respecter, mais ce n’est pas un contrôle d’accès : utilisez une authentification ou des règles de pare-feu pour les contenus qui doivent rester privés.
Le vérificateur de robots d’IA de Citevana est-il gratuit ?
Oui. Il est gratuit et sans compte, avec une limite quotidienne généreuse pour éviter les abus.