Faut-il laisser entrer les robots d’IA ?
Bloquer les robots d’IA est une décision raisonnable, presque partout mal appliquée, car les jetons que l’on bloque sont rarement ceux qui font ce que l’on reproche.
La distinction qui décide de tout
Chaque grand acteur exploite des agents distincts pour des usages distincts, documentés et contrôlables séparément.
- OpenAI utilise
GPTBotpour l’entraînement,OAI-SearchBotpour faire apparaître des sites dans les résultats de la recherche de ChatGPT,ChatGPT-Userpour les actions des utilisateurs, etOAI-AdsBot(OpenAI). BloquerGPTBotne vous retire pas de la recherche de ChatGPT. C’estOAI-SearchBotqui mène aux citations. - Anthropic utilise
ClaudeBotpour l’entraînement,Claude-Userquand une personne pose une question à Claude, etClaude-SearchBotpour améliorer la qualité des résultats de recherche (Anthropic). - Perplexity utilise
PerplexityBot, dont elle précise qu’il ne sert pas à collecter du contenu pour entraîner des modèles de fondation, etPerplexity-User. À noter, dans la documentation même de Perplexity : comme la récupération est demandée par un utilisateur,Perplexity-Userignore en général les règles du robots.txt (Perplexity). - Google utilise
Googlebotpour la recherche, et les AI Overviews comme AI Mode font partie de la recherche.Google-Extendedrégit l’usage de votre contenu pour entraîner ou ancrer les modèles Gemini. Ce n’est pas un robot d’exploration, et il n’a aucun effet sur l’inclusion ou le classement dans la recherche (Google). - Apple suit la même logique : Applebot-Extended n’explore aucune page, et les pages qui l’interdisent peuvent toujours figurer dans les résultats de recherche (Apple).
La configuration la plus courante, bloquer GPTBot et Google-Extended, vous
retire donc de l’entraînement sans rien changer à votre visibilité dans les
réponses IA. C’est peut-être exactement ce que vous voulez. Il vaut mieux savoir
que c’est ce que vous avez choisi.
Pour sortir réellement des réponses IA de Google, le levier est le paramètre Search generative AI de la Search Console, pas une ligne de robots.txt, comme l’explique l’article sur la tuyauterie.
L’économie à laquelle on réagit
L’objection habituelle : les robots d’IA prennent le contenu et ne renvoient rien. Cloudflare l’a chiffré : sur une fenêtre d’août 2025, tous secteurs confondus, environ 50 000 requêtes HTML par visite renvoyée pour Anthropic, 887 pour une chez OpenAI et 118 pour une chez Perplexity (Cloudflare). Sur la même période, l’entraînement représentait près de 80 % de l’exploration par les robots d’IA.
Cloudflare signale lui-même deux réserves. Le trafic renvoyé par l’application native de Claude ne transmet pas d’en-tête de provenance, ce qui gonfle le ratio d’Anthropic. Et ces mesures sont calculées sur des fenêtres glissantes qui ont varié de plusieurs ordres de grandeur d’une fenêtre à l’autre : un chiffre sans sa fenêtre n’est pas une statistique.
Ce que le web a décidé
La Data Provenance Initiative a audité 14 000 domaines et constaté une progression rapide des restrictions : parmi les sources les plus importantes du corpus C4, 20 à 33 % des jetons étaient restreints, contre moins de 3 % un an plus tôt, et les robots d’OpenAI étaient bloqués pour 25,9 % des jetons de ce sous-ensemble (Longpre et al., arXiv:2407.14933). Les données s’arrêtent en avril 2024 : lisez-les comme le début d’une tendance.
Les auteurs relevaient aussi l’asymétrie qui compte commercialement : certains acteurs déclarent leurs robots d’entraînement pour permettre le refus, tandis que les robots qui interviennent au moment de la réponse ne sont pas déclarés.
Une grille de décision
Demandez-vous ce que vous protégez. S’il s’agit d’éviter que votre contenu entraîne le modèle d’un concurrent, bloquez les jetons d’entraînement et gardez ceux de recherche. S’il s’agit de bande passante, limitez le débit plutôt que de bloquer. Si votre objectif commercial est d’être recommandé, prudence : une marque absente à la fois de l’index et des données d’entraînement est une marque que l’assistant n’a ni récupérée ni mémorisée, et la réponse sera construite à partir de ce que des tiers disent de vous.