Comment un assistant choisit la marque qu’il cite

Quand un assistant recommande trois marques dans une catégorie, cette recommandation vient de l’un de deux endroits, et la différence décide de ce que vous pouvez y faire. Les deux s’écartent de la logique de la recherche, qui récompensait la page bien classée.

Le premier, c’est la récupération. Google décrit ses propres fonctionnalités IA comme de la génération augmentée par récupération (RAG), une technique qui s’appuie sur les systèmes de classement de la recherche pour récupérer des pages web pertinentes et à jour, combinée à une « diffusion » de la requête, où une question devient plusieurs recherches. Sur ce chemin, votre page est récupérée, lue et parfois citée, et les leviers sont connus : être explorable, être trouvable, être citable. Le guide de Google sur l’optimisation pour les fonctionnalités d’IA générative est explicite : aucune exigence de classement propre à l’IA, aucun balisage particulier à ajouter.

Le second, c’est la mémoire que le modèle a de votre marque, et c’est celui que la plupart des mesures ignorent.

Le modèle n’a peut-être rien lu

Une équipe de Berkeley, publiée à EMNLP 2024, a pris 1 147 pages de fabricants dans 50 catégories de produits pour déterminer quels facteurs décidaient du classement des produits par les modèles. Résultat : les modèles diffèrent fortement dans le poids qu’ils donnent au nom du produit, au contenu du document et à sa position dans le contexte, et pour certains, la page ne comptait presque pas. GPT-4 Turbo et Llama 3 s’appuient largement sur leur connaissance latente des noms de produits, écrivent les auteurs, et GPT-4 Turbo n’est que très peu influencé par les documents récupérés (Pfrommer et al., arXiv:2406.03589).

Une comparaison de 2026 entre assistants et recherche web arrive au même constat par l’autre bout. Sur des requêtes de classement grand public, 16 % des entités présentes dans un classement généré n’apparaissaient dans aucun extrait récupéré (Chen et al., arXiv:2601.16858). Le modèle a cité des marques qu’il n’avait pas consultées. On ne peut pas obtenir une citation dans une liste issue des connaissances préalables du modèle ; on peut seulement devenir l’une des marques qu’il connaît, ce qui prend plus de temps et se joue surtout hors de votre propre domaine.

Pourquoi cela scinde votre liste de tâches

Si votre absence est un problème de récupération, elle se traite ce trimestre : la page existe, elle n’est simplement pas reprise dans les réponses, et il existe des données sur ce qui change la donne.

Si votre absence est un problème de mémoire, aucun travail sur la page ne la corrige directement. Ce qui la fait évoluer, c’est d’être décrit, de façon cohérente et à de nombreux endroits, par des sources que le modèle a assimilées : distributeurs, avis, comparatifs, sites de référence, forums.

Les deux échouent aussi différemment. Les échecs de récupération sont stables et reproductibles. Les échecs de mémoire sont erratiques : la marque apparaît pour une formulation et disparaît pour une formulation presque identique, ce qui explique qu’un contrôle ponctuel ne dise presque rien ni de l’un ni de l’autre. Une étude sur le non-déterminisme de réglages censés être déterministes a mesuré une précision variant jusqu’à 15 % sur dix exécutions identiques (Atil et al., arXiv:2408.04667) : la façon d’échantillonner compte plus que ce que l’on échantillonne.

Le point de départ concret consiste à séparer les deux dans vos propres données. Quand votre marque apparaît, une de vos pages a-t-elle été citée ? Quand elle n’apparaît pas, un concurrent a-t-il été cité, ou le modèle a-t-il simplement cité des noms ? Ces deux colonnes transforment un chiffre flou en deux chantiers distincts.