Pourquoi tester dix requêtes ne vous apprend rien

La plupart des marques vérifient leur visibilité IA en posant quelques questions à un assistant et en lisant les réponses. Cela ressemble à une preuve. C’est plutôt un tirage unique dans une distribution que personne n’a caractérisée.

Commençons par ce qui dérange : des entrées identiques ne donnent pas des sorties identiques, même lorsque tout est réglé pour être déterministe. Une étude de 2024 a fait tourner cinq modèles sur huit tâches, dix fois chacune, à température zéro et avec les autres réglages de déterminisme. La précision variait jusqu’à 15 % d’une exécution à l’autre, l’écart entre la meilleure et la pire atteignait 70 % sur certaines tâches, et aucun des modèles ne produisait une précision reproductible sur l’ensemble des tâches (Atil et al., arXiv:2408.04667). La température zéro ne garantit pas une réponse stable.

Une seule exécution relève donc du pile ou face. La solution évidente serait de répéter la même requête de nombreuses fois. C’est presque la chose la moins utile que l’on puisse faire.

Où se loge réellement la variance

Une prépublication de 2026 a décomposé la variance des mentions de marques sur 12 933 réponses, 20 marques, huit langues et trois modèles. Le rééchantillonnage de la même requête expliquait 34,8 % de la variance d’une réponse, la langue de la requête 26,5 %. L’identité de la marque, c’est-à-dire ce que l’on cherche à mesurer, n’en expliquait que 1,5 %. Répéter une fois de plus une requête identique ne réduisait la variance de l’erreur relative que de 0,0003 (Żatuchin, arXiv:2607.13304).

Il s’agit d’une prépublication d’un seul auteur sur un seul jeu de données : tenez les pourcentages exacts avec prudence. C’est la conclusion qualitative qui compte, et elle est difficile à contester : la fiabilité vient de la diversité des formulations, des langues et des moteurs, pas de la répétition d’une même question.

Ce que cela implique pour un protocole de mesure

  • Échantillonnez l’espace des formulations, pas la requête. Vos clients ne parlent pas votre vocabulaire. « Meilleure montre de luxe pour la revente » et « quelles montres gardent leur valeur » expriment la même intention et peuvent renvoyer des marques différentes.
  • Traitez chaque moteur séparément. Le recouvrement entre moteurs est au mieux partiel, comme le montrent les travaux sur les sources citées. En faire la moyenne masque le moteur où vous êtes absent.
  • Échantillonnez les langues dans lesquelles vous vendez. La langue était la deuxième source de variance de cette décomposition, devant tout ce qui tient à la marque.
  • Donnez des intervalles, pas des points. « Nous apparaissons dans 22 % des réponses, à plus ou moins 6 points » est un résultat. « Nous apparaissons dans ChatGPT » est une anecdote.
  • Figez l’échantillon dans le temps. Si le jeu de requêtes change à chaque rapport, impossible de distinguer une vraie évolution d’une nouvelle question.

Rien de tout cela n’exige d’outillage exotique. Il faut seulement accepter que l’unité de mesure est une distribution sur de nombreuses formulations, et qu’un chiffre sans taille d’échantillon n’est qu’une décoration.

Une fois ce cadre posé, reste à savoir quels chiffres calculer, et trois méritent de passer avant tous les autres. Il devient aussi possible de savoir si une modification a réellement changé quelque chose, ce que des contrôles ponctuels ne permettront jamais.