5 étapes pour faire des tests A/B sur votre flux Google Shopping avec FeedX

Image showing the main image
Déployer des A/B tests dans les campagnes Google Shopping avec FeedX, un outil conçu par Google pour réaliser des split-tests dans les campagnes PMax
Table des matières
Recevez les dernières informations sur l'optimisation de Google Shopping.
Merci ! Votre soumission a bien été reçue !
Oups ! Une erreur est survenue lors de l'envoi du formulaire.
En cliquant sur S'inscrire, vous confirmez que vous acceptez nos Conditions Générales.

La plupart des annonceurs optimisent leur catalogue Google Shopping à l'instinct, ou basé sur les données de leur CMS. Le problème ? Leur intuition et/ou leurs sources de données ne sont pas toujours bonnes.

Ils modifient des titres, réécrivent des descriptions, changent des images, puis observent les métriques globales de la campagne pendant quelques semaines dans l'espoir de distinguer un signal dans le bruit. Le problème avec cette méthode, c'est qu'il ne s'agit pas d'un test. C'est un changement. Sans groupe de référence fonctionnant parallèlement à la variante, il est impossible de déterminer avec certitude si une variation de performance provient de la modification de l'attribut, d'un changement de comportement saisonnier, d'une modification budgétaire d'un concurrent ou de toute autre variable.

FeedX résout ce problème. Développé par Google Marketing Solutions et publié en tant que package Python open-source, FeedX est un framework d'expérimentation A/B spécifiquement conçu pour les données de référencement Google Shopping. Il permet aux annonceurs de réaliser des split tests statistiquement fiables sur les attributs de flux (titres, descriptions, libellés personnalisés) et de mesurer l'impact direct sur les performances des annonces Shopping à l'aide de méthodes statistiques conformes aux standards du secteur.

Il est important de comprendre ce que signifie réellement le test A/B dans le contexte de Shopping avant de mettre en œuvre le framework. Parfois appelé test fractionné, un AB test est une méthode consistant à comparer deux variantes d'un même attribut pour déterminer laquelle est la plus performante. La différence clé entre un de catalogue et d'autres formes d'expériences publicitaires est qu'il ne repose pas sur les cookies, les segments d'utilisateurs ou le ciblage d'audience pour répartir le trafic. Au lieu de cela, FeedX utilise des données au niveau de l'article pour assigner chaque référence de votre catalogue à un groupe de contrôle ou de test en fonction de son comportement historique. Il s'agit d'une méthode plus fiable pour les annonceurs e-commerce, car elle élimine la variation au niveau de l'utilisateur qui rend les tests basés sur l'audience difficiles à analyser proprement. Le nombre d'articles assignés à chaque cohorte est important : FeedX recommande un catalogue suffisamment large pour détecter de faibles écarts, avec au moins 1000 références comme base pour une étude capable de produire des résultats significatifs.

Un exemple concret de l'utilisation de FeedX est documenté dans un article de "Think with Google" concernant Home24, où le framework a été utilisé conjointement avec FeedGen, l'outil d'IA générative de Google, pour mesurer une augmentation de 29 % des clics et de 25 % des impressions grâce à l'optimisation des titres de produits. Il ne s'agit pas d'estimations, mais de résultats mesurés issus d'une étude contrôlée avec un groupe de référence validé statistiquement et fonctionnant en parallèle.

Ce guide détaille précisément le fonctionnement de FeedX, les prérequis nécessaires et les cinq étapes pour exécuter votre premier essai fiable sur Google Shopping.

Qu'est-ce que FeedX et pourquoi est-ce important pour la performance des annonces Shopping ?

Avant de passer aux étapes, il est utile de comprendre ce qui différencie FeedX des tests informels que la plupart des annonceurs utilisent actuellement.

Les modifications de référencement standard sont appliquées globalement. Chaque article reçoit le nouveau titre, chaque référence reçoit la description mise à jour. Cela signifie que vos données d'origine sont écrasées et qu'il ne reste aucune base de référence pour effectuer une comparaison. Vous observez alors les performances avant et après sur les mêmes articles, ce qui est sensible à chaque variable externe ayant changé durant la même période.

FeedX divise votre catalogue en deux segments : une cohorte de contrôle et une cohorte de test, plutôt que de diviser les utilisateurs ou le trafic. La cohorte de contrôle conserve les attributs d'origine tout au long de l'étude. La cohorte de test reçoit la variante optimisée. Les deux segments diffusent des annonces Shopping simultanément avec les mêmes paramètres de campagne, ce qui signifie que toute différence de performance entre eux est attribuable à la modification de l'attribut lui-même plutôt qu'à des facteurs externes.

FeedX utilise deux méthodes statistiques clés pour rendre les résultats aussi fiables que possible. La première est un plan croisé. La seconde est le CUPED (Controlled-experiment Using Pre-Experiment Data). Le CUPED ajuste les performances au niveau de l'article en fonction du comportement pré-expérimental, éliminant ainsi le biais introduit par la randomisation et améliorant la sensibilité de l'étude. Le plan croisé va plus loin : à mi-parcours, les deux cohortes sont inversées, de sorte que le segment de test revient aux attributs d'origine et le segment de contrôle reçoit l'optimisation. Cette approche double la puissance statistique de l'étude sans nécessiter davantage d'articles ni une durée plus longue.

Pour garantir des résultats fiables, l'essai doit inclure au moins 1 000 articles. Le notebook de conception FeedX vous alertera si la taille de l'échantillon est trop faible. Pour les catalogues plus petits de moins de 1 000 références, il est préférable d'élargir le périmètre de test à une catégorie entière plutôt qu'à une seule sous-catégorie, ou d'attendre que le catalogue se développe avant de mener une étude formelle.

Ce dont vous avez besoin avant de commencer

FeedX est un Package Python disponible sur GitHub qui fonctionne via des notebooks Google Colab. Aucune installation locale n'est requise. L'intégralité du flux de travail s'exécute dans le navigateur via Colab. Cependant, vous devez disposer des éléments suivants avant d'ouvrir le notebook de configuration.

Un compte Google Merchant Center avec une source de données produit active synchronisée avec Google Ads. Votre catalogue principal doit être sain, sans refus généralisé ni violation de politique, avant de commencer à y superposer une étude.

Un projet Google BigQuery connecté à la fois à votre compte Google Ads et à votre compte Merchant Center via le service de transfert de données BigQuery. FeedX nécessite des données de performance historiques, généralement de quatre à huit semaines de clics et d'impressions au niveau de l'article, pour concevoir l'essai et exécuter l'ajustement statistique CUPED. Sans BigQuery, le framework ne peut pas accéder aux informations au niveau de l'article dont il a besoin.

Un fichier de flux supplémentaire configuré dans Merchant Center. C'est cette source qui portera votre variante de test. Le fichier supplémentaire remplace des attributs spécifiques de la source principale uniquement pour la cohorte de test, laissant le segment témoin sur les données d'origine.

Une hypothèse claire. Avant d'ouvrir le notebook Colab, déterminez précisément ce que vous comparez et pourquoi. Une bonne étude compare un changement à la fois. Tester une mise à jour de titre et une modification d'image simultanément rend impossible la détermination de la variable responsable du résultat. Les points de départ courants incluent l'ajout d'informations sur les matériaux et les dimensions aux titres, la réorganisation de la structure du titre pour placer l'attribut le plus pertinent pour la recherche en premier, ou l'ajout de modificateurs à forte intention basés sur les requêtes de recherche de votre compte Google Ads.

Les cinq étapes pour implémenter FeedX et commencer les tests A/B de votre catalogue Google Shopping

L'implémentation de cet outil Google nécessite une expertise technique et un catalogue de produits conséquent. Si vous avez un développeur in-house, cela devrait lui nécessiter environ deux jours de travail. Si vous passez par une agence, assurez-vous bien qu'elle vous envoie un devis ne dépassant pas cette limite de temps.

Si vous n'avez pas de développeur en interne pour vous aider ou si votre flux de produits contient moins de 1 000 références (SKU), nous ne recommandons pas cette implémentation. Le rapport entre les bénéfices et l'investissement ne sera pas très intéressant pour vous.

Étape 1 : concevoir le test

Ouvrez 01_experiment_designer.ipynb dans Google Colab et enregistrez une copie sur votre Google Drive. Ce notebook contient toute la logique nécessaire à la mise en place de l'étude avant même qu'une seule modification ne soit apportée à vos données produit.

Saisissez l'ID de votre projet BigQuery, l'ID de votre compte Merchant Center et la fenêtre de données historiques que vous souhaitez utiliser comme référence, généralement quatre à huit semaines de performances antérieures. Exécutez les cellules du notebook. FeedX extraira les données de performance au niveau de l'article depuis BigQuery, analysera les métriques historiques, y compris les clics, les impressions et le comportement de conversion pour chaque référence de votre catalogue, puis divisera le catalogue en un segment témoin et un segment de test.

La répartition n'est pas aléatoire au sens naïf du terme. FeedX apparie mathématiquement les articles pour garantir que les deux cohortes présentent des performances historiques équilibrées avant le début de l'étude. Ce processus d'appariement élimine le biais de sélection qui compromet les tests informels. Le notebook génère une table dans BigQuery étiquetant chaque ID produit comme CONTROL ou TREATMENT. Enregistrez ce mappage. Il constitue le point de référence pour chaque étape ultérieure.

Le notebook indiquera également si votre catalogue est suffisamment volumineux pour produire des résultats fiables avec une taille d'effet significative. Si vous souhaitez détecter une amélioration de 5 % du taux de clic, par exemple, vous avez besoin de plus d'articles que si vous essayez seulement de détecter une amélioration de 20 %. FeedX peut exécuter 1 000 simulations pour valider que la conception de votre étude produira des résultats fiables à la taille d'effet cible avant que vous ne vous engagiez à la mener en conditions réelles. Notez attentivement le résultat avant de passer à l'étape suivante. Démarrer un essai avec une conception sous-dimensionnée est l'une des raisons les plus courantes pour lesquelles les tests A/B de produits aboutissent à des conclusions non probantes.

Étape 2 : préparer et appliquer la variante de test

Avant de préparer vos données de test, il est utile d'examiner attentivement vos titres existants et de décider quel type de changement est le plus susceptible d'augmenter le taux de clic (CTR) en fonction de vos rapports sur les requêtes de recherche dans Google Ads. Une bonne pratique consiste à comparer vos titres les plus performants actuels avec ceux ayant un nombre élevé d'impressions mais peu de clics, et d'utiliser ces informations comme base pour votre variante. Des logiciels de gestion de flux tiers peuvent vous aider à générer en masse des variantes de titres optimisées, mais la logique fondamentale doit provenir des données de votre propre compte. Identifiez les attributs clés manquants dans vos annonces actuelles, par exemple les dimensions, les matériaux ou les informations de compatibilité, et déterminez comment varier le format du titre pour mieux correspondre à ce que votre public cible recherche réellement. Trouvez plusieurs options avant de sélectionner la variante finale à tester, et gardez une trace de votre raisonnement afin de pouvoir vous y référer lors de l'analyse des résultats.

Exportez la liste des ID produits assignés à la cohorte TREATMENT depuis BigQuery. Ce sont les seuls articles qui recevront les attributs optimisés. Le segment témoin n'est modifié à aucun moment pendant l'étude.

Pour la cohorte de test, créez vos données d'article optimisées. L'attribut le plus impactant à tester dans la plupart des sources de données Shopping est le titre, car il détermine directement quelles requêtes de recherche déclenchent vos annonces et influence le CTR dans le carrousel Shopping. Un test de titre bien structuré pourrait comparer un format générique tel que "Ensemble de salle à manger extérieur" à une variante riche en attributs telle que "Ensemble de salle à manger extérieur 6 pièces en bois FSC, résistant aux intempéries, 6 places". Le second format cible des requêtes de recherche plus spécifiques, affiche des informations supplémentaires sur l'article dans l'annonce et est plus susceptible de correspondre à l'intention de l'utilisateur au moment de la comparaison des produits.

Formatez les données des articles du groupe de test sous forme de fichier de flux supplémentaire. Il s'agit d'un tableur ou d'un fichier de données structurées contenant uniquement les identifiants de produit (Product IDs) de la cohorte de test et l'attribut spécifique que vous souhaitez mettre à jour. Importez ce fichier supplémentaire dans Merchant Center et configurez-le pour qu'il remplace l'attribut correspondant de la source principale. Vérifiez que les articles du groupe de test affichent le nouveau titre, tandis que ceux du groupe témoin conservent l'original. Si les deux cohortes affichent le nouvel attribut, le mappage du fichier supplémentaire est incorrect et doit être corrigé avant le début de l'étude.

Il est également recommandé, à ce stade, d'étiqueter vos articles de test à l'aide d'une étiquette personnalisée dans la source du flux. L'attribution d'une étiquette telle que "feedx-treatment" à chaque identifiant de produit du groupe de test permet de segmenter facilement les performances par cohorte dans les rapports Google Ads et offre un niveau de suivi supplémentaire en complément des résultats BigQuery.

Étape 3 : exécution du test sur Google Shopping

Lancez l'essai en confirmant que le fichier de flux supplémentaire est actif dans Merchant Center et que les deux segments diffusent des annonces Shopping au sein de la même campagne. Ne créez pas de campagnes distinctes pour les cohortes témoin et de test. Les deux doivent être diffusées avec des paramètres de campagne, une stratégie d'enchères et un budget identiques afin de garantir que la seule variable entre elles soit l'attribut de flux comparé.

Laissez l'étude se dérouler pendant au moins deux à quatre semaines afin que le cadre puisse accumuler suffisamment de données de trafic pour que l'analyse statistique soit pertinente. Ne modifiez pas les budgets, les stratégies d'enchères ou le ciblage des campagnes pendant cette période. Tout changement dans la diffusion de la campagne introduit une variable confusionnelle qui fausse les résultats.

Si vous effectuez un plan croisé, ce que FeedX recommande pour une puissance statistique maximale, inversez les cohortes à mi-parcours. Le segment de test revient aux attributs d'origine via le fichier supplémentaire, et le segment témoin reçoit la variante optimisée. Ce croisement élimine l'effet de toute différence de performance au niveau de l'article existant entre les deux cohortes indépendamment du changement de flux, et produit un résultat plus clair et plus fiable.

Notez la date de début, la date d'inversion à mi-parcours le cas échéant, ainsi que tout événement externe tel que des promotions, des pics saisonniers ou l'activité des concurrents survenant pendant la période. Ces éléments constituent un contexte important pour interpréter les résultats de l'analyse. Une forte hausse coïncidant exactement avec une promotion sur tout le site est plus difficile à attribuer uniquement au changement de flux et doit être signalée dans les conclusions.

Étape 4 : analyse des résultats avec CUPED

Une fois l'étude terminée, ouvrez 02_experiment_analyzer.ipynb dans Google Colab. Ce notebook récupère les informations de performance en direct accumulées dans BigQuery pendant la période d'essai et applique automatiquement l'ajustement statistique CUPED.

CUPED fonctionne de manière similaire à une analyse de différence dans les différences. Plutôt que de comparer les performances brutes pendant la période d'étude, il analyse l'écart entre la performance de chaque article pendant l'essai et sa performance attendue basée sur son comportement pré-expérimental. Cela élimine tout biais introduit par le processus de randomisation et améliore considérablement la sensibilité du résultat. La raison principale pour laquelle CUPED est important dans le contexte des flux Shopping est que la performance au niveau de l'article est naturellement volatile. Un SKU qui a été mis en avant dans une campagne Display ou partagé sur les réseaux sociaux pendant la période d'étude affichera un nombre de clics gonflé qui n'a rien à voir avec le changement de titre. CUPED prend en compte ce comportement préexistant et l'exclut du résultat final.

Lorsque vous analysez les résultats du notebook, l'objectif est de trouver un gagnant clair, et non simplement un chiffre positif. Examinez attentivement l'intervalle de confiance. Un résultat avec une hausse moyenne de 8 % mais un large intervalle allant de -3 % à +19 % ne constitue pas une base fiable pour une décision. Un bon résultat est un résultat où l'intervalle est étroit et proche de la moyenne, ce qui signifie que le résultat est cohérent sur l'ensemble des articles de la cohorte de test. FeedX est conçu pour fournir cette détermination automatiquement, en signalant les résultats comme significatifs ou non concluants en fonction des seuils statistiques intégrés à l'outil. L'expérience de lecture d'un résultat FeedX pour la première fois peut sembler technique, mais le cadre est conçu pour rendre la conclusion clé facile à exploiter.

Le notebook génère des graphiques montrant la hausse ou la baisse statistique sur vos indicateurs cibles, notamment le CTR, le taux de conversion et le ROAS, pour la cohorte de test par rapport au segment témoin. Chaque résultat inclut un intervalle de confiance. Un résultat est considéré comme statistiquement significatif lorsque l'intervalle de confiance n'inclut pas zéro, ce qui signifie que la différence de performance observée a peu de chances d'être due au hasard.

Si le résultat est positif et statistiquement significatif, la variante optimisée est gagnante. Si le résultat est négatif ou si l'intervalle de confiance est large et croise zéro, l'attribut d'origine est tout aussi performant, voire meilleur, et le changement ne doit pas être déployé. Si le résultat est non concluant, c'est-à-dire une faible hausse avec un large intervalle, l'essai devra peut-être être prolongé ou inclure davantage d'articles pour aboutir à une conclusion fiable. Utilisez le notebook de conception pour recalculer la taille d'échantillon requise en fonction de l'ampleur de l'effet observé, et utilisez-la comme guide pour la prochaine exécution.

Étape 5 : analyse des produits gagnants, et préparation de l'essai suivant

Si la variante de test produit un résultat positif statistiquement significatif, supprimez le remplacement du fichier de flux supplémentaire et appliquez l'attribut gagnant directement à la source principale pour tous les articles. Une fois le gagnant déterminé, mettez en œuvre le changement, suivez l'impact sur le taux de conversion et le ROAS dans votre compte Google Ads, et préparez l'essai suivant. Les équipes marketing qui utilisent systématiquement ce processus se constituent une base de connaissances sur les changements de flux validés, dont la valeur se cumule au fil du temps, car chaque variante gagnante améliore le potentiel de chaque étude ultérieure en élevant la performance de référence.

Mettez à jour votre catalogue systématiquement. N'appliquez pas le format de titre gagnant uniquement aux articles qui faisaient partie de la cohorte de test. L'intérêt même de mener une étude contrôlée est de trouver un format qui fonctionne pour une catégorie ou un type d'article. Une fois validé, appliquez-le largement. Si votre essai a testé une structure de titre spécifique pour les meubles de jardin, déployez cette structure sur toutes les fiches de meubles de jardin de la source, et pas seulement sur les 50 % qui ont servi de cohorte de test pendant l'étude.

Le cadre FeedX est conçu pour être reproductible. Une fois un essai terminé, le même processus peut être appliqué à un autre attribut, notamment les descriptions, les étiquettes personnalisées et la sélection d'images, en utilisant la même infrastructure BigQuery et les mêmes notebooks Colab. Chaque étude renforce votre compréhension de ce qui influence réellement les performances de votre catalogue spécifique, plutôt que de vous fier à des conseils généraux qui peuvent ou non s'appliquer à votre type d'article ou à votre audience.

La pratique clé à retenir est de comparer une seule variable à la fois. Le segment témoin doit toujours servir de base de référence réelle, inchangée et fonctionnant dans des conditions de campagne identiques, pour que le résultat soit digne de confiance. Introduire plusieurs variantes simultanément ou modifier les paramètres de campagne en cours d'essai produit des informations qui ne permettent pas de déterminer un gagnant de manière fiable.

Pourquoi tester la fiabilité de vos fiches produits est crucial pour Google Shopping aujourd'hui ?

La qualité des fiches produits Google Shopping influence désormais directement l'éligibilité aux annonces, la compétitivité lors des enchères et l'efficacité des conversions, en particulier dans les campagnes Performance Max où l'automatisation de la plateforme repose largement sur les données articles que vous fournissez pour faire correspondre vos références aux requêtes à forte intention d'achat. Selon Google, les utilisateurs effectuent plus d'un milliard de recherches shopping par jour sur la plateforme, et Google Lens enregistre désormais plus de 20 milliards de recherches visuelles par mois, dont une sur quatre possède une intention commerciale. Des données produits structurées et optimisées servent simultanément l'ensemble de ces surfaces.

La source des fiches produits n'est plus une simple exigence de transfert de données. Il s'agit du principal levier créatif et de ciblage pour les annonces Shopping, et la qualité de ces informations détermine la capacité des systèmes de la plateforme à présenter vos articles au bon public, au bon moment. Pour tout annonceur menant des campagnes Shopping à une échelle significative, FeedX est l'outil le plus fiable pour transformer l'optimisation des fiches produits d'une tâche récurrente en un levier de performance systématique. Réalisez l'étude, analysez les résultats, implémentez la variante gagnante et recommencez. Ce processus, appliqué de manière cohérente aux formats de titres, aux descriptions et aux structures d'étiquettes personnalisées, se traduit au fil du temps par un catalogue aux performances nettement supérieures à celui géré à l'instinct.

Recevez nos conseils mensuels !

Recevez de nouvelles informations sur l'optimisation de Google Shopping directement dans votre boîte de réception.

Merci ! Votre soumission a bien été reçue !
Oups ! Une erreur est survenue lors de l'envoi du formulaire.
En cliquant sur S'inscrire, vous confirmez que vous acceptez nos Conditions Générales.