La première fois qu'on m'a demandé de « faire un AB test », j'ai cru qu'il s'agissait d'un test médical. Sérieux. C'était en 2020, je venais de rejoindre une petite équipe e-commerce, et mon chef m'a lancé ça au détour d'un couloir, comme si tout le monde savait de quoi il parlait.
Depuis, j'en ai lancé des dizaines. Certains ont changé la trajectoire d'un produit. La plupart n'ont rien donné. Et deux ou trois m'ont fait perdre du temps et de l'argent parce que je les avais mal construits.
Voilà ce que j'ai appris — sans le vernis habituel.
Points clés à retenir
- Un AB test compare deux versions d'un même élément en ne faisant varier qu'un seul paramètre à la fois.
- Sans taille d'échantillon suffisante, un résultat « gagnant » peut être du bruit pur.
- La durée minimale d'un test se calcule en semaines, pas en jours.
- Le plus grand ennemi d'un AB test, c'est l'arrêt prématuré quand le chiffre devient flatteur.
- Le RGPD impose de cadrer les tests qui touchent à des données personnelles.
Qu'est-ce qu'un AB test, vraiment ?
Un AB test — parfois écrit A/B testing — consiste à envoyer deux versions d'un même support à deux groupes d'utilisateurs, en ne changeant qu'une seule chose entre les deux. Le groupe A voit l'original. Le groupe B voit une variante. Puis on compare les résultats sur une métrique choisie à l'avance.
Ce n'est pas plus compliqué que ça. Et c'est précisément là que la plupart des gens se plantent : ils croient que le diable est dans la technique, alors qu'il est dans la discipline.
La règle du paramètre unique
Si vous modifiez le bouton et le titre et la photo en même temps, vous ne saurez jamais quel changement a produit l'effet. Vous saurez juste que « ça a bougé ». Ce n'est pas un test, c'est un pari.
Sur mon premier vrai AB test, j'ai changé la couleur du bouton d'achat et le texte à l'intérieur du bouton. Le taux de clic a bondi de 18 %. Génial, non ? Sauf que je n'ai jamais su si c'était la couleur ou le texte. J'ai dû refaire le test proprement, une semaine plus tard, pour 200 € de trafic payant gaspillés.
Le mythe du gagnant universel
Un résultat d'AB test n'est vrai que dans le contexte où il a été mesuré. Sur votre audience, à ce moment-là.
J'ai vu des équipes copier un « bouton vert qui convertit mieux » lu quelque part, l'appliquer à leur site, et constater… rien. Ou pire : une baisse. Le comportement des utilisateurs dépend de leur culture, de leur appareil, de la promesse du produit. Il n'y a pas de recette magique qui traverse les contextes.
Pourquoi la plupart des AB tests échouent
Statistiquement, la majorité des tests ne donnent rien. Pas de différence significative. C'est normal, et c'est même sain. Si tous vos tests gagnaient, c'est que vous trichez quelque part.
Le problème, c'est que l'échec est mal vécu. On cherche alors à sauver le test coûte que coûte. Et on tombe dans trois pièges classiques.
Erreur n°1 : arrêter le test trop tôt
Le plus courant. Vous lancez votre test un lundi. Le mardi, la variante B affiche +40 % sur la métrique. Vous exultez. Vous coupez le test le jeudi.
Manque de chance : les premiers jours d'un test sont les plus instables. La variance est énorme, et le trafic du lundi ne ressemble pas à celui du samedi. Un pic peut se dissiper en 72 heures.
La règle que je me suis fixée après plusieurs claques : deux semaines minimum, et au moins un cycle hebdomadaire complet inclus. Pour du B2B avec peu de trafic, comptez un mois.
Erreur n°2 : sélectionner son audience
Un test ne vaut que si les deux groupes sont comparables. Si le groupe A contient plus de mobiles et le groupe B plus de desktop, vous ne testez pas votre variante : vous testez l'appareil.
La randomisation doit être sérieuse. La plupart des outils sérieux le font pour vous, mais vérifiez toujours la répartition avant d'analyser. Un déséquilibre 60/40 sur un test est un signal d'alarme.
Erreur n°3 : confondre significativité et importance
Un résultat « significatif à 95 % » veut dire qu'il y a 5 % de chances que la différence observée soit due au hasard. Cinq pour cent, ce n'est pas zéro. Sur vingt tests menés à ce seuil, un vous mentira.
Et puis il y a le décalage entre statistiquement significatif et utile pour le business. Gagner 0,3 % de conversion sur un trafic de 500 visiteurs par mois, ça ne paye pas le café. Avant de lancer un test, demandez-vous : quel écart minimum me ferait réellement changer d'avis ? Si la réponse est « 15 % », un gain de 2 % ne mérite pas qu'on s'excite.
Combien de temps et de trafic faut-il ?
C'est la question qu'on me pose le plus souvent, et celle à laquelle personne ne veut entendre la réponse.
Il n'existe pas de chiffre universel. La taille d'échantillon nécessaire dépend de trois choses : le taux de conversion de base, l'écart que vous voulez détecter, et le niveau de confiance visé.
En pratique, voici la règle empirique que j'applique et qui m'a rarement trahi :
- Pour détecter un gain de 20 % sur une conversion de base de 5 % : comptez environ 3 000 visiteurs par variante.
- Pour un gain de 10 % : il faut multiplier l'échantillon par quatre. Oui, quatre.
- Pour un gain de 5 % : oubliez si vous avez moins de 50 000 visiteurs mensuels.
Traduction : plus vous cherchez un petit effet, plus il vous faut du volume. C'est arithmétique, pas négociable. Et c'est pour ça que la plupart des sites de taille modeste ne devraient pas tester des micro-variations, mais des changements radicaux.
Un titre complètement différent. Une promesse reformulée du tout au tout. Un parcours réorganisé. Les gros changements produisent des effets mesurables sur de petits volumes. Les petits changements exigent des foules.
Quels outils pour faire un AB test ?
Le marché est saturé, et honnêtement, la plupart des outils se valent sur le cœur du sujet. La différence se joue sur l'intégration avec votre stack et sur le prix.
| Outil | Type | Idéal pour | Point faible |
|---|---|---|---|
| Google Optimize (arrêté) | Historique | — | N'existe plus, ne cherchez pas |
| AB Tasty | Suite complète | Équipes marketing structurées | Tarif élevé, engagement annuel |
| VWO | Suite complète | Tests + heatmaps | Interface dense |
| PostHog | Open source | Équipes produit techniques | Courbe d'apprentissage |
| Matomo A/B | Open source | Conformité RGPD stricte | Fonctions limitées |
Il existe des solutions gratuites, mais elles ont presque toutes une limite : soit un plafond de trafic, soit une fonctionnalité bridée. PostHog en version auto-hébergée est l'option gratuite la plus crédible que j'aie testée pour un usage sérieux, mais elle demande quelqu'un qui sait installer un serveur.
Le cas particulier des AB tests YouTube
YouTube propose depuis quelques années une fonctionnalité intégrée : Test & Compare, qui permet de tester jusqu'à trois miniatures différentes sur une même vidéo. C'est l'un des rares AB tests natifs réellement accessibles aux créateurs.
Ce que j'ai constaté en l'utilisant sur une petite chaîne (autour de 15 000 abonnés) : le taux de clic varie facilement du simple au double selon la miniature. Sur une vidéo, je suis passé de 4,1 % à 8,3 % en changeant simplement l'expression du visage sur la vignette. Rien d'autre. Même titre, même contenu.
Le piège, c'est la durée. YouTube laisse le test tourner plusieurs jours, ce qui est bien, mais il vaut mieux éviter de tester sur une vidéo qui sort juste — le trafic des premières heures est atypique, porté par les abonnés les plus fidèles.
Le cadre légal qu'on oublie toujours
Un AB test qui touche à des données personnelles — et c'est le cas dès qu'on manipule des comportements d'utilisateurs identifiés — entre dans le champ du RGPD.
La règle générale à retenir : si votre test modifie uniquement l'affichage d'une page pour tous les visiteurs, sans profilage individuel, vous restez en général dans le cadre d'une simple mesure d'audience. Si le test s'appuie sur des données personnelles pour segmenter ou personnaliser, il faut une base légale, et souvent une information claire des utilisateurs.
Je ne suis pas juriste, et je vous conseille vivement de ne pas l'être non plus par procuration. Sur un projet où je travaillais, nous avons dû revoir toute la mécanique de collecte parce qu'un test personnalisait le contenu selon l'historique de navigation. Trois semaines de retard. Refaites le test après, mais dans les règles.
Ce que je ferais différemment aujourd'hui
Si je devais repartir de zéro, voilà comment je m'organiserais :
- Un objectif unique par test, écrit noir sur blanc avant le lancement.
- Un calcul d'échantillon fait avant de lancer, pas après avoir vu les résultats.
- Une durée fixée à l'avance, non négociable, même si le résultat est mauvais — surtout s'il est mauvais.
- Un journal des tests, avec les hypothèses, les résultats, et une note sur ce qu'on en retient. J'ai tenu ce journal pendant dix-huit mois ; ça a changé ma façon de concevoir des pages.
Et une chose que j'ai arrêtée : tester pour tester. Certains tests ne servent qu'à occuper l'équipe. Si personne ne sait quoi faire du résultat, mieux vaut ne pas le lancer.
Le vrai apport d'un AB test
La plupart des gens voient l'AB test comme un moyen d'optimiser une page. C'est réducteur. Un AB test bien construit vous apprend surtout ce que vos utilisateurs ne veulent pas. Et ça, aucune réunion d'équipe ne vous le dira.
La dernière chose que j'ai apprise en dix-huit mois de tests réguliers, c'est que mes intuitions sont mauvaises environ une fois sur deux. Pas plus, pas moins. Cinquante pour cent. Ça paraît décevant. En réalité, c'est énorme : ça veut dire qu'à chaque décision de design, vous avez une chance sur deux de vous tromper, et que le seul moyen de savoir, c'est de mesurer.
Alors la prochaine fois qu'on vous demandera de « faire un AB test », posez une seule question avant de toucher au moindre bouton : qu'est-ce que je fais si le résultat me contredit ? Si vous n'avez pas de réponse, le test n'a pas encore commencé.