Trouver la friandise préférée de son chien avec les stats

Pourquoi ça compte pour toi
C'est un exemple concret et amusant de comment appliquer des modèles statistiques pour résoudre des questions qu'on ne peut pas poser directement. Si tu construis un produit où tu dois classer des alternatives (contenus, designs, fonctionnalités), tu peux t'approprier cette approche : des comparaisons par paires plutôt que des votes directs. Et ça marche mieux que tu ne le penses.
Ce qu'il faut retenir
- 1.Bradley-Terry estime la force relative d'options en comparant des paires : qui gagne face à qui
- 2.C'est le même modèle que le classement Elo aux échecs, utilisé aussi par Claude Arena pour tester les IA
- 3.Après 30+ essais par paires, la friandise au poulet déshydraté a 63% de chances de gagner (mais sans certitude absolue)
Tu galères avec le jargon ?
Lis la version réécrite en mode débutant — toutes les idées, sans le jargon.
Pourquoi les modèles par paires fonctionnent mieux
Demander à quelqu'un "classe 10 options du mieux au pire" = à peu près impossible. Les gens abandonnent, changent d'avis, se fatiguent. Demander "lequel de ces deux tu préfères" = facile.
C'est exactement ce que fait Bradley-Terry. Le modèle dit : la probabilité que l'option A batte B dépend de la différence de leurs forces latentes. Si A gagne à 80% contre B, et B gagne à 60% contre C, tu peux en déduire la force relative de chacun.
L'expérience : simple mais rigoureuse
Chaque jour à 23h, Adam présente deux friandises à Bebop (son Greyhound) et note laquelle il choisit. Il teste 5 friandises différentes : du canard, du poulet déshydraté, des rawhides, etc.
Détail amusant : au milieu de l'expérience, deux friandises perdaient tellement que leur classement en queue de peloton ne faisait plus de doute. Adam a pivoté : il a arrêté les essais les impliquant et concentré les nouvelles données sur les vraies concurrentes.
Résultat après bootstrap (c'est-à-dire en répliquant l'expérience 1000x sur des sous-échantillons) :
- ▸Friandise E (poulet déshydraté) : championne 63% du temps
- ▸Friandise A (canard) : championne 33% du temps
- ▸Autres : marginal
Mais 63% ≠ 100%. Adam ne proclame pas victoire. Il dit clairement : "la seule honnête conclusion est de faire plus d'essais E vs A".
Tu peux t'approprier cette approche
Si tu dois décider entre deux designs, deux accroches publicitaires, deux fonctionnalités à lancer en priorité : oublie les sondages et les votes. Teste des paires. Les utilisateurs décident plus vite et plus honnêtement.
Le code complet est sur Github. Le modèle Bradley-Terry existe dans tous les langages de programmation. Et contrairement aux sondages, il produit un classement global cohérent à partir de votes locaux.
Et concrètement pour toi ?
Choisis ton profil — la lecture de l'article change selon qui tu es.
Pour toi, retiens que l'IA ne se limite pas à prédire ou générer : elle peut aussi trancher des questions nuancées où tu peux pas demander la réponse directement. C'est comme ça qu'on teste si Claude est meilleur que GPT — pas par magie, mais par science bien pensée.
Source
Pour aller plus loin
Cet article t'a donné envie d'approfondir ? Deux formations Noésis t'attendent :
Explorer les thèmes de cet article :