Méthodologie
Comment ces probabilités sont calculées
Un modèle publié en 1997, quelques milliers de rencontres, et cinquante mille saisons rejouées. Rien d'ésotérique — et tout est vérifiable, y compris ce qui ne marche pas.
Notre approche
Nous modélisons le football comme n'importe quel phénomène statistique : à partir de données, avec des modèles dont les hypothèses sont connues et vérifiables — pas à partir d'une intuition habillée en pourcentage.
Deux conséquences. Nos modèles reposent sur des méthodes établies, publiées, pas inventées pour l'occasion. Et quand un modèle a des limites, nous les écrivons : un bon modèle est un modèle dont on connaît les angles morts.
Le reste de cette page déroule la construction du modèle de championnat, du modèle le plus naïf jusqu'à celui que nous publions. Les deux autres, propriétaires, ont leur propre page : elles disent ce qu'ils cherchent, comment nous les vérifions et où ils échouent, pas comment ils sont faits.
Commencer par le plus simple
Le modèle le plus naïf ne regarde rien : il prend le nombre moyen de buts marqués à domicile et à l'extérieur dans le championnat, et l'applique à toutes les rencontres. En Ligue 1, ça donne environ 1,9 but pour l'équipe qui reçoit et 1,7 pour celle qui se déplace, quel que soit l'affiche.
C'est un mauvais modèle, mais il pose la bonne question : à partir de deux nombres de buts attendus, on sait déjà calculer la probabilité de chaque score, donc celle d'une victoire, d'un nul, ou de plus de 2,5 buts. Tout le travail consiste ensuite à obtenir de meilleurs nombres.
Donner à chaque équipe ses propres forces
Michael Maher a proposé en 1982 de décrire chaque équipe par deux nombres plutôt qu'un : une force d'attaque et une force de défense. Un seul paramètre ne distinguerait pas une équipe qui gagne 3-2 d'une équipe qui gagne 1-0.
Une attaque de 1,60 signifie que l'équipe marque 60 % de plus que la moyenne du championnat, face à une défense moyenne. Une défense se lit à l'envers : c'est un multiplicateur de buts encaissés, plus il est bas mieux c'est. L'avantage du terrain est commun à tout le championnat, et il vaut environ ×1,23 chez nous.
Ces forces ne se lisent pas dans le classement : elles sont estimées sur des milliers de rencontres, et corrigées de la qualité des adversaires rencontrés. Une équipe qui a bien commencé contre les promus n'en tire pas la même force qu'une équipe qui a fait autant contre le haut de tableau.
Ce que la loi de Poisson ne sait pas faire
Maher suppose que les deux équipes marquent indépendamment l'une de l'autre, selon deux lois de Poisson. C'est commode, et c'est faux sur un point précis, que Dixon et Coles ont mesuré en 1997.
Les scores serrés sont plus fréquents que l'indépendance ne le prédit. Il y a plus de 0-0, de 1-0, de 0-1 et de 1-1 dans la réalité que dans le modèle. Ce n'est pas un hasard : à 0-0 à la 80e, les deux équipes jouent différemment de ce qu'elles feraient à 3-1. Le score influence le jeu, donc les buts ne sont pas indépendants.
Oublier le passé, mais lentement
La seconde idée de Dixon et Coles est qu'une rencontre de 2019 ne dit pas autant qu'une rencontre de la semaine dernière. Chaque match reçoit un poids qui décroît avec le temps. Une rencontre vieille d'une demi-vie compte pour moitié.
Cette demi-vie n'est pas choisie à l'intuition. Elle est calibrée championnat par championnat : on rejoue chaque saison passée semaine après semaine, on prédit la journée suivante avec plusieurs réglages, et on retient celui qui s'est le moins trompé. Le résultat varie énormément, et cette variation est en soi une information — là où la demi-vie est courte, les hiérarchies bougent vite.
| Championnat | Demi-vie | ρ | Rencontres | Échantillon effectif | Dernier calcul |
|---|---|---|---|---|---|
| Admiral Bundesliga | 365 j | — | 955 | 426 | 21. September 2026 |
| Allsvenskan | 365 j | — | 1.756 | 675 | 27. September 2026 |
| Bundesliga (Germany) | 365 j | -0,086 | 2.139 | 866 | 27. September 2026 |
| Champions League | — j | — | 144 | 18 | 1. Oktober 2026 |
| Championship (England) | 240 j | — | 3.847 | 1.040 | 27. September 2026 |
| Ekstraklasa | 1095 j | — | 2.026 | 1.678 | 27. September 2026 |
| Eliteserien | 180 j | — | 1.710 | 337 | 27. September 2026 |
| Eredivisie (Netherlands) | 365 j | — | 2.063 | 868 | 27. September 2026 |
| La Liga (Spain) | 365 j | -0,012 | 2.684 | 1.076 | 27. September 2026 |
| La Liga 2 (Spain) | 240 j | — | 3.189 | 825 | 29. September 2026 |
| Liga Portugal (Portugal) | 1095 j | 0,036 | 1.987 | 1.644 | 27. September 2026 |
| Ligue 1 (France) | 730 j | -0,050 | 2.333 | 1.589 | 27. September 2026 |
| Premier League (England) | 180 j | -0,110 | 2.652 | 530 | 27. September 2026 |
| Premiership (Scotland) | 730 j | — | 1.504 | 1.038 | 27. September 2026 |
| Pro League (Belgium) | 365 j | — | 2.093 | 834 | 21. September 2026 |
| Serie A (Italy) | 240 j | 0,011 | 2.674 | 699 | 27. September 2026 |
| Serie B (Italy) | 120 j | — | 2.681 | 344 | 27. September 2026 |
| Super League (Switzerland) | 240 j | — | 1.404 | 404 | 27. September 2026 |
| Süper Lig (Turkey) | 120 j | — | 2.367 | 276 | 27. September 2026 |
| Superliga | — j | — | 1.245 | 1.245 | 27. September 2026 |
L'échantillon effectif est le nombre de rencontres qu'il faudrait, toutes de même poids, pour porter autant d'information que l'ensemble pondéré. En Premier League, 2.652 rencontres n'en valent que 530: c'est le prix d'une mémoire courte, et c'est aussi pourquoi les probabilités y sont moins tranchées.
Le cas des promus
Une équipe qui vient de monter n'a pas d'historique dans son nouveau championnat. Lui estimer une force sur trois rencontres produirait n'importe quoi : trois victoires en feraient un candidat au titre.
Son estimation est donc tirée vers le niveau moyen d'un promu, mesuré sur 149 montées observées depuis 2020 dans dix championnats européens. En moyenne, un promu attaque à ×0,82 et encaisse à ×1,34 par rapport au reste de son nouveau championnat. Plus il joue, moins ce rappel pèse. Les promus sont signalés comme tels dans les tableaux.
Dix championnats et non six : nous estimons ce niveau partout où nous disposons de données, y compris là où nous ne publions rien. Un promu norvégien ne renseigne aucune de nos pages, mais il renseigne le prior norvégien, et c'est la seule façon de l'obtenir.
Comparer deux championnats : notre adaptation de Dixon-Coles
Dixon-Coles a été écrit pour un championnat, et il y a une raison à cela. À chaque ajustement, les forces d'attaque sont recentrées : leur moyenne est ramenée à zéro en logarithme. C'est ce qui rend le modèle identifiable — sans cette ancre, multiplier toutes les attaques par un nombre et diviser toutes les défenses par le même laisserait les intensités inchangées.
La conséquence est que chaque indice se lit par rapport à son propre championnat. Celui de Porto se lit « par rapport au Portugal », celui de Manchester City « par rapport à l'Angleterre ». Poser les deux côte à côte et conclure, c'est comparer deux températures dont l'une serait en Celsius et l'autre en Fahrenheit.
Nous avons donc ajouté au modèle deux termes par championnat : δ pour l'attaque, ε pour la défense. Une rencontre entre une équipe i du championnat L et une équipe j du championnat M s'écrit alors :
g est l'avantage du terrain propre aux coupes d'Europe, estimé sur ces rencontres et non repris des championnats : s'y ajoute le voyage, souvent plus long. La correction τ de Dixon-Coles est conservée, avec son propre ρ.
Ces termes gagnent-ils leur place ? La question se tranche hors échantillon, sur une saison entière jamais vue pendant l'ajustement — 138 rencontres. Le modèle avec décalages obtient une log-perte de 0,933 et un RPS de 0,204 ; sans les décalages, 1,007 et 0,230 ; en pariant selon les seules fréquences historiques, 1,023 et 0,237.
Le deuxième chiffre mérite qu'on s'y arrête : comparer deux indices domestiques sans correction ne bat presque pas le hasard éclairé. C'est la mesure de ce que vaut le raccourci que le décalage évite.
Ces probabilités ne sont publiées que là où les deux clubs jouent dans l'un de nos six championnats — une minorité des affiches européennes. Ailleurs, nous ne mesurons pas le niveau de l'adversaire, et nous ne l'inventons pas.
Rejouer la saison
Le calendrier restant est rejoué 50 000 fois. Chaque rencontre est tirée au sort selon les probabilités du modèle, les points s'accumulent, et le classement final est établi aux règles réelles du championnat — points, puis différence de buts, puis buts marqués.
Une probabilité de titre de 60 % veut dire exactement ceci : sur cinquante mille saisons simulées, cette équipe termine première dans trente mille d'entre elles. Et se trompe quatre fois sur dix.
L'incertitude sur les forces elles-mêmes
Les forces sont estimées, donc incertaines. Les traiter comme connues rendrait les probabilités trop tranchées : un favori traverserait la saison sans que son avantage soit jamais remis en question.
Le modèle est donc réajusté 60 fois sur des rééchantillonnages des rencontres passées, et chaque saison simulée tire au sort lequel de ces ajustements elle utilise. Les probabilités publiées intègrent ainsi l'incertitude sur les forces, pas seulement le hasard des matchs.
Quand les chiffres bougent
Le modèle n'est recalculé que si des rencontres ont été jouées depuis le dernier calcul. Sans nouveau résultat, il redonnerait exactement les mêmes chiffres avec une date plus récente — ce qui laisserait croire à un mouvement qui n'a pas eu lieu. En pratique : un calcul par semaine, deux les semaines à match en milieu de semaine, aucun pendant les trêves internationales.
Chaque page porte la date de son calcul. Si la chaîne nocturne tombe en panne, le site continue de servir le dernier calcul valide — et cette date est la seule chose qui vous le dit.
Ce que ce modèle ne sait pas
Il ne connaît que des résultats. Ni les blessures, ni les transferts, ni un changement d'entraîneur, ni un match joué à dix. Une équipe qui perd son buteur en janvier gardera sa force d'attaque jusqu'à ce que les résultats la démentent.
Et la correction de Dixon-Coles, si elle règle la question des scores serrés, ne lève pas l'hypothèse d'indépendance : elle la corrige sur quatre cellules, pas partout. C'est une limite reconnue du modèle, et elle est connue depuis 1997.
Ce pour quoi il n'a pas été conçu
Dixon-Coles explique bien un résultat à partir de la force globale de deux équipes. Il n'a pas été construit pour une tâche différente : trouver précisément où un opérateur se trompe dans son prix. Un marché de cotes est déjà largement efficient — le battre ne demande pas un bon modèle de résultat, mais un modèle calibré pour cette confrontation-là.
C'est pour cette raison, et pas par goût du secret, que nous avons construit deux autres modèles, distincts de celui-ci.
Au-delà de Dixon-Coles
Ces deux modèles restent propriétaires. Contrairement à Dixon-Coles, nous ne détaillons pas leur construction : c'est elle qui porte la valeur de nos produits. Ce qui demeure vérifiable, en revanche, c'est leur performance dans le temps — l'historique des résultats est consultable, pertes comprises, pas seulement les réussites mises en avant.
Chacun a sa page, qui dit ce qu'il cherche à faire, comment nous le vérifions, et où il échoue.
- Le modèle joueurs — ce que vaut un joueur à une date donnée, et ce que son absence coûte à son équipe. C'est lui qui lit les compositions, là où Dixon-Coles en est incapable.
- Le modèle de l'application — celui qui cherche où un prix est faux, et pourquoi cette tâche demande une autre construction qu'un modèle de résultat.
Les limites que nous assumons
- Une probabilité n'est pas une prédiction. 61 % de chances de titre signifie que, sur cent saisons semblables, on en attend environ soixante-et-une où ça arrive — pas que c'est écrit d'avance.
- Le modèle part toujours d'un historique. Un événement sans précédent — blessure majeure, changement radical d'entraîneur — met du temps à être intégré, puisqu'il ne le voit qu'à travers les résultats.
- Aucun modèle ne remplace une expertise. Ni celle d'un staff technique, ni celle d'un médecin. Nos outils servent à appuyer une décision, pas à la prendre.
Une question sur la méthode ?
Si vous travaillez avec nous — média, club, chercheur — et que vous vous demandez ce que nos modèles peuvent ou ne peuvent pas couvrir pour votre cas précis, écrivez-nous plutôt que de deviner. Une réponse honnête sur ce qui n’est pas mesurable vous fait gagner plus de temps qu’une promesse.
Aller plus loin
Nous avons un modèle qui lève ces limites
Le modèle publié ici est ouvert, documenté, et volontairement simple — il doit pouvoir être reproduit. Celui que nous utilisons en interne va plus loin : il lève l’hypothèse d’indépendance entre les deux équipes au lieu de la corriger sur quatre scores, il intègre les cotes du marché, et il est entraîné marché par marché. Il n’est pas publié ici, mais il est accessible.