Erreur empirique des sondages
Les sondages publiés juste avant une élection sont-ils aussi précis que leur marge d'erreur le laisse croire ? Comparaison avec les résultats des scrutins dans 45 pays.
Peu de données pour la France. Seuls sondages français ( lignes) entrent dans les trois premiers graphiques, et dans la fenêtre de 2 semaines de la taille équivalente. Les graphiques ont moins de tranches, le seuil passe à sondages par tranche, et la surface 3D est très extrapolée (ses valeurs négatives sont ramenées à zéro). Les tendances sont donc indicatives. Les commentaires du texte décrivent l'ensemble des pays. Réglages détaillés en annexe H.
Données
La base rassemble des intentions de vote et les résultats des élections correspondantes : lignes (un parti ou un candidat dans un sondage), sondages, pays, de à . Elle a été constituée par Will Jennings et Christopher Wlezien pour l'article Election polling errors across time and space (Nature Human Behaviour, vol. 2, p. 276–283, 2018) ; le fichier d'origine est téléchargeable sur Harvard Dataverse.
Chaque sondage y est daté du milieu de sa période de terrain. Quand plusieurs sondages tombent le même jour, les auteurs les regroupent en une moyenne (un « sondage de sondages »), comptée ici comme un seul sondage : c'est le cas de plus de la moitié des lignes retenues ci-dessous.
Seuls les sondages dont la taille d'échantillon est connue sont conservés. Toutes les analyses portent sur les élections depuis , période où les sondages par internet se généralisent : il reste sondages dans pays. Les deux premières parties se limitent en outre aux sondages réalisés moins de 8 jours avant le scrutin, pour que l'écart mesuré tienne le moins possible à une évolution de l'opinion pendant la campagne. Elles portent sur lignes, sondages et pays. Les sélections, formules et réglages de chaque mesure sont détaillés en annexe.
Écarts entre sondages et résultats
Chaque point est l'écart entre l'intention de vote d'un parti et son score réel. Si les sondages se comportaient comme des tirages aléatoires, 95 % des points devraient tenir dans leur marge d'erreur, et l'entonnoir devrait se resserrer quand l'échantillon grandit.
Écart entre intention de vote et résultat
Un point par parti et par sondage ; axe horizontal en échelle logarithmique.
- Écart sondage − résultat
- Marge à 95 % pour p = 50 % (la plus large)
Voir les données
En réalité, des écarts dépassent la marge d'erreur à 95 % de leur propre proportion, contre 5 % attendus (annexe B). Et l'entonnoir ne se resserre presque pas : au-delà de quelques milliers de sondés, l'erreur stagne.
Les auteurs de la base faisaient déjà ce constat : dans les 16 pays où la taille des échantillons est connue, le seul hasard de l'échantillonnage produirait une erreur absolue moyenne de 0,7 point, contre 1,8 point observé la dernière semaine avant le vote (Jennings et Wlezien, 2018, p. 4). Ils en concluent que la marge d'erreur usuelle sous-estime presque certainement l'erreur réelle.
Erreur moyenne selon la taille d'échantillon
Lignes regroupées en tranches d'effectifs comparables ; chaque point est placé à la taille médiane de sa tranche.
- Erreur observée
- Erreur attendue d'un tirage aléatoire
Voir les données
L'erreur attendue diminue en $1/\sqrt n$ ; l'erreur observée, elle, reste entre 1,5 et 2,3 points quelle que soit la taille. Elle est déjà deux fois trop grande pour les petits échantillons, et quatre à cinq fois trop grande pour les plus gros. Traduit en taille équivalente, un sondage se comporte comme un tirage aléatoire de quelques centaines de personnes (voir la colonne « taille équivalente » du tableau et l'annexe C).
Erreur selon la taille et la proportion
L'erreur théorique dépend aussi de $p$, le résultat réel du parti à l'élection : elle est maximale à 50 % et plus faible pour les petits partis. Le lissage LOESS en deux dimensions estime l'erreur moyenne observée pour chaque couple (proportion, taille), qu'on peut comparer à l'erreur attendue (annexe D).
Erreur moyenne selon la proportion et la taille d'échantillon
Lissage LOESS des écarts absolus ; les zones sans observations sont extrapolées ; . Faites glisser pour pivoter, survolez pour lire les valeurs.
- Erreur observée (lissée)
- Erreur attendue d'un tirage aléatoire
- Observations
- Erreur observée ÷ erreur attendue
Voir les données
Le rapport entre erreur observée et erreur attendue va de à . Il croît avec la taille d'échantillon, et plus encore pour les grands partis : c'est là que la marge d'erreur annoncée est la plus trompeuse.
Taille d'échantillon équivalente
Une autre approche consiste à simuler, pour chaque sondage, des échantillons purement aléatoires tirés à partir du résultat réel de l'élection. On cherche la plus petite taille pour laquelle ces tirages simulés sont, en médiane sur 1 000 tirages, aussi proches du résultat que le sondage réel. Cette taille équivalente mesure la précision effective du sondage (annexe E).
La proximité entre une distribution de votes et son estimation se mesure de plusieurs façons : divergence de Kullback-Leibler, entropie croisée, erreur quadratique, erreur absolue (formules). Le calcul porte sur sondages, quel que soit leur délai avant le scrutin.
La série « tirage aléatoire unique » sert de témoin : on remplace le sondage réel par un tirage aléatoire de même taille et on lui applique la même recherche. Si la méthode est juste, sa taille équivalente doit être proche de la taille réelle (annexe E).
Taille équivalente selon la taille réelle
Médiane glissante sur sondages, réalisés au plus 14 jours avant le scrutin ; axe vertical en échelle logarithmique (annexe F).
- Divergence KL
- Entropie croisée
- Erreur quadratique
- Erreur absolue
- Tirage aléatoire unique (témoin)
Voir les données
Le témoin suit à peu près la taille réelle, ce qui valide la méthode. Les sondages réels, eux, se comportent en médiane comme un tirage aléatoire de personnes (divergence KL), alors que leur taille médiane est de . Les quatre mesures donnent le même ordre de grandeur, et ce niveau ne dépend presque pas de la taille réelle.
Distribution de la taille équivalente
Boîte : 1er et 3e quartiles ; trait : médiane ; moustaches : 1,5 écart interquartile. Tranches de moins de sondages exclues. Choisissez la fenêtre avant le scrutin, le facteur et la mesure ; le témoin est la taille équivalente d'un vrai tirage aléatoire de même taille (annexe F).
Voir les données
Quelques tendances ressortent :
- Taille réelle : la taille équivalente médiane bouge peu d'une tranche à l'autre. Multiplier les sondés n'améliore guère la précision effective.
- Année : pas d'amélioration nette au fil du temps. Les tranches récentes ont des médianes plus élevées, mais sans tendance régulière.
- Jours avant l'élection : c'est le facteur le plus marqué. Plus le sondage est éloigné du scrutin, plus sa taille équivalente baisse, ce qui est attendu puisque l'opinion a le temps d'évoluer. La chute est la plus rapide pendant le dernier mois : sur la fenêtre « ≤ 1 mois », la médiane KL passe d'environ 300 (0 à 5 jours avant le scrutin) à 87 (26 à 30 jours). Au-delà, elle ne baisse presque plus (entre 73 et 88 sur la fenêtre de 3 mois, après les 20 premiers jours).
- Nombre de partis : à partir de trois partis, la taille équivalente augmente avec le nombre de partis. Les duels ont une médiane élevée mais une dispersion très forte.
Erreur partagée et mimétisme
Si chaque sondage se trompait au hasard, certains surestimeraient un parti et d'autres le sous-estimeraient : les erreurs se compenseraient d'un sondage à l'autre. Deux indicateurs vérifient, élection par élection, si c'est le cas. Ils portent sur les sondages réalisés au plus jours avant le scrutin, pour les élections qui en comptent au moins .
- Consensus d'erreur : les sondages se trompent-ils tous dans le même sens ? Il vaut 0 quand les erreurs sont équilibrées de part et d'autre du résultat, et s'approche de 1 quand tous les sondages sont nettement du même côté. Un écart faible compte peu, un écart net compte pleinement (annexe G).
- Resserrement : les sondages sont-ils plus proches les uns des autres que le hasard ne le permet ? Il vaut 1 pour des sondages aussi dispersés que de vrais tirages aléatoires. En dessous de 1, les sondages se ressemblent trop, ce qui peut trahir du mimétisme : un institut qui ajuste ses chiffres pour ne pas trop s'écarter de ses concurrents (annexe G).
Pour chaque élection, les deux valeurs sont comparées à 2 000 élections simulées où chaque sondage est un vrai tirage aléatoire, de même taille et sur le même résultat. Une élection est jugée anormale quand moins de 5 % des simulations atteignent sa valeur : par hasard, cela n'arrive qu'à 5 % des élections (annexe G).
Consensus d'erreur et resserrement, par élection
Un point par élection ; axe vertical en échelle logarithmique. Anormal : moins de 5 % des élections simulées au hasard atteignent cette valeur.
- Consensus anormal
- Consensus et resserrement anormaux
- Resserrement anormal seul
- Compatible avec le hasard
Voir les données
Le consensus d'erreur est massif : il est anormal pour des élections, contre 5 % attendus. Sa valeur médiane est de , là où le hasard donnerait environ . Autrement dit, les sondages d'une même élection se trompent presque toujours ensemble, dans le même sens. C'est pourquoi multiplier les sondages, ou en faire la moyenne, ne corrige pas l'erreur.
Le resserrement, lui, ne montre pas de mimétisme généralisé : seules des élections sont anormalement resserrées, soit le niveau du hasard. En médiane, les sondages sont même plus dispersés qu'attendu (), ce qui s'explique par les évolutions de l'opinion pendant les derniers jours et par les différences de méthode entre instituts. Ces deux effets écartent les sondages les uns des autres et peuvent masquer un mimétisme réel : le test est donc prudent, et quelques élections restent nettement trop resserrées.
Croiser les deux indicateurs distingue deux façons de se tromper :
- Consensus élevé et resserrement élevé (Canada 2011, Royaume-Uni 2017) : les sondages se trompent tous dans le même sens, mais ne sont pas d'accord sur l'ampleur de l'erreur.
- Consensus faible et resserrement élevé (Venezuela 2013 : consensus de 0,05, resserrement de 16) : les sondages sont éparpillés de part et d'autre du résultat, comme si les instituts formaient des camps opposés.
Dans cette base, les sondages réalisés le même jour sont regroupés par les auteurs en une seule ligne : leur moyenne, avec apparemment la somme des échantillons. Ces lignes sont traitées comme les autres : une moyenne de sondages qui partagent la même erreur ne la corrige pas davantage.
Annexe : méthodes et métriques
Cette annexe détaille chaque mesure utilisée dans la page. Les calculs sont dans analyses/erreurs.py, analyses/taille_equivalente.py et analyses/mimetisme.py.
A. Données et sélections
- Source : base de Jennings et Wlezien (2018). Une ligne correspond à un parti ou un candidat dans un sondage, avec son intention de vote $\hat p$, son résultat $p$ et la taille d'échantillon $n$. La base ne contient que les partis ayant obtenu au moins 5 % des voix ; les intentions de vote excluent les indécis et les refus de répondre.
- Datation : chaque sondage est daté du milieu de sa période de terrain ; le délai avant le scrutin se compte à partir de cette date.
- Sondages regroupés : quand plusieurs sondages tombent le même jour, les auteurs de la base les remplacent par leur moyenne (colonne
npolls> 1). La taille d'échantillon de ces lignes vaut, d'après les données, la somme des échantillons. Elles sont traitées comme des sondages ordinaires. - Identification : un sondage est défini par son pays, sa date, le type d'élection, le système, le mode de scrutin, le tour, l'année et la date du scrutin ; une élection, par son pays, son type, sa date et son tour.
- Filtres : seules les lignes dont la taille d'échantillon est connue sont conservées. Toutes les analyses retiennent les élections depuis 2000, avec la généralisation des sondages par internet ; les chiffres de présentation de la base portent, eux, sur toutes les années. Les parties « écarts » et « taille et proportion » retiennent en outre les sondages réalisés moins de 8 jours avant le scrutin. La taille équivalente utilise une fenêtre au choix (1 semaine à 1 an ; 14 jours par défaut). Le consensus d'erreur et le resserrement portent sur les sondages réalisés au plus 14 jours avant le scrutin, et sur les élections qui en comptent au moins 3.
B. Marge d'erreur et erreur attendue
- Écart-type théorique d'une proportion estimée sur un échantillon aléatoire simple : $$\sigma = \sqrt{\frac{p\,(1-p)}{n}}$$ Il est calculé avec le résultat réel $p$ ; les instituts utilisent leur estimation $\hat p$, ce qui ne change presque rien.
- Marge d'erreur à 95 % : $L_{95} = 1{,}96\,\sigma$. L'entonnoir du nuage de points trace $\pm L_{95}$ pour $p = 50\,\%$, la marge la plus large.
- Erreur d'un sondage sur un parti : $e = |\hat p - p|$, en points de pourcentage.
- Part hors marge : proportion des lignes où $e > L_{95}$, chaque ligne avec sa propre marge. Pour de vrais tirages aléatoires, elle vaudrait 5 %.
- Erreur moyenne attendue d'un tirage aléatoire (espérance de la valeur absolue d'une loi normale) : $$\mathbb{E}\,|\hat p - p| = \sqrt{\tfrac{2}{\pi}}\;\sigma \approx 0{,}80\,\sigma$$ Le calcul d'origine utilisait $0{,}67\,\sigma$, qui est l'erreur médiane ; la page compare des moyennes et utilise donc $0{,}80\,\sigma$.
C. Erreur par tranche de taille et taille équivalente analytique
- Les lignes sont réparties en 8 tranches de taille d'échantillon d'effectifs comparables (quantiles ; les tranches en double sont fusionnées). Chaque tranche est placée à sa taille médiane.
- Erreur observée : moyenne de $e$ sur la tranche. Erreur attendue : moyenne de $0{,}80\,\sigma$ sur les mêmes lignes.
- Taille équivalente analytique : taille d'un échantillon aléatoire dont l'erreur moyenne attendue égalerait l'erreur observée $\bar e$ de la tranche, $$n_{eq} = \frac{2}{\pi}\,\frac{\overline{p\,(1-p)}}{\bar e^{\,2}}$$ où $\overline{p\,(1-p)}$ est la moyenne sur la tranche.
D. Surface lissée (LOESS en deux dimensions)
- Lissage des erreurs $e$ en fonction de la proportion $p$ et de $\log_{10} n$, avec
loess_2d(Cappellari et al., 2013, d'après Cleveland et Devlin, 1988) : régression locale de degré 1 sur 40 % des points les plus proches. - Les deux variables sont centrées et réduites avant le lissage, pour qu'une unité de proportion et une unité de $\log n$ pèsent autant dans le voisinage.
- La surface est évaluée sur une grille de 40 × 40 points : $p$ de 5 % à 60 %, $n$ de 500 à 10 000 en échelle logarithmique. Les zones sans observations sont extrapolées, et les valeurs négatives éventuelles sont ramenées à zéro.
- Ce lissage est robuste : il réduit le poids des écarts extrêmes. Il estime donc une valeur située entre la moyenne et la médiane des erreurs, et sous-estime probablement un peu l'erreur moyenne.
- Rapport : erreur lissée ÷ erreur moyenne attendue $0{,}80\,\sigma(p, n)$. Dans la vue « erreur observée », l'axe vertical s'arrête à 8 points : les écarts plus grands sont hors cadre.
E. Taille équivalente par simulation
- Distributions : pour un sondage, $y$ est le vecteur des résultats réels des partis et $\hat y$ celui des intentions de vote, en proportions. Si les partis ne totalisent pas 100 %, une catégorie « autres » est ajoutée aux deux ($1 - \sum y$ et $1 - \sum \hat y$, ramenée à 0 si négative). Les valeurs nulles de $\hat y$ sont remplacées par $10^{-5}$.
- Tirages : pour une taille $k$, on tire 1 000 échantillons multinomiaux de $k$ personnes selon $y$ (normalisé à 1), on convertit les comptes en proportions (comptes nuls remplacés par $10^{-5}$), et on calcule la mesure $D$ de chaque échantillon. $M(k)$ est la médiane de ces 1 000 valeurs.
- Recherche : soit $R = D(y, \hat y)$ la mesure du sondage réel, et $n$ sa taille. On part de $k = n$. Tant que le sondage fait mieux que le hasard ($R < M(k)$), on double $k$, sans dépasser $16\,n$. Puis, par dichotomie, on cherche la plus petite taille $k$ telle que $M(k) \le R$. Cette taille est la taille équivalente : le sondage est aussi proche du résultat qu'un tirage aléatoire médian de $k$ personnes.
Les quatre mesures, sommées sur les catégories $i$ :
- Divergence de Kullback-Leibler : $D = \sum_i \big( y_i \ln \tfrac{y_i}{\hat y_i} - y_i + \hat y_i \big)$
- Entropie croisée : $D = -\sum_i y_i \ln \hat y_i$
- Erreur quadratique : $D = \sum_i (\hat y_i - y_i)^2$
- Erreur absolue : $D = \sum_i |\hat y_i - y_i|$
- Témoin : on remplace le sondage réel par un seul tirage aléatoire de $n$ personnes selon $y$, et on applique la même recherche (divergence KL). Un tirage aléatoire donne en médiane une taille équivalente proche de $n$, mais très dispersée d'un tirage à l'autre : c'est la référence à laquelle comparer les sondages réels.
- Nombre de partis : nombre de partis du sondage, plus un si la catégorie « autres » existe.
- Les tailles équivalentes affichées proviennent du calcul d'origine. Le module
analyses/taille_equivalente.pyreproduit la même méthode avec des tirages multinomiaux et une graine fixe.
F. Médiane glissante et boîtes à moustaches
- Médiane glissante : les sondages réalisés au plus 14 jours avant le scrutin sont triés par taille réelle ; pour chaque mesure, on prend la médiane sur une fenêtre centrée de 50 sondages. Le graphe s'arrête à 6 000 personnes et affiche un point sur 10.
- Boîtes : 1er quartile, médiane et 3e quartile de la taille équivalente. Les moustaches vont jusqu'aux valeurs les plus extrêmes situées à moins de 1,5 écart interquartile de la boîte ; les points au-delà ne sont pas affichés.
- Tranches : 5 tranches d'effectifs comparables pour la taille réelle et l'année, 6 pour les jours avant l'élection (calculées à l'intérieur de la fenêtre choisie), une par valeur pour le nombre de partis. Les tranches en double sont fusionnées, et celles de moins de 30 sondages sont retirées.
- Fenêtres : sondages réalisés au plus 7, 14, 30, 90 ou 365 jours avant le scrutin.
G. Consensus d'erreur et resserrement
Pour une élection, notons $e_{ij} = \hat p_{ij} - p_j$ l'écart signé du sondage $i$ sur le parti $j$, $\sigma_{ij} = \sqrt{p_j (1 - p_j) / n_i}$ et $z_{ij} = e_{ij} / \sigma_{ij}$. Seuls les couples sondage × parti présents dans les données sont utilisés ; $k_j$ est le nombre de sondages qui donnent le parti $j$.
- Consensus d'erreur du parti $j$ : $$C_j = \Big|\, \frac{1}{k_j} \sum_i \tanh\!\big(z_{ij} / 2\big) \Big|$$ La tangente hyperbolique est une sigmoïde symétrique : un écart d'un demi-écart-type compte pour environ 0,24, un écart de 2 écarts-types pour 0,76, et un très grand écart pour 1. $C_j$ vaut 0 quand les écarts se compensent, 1 quand tous les sondages sont nettement du même côté.
- Resserrement du parti $j$ (au moins 3 sondages) : $$R_j = \frac{1}{k_j - 1} \sum_i \Big( \frac{e_{ij} - \bar e_j}{\sigma_{ij}} \Big)^2, \qquad \bar e_j = \frac{\sum_i e_{ij} / \sigma_{ij}^2}{\sum_i 1 / \sigma_{ij}^2}$$ Pour de vrais tirages aléatoires, $R_j$ vaut 1 en moyenne. En dessous, les sondages sont plus proches les uns des autres que leur marge ne le permet ; au-dessus, ils se dispersent davantage.
- Agrégation : $C$ et $R$ d'une élection sont les moyennes de $C_j$ et $R_j$ pondérées par le score $p_j$ des partis.
- Comparaison au hasard : pour chaque élection, on simule 2 000 élections où chaque sondage $i$ est un tirage multinomial de $n_i$ personnes selon les résultats réels (plus la catégorie « autres »), avec les mêmes partis présents. Le rang du consensus est la part des simulations dont le $C$ est au moins aussi grand ; celui du resserrement, la part dont le $R$ est au moins aussi petit. Une élection est jugée anormale quand son rang est inférieur à 5 %. Sur des élections simulées parfaitement aléatoires, environ 5 % ressortent anormales, comme attendu.
H. Réglages du périmètre France
Le périmètre France compte peu de sondages ; plusieurs réglages sont assouplis pour garder quelque chose à afficher :
| Réglage | Tous pays | France |
|---|---|---|
| Tranches de taille (erreur par tranche) | 8 | 4 |
| Tranches (taille réelle, année) | 5 | 3 |
| Tranches (jours avant l'élection) | 6 | 3 |
| Effectif minimal d'une tranche | 30 | 10 |
| Fenêtre de la médiane glissante | 50 sondages | 20 sondages |
| Part des points du lissage LOESS | 40 % | 70 % |