// erreur des sondages

Erreur empirique des sondages

Les sondages publiés juste avant une élection sont-ils aussi précis que leur marge d'erreur le laisse croire ? Comparaison avec les résultats des scrutins dans 45 pays.

Données

La base rassemble des intentions de vote et les résultats des élections correspondantes : lignes (un parti ou un candidat dans un sondage), sondages, pays, de à . Elle a été constituée par Will Jennings et Christopher Wlezien pour l'article Election polling errors across time and space (Nature Human Behaviour, vol. 2, p. 276–283, 2018) ; le fichier d'origine est téléchargeable sur Harvard Dataverse.

Chaque sondage y est daté du milieu de sa période de terrain. Quand plusieurs sondages tombent le même jour, les auteurs les regroupent en une moyenne (un « sondage de sondages »), comptée ici comme un seul sondage : c'est le cas de plus de la moitié des lignes retenues ci-dessous.

Seuls les sondages dont la taille d'échantillon est connue sont conservés. Toutes les analyses portent sur les élections depuis , période où les sondages par internet se généralisent : il reste sondages dans pays. Les deux premières parties se limitent en outre aux sondages réalisés moins de 8 jours avant le scrutin, pour que l'écart mesuré tienne le moins possible à une évolution de l'opinion pendant la campagne. Elles portent sur lignes, sondages et pays. Les sélections, formules et réglages de chaque mesure sont détaillés en annexe.

Écarts entre sondages et résultats

Chaque point est l'écart entre l'intention de vote d'un parti et son score réel. Si les sondages se comportaient comme des tirages aléatoires, 95 % des points devraient tenir dans leur marge d'erreur, et l'entonnoir devrait se resserrer quand l'échantillon grandit.

Écart entre intention de vote et résultat

Un point par parti et par sondage ; axe horizontal en échelle logarithmique.

Voir les données

En réalité, des écarts dépassent la marge d'erreur à 95 % de leur propre proportion, contre 5 % attendus (annexe B). Et l'entonnoir ne se resserre presque pas : au-delà de quelques milliers de sondés, l'erreur stagne.

Les auteurs de la base faisaient déjà ce constat : dans les 16 pays où la taille des échantillons est connue, le seul hasard de l'échantillonnage produirait une erreur absolue moyenne de 0,7 point, contre 1,8 point observé la dernière semaine avant le vote (Jennings et Wlezien, 2018, p. 4). Ils en concluent que la marge d'erreur usuelle sous-estime presque certainement l'erreur réelle.

Erreur moyenne selon la taille d'échantillon

Lignes regroupées en tranches d'effectifs comparables ; chaque point est placé à la taille médiane de sa tranche.

Voir les données

L'erreur attendue diminue en $1/\sqrt n$ ; l'erreur observée, elle, reste entre 1,5 et 2,3 points quelle que soit la taille. Elle est déjà deux fois trop grande pour les petits échantillons, et quatre à cinq fois trop grande pour les plus gros. Traduit en taille équivalente, un sondage se comporte comme un tirage aléatoire de quelques centaines de personnes (voir la colonne « taille équivalente » du tableau et l'annexe C).

Erreur selon la taille et la proportion

L'erreur théorique dépend aussi de $p$, le résultat réel du parti à l'élection : elle est maximale à 50 % et plus faible pour les petits partis. Le lissage LOESS en deux dimensions estime l'erreur moyenne observée pour chaque couple (proportion, taille), qu'on peut comparer à l'erreur attendue (annexe D).

Erreur moyenne selon la proportion et la taille d'échantillon

Lissage LOESS des écarts absolus ; les zones sans observations sont extrapolées ; . Faites glisser pour pivoter, survolez pour lire les valeurs.

Voir les données

Le rapport entre erreur observée et erreur attendue va de à . Il croît avec la taille d'échantillon, et plus encore pour les grands partis : c'est là que la marge d'erreur annoncée est la plus trompeuse.

Taille d'échantillon équivalente

Une autre approche consiste à simuler, pour chaque sondage, des échantillons purement aléatoires tirés à partir du résultat réel de l'élection. On cherche la plus petite taille pour laquelle ces tirages simulés sont, en médiane sur 1 000 tirages, aussi proches du résultat que le sondage réel. Cette taille équivalente mesure la précision effective du sondage (annexe E).

La proximité entre une distribution de votes et son estimation se mesure de plusieurs façons : divergence de Kullback-Leibler, entropie croisée, erreur quadratique, erreur absolue (formules). Le calcul porte sur sondages, quel que soit leur délai avant le scrutin.

La série « tirage aléatoire unique » sert de témoin : on remplace le sondage réel par un tirage aléatoire de même taille et on lui applique la même recherche. Si la méthode est juste, sa taille équivalente doit être proche de la taille réelle (annexe E).

Taille équivalente selon la taille réelle

Médiane glissante sur sondages, réalisés au plus 14 jours avant le scrutin ; axe vertical en échelle logarithmique (annexe F).

Voir les données

Le témoin suit à peu près la taille réelle, ce qui valide la méthode. Les sondages réels, eux, se comportent en médiane comme un tirage aléatoire de personnes (divergence KL), alors que leur taille médiane est de . Les quatre mesures donnent le même ordre de grandeur, et ce niveau ne dépend presque pas de la taille réelle.

Distribution de la taille équivalente

Boîte : 1er et 3e quartiles ; trait : médiane ; moustaches : 1,5 écart interquartile. Tranches de moins de sondages exclues. Choisissez la fenêtre avant le scrutin, le facteur et la mesure ; le témoin est la taille équivalente d'un vrai tirage aléatoire de même taille (annexe F).

Voir les données

Quelques tendances ressortent :

Erreur partagée et mimétisme

Si chaque sondage se trompait au hasard, certains surestimeraient un parti et d'autres le sous-estimeraient : les erreurs se compenseraient d'un sondage à l'autre. Deux indicateurs vérifient, élection par élection, si c'est le cas. Ils portent sur les sondages réalisés au plus jours avant le scrutin, pour les élections qui en comptent au moins .

Pour chaque élection, les deux valeurs sont comparées à 2 000 élections simulées où chaque sondage est un vrai tirage aléatoire, de même taille et sur le même résultat. Une élection est jugée anormale quand moins de 5 % des simulations atteignent sa valeur : par hasard, cela n'arrive qu'à 5 % des élections (annexe G).

Consensus d'erreur et resserrement, par élection

Un point par élection ; axe vertical en échelle logarithmique. Anormal : moins de 5 % des élections simulées au hasard atteignent cette valeur.

Consensus d'erreur anormal
Resserrement anormal
Attendu par hasard
5 %
Voir les données

Le consensus d'erreur est massif : il est anormal pour des élections, contre 5 % attendus. Sa valeur médiane est de , là où le hasard donnerait environ . Autrement dit, les sondages d'une même élection se trompent presque toujours ensemble, dans le même sens. C'est pourquoi multiplier les sondages, ou en faire la moyenne, ne corrige pas l'erreur.

Le resserrement, lui, ne montre pas de mimétisme généralisé : seules des élections sont anormalement resserrées, soit le niveau du hasard. En médiane, les sondages sont même plus dispersés qu'attendu (), ce qui s'explique par les évolutions de l'opinion pendant les derniers jours et par les différences de méthode entre instituts. Ces deux effets écartent les sondages les uns des autres et peuvent masquer un mimétisme réel : le test est donc prudent, et quelques élections restent nettement trop resserrées.

Croiser les deux indicateurs distingue deux façons de se tromper :

Dans cette base, les sondages réalisés le même jour sont regroupés par les auteurs en une seule ligne : leur moyenne, avec apparemment la somme des échantillons. Ces lignes sont traitées comme les autres : une moyenne de sondages qui partagent la même erreur ne la corrige pas davantage.

Annexe : méthodes et métriques

Cette annexe détaille chaque mesure utilisée dans la page. Les calculs sont dans analyses/erreurs.py, analyses/taille_equivalente.py et analyses/mimetisme.py.

A. Données et sélections

B. Marge d'erreur et erreur attendue

C. Erreur par tranche de taille et taille équivalente analytique

D. Surface lissée (LOESS en deux dimensions)

E. Taille équivalente par simulation

Les quatre mesures, sommées sur les catégories $i$ :

F. Médiane glissante et boîtes à moustaches

G. Consensus d'erreur et resserrement

Pour une élection, notons $e_{ij} = \hat p_{ij} - p_j$ l'écart signé du sondage $i$ sur le parti $j$, $\sigma_{ij} = \sqrt{p_j (1 - p_j) / n_i}$ et $z_{ij} = e_{ij} / \sigma_{ij}$. Seuls les couples sondage × parti présents dans les données sont utilisés ; $k_j$ est le nombre de sondages qui donnent le parti $j$.

H. Réglages du périmètre France

Le périmètre France compte peu de sondages ; plusieurs réglages sont assouplis pour garder quelque chose à afficher :

RéglageTous paysFrance
Tranches de taille (erreur par tranche)84
Tranches (taille réelle, année)53
Tranches (jours avant l'élection)63
Effectif minimal d'une tranche3010
Fenêtre de la médiane glissante50 sondages20 sondages
Part des points du lissage LOESS40 %70 %