Pourquoi les générateurs d'adresses produisent des villes implausibles
Jusqu'au 18 juillet 2026, notre générateur d'adresses tirait les villes ukrainiennes de façon uniforme. La liste de la locale ukrainienne compte 54 villes : chacune — Kyiv, mais aussi Kamianets-Podilskyi — avait donc 1 chance sur 54 d'apparaître sur une carte générée. Kyiv concentre environ 16,4 % de la population couverte par cette liste. Elle était tirée dans 1,9 % des cas.
Rien, sur une carte prise isolément, ne paraissait faux. Chaque ville était réelle, correctement orthographiée, correctement associée à son oblast et à un code postal valide. Le défaut n'était visible qu'en agrégat, et en agrégat il était énorme.
Ce que fait réellement la sélection uniforme
La mesure est simple. Prenez la liste de villes de la locale, calculez la part du top 10 des villes dans le total sous sélection uniforme (soit simplement 10/N), puis comparez-la à leur part de la population réelle couverte par la liste.
| Locale | Villes | Part du top 10, uniforme | Part du top 10, pondérée par la population |
|---|---|---|---|
uk_UA | 54 | 18,5 % | 56,5 % |
ja_JP | 60 | 16,7 % | 54,0 % |
de_DE | 57 | 17,5 % | 49,8 % |
La sélection uniforme sous-estime la tête de chacune de ces distributions d'un facteur d'environ trois. Autrement dit : sous sélection uniforme, plus de 80 % des adresses générées tombent en dehors des dix villes où vit à peu près la moitié de la population listée.
À l'échelle d'une seule ville, la distorsion est plus grande encore. Sur 300 cartes générées à partir de la liste ukrainienne :
| Ville | Population | Observé, uniforme | Observé, pondéré | Espérance pondérée |
|---|---|---|---|---|
| Kyiv | 2 952 301 | 12 | 46 | 49,1 |
| Kharkiv | 1 421 125 | 12 | 31 | 23,6 |
| Odesa | 1 010 537 | 11 | 14 | 16,8 |
Sous sélection uniforme, chacune des 54 villes obtient en moyenne 5,6 tirages pour 300 cartes, et Kyiv en a dûment obtenu 12 — non pas parce qu'elle est la capitale, mais parce qu'il faut bien que quelque chose ressorte en tête de 54 cellules bruitées, et 12 correspond à peu près à ce qu'on observe en tête de ce tas. Après pondération, Kyiv obtient 46 contre une espérance de 49,1, et les trois villes se situent à moins de 1,6 écart-type de leurs espérances pondérées.
Une mise en garde dans laquelle nous sommes tombés nous-mêmes. Notre première lecture de la série uniforme fut que 12/12/11 était trop élevé pour relever du hasard — chaque cellule attend 5,6 avec un écart-type de 2,3, si bien que 12 ressemble à un résultat à +2,8σ, et cela trois fois de suite. Ce raisonnement est faux, et il est faux d'une manière instructive : 12 n'est pas une cellule choisie au hasard, c'est la plus grande de 54, et le maximum d'un grand nombre de cellules se situe dans la queue par construction. En simulant 200 000 séries uniformes de 300 tirages sur 54 villes, on obtient un maximum moyen de 11,58, une médiane de 11 et un 95e centile de 14. La probabilité que les trois premières cellules atteignent au moins 12, 12 et 11 est de 0,060 — peu courant, mais loin d'être impossible, et exactement la forme que produit un tirage uniforme. Avant de déclarer impossible un nombre observé, vérifiez que vous le comparez à la bonne distribution. Nous comparions une statistique d'ordre à la distribution d'une cellule isolée.
Cela signifie aussi qu'un décompte sur 300 cartes ne se lit pas directement à partir des 18,5 % du tableau ci-dessus. Ces 18,5 % sont la probabilité de sélection d'un ensemble fixe de dix villes ; les dix villes qui se trouvent ressortir en tête d'une série bruitée en couvriront toujours davantage — environ 30 % empiriquement. Les deux colonnes du tableau précédent sont toutes deux des probabilités, et comparables entre elles ; un décompte des gagnants observés est une troisième chose.
Le problème le plus difficile : qu'est-ce qu'une ville ?
Pondérer par la population suppose de disposer d'une population. C'est précisément là que réside la difficulté, car « la population d'une ville » n'est pas une grandeur unique.
| Ville | Définition étroite | Définition large | Rapport |
|---|---|---|---|
| Sydney | ~200 000 (City of Sydney LGA) | 5,3 millions (Greater Sydney) | ~26× |
| Chongqing | ~9 millions (cœur urbain) | 32 millions (municipalité) | ~3,5× |
| Tokyo | 9 733 276 (23 arrondissements spéciaux) | ~14 millions (métropole de Tokyo) | ~1,4× |
| Frankfurt | 760 656 (Gemeinde) | ~2,3 millions (Rhein-Main) | ~3× |
Sydney est le cas extrême : la zone de gouvernement local City of Sydney est un petit conseil central qui couvre une fraction de ce que quiconque entend par « Sydney ». La municipalité de Chongqing est une région administrative de la taille de l'Autriche, rurale pour l'essentiel. Et Tokyo n'a aucune ville au sens juridique — la City of Tokyo a été supprimée en 1943. Ce qui existe, ce sont 23 arrondissements spéciaux, chacun une municipalité à part entière, à l'intérieur de la métropole de Tokyo. Nous retenons le chiffre des 23 arrondissements, 9 733 276, parce que c'est ce qui se rapproche le plus de l'entité que les gens ont en tête.
Aucun de ces choix n'est correct dans l'absolu. Ce qui compte, c'est que le choix soit fait de manière cohérente à l'intérieur d'une locale, car les poids sont relatifs. Mélanger un chiffre métropolitain pour une ville et un chiffre communal pour une autre multiplie silencieusement par trois ou plus la probabilité de tirage de la première face à sa voisine — le même défaut que celui décrit pour l'Argentine dans Quatre noms de famille qui n'existent pas, où des chiffres de municipio et de localidad cohabitent dans une même colonne.
La locale que nous avons laissée non pondérée
La liste ar_SA de l'Arabie saoudite compte 39 villes, et elle est toujours livrée sans poids de population.
GASTAT, l'autorité statistique saoudienne, publie la population par gouvernorat. Pour 25 des 39 villes, un chiffre urbain défendable peut être reconstitué ; pour les 14 restantes, non — le nombre au niveau de la ville n'existe tout simplement pas dans les statistiques publiées. Les options étaient : pondérer 25 villes et laisser les 14 autres à une valeur par défaut arbitraire, substituer les populations de gouvernorat aux populations de ville (ce qui surestimerait fortement les petites villes situées dans de grands gouvernorats), ou laisser la locale uniforme.
Nous l'avons laissée uniforme. Une adresse saoudienne tirée uniformément est une approximation connue et documentée ; une liste où deux tiers des villes sont pondérées à partir d'un type d'unité et un tiers à partir d'un autre est un défaut qui resterait invisible pour tout le monde, nous compris. Là où la source ne permet pas d'établir la métrique, ne pas la calculer est la bonne réponse — un argument développé en détail dans Comment auditer un jeu de données de fréquence des noms.
Sur 64 fichiers de localités, 44 sont pondérés par la population à l'heure où nous écrivons et 20 restent uniformes. Ces 20 fichiers uniformes ne sont pas un arriéré que nous n'aurions pas traité ; chacun est un cas où la source ne permet pas d'établir la métrique, ar_SA ci-dessus en étant l'exemple détaillé. Ils restent uniformes tant que les statistiques sous-jacentes ne changent pas, et l'approximation documentée est, dans l'intervalle, la sortie correcte.
L'autre signe révélateur : des codes postaux qui ne peuvent pas être justes
La fréquence des villes est la distorsion que les gens remarquent le moins. Les codes postaux sont celle qu'ils remarquent en premier, et c'est en Irlande que les générateurs naïfs échouent de la manière la plus visible.
Un Eircode irlandais compte sept caractères en deux parties :
A65 F4E2
└┬┘ └─┬─┘
│ └── identifiant unique d'UNE propriété
└─────── clé de routage (zone géographique)
Les trois premiers caractères forment une clé de routage couvrant une zone étendue. Les quatre derniers identifient un bâtiment précis. Deux maisons voisines d'une même rue ont des Eircodes différents ; « l'Eircode de Galway » n'existe pas.
Un générateur qui attribue le même code postal à toutes les cartes d'une ville produit, pour l'Irlande, non pas une adresse légèrement fausse mais une adresse structurellement impossible — et n'importe quel habitant du pays le repère immédiatement. La même classe de problème apparaît partout où les codes postaux descendent plus finement que la localité : les codes postaux britanniques portent sur environ 15 adresses, et les codes postaux néerlandais, complétés du numéro de rue, identifient une adresse unique.
Notre liste irlandaise comporte 72 entrées pour un schéma à 3 colonnes, la plus fournie de toutes les locales rapportée à la taille du pays, précisément parce que les clés de routage ne correspondent pas une à une aux villes.
Ce qu'il faut contrôler dans tout générateur d'adresses
- Comparez la part du top 10 des villes à la part réelle de la population. Si le générateur est uniforme, le premier nombre vaut
10/Net il représentera environ un tiers du second. C'est une ligne d'arithmétique, et c'est tout le diagnostic. - Demandez quel chiffre de population utilise chaque ville. Communal, agglomération urbaine, aire métropolitaine, région administrative. La cohérence à l'intérieur d'une locale compte davantage que le choix retenu.
- Vérifiez si l'office statistique du pays publie ne serait-ce que des chiffres au niveau de la ville. Plusieurs ne le font pas. C'est une raison de laisser une locale non pondérée, pas une raison d'improviser.
- Contrôlez la granularité du code postal. Si le code du pays identifie un bâtiment ou un petit groupe d'adresses, un seul code par ville est un défaut visible.
- Générez quelques centaines de cartes et comptez. Presque tous les défauts décrits dans cet article sont invisibles sur une carte isolée et évidents dans un décompte de 300.
Le point de fond, c'est que la plausibilité des données générées est une propriété distributionnelle. Chaque carte ukrainienne prise isolément était impeccable. Leur ensemble décrivait un pays où la capitale n'est pas plus probable qu'un chef-lieu de district, et aucune inspection d'enregistrements individuels ne l'aurait jamais révélé.
Données arrêtées au 2026-07-18
Les parts des villes ont été calculées le 18 juillet 2026 directement à partir des fichiers de localités livrés. Les parts uniformes valent 10/N sur le même fichier, si bien que les deux colonnes décrivent la même liste de villes et ne diffèrent que par la règle de sélection. Les chiffres de population sont ceux intégrés aux fichiers de localités ; là où un chiffre exigeait un choix de périmètre, ce choix est indiqué dans le texte.
Sources et notes :
- Fichiers de localités — 64 locales, dont 44 portent des poids de population et 20 sont uniformes, recomptées le 22 juillet 2026. Les trois cas détaillés ci-dessus :
uk_UA(54 villes, 18 033 518 habitants couverts),de_DE(57 villes, 23 909 828),ja_JP(60 villes, 51 046 822). La population couverte est la somme sur les villes listées, et non la population nationale. - Japon — Statistics Bureau. Tokyo est représentée par les 23 arrondissements spéciaux, 9 733 276. La City of Tokyo a été supprimée en 1943 et n'a pas de successeur juridique en tant que municipalité unique. <stat.go.jp/english/>
- Allemagne — Destatis / offices statistiques des Länder. Populations communales (Gemeinde) ; Frankfurt am Main 760 656. <destatis.de/>
- Ukraine — Derzhstat. Populations des villes ; Kyiv 2 952 301. Les chiffres sont antérieurs aux perturbations administratives actuelles et servent de poids de liste, non d'estimations démographiques actuelles. <ukrstat.gov.ua/>
- Arabie saoudite — GASTAT. Publie par gouvernorat ; les chiffres urbains au niveau de la ville sont indisponibles pour 14 des 39 villes de notre liste, si bien que
ar_SAreste non pondérée. <stats.gov.sa/> - Irlande — Eircode. Code de sept caractères : clé de routage de 3 caractères plus identifiant unique de propriété de 4 caractères. <eircode.ie/>
- Australie — ABS ; City of Sydney LGA face au Greater Sydney GCCSA. <abs.gov.au/>
Sur les décomptes de tirages. Les décomptes uniformes (12/12/11) et pondérés par la population (46/31/14) sont tous deux mesurés sur des séries de 300 cartes tirées du fichier ukrainien livré, qui compte 54 villes. Les chiffres de valeurs extrêmes qui servent à les interpréter — maximum moyen 11,58, médiane 11, 95e centile 14, et P(trois premières ≥ 12, 12, 11) = 0,060 — proviennent de 200 000 séries uniformes simulées de 300 tirages sur 54 villes équiprobables.