Des noms de famille qui n'existent pas : comment repérer les valeurs de remplissage dans un recensement
Le 78e nom de famille le plus répandu aux États-Unis est DOE.
Il figure dans le fichier des noms de famille du recensement de 2020 entre PETERSON au #77 et WARD au #79, avec 262 774 porteurs. Dix ans plus tôt, la même série de fichiers plaçait DOE au #4 972, avec 7 066 porteurs. Cela fait un facteur de 37,2 en une seule décennie, pour un nom de famille dont tout le monde, dans le monde anglophone, sait déjà que c'est ce que l'on écrit quand on ignore le nom.
Ce n'est pas un scandale, et le Census Bureau n'a pas commis d'erreur. DOE est un nom de famille réel, porté par de vraies familles, et c'est aussi la chaîne de caractères que l'on saisit lorsqu'un formulaire doit être rempli et que le nom de famille n'est pas disponible. Le fichier ne peut pas séparer ces deux populations, il publie donc leur somme.
La question intéressante n'est pas « DOE est-il factice ». Elle est la suivante : comment trouveriez-vous le suivant, dans un pays dont vous ignorez les conventions de dénomination ?
Nous avons dû y répondre le 21 juillet 2026, en reconstruisant les données de noms américaines à partir du recensement de 2020. La réponse s'est révélée tenir en deux tests arithmétiques qui n'exigent aucune connaissance linguistique — et, appliqués ensemble, ils ont trouvé six candidats dans les 5 000 premiers, dont un seul nous était connu jusque-là.
Signal un : une croissance qui ne peut pas se produire
Le premier test est le test évident, et pris isolément il est inutile. Voici pourquoi.
Prenez chaque nom de famille classé dans les 5 000 premiers du fichier de 2020, relevez son effectif de 2010 et calculez le rapport. Sur 4 999 noms de famille, la distribution est extrêmement resserrée :
| Quantile | Effectif 2020 ÷ effectif 2010 |
|---|---|
| p01 | 0,90 |
| p10 | 0,93 |
| médiane | 0,96 |
| p90 | 1,04 |
| p99 | 1,64 |
| max | 37,19 |
Quatre-vingt-dix-neuf pour cent des noms de famille américains courants ont bougé de moins de ±64 % en dix ans, et la médiane n'a pratiquement pas bougé du tout. Tout ce qui dépasse environ ×1,7 se situe donc déjà hors du quatre-vingt-dix-neuvième centile, et les vingt entrées à la croissance la plus rapide méritent un examen individuel.
Les voici :
| Nom de famille | Rang 2020 | Effectif 2020 | Effectif 2010 | Facteur |
|---|---|---|---|---|
DOE | 78 | 262 774 | 7 066 | 37,2 |
REF | 3 337 | 10 563 | 705 | 15,0 |
MALE | 2 611 | 13 499 | 1 773 | 7,6 |
NO | 3 618 | 9 579 | 1 349 | 7,1 |
TAMANG | 4 372 | 7 841 | 1 105 | 7,1 |
LAST | 3 477 | 10 013 | 1 825 | 5,5 |
GURUNG | 2 454 | 14 369 | 3 450 | 4,2 |
THANG | 4 810 | 7 126 | 1 836 | 3,9 |
RAI | 1 760 | 19 927 | 5 295 | 3,8 |
HTOO | 4 097 | 8 400 | 2 681 | 3,1 |
PATIL | 4 235 | 8 091 | 2 790 | 2,9 |
ADHIKARI | 4 642 | 7 408 | 2 889 | 2,6 |
CHILD | 2 673 | 13 159 | 5 237 | 2,5 |
SHRESTHA | 2 993 | 11 764 | 5 535 | 2,1 |
HOSSAIN | 2 784 | 12 599 | 5 978 | 2,1 |
La liste mélange deux choses complètement différentes. TAMANG, GURUNG, RAI, SHRESTHA, ADHIKARI, HTOO, THANG sont des noms de famille népalais, bhoutanais et birmans qui ont progressé pour la raison la plus ordinaire du monde : la réinstallation de réfugiés et la migration. Ils sont aussi réels que SMITH. La croissance seule les signale, et la croissance seule ne peut pas les disculper.
Le premier test produit donc une liste de candidats, pas un verdict. Il lui faut un second test, indépendant, qui n'ait rien à voir avec le temps.
Signal deux : l'empreinte du profil
Le fichier des noms de famille du recensement américain comporte un bloc auxiliaire de colonnes que personne n'utilise pour cela : pour chaque nom de famille, il publie la répartition de ses porteurs entre les catégories auto-déclarées que le recensement collecte. Nous utilisons ici ces colonnes uniquement comme une empreinte permettant d'identifier une ligne qui a été assemblée plutôt qu'observée. Elles ne portent aucune signification sur les noms et les populations, et nous n'en tirons aucune.
La logique est mécanique. Chaque nom de famille réel sur Terre est arrivé aux États-Unis au fil d'une histoire particulière, et cette histoire laisse les porteurs du nom concentrés quelque part. Une valeur de remplissage n'a pas d'histoire. Elle est inscrite dans un enregistrement chaque fois qu'un enregistrement doit être complété, et cela arrive à tout le monde à peu près au rythme où chacun est présent dans la population. La distribution d'une valeur de remplissage devrait donc ressembler aux totaux propres du fichier, et celle d'un nom de famille réel non.
Les totaux propres du fichier, sur l'ensemble des 298 870 618 porteurs recensés, constituent la référence :
| Ligne | Rang 2020 | Effectif | A | B | C | D | E | F |
|---|---|---|---|---|---|---|---|---|
| référence (fichier entier) | — | 298 870 618 | 60,0 | 11,8 | 0,7 | 6,2 | 3,3 | 18,0 |
DOE | 78 | 262 774 | 52,7 | 21,3 | 0,7 | 5,1 | 1,8 | 18,4 |
REF | 3 337 | 10 563 | 49,3 | 19,6 | 1,2 | 6,1 | 2,6 | 21,2 |
SMITH | 1 | 2 369 644 | 68,0 | 22,6 | 0,8 | 0,7 | 4,4 | 3,5 |
WILLIAMS | 3 | 1 561 395 | 43,8 | 46,2 | 0,8 | 0,6 | 5,1 | 3,5 |
GARCIA | 6 | 1 149 510 | 5,7 | 0,5 | 0,5 | 1,6 | 0,4 | 91,2 |
NGUYEN | 29 | 531 404 | 1,3 | 0,2 | 0,0 | 95,4 | 2,1 | 0,8 |
GURUNG | 2 454 | 14 369 | 0,9 | 0,1 | 0,0 | 97,5 | 1,1 | 0,3 |
Lisez les quatre dernières lignes : GARCIA place 91 % de sa masse dans une seule colonne, NGUYEN 95 %, GURUNG 97 %. Même SMITH et WILLIAMS, qui ont l'air « génériques », s'écartent radicalement de la forme nationale — tous deux placent moins de 4 % dans la dernière colonne, contre 18 % au niveau national.
Lisez maintenant DOE. Chacun de ses six nombres se tient à environ neuf points au plus de la valeur nationale, et trois d'entre eux à moins d'un point.
Résumez cela en un seul nombre — la somme des différences absolues entre les six parts d'un nom de famille et les six parts de référence, que nous appellerons L1 — et le résultat est saisissant :
| Tranche du fichier 2020 | n | Plus petit L1 | L1 médian | L1 p90 |
|---|---|---|---|---|
| top 100 | 100 | 19,9 — DOE | 43,4 | 148,7 |
| top 500 | 500 | 19,9 — DOE | 42,9 | 149,0 |
| top 1 000 | 1 000 | 19,9 — DOE | 45,4 | 150,0 |
| top 5 000 | 4 999 | 8,2 — CHILD | 57,5 | 149,0 |
DOE a le profil le plus plat de tous les noms de famille des 1 000 premiers du recensement américain. Pas dans les dix premiers — le premier. Le deuxième dans les 500 premiers est SIMON, à 25,4, et la médiane vaut plus du double de la valeur de DOE.
Il existe exactement une ligne, dans tout le fichier, qui soit plus plate, et c'est le contrôle qui valide la méthode : la ligne de reste agrégée ALL OTHER NAMES, qui représente 36 257 637 personnes dont les noms de famille étaient trop rares pour être publiés individuellement. Cette ligne est, par construction, une tranche aléatoire du pays, et son L1 vaut 12,36. La seule chose du fichier qui soit démographiquement plus dépourvue de traits qu'une valeur de remplissage est un fourre-tout étiqueté « tous les autres ».
Croiser les deux signaux
Aucun test ne décide quoi que ce soit à lui seul. La croissance signale des migrations légitimes ; la platitude signale des noms de famille légitimement mixtes. Exécutez les deux et exigez les deux.
Filtre : rang ≤ 5 000 en 2020, L1 < 30, tri par croissance. Cinquante-deux noms de famille passent le filtre de platitude. Une fois la liste triée par croissance, sa tête est sans ambiguïté, puis c'est la chute brutale :
| Nom de famille | Rang 2020 | Effectif 2020 | Effectif 2010 | Facteur | L1 |
|---|---|---|---|---|---|
DOE | 78 | 262 774 | 7 066 | 37,2 | 19,9 |
REF | 3 337 | 10 563 | 705 | 15,0 | 23,1 |
MALE | 2 611 | 13 499 | 1 773 | 7,6 | 23,2 |
NO | 3 618 | 9 579 | 1 349 | 7,1 | 24,4 |
LAST | 3 477 | 10 013 | 1 825 | 5,5 | 14,2 |
CHILD | 2 673 | 13 159 | 5 237 | 2,5 | 8,2 |
| — | |||||
DOSSANTOS | 3 800 | 9 120 | 6 137 | 1,5 | 20,0 |
DESOUZA | 3 871 | 8 922 | 6 639 | 1,3 | 18,2 |
DASILVA | 1 397 | 24 905 | 20 338 | 1,2 | 25,6 |
PEREIRA | 1 070 | 32 169 | 29 898 | 1,1 | 28,1 |
MENDES | 3 398 | 10 283 | 10 162 | 1,0 | 15,4 |
Six entrées au-dessus de ×2,5, puis un écart, puis une longue queue de noms de famille portugais et brésiliens, entre ×1,0 et ×1,5. Ces noms lusophones ont un profil plat pour une raison parfaitement valable — leurs porteurs se répartissent réellement entre les catégories du recensement — et leur croissance est ordinaire, si bien que le second signal les disculpe. Les noms de famille népalais passent le test de croissance et échouent au test de profil, à L1 ≈ 180. Six éléments seulement passent les deux.
Et chacun de ces six est un mot anglais que l'on trouverait sur un formulaire : doe, ref(erence), male, no, last (name), child.
Les contrôles qui gardent la méthode honnête
Une méthode qui signale de simples mots anglais dans une liste de noms de famille ne vaut rien si elle ne disculpe pas aussi les simples mots anglais qui se trouvent être des noms de famille. Elle le fait.
| Nom de famille | Rang 2020 | Effectif 2020 | Effectif 2010 | Facteur | L1 | Verdict |
|---|---|---|---|---|---|---|
ROE | 1 404 | 24 654 | 25 286 | 1,0 | 55,4 | nom de famille réel |
BLANK | 2 681 | 13 127 | 13 050 | 1,0 | 62,9 | nom de famille réel |
SAMPLE | 3 226 | 10 911 | 11 471 | 1,0 | 39,7 | nom de famille réel |
TEST | 22 518 | 1 171 | 1 121 | 1,0 | 42,1 | nom de famille réel |
FIRST | 14 872 | 1 912 | 1 255 | 1,5 | 37,4 | nom de famille réel |
ROE est le cas le plus fort de tous. Dans la pratique juridique américaine, Richard Roe est la seconde valeur de remplissage canonique, employée aux côtés de John Doe pour une seconde partie inconnue depuis la procédure anglaise médiévale. Si la méthode n'était qu'une reconnaissance de motifs portant sur « les mots qui ressemblent à des valeurs de remplissage », ROE serait en tête de liste. Au lieu de quoi il est parfaitement plat, à ×1,0 de croissance, et son profil est concentré à 87,6 % dans une seule colonne — très loin de la forme nationale. ROE est un authentique nom de famille anglo-irlandais, et le compteur le dit.
BLANK raconte la même histoire dans l'autre sens : un nom de famille allemand (blank = brillant, clair) qui figure dans le fichier avec 13 127 porteurs, un L1 de 62,9 et aucune croissance. Il ressemble exactement à un artefact de formulaire. Il n'en est pas un.
L'apparence ne décide rien. Le compteur décide tout. C'est la conclusion à laquelle nous étions parvenus par le chemin inverse dans Le problème du seuil de confidentialité dans les registres de noms, où un nom de famille composé chinois d'allure archaïque s'est révélé avoir deux porteurs vivants et est resté dans le corpus.
Le troisième signal, pour les prénoms
Les valeurs de remplissage infestent aussi les fichiers de prénoms, et là, les colonnes de profil n'existent pas — le fichier des prénoms de 2020 publie le sexe à la place. Cela se révèle tout aussi efficace, car les valeurs de remplissage n'ont pas de sexe.
Prenez les 2 500 premiers prénoms du recensement de 2020 et mesurez l'écart entre la part masculine de chacun et 50 %. La médiane est de 49,66 points de pourcentage. Ce n'est pas une coquille : le prénom américain typique relève essentiellement d'un seul sexe, si bien que l'écart typique à la parité est presque le maximum possible. Seul 1 % des 2 500 premiers se tient à moins de 6,4 points d'une répartition égale.
Sur cette toile de fond :
| Prénom | Rang | Effectif | Masculin | Féminin | Part masculine | Écart à 50 % |
|---|---|---|---|---|---|---|
DOE | 11 533 | 1 106 | 562 | 544 | 50,8 % | 0,8 pp |
BABY | 1 875 | 15 306 | 7 158 | 8 148 | 46,8 % | 3,2 pp |
REF | 1 908 | 14 844 | 7 936 | 6 908 | 53,5 % | 3,5 pp |
| — | ||||||
MALE | 1 309 | 27 911 | 27 703 | 208 | 99,3 % | 49,3 pp |
FEMALE | 1 659 | 18 869 | 102 | 18 767 | 0,5 % | 49,5 pp |
BOY | 1 710 | 18 094 | 17 960 | 134 | 99,3 % | 49,3 pp |
GIRL | 1 760 | 17 156 | 99 | 17 057 | 0,6 % | 49,4 pp |
Deux signatures de remplissage différentes, toutes deux diagnostiques. REF, BABY et DOE sont neutres quant au sexe parce que rien chez la personne ne les détermine. MALE, FEMALE, BOY et GIRL sont l'extrême opposé — purs à 99,3 % — parce que la valeur de remplissage est le champ du sexe qui déborde dans le champ du nom. Un prénom authentique n'atteint presque jamais ni l'un ni l'autre.
Et REF reçoit une quatrième confirmation, entièrement indépendante. Les données d'enregistrement des naissances de la Social Security Administration, qui constituent l'autre source nationale de prénoms pour les États-Unis, contiennent 32 718 noms masculins et 55 399 noms féminins distincts. REF ne figure dans aucun des deux. Le recensement dit que 14 844 Américains vivants répondent à ce nom ; le registre des naissances n'a jamais enregistré une seule naissance sous ce nom. DOE apparaît au moins dans les données de naissance (27 naissances). REF en a zéro.
Zéro naissance, quatorze mille porteurs, parité des sexes parfaite. Trois instruments orthogonaux, une seule réponse.
Ce que cela ne prouve pas
Quatre limites honnêtes, car cette méthode se prête facilement à la surinterprétation.
1. Nous ne pouvons pas voir le mécanisme. Le fichier montre qu'une valeur de remplissage est présente, et à peu près en quelle quantité. Il ne montre pas par où elle est entrée — auto-déclaration, saisie par un agent recenseur, enregistrement administratif ou étape de traitement. Nous savons que DOE a gagné environ un quart de million de porteurs entre deux recensements. Le fichier ne nous dit pas pourquoi, et nous ne l'avons pas deviné dans cet article.
2. Les six ne sont pas également certains. DOE à ×37,2 et REF à ×15,0 sont hors de discussion. CHILD à ×2,5, avec un L1 de 8,2, est le plus faible des six : Child est un authentique nom de famille anglais, ×2,5 est très loin de ×37, et un nom de famille réel dont les porteurs se trouvent être démographiquement moyens produirait honnêtement un L1 faible. NO est vraiment ambigu, dans l'autre sens — son profil montre 18,2 % dans la quatrième colonne contre 6,2 % au niveau national, ce à quoi on s'attendrait si un vrai nom de famille coréen (노) se mêlait à l'usage comme valeur de remplissage. Un filtre renvoie des candidats. Seuls les candidats aux extrêmes sont des conclusions.
3. Les deux signaux ont besoin d'un plancher. En dessous de quelques milliers de porteurs, les facteurs de croissance deviennent bruités, et les parts de profil plus bruitées encore. C'est pour cette raison que nous avons restreint le filtre aux 5 000 premiers. Le prolonger dans la queue produirait des dizaines de « touches » qui ne sont que de petits nombres qui bougent.
4. Ce n'est pas une critique du recensement. Un recensement enregistre ce que les répondants et les enregistrements fournissent. Publier DOE au #78 est plus honnête que de le supprimer en silence, et le fichier fournit exactement les colonnes auxiliaires qui permettent à un tiers de le détecter. Le défaut appartient à quiconque consomme le fichier sans le contrôler — ce qui, jusqu'à cette semaine, nous incluait.
La méthode, transposable à n'importe quel pays
Rien de ce qui précède n'exige de connaître quoi que ce soit des noms de famille américains. Chaque étape est de l'arithmétique sur le fichier, et chaque étape se généralise :
- Procurez-vous deux éditions du même fichier, à dix ans d'intervalle. Presque tout ce qui suit dépend du fait de disposer d'un avant.
- Calculez d'abord la distribution de la croissance, puis regardez les valeurs aberrantes. Le p99 vous dit ce que « impossible » signifie pour ce fichier. N'importez pas un seuil d'un autre pays.
- Trouvez les colonnes auxiliaires du fichier. Parts par race, répartitions par sexe, par région, par citoyenneté — tout ce qui varie d'un nom réel à l'autre. Cette colonne est votre lecteur d'empreintes.
- Calculez une distance aux totaux propres du fichier. Non pas à une estimation de population externe ; à la somme du fichier lui-même, qui est la seule référence garantie d'être sur le même pied que les lignes.
- Exigez deux signaux indépendants. L'un signale la migration. L'autre signale les noms d'origine mixte. Leur intersection est petite et propre.
- Testez les contrôles avant de croire aux touches. Donnez au filtre des noms dont vous savez qu'ils sont réels et vérifiez qu'ils en ressortent indemnes. Si
ROEetBLANKavaient obtenu des scores comparables àDOE, la méthode serait une reconnaissance de motifs, pas une mesure. - Croisez avec un second registre s'il en existe un. « Présent dans le recensement, absent du registre des naissances » est le test isolé le plus tranchant qui soit, et il coûte une jointure.
Le point inconfortable, c'est l'ampleur que cela prend. DOE n'est pas une curiosité de la queue. C'est le 78e nom de famille le plus répandu aux États-Unis, devant WARD, KELLY et COX, et il atterrira dans n'importe quelle tranche mécanique des 100 premiers que quiconque prélèvera de ce fichier. Le jeu de données de quelqu'un le contient en ce moment même, pondéré comme si un quart de million d'Américains étaient nés avec ce nom.
Données arrêtées au 2026-07-21
Chaque chiffre ci-dessus a été recalculé le 21 juillet 2026 directement à partir des fichiers primaires, et non repris de notes. Là où nos propres notes de travail antérieures divergeaient des fichiers, ce sont les fichiers qui l'ont emporté — voir la correction ci-dessous.
Sources :
- États-Unis — US Census Bureau, Frequently Occurring Surnames in the 2020 Census by Race and Hispanic Origin. 156 620 lignes publiées, plus la ligne agrégée
ALL OTHER NAMES; 298 870 618 porteurs recensés ; effectif publié le plus bas 92. Domaine public. <census.gov/topics/population/gene…; - États-Unis — US Census Bureau, Frequently Occurring Surnames in the 2010 Census. 162 254 lignes, 294 979 229 porteurs recensés, effectif publié le plus bas 100. Utilisé pour tous les chiffres de 2010. Domaine public.
- États-Unis — US Census Bureau, Frequently Occurring First Names in the 2020 Census by Sex. 53 616 lignes, 302 031 536 porteurs recensés, effectif publié le plus bas 91. Domaine public.
- États-Unis — Social Security Administration, données nationales de noms issues de l'enregistrement des naissances, utilisées uniquement comme contrôle de présence/absence (32 718 noms masculins et 55 399 noms féminins distincts dans le corpus construit à partir d'elles). Domaine public.
Une correction à notre propre note antérieure. Nos notes de session enregistraient DOE au #2 834, avec 11 603 porteurs en 2010, ce qui donnait un facteur de croissance de ×22,6. Recalculé à partir du fichier de 2010 lui-même, DOE est au rang #4 972, avec 7 066 porteurs, et le facteur est de ×37,2. La note était fausse sur les trois nombres et se trouve remplacée par cet article. La même revérification a fait passer REF comme nom de famille d'un chiffre tiré du fichier des prénoms (14 844) à son chiffre correct de nom de famille (10 563) — REF apparaît dans les deux fichiers, et ce sont deux effectifs différents de choses différentes.
À propos des colonnes de catégories du recensement. Le fichier des noms de famille de 2020 publie, pour chaque nom de famille, les effectifs absolus de porteurs par race auto-déclarée et origine hispanique. Dans cet article, ces colonnes sont utilisées exclusivement comme une empreinte permettant de distinguer une ligne assemblée d'une ligne observée, et n'étayent absolument aucune inférence sur les noms, l'ascendance ou les populations. La ligne ALL OTHER NAMES n'est utilisée que comme contrôle méthodologique.
Reproductibilité. Le filtre tient en quatre lignes d'arithmétique : joindre les deux fichiers du recensement sur le nom de famille, calculer count2020 / count2010, calculer la somme des différences absolues entre les six parts de catégorie de chaque ligne et les six totaux propres du fichier, puis trier. Pas de modélisation, pas de données externes, pas de seuils importés d'ailleurs.