Le problème du seuil de confidentialité dans les registres de noms
Vous cherchez un nom de famille dans un registre national et il n'y est pas.
Qu'avez-vous appris ? Selon le pays dont vous avez interrogé le registre, l'une de ces trois choses entièrement différentes : que le nom de famille a zéro porteur, qu'il a un certain nombre de porteurs que l'organisme ne vous communiquera pas, ou rien du tout. La cellule vide a exactement la même apparence dans les trois cas. Seule la règle de divulgation du registre les distingue, et cette règle réside ailleurs que dans le fichier de données.
Cela devient déterminant dès l'instant où vous agissez sur cette absence. Si l'absence signifie zéro, supprimer l'entrée est correct. Si l'absence signifie « sous le seuil », la supprimer détruit des données réelles. Mêmes éléments de preuve, même action, verdict opposé — tranché entièrement par une note de bas de page d'un document de politique.
Nous sommes tombés là-dessus en auditant les corpus de noms de famille de 63 locales le 17 juillet 2026 (64 aujourd'hui), et nous avons failli transférer une décision correcte d'un pays vers un autre où elle aurait été une erreur grave. Voici le tableau comparatif dont nous aurions voulu disposer à l'avance.
La comparaison
| Registre | Seuil | L'absence signifie | Peut-on nettoyer sur cette base ? |
|---|---|---|---|
| Taïwan, MOI | Aucun — publie des noms de famille à 1 porteur (643 d'entre eux) | Véritablement zéro | Oui |
| Danemark, DST | <3 supprimé, mais zéro est signalé séparément | Dépend du message | Par nom |
| Corée du Sud, KOSTAT | ≥5 porteurs ; le reste regroupé dans 기타 (« autres ») | Inconnu | Non |
| Espagne, INE | ≥20 porteurs (règle de confidentialité statistique) | Inconnu | Non |
| France, INSEE | ≥30 naissances 1891–2000 ; le reste regroupé sous AUTRES NOMS | Inconnu | Non |
| Ukraine | Aucun registre n'existe | Rien | Non |
| Lettonie | Aucun registre par nom de famille n'existe | Rien | Non |
Sept registres, quatre significations différentes pour la même case vide.
Le Danemark : le registre qui répond directement à la question
Le Danemark mérite la section la plus longue parce qu'il fait quelque chose qu'aucune autre source ici ne fait — il distingue les deux états explicitement, avec des mots. Danmarks Statistik exploite un oracle de noms : vous posez une question sur un nom de famille précis et vous obtenez l'une des deux réponses possibles.
| Réponse de DST | Ce que cela signifie | Action correcte |
|---|---|---|
Der er færre end 3 personer med efternavnet X | 1–2 porteurs existent ; l'effectif est masqué | Conserver, poids 1 |
Der er ingen personer med efternavnet X | Zéro porteur | Supprimer |
« Il y a moins de 3 personnes portant le nom de famille X » et « il n'y a aucune personne portant le nom de famille X » sont deux phrases différentes, et le Danemark est prêt à dire les deux. Cette seule décision de conception transforme un seuil de confidentialité, d'obstacle qu'il était, en arbitre nom par nom.
C'est pourquoi nous avons conservé Thurah et Vagn — tous deux tombent à l'intérieur de la bande de confidentialité, tous deux sont de vrais noms de famille danois portés par une ou deux personnes — et pourquoi nous avons supprimé Pedersgaard. Le registre ne se contente pas de ne pas répertorier Pedersgaard ; il affirme expressément que personne ne le porte. Cela en fait un fantôme, assemblé à partir d'un modèle plausible (Peders- + -gaard) plutôt qu'observé dans une population.
L'argument repose entièrement sur l'existence de deux messages. Si DST répondait færre end 3 pour zéro également — comme une lecture naïve de « supprimer les effectifs inférieurs à 3 » le laisserait entendre —, Pedersgaard serait indiscernable de Thurah et nous aurions dû le conserver. Le seuil aurait avalé la preuve. C'est la politique de divulgation, et non la valeur du seuil, qui rend les données danoises utilisables de cette manière.
Taïwan et la Corée du Sud : des images en miroir
Ces deux pays sont la raison d'être de cet article. Voisins, tous deux est-asiatiques, tous deux dotés de distributions de noms de famille concentrées, tous deux publiant des statistiques officielles détaillées — et de côtés opposés de ce problème, sans que rien dans l'apparence des données ne vous le signale.
Taïwan : aucun plancher
Le ministère de l'Intérieur de Taïwan publie 643 noms de famille comptant exactement un porteur et 406 en comptant deux — jusqu'à des noms d'origine japonaise comme 八谷 et 大久保, portés par une seule personne sur 23 millions. Il n'existe aucun plancher de confidentialité.
Cette propriété fait du registre un instrument de falsification. L'absence signifie zéro porteur, point final. Aussi, lorsque nous avons trouvé dans notre corpus taïwanais 33 noms de famille que le registre ne contient pas — 亓官, 漆雕, 巫馬, 段干, 百里, 東郭, 南門, 子車, 梁丘, 左丘, 東門, 西門, 南宮, 長孫, 宇文, 公孫, 萬俟, 聞人, 鍾離, 仲孫, 拓跋 et d'autres —, les supprimer était correct. Ils avaient été tirés du 百家姓, un texte classique du XIe siècle, et transportés dans un jeu de données censé décrire des personnes vivantes. Personne à Taïwan ne les porte.
La Corée du Sud : un plancher à cinq
Le recensement de KOSTAT ne publie que les noms de famille comptant cinq porteurs ou plus. Tout ce qui est plus rare est regroupé dans 기타 — « autres ». Un nom de famille coréen absent du tableau publié peut donc avoir quatre porteurs, ou deux, ou aucun, et le tableau ne peut pas vous dire lequel de ces cas s'applique.
La logique de suppression taïwanaise est donc invalide en Corée. Non pas « moins fiable » — invalide. Elle raisonne à partir d'une absence qui ne porte aucune information. Nous avons été à deux doigts de l'appliquer malgré tout, sur le fondement, tout à fait raisonnable en apparence, que nous venions de faire exactement cela, avec succès, dans un pays voisin doté d'un jeu de données d'aspect très similaire. La différence n'est pas dans les données. Elle est dans une règle de divulgation publiée ailleurs.
Et même à Taïwan, l'apparence ne décide de rien
La leçon la plus tranchante est venue de l'intérieur du pays où le nettoyage était permis. 澹臺 ressemble exactement aux 33 fantômes : un nom de famille composé archaïque tout droit sorti du 百家姓 — précisément le profil qui venait de nous faire supprimer 33 entrées. Il a atterri sur la liste de suppression à ce titre.
Il a 2 porteurs. Il figure dans le registre. Il est resté.
Il en va de même de 司徒 (478), 上官 (294), 端木 (186), 諸葛 (180), 皇甫 (115), 慕容 (1) et 呼延 (1) — tous d'aspect archaïque, tous réels. Or 歐陽 compte 7 653 porteurs et 東郭 zéro, et aucune expertise philologique, si grande soit-elle, ne les sépare à l'examen visuel.
Seul le décompte les distingue. Jamais l'apparence. Un registre sans plancher de confidentialité n'autorise pas le jugement à l'œil ; il autorise les recherches.
Là où rien n'existe : l'Ukraine et la Lettonie
Le troisième état — l'absence ne signifie rien — est le plus inconfortable à assumer.
L'Ukraine ne dispose d'aucun registre de noms de famille consultable pour vérification. Pas même un registre à seuil ; aucun. Les travaux universitaires publient un top 100 et s'arrêtent là. Nettoyer la queue des noms de famille ukrainiens se réduit donc à supprimer des entrées d'après leur sonorité, et nous avons mesuré cette heuristique : appliquée à des candidats délibérément retenus comme « les plus suspects », « sonne bizarrement » a produit un taux de faux positifs de 21 % — de vrais noms de famille portés par des personnes identifiables (un chanteur d'opéra, un ancien commandant en chef des forces armées, une famille de compositeurs) qui figurent dans la même queue que les véritables fabrications. Le contexte rend la chose inévitable : l'Ukraine compte 707 685 noms de famille uniques, avec 64 porteurs en moyenne chacun. Dans une distribution de cette forme, rare et bizarre est la norme, non un signal de défaut.
La Lettonie ajoute une variante qui mérite d'être signalée, parce qu'elle donne l'impression du cas inverse. La Lettonie publie bel et bien un oracle par nom interrogeable — en direct, à jour, exactement la forme de l'outil danois. Interrogez un nom de famille et vous obtenez un effectif.
Sauf qu'il s'agit d'une base de données de prénoms uniquement. Interrogez Ozoliņš, l'un des noms de famille les plus répandus du pays, et vous obtenez zéro ligne. Interrogez Ivanovs et vous obtenez trois personnes qui portent Ivanovs comme prénom. L'oracle répond à une autre question, avec aisance et sans sourciller — et un registre qui ressemble à l'outil dont vous avez besoin est plus dangereux qu'une absence évidente, parce qu'il renvoie un nombre et que ce nombre n'a aucun sens pour votre objectif.
La Lettonie rejoint donc l'Ukraine : pas de registre par nom de famille, l'absence ne signifie rien, nettoyage interdit.
Des catégories de service qui se font passer pour des noms
Un seuil doit bien mettre quelque part le reste supprimé, et l'endroit où il atterrit est généralement une ligne qui ressemble exactement à un nom.
| Registre | La catégorie | Ce que c'est | Où elle se situe |
|---|---|---|---|
| Taïwan, MOI | 其他 | « Autres » — le reste regroupé | Rang #147, effectif 5 174 |
| Corée du Sud | 기타 | « Autres » — tout ce qui est sous 5 porteurs | Dans le tableau des noms de famille |
| France, INSEE | AUTRES NOMS | Tout ce qui est sous 30 naissances, 1891–2000 | Dans le fichier national |
其他, au rang #147, est celle à laquelle il faut réfléchir. Elle n'est pas enfouie dans une queue où vous n'iriez jamais regarder. Elle se loge confortablement dans n'importe quelle tranche mécanique du type « prendre les 200 premiers », à une position plausible, formatée à l'identique de tous les vrais noms de famille qui l'entourent. Prenez une coupe top-N sans exclusion explicite et « autres » devient, dans votre jeu de données, le 147e nom de famille le plus répandu de Taïwan.
La Suède fournit la variante la plus étrange. Son registre de prénoms porte l'alphabet entier en guise de prénoms : M (305 porteurs), A (120), S (65), I (22), K (17), B (5), Z (3). Ce n'est pas une pratique de dénomination suédoise ; ce sont des enregistrements où seule une initiale a survécu. La preuve est structurelle plutôt qu'esthétique — les 26 lettres sont toutes présentes, ce qui n'est pas le comportement d'une distribution de noms.
Mais notez ce que cet argument n'autorise pas. Md (1 361 porteurs) n'est pas une lettre de l'alphabet ; c'est l'abréviation bangladaise, sur les passeports, de Muhammad, et 1 361 résidents de Suède l'ont enregistrée comme prénom d'usage légal. Il est resté. De même pour Thi (3 717) — dans un corpus vietnamien analysé automatiquement, cette chaîne est un artefact notoire, mais dans le registre suédois c'est un enregistrement délibéré. La règle qui attrape M ne doit pas attraper Md, et « ça ressemble à un artefact » ne permet pas de les distinguer.
De tels artefacts se propagent dans les corpus analysés automatiquement, non dans les registres légaux. Dans les données de fréquence vietnamiennes, Y se situe au rang 55 avec 0,092 % — et n'est pas du tout un nom de famille. C'est un titre honorifique masculin des peuples Ê Đê et Gia Rai, à peu près « M. ». La preuve est interne à la source : si Y était un nom de famille, les véritables noms de clan de ces peuples se situeraient près de lui. Or Niê est au rang #210 (0,005 %) et Rơ au #247. Y est dix-huit fois « plus fréquent » que le clan auquel il est censé appartenir, parce qu'un analyseur a pris le premier segment du nom de chaque homme Ê Đê et Gia Rai et l'a rangé sous « nom de famille ». La même source place Thị au #149 — un deuxième prénom féminin — ainsi que Ka au #123 et A au #129.
Les registres légaux sont structurellement immunisés contre cette classe d'erreurs : le champ est « le nom de famille figurant sur le document », il ne peut donc pas contenir un titre honorifique. Les corpus analysés automatiquement, eux, ne le sont pas. Savoir quel type de source vous avez entre les mains vous indique quels artefacts attendre.
Les seuils cachent aussi des choses qui ne sont pas des seuils
Certains registres excluent des populations entières, et cette exclusion n'est pas déclarée comme un seuil parce qu'elle n'en est pas un.
Le fichier de l'INSEE, en France, exclut les personnes nées à l'étranger — environ 10,7 % de la population française. Ce n'est pas une règle de confidentialité ; c'est une découpe systématique de la population de référence, et elle agit presque entièrement sur une seule couche. Des noms de famille comme Cissé ou Benali ne sont comptés qu'à travers les enfants de ces porteurs nés en France. Le fichier compte en outre des naissances, non des porteurs vivants — un second changement d'unité par-dessus le premier. La direction de l'erreur est connue ; son ampleur ne l'est pas, et multiplier par un coefficient deviné relèverait de l'ajustement, non de la correction.
Le registre lui-même montre l'arrivée de cette couche, par cohorte de naissance, pour 100 000 :
| Nom de famille | 1941–1950 | 1991–2000 | Variation |
|---|---|---|---|
TRAORE | 0,10 | 35,76 | ×358 |
DIALLO | 0,37 | 35,59 | ×96 |
NGUYEN | 3,76 | 55,35 | ×15 |
MARTIN | 359,65 | 280,93 | −22 % |
Le registre suédois des prénoms offre une seconde variété : il compte les porteurs vivants de tous âges, sans qu'aucune ventilation par âge ne soit disponible. Environ 20 % de sa masse sont des enfants de 0 à 17 ans, si bien que les prénoms à la mode depuis les années 2010 sont surestimés pour toute application réservée aux adultes, et que les prénoms dont les porteurs sont pour la plupart décédés sont sous-estimés. Direction connue, ampleur inconnue, aucune correction honnête disponible.
Ni l'un ni l'autre n'est un seuil de confidentialité. Les deux relèvent du même mode de défaillance : la population publiée n'est pas la population que vous avez supposée, et rien dans le fichier ne le dit.
Que faire de tout cela
- Trouvez la règle de divulgation avant de toucher aux données. Elle se trouve dans une note méthodologique, pas dans le fichier de données, et elle détermine ce que signifie une cellule vide.
- Établissez dans lequel des trois états vous vous trouvez. Absence = zéro (agissez en conséquence), absence = donnée supprimée (n'agissez pas), aucune source du tout (n'agissez pas, et dites-le).
- Préférez les registres qui signalent zéro séparément. La conception danoise à deux messages vaut plus qu'un seuil plus bas ne vaudrait. La valeur d'un seuil ne tient pas à son nombre ; elle tient à la possibilité de distinguer zéro d'une suppression.
- Ne transposez jamais une décision de nettoyage d'un pays à l'autre. Taïwan et la Corée se ressemblent et sont opposés. La décision appartient au registre, non à l'apparence des données.
- Excluez explicitement les catégories de service.
其他,기타,AUTRES NOMSet les initiales isolées ressemblent à des noms et survivent à toute coupe mécanique top-N. - Contrôlez l'unité et la population de référence, pas seulement le seuil. Naissances ≠ porteurs. Citoyens ≠ résidents. Tous âges ≠ adultes. Positions ≠ personnes.
- Quand rien n'existe, « pas de données » est le résultat. Nettoyer une queue d'après sa sonorité affiche un taux de faux positifs mesuré de 21 %. Ce n'est pas une heuristique ; c'est de la destruction de données assortie d'une histoire de couverture plausible.
Données arrêtées au 2026-07-17
Tous les comportements de registre décrits ici ont été observés le 17 juillet 2026 au cours de la construction de corpus pondérés de noms de famille pour les 63 locales que le corpus comptait à cette date ; en_IE a été ajoutée le 18 juillet 2026, portant l'ensemble à 64. Les seuils sont ceux publiés par chaque organisme à cette date. Le comportement danois à deux messages, les entrées taïwanaises à porteur unique, l'oracle letton limité aux prénoms et l'artefact vietnamien de titre honorifique ont chacun été vérifiés auprès de la source plutôt que déduits. Les lignes Ukraine et Lettonie sont des résultats négatifs — des tentatives répétées de localiser une source nationale de noms de famille consultable nom par nom n'en ont trouvé aucune disponible.
Sources :
- Taïwan, ministère de l'Intérieur — classements et effectifs des noms de famille par tranche d'âge, 30 juin 2023 (OGDL 1.0) : data.gov.tw/dataset/126774
- Danemark, Danmarks Statistik — statistiques de noms et recherche nom par nom : dst.dk/da/Statistik/emner/bor… · jeu de données ouvert des prénoms et noms de famille au Danemark : sprogteknologi.dk/dataset/fornavne-og-ef…
- Corée du Sud, KOSTAT — recensement de la population et des logements 2015, statistiques des noms de famille (인구주택총조사 성씨 통계) : kostat.go.kr
- Espagne, INE — noms de famille comptant ≥20 porteurs, recensement au 1er janvier 2025 ; note méthodologique sur la règle de confidentialité : ine.es/daco/daco42/nombyapel/…
- France, INSEE — Fichier des noms de famille 1891–2000 (≥30 naissances au niveau national ; reste regroupé sous
AUTRES NOMS) : insee.fr/fr/statistiques/353663… - Suède, SCB — noms de famille et prénoms d'usage tilltalsnamn, 31 décembre 2022 : scb.se
- Lettonie, PMLP — base de données des prénoms (noms de famille non couverts) : personvardi.pmlp.gov.lv · Lettonie, CSP — recensement de 2021 : stat.gov.lv
- Ukraine — aucun registre nom par nom disponible ; uniquement des listes universitaires du top 100
- Vietnam — jeux de données de fréquence hoten.org VNTH01 (n = 1 682 729) et SG01 (n = 241 000), CC BY 4.0 tel que déclaré dans le texte de la page ; pas un registre d'État