D'où proviennent nos données de noms taïwanais
Chaque poids de notre jeu de données de noms de famille taïwanais remonte à une ligne nommée d'un registre d'État, avec un nombre de porteurs inscrit juste à côté. Rien dans la tête de la distribution n'est modélisé, interpolé ni emprunté à un pays voisin. Cela n'est vrai d'aucune autre locale que nous maintenons, et il vaut la peine d'expliquer précisément ce que cela apporte — et ce que cela ne règle toujours pas.
Cette page documente le registre que nous avons utilisé, la frontière entre ce que nous avons mesuré et ce que nous avons estimé, les pièges propres à l'onomastique taïwanaise, et les choses que nous n'avons pas corrigées.
Le registre que nous avons utilisé
| Champ | Valeur |
|---|---|
| Jeu de données | 姓氏排名與人數按三階段年齡分 (Rang et population des noms de famille par trois tranches d'âge) |
| Éditeur | 內政部戶政司 — Département de l'enregistrement des ménages, ministère de l'Intérieur |
| Portail | https://data.gov.tw/dataset/126774 |
| Date de référence | 30 juin 2023 (民國112年6月30日) |
| Profondeur | 2 731 noms de famille distincts, chacun réparti sur 3 tranches d'âge (0–14, 15–64, 65+) |
| Champs | année statistique, rang, nom de famille, tranche d'âge, effectif de population |
| Licence | Government Open Data Licence v1 |
| Base de population | 23 373 283 |
Le rapport narratif qui l'accompagne — 《全國姓名統計分析》, 8e édition, publiée en octobre 2023 — donne les agrégats de tête : les 10 noms de famille les plus fréquents couvrent 12 339 778 personnes, soit 52,79 % de la population, et les 100 premiers en couvrent 22 582 375, soit 96,62 %.
L'écart entre 2 731 et 1 785
Le même ministère affirme que Taïwan compte 1 785 noms de famille : 1 667 noms de famille d'un seul caractère couvrant 23 337 790 personnes, plus 118 noms de famille composés couvrant 27 404 personnes. Ces deux chiffres, additionnés aux 8 089 personnes portant un nom traditionnel autochtone ou un nom étranger translittéré, donnent exactement la population nationale. Pourquoi, alors, le jeu de données ouvert comporte-t-il 2 731 lignes ?
Nous n'avons pas de réponse documentée ; le ministère ne publie aucun rapprochement. La lecture la plus plausible est que le décompte de 1 785 ne couvre que les catégories 單姓 + 複姓, tandis que le jeu de données brut liste le reliquat de 8 089 personnes sous forme de lignes individuelles — environ 946 chaînes de noms rares, avec moins de neuf porteurs chacune en moyenne. Arithmétiquement, cela se tient, mais nous ne l'avons pas vérifié ligne par ligne. L'énoncé honnête est le suivant : l'écart correspond probablement au bloc des noms autochtones et translittérés, et nous ne le savons pas avec certitude.
Ce que nous avons mesuré et ce que nous avons estimé
Mesuré. Chaque nom de famille du fichier, et chaque poids qui lui est attaché, provient du registre. Le poids est le nombre de porteurs du registre, stocké tel quel :
weight = count # 陳 → 2618994, not a rescaled 255
Aucune courbe de puissance, aucun ajustement fondé sur le rang, aucun jugement d'expert dans l'ordre. Notre ordre du top 10 — 陳, 林, 黃, 張, 李, 王, 吳, 劉, 蔡, 楊 — est l'ordre publié par le ministère, et non notre reconstruction de celui-ci.
Note historique. Jusqu'au changement de format, les poids étaient ramenés sur une échelle 8 bits par round(255 × count / count(陳)), ce qui introduisait un plancher d'arrondi : un poids de 1 valait 2 618 994 / 255 = 10 271 porteurs, si bien que tout nom de famille en dessous se trouvait surreprésenté. Cela imposait un seuil de profondeur situé autour de 2 000 porteurs, soit 401 entrées. Les deux contraintes ont disparu : le fichier porte désormais des effectifs réels et livre le corpus complet. Les chiffres issus d'anciens builds — 401 noms de famille, poids 255 pour 陳 — renvoient à ce format remplacé, et c'est pourquoi ils ne correspondent à rien de ce que vous pouvez calculer à partir du fichier livré aujourd'hui.
Estimé. Rien dans les poids. Le seul jugement qui subsiste porte sur les lignes à exclure comme inutilisables (voir ci-dessous), non sur la façon de noter les lignes que nous conservons.
Pas estimé du tout : la répartition par âge. Le registre ventile chaque nom de famille sur trois tranches d'âge, et nous les agrégeons. Notre fichier ne porte aucune structure d'âge.
Pièges propres à Taïwan
Il n'y a pas de seuil de confidentialité — l'absence signifie donc réellement zéro
La plupart des instituts statistiques suppriment les petits effectifs. Taïwan, non. Le registre publie 643 noms de famille comptant exactement un porteur et 406 en comptant deux, jusqu'à des noms d'origine japonaise comme 八谷 et 大久保, portés par une seule personne sur 23 millions.
Cela change ce que le registre permet de faire. Dans la plupart des pays, un nom de famille absent des données officielles peut être rare, peut avoir été supprimé, peut être une erreur de données — impossible de trancher. À Taïwan, absent signifie zéro porteur, un point c'est tout.
Nous nous en sommes servis. Notre liste antérieure contenait 33 noms de famille tirés du 百家姓, l'abécédaire des Cent Noms de Famille du XIe siècle — 亓官, 漆雕, 東郭, 南門, 段干, 百里, 公孫, 萬俟 et d'autres. Chacun d'eux compte zéro porteur à Taïwan. Ils y figuraient parce que la liste avait été construite à partir d'un texte classique et non d'une population vivante. Ils ont disparu.
Mais 澹臺 est resté, et c'est là toute la leçon
澹臺 est un nom de famille archaïque à deux caractères issu du même abécédaire, installé dans le même voisinage sémantique que les fantômes et impossible à distinguer d'eux. Il figurait sur notre liste de suppression. Il est dans le registre avec deux porteurs vivants : il est donc resté.
Rien dans son apparence ne le distingue de 東郭. Seul le compteur le fait. Il en va de même pour 歐陽 (7 653), 司徒 (478), 上官 (294), 端木 (186), 諸葛 (180), 皇甫 (115), 慕容 (1) et 呼延 (1) — tous réels, tous conservés. Un registre n'est pas un moyen de confirmer ce que l'on soupçonnait déjà ; c'est un moyen de s'entendre dire que l'on avait tort sur une ligne précise.
C'est aussi pourquoi le nettoyage taïwanais n'autorise pas le même nettoyage ailleurs. L'Ukraine n'a pas de registre des noms de famille : y supprimer des noms de famille ukrainiens d'apparence étrange serait une suppression à l'intuition. La différence tient au compteur, non à l'évidence du défaut.
異體字 : les graphies variantes sont des noms de famille différents, et le registre le prouve
L'enregistrement des ménages taïwanais consigne la forme écrite, et plusieurs noms de famille existent en plus d'une variante orthographique légale (異體字) : 温/溫, 黄/黃, 鐘/鍾, 凃/涂/塗, 藍/籃, 龎/龐.
La règle tentante est : « Taïwan utilise les caractères traditionnels, donc on garde 溫 et on écarte 温. » Le registre tue cette règle avec un seul chiffre : 温 a 42 171 porteurs et 溫 en a 13 956. La forme prétendument fautive est trois fois plus fréquente. Appliquer la règle supprimerait 42 000 citoyens réels et en garderait 14 000.
Il ne s'agit pas de simplifications continentales, mais de variantes légales dans le 戶籍 taïwanais ; la ressemblance avec les formes simplifiées est fortuite, car la simplification a souvent repris une variante existante. Les rapports jouent dans les deux sens : 黃 1 402 808 contre 黄 34 531 et 鍾 152 550 contre 鐘 28 759 favorisent la forme traditionnelle, mais 龎 2 099 contre 龐 1 171 est inversé. Il n'y a pas de règle. Il n'y a que le tableau. Nous conservons les deux formes de chaque paire.
Par ailleurs, 丘 (4 361) et 邱 (343 469) ne sont pas du tout des variantes, mais des noms de famille distincts — 邱 est né de 丘 sous l'interdit Qing frappant le prénom de Confucius, 孔丘.
其他 n'est pas un nom de famille
Le rang 147 du registre est 其他 — « autre » — avec 5 174 personnes. C'est une catégorie de service, et tout traitement mécanique du type « prendre les N premiers » l'avale et produit un jeu de données dans lequel 5 174 Taïwanais s'appellent « Autre ». Nous l'avons exclue explicitement.
La tête n'est pas celle de la Chine
Quiconque importe les hypothèses continentales se trompe sur Taïwan. 陳 est en tête avec 11,21 %, 林 est deuxième avec 8,33 %, et 王 — le nom de famille le plus courant en Chine continentale — n'est qu'au rang 6, avec 4,09 %. Ce sont des populations différentes, avec des histoires différentes, et non des dialectes d'une unique liste « chinoise ».
Pourquoi nous ne nous arrêtons plus à 401 noms de famille
La profondeur avait autrefois un prix mesurable. Parce qu'un poids de 1 valait 10 271 porteurs, chaque entrée située sous ce seuil se surestimait elle-même. La somme de la population implicite sur l'ensemble du fichier donne un chiffre de « couverture revendiquée », et sous l'échelle 8 bits c'était une contrainte dure — voici le tableau qui justifiait le seuil dans le build du 17 juillet 2026 :
| Seuil de profondeur | Entrées | Couverture revendiquée | Couverture réelle |
|---|---|---|---|
| ≥ 2 000 | 401 | 109,8 % | 99,61 % |
| ≥ 1 000 | 414 | 110,3 % | 99,69 % |
| ≥ 500 | 440 | 111,5 % | 99,76 % |
| ≥ 100 | 579 | 117,6 % | 99,90 % |
| registre entier | 2 730 | 212,1 % | 100,00 % |
Charger les 2 730 noms de famille sur cette échelle aurait produit un jeu de données revendiquant deux Taïwan : le problème était la masse fantôme de la queue, non sa longueur.
Cette contrainte n'existe plus. Avec des effectifs de porteurs réels, il n'y a ni plancher d'arrondi ni masse fantôme, donc aucune raison de tronquer. Le fichier livré porte l'ensemble des 2 707 noms de famille exploitables, dont les poids totalisent 23 367 536 pour une base de population de 23 373 283 — une couverture revendiquée de 99,98 %, qui est tout simplement la couverture réelle, puisque revendiquée et réelle sont désormais la même mesure. Le tableau ci-dessus est conservé parce que des documents plus anciens en citent les chiffres ; il décrit un format que nous ne livrons plus.
⚠ Notre suite de tests de régression affiche 99,9 %, et non 99,98 %, et il s'agit là d'un troisième dénominateur plutôt que d'une quatrième erreur. ng_regression_tests.php divise par une estimation arrondie de la population actuelle, 23 400 000, alors que cette page divise par la base propre au registre, 23 373 283. La ligne de la suite — 52.81% top-10-in-corpus · 99.9% coverage · 52.73% product — est cohérente en interne sur cette base ; rapportée à la base du registre, la même identité se lit 52,81 % × 99,98 % = 52,79 %, soit la part du top 10 publiée par le registre. Aucune des deux n'est fausse ; ce qui est faux, c'est de rapporter l'une au dénominateur de l'autre.
L'asymétrie qui régissait l'ancien build était délibérée : nous n'ajoutions rien en dessous de 2 000 porteurs, mais nous ne supprimions pas non plus des entrées réelles déjà présentes (慕容 1, 通 1, 澹臺 2). L'ajout était limité par l'échelle ; supprimer quelque chose de réel n'a jamais été envisagé. Aujourd'hui, plus rien n'est limité par l'échelle, et la règle se réduit à sa seconde moitié.
Top 10
| Rang | Nom de famille | Porteurs (= poids stocké) | Part de la population |
|---|---|---|---|
| 1 | 陳 | 2 618 994 | 11,21 % |
| 2 | 林 | 1 947 520 | 8,33 % |
| 3 | 黃 | 1 402 808 | 6,00 % |
| 4 | 張 | 1 239 880 | 5,30 % |
| 5 | 李 | 1 199 920 | 5,13 % |
| 6 | 王 | 955 035 | 4,09 % |
| 7 | 吳 | 935 684 | 4,00 % |
| 8 | 劉 | 737 607 | 3,16 % |
| 9 | 蔡 | 684 531 | 2,93 % |
| 10 | 楊 | 617 799 | 2,64 % |
Chaque effectif ci-dessus est le chiffre du registre, stocké tel quel dans le fichier livré — il n'y a plus d'étape de reconstruction, et aucune ligne n'a besoin d'un ~. Les parts sont calculées sur la base de population de 23 373 283 et peuvent s'écarter de ±0,02 point de pourcentage de l'arrondi propre au ministère.
52,79 % et 52,81 % sont deux mesures différentes
Ces deux chiffres apparaissent partout dans notre documentation et ils ne constituent pas une divergence. Ce sont les dix mêmes noms de famille rapportés à deux dénominateurs différents :
| Chiffre | Dénominateur | Noms de famille | Porteurs |
|---|---|---|---|
| 52,79 % | Le registre complet du ministère, tel que publié | 2 731 | 23 373 283 |
| 52,81 % | Notre corpus, après exclusion des lignes inutilisables | 2 707 | 23 367 536 |
L'écart est de 24 lignes et 5 747 porteurs — 0,0246 % de la population — et nous savons exactement de quelles lignes il s'agit : la catégorie de service 其他 (5 174 porteurs, pas un nom de famille) plus 23 lignes situées dans la zone à usage privé d'Unicode (Private Use Area), où le ministère encode des caractères rares dépourvus d'attribution Unicode et qui s'afficheraient comme des carrés vides pour tout lecteur.
Retirer une fine tranche de la queue laisse le top dix intact tout en réduisant le dénominateur : notre part ressort donc marginalement plus élevée. Calculé à partir du fichier de poids livré : les dix premiers totalisent 12 339 778, soit 52,8074 % de notre corpus et 52,7944 % de la base complète du registre. La formulation correcte est donc « le registre donne 52,79 % ; notre corpus, après exclusion de 24 lignes inutilisables, donne 52,81 % » — jamais « environ 52,8 % », car c'est ainsi qu'une divergence réelle se cacherait.
Limites connues
- L'écart 2 731 / 1 785 reste inexpliqué. Notre lecture est plausible et non vérifiée.
- 24 lignes du registre sont exclues — la catégorie de service 其他 plus 23 lignes de la Private Use Area. C'est là tout ce que nous écartons : 5 747 porteurs, 0,0246 % de la population. La troncature de profondeur qui retirait autrefois ~2 330 noms de famille de la queue a disparu.
- La queue est désormais livrée en pleine précision, et c'est un changement de nature. Sous l'échelle 8 bits, tout ce qui se situait entre 2 000 et 10 271 porteurs s'effondrait sur le poids 1 et se surestimait jusqu'à ~5×. Les effectifs réels suppriment entièrement la distorsion ; tout document décrivant ce plancher décrit l'ancien format.
- La structure par âge est écartée. Le registre la possède ; nous ne l'utilisons pas. 郭 est le nom de famille le plus vieillissant de Taïwan (indice de vieillissement 158,64) et nos données ne peuvent pas exprimer cela.
- L'identité top 10 × couverture n'est pas une vérification. Multiplier notre part du top 10 dans le corpus par la couverture revendiquée du corpus reproduit la part du top 10 au niveau de la population, et le fait quel que soit le contenu du fichier : les deux membres sont calculés à partir des mêmes poids, si bien que l'identité se réduit à
(a/b) × (b/c) = a/c, vraie pour n'importe quelles entrées. Notre suite de tests de régression porte cela comme sortie informative assortie d'un PASS fixe, et non comme un test. Les poids proviennent de ce registre : s'accorder avec lui prouve l'arithmétique, pas la vérité.
Données arrêtées au 2026-07-18
Date de référence du registre : 30 juin 2023. Jeu de données revu et reconstruit pour la dernière fois le 18 juillet 2026. Corpus : 2 707 noms de famille portant des effectifs de porteurs réels et couvrant 99,98 % de la population taïwanaise. Les fichiers des porteurs masculins et féminins sont identiques octet pour octet — les noms de famille taïwanais ne varient pas selon le genre.
⚠ Les chiffres issus des builds plus anciens ne correspondent pas à cette page. Les documents rédigés avant le 18 juillet 2026 décrivent un corpus de 401 noms de famille sur une échelle de poids 8 bits, en citant 99,61 % de couverture, 109,8 % de couverture revendiquée et un top 10 dans le corpus de 48,14 %. Ces chiffres étaient corrects pour ce format et sont faux pour le fichier livré. Les équivalents actuels sont 2 707 noms de famille, 99,98 % de couverture et un top 10 dans le corpus de 52,81 %. Vérifié sur le fichier de poids livré le 18 juillet 2026.