D'où viennent nos données de noms chinois
Demandez quel nom de famille est le plus répandu en Chine et vous obtiendrez une réponse assurée que les données n'étayent pas. 王 et 李 diffèrent de 0,06 point de pourcentage — environ 800 000 personnes sur 1,3 milliard, soit largement à l'intérieur du bruit d'un instantané du registre des ménages. « Le nom de famille le plus répandu en Chine » est une question sans réponse qui ait du sens, et la première chose qu'un jeu de données honnête doit faire, c'est cesser de prétendre le contraire.
Cette page documente la source de nos poids de noms de famille chinois, ce que nous avons pu mesurer et ce que nous n'avons pas pu, ainsi que le grand trou au milieu des données publiées que nous avons délibérément choisi de ne pas combler par de l'invention.
Le registre utilisé
| Champ | Valeur |
|---|---|
| Source | 全国户籍人口姓氏统计 — analyse nationale des noms de famille issue du registre des ménages |
| Éditeur | 公安部治安管理局 — Bureau de l'administration de la sécurité publique, ministère de la Sécurité publique |
| Date de référence | avril 2007 |
| Profondeur publiée | Top 100 des noms de famille avec parts de population |
| Sous le rang 100 | Rien. Aucune table publiée n'existe. |
| Base | Registre des ménages (户籍), pas un échantillonnage de recensement |
Valeurs d'ancrage publiées sur lesquelles nous nous appuyons :
- 王 — 92 881 000 personnes, 7,25 %
- 李 — 92 074 000 personnes, 7,19 %
- 张 — 87 502 000 personnes, 6,83 %
- Top 10 : 王, 李, 张, 刘, 陈, 杨, 黄, 赵, 吴, 周 — chacun au-dessus de 20 millions ; 42,9 % au total
- Top 100 : 84,77 % de la population
Ce que nous avons mesuré et ce que nous avons estimé
Mesuré. Les rangs 1–100, et par extension la forme de la tête. Les poids sont une remise à l'échelle linéaire des parts publiées, calée sur 王 :
weight = round(255 × share / 7.25)
Il y a ici un détail inhabituel sur lequel nous tenons à être transparents. Lorsque nous avons audité la tête existante du fichier face à la table de 2007, nous nous attendions à trouver des valeurs ajustées et nous avons trouvé à la place des valeurs de registre : 23 des premières entrées s'écartaient de moins de 2 % (seul 黄 s'en écartait de 4 %). Le plateau au sommet — 王 255, 李 252, 张 240 — n'a pas été construit pour paraître plat. Il découle des parts réelles. Le réétalonnage de 2026 a remis à l'échelle les rangs 1–157 ; il ne les a pas recalculés à partir de la source.
Estimé — et nous voulons être francs là-dessus. Les rangs 158–460 sont tous posés sur un poids de 1, et c'est faux d'un facteur d'environ 50. Voir ci-dessous.
Pièges propres à la Chine
Le top 5 est un plateau, pas un classement
王 7,25 %, 李 7,19 %, 张 6,83 %. L'écart entre le premier et le deuxième est de 0,06 pp. Le registre des ménages n'est pas un recensement ; il accuse un retard sur la migration, les radiations et les déclarations de naissance, avec des marges confortablement supérieures à 0,06 pp.
Donc : 王, 李 et 张 forment un plateau. Tout jeu de données, article ou infographie qui présente « #1 王 » comme un fait surinterprète la source. Nos poids préservent le plateau parce que le plateau est ce que dit la mesure. Que des rangs voisins soient quasi égaux n'est pas une erreur à lisser — c'est le constat.
La même prudence vaut plus bas dans la liste. 赵, 吴 et 周 se retrouvent tous sur le poids 71 dans notre fichier, ce qui signifie que nos données ne peuvent pas les ordonner. Le registre le peut, tout juste — 赵 2,06 %, 周 2,02 %, 吴 2,00 %. Sur une échelle en nombres entiers, cela fait un seul et même nombre.
公安部 et 袁义达 ne comptent pas de la même façon — et aucun des deux n'a tort
C'est le piège qui produit deux classements « officiels » contradictoires des noms de famille chinois.
L'analyse du MPS de 2007 compte 萧 et 肖 séparément, de même que 戴/代 et 傅/付. Les classements largement cités du démographe 袁义达 les fusionnent, au motif que la scission est un artefact de la simplification des caractères au XXe siècle et de substitutions administratives, et non une véritable division de lignées.
Les deux positions se défendent. Elles produisent des ordres de rangs différents, et les listes qui en dérivent ne peuvent pas être raboutées. La nôtre suit la convention du MPS parce que nos poids proviennent de la table du MPS, et mélanger les conventions à l'intérieur d'un même jeu de données, c'est ainsi qu'on finit par compter un nom de famille une fois et demie.
Les lecteurs de notre page sur Taïwan reconnaîtront la même configuration : le registre taïwanais compte 温 et 溫 séparément parce qu'il enregistre des formes écrites. Même phénomène sous-jacent, réponse institutionnelle différente, et dans les deux cas la convention de la source l'emporte sur notre intuition de ce qui « devrait » ne faire qu'un seul nom de famille.
Il n'existe pas de table publiée pour les rangs 100–300 — nous n'en avons donc pas inventé
Voici le trou, assumé, au milieu de nos données chinoises.
Le MPS publie le top 100 (84,77 %). Les travaux de 袁义达 de 2006 publient une tranche — « 129 noms de famille à ≥0,1 % représentent 87 % » — qui est un agrégat, pas une table rang par rang. La seule source systématique pour les rangs 100–300 est l'ouvrage 《中国姓氏·三百大姓》 (袁义达 / 邱家儒, 2007), dont nous ne disposions pas.
Les rangs 158–460 de notre corpus portent donc tous le poids 1. C'est factuellement faux, et nous savons exactement à quel point. Sur ce plancher commun se côtoient 欧阳, avec environ un million de porteurs, et 壤驷 / 漆雕 / 澹台, avec quelques milliers chacun. Le rapport réel est de l'ordre de 50:1 ; nos données disent 1:1. Pire encore, ces entrées sont ordonnées selon leur séquence dans l'abécédaire 百家姓, et non par fréquence — cette section du fichier est une liste, pas une courbe.
Nous aurions pu interpoler sur cet intervalle une courbe de puissance d'apparence plausible. Elle aurait eu meilleure allure et aurait été fabriquée. Le manque est réel, il est documenté, et le remède est l'ouvrage, pas une formule.
La couverture face au chiffre du fichier
Notre corpus compte 460 noms de famille et couvre environ 91 % de la population. Cela explique aussitôt un chiffre que l'on cherche à « corriger » : la part du top 10 à l'intérieur de notre fichier est de 42,3 %, et non de 42,9 %. Des dénominateurs différents — 42,9 % est une part de l'ensemble des Chinois, 42,3 % est une part d'un fichier qui ne contient pas tous les noms de famille chinois.
La cible honnête à l'intérieur du fichier est 42,9 % ÷ 91 % ≈ 47 %, et nous ne l'atteignons pas. 42,3 % est le plafond, pas un déficit : le top 10 (1 496 unités de poids) et les rangs 11–157 (1 742 unités) sont arrimés à des parts de registre réelles, et les 303 entrées de queue ne peuvent pas peser moins de 1 (=303 unités). Tout chiffre supérieur à 42,3 % exige de sous-estimer les rangs 11–157 — c'est-à-dire de mentir à leur sujet pour qu'un agrégat ait l'air juste.
Le contrôle qui nous a pris en défaut
Un diagnostic mérite d'être publié parce qu'il est transposable. Si un poids de 1 correspond à share(top1) / 255 de la population, alors la somme de tous les poids, multipliée par cette valeur, indique quelle population le fichier prétend décrire :
claimed coverage = sum(weights) × share(top1) / max(weight)
Avant le réétalonnage de 2026, notre fichier chinois prétendait couvrir 114 % de la Chine. C'est arithmétiquement impossible, et cela a prouvé que la queue était surpondérée sans qu'il faille juger quelles entrées semblaient fausses. Après réétalonnage, il en revendique 100,7 %.
Top 10
| Rang | Nom de famille | Poids | Porteurs | Part de la population |
|---|---|---|---|---|
| 1 | 王 | 255 | 92 881 000 | 7,25 % |
| 2 | 李 | 252 | 92 074 000 | 7,19 % |
| 3 | 张 | 240 | 87 502 000 | 6,83 % |
| 4 | 刘 | 189 | > 20 000 000 | ~5,37 % |
| 5 | 陈 | 158 | > 20 000 000 | ~4,49 % |
| 6 | 杨 | 107 | > 20 000 000 | ~3,04 % |
| 7 | 黄 | 82 | > 20 000 000 | ~2,33 % |
| 8 | 赵 | 71 | > 20 000 000 | 2,06 % |
| 9 | 吴 | 71 | > 20 000 000 | 2,00 % |
| 10 | 周 | 71 | > 20 000 000 | 2,02 % |
⚠ Ce qui est mesuré et ce qui relève de l'arithmétique. Les rangs 1–3 sont des effectifs et des parts publiés. Les rangs 4–7 affichent des parts reconstruites à partir du poids stocké — le fichier conserve un poids entier, et non la part d'origine, si bien qu'elles ne sont récupérables qu'à l'arrondi près. Les rangs 8–10 affichent les parts publiées, ce qui explique qu'ils ne soient pas dans l'ordre des poids : le fichier ne peut pas séparer 2,00 % de 2,06 %. Le MPS indique seulement que chacun des dix premiers dépasse 20 millions de porteurs ; les effectifs par nom de famille sous le rang 3 ne figurent pas dans le résumé publié que nous avons utilisé.
Notez que la reconstruction tire légèrement vers le bas : nos poids, une fois reconvertis, donnent un top 10 à ~42,5 % contre les 42,9 % publiés, et un top 100 à 84,0 % contre les 84,77 % publiés. Ce déficit de ~0,8 pp est de l'arrondi entier qui s'accumule sur 100 entrées, toujours dans le même sens.
Limites connues
- Les rangs 158–460 sont plats et non ordonnés. Le défaut le plus grave de cette locale. ~50:1 de variation réelle comprimés en 1:1, séquencés selon un abécédaire classique plutôt que par fréquence. Corrigeable uniquement en se procurant 《中国姓氏·三百大姓》.
- Les données datent de 2007. Dix-neuf ans. Le MPS a publié des rapports plus récents (《二〇二〇年全国姓名报告》, 《二〇二一年全国姓名报告》), mais ils ne comportent pas de table équivalente des parts du top 100 complet, aussi n'avons-nous pas changé de source. Pour donner l'échelle : le rapport de 2020 chiffre le top 5 à 30,8 % de la population enregistrée ; notre tête calibrée sur 2007 implique 31,1 %. C'est un signal de stabilité temporelle émanant de la même administration — un indice que la distribution a à peine bougé — et explicitement pas une confirmation indépendante que nos chiffres sont justes.
- Le top 10 ne peut pas être ordonné par nos données en dessous du rang 3. Et il ne devrait pas l'être, à vrai dire. Voir la section sur le plateau.
- La couverture est de ~91 %. Les ~9 % restants de la population portent des noms de famille absents de notre fichier.
- Le registre des ménages n'est pas un recensement. Le 户籍 accuse un retard sur la résidence effective. Le sens de l'erreur est connu ; son ampleur ne l'est pas.
- La fusion des formes simplifiées et variantes suit la convention du MPS. Si vous avez besoin de la convention de 袁义达, notre fichier n'est pas le bon.
- Le contrôle de cohérence du top 100 n'est pas une vérification. 83,4 % à l'intérieur du fichier × 100,7 % de couverture revendiquée = 84,0 % contre les 84,77 % publiés, c'est un contrôle de cohérence interne face à la source même dont proviennent les poids. Il montre que la courbe est arithmétiquement cohérente au-delà de la tête. Il ne peut pas montrer qu'elle est vraie.
Données arrêtées au 2026-07-17
Date de référence du registre : avril 2007. Jeu de données réétalonné : 17 juillet 2026 (top 10 dans le fichier 37,3 % → 42,3 % ; couverture revendiquée 114 % → 100,7 %). Corpus : 460 noms de famille couvrant ~91 % de la population. Les fichiers masculin et féminin sont identiques octet pour octet — les noms de famille chinois ne varient pas selon le genre.