Category:

Самые распространённые фамилии и имена в Албании 2008

Достал тут данные гражданского реестра, когда-то кем-то куда-то слитые, и поколдовал над ними. НЯП, это на конец 2008 года, причём тогда в нём было более 4,2 млн записей (при 2,9 млн фактического населения).
Собственно, данные очень низкокачественные, но для оценочных прикидок очень полезные, особенно если их подчистить по мере возможности. Ибо кроме традиционной албанской фишки - огромного количество неточностей, опечаток и ошибок в целом, их особенность в том, что по меньшей мере 4% записей имеют признаки дублирования. Однако далеко не все из них являются дублями по всем параметрам - где-то разница обусловлена ошибками в написании, где-то это разные люди-близнецы, а то и вовсе совсем разные люди. Потому пару десятков тысяч записей пришлось анализировать в полуручном режиме, отсеяв в итоге всё явно лишнее.
Большой плюс в том, что указана и национальность, но кроме греков и македонцев, из нацменьшинств никто не выделен. Меньшинство (около 20%) арумын записаны румынами, причём раскиданы они неравномерно относительно реального расселения. Остальные - всевозможные иностранцы, расфасованные по принципу граданства и коих всех по чуть-чуть. Из реальных микроменьшинств под подозрением разве что итальянцы, евреи и 30 армян, но они никакого статистического интереса не представляют.
В общем, там где греков чуть больше чем кот наплакал, выделил их отдельно. Где их весомое меньшинство, там выделил ещё и албанцев.
По районам данные разделены автоматом - там была соответствующая отдельная колонка. А вот с более подробной географией - бардак. Любопытно, что внутри городов есть разделение по микрорайонам и адресам, но видимо хаотичное. В общем, адо очень долго разбираться вручную, но, возможно, дойдут руки и до этого.
И как сказано выше, к реальной носителей цифры не имеют отношения, от них надо отнимать плюс-минус треть.
Фамилии-имена с отличиями в написании не объединялись, ибо для этого нужен ручной анализ, который затянется на <дохрена времени>. Т.е. они все отсеяны в таком порядке автоматически, и где-то это повлияло даже на первое место (скажем, где-то в тридцатке все три возможных варианта указания имени Диля, которые однозначно выводят его в лидеры с отрывом, а где-то могли бы подняться Александр и прочие имена с ë/e, указываемыми "по настроению").
Выводы и наблюдения расписывать не стану - кому тема интересна, и так их сделает при беглом анализе глазами:)