← Digital Economy Lab · все материалы← Digital Economy Lab · all work
1 904 муниципалитета как сеть по безналичным расходам СберИндекса. Если соединять похожие по уровню и структуре расходов, получаются типы локальных экономик. Если соединять те, чьи расходы движутся вместе, разбиение оказывается сильно связано с географией, хотя ни региона, ни координат в данных нет.1,904 Russian municipalities as a network built from SberIndex card-spending data. Link those with similar spending levels and mix, and you get types of local economies. Link those whose spending moves together, and the partition turns out to be strongly geographic, although the data contain neither regions nor coordinates.
Согласие разбиения по сходству и разбиения по совместному движению (ARI, из 1). Две разные сети, и каждая воспроизводится на подвыборках.Agreement between the similarity partition and the co-movement partition (ARI, out of 1). Two different networks, each reproducible on subsamples.
Доля рёбер совместного движения внутри одного региона против случайных пар МО одного типа, без Москвы и Петербурга. Медиана расстояния между соседями — 611 км против 1 471 у случайных пар.Share of co-movement edges within one region vs random pairs of municipalities of the same type, Moscow and St Petersburg excluded. Median neighbour distance 611 km vs 1,471 for random pairs.
МО меняют тип за месяц, в зависимости от режима кластеризации. Заметный нетто-поток один — из районов в региональные города.of municipalities change type in a month, depending on the clustering mode. The one visible net flow is from districts into regional cities.
Ошибка прогноза от общего фактора типа против фактора страны. Типы различаются уровнем, структурой и местом, а не ритмом.Forecast error using the type's common factor instead of the national one. Types differ in level, mix and place, not in rhythm.
Основное разбиение строится на гибридной сети: ребро есть, если МО похожи по уровню и структуре расходов или их расходы движутся вместе. Алгоритм Leiden находит четыре типа. Названия — интерпретация автора; цифры ниже позволяют назвать их иначе.The main partition uses a hybrid network: an edge exists if two municipalities are similar in spending level and mix or if their spending moves together. The Leiden algorithm finds four types. The names are the author's reading; the figures below let you name them otherwise.
Медианы по МО типа, декабрь 2024 года (среднее за октябрь–декабрь). Расходы — безналичные, в рублях в определении СберИндекса. «Прочее» — остаток «Всех категорий» после пяти выделенных.Medians across the type's municipalities, December 2024 (October–December average). Spending is card spending in rubles as defined by SberIndex. "Other" is what remains of "All categories" after the five named ones.
Маркетплейсы выпадают из логики «чем богаче, тем меньше обязательных трат»: их доля выше всего в районах. Растут они быстрее там, где их доля ниже: годовой индекс расходов на маркетплейсах у медианного МО Севера и Дальнего Востока в конце 2024 года примерно в 1,12 раза выше, чем у типичного МО, у столичного — в 0,90 раза. Прирост в разбиении не участвует, но связан с уровнем расходов, который участвует, так что это наблюдение не вполне независимо от построения.Marketplaces break the "richer means fewer necessities" pattern: their share is highest in districts. They grow faster where their share is lower: at the end of 2024 the year-on-year marketplace spending index of the median North and Far East municipality was about 1.12 times that of a typical municipality, and 0.90 times in the capitals. Growth is not used for clustering but correlates with spending level, which is, so this is not fully independent of the construction.
Сеть пересобирается каждый месяц 2024 года. Если кластеризовать каждый месяц с нуля, тип меняют 5,9 % МО в месяц; если начинать с разбиения прошлого месяца — 1,9 %. Два запуска на одном и том же снимке с разными зёрнами расходятся на 1,7 %. Старт с прошлого разбиения по построению держится за него, поэтому реальная смена типа лежит где-то между этими оценками. В декабре при пересчёте с нуля столичный тип распадается на Москву и Петербург; старт с прошлого месяца этот распад не видит.The network is rebuilt for every month of 2024. Clustering each month from scratch, 5.9% of municipalities change type per month; starting from last month's partition, 1.9% do. Two runs on the same snapshot with different seeds disagree on 1.7%. A warm start holds on to the previous partition by design, so the true rate of type change lies somewhere between these estimates. In December, re-clustering from scratch splits the capital type into Moscow and St Petersburg; the warm start does not see this split.
Режим со стартом с прошлого месяца. Полосы — помесячный состав типов; потоки — МО, сменившие тип между соседними месяцами. Январь к декабрю: из районов в региональные города 56 МО, обратно 9; помесячно переходы идут в обе стороны.Warm-start mode. Bars show each type's monthly membership; ribbons show municipalities that changed type between consecutive months. January to December: 56 moved from districts into regional cities, 9 back; month to month, moves go both ways.
Признаки соседних снимков считаются по перекрывающимся окнам, поэтому часть устойчивости механическая.Features of neighbouring snapshots use overlapping windows, so part of the stability is mechanical.
В выгрузке СберИндекса нет ни региона, ни координат — только название МО. Чтобы проверить, что видит сеть, названия сопоставлены с границами муниципальных образований из OpenStreetMap: однозначно нашлись 1 744 МО из 1 904. В признаки и рёбра регион не входит.The SberIndex extract has no region and no coordinates, only municipality names. To check what the network sees, names were matched to OpenStreetMap municipal boundaries: 1,744 of 1,904 matched unambiguously. Region never enters the features or the edges.
Без внутригородских территорий Москвы и Санкт-Петербурга, среднее по 12 снимкам. Серые полосы — ориентиры: случайные пары МО одного основного типа, одного типа по названию и просто случайные пары. Сходство по уровню и структуре тоже географично; совместное движение добавляет к нему около 5 п. п.Excluding intra-city territories of Moscow and St Petersburg, mean over 12 snapshots. Grey bars are baselines: random pairs of the same main type, of the same municipality type, and plain random pairs. Similarity in level and mix is also geographic; co-movement adds about 5 points to it.
МО — сопоставленные с OpenStreetMap. Шестой кластер остаточный: 64 региона. Медианный регион на 67 % попадает в один кластер, при случайной перестановке меток — 44 %. Татарстан — на 93 % в волго-уральском кластере; Башкортостан, Оренбургская и Свердловская области — на 57–65 % там же. Почему соседи движутся вместе, данные не говорят: региональный календарь выплат, меры поддержки, погода, логистика — правдоподобные, но не проверенные причины.Counts are municipalities matched to OpenStreetMap. The sixth cluster is residual: 64 regions. The median region has 67% of its municipalities in one cluster, vs 44% under random relabelling. Tatarstan is 93% in the Volga–Urals cluster; Bashkortostan, Orenburg and Sverdlovsk regions are 57–65% in the same cluster. The data do not say why neighbours move together; regional payment calendars, support measures, weather and logistics are plausible but untested causes.
Если тип — реальная экономика со своей динамикой, то общий фактор типа должен прогнозировать его МО лучше, чем фактор всей страны. Проверка — модель без обучаемых параметров из работы «Шок по расписанию», прогноз на 1–3 месяца из точек июнь–сентябрь 2024 года, 22 848 пар. Контроль — 50 случайных разбиений тех же размеров.If a type is a real economy with its own dynamics, the type's common factor should forecast its municipalities better than the national factor. The test uses the parameter-free model from "Shock on schedule", 1–3 month forecasts from June–September 2024 origins, 22,848 pairs. Control: 50 random partitions with the same cluster sizes.
Основная спецификация: от кластера берётся сезонный профиль, годовой прирост — у страны. Ни одно из 18 разбиений ни в одной из двух спецификаций не обыгрывает фактор страны больше чем на 1 %. Разбиения по уровню и структуре однороднее случайных групп на 2–5 %, но и простое деление по типу МО из названия даёт 2 %, а во второй спецификации, где прирост берётся у кластера, разница с плацебо исчезает. Текущий прирост исключён из определения типа после этой проверки, на тех же данных.Main specification: the cluster supplies the seasonal profile, the year-on-year growth is national. None of 18 partitions beats the national factor by more than 1% in either of two specifications. Partitions by level and mix are 2–5% more homogeneous than random groups, but a simple split by municipality type from the name gives 2% too, and in the second specification, with cluster growth, the gap to placebo disappears. Current growth was dropped from the type definition after this check, on the same data.
Узлы — 1 904 МО с полной историей в шести рядах (из выгрузки исключены 49 одноимённых названий разных регионов, которые нельзя надёжно сшить между категориями). Признаки — уровень расходов относительно медианы МО того же месяца и доли пяти категорий и «прочего». Сходство: 10 ближайших соседей в признаках. Совместное движение: 10 соседей с наибольшей корреляцией месячных изменений расходов за 12 месяцев после вычитания общего для страны движения. Гибрид — сумма двух графов. Методы: Leiden, спектральная кластеризация и k-средних без графа как контроль. Разрешение Leiden γ = 0,5 — наибольшее на сетке, при котором устойчивость к подвыборкам не ниже 0,85.Nodes are 1,904 municipalities with full histories in all six series (49 names shared by municipalities in different regions are dropped, as they cannot be linked reliably across categories). Features: spending level relative to the month's median municipality and the shares of five categories plus "other". Similarity: 10 nearest neighbours in feature space. Co-movement: 10 neighbours with the highest correlation of monthly spending changes over 12 months, net of the national movement. Hybrid: the sum of both graphs. Methods: Leiden, spectral clustering, and graph-free k-means as a control. Leiden resolution γ = 0.5 is the largest grid value with subsample stability of at least 0.85.
Среднее по 12 снимкам. Устойчивость — ARI с полным разбиением на 20 подвыборках по 90 % МО. Во времени — ARI соседних месяцев. AMI — согласие с регионами. Прогноз к плацебо: минус — лучше случайных групп.Mean over 12 snapshots. Stability: ARI vs the full partition on 20 subsamples of 90%. Over time: ARI between consecutive months. AMI: agreement with regions. Forecast vs placebo: negative means better than random groups.
← Digital Economy Lab · все материалы← Digital Economy Lab · all work