Modelling the value of residential property in Moscow Oblast using machine learning methods
Modelling the value of residential property in Moscow Oblast using machine learning methods
Abstract
The housing market in Moscow Oblast is strongly influenced by complex non-linear relationships. This work presents a hybrid method for forecasting house prices, combining machine learning and spatial econometrics. A sample of 482,672 properties from 2018 to 2021 was used for the analysis. It was confirmed that prices are statistically significantly correlated in space: I = 0.56 at p = 0.001. The Random Forest model yielded the best results: MAE = 0.146 on a logarithmic scale, MAPE = 0.95%. SHAP analysis showed that the factors most strongly influencing price are the flat’s floor area, the number of rooms, the distance to the city centre and local population density. This approach may prove useful in geofintech platforms and mass property valuation systems.
1. Введение
Современный рынок жилой недвижимости характеризуется высокой динамикой, сложной структурой пространственных взаимосвязей между объектами и значительной неоднородностью ценовых показателей. Московская область является одним из наиболее активных регионов Российской Федерации, где стоимость объектов определяется как индивидуальными характеристиками недвижимости, так и географическим расположением, а также доступностью транспортной и социальной инфраструктуры .
Традиционные методы оценки, основанные на регрессионных моделях, часто не учитывают пространственные зависимости и локальные особенности рынка, что ограничивает точность прогнозов , . В последние годы возрос интерес к применению методов машинного обучения для прогнозирования цен на жилые объекты, включая ансамблевые алгоритмы и методы градиентного бустинга , .
Цель работы — разработка и апробация моделей прогнозирования стоимости жилой недвижимости Московской области, способных учитывать как структурные характеристики объектов, так и пространственные зависимости.
Задачи исследования включают:
1. Оценку пространственной автокорреляции цен и выявление кластеров объектов с высокими и низкими ценами.
2. Подготовку и очистку данных, включая обработку пропусков, фильтрацию выбросов и формирование пространственных признаков.
3. Прогнозирование стоимости жилья с использованием моделей машинного обучения и оценку точности прогнозов по метрикам MAE.
4. Применение пространственных регрессионных моделей для учета влияния соседних объектов на формирование цен.
5. Интерпретацию влияния факторов на стоимость жилья с использованием SHAP-анализа для выявления ключевых детерминант ценового уровня.
Для оценки прогнозной силы моделей использовалось разделение данных по временному принципу. Наблюдения за 2018–2020 гг. использовались для обучения моделей, а данные за 2021 г. формировали тестовую выборку, что позволяет оценить способность моделей к прогнозированию на будущих периодах в реальных рыночных условиях. Дополнительно на обучающей выборке применялась пятикратная перекрёстная проверка.
Гипотеза исследования заключается в предположении, что использование пространственных характеристик объектов недвижимости и учет пространственной автокорреляции цен позволяют повысить точность прогнозирования стоимости жилой недвижимости по сравнению с моделями, принимающие структурные характеристики объектов, при этом прирост точности составит не менее 5% на тестовой выборке.
Научная новизна работы заключается в интеграции методов машинного обучения и пространственных моделей. Это позволяет одновременно учитывать структурные характеристики объектов и пространственные эффекты при прогнозировании стоимости недвижимости. Реализация предложенного подхода обеспечивает повышение точности прогнозов и формирование практических рекомендаций для органов планирования, инвесторов и разработчиков геофинтех-платформ.
2. Обзор литературы
Оценка и прогнозирование стоимости жилой недвижимости является актуальной задачей как экономической науки, так и практической деятельности геофинтех-платформ. Традиционные регрессионные модели учитывают структурные характеристики объектов, такие как площадь квартиры, количество комнат или этажность здания. Однако эти модели часто не отражают влияние локальной среды и пространственной зависимости между объектами, что ограничивает точность прогнозирования , .
Пространственные модели позволяют выявлять локальные закономерности и количественно оценивать влияние соседних объектов на формирование цен. К наиболее распространённым подходам относятся:
- Spatial Lag (пространственная лаговая модель) — учитывает влияние цен соседних объектов через матрицу пространственных весов ;
- Spatial Error — моделирует пространственную зависимость случайной ошибки ;
- Geographically Weighted Regression (GWR) – локальная регрессия, позволяющая учитывать неоднородность факторов по территории .
Методы географически взвешенной регрессии широко применяются в исследованиях пространственной дифференциации цен жилья и позволяют выявлять территориальные вариации факторов .
Применение показателей пространственной автокорреляции, таких как индекс Moran’s I, позволяет выявлять локальные кластеры объектов с высокой и низкой стоимостью, что является важным инструментом анализа структуры рынка , .
Параллельно с развитием пространственных моделей наблюдается активное внедрение методов машинного обучения. Ансамблевые алгоритмы и градиентный бустинг (Random Forest, XGBoost, LightGBM, CatBoost) демонстрируют высокую эффективность при моделировании нелинейных зависимостей между характеристиками объектов и их стоимостью , , , . Эти методы позволяют строить точные прогнозные модели на больших массивах данных, учитывая как структурные характеристики объектов, так и влияние локальной среды .
Кроме сложных моделей, в литературе рассматривается применение линейной регрессии для анализа ключевых факторов формирования стоимости, подчёркивая важность очистки данных, отбора признаков и корректного построения моделей . Дополнительно предлагаются классификации систем машинного обучения для систематизации подходов к анализу экономических данных и прогнозированию рыночных показателей , .
Сравнительный анализ различных моделей прогнозирования рыночной стоимости жилой недвижимости показывает, что выбор алгоритма существенно влияет на точность оценок, а динамика рыночных условий требует регулярной калибровки моделей, особенно при сопоставлении с кадастровой стоимостью .
Таким образом, обзор литературы выделяет два ключевых направления анализа рынка жилой недвижимости:
1. Пространственные модели — Moran’s I, Spatial Lag, GWR, выявление пространственных закономерностей распределения цен;
2. Методы машинного обучения — высокоточные прогнозные модели на основе больших массивов данных с учетом как структурных характеристик объектов, так и влияния локальной среды.
При этом следует отметить, что каждый из рассмотренных подходов имеет ограничения: Spatial Lag эффективен при глобальной пространственной зависимости, но не учитывает локальную нестационарность факторов. Ансамблевые методы машинного обучения демонстрируют высокую точность на больших данных, однако их «чёрный ящик» затрудняет интерпретацию, что частично компенсируется применением SHAP-анализа . Однако важно учитывать, что интерпретация SHAP-значений может быть затруднена при наличии мультиколлинеарных признаков, поскольку в таких условиях вклад коррелирующих переменных распределяется между ними неоднозначно .
Таким образом, синтез этих подходов позволяет компенсировать недостатки каждого из них. Синтез этих направлений и их интеграция в геофинтех-платформы представляют перспективное направление исследований, направленное на повышение точности прогнозирования, выявление локальных закономерностей и более глубокое понимание структуры рынка недвижимости , , .
3. Данные и подготовка к анализу
Задача прогнозирования стоимости жилой недвижимости формально представляется как моделирование функции (1):
где
Эмпирической основой настоящего исследования является набор данных, размещённый в открытом доступе на платформе Hugging Face . Данный датасет содержит информацию о рынке жилой недвижимости Российской Федерации за период 2018–2021 гг. и включает как структурные характеристики объектов, так и их географические координаты. Общий массив данных охватывает более 5 миллионов наблюдений по всем регионам страны. Это делает его одним из крупнейших открытых источников данных по рынку жилой недвижимости России.
Для целей данного исследования была выделена выборка объектов, расположенных на территории Московской области. Выбор региона обусловлен высокой активностью рынка недвижимости, значительным объёмом предложений и выраженной пространственной дифференциацией цен. После фильтрации по региональному признаку и предварительной очистки данных итоговый набор наблюдений составил около 480 тыс. записей. Это обеспечивает статистическую репрезентативность и позволяет проводить корректный эконометрический и пространственный анализ.
Для оценки прогнозной силы моделей использовалось разделение данных по временному принципу. Наблюдения за 2018–2020 гг. использовались для обучения моделей, а данные за 2021 г. формировали тестовую выборку. Дополнительно на обучающей выборке применялась пятикратная перекрёстная проверка.
Каждое наблюдение в наборе данных соответствует отдельному объекту жилой недвижимости и включает параметры, характеризующие как физические свойства объекта, так и его пространственное положение. К основным переменным относятся:
1. price — цена объекта недвижимости;
2. geo_lat, geo_lon — географические координаты объекта (широта и долгота);
3. area — общая площадь квартиры;
4. rooms — количество комнат;
5. level — этаж расположения квартиры;
6. levels — этажность здания;
7. kitchen_area — площадь кухни;
8. building_type / object_type — тип здания и тип объекта недвижимости.
Перед построением прогнозных моделей была выполнена процедура предварительной обработки данных, включающая следующие этапы:
1. Очистка данных — удаление наблюдений с пропущенными значениями ключевых признаков (цена, площадь, координаты).
2. Фильтрация выбросов — исключение аномальных значений площади и цены, выходящих за пределы реалистичных диапазонов рынка.
3. Удаление дубликатов — исключение повторяющихся объявлений объектов недвижимости.
4. Преобразование целевой переменной — для стабилизации дисперсии и уменьшения асимметрии распределения цены было применено логарифмическое преобразование переменной price.
5. Нормализация признаков — масштабирование числовых переменных для повышения устойчивости алгоритмов машинного обучения.
Дополнительно были сформированы новые признаки, учитывающие пространственные характеристики объектов недвижимости. В частности, был рассчитан показатель расстояния до центра города, используемый как прокси-переменная доступности инфраструктуры и транспортных узлов. Расстояние вычислялось на основе географических координат объектов.
Кроме того, введён показатель локальной плотности объектов недвижимости, отражающий степень концентрации объектов в пространстве. Этот показатель рассчитывался на основе среднего расстояния до ближайших соседних объектов. Данный показатель рассчитывался как величина, обратная среднему расстоянию до 10 ближайших соседей.
Использование как традиционных характеристик объектов недвижимости, так и пространственных признаков создаёт расширенный набор факторов, отражающих структурные и географические особенности рынка.
4. Корреляционный анализ признаков
Для выявления закономерностей взаимосвязей между переменными и анализа структуры данных был проведён корреляционный анализ признаков. В качестве основной меры линейной зависимости использовался коэффициент Пирсон, который широко применяется в эконометрических и пространственных исследованиях для оценки силы и направления взаимосвязи между количественными переменными.
Результаты корреляционного анализа выявили несколько ключевых закономерностей. Наибольшая положительная корреляция наблюдается между ценой объекта и общей площадью квартиры, что соответствует экономической логике рынка: более крупные квартиры, как правило, обладают более высокой стоимостью. Значительная положительная зависимость выявлена также между количеством комнат и площадью квартиры, что отражает структурную взаимосвязь характеристик жилых объектов.
Умеренная корреляция отмечена между ценой недвижимости и площадью кухни, что указывает на тенденцию увеличения площади кухни в более дорогих квартирах. В то же время признаки, связанные с этажом расположения квартиры и этажностью здания, демонстрируют относительно слабую связь с ценой объекта, что согласуется с наблюдениями других региональных исследований рынка жилья.
Особое внимание привлекают пространственные признаки. Показатель расстояния до центра города демонстрирует отрицательную корреляцию с ценой, подтверждая классическую гипотезу урбанистической экономики о снижении стоимости жилья по мере удаления от центральных районов. Показатель локальной плотности объектов отражает степень концентрации объектов недвижимости в определённой зоне, что также влияет на формирование цен. На рисунке 1 представлена матрица корреляции признаков, наглядно демонстрирующая линейные зависимости между основными переменными.

Рисунок 1 - Матрица корреляции признаков
Для дальнейшей интерпретации влияния отдельных факторов на прогноз стоимости жилой недвижимости был применён SHAP-анализ (SHapley Additive exPlanations) на модели XGBoost. Данный подход позволяет количественно оценить вклад каждого признака в прогноз модели . Результаты SHAP показали, что наибольший вклад в прогноз вносят площадь квартиры и количество комнат, существенное влияние оказывают пространственные характеристики — расстояние до центра и локальная плотность объектов, а остальные признаки, включая этаж, этажность и площадь кухни, имеют умеренное воздействие. На рисунке 2 показан вклад признаков в прогноз стоимости жилья по SHAP-анализу модели XGBoost.

Рисунок 2 - Влияние признаков на прогноз стоимости недвижимости
5. Пространственный анализ рынка недвижимости
Одной из особенностей рынка жилой недвижимости является выраженная пространственная зависимость цен объектов. Стоимость жилья формируется не только на основе характеристик конкретного объекта, но и под влиянием факторов окружающей среды, таких как инфраструктура района, транспортная доступность, плотность застройки и уровень развития территории. В связи с этим для анализа структуры рынка недвижимости был проведён пространственный анализ, направленный на выявление пространственной автокорреляции цен и локальных кластеров стоимости жилья.
Для проверки наличия пространственной зависимости цен на недвижимость был рассчитан индекс Морана, который является одним из наиболее распространённых показателей пространственной автокорреляции , . Данный индекс позволяет определить, наблюдается ли пространственная кластеризация значений исследуемой переменной.
Значения индекса Морана высчитывают следующим образом (2):
где
Результат интерпретируется следующим образом:
-
-
-
Для построения матрицы пространственных весов был выбран принцип k-ближайших соседей с k=8 . Выбор данного параметра обусловлен результатами предварительного анализа чувствительности: при k<5 матрица становится разреженной и не отражает значимых пространственных связей, а при k>15 происходит избыточное сглаживание, снижающее чувствительность индекса Морана. Значение k=8 обеспечивает устойчивую оценку пространственной автокорреляции.
В ходе расчётов было получено значение индекса Морана
В целях визуализации пространственной дифференциации стоимости недвижимости на территории Московской области было построено распределение цен на жилую недвижимость, представленное на рисунке 3.

Рисунок 3 - Распределение цен на жилую недвижимость

Рисунок 4 - Пространственные кластеры стоимости жилой недвижимости Московской области
1. High-High — области с высокой стоимостью жилья, окружённые объектами с аналогично высокой ценой.
2. Low-Low — зоны низких цен, формирующие кластеры доступного жилья.
3. High-Low — дорогие объекты в окружении более дешёвых.
4. Low-High — относительно дешёвые объекты, расположенные в районах с высокой стоимостью недвижимости.
Выявление подобных пространственных кластеров позволяет определить территории с различной ценовой структурой и выявить потенциально привлекательные зоны для инвестиций и развития инфраструктуры.
6. Методы исследования и моделирования стоимости недвижимости
Методологическая стратегия исследования строится на сочетании трёх взаимодополняющих аналитических подходов: системного анализа рынка как пространственно-распределённого объекта, инструментов пространственной эконометрики и ансамблевых методов машинного обучения. Пространственная связанность цен оценивалась с помощью индекса Морана, расчёт которого выполнялся на матрице пространственных весов, построенной по принципу k-ближайших соседей с k=8. Выбор k=8 обоснован результатами предварительного анализа чувствительности: при меньших значениях матрица становится разреженной и не отражает значимых пространственных связей, при больших происходит избыточное сглаживание, снижающее чувствительность индекса Морана.
Для прогнозирования стоимости жилой недвижимости были использованы методы машинного обучения и пространственной эконометрики. Применение данных подходов позволяет учитывать как характеристики объектов недвижимости, так и пространственные зависимости между ними. Основные модели, использованные в исследовании, представлены в таблице 1.
Таблица 1 - Методы моделирования стоимости недвижимости
Класс | Модель | Описание |
Машинное обучение | Линейная регрессия | Базовая статистическая модель, описывающая линейную зависимость стоимости недвижимости от набора признаков. Используется как эталон для сравнения более сложных алгоритмов. |
Машинное обучение | Случайный лес | Ансамблевый алгоритм на основе множества решающих деревьев, позволяющий моделировать сложные нелинейные зависимости между характеристиками объектов и их стоимостью , , , . |
Машинное обучение | Градиентный бустинг (XGBoost, LightGBM, CatBoost) | Современные ансамблевые методы, основанные на последовательной минимизации ошибки модели и эффективно работающие на больших массивах данных. |
Пространственные регрессии | Пространственная лаговая модель (Spatial Lag, ML_Lag) | Регрессионная модель, учитывающая влияние цен соседних объектов через матрицу пространственных весов. |
Пространственная эконометрика | Географически взвешенная регрессия (GWR) | Метод локальной регрессии, позволяющий учитывать пространственную неоднородность факторов формирования цен на недвижимость. |
7. Результаты исследования и их обсуждение
В рамках исследования была проведена комплексная оценка факторов, влияющих на стоимость жилой недвижимости Московской области, с использованием методов машинного обучения и пространственной эконометрики. Итоговая выборка включала 482 672 объекта недвижимости.
Корреляционный анализ показал значительную положительную зависимость цены от площади квартиры и количества комнат, умеренную — от площади кухни, а признаки этажности и этажа оказались менее значимыми. Пространственные признаки демонстрируют отрицательную корреляцию с расстоянием до центра города и подтверждают существование локальных кластеров высокой и низкой стоимости.
Пространственный анализ с использованием индекса Морана выявил выраженную положительную автокорреляцию цен, что подтверждает наличие локальных ценовых кластеров. Визуализация распределения стоимости объектов на карте Московской области позволила выявить зоны концентрации высоких и низких цен, а пространственная лаговая модель показала значимое влияние соседних объектов на формирование цены.
В ходе исследования была предпринята попытка оценки географически взвешенной регрессии для выявления локальной нестационарности влияния факторов ценообразования. Однако ввиду высокой мультиколлинеарности пространственных признаков (расстояния до центра и локальной плотности) и вычислительной сложности обращения матрицы пространственных весов, оценка GWR не позволила получить устойчивых результатов на используемой выборке.
Применение ансамблевых моделей машинного обучения позволило оценить точность прогноза стоимости жилья. Наименьшее значение средней абсолютной ошибки показала модель Случайный лес, при этом t-тест показал статистически значимое превосходство над XGBoost. SHAP-анализ подтвердил, что наибольший вклад в прогноз вносят площадь квартиры и количество комнат, значительное влияние оказывают пространственные признаки (расстояние до центра и локальная плотность объектов), а остальные признаки (этаж, этажность, площадь кухни) имеют умеренное воздействие. Результаты работы представлены в таблице 2.
Таблица 2 - Результаты исследования
Категория анализа | Показатель | Результат |
Объем данных | Количество объектов | 482 672 ед. |
Статистика цены | Среднее | 4 802 698 руб. |
Медиана | 4 350 000 руб. | |
25% квантиль | 3 004 276 руб. | |
75% квантиль | 6 000 000 руб. | |
Минимум / максимум | 100 020 / 162 062 800 | |
Пространственная автокорреляция | Индекс Морана | 0,56 отн. ед. |
p-значение | 0,001 | |
Метрики моделей ML (MAE) | Линейная регрессия | 0,228 отн. ед. (1 077 923 руб., 1,49%) |
Случайный лес | 0,146 отн. ед. (660 051 руб., 0,95%) | |
XGBoost | 0,171 отн. ед. (786 867 руб., 1,12%) | |
LightGBM | 0,169 отн. ед. (776 881 руб., 1,11%) | |
CatBoost | 0,173 отн. ед. (793 870 руб., 1,13%) | |
Spatial Lag | 0,272 отн. ед. (1 313 634 руб., 1,78%) | |
Статистическая проверка | t-test XGB vs RF | t = 6,89, p = 0,002 |
Пространственная лаговая модель | Псевдо R² | 0,728 |
Псевдо R² с учетом пространственных весов | 0,599 | |
Средневзвешенная зависимая переменная | 0,601 | |
Влияние признаков | Площадь квартиры | наибольший вклад |
Количество комнат | наибольший вклад | |
Расстояние до центра | значительное влияние | |
Локальная плотность объектов | значительное влияние | |
Этаж, этажность, кухня | умеренное влияние |
8. Ограничения исследования
Несмотря на полученные результаты и высокую точность прогнозов, исследование имеет ряд ограничений.
Во-первых, оно проводилось на основе данных о российской недвижимости в период 2018–2021 годов, при этом была определена выборка объектов Московской области для моделирования. В данном наборе данных отражены главным образом характеристики вторичного рынка жилья и не учтены характеристики рынка первичной недвижимости, которые могут оказывать значительное влияние на процессы ценообразования.
Во-вторых, в исследовании основное внимание уделялось структурным и пространственным характеристикам недвижимости без учета макроэкономических показателей, включая инфляцию, процентные ставки по ипотечным кредитам, изменения доходов и сезонные колебания спроса, которые могут оказывать значительное воздействие на динамику цен.
В-третьих, пространственные характеристики вытекают из географического местоположения объектов и плотности местных участков, но при этом не учитываются подробные особенности городов, такие как доступность транспорта, экологическая ситуация, качество социальной инфраструктуры и криминальная среда отдельных районов.
В-четвёртых, в работе предпринята попытка применения географически взвешенной регрессии (GWR) для выявления локальной нестационарности факторов. Однако ввиду высокой мультиколлинеарности пространственных признаков (расстояния до центра и локальной плотности, коэффициент корреляции между которыми составил 0,68) и вычислительной сложности обращения матрицы пространственных весов, устойчивая оценка GWR не была получена на используемой выборке. Данное ограничение может быть преодолено в будущих исследованиях с использованием регуляризованных версий GWR или методов машинного обучения с пространственными эффектами.
Кроме того, использование машинного обучения и пространственной эконометрии требует периодического обновления моделей и повторного обучения при получении новых данных, поскольку структура рынка недвижимости и влияние отдельных факторов меняются с течением времени; поэтому разработанный подход следует рассматривать в качестве основы для создания адаптивных систем интеллектуального прогнозирования, которые требуют дальнейшей доработки путем включения дополнительных пространственных, временных и социально-экономических факторов.
9. Заключение
Таким образом, проведённый анализ стоимости жилой недвижимости Московской области с использованием методов машинного обучения и пространственной эконометрики показал высокую точность прогнозирования и выявил ключевые детерминанты цен — площадь квартиры, количество комнат, расстояние до центра города и локальную плотность объектов. Полученные результаты демонстрируют, что интеграция ансамблевых моделей и пространственных регрессий позволяет учитывать как структурные характеристики объектов, так и их пространственные зависимости, что повышает практическую ценность прогноза.
Следует отметить, что применение SHAP-анализа и индекса Морана позволяет не только оценить влияние отдельных признаков на формирование стоимости, но и выявить локальные ценовые кластеры, что имеет важное значение для инвесторов, органов планирования и разработчиков геофинтех-платформ при принятии решений о вложениях и развитии инфраструктуры.
Перспективным направлением дальнейших исследований является разработка интеллектуальных геофинтех-систем. Реализация API позволит автоматически принимать сведения о новых объектах недвижимости, выполнять расчёт пространственных признаков, строить прогнозы стоимости и формировать интерпретируемые результаты в режиме, близком к реальному времени. Регулярное обновление моделей по мере поступления новых объявлений обеспечит адаптацию системы к изменению рыночной конъюнктуры, инфраструктурным преобразованиям территорий и влиянию внешних социально-экономических факторов. Разработанная технология может стать основой геофинтех-платформ, сервисов массовой оценки недвижимости, систем инвестиционной аналитики и интеллектуальных средств поддержки принятия решений органов государственного и муниципального управления.
