Пишу научную статью про рынок девелопмента. Делюсь процессом

Недавно снова притронулся к написанию научных статей для портфолио. Начал с простого вопроса: как ключевая ставка влияет на рентабельность застройщиков?

Первый ответ получил быстро: собрал отчётность пары застройщиков, посчитал в Эксельке, написал статью. Научный руководитель прочитала и сказала: «Интересно. Но ты можешь лучше. Может построим модель?» Следующие несколько месяцев я повторял весь материал по эконометрике, чтобы ответить на вопрос: как построить качественную «модель».

Первая проблема - сбор данных. Компании, которые составляют отчётность по МСФО в сфере девелопмента, составляют менее 1% от общего числа. То есть нормально измеримых игроков на рынке - единицы.

Собрал отчетности всех крупных публичных застройщиков (в том числе, региональных): получилось 5 компаний, причём отражающие разные бизнес-стратегии. Забыл добавить важную деталь - моё первое исследование было посвящено влиянию эскроу, проектного финансирования и льготных ипотек на рынок строительства. Отсюда у меня был неплохой старт - данные с 2019 года. 7 лет и 5 компаний. 35 наблюдений (хотя поиск сопровождался куда более нудным процессом - Python, парсинг, ручная проверка каждой строки). Итог: 5 компаний × 7 лет = 35 наблюдений. Для серьёзной статистики немного. Но для закрытой отрасли, где большинство вообще не раскрывает данные - это неплохое начало.

Когда данные наконец собраны, встаёт следующий вопрос: какую модель строить? Панельные данные - это не просто таблица. Здесь важно учесть, что каждая компания сама по себе разная: разная стратегия, разный менеджмент, разная история. Если это не учесть, модель будет смешивать различия между компаниями с реальным эффектом переменных. Для этого существует метод фиксированных эффектов (FE, Fixed Effects). Он изолирует эффект переменных, которые мы не можем оценить, от индивидуальных особенностей каждой компании и смотрит только на то, что менялось внутри неё во времени. Существует тест, который проверяет, нужно ли применять данный метод - тест Хаусмана. Мне он сказал: нужен. без вопросов.

Вторая проблема - работа с переменными. Сначала (очевидно, но блеф - о таком вспоминаю в конце) мультиколлинеарность - это когда две переменные настолько связаны между собой, что модель не может разобраться, кто из них на что влияет. Представь, что пытаешься понять, от чего зависит продуктивность сотрудника, но берёшь и часы работы, и количество задач. Переменные слишком коррелируют. По итогу, наблюдений 35, параметров больше 20. R² (способность линии регрессии объяснить реальные данные) был высоким - почти всё влияло на всё. Круто же?!

Но это не точность модели - это переобучение. Пришлось нещадно убирать переменные. Оставил только то, что теоретически обосновано и статистически устойчиво. Переменных стало 5. R² упал до значения в районе 65%. Зато модель перестала рассказывать мне сказки.

Статья почти готова. Один из результатов оказался неожиданным: знак у коэффициента вышел интуитивно обратный. Разбирался почему. Оказалось, данные правы, а моя картина была слишком упрощённой. Про это напишу отдельно, когда выйдет.

А на сегодня всё. Если занимаетесь анализом данных, эконометрикой или просто работаете с рынком недвижимости - пишите. Всегда интересно узнавать что-то новое. Открыт к новым сотрудничествам.