Сегодня тестовое, в котором нужно проанализировать набор данных по стоимости жилья в Калифорнии 🏙

Данные и заготовку для решения можно найти здесь.

👨🏻‍💻А сделать нужно следующее:

1️⃣ Извлечь таблицу neighborhoods в датафрейм. В части записей отсутствуют данные в атрибуте ocean_proximity (null-значения), их необходимо восстановить. Фактически, это задача классификации. Проведите разведочный анализ, подумайте, как в принципе её возможно решить; 2️⃣ Исправить null-значения ocean_proximity в самой БД. Условие: нельзя заменять таблицу в БД на новую, только через обновление значений с помощью SQL; 3️⃣ С помощью SQL создать объединенный датасет со значениями из двух таблиц БД, т.е. чтобы у каждого района было известно среднее арифметическое медианной стоимости жилья для районов в его кластере. Условие: только с помощью SQL, не с помощью Python; 4️⃣ Определить форму распределения median_house_value в каждом кластере. Определить выборочные средние median_house_value и их отклонения от средних ген. совокупностей. Все изобразить графически для каждого кластера. В виде комментария описать ваши выводы о репрезентативности выборок; 5️⃣ Определить зависимость стоимости жилья от численности населения района в каждом кластере. Описать в виде комментария.

❗️Каждое задание необходимо сопроводить комментариями, в которых вы поясняете, чего конкретно добиваетесь и почему используете именно выбранный способ решения. Обоснуйте ваши действия и сформулируйте выводы.

Вариант реализации от подписчика (@kinick):

  1. Основная часть: https://colab.research.google.com/drive/1RglOfXE_TdfMBwQ4kqHy202rylEoxODU?usp=sharing
  2. ML-модель: https://colab.research.google.com/drive/13PAc4fQORjdWh1ztheffhnE6tvdRSsqJ?usp=sharing

#тестовое |⚡️ Забустить канал 🚀