Что влияет на высокий рейтинг фильма?
https://github.com/d520765/movie-rating-analysis
Я не хотела делать очередной проект в стиле “почистила датасет и построила пару графиков” Поэтому взяла The Movies Dataset и собрала из него полноценный аналитический пайплайн: Python → PostgreSQL → SQL-витрины → Power BI
Цель была простая: понять, какие признаки связаны с высоким рейтингом фильма.
Что вошло в проект: — очистка и подготовка данных в Python; — объединение метаданных, жанров, режиссёров, рейтингов и финансовых показателей; — загрузка очищенных таблиц в PostgreSQL; — создание SQL-витрин в схеме marts; — анализ high-rated фильмов; — Power BI-дашборд с KPI, жанрами, десятилетиями, режиссёрами и корреляциями. Что получилось: — около 45 тыс. фильмов в основной таблице; — около 9 тыс. фильмов с пользовательскими рейтингами; — 2 257 фильмов с высоким рейтингом; — high-rated share около 25%; — отдельные витрины по фильмам, жанрам, годам и режиссёрам.
Самый полезный вывод для меня: хороший аналитический проект — это не только графики, а понятная цепочка от сырых данных до проверяемого вывода.
Сейчас ищу junior data / BI analyst роли, поэтому буду рада обратной связи от тех, кто смотрит портфолио кандидатов: что в таком проекте усиливает впечатление, а что лучше доработать?