EDA за пару строк кода

Прилетает новый датасет и просьба: «Денис, ты там быстро глянь, что там внутри»

Обычно мы по старинке пишем head(), info() и describe(). Но для того, чтобы реально оценить пропуски, корреляции и тд, приходится писать целую простыню кода для визуализации.

А можно сделать умнее) Есть библиотека ydata-profiling, которая за пару минут генерирует полноценный HTML-отчет. Она сама подсветит дубликаты, распределения, выбросы, средние (все с графиками).

Сначала ставим: pip install ydata-profiling

И запускаем: import pandas as pd from ydata_profiling import ProfileReport

df = pd.read_csv("your_data.csv") profile = ProfileReport(df, title="EDA")

#Смотрим прямо в Jupyter:

profile.to_notebook_iframe()

#Или сохраняем в файл, чтобы переслать коллеге:

profile.to_file("report.html")

❓ А с чего обычно начинаете вы? Пользуетесь готовыми библиотеками для EDA или предпочитаете старый добрый ручной подход с matplotlib и pandas?