EDA за пару строк кода
Прилетает новый датасет и просьба: «Денис, ты там быстро глянь, что там внутри»
Обычно мы по старинке пишем head(), info() и describe(). Но для того, чтобы реально оценить пропуски, корреляции и тд, приходится писать целую простыню кода для визуализации.
А можно сделать умнее) Есть библиотека ydata-profiling, которая за пару минут генерирует полноценный HTML-отчет. Она сама подсветит дубликаты, распределения, выбросы, средние (все с графиками).
Сначала ставим: pip install ydata-profiling
И запускаем: import pandas as pd from ydata_profiling import ProfileReport
df = pd.read_csv("your_data.csv") profile = ProfileReport(df, title="EDA")
#Смотрим прямо в Jupyter:profile.to_notebook_iframe()
#Или сохраняем в файл, чтобы переслать коллеге:profile.to_file("report.html")
❓ А с чего обычно начинаете вы? Пользуетесь готовыми библиотеками для EDA или предпочитаете старый добрый ручной подход с matplotlib и pandas?