Python (2/10)

📱Работа с данными в pandas: основы чтения, просмотра и простого анализа (2/10)

Сегодня рассмотрим, как быстро загрузить данные, посмотреть их общую информацию, отфильтровать и отсортировать — чтобы уже на таком базисе начинать делать первые анализы.

Загрузка и базовый осмотр данных  Чаще всего данные хранятся в CSV-файлах. Загрузим примерный набор:  import pandas as pd

df = pd.read_csv('data/sales.csv') Чтобы понять, что внутри, используйте методы info() и describe():  df.info()        # Выводит количество строк, столбцов, типы данных и количество непустых значений  df.describe()    # Выводит основные статистики для числовых столбцов: среднее, медиану, квартели, min, max  Заполнение пропущенных значений (NaN)  Данные часто бывают неполными. Заполним пропуски медианой по столбцу amount:  median_amount = df['amount'].median() df['amount'] = df['amount'].fillna(median_amount) Фильтрация данных  Выберем заказы с суммой больше 1000:  high_sales = df[df['amount'] > 1000] Сортировка данных  Отсортируем отфильтрованные данные по дате заказа:  sorted_sales = high_sales.sort_values(by='order_date', ascending=True) Полный пример обработки  df = pd.read_csv('data/sales.csv')

print(df.info())  print(df.describe())

df['amount'] = df['amount'].fillna(df['amount'].median())

df_filtered = df[(df['amount'] > 1000) & (df['region'] == 'Europe')]

df_sorted = df_filtered.sort_values(by='order_date', ascending=False)

print(df_sorted.head(10))  В этом примере мы загрузили данные, поняли их структуру, заполнили пропуски, отфильтровали и отсортировали. Это простая, но важная база для любого аналитика, чтобы дальше углубиться в сложные преобразования и анализ.

Запомните, даже самый спокойный медведь умеет рычать, когда надо. Берегите голову, берегите данные — и пусть в вашем дне будет немного тишины, ясности и добрых переменных.