Python (1/10)

Введение в Python для аналитика: знакомство и установка (1/10)

Python прочно завоевал свое место в арсенале аналитиков данных благодаря простоте, мощи и огромному экосистемному набору библиотек. В отличие от специфичных инструментов, Python универсален: он позволяет быстро обрабатывать данные, визуализировать результаты, писать скрипты автоматизации и даже строить модели машинного обучения — всё в одном языке.

Если вы только начинаете или хотите системно изучить основы Python — рекомендую курс на Stepik «Программирование на Python» . Там подробно рассмотрено всё — от базовых конструкций до функций и циклов. Но сегодня мы сделаем первый шаг, сфокусировавшись именно на том, что актуально для аналитика.

Зачем Python аналитикам?

  • Обработка данных: библиотека pandas позволяет оперативно работать с табличными данными, выполняя фильтрацию, трансформации, агрегации.
  • Численные вычисления: numpy обеспечивает быстрые операции с массивами, векторы и матрицы — фундамент для статистики и ML.
  • Визуализация: matplotlib и seaborn создают красивые и информативные графики.
  • Машинное обучение: scikit-learn и другие библиотеки открывают доступ к мощным алгоритмам.
  • Автоматизация: Python умеет работать с файлами, базами, API и системными задачами, что экономит сотни часов работы.

Первые шаги с обработкой данных — примеры на pandas

import pandas as pd

#Создаём DataFrame из словаря

data = {     'client': ['Anna', 'Boris', 'Cathy', 'Dmitry'],     'sales': [250, 150, 200, 300],     'region': ['North', 'South', 'East', 'West'] } df = pd.DataFrame(data)

#Просмотр первых строк

print(df.head())

#Фильтрация по условию — продажи больше 180

filtered = df[df['sales'] > 180] print(filtered)

#Агрегирование — сумма продаж по регионам

agg = df.groupby('region')['sales'].sum() print(agg)

#Добавление столбца с повышенными продажами на 10%

df['sales_plus_10'] = df['sales'] * 1.10 print(df)

Немного о numpy import numpy as np

arr = np.array([10, 20, 30, 40]) print(arr + 5)           # [15 25 35 45] print(arr.mean())         # Среднее: 25.0 print(arr > 25)           # [False False  True  True] Как начать?  1. Установите Python и Jupyter Notebook.  В качестве IDE я использую VScode. 2. Установите библиотеки через pip:  pip install pandas numpy matplotlib seaborn scikit-learn 3. Попробуйте самостоятельно загрузить небольшой CSV и провести первые фильтрации и группировки — эксперименты лучше любого курса!

Это только старт, впереди много интересного! В следующих постах мы подробно разберём очистку данных, работу с пропусками и трансформациями.

Запомните, даже самый спокойный медведь умеет рычать, когда надо. Берегите голову, берегите данные — и пусть в вашем дне будет немного тишины, ясности и добрых переменных.