Проекты :

Хранилище данных для интернет-магазина https://github.com/poppkott/prods/tree/main/Интернет-магазин Задачи и результаты:

  • Создал скрипты на Python для генерации тестовых данных, имитирующих реальные сценарии.
  • Разработал хранилище данных на основе Data Vault для 1000 клиентов, 10 000 заказов, 100 складов и 500 товаров.
  • Реализовал проверки на Data Quality и увеличил точность данных на 15%.
  • Внедрил SCD Type 1 и Type 2 для управления историчностью данных.
  • Создал ETL-пайплайны на Python, ускорив загрузку данных на 30%.
  • Спроектировал витрины данных на основе звездной схемы, сократив время выполнения аналитических запросов на 25%.
  • Разработал дашборды для анализа выручки, среднего чека и количества заказов.
  • Исследовал возможность интеграции модели Mistral для работы с историческими данными.

Telegram-бот для поиска экранизаций книг https://github.com/poppkott/prods/tree/main/Экранизации Задачи и результаты:

  • Разработал базу данных на PostgreSQL (10 000 записей о книгах и экранизациях) с оптимизацией запросов до 1-2 секунд.
  • Автоматизировал сбор данных с Кинопоиска с помощью Python (BeautifulSoup, requests).
  • Настроил бота для ответа на запросы (1-2 секунды) с точностью поиска 90%.

Проект "Медсестра на дом" https://github.com/poppkott/prods/tree/main/Медсестра%20на%20дом Задачи и результаты:

  • Разработал структуру базы данных в PostgreSQL для хранения информации о клиентах, медсёстрах и заявках.
  • Оптимизировал запросы, сократив время выполнения на 20%.
  • Реализовал 12 эндпоинтов на FastAPI для управления клиентами, медсёстрами и заявками (CRUD-операции).
  • Подготовил BRD и SRS для описания функциональных и нефункциональных требований к системе.
  • Реализовал базовый функционал Telegram-бота для обработки заказов.

Ключевые навыки:

Data Warehousing (DWH):

  • Проектирование и реализация хранилищ данных с использованием PostgreSQL, Data Vault, Star Schema.
  • Управление историчностью данных через Slowly Changing Dimensions (SCD).
  • Оптимизация структуры и производительности хранилищ данных (индексация, партиционирование).

ETL-процессы:

  • Проектирование и реализация ETL-пайплайнов на Python и SQL.
  • Оркестрация ETL-процессов с использованием Apache Airflow.
  • Автоматизация обработки данных и контроль качества (Data Quality).

SQL:

  • Написание сложных SQL-запросов (оконные функции, подзапросы, CTE).
  • Работа с большими объемами данных, оптимизация запросов.

BI и визуализация:

  • Разработка дашбордов и аналитических отчетов в Power BI.

Python:

  • Разработка Telegram-ботов с использованием Telegram API.
  • Автоматизация задач и аналитика данных (pandas, numpy, matplotlib).

Документация:

  • Подготовка BRD, SRS, Use Cases, User Stories.

Дополнительно:

  • Интеграция AI-моделей (Mistral) для анализа данных.
  • Генерация тестовых данных для имитации реальных сценариев.
  • Работа с Docker для контейнеризации приложений.