172 строки. 51 дефект. Мой любимый файл этого месяца

Наблюдение: курсы учат SQL и Excel на чистых данных, а реальная работа аналитика начинается там, где данные грязные. Дубли, пустые поля, даты текстом и тд. На курсах этого нет, а на проектах - только это.

Решение оказалось простым: я нагенерировал себе грязные данные сам.

Попросил нейросеть собрать реестр ИТ-оборудования примерно на 200 строк и намеренно внести типовые дефекты. Для примера: - 12 дублей, часть с расхождением статусов, как в жизни - 15 записей без владельца - 10 дат в кривом формате: текст вместо даты, «вчера», «15/03-2026» и тд - 8 пустых версий - 6 опечаток в типах: «сервер» с маленькой, «database», «сеть»

Вторым листом - справочник владельцев, чтобы тренировать связки таблиц. Дальше чиню сам руками. В Excel: ВПР и XLOOKUP, сводные таблицы, условное форматирование, проверка дат. Потом те же задачи в SQL: дубли через GROUP BY и HAVING, оконные функции, JOIN на справочник.

Почему это работает: 1. Дефекты те же, что в реальных системах. Ты тренируешься на будущей работе, а не на чистом учебнике 2. Ты примерно знаешь, сколько всего сломано, значит можешь себя перепроверить 3. 30-40 минут в день - и навык не ржавеет между проектами

Режим сложности: попросить нейросеть не говорить, где именно дефекты и сколько их. Тогда это уже не упражнение, а охота.

А на чём тренируетесь вы, когда под рукой нет живого проекта?