172 строки. 51 дефект. Мой любимый файл этого месяца
Наблюдение: курсы учат SQL и Excel на чистых данных, а реальная работа аналитика начинается там, где данные грязные. Дубли, пустые поля, даты текстом и тд. На курсах этого нет, а на проектах - только это.
Решение оказалось простым: я нагенерировал себе грязные данные сам.
Попросил нейросеть собрать реестр ИТ-оборудования примерно на 200 строк и намеренно внести типовые дефекты. Для примера: - 12 дублей, часть с расхождением статусов, как в жизни - 15 записей без владельца - 10 дат в кривом формате: текст вместо даты, «вчера», «15/03-2026» и тд - 8 пустых версий - 6 опечаток в типах: «сервер» с маленькой, «database», «сеть»
Вторым листом - справочник владельцев, чтобы тренировать связки таблиц. Дальше чиню сам руками. В Excel: ВПР и XLOOKUP, сводные таблицы, условное форматирование, проверка дат. Потом те же задачи в SQL: дубли через GROUP BY и HAVING, оконные функции, JOIN на справочник.
Почему это работает: 1. Дефекты те же, что в реальных системах. Ты тренируешься на будущей работе, а не на чистом учебнике 2. Ты примерно знаешь, сколько всего сломано, значит можешь себя перепроверить 3. 30-40 минут в день - и навык не ржавеет между проектами
Режим сложности: попросить нейросеть не говорить, где именно дефекты и сколько их. Тогда это уже не упражнение, а охота.
А на чём тренируетесь вы, когда под рукой нет живого проекта?
· 15.07
Опана. Ребята от нечего делать начали грязные данные с помощью ИИ генерить. У вас там что только непризнаныегение могут только выживать? Похоже да!!!! Особенно с замашками ошибок в данных больше, чем самих данных!!!!! Вау круто - это из разряда мы расширили атом и расколем кого хочешь!!!!! Ну давайте как один кейс - который пришлось решать из области грязных данных : Для предиктивного анализа нужны были данные скважин. Они копились лет 50 в различных форматах - начиная от ЕС ЭВМ - заканчивая ERP именитой западной конторы. При этом данные снимались с различной методикой. Опаньки первая проблемка - имеем порядка 7-8 сетов параметров. Вторая проблема - некоторые вещи (координаты, углы бурения скважин ) так хитро кодированисть - например тангенс умножался на 1000000 - получался интежер который записывался. Про методику кодировки не где не было написано. А теперь по методики сьемки данных - как отличить корректные от фальсификата? А ни как !!!! По выбросам? Так выброс говорит о анамалии. А вот кто бы знал в чем причина анамалии. Пьяный помбура с последующим скрытием его деятельности в отчетах или сбой оборудования от износа - который начали прогнозировать. К стати прогнозировать пьянство помбура тоже стоит...... как и наличие дебилов в руководстве вашей конторы которые выдают бредовые задания и требуют их выполнения не смотря не на что .... а если не выполнил - не распел а увольнение. Так что продолжайте бредить дальше.......
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён