Как найти закономерности в данных?
Коллеги, дайте совет. Столкнулся с проблемой. Есть данные, в виде выгрузки результатов sql запроса. Смысл запроса найти «плохие» переводы. Результат: я их нашел. Для сравнения выгрузил «хорошие» переводы. Но надо еще найти закономерности «почему плохие переводы возникают»
И тут начинается жесть. Они буквально ни чем друг от друга не отличаются. Критерии «хороших» и «плохих» изначально были связаны со временем, которое тратится на перевод (условно если больше, чем n, то плохой, если меньше, то хороший). Но никаких других критериев на первый взгляд я не вижу. Я уже начинаю прям совсем отбитые гипотезы тестить и проверять даже кор/счета в проводках. Очень сложно искать закономерности, когда данные «грязные», те же плательщики в переводах не имеют какого-то общего вида. Условная ООО Ромашка может быть записана, как ООО Ромашка, так и ООО ромашка//сбербанк, улица Пушкина дом Колотушкина. Из-за этого очень тяжко фильтровать. А чистить эти грязные данные тоже тяжело (или может быть у меня недостаток скилла) Поделитесь лайфхаком, а то я уже отчаялся и начал придумывать кластеры вручную в эксельке, потому что через Юпитер ноут у меня ничего не получилось
· 14.07.2025
Тут вопрос ведения данных. Вычистить вручную сложно. Нужна нормализация. Вообще так вести данные нельзя))) но почему-то сейчас компании не хотят заморачиваться с выстраиванием процесса ведения данных, внедрением мдм систем. Даже если и внедряют, то рассматривают в первую очередь как хранилище данных
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён