Научил AI-агентов чистить данные
Вам пришли данные из внешнего источника. Вы открыли файл и поняли, что это грязные данные. Email в разном регистре, цены со странными минусами, даты в трех форматах. Плюс заказы ссылаются на несуществующих клиентов.
Хочется быстро все исправить и желательно автоматически, а не править данные вручную.
Решить эту проблему через систему с AI-агентами.
Как это может работать.
Система работает в двух режимах.
Режим обучения - здесь агенты учатся на контролируемых ошибках. Я беру чистые данные, специально добавляю в них проблемы (неправильный формат, опечатки, битые ссылки), и смотрю, как система их находит и исправляет. На контролируемых ошибках ясно, сработало ли решение.
Режим работы - здесь система работает с реальными данными. Анализирует, предлагает исправления, я подтверждаю или отклоняю, система применяет - и готово. Перед изменениями автоматически создаётся backup.
Три агента вместо одного безумца
Вместо одного агента, который исправляет всё подряд, у меня три, каждый отвечает за свой этап.
Агент 1 - аналитик, смотрит на данные и спрашивает: “Что здесь выглядит неправильно?”
Он видит, что большинство статусов написаны с маленькой буквы, а одна строка содержит “ACTIVE” - это выглядит странно. Или цена “50,00” вместо обычной “50.00” - тоже странновато.
Аналитик не исправляет. Он просто говорит: “Вот эти записи имеют проблемы, вот какие именно”.
Агент 2 - исправитель, получает список проблем и предлагает, что с ними делать. “ACTIVE” превратить в “active”? “50,00” парсить как “50.00”? Или оставить как есть и пометить для ручной проверки.
Тут исправитель старается быть умным. Смотрит на контекст: если все остальные цены написаны через точку, то “50,00” - скорее всего ошибка. Если это отрицательная цена, может быть, это возврат товара? Не ясно - пометит для ручной проверки.
Агент 3 - критик проверяет предложения исправителя. Согласен ли он с каждым предложением? “Да, явно нужно привести регистр к нижнему”. “Да, дата в неправильном формате”. “Нет, не нужно угадывать, отрицательная цена - это может быть все что угодно”.
Критик - охранник. Он останавливает ошибочные предложения перед тем, как они попадут в данные.
Итог: экономия времени
Вместо того чтобы смотреть все строки вручную: Строка 1 не трогалась Строка 2 автоматически исправлена (дата и статус) Строки 3-4 помечены для вашей проверки
Вы смотрите только 2 помеченные строки. На это уходит 5 минут вместо часов.
Система учится
После каждого запуска в режиме обучения система смотрит: какие исправления сработали? Какие проблемы устранились?
Если исправление “привести регистр к нижнему для enum-полей” сработало 100 раз подряд, система добавляет это в свой набор правил. В следующий раз она будет даже увереннее применять это правило.
Весь процесс записывается
Каждое действие (исправили или пометили) записывается в журнал с объяснением. Через месяц вы сможете посмотреть: что именно изменилось в строке, почему, и когда это случилось. Если что-то пошло не так - есть полная трассировка.
Разделение ответственности.
Один агент анализирует, другой предлагает, третий проверяет. Ни один не работает в вакууме. Анализ → предложения → критика. На каждом шаге есть точка, где система может сказать “нет, не уверена”.
Финальное решение принимает человек.
На что обратить внимание Такой подход имеет смысл, если: - Данные приходят извне (от партнёров, через API) - Есть четкая структура (таблицы, поля, связи) - Нужна автоматизация без риска испортить данные
Не стоит использовать, если: - Данные очень маленького объёма (проще вручную) - Данные совсем случайные и неструктурированные
AI нужен не для того, чтобы самому чинить данные, а чтобы помогать человеку быстро найти проблемы и предложить решения.
Результат: 90% автоматизации + 100% контроль. Система становится умнее, вы экономите время, данные остаются целыми.