Как работать с большими данными при помощи ЫЫ)))

Речь не про «мелкие» датасеты на 100–1000 строк. На практике вы можете столкнуться с массивами в десятки тысяч записей: 5 000, 50 000 и более. Вот я столкнуося с 100 000+ строк 😷

😏Зачем вам это знать? Ответ: а как вы хотите разобраться с данными за огромный промежуток времени? 🤔

Обычно типичный источник в любом бизнесе: ATS, CRM или любые системы, куда данные годами заносились вручную в любой форме. Данные там почти всегда: ➖ неструктурированные поля (комментарии, заметки, описания); ➖ разный стиль ввода (заполняют разные люди); ➖ ошибки, сокращения, и прочая «гразь».

🔫Попытка “скормить слона” ИИ целиком в 99,9% гарантированно даст плохой результат: ➖ модель теряет контекст из-за ограничений окна; ➖ растёт уровень галлюцинаций; ➖ ответы становятся нестабильными;

Тут важно уяснить, что проблема вообще не в модели, а в архитектуре обработки.

🤯Почему ИИ «делает ерунду»? LLM не понимает данные “как человек”. Она работает через вероятностное сопоставление токенов. Без явного контекста она: ➖ тупо не знает, какие категории важны; ➖ не понимает бизнес-логики; ➖ начинает “додумывать” структуру;

Например, если вы попросите: «Классифицируй кандидатов по специализациям» или «Сделай с моим эхсэль файликом так, чтобы все было рОвно и чОтко»

Конечно модель сама придумает категории. Причем они будут нестабильны от запроса к запросу.

Базовый принцип: сначала структура (каркас), потом ИИ Это как с шашлыками. Мы сначала нанизываем мясо на шампур, а не наоборот.

🧛‍♂️Перед использованием ИИ в таких задачах нужно задать жесткую систему понятий и координат: Определить конечный результат Не «что-то структурировать», а конкретно: ➖ классификация по ролям; ➖ нормализация навыков; ➖ выделение сущностей;

☕️Создать справочник В котором будет задан: ➖ список категорий; ➖ их описание; ➖ примеры; Пример примера 😛: “Аналитик данных” — работа с SQL, BI, отчетность “Исследователь данных” — ML, модели, Python, статистика ➖Зафиксировать правила Например: - можно выбирать только из списка - если не подходит, то значит другое - не придумывать новые категории

🥚Ключевая техника: декомпозиция (разделение на чанки) Большой массив нельзя обрабатывать целиком. Его нужно разбивать: ➖ как пример на 10–100 строк за итерацию ➖ без передачи предыдущих результатов в контекст

🌻Зачем это все делать? ➖ модель не “засоряет” память предыдущими ответами; ➖каждый батч обрабатывается независимо; ➖ результат становится стабильным

🏄‍♂️Пример архитектуры: 1️⃣ Делим данные на батчи 2️⃣ Для каждого батча подставляем справочник 3️⃣ Передаем данные 4️⃣ Получаем структурированный ответ 5️⃣ Сохраняем результат 6️⃣ Переходим к следующему батчу

Надеюсь получилось понятно и без сильной духоты 🧱

Как работать с большими данными при помощи ЫЫ))) | Сетка — социальная сеть от hh.ru