Как мы обучили LLM распознавать имена на двух языках
В 2025 году мы работали над ИИ-ботом для крупной Edtech-компании Казахстана. Одна из задач — пропускать через модель сообщения пользователей, не раскрывая персональные данные. Особенно ФИО. 🟣 Передавать в языковую модель имена и фамилии нельзя. Это риски утечек и нарушение законодательства. Поэтому данные нужно найти и зашифровать, а уже потом отправлять в LLM. Почему задача была сложной: 1⃣ Нужно было выделять русские и казахские имена, отчества и фамилии. 2⃣ Русский язык богат падежами и склонениями, одно имя может встречаться в десятках форм. 3⃣ Готовые решения вроде Natasha или DeepPavlov не подошли. 🟣 Для решения проблемы мы использовали технологию NER (Named Entity Recognition) — она помогает находить в текстах имена, адреса, даты рождения и другие сущности. Подробно о NER мы рассказывали в предыдущем посте.
🟣 Мы дообучили модель, которая теперь точно распознаёт ФИО на русском и казахском. Она работает быстро, легко обрабатывает большое количество сообщений и готова к новым задачам — при желании её можно натренировать для поиска любой другой информации, от номеров ИНН до названий фруктов. 👉 Полный разбор кейса и технических деталей от ML-инженера arcsinus Тимофея Кузнецова — в блоге.