Как мы обучили LLM распознавать имена на двух языках

В 2025 году мы работали над ИИ-ботом для крупной Edtech-компании Казахстана. Одна из задач — пропускать через модель сообщения пользователей, не раскрывая персональные данные. Особенно ФИО.    🟣 Передавать в языковую модель имена и фамилии нельзя. Это риски утечек и нарушение законодательства. Поэтому данные нужно найти и зашифровать, а уже потом отправлять в LLM.    Почему задача была сложной:  1⃣ Нужно было выделять русские и казахские имена, отчества и фамилии.  2⃣ Русский язык богат падежами и склонениями, одно имя может встречаться в десятках форм.  3⃣ Готовые решения вроде Natasha или DeepPavlov не подошли.    🟣 Для решения проблемы мы использовали технологию NER (Named Entity Recognition) — она помогает находить в текстах имена, адреса, даты рождения и другие сущности. Подробно о NER мы рассказывали в предыдущем посте.

🟣 Мы дообучили модель, которая теперь точно распознаёт ФИО на русском и казахском. Она работает быстро, легко обрабатывает большое количество сообщений и готова к новым задачам — при желании её можно натренировать для поиска любой другой информации, от номеров ИНН до названий фруктов.    👉 Полный разбор кейса и технических деталей от ML-инженера arcsinus Тимофея Кузнецова — в блоге.

Как мы обучили LLM распознавать имена на двух языках | Сетка — социальная сеть от hh.ru