Для ИИ две одинаковые «а» могут быть разными 🔤
Латинская «a» и кириллическая «а» во многих шрифтах выглядят почти одинаково, но имеют разные коды Unicode. Такая подмена называется конфузаблом. Она может незаметно появиться после копирования текста из PDF, сайта или чужого документа.
Для языковой модели это способно изменить токенизацию, а для системы вокруг неё — нарушить точный поиск, удаление дублей или проверку логина. Обычная Unicode-нормализация не объединяет буквы разных алфавитов.
Если ИИ обрабатывает домены, артикулы и идентификаторы, полезнее автоматически выявлять смешение письменностей, чем искать подмену глазами. Похожий вид ещё не означает одинаковые данные.