Собрал открытый каталог из 64 признаков, по которым русский
Привет, меня зовут Илья, уже несколько месяцев я развиваю Open Source проект humanizer-ru
Нейрослоп заполонил интернет и бороться с ним бессмысленно - но можно попытаться сделать его более человекочиаемым.
Обычно нейрослоп палиться типичными паттернами генерации, даже если в нем есть авторская позиция
Обычно хуманайзеры строят по верх Английских списков признаков нейросети («delve», тройки прилагательных, длинное тире) на русский переводятся лишь наполовину или вовсе не работают
Но многие забывают о паттернах характерных для нейрослопа на Русском: «является» через предложение, кальки вроде «делает разницу», пропавшие частицы «же», «ведь», «вот», «не просто X, а Y» в каждом втором абзаце. Модели генерируют русский через английский слой, и это видно.
Собрал каталог: 64 признака в 14 категориях и 21 конструкция под полный запрет, когда фразу не чинят, а удаляют. Плюс сканер: вставляешь текст, получаешь балл чистоты от 0 до 100 с подсветкой оборотов.
Дальше проверил каталог на данных, и это самое интересное Три открытых корпуса, 55 тысяч размеченных текстов, включая GigaChat и YandexGPT
Оказалось, что на научных аннотациях мои же правила ловили людей чаще, чем машины: «является» и «данный» там норма жанра
Пришлось делать жанровый фильтр. А длинное тире зависит от жанра сильнее, чем от автора: в энциклопедических статьях его ставят люди, в отзывах и историях машины.
Про ограничения. Лучший русский детектор на бенчмарке AINL-Eval 2025 даёт 86%, каждый седьмой вердикт мимо. Поэтому цель не обмануть проверку, а убрать канцелярит и штампы, чтобы текст читался как написанный человеком. Число сканера это повод для правки, а не приговор.
Всё открыто, MIT: github.com/ilyautov/humanizer-ru живое демо без установки: humanizer-ru.aifrontier.tech
Работает как скилл для Claude Code, Cursor, Codex. Какие признаки я пропустил? По чему вы сами узнаёте текст нейросети?