SurpriseRus: как я ищу удивление в русскоязычных отзывах

Я исследую, как проявляется удивление в русскоязычных отзывах. Результат — открытый датасет SurpriseRus на 55k+ отзывов и готовый код, автоматически размечающий тексты по эмоциональным категориям.

Ключевые результаты:

55 421 размеченный отзыв, 20% из которых содержат удивление. • 3 уровня интенсивности: слабое (8.9%), среднее (9.8%), сильное (1.2%). • 26 эмоциональных категорий с весовыми коэффициентами, включая «Интерес», «Неожиданность», «Отрицание», «Смущение» и другие.

Для разметки я подготовила методологию: • лемматизация с обработкой эмодзи и капса • семантическое взвешивание по 26 категориям • rule-based классификация с тремя уровнями интенсивности.

Проект помогает лучше понимать эмоциональную реакцию пользователей на товары и услуги: когда отзыв действительно удивляет, а когда оставляет равнодушным.

Ссылки: Датасет: https://huggingface.co/datasets/ValeriaMagnatka/SurpriseRus Код: https://github.com/ValeriaMagnatka/surprise_dataset

Буду рада вашим вопросам, идеям и звездочкам на репозиториях! 🌟

#NLP #русскийязык #датасет #анализэмоций #сентиментанализ #машинноеобучение

SurpriseRus: как я ищу удивление в русскоязычных отзывах | Сетка — социальная сеть от hh.ru SurpriseRus: как я ищу удивление в русскоязычных отзывах | Сетка — социальная сеть от hh.ru