SurpriseRus: как я ищу удивление в русскоязычных отзывах
Я исследую, как проявляется удивление в русскоязычных отзывах. Результат — открытый датасет SurpriseRus на 55k+ отзывов и готовый код, автоматически размечающий тексты по эмоциональным категориям.
Ключевые результаты:
• 55 421 размеченный отзыв, 20% из которых содержат удивление. • 3 уровня интенсивности: слабое (8.9%), среднее (9.8%), сильное (1.2%). • 26 эмоциональных категорий с весовыми коэффициентами, включая «Интерес», «Неожиданность», «Отрицание», «Смущение» и другие.
Для разметки я подготовила методологию: • лемматизация с обработкой эмодзи и капса • семантическое взвешивание по 26 категориям • rule-based классификация с тремя уровнями интенсивности.
Проект помогает лучше понимать эмоциональную реакцию пользователей на товары и услуги: когда отзыв действительно удивляет, а когда оставляет равнодушным.
Ссылки: Датасет: https://huggingface.co/datasets/ValeriaMagnatka/SurpriseRus Код: https://github.com/ValeriaMagnatka/surprise_dataset
Буду рада вашим вопросам, идеям и звездочкам на репозиториях! 🌟
#NLP #русскийязык #датасет #анализэмоций #сентиментанализ #машинноеобучение