Python (6/10)
Анализ текстовых данных: основы обработки строк в Python для аналитиков (6/10)
Текстовые данные - одна из самых нестабильных и интересных частей анализа. Они бывают отзывами, комментариями, названиями продуктов, email-адресами и многим другим. Чтобы извлечь из них полезные инсайты, важно уметь правильно работать со строками. Сегодня расскажу о базовых методах и приведу много практических примеров!
Проверка и преобразование регистра text = "Data Analytics" print(text.lower()) # 'data analytics' print(text.upper()) # 'DATA ANALYTICS' print(text.title()) # 'Data Analytics' Обрезка пробелов text = " hello world " print(text.strip()) # 'hello world' print(text.lstrip()) # 'hello world ' print(text.rstrip()) # ' hello world' Поиск подстроки text = "machine learning" print(text.find('learn')) # 8 (индекс начала) print(text.find('data')) # -1 (не найдено) Проверка вхождения text = "big data" print('data' in text) # True print(text.startswith('big')) # True print(text.endswith('base')) # False Разбиение строки text = "apple, banana, cherry" fruits = text.split(', ') print(fruits) # ['apple', 'banana', 'cherry'] Объединение списка строк words = ['data', 'science', 'is', 'fun'] sentence = ' '.join(words) print(sentence) # 'data science is fun' Замена подстроки text = "I love data analytics" new_text = text.replace('data', 'big data') print(new_text) # 'I love big data analytics' Категоризация на основе ключевых слов reviews = ["Loved the product", "Not satisfied", "Excellent quality", "Could be better"] categories = [] for review in reviews: if 'love' in review.lower(): categories.append('Positive') elif 'not' in review.lower(): categories.append('Negative') else: categories.append('Neutral') print(categories) # ['Positive', 'Negative', 'Neutral', 'Neutral'] Удаление нежелательных символов (чистка текста) import re text = "Hello!!! This is great... :)" clean_text = re.sub(r'[^\w\s]', '', text) print(clean_text) # 'Hello This is great ' Освоение этих базовых методов обработки строк это первый шаг к эффективному анализу текстов. Они помогут преобразовать сырые тексты в удобные для дальнейшего анализа категории, фильтры и метрики. В следующих постах рассмотрим продвинутые техники NLP, тональный анализ, работу с большими текстовыми массивами.
Запомните, даже самый спокойный медведь умеет рычать, когда надо. Берегите голову, берегите данные — и пусть в вашем дне будет немного тишины, ясности и добрых переменных.
· 29.10.2025
Ох, прям ностальгия напала, когда увидел код. Вспомнил, как все это происходил) А тут как всегда полезный материал для всех
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён