Python (6/10)

Анализ текстовых данных: основы обработки строк в Python для аналитиков (6/10)

Текстовые данные - одна из самых нестабильных и интересных частей анализа. Они бывают отзывами, комментариями, названиями продуктов, email-адресами и многим другим. Чтобы извлечь из них полезные инсайты, важно уметь правильно работать со строками. Сегодня расскажу о базовых методах и приведу много практических примеров!

Проверка и преобразование регистра  text = "Data Analytics" print(text.lower())  # 'data analytics' print(text.upper())  # 'DATA ANALYTICS' print(text.title())  # 'Data Analytics' Обрезка пробелов  text = "  hello world  " print(text.strip())   # 'hello world' print(text.lstrip())  # 'hello world  ' print(text.rstrip())  # '  hello world' Поиск подстроки  text = "machine learning" print(text.find('learn'))  # 8 (индекс начала) print(text.find('data'))   # -1 (не найдено) Проверка вхождения  text = "big data" print('data' in text)    # True print(text.startswith('big')) # True print(text.endswith('base'))  # False Разбиение строки  text = "apple, banana, cherry" fruits = text.split(', ') print(fruits)  # ['apple', 'banana', 'cherry'] Объединение списка строк  words = ['data', 'science', 'is', 'fun'] sentence = ' '.join(words) print(sentence)  # 'data science is fun' Замена подстроки  text = "I love data analytics" new_text = text.replace('data', 'big data') print(new_text)  # 'I love big data analytics' Категоризация на основе ключевых слов  reviews = ["Loved the product", "Not satisfied", "Excellent quality", "Could be better"] categories = [] for review in reviews:     if 'love' in review.lower():         categories.append('Positive')     elif 'not' in review.lower():         categories.append('Negative')     else:         categories.append('Neutral') print(categories)  # ['Positive', 'Negative', 'Neutral', 'Neutral'] Удаление нежелательных символов (чистка текста)  import re text = "Hello!!! This is great... :)" clean_text = re.sub(r'[^\w\s]', '', text)  print(clean_text)  # 'Hello This is great ' Освоение этих базовых методов обработки строк это первый шаг к эффективному анализу текстов. Они помогут преобразовать сырые тексты в удобные для дальнейшего анализа категории, фильтры и метрики. В следующих постах рассмотрим продвинутые техники NLP, тональный анализ, работу с большими текстовыми массивами.

Запомните, даже самый спокойный медведь умеет рычать, когда надо. Берегите голову, берегите данные — и пусть в вашем дне будет немного тишины, ясности и добрых переменных.