😳 Главная фишка Bash — это пайпы (pipes). Это когда вы соединяете несколько простых инструментов в одну мощную цепочку
Кто-то спросит: «Зачем мне этот bash, если я могу написать df.groupby().count() в Python или сделать Select в SQL?» Ответ простой: Чтобы сделать это в Python, вам нужно запустить ноутбук, импортировать библиотеки и дождаться, пока файл зальется в оперативку. Чтобы сделать это в SQL, данные сначала нужно импортировать в базу. Bash делает это «на лету» с любым объемом данных
Допустим, у нас огромный лог покупок orders.csv, и нам нужно быстро вытащить Топ-5 самых популярных товаров
👍 Вместо того чтобы писать скрипт, пишем в терминале одну строку:
cat orders.csv | cut -d',' -f2 | sort | uniq -c | sort -rn | head -n 5
• cat — открываем файл (стримим данные, не забивая память) • cut — «отрезаем» только нужную колонку с ID товара • sort — выстраиваем всё в ряд (подготавливаем почву для подсчета) • uniq -c — схлопываем дубли и сразу считаем, сколько раз встретился каждый товар • sort -rn — сортируем результат по количеству (от большего к меньшему) • head -n 5 — оставляем только финальную пятерку лидеров
👍 Из таких простых кирпичиков можно собрать автоматизацию любой сложности. Если начали замечать, что делаете в терминале одно и то же — просто сохраните это в .sh файл, и у вас готов личный инструмент для обработки данных