Последнее время всё чаще приходится парсить сайты. Пока не буду раскрывать, зачем именно, — позже сделаю об этом отдельную серию постов.

Конечно, можно использовать для этого, например, Claude Code, но это скорее вариант «стрелять из пушки по воробьям». Для подобных задач есть специализированные инструменты, которые во многих случаях удобнее и эффективнее.

Собрал 10 бесплатных проектов с GitHub, которые точно стоит добавить в закладки:

1. Firecrawl https://github.com/firecrawl/firecrawl Сканирует практически любой сайт, обходит все страницы, рендерит JavaScript и возвращает чистые, структурированные данные, которые отлично подходят для работы с LLM. Более 155 000 ⭐.

2. Crawl4AI https://github.com/unclecode/crawl4ai Один из самых популярных инструментов для подготовки сайтов к работе с ИИ. Превращает страницы в аккуратный Markdown. Более 74 000 ⭐. Лицензия Apache 2.0.

3. Browser Use https://github.com/browser-use/browser-use ИИ-агент, который управляет браузером как человек: нажимает кнопки, прокручивает страницы, авторизуется, заполняет формы и собирает нужные данные. Более 100 000 ⭐. Лицензия MIT.

4. Crawlee https://github.com/apify/crawlee Мощный фреймворк для профессионального веб-скрапинга. Поддерживает ротацию прокси, автоматические ретраи, подмену отпечатка браузера и управление очередями.

5. Scrapy https://github.com/scrapy/scrapy Классический промышленный фреймворк для скрапинга. Подходит для обхода миллионов страниц, извлечения данных и их экспорта в удобном формате.

6. MarkItDown https://github.com/microsoft/markitdown Проект Microsoft, который преобразует веб-страницы и файлы (PDF, Office-документы, изображения, аудио и многое другое) в Markdown. Более 168 000 ⭐.

7. Scrapling https://github.com/D4Vinci/Scrapling Умеет адаптироваться к изменениям структуры сайтов и помогает обходить многие механизмы защиты от скрапинга.

8. scrcpy https://github.com/Genymobile/scrcpy Полезен, если данные находятся внутри Android-приложений без веб-версии. Позволяет взаимодействовать с устройством и автоматизировать извлечение информации. Более 145 000 ⭐. Лицензия Apache 2.0.

9. AutoScraper https://github.com/alirezamika/autoscraper Достаточно показать пример нужных данных — инструмент сам определит шаблон и сможет извлекать аналогичную информацию со всего сайта.

10. curl-impersonate https://github.com/lwthiker/curl-impersonate Модифицированная версия curl, которая максимально точно имитирует сетевой отпечаток популярных браузеров. Благодаря этому запросы выглядят как обычный трафик реального пользователя.