Опрос для тех, кто сталкивался с веб-парсингом! 🚀 Недавно наткнулся на тред, где обсуждали два подхода: использовать headless-браузеры или частные API. И если вы хоть раз парсили данные с сайтов, наверняка знаете эту дилемму.
Вот, что пишут:
Частные API — это мечта. Чистый JSON, никаких лишних телодвижений, минимум кода. Многие говорят: «Нашёл API — считай, 99% работы сделано». Но API есть далеко не всегда, и, кстати, иногда их тоже меняют (да, и такое бывает). Headless-браузеры — мощный, но тяжёлый инструмент. Они отлично обходят защиту от ботов, но требуют много памяти, времени и, конечно, денег. Плюс эти капчи… ну вы поняли. 💡 Один из участников поделился лайфхаком: можно комбинировать оба подхода. Используешь headless-браузер, чтобы получить сессию/куки, а потом уже спокойно работаешь с API.
Ещё кто-то попробовал кормить страницы ИИ, чтобы тот доставал нужные данные. На удивление, работает!
P. S. В треде много говорили, что цены на SaaS-сервисы для парсинга упали, и иногда проще заплатить, чем возиться самому.
📌 А как вы подходите к этой задаче? API, headless-браузеры, Beautiful Soup, а может, что-то другое?
Рогачев Дмитрий: ИТ бизнес без рокетсайн 🚀 https://t.me/itrubiz
· 26.12.2024
Комбинирую лично все вместе, кроме SaaS сервисов Парсинга
В том числе под капчу и нейросети обучаю - под большие объемы даже можно рукапчу использовать Но если 10-15 секунд ждать не допустимо - тут только человека или нейросеть сажать (вторая работает круглосуточно, без перерывов и зарплату не требует)
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён