Разработка NLP-модели для автоматического извлечения данных из PDF-файлов с помощью библиотек pdfminer, pdfplumber, PyPDF2 и OCR через pytesseract для отсканированных документов.