pdf-inspector мгновенно определяет, нужно ли вам OCR: за 10–50 мс помечает страницы как текстовые, сканированные или смешанные и потом извлекает позиционно‑осведомленный текст и таблицы в чистый Markdown — без ML и без внешних сервисов.
Полезно для тех, кто массово конвертирует отчёты, научные статьи или счета: точнее и в 2–40× быстрее конкурентов на локальных коллекциях благодаря умной выборке, поддержке CID‑шрифтов, мультиколоночности и экспортам в WebAssembly/Python/Node.
Можете запустить на папке с отчётами/инвойсами, автоматически детектировать страницы, пропустить OCR только для нужных страниц и сохранить каждый документ как структурированный Markdown + таблицы — готовый к поиску, вёрстке и выгрузке в базу.
Не знаю, как будет работать с русским языком, надеюсь ОК.
tg / max
В этом посте были ссылки, но мы их удалили по правилам Сетки