pdf-inspector мгновенно определяет, нужно ли вам OCR: за 10–50 мс помечает страницы как текстовые, сканированные или смешанные и потом извлекает позиционно‑осведомленный текст и таблицы в чистый Markdown — без ML и без внешних сервисов.

Полезно для тех, кто массово конвертирует отчёты, научные статьи или счета: точнее и в 2–40× быстрее конкурентов на локальных коллекциях благодаря умной выборке, поддержке CID‑шрифтов, мультиколоночности и экспортам в WebAssembly/Python/Node.

Можете запустить на папке с отчётами/инвойсами, автоматически детектировать страницы, пропустить OCR только для нужных страниц и сохранить каждый документ как структурированный Markdown + таблицы — готовый к поиску, вёрстке и выгрузке в базу.

firecrawl/pdf-inspector

Не знаю, как будет работать с русским языком, надеюсь ОК.

tg / max


В этом посте были ссылки, но мы их удалили по правилам Сетки

pdf-inspector мгновенно определяет, нужно ли вам OCR: за 10–50 мс помечает страницы как текстовые, сканированные или смешанные и потом извлекает позиционно‑осведомленный текст и таблицы в чистый Markd... | Сетка — социальная сеть от hh.ru