PDF может быть распознан верно — и прочитан в неверном порядке

OCR решает две разные задачи: узнаёт символы и определяет, какой фрагмент идёт следующим. На странице с двумя колонками, сноской и подписью все слова могут быть считаны точно, но система склеит строку слева со строкой справа. В итоге ИИ получает грамматически странный текст, а затем пересказывает уже испорченный вход.

Перед саммари откройте извлечённый текст и проверьте начало абзацев, колонки и подписи. Если порядок сбит, используйте распознавание с учётом макета или обрабатывайте колонки отдельно. Иногда чинить нужно не модель, а маршрут текста по странице.

#ИИ #OCR #Документы

PDF может быть распознан верно — и прочитан в неверном порядке
OCR решает две разные задачи: узнаёт символы и определяет, какой фрагмент идёт следующим | Сетка — социальная сеть от hh.ru