У сканированного PDF может быть невидимый второй текст

Поисковый PDF часто хранит сразу два слоя: фотографию страницы, которую видите вы, и результат OCR — распознавания символов. Если ИИ-сервис извлекает содержимое файла, он может получить именно этот скрытый слой.

Отсюда странный эффект: в ответе появляется слово, которого будто нет на странице, или исчезает важная приписка. Модель не обязательно фантазирует — возможно, OCR ошибся или не заметил рукописное исправление.

Для важного документа скопируйте подозрительный абзац и сравните его с изображением страницы. Если тексты расходятся, нужен повторный OCR либо анализ самого скана, а не только содержимого PDF.

#ИИбезмагии #OCR #PDF

У сканированного PDF может быть невидимый второй текст
Поисковый PDF часто хранит сразу два слоя: фотографию страницы, которую видите вы, и результат OCR — распознавания символов | Сетка — социальная сеть от hh.ru