n1ro°
RU

Текст и данные · Инструкция

Searchable PDF или image PDF

Searchable PDF или image PDF. Image PDF хранит страницу как изображение, а searchable PDF добавляет распознанный текстовый слой OCR, благодаря чему документ можно искать и часто копировать; визуально оба файла могут.

Редакция N1RO · Проверено

Короткий ответ

Image PDF хранит страницу как изображение, а searchable PDF добавляет распознанный текстовый слой OCR, благодаря чему документ можно искать и часто копировать; визуально оба файла могут выглядеть одинаково.

Текстовый слой отличает searchable PDF

Некоторые документ-сканеры и фирменное ПО умеют создавать searchable PDF с OCR непосредственно в рабочем процессе. Поисковый текстовый слой не заменяет изображение оригинала: OCR может ошибаться в цифрах, фамилиях, таблицах и бледных фрагментах. Image-only PDF проще как цифровая фотография страницы, но полнотекстовый поиск и индексирование в нём невозможны без последующего OCR.

Совет: Зафиксируйте исходную точку: отсканируйте тестовый документ в PDF и попробуйте выделить мышью отдельное слово; отсутствие выделяемого текста часто указывает на image-only PDF.

Что делать по порядку

  1. 1. Отсканируйте тестовый документ в PDF и попробуйте выделить мышью отдельное слово; отсутствие выделяемого текста часто указывает на image-only PDF.
  2. 2. Используйте поиск по редкому слову или номеру из середины страницы, а не только по заголовку.
  3. 3. Если поиск не работает, включите OCR/searchable PDF в ПО сканера либо обработайте уже созданный PDF в OCR-программе.
  4. 4. Проверьте несколько чисел, дат и фамилий, сравнив распознанный текст с картинкой страницы.
  5. 5. Для массового потока настройте язык OCR и одинаковый профиль, затем выборочно контролируйте ошибки.

Важно: Не считайте OCR-текст юридически точной расшифровкой: при споре сверяйтесь с изображением оригинала.

Где искать следующий сигнал

Для архива полезно сохранять визуальный образ и проверять критичные поля по изображению, даже если поисковый слой успешно создан. Разрешение около 200–300 dpi часто используется для OCR, но качество исходника, язык и контраст существенно влияют на результат. Searchable PDF содержит изображение страницы и распознанный текстовый слой, поэтому документ можно искать, выделять и индексировать. Image PDF сохраняет только изображение и лучше подходит, если OCR не нужен или его будет выполнять другая система. Для рабочего процесса важнее проверить точность на ваших документах: кириллицу, таблицы, номера и мелкий шрифт. OCR-слой не следует считать безошибочной расшифровкой; при юридически значимых значениях сверяйтесь с изображением. Если задача — поиск по архиву, отсутствие текстового слоя резко снижает практическую ценность скана.

Предупреждение: Не удаляйте исходные изображения страниц только потому, что поиск начал работать.

Что проверить в рабочем сценарии

  • Совместимость/настройка. Отсканируйте тестовый документ в PDF и попробуйте выделить мышью отдельное слово; отсутствие выделяемого текста часто указывает на image-only PDF.
  • Тест документа. Используйте поиск по редкому слову или номеру из середины страницы, а не только по заголовку.
  • Риск. Не считайте OCR-текст юридически точной расшифровкой: при споре сверяйтесь с изображением оригинала.

Ограничения и безопасность

Не считайте OCR-текст юридически точной расшифровкой: при споре сверяйтесь с изображением оригинала. Не удаляйте исходные изображения страниц только потому, что поиск начал работать. OCR-слой может содержать ошибки, поэтому для сумм, номеров и подписей эталоном остаётся изображение исходной страницы.

Что учитывать

Не считайте OCR-текст юридически точной расшифровкой: при споре сверяйтесь с изображением оригинала. Не удаляйте исходные изображения страниц только потому, что поиск начал работать. OCR-слой может содержать ошибки, поэтому для сумм, номеров и подписей эталоном остаётся изображение исходной страницы.

Источники и проверка

Инструкция составлена редакцией N1RO на 2026-09-23. Перед действием сверьте актуальные условия на официальном сайте сервиса или производителя.