Текст и данные · Инструкция
Searchable PDF или image PDF
Searchable PDF или image PDF. Image PDF хранит страницу как изображение, а searchable PDF добавляет распознанный текстовый слой OCR, благодаря чему документ можно искать и часто копировать; визуально оба файла могут.
Короткий ответ
Image PDF хранит страницу как изображение, а searchable PDF добавляет распознанный текстовый слой OCR, благодаря чему документ можно искать и часто копировать; визуально оба файла могут выглядеть одинаково.
Текстовый слой отличает searchable PDF
Некоторые документ-сканеры и фирменное ПО умеют создавать searchable PDF с OCR непосредственно в рабочем процессе. Поисковый текстовый слой не заменяет изображение оригинала: OCR может ошибаться в цифрах, фамилиях, таблицах и бледных фрагментах. Image-only PDF проще как цифровая фотография страницы, но полнотекстовый поиск и индексирование в нём невозможны без последующего OCR.
Совет: Зафиксируйте исходную точку: отсканируйте тестовый документ в PDF и попробуйте выделить мышью отдельное слово; отсутствие выделяемого текста часто указывает на image-only PDF.
Что делать по порядку
- 1. Отсканируйте тестовый документ в PDF и попробуйте выделить мышью отдельное слово; отсутствие выделяемого текста часто указывает на image-only PDF.
- 2. Используйте поиск по редкому слову или номеру из середины страницы, а не только по заголовку.
- 3. Если поиск не работает, включите OCR/searchable PDF в ПО сканера либо обработайте уже созданный PDF в OCR-программе.
- 4. Проверьте несколько чисел, дат и фамилий, сравнив распознанный текст с картинкой страницы.
- 5. Для массового потока настройте язык OCR и одинаковый профиль, затем выборочно контролируйте ошибки.
Важно: Не считайте OCR-текст юридически точной расшифровкой: при споре сверяйтесь с изображением оригинала.
Где искать следующий сигнал
Для архива полезно сохранять визуальный образ и проверять критичные поля по изображению, даже если поисковый слой успешно создан. Разрешение около 200–300 dpi часто используется для OCR, но качество исходника, язык и контраст существенно влияют на результат. Searchable PDF содержит изображение страницы и распознанный текстовый слой, поэтому документ можно искать, выделять и индексировать. Image PDF сохраняет только изображение и лучше подходит, если OCR не нужен или его будет выполнять другая система. Для рабочего процесса важнее проверить точность на ваших документах: кириллицу, таблицы, номера и мелкий шрифт. OCR-слой не следует считать безошибочной расшифровкой; при юридически значимых значениях сверяйтесь с изображением. Если задача — поиск по архиву, отсутствие текстового слоя резко снижает практическую ценность скана.
Предупреждение: Не удаляйте исходные изображения страниц только потому, что поиск начал работать.
Что проверить в рабочем сценарии
- Совместимость/настройка. Отсканируйте тестовый документ в PDF и попробуйте выделить мышью отдельное слово; отсутствие выделяемого текста часто указывает на image-only PDF.
- Тест документа. Используйте поиск по редкому слову или номеру из середины страницы, а не только по заголовку.
- Риск. Не считайте OCR-текст юридически точной расшифровкой: при споре сверяйтесь с изображением оригинала.
Ограничения и безопасность
Не считайте OCR-текст юридически точной расшифровкой: при споре сверяйтесь с изображением оригинала. Не удаляйте исходные изображения страниц только потому, что поиск начал работать. OCR-слой может содержать ошибки, поэтому для сумм, номеров и подписей эталоном остаётся изображение исходной страницы.
Что учитывать
Не считайте OCR-текст юридически точной расшифровкой: при споре сверяйтесь с изображением оригинала. Не удаляйте исходные изображения страниц только потому, что поиск начал работать. OCR-слой может содержать ошибки, поэтому для сумм, номеров и подписей эталоном остаётся изображение исходной страницы.
Источники и проверка
Инструкция составлена редакцией N1RO на 2026-09-23. Перед действием сверьте актуальные условия на официальном сайте сервиса или производителя.