n1ro°
RU

Ошибки и коды · Инструкция

OCR плохо распознаёт кириллицу: как улучшить скан

Если OCR плохо распознаёт кириллицу, первым делом выберите русский язык распознавания и проверьте качество самого скана.

Редакция N1RO · Проверено

Короткий ответ

Как улучшить распознавание русского текста OCR: выбрать язык, исправить наклон и контраст, создать Searchable PDF и проверить скрытый текстовый слой.

Как подготовить скан для OCR кириллицы

  1. Пересканируйте страницу без перекоса и теней по краям.
  2. В OCR выберите русский язык или русский+английский для смешанного документа.
  3. Начните с 300 dpi; для мелкого текста сравните результат с 400–600 dpi.
  4. Отключите чрезмерное повышение резкости, если вокруг букв появились ореолы.
  5. После распознавания проверьте даты, суммы, номера и фамилии вручную.

Предупреждение: Не доверяйте OCR критичным числам без проверки: 0/О, 1/I, 3/З и похожие символы могут подменяться даже при хорошем скане.

Какие настройки языка и разрешения дают разницу

OCR ошибается чаще на мелком шрифте, низком контрасте, декоративных гарнитурах и фото с перспективой. Повышение до 600 dpi имеет смысл для очень мелкого текста, но увеличивает файл и время обработки. Если выбран только английский язык, кириллические символы часто заменяются похожими латинскими. Epson Scan 2 при создании Searchable PDF предлагает Text Language — язык текста документа, который OCR использует для распознавания. Поэтому англоязычный профиль для русской страницы закономерно увеличивает ошибки, особенно в похожих символах. Перед повторным OCR выровняйте страницу, уберите тени у корешка, проверьте резкость и не применяйте чрезмерное сжатие. Если документ смешанный, выбирайте режим и языки, которые реально поддерживает используемое OCR-приложение, а не предполагайте автоматическое определение. Для таблиц и бланков сначала добейтесь ровных строк и хорошего контраста, а уже потом повышайте разрешение. OCR чаще ошибается не из-за недостатка dpi, а из-за перекоса, теней, грязного фона и неверно выбранного языка распознавания.

Совет: Для пачки однотипных документов сначала настройте одну эталонную страницу, а потом применяйте профиль ко всей серии.

Как проверить скрытый текстовый слой PDF

  • В OCR выбран русский язык или корректная языковая комбинация.
  • Страница отсканирована без заметного наклона и размытия.
  • Фон не съедает тонкие штрихи букв.
  • Searchable PDF действительно ищет русские слова, а не только показывает картинку.
  • Отдельно проверены фамилии, цифры и короткие коды, где ошибка особенно критична.

Где OCR чаще всего ошибается

Не доверяйте OCR критичным числам без проверки: 0/О, 1/I, 3/З и похожие символы могут подменяться даже при хорошем скане. Проверяйте результат не по внешнему виду PDF, а по поиску и копированию нескольких сложных слов: изображение страницы может выглядеть идеально, а скрытый текстовый слой быть ошибочным. Для таблиц и мелкого шрифта полезно отдельно проверить цифры, «О/0», «З/3», дефисы и аббревиатуры. Если исходник — фотография со световым градиентом, сначала добейтесь равномерного контраста и ровной геометрии. Повторное распознавание того же плохого изображения обычно даёт те же ошибки.

Важно: Если исходник — фотография под углом, сначала исправьте перспективу и контраст; увеличение dpi само по себе геометрию не исправляет.

Что учитывать

Условия меняются. Страница отражает состояние на 2026-09-22; при расхождении с официальной документацией приоритет у первоисточника.

Источники и проверка

Инструкция составлена редакцией N1RO на 2026-09-22. Перед действием сверьте актуальные условия на официальном сайте сервиса или производителя.