n1ro°
RU

Текст и данные · Инструкция

Как сканировать в Word, Excel и PowerPoint на Epson через OCR

Сканировать в Word, Excel и PowerPoint означает сначала получить изображение страницы, затем распознать текст и.

Редакция N1RO · Проверено

Короткий ответ

Для редактируемого Word/Excel/PowerPoint нужен OCR, а не простое сохранение изображения. На совместимых решениях Epson доступны форматы DOCX, XLSX и PPTX; для текстового OCR Epson рекомендует около 300 dpi как практическое разрешение, после чего результат обязательно вычитывают — сложные таблицы и макет распознаются не идеально.

Почему обычный PDF не превращается в Word сам

Сканер по своей природе получает растровое изображение страницы — набор пикселей, а не символы и ячейки таблицы. OCR анализирует это изображение, распознаёт буквы и пытается восстановить структуру документа. Только после этого приложение может сформировать DOCX, XLSX или PPTX, где содержимое становится редактируемым. Если сохранить простой image PDF без OCR, Word увидит страницу главным образом как изображение. Поэтому первым диагностическим вопросом должно быть не «какой формат файла», а «включено ли распознавание текста».

Совет: Для обычного печатного текста начните с 300 dpi и улучшайте исходник, а не автоматически ставьте максимальное разрешение.

Почему 300 dpi обычно достаточно для текста

В справке Epson для OCR и дальнейшего редактирования текста приводится ориентир 300 dpi. Увеличение до 600 dpi удваивает линейное разрешение и резко увеличивает объём данных, но не гарантирует вдвое более точное распознавание. Для обычного хорошо напечатанного текста 300 dpi чаще даёт разумный баланс скорости, файла и детализации. Мелкий шрифт, бледная печать или штамп могут потребовать отдельного теста, а не автоматического максимума. Куда важнее ровный лист, правильная экспозиция и отсутствие грязи на стекле или полос ADF.

Когда 300 dpi мало и почему 600 dpi не является универсальным лечением

Для обычного OCR Epson рекомендует 300 dpi как базовый ориентир, а в других актуальных руководствах указывает диапазон примерно 200–300 dpi для преобразования в редактируемый текст. Но разрешение нужно соотносить с размером символов и качеством оригинала. В одном из руководств Epson для OCR приведён пример: около 10 pt — 300 dpi, а очень мелкий текст порядка 5 pt — 600 dpi. Это показывает, почему нельзя превращать правило «300 dpi» в догму. Если мелкие подписи распознаются плохо, сначала сделайте тест одной страницы на 300 и 600 dpi и сравните реальные ошибки, размер файла и время обработки. Для крупного текста чрезмерное разрешение тоже не обязательно улучшает распознавание. Перед повышением DPI устраните более простые причины: перекос, грязную полосу ADF, неверный язык OCR, слабый контраст и слишком сильное фоновое изображение. Поднимать разрешение имеет смысл после такого контрольного теста, а не автоматически для всей пачки.

Как выбрать формат экспорта

  • DOCX. Текстовые документы. Абзацы, заголовки, переносы, номера
  • XLSX. Таблицы и числовые формы. Колонки, объединённые ячейки, десятичные разделители
  • PPTX. Слайды/презентационный макет. Положение блоков, изображения, шрифты
  • Searchable PDF. Сохранить вид страницы + поиск. Текстовый слой и соответствие оригиналу

Когда выбирать DOCX, XLSX или PPTX

DOCX подходит для писем, договоров и обычных текстовых страниц, где главным результатом является редактируемый текст. XLSX имеет смысл для таблиц, но OCR должен не только прочитать символы, а правильно восстановить строки, столбцы и границы; сложная форма часто требует ручной правки. PPTX нужен, когда исходник ближе к слайду или презентационному макету, но расположение объектов также может восстановиться приблизительно. Не выбирайте Excel только потому, что на странице есть одна маленькая таблица: иногда качественный searchable PDF или Word сохраняет документ понятнее. Формат должен соответствовать тому, что пользователь собирается редактировать после сканирования.

Сканирование в DOCX, XLSX и PPTX

  1. Очистите стекло/полосу ADF и сделайте пробный скан одной страницы.
  2. В Document Capture или другом поддерживаемом Epson-приложении выберите OCR/редактируемый офисный формат, а не только изображение.
  3. Для обычного текста начните с 300 dpi и правильной ориентации страницы.
  4. Выберите DOCX для текста, XLSX для преимущественно табличных данных или PPTX для презентационного макета, если такой экспорт поддерживается вашей конфигурацией.
  5. Запустите распознавание и откройте итоговый файл в соответствующем офисном приложении.
  6. Сверьте критичные значения с оригиналом и исправьте разметку, которую OCR восстановил неверно.
  7. Сохраните исходный скан хотя бы до завершения проверки и согласования документа.

Предупреждение: OCR может уверенно распознать неверную цифру; суммы, даты, номера и фамилии всегда сверяйте с оригиналом.

Как проверять результат OCR системно

После экспорта не ограничивайтесь беглым взглядом на первую страницу. Для текста сравните несколько абзацев с оригиналом, для Excel проверьте заголовки, суммы и границы столбцов, а для PowerPoint — расположение блоков на каждом слайде. Особое внимание уделяйте похожим символам `0/O`, `1/l`, кириллическим и латинским буквам, датам и десятичным разделителям. Если документ большой, выборочно проверяйте страницы из начала, середины и конца, потому что перекос или загрязнение ADF может появиться только на части пачки. Так OCR остаётся ускорителем ввода, а не источником незаметных ошибок в данных. Для документов с таблицами полезно дополнительно пересчитать одну-две контрольные суммы вручную: корректно выглядящая таблица может содержать ошибочно распознанную цифру, которую визуально легко пропустить.

Проверка OCR перед использованием

  • OCR действительно включён
  • Разрешение подходит для текста
  • Выбран правильный язык распознавания
  • Критичные цифры сверены с оригиналом
  • Исходный скан сохранён до проверки

Важно: Редактируемый DOCX/XLSX/PPTX не заменяет исходный документ: храните первичный скан до завершения проверки.

Сложные оригиналы и критичные данные

Рукописный текст, печати поверх букв, факс низкого качества и сложные многоколоночные формы распознаются хуже обычного машинописного листа. Не используйте OCR-экспорт как единственный источник для юридически или финансово значимых цифр без ручной сверки с оригиналом. Если доступных DOCX/XLSX/PPTX нет, это может быть ограничением конкретной модели, установленного программного пакета или версии, а не ошибкой сканера. Для архива, где важна визуальная неизменность документа, searchable PDF часто практичнее офисного формата: внешний вид сохраняется, а текст остаётся доступным для поиска.

Как улучшить точность OCR до экспорта

Положите лист ровно, выберите правильную ориентацию и удалите фоновые тени, если приложение предлагает соответствующую обработку. Для текста используйте достаточное разрешение и контраст, но избегайте чрезмерного повышения резкости, которое превращает края букв в шум. Проверьте язык OCR, если программа позволяет его выбирать: похожие символы разных алфавитов — частая причина ошибок. После экспорта просмотрите фамилии, номера, суммы, даты и таблицы вручную, потому что именно такие данные нельзя считать безошибочными по одному факту успешного OCR. Оригинал или исходный скан сохраняйте до завершения проверки.

Что учитывать

Сканер по своей природе получает растровое изображение страницы — набор пикселей, а не символы и ячейки таблицы. OCR анализирует это изображение, распознаёт буквы и пытается восстановить структуру документа. Только после этого приложение может сформировать DOCX, XLSX или PPTX, где содержимое становится редактируемым. Если сохранить простой image PDF без OCR, Word увидит страницу главным образом как изображение. Поэтому первым диагностическим вопросом должно быть не «какой формат файла», а…

Источники и проверка

Инструкция составлена редакцией N1RO на 2026-09-22. Перед действием сверьте актуальные условия на официальном сайте сервиса или производителя.