Перейти к содержимому
PDFToucan Главная PDF Toucan

Как сделать PDF с возможностью поиска текста: OCR без установки

PDF Toucan editorial team · Обновлено 20 сентября 2026 г. · 9 мин. чтения

Как сделать PDF с возможностью поиска текста: OCR без установки

Чтобы сделать PDF с возможностью поиска текста, загрузите скан в инструмент OCR, укажите языки документа, при необходимости исправьте наклон или поворот страниц и запустите распознавание. Готовый файл сохранит привычный вид скана, но в нём можно будет искать слова и копировать текст без установки программ.

Почему в отсканированном PDF не работает поиск

Скан договора, удостоверения, квитанции или учебного конспекта часто выглядит как обычный PDF-документ, но технически состоит только из изображений страниц. Сканер или камера сфотографировали листы, а PDF объединил эти картинки в один файл. Просмотрщик видит пиксели, а не буквы и слова.

Поэтому поиск по Ctrl+F не даёт результата, выделение захватывает всю страницу или область, а скопированный фрагмент оказывается пустым. Это не обязательно означает, что файл повреждён: ему просто не хватает текстового слоя.

OCR, или оптическое распознавание символов, анализирует изображение страницы и добавляет поверх него распознанный текстовый слой. Внешний вид листа при этом сохраняется: подписи, печати, таблицы и исходная верстка остаются на своих местах. Но PDF уже можно использовать для поиска реквизитов, фамилий, дат и номеров.

Качество результата зависит от исходника. Чёткий печатный скан обычно распознаётся хорошо. Размытые фотографии, бледные копии, рукописный текст, декоративные шрифты, печати поверх текста и сильный наклон могут привести к ошибкам. OCR помогает читать и искать документ, но не гарантирует идеальную расшифровку каждого символа.

Как сделать PDF с возможностью поиска текста в PDF Toucan

Для распознавания используйте инструмент OCR PDF. Он принимает PDF и выдаёт PDF с возможностью поиска. Работать можно в браузере на компьютере, планшете или телефоне.

  1. Откройте страницу инструмента и нажмите «Выбрать PDF-файлы».
  2. Выберите PDF со сканами. Вместо этого файл можно перетащить в любое место страницы или вставить из буфера обмена.
  3. В блоке выбора языка документа отметьте хотя бы один язык, который действительно есть в файле.
  4. При необходимости откройте дополнительные параметры: выберите страницы для сканирования и исправления страниц.
  5. Нажмите «Распознать текст».
  6. Дождитесь сообщения об успешном распознавании и нажмите кнопку скачивания PDF с возможностью поиска.
  7. Откройте результат в привычном просмотрщике и проверьте поиск по нескольким словам.

Можно добавить несколько PDF за один раз: каждый файл обрабатывается отдельно. В PDF Toucan не нужны регистрация, водяной знак или ежедневные лимиты для браузерных инструментов.

Для OCR файл передаётся по HTTPS на серверы в Европейском союзе, поскольку распознавание требует серверной обработки. Он обрабатывается в памяти, не записывается на диск и не хранится; удаление происходит после скачивания результата, максимум через 10 минут. Если внутренние правила компании, госорганизации или клиента запрещают передавать документы стороннему онлайн-сервису, не загружайте такой файл и используйте одобренное офлайн-решение.

Какие языки выбрать для русского, казахского и смешанного документа

Выбор языка влияет на распознавание: OCR использует сведения об алфавите и характерных сочетаниях букв. Особенно это важно для похожих символов, диакритики, имён и терминов.

Для русскоязычного документа выберите русский. Для казахского текста выберите казахский, если он показан в списке языков интерфейса. Если договор, справка или анкета содержит оба языка, добавьте русский и казахский. Когда в форме также есть английские поля, можно добавить и английский.

За один запуск допускается объединить до пяти языков. Однако выбирать все языки «на всякий случай» не стоит: лишние языки замедляют обработку и могут ухудшать результат из-за неверных подстановок похожих символов.

Инструмент поддерживает 30 языков и письменности, включая кириллицу, латиницу, греческое, арабское, еврейское, деванагари, тайское, китайское, японское и корейское письмо. Для большинства документов достаточно выбрать только языки основного печатного текста.

Содержимое PDFЧто выбратьПочему
Договор или заявление на русскомРусскийOCR ожидает кириллицу и русские словоформы
Справка на казахскомКазахский, если доступен в спискеЛучше учитываются символы и особенности языка
Русско-казахская формаРусский и казахскийОба текстовых слоя будут распознаны точнее
Трёхъязычный бланкРусский, казахский и английскийНе добавляйте языки, которых в документе нет

Нужно ли выравнивать наклон и поворачивать страницы перед OCR

Перед запуском посмотрите на страницы хотя бы выборочно. Ориентация и ровность строк сильно влияют на результат, особенно в документах, снятых телефоном или загруженных через автоподатчик сканера.

Включите «Straighten tilted pages», если строки идут под углом. Эта функция выравнивает наклонённые листы, поэтому движок обычно лучше отделяет строки и слова друг от друга. Она полезна для криво отсканированных заявлений, книг и пакетов документов.

Включите автоматическое исправление ориентации, если часть страниц лежит боком или перевёрнута. Это актуально для архивов с альбомными таблицами и смешанной ориентацией листов.

Параметры сканирования страниц выбирайте по состоянию исходного PDF:

РежимЧто происходитКогда выбирать
«Scan pages without text»Распознаются только страницы без текста, а страницы с существующим текстом не меняютсяОбычный и рекомендуемый вариант для смешанного PDF
«Recognize existing text again»Старый ошибочный текстовый слой удаляется, страницы распознаются зановоПоиск и копирование уже есть, но работают неверно
«Treat every page as an image»Каждая страница превращается в изображение и читается с нуляТекстовый слой полностью непригоден или сильно повреждён

У режима повторного распознавания существующего текста есть ограничение: выравнивание наклона в нём недоступно. Режим обработки всех страниц как изображений удаляет прежний выделяемый текст и ссылки. Используйте его только тогда, когда это действительно необходимо.

Для большого архива сначала проверьте настройки на небольшом PDF. Так проще понять, верно ли выбраны языки и нужна ли коррекция страниц, до обработки сотен листов.

Как проверить, что текст в PDF распознан правильно

Не ограничивайтесь сообщением об успешном завершении. OCR мог создать текстовый слой, но отдельные слова, цифры или переносы всё равно могут содержать ошибки.

  1. Откройте скачанный PDF в браузере или приложении для просмотра документов.
  2. На Windows и Linux нажмите Ctrl+F, на macOS — Command+F. На телефоне найдите значок поиска в просмотрщике PDF.
  3. Введите заметное слово с конкретной страницы: фамилию, номер договора, дату, адрес или редкий термин.
  4. Убедитесь, что просмотрщик переходит к правильному месту и подсвечивает найденное слово.
  5. Проверьте начало, середину и конец многостраничного файла: качество скана может различаться между разделами.
  6. Выделите несколько предложений, скопируйте их и вставьте в заметку. Сравните текст с изображением страницы.

Особенно внимательно сверяйте фамилии, ИИН, номера счетов и договоров, суммы, даты и адреса. Частые ошибки возникают у похожих символов: О и 0, З и 3, I и 1, S и 5. Ошибки также возможны в пробелах, дефисах и переносах строк.

Если очевидное слово не находится, повторите OCR с правильно выбранными языками. Для кривых страниц включите выравнивание, а для боковых — исправление ориентации. При некачественном исходном скане лучшим решением часто будет новое сканирование: хорошее освещение, ровный лист, отсутствие бликов и достаточная резкость важнее любых настроек.

Учтите важное ограничение: после OCR цифровая подпись PDF становится недействительной, потому что документ изменяется. Сохраните исходный подписанный файл без изменений, а распознанную копию используйте только как рабочую — для поиска, чтения и копирования. Если файл нужно заново подписывать, соблюдайте процедуру, которую требует получатель документа.

Как искать текст в PDF и что будет при конвертации в Word

Распознанный PDF удобен для архивов, договоров и сканов удостоверений: в совместимом просмотрщике можно искать слова, переходить к нужным страницам и копировать фрагменты. Для быстрого поиска используйте не слишком короткие слова, а фамилию, номер, дату или уникальную часть реквизита.

Если нужен DOCX, откройте конвертер PDF в Word и выполните следующие действия:

  1. Нажмите «Выбрать PDF-файлы».
  2. Добавьте нужный PDF.
  3. Нажмите «Преобразовать в Word».
  4. Скачайте документ и откройте его в Word для проверки.

Конвертер создаёт DOCX, который можно открыть и редактировать в Word. Но сам по себе он не распознаёт сканы: страницы исходного PDF без текстового слоя добавляются в Word как изображения, а не превращаются в редактируемый текст. Поэтому для поиска и копирования основным результатом лучше оставлять OCR-PDF.

Даже после предварительного OCR обязательно проверьте созданный DOCX вручную, особенно таблицы, колонки, сноски и сложные бланки. Конвертация может изменить структуру страницы. Если цель — найти сведения в архиве, не конвертируйте файл без необходимости: PDF с текстовым слоем обычно сохраняет исходное оформление надёжнее.

FAQ

Можно ли сделать PDF с поиском текста на телефоне?

Да. Откройте OCR PDF в мобильном браузере, нажмите «Выбрать PDF-файлы» и выберите скан из файлового приложения. После распознавания скачайте результат и откройте его в просмотрщике PDF. Для проверки используйте значок лупы или команду поиска в меню приложения.

Какой язык выбрать для PDF на русском и казахском?

Отметьте русский и казахский, если оба языка реально присутствуют в документе и казахский доступен в списке. При наличии английских полей добавьте английский. Не выбирайте дополнительные языки без причины: они замедляют OCR и могут увеличить число неверно распознанных символов.

Почему после OCR некоторые слова не находятся или копируются с ошибками?

Обычно причина в размытом скане, наклоне страницы, неверно выбранном языке, печати поверх текста или похожих символах. Проверьте проблемные страницы, повторите распознавание с нужными языками и исправлением наклона. Для важной информации всегда сверяйте скопированный текст с изображением оригинала.

Можно ли превратить отсканированный PDF в полностью редактируемый Word?

Не рассчитывайте на это при прямой конвертации: сканированные страницы добавляются в DOCX как картинки. Сначала создайте PDF с текстовым слоем через OCR, затем при необходимости конвертируйте файл в Word и тщательно проверьте результат. Сложную верстку, таблицы и бланки часто приходится исправлять вручную.

Что произойдёт с электронной цифровой подписью после распознавания PDF?

OCR изменяет содержимое PDF, добавляя текстовый слой, поэтому существующая цифровая подпись становится недействительной. Не заменяйте распознанной копией исходный подписанный документ. Храните оригинал отдельно, а PDF после OCR используйте для внутреннего поиска, чтения и извлечения текста.

Как распознать текст PDF онлайн
Как распознать текст PDF онлайн

Похожие руководства