Как сделать PDF с возможностью поиска текста: OCR без установки
PDF Toucan editorial team · Обновлено 20 сентября 2026 г. · 9 мин. чтения

Чтобы сделать PDF с возможностью поиска текста, загрузите скан в инструмент OCR, укажите языки документа, при необходимости исправьте наклон или поворот страниц и запустите распознавание. Готовый файл сохранит привычный вид скана, но в нём можно будет искать слова и копировать текст без установки программ.
Почему в отсканированном PDF не работает поиск
Скан договора, удостоверения, квитанции или учебного конспекта часто выглядит как обычный PDF-документ, но технически состоит только из изображений страниц. Сканер или камера сфотографировали листы, а PDF объединил эти картинки в один файл. Просмотрщик видит пиксели, а не буквы и слова.
Поэтому поиск по Ctrl+F не даёт результата, выделение захватывает всю страницу или область, а скопированный фрагмент оказывается пустым. Это не обязательно означает, что файл повреждён: ему просто не хватает текстового слоя.
OCR, или оптическое распознавание символов, анализирует изображение страницы и добавляет поверх него распознанный текстовый слой. Внешний вид листа при этом сохраняется: подписи, печати, таблицы и исходная верстка остаются на своих местах. Но PDF уже можно использовать для поиска реквизитов, фамилий, дат и номеров.
Качество результата зависит от исходника. Чёткий печатный скан обычно распознаётся хорошо. Размытые фотографии, бледные копии, рукописный текст, декоративные шрифты, печати поверх текста и сильный наклон могут привести к ошибкам. OCR помогает читать и искать документ, но не гарантирует идеальную расшифровку каждого символа.
Как сделать PDF с возможностью поиска текста в PDF Toucan
Для распознавания используйте инструмент OCR PDF. Он принимает PDF и выдаёт PDF с возможностью поиска. Работать можно в браузере на компьютере, планшете или телефоне.
- Откройте страницу инструмента и нажмите «Выбрать PDF-файлы».
- Выберите PDF со сканами. Вместо этого файл можно перетащить в любое место страницы или вставить из буфера обмена.
- В блоке выбора языка документа отметьте хотя бы один язык, который действительно есть в файле.
- При необходимости откройте дополнительные параметры: выберите страницы для сканирования и исправления страниц.
- Нажмите «Распознать текст».
- Дождитесь сообщения об успешном распознавании и нажмите кнопку скачивания PDF с возможностью поиска.
- Откройте результат в привычном просмотрщике и проверьте поиск по нескольким словам.
Можно добавить несколько PDF за один раз: каждый файл обрабатывается отдельно. В PDF Toucan не нужны регистрация, водяной знак или ежедневные лимиты для браузерных инструментов.
Для OCR файл передаётся по HTTPS на серверы в Европейском союзе, поскольку распознавание требует серверной обработки. Он обрабатывается в памяти, не записывается на диск и не хранится; удаление происходит после скачивания результата, максимум через 10 минут. Если внутренние правила компании, госорганизации или клиента запрещают передавать документы стороннему онлайн-сервису, не загружайте такой файл и используйте одобренное офлайн-решение.
Какие языки выбрать для русского, казахского и смешанного документа
Выбор языка влияет на распознавание: OCR использует сведения об алфавите и характерных сочетаниях букв. Особенно это важно для похожих символов, диакритики, имён и терминов.
Для русскоязычного документа выберите русский. Для казахского текста выберите казахский, если он показан в списке языков интерфейса. Если договор, справка или анкета содержит оба языка, добавьте русский и казахский. Когда в форме также есть английские поля, можно добавить и английский.
За один запуск допускается объединить до пяти языков. Однако выбирать все языки «на всякий случай» не стоит: лишние языки замедляют обработку и могут ухудшать результат из-за неверных подстановок похожих символов.
Инструмент поддерживает 30 языков и письменности, включая кириллицу, латиницу, греческое, арабское, еврейское, деванагари, тайское, китайское, японское и корейское письмо. Для большинства документов достаточно выбрать только языки основного печатного текста.
| Содержимое PDF | Что выбрать | Почему |
|---|---|---|
| Договор или заявление на русском | Русский | OCR ожидает кириллицу и русские словоформы |
| Справка на казахском | Казахский, если доступен в списке | Лучше учитываются символы и особенности языка |
| Русско-казахская форма | Русский и казахский | Оба текстовых слоя будут распознаны точнее |
| Трёхъязычный бланк | Русский, казахский и английский | Не добавляйте языки, которых в документе нет |
Нужно ли выравнивать наклон и поворачивать страницы перед OCR
Перед запуском посмотрите на страницы хотя бы выборочно. Ориентация и ровность строк сильно влияют на результат, особенно в документах, снятых телефоном или загруженных через автоподатчик сканера.
Включите «Straighten tilted pages», если строки идут под углом. Эта функция выравнивает наклонённые листы, поэтому движок обычно лучше отделяет строки и слова друг от друга. Она полезна для криво отсканированных заявлений, книг и пакетов документов.
Включите автоматическое исправление ориентации, если часть страниц лежит боком или перевёрнута. Это актуально для архивов с альбомными таблицами и смешанной ориентацией листов.
Параметры сканирования страниц выбирайте по состоянию исходного PDF:
| Режим | Что происходит | Когда выбирать |
|---|---|---|
| «Scan pages without text» | Распознаются только страницы без текста, а страницы с существующим текстом не меняются | Обычный и рекомендуемый вариант для смешанного PDF |
| «Recognize existing text again» | Старый ошибочный текстовый слой удаляется, страницы распознаются заново | Поиск и копирование уже есть, но работают неверно |
| «Treat every page as an image» | Каждая страница превращается в изображение и читается с нуля | Текстовый слой полностью непригоден или сильно повреждён |
У режима повторного распознавания существующего текста есть ограничение: выравнивание наклона в нём недоступно. Режим обработки всех страниц как изображений удаляет прежний выделяемый текст и ссылки. Используйте его только тогда, когда это действительно необходимо.
Для большого архива сначала проверьте настройки на небольшом PDF. Так проще понять, верно ли выбраны языки и нужна ли коррекция страниц, до обработки сотен листов.
Как проверить, что текст в PDF распознан правильно
Не ограничивайтесь сообщением об успешном завершении. OCR мог создать текстовый слой, но отдельные слова, цифры или переносы всё равно могут содержать ошибки.
- Откройте скачанный PDF в браузере или приложении для просмотра документов.
- На Windows и Linux нажмите Ctrl+F, на macOS — Command+F. На телефоне найдите значок поиска в просмотрщике PDF.
- Введите заметное слово с конкретной страницы: фамилию, номер договора, дату, адрес или редкий термин.
- Убедитесь, что просмотрщик переходит к правильному месту и подсвечивает найденное слово.
- Проверьте начало, середину и конец многостраничного файла: качество скана может различаться между разделами.
- Выделите несколько предложений, скопируйте их и вставьте в заметку. Сравните текст с изображением страницы.
Особенно внимательно сверяйте фамилии, ИИН, номера счетов и договоров, суммы, даты и адреса. Частые ошибки возникают у похожих символов: О и 0, З и 3, I и 1, S и 5. Ошибки также возможны в пробелах, дефисах и переносах строк.
Если очевидное слово не находится, повторите OCR с правильно выбранными языками. Для кривых страниц включите выравнивание, а для боковых — исправление ориентации. При некачественном исходном скане лучшим решением часто будет новое сканирование: хорошее освещение, ровный лист, отсутствие бликов и достаточная резкость важнее любых настроек.
Учтите важное ограничение: после OCR цифровая подпись PDF становится недействительной, потому что документ изменяется. Сохраните исходный подписанный файл без изменений, а распознанную копию используйте только как рабочую — для поиска, чтения и копирования. Если файл нужно заново подписывать, соблюдайте процедуру, которую требует получатель документа.
Как искать текст в PDF и что будет при конвертации в Word
Распознанный PDF удобен для архивов, договоров и сканов удостоверений: в совместимом просмотрщике можно искать слова, переходить к нужным страницам и копировать фрагменты. Для быстрого поиска используйте не слишком короткие слова, а фамилию, номер, дату или уникальную часть реквизита.
Если нужен DOCX, откройте конвертер PDF в Word и выполните следующие действия:
- Нажмите «Выбрать PDF-файлы».
- Добавьте нужный PDF.
- Нажмите «Преобразовать в Word».
- Скачайте документ и откройте его в Word для проверки.
Конвертер создаёт DOCX, который можно открыть и редактировать в Word. Но сам по себе он не распознаёт сканы: страницы исходного PDF без текстового слоя добавляются в Word как изображения, а не превращаются в редактируемый текст. Поэтому для поиска и копирования основным результатом лучше оставлять OCR-PDF.
Даже после предварительного OCR обязательно проверьте созданный DOCX вручную, особенно таблицы, колонки, сноски и сложные бланки. Конвертация может изменить структуру страницы. Если цель — найти сведения в архиве, не конвертируйте файл без необходимости: PDF с текстовым слоем обычно сохраняет исходное оформление надёжнее.
FAQ
Можно ли сделать PDF с поиском текста на телефоне?
Да. Откройте OCR PDF в мобильном браузере, нажмите «Выбрать PDF-файлы» и выберите скан из файлового приложения. После распознавания скачайте результат и откройте его в просмотрщике PDF. Для проверки используйте значок лупы или команду поиска в меню приложения.
Какой язык выбрать для PDF на русском и казахском?
Отметьте русский и казахский, если оба языка реально присутствуют в документе и казахский доступен в списке. При наличии английских полей добавьте английский. Не выбирайте дополнительные языки без причины: они замедляют OCR и могут увеличить число неверно распознанных символов.
Почему после OCR некоторые слова не находятся или копируются с ошибками?
Обычно причина в размытом скане, наклоне страницы, неверно выбранном языке, печати поверх текста или похожих символах. Проверьте проблемные страницы, повторите распознавание с нужными языками и исправлением наклона. Для важной информации всегда сверяйте скопированный текст с изображением оригинала.
Можно ли превратить отсканированный PDF в полностью редактируемый Word?
Не рассчитывайте на это при прямой конвертации: сканированные страницы добавляются в DOCX как картинки. Сначала создайте PDF с текстовым слоем через OCR, затем при необходимости конвертируйте файл в Word и тщательно проверьте результат. Сложную верстку, таблицы и бланки часто приходится исправлять вручную.
Что произойдёт с электронной цифровой подписью после распознавания PDF?
OCR изменяет содержимое PDF, добавляя текстовый слой, поэтому существующая цифровая подпись становится недействительной. Не заменяйте распознанной копией исходный подписанный документ. Храните оригинал отдельно, а PDF после OCR используйте для внутреннего поиска, чтения и извлечения текста.
