コンテンツへスキップ
PDFToucan PDF Toucan ホーム

PDF 検索可能にする 無料:OCRで文字検索・コピーできるPDFへ

PDF Toucan editorial team · 最終更新日: 2026年9月20日 · 読了時間 約11分

PDF 検索可能にする 無料:OCRで文字検索・コピーできるPDFへ

スキャンした書類をPDF 検索可能にする 無料の方法は、OCRで画像内の文字を読み取り、検索・選択・コピー用の文字情報をPDFへ追加することです。PDFをOCR処理で文書言語を選び、必要なら傾きや向きを補正してから処理し、保存後に検索結果を確認してください。

スキャンPDFを検索可能にするOCRとは?

紙をスキャンしたPDFは、見た目は文書でも、内部的には各ページが画像だけになっていることがあります。この状態では、PDFビューアで文字が見えていても、Ctrl+Fで検索できない、文章単位で選択できない、コピーしても文字として取り出せない、といった問題が起こります。

OCRは「光学文字認識」のことです。ページ画像に写った文字の形を解析し、検索やコピーに使える文字情報をPDFへ追加します。通常、OCR後もページの見た目はスキャン画像のままで、その上に見えない文字情報が重なった状態になります。

ただし、OCRは完全な文字起こしではありません。薄い印字、低解像度の画像、手書き文字、複雑な表、段組み、印影や透かしが重なった箇所では誤認識が起こり得ます。検索用・コピー用として便利になりますが、金額や契約条件など重要な内容は必ず原本画像と照合してください。

PDFの状態検索・コピー向いている処理
スキャン画像だけのPDF原則できないOCRを実行する
文字情報があるPDFできるそのまま利用する
一部だけ画像の混在PDFページにより異なる文字のないページをOCRする

PDFを無料でOCR処理して検索可能にするには?

PDF Toucanでは、アカウント登録なし、透かしなし、ブラウザツールの日次回数制限なしでOCR処理を利用できます。複数のPDFを追加した場合も、ファイルごとに個別に処理されます。

  1. PDFをOCR処理を開きます。
  2. **「PDFファイルを選択」**を押して対象PDFを選びます。ページ上の任意の場所へドラッグ&ドロップするか、ファイルを貼り付けて追加することもできます。
  3. 「Document language」で、文書に使われている言語を選択します。日本語の書類なら日本語を必ず含めます。少なくとも1つの言語選択が必要です。
  4. 必要に応じて「More options」を開き、対象ページやページ補正を設定します。通常は「Scan pages without text」が推奨です。
  5. **「文字を認識」**を押して処理を開始します。ページ数が多いPDFでは、認識に数分かかることがあります。
  6. 完了メッセージを確認し、**「Download the searchable PDF」**から検索可能になったPDFを保存します。

まずは少ないページのPDFで結果を確認してから、大量の文書を処理すると安心です。特に数百ページの帳票や、画質にばらつきがある資料では、先頭・中間・末尾のページを試すと認識品質を判断しやすくなります。

OCRの言語はどう選べば認識精度が上がる?

言語設定は単なる表示設定ではありません。OCRは選択された言語の文字体系や語のパターンを参考にして、似た形の文字を判定します。日本語文書では日本語を選ぶことで、漢字・ひらがな・カタカナを含む認識に対応しやすくなります。

  1. 日本語だけの文書は、日本語のみを選びます。
  2. 日本語と英語が併記されたマニュアル、請求書、仕様書は、日本語と英語を選びます。
  3. 中国語や韓国語なども実際に含まれる場合だけ追加します。
  4. 不要な言語を「念のため」に多数選ばないようにします。追加言語は処理を遅くします。

1回の処理で組み合わせられる言語は最大5つです。認識言語は30言語に対応しており、日本語・中国語・韓国語のほか、ラテン文字、キリル文字、ギリシャ文字、アラビア文字などを含みます。

固有名詞、型番、住所、日付、金額、電話番号、メールアドレスは、誤認識が実務上の問題につながりやすい項目です。たとえば数字の0と英字のO、数字の1と英字のlなどは混同されることがあります。これらは検索できたとしても、正しい文字列かどうかを原本と見比べます。

傾いたPDFや横向きのスキャンは補正できる?

斜めにスキャンされたページや、上下逆・横向きのページが混じるPDFでは、OCR前に補正を設定できます。文字の行が整うと、読みやすさだけでなく認識の安定にも役立ちます。

  • **「Straighten tilted pages」**は、斜めに取り込まれたページをまっすぐに補正します。原稿が少し傾いている場合に適しています。
  • **「Fix page orientation automatically」**は、上下逆や横向きのページを自動的に正しい向きへ回転します。
  • **「Scan pages without text」**は、文字情報がないページだけを認識します。すでに文字があるページはそのまま残すため、通常はこちらが推奨です。
  • **「Recognize existing text again」**は、既存の認識テキストが不正確な場合に削除して読み直します。この設定では傾き補正を利用できません。
  • **「Treat every page as an image」**は、全ページを画像としてゼロから認識します。既存の選択可能な文字とリンクは失われるため、問題がある場合だけ使います。

既存の文字情報が正しく検索できているPDFに対し、むやみに全ページを画像として再認識する必要はありません。まずは推奨設定で処理し、検索やコピーの結果に問題があるページだけを確認する方法が適切です。

OCR後のPDFが正しく検索・コピーできるか確認するには?

ダウンロード直後に、検索とコピーの両方を試してください。検索できても、数字や記号が誤っていることはあるためです。

  1. 保存したPDFを普段使うPDFビューアで開きます。
  2. WindowsではCtrl+F、MacではCommand+Fを押します。スマホやタブレットでは、PDFビューアの検索アイコンを使います。
  3. 見出し、氏名、型番、日付など、ページ上で読める特徴的な語句を検索します。
  4. 検索結果が正しいページ・位置へ移動するか確認します。
  5. 短い文章をドラッグして選択し、コピーします。テキストエディタなどへ貼り付け、原本画像と比べます。
  6. 日付、数量、金額、電話番号、住所、固有名詞を優先して確認します。

誤認識が多いときは、文書言語の選択を見直し、傾きや向きの補正を有効にして再処理します。元のスキャンが不鮮明なら、より鮮明な原稿を用意することも必要です。OCR設定だけでは、つぶれた文字や強い影を完全に復元できない場合があります。

検索可能にしたPDFをWordに変換できる?

検索やコピーが目的なら、OCR後のPDFをそのまま使うのが最も確実です。Word形式が必要な場合は、PDFをWordに変換でDOCXを作成できます。

  1. OCR済みPDFを用意します。
  2. PDFをWordに変換のページで**「PDFファイルを選択」**を押し、PDFを追加します。
  3. **「Wordに変換」**を押します。
  4. 完了後、**「Download the Word document」**からDOCXを保存します。

ここで注意したいのは、PDFをWordに変換する機能自体は、スキャンページをOCRして編集可能な文字へ変換するものではない点です。スキャンされたページは、Word文書内では画像として追加されます。OCR済みPDFであっても、複雑なレイアウトを完全に編集可能な段落や表として再現できるとは限りません。

文字を編集したい箇所がある場合は、検索可能PDFから必要な文章をコピーしてWordへ貼り付け、改行、表、数字、レイアウトを確認しながら整える方法が安全です。画像中心のPDFでファイルサイズが大きい場合は、用途に応じてPDF Toucanのcompressも検討できます。

オンラインOCRにPDFをアップロードしても安全?

PDF ToucanのOCRでは、ファイルはHTTPSで欧州連合域内のサーバーへ送信され、メモリ内で処理されます。ファイルはディスクへ保存・保管されず、結果のダウンロード後に削除されます。遅くとも10分以内に削除されます。

一方で、オンライン処理ではファイルが端末の外へ送信されること自体を理解しておく必要があります。契約書、本人確認書類、医療情報、人事資料、未公開の社内資料などは、組織の情報管理規程、共有可否、法令上の要件を確認してから利用してください。端末外へ出せない文書は、オフラインのOCRソフトウェアで扱う選択が適しています。

また、電子署名付きPDFをOCR処理すると、PDFの内容が変更されるためデジタル署名は有効ではなくなります。署名の検証が必要な原本は変更せず保管し、OCR済みのPDFは検索・参照・コピー用の作業ファイルとして分けて扱ってください。

よくある質問

OCR処理したPDFはスマホでも検索できますか?

はい。OCR後に保存したPDFは、文字情報に対応したPDFビューアで検索できます。スマホではPDFを開き、検索アイコンから語句を入力してください。ビューアによって表示や選択操作は異なりますが、氏名や見出しなどで結果を確認できます。

日本語と英語が混在するPDFはどの言語を選べばよいですか?

日本語と英語の両方を選びます。実際に使われている言語を指定すると、文字体系や語の判定に役立ちます。関係のない言語を多数追加すると処理が遅くなるため、和英併記なら通常は日本語と英語だけで十分です。

文字が選択できるPDFもOCRをやり直すべきですか?

通常は不要です。すでに検索・コピーが正しくできるなら、その文字情報を維持するほうが安全です。検索結果がおかしい、コピーすると文字化けするなど、既存テキストに明確な問題がある場合にだけ、読み直しの設定を検討してください。

OCRしたPDFをWordに変換すれば文字を編集できますか?

必ずしも編集可能な文書になるわけではありません。PDFをWordに変換する機能では、スキャンページは画像として追加されます。編集したい文章はOCR済みPDFからコピーして貼り付け、原本と照合しながら数字、改行、表の内容を修正してください。

オンラインでPDF OCRする方法
オンラインでPDF OCRする方法

関連ガイド