掃描PDF轉文字:用 OCR 讓掃描檔可搜尋、複製
PDF Toucan editorial team · 最後更新:2026年9月20日 · 閱讀時間 8 分鐘

掃描PDF轉文字的關鍵是先執行 OCR,讓原本只是頁面影像的掃描 PDF 加上可搜尋、可複製的文字層。使用 OCR PDF 上傳檔案、選擇文件語言並按「辨識文字」後,即可下載可搜尋的 PDF;完成後請以搜尋與複製貼上的方式抽查辨識結果。
掃描 PDF 為什麼不能搜尋文字?OCR 能做什麼?
多數掃描器、事務機或手機掃描功能,會把紙本每一頁拍成影像,再包裝成 PDF。畫面上的中文看起來像正常文件,但對 PDF 閱讀器而言,那其實是一整張圖片,而不是一個個可選取的字元。因此,按 Ctrl+F 找不到關鍵字、拖曳滑鼠只能框選一塊區域,或複製後沒有可用文字,都是常見情況。
OCR 是「光學字元辨識」。它會分析掃描影像中的字形,並在原頁面影像上建立文字層。完成後,掃描頁的視覺外觀通常仍以原始影像為主,但您可以搜尋文字、選取段落及複製內容。
| 類型 | PDF 內實際內容 | 可以搜尋或複製嗎? | 適合的處理方式 |
|---|---|---|---|
| 一般掃描 PDF | 每頁是一張影像 | 通常不行 | 執行 OCR |
| 原生數位 PDF | 真正的文字與版面物件 | 通常可以 | 不一定需要 OCR |
| 已做過但品質差的 OCR PDF | 有文字層,但可能有錯字 | 可以,但結果未必可靠 | 視情況重新辨識 |
OCR 很適合掃描合約、講義、收據、舊檔案、影印資料與表單。不過它不是逐字保證的轉錄服務:手寫字、模糊字、低解析度影本、反光照片、藝術字體、印章遮住文字或多欄表格,都可能造成辨識錯誤。
如何在線上把掃描 PDF 轉成可搜尋文字?
可依下列步驟使用 PDF Toucan 的 OCR 工具。它可一次加入多個 PDF,但每個檔案會分別處理;頁數很多或影像較複雜時,辨識可能需要幾分鐘。
- 開啟 OCR PDF,按「選擇 PDF 檔案」加入掃描檔。您也可以將檔案拖曳到頁面任意位置,或直接貼上檔案。
- 在「Document language」選擇文件實際使用的語言。至少要選擇一種語言。
- 如有需要,開啟更多選項,設定要掃描的頁面及頁面修正功能。
- 按「辨識文字」,並等待處理完成。處理時請保留瀏覽器分頁開啟。
- 出現辨識完成訊息後,下載可搜尋的 PDF。
- 用常用的 PDF 閱讀器開啟結果,在 Windows 按 Ctrl+F,Mac 按 Command+F,搜尋文件上看得到的一個明確詞語。
此工具不需帳號、不加浮水印,瀏覽器工具也沒有每日使用次數限制。不過 OCR 需要伺服器運算:檔案會經 HTTPS 傳送至位於歐盟的伺服器,在記憶體中處理,不會寫入磁碟或保存;結果下載後會立即刪除,最晚於 10 分鐘後刪除。
OCR 語言要怎麼選?中文、英文混排可一起辨識嗎?
可以。語言設定不是單純介面偏好,而是讓辨識引擎知道應預期哪些字母、字形與語言規則。文件為繁體中文時,選擇中文;中英混排的履歷、型錄、研究資料或合約,則同時選中文與英文。若日文、韓文或其他語言確實出現在正文,也可加入對應語言。
一次最多可合併 5 種語言,並支援 30 種辨識語言,涵蓋中文、日文、韓文、拉丁、阿拉伯、希伯來、泰文等文字系統。但不建議把所有可能語言都勾選:額外語言會拖慢辨識,也可能讓相似字元出現不必要的替換。
建議依內容選擇:
- 繁體中文公文、講義或合約:選中文。
- 中文與英文並列的說明書、履歷:選中文與英文。
- 中文文件偶爾出現產品型號或品牌名稱:通常不必為少數詞彙加入多種語言。
- 有人名、地址、帳號、日期、金額或表格欄位:完成後務必逐項抽查。
尤其是數字與字母相近的情況,例如 0 與 O、1 與 l、5 與 S,或中文姓名中的罕用字,都不應只靠 OCR 結果直接用於正式用途。
掃描頁面歪掉、倒著放,OCR 前要開哪些修正?
掃描品質會直接影響 OCR。若原稿沒有平放、送紙歪斜,或部分頁面旋轉,先選對頁面修正選項通常比事後大量改字有效。
- Straighten tilted pages:修正輕微傾斜的頁面。橫排文字若歪斜數度,辨識行距與字詞邊界較容易出錯;開啟後也能改善閱讀觀感。
- Fix page orientation automatically:自動修正上下顛倒或側放頁面。適合混有橫向表格、直向文件,或掃描時方向不一致的檔案。
- Scan pages without text:建議一般情況保留此選項。它只辨識尚未含文字的頁面,已有文字的頁面會維持原狀。
- Recognize existing text again:如果 PDF 已有文字層,但搜尋不到明明看得到的內容,或複製結果嚴重亂碼,可用此選項移除舊的錯誤文字層後重讀。
- Treat every page as an image:每一頁都轉成影像後從頭辨識。這適合文字層嚴重損壞或來源混亂的檔案,但原有的可選取文字和連結會遺失。
要注意的是,選擇重新辨識既有文字時,無法使用頁面傾斜校正。若文件既需要拉正歪斜頁面,又必須全面重做文字層,可考慮將每頁視為影像重新辨識,但應先接受原有連結與可選取文字會消失的影響。
若要處理數百頁檔案,建議先以幾頁代表性頁面測試。包含印章、表格、收據、細小字、多欄排版或影印痕跡的頁面,最值得優先確認。
OCR 完成後,怎麼檢查掃描 PDF 是否真的可搜尋?
下載完成不代表所有文字都完全正確。請至少做以下檢查,通常只需幾分鐘,卻能及早發現整批設定錯誤的問題。
- 在結果 PDF 中搜尋公司名稱、文件標題、日期或地址等明確存在的詞。Windows 使用 Ctrl+F,Mac 使用 Command+F。
- 分別抽查開頭、中段與末頁。不要只因第一頁搜尋成功,就認定整份檔案辨識無誤。
- 選取一小段文字,複製到純文字欄位中,再與掃描頁逐字對照。
- 特別檢查傾斜頁、印章附近、細小字、表格、金額、電話、日期,以及中英數混排處。
- 若某幾頁結果很差,先檢查原稿是否模糊、反光、方向錯誤或歪斜,再以正確語言及頁面修正選項重新處理。
此外,OCR 會修改 PDF 內容來加入文字層。因此,若原始檔帶有數位簽章,處理後該數位簽章將不再有效。請保留簽署後的原始檔不變,並把 OCR 版本視為供搜尋、複製或工作使用的副本。
掃描 PDF OCR 後可以轉 Word 嗎?有什麼限制?
「可搜尋」不等於「版面完全可編輯」。OCR 的主要成果是含文字層的 PDF,適合找關鍵字、複製段落和擷取內容;如果只需要引用少量文字,從 OCR 後 PDF 複製並校對,往往最直接。
若需要 DOCX,可依正確順序處理:
- 先在 OCR 工具完成辨識並下載可搜尋 PDF。
- 開啟 PDF 轉 Word,按「選擇 PDF 檔案」,加入剛下載的 OCR 版本,而不是原始掃描檔。
- 按「轉換為 Word」,再下載 DOCX 文件。
- 在 Word 中檢查段落、換行、表格欄位、頁首頁尾與數字後,再進行編修或引用。
直接將沒有文字層的掃描 PDF 轉 Word,掃描頁不會自動變成可編輯文字,而是以圖片加入 Word 文件。先 OCR 再轉換,轉換工具才有可處理的文字內容。即使如此,複雜表格、多欄排版、註腳與特殊格式仍可能需要手動整理。
上傳含個資的掃描 PDF 安全嗎?
PDF Toucan 的 OCR 與 PDF 轉 Word 都透過 HTTPS 傳送檔案,並在歐盟伺服器的記憶體中處理;檔案不會寫入磁碟或保存,下載結果後立即刪除,最晚不超過 10 分鐘。
不過,這些技術處理方式不會取代組織本身的資料規範。身分證號、病歷、薪資資料、未公開合約、客戶名單或受保密義務限制的文件,仍應先依公司、學校、機關或法規要求判斷能否使用線上服務。若文件規定不得離開裝置,請改用符合規範的離線工具。
常見問題
掃描 PDF 轉文字後,原本的版面會改掉嗎?
通常不會明顯改變。OCR 主要是在掃描頁影像後方新增文字層,原有的頁面視覺外觀仍以掃描影像呈現。不過若啟用傾斜校正、方向修正或將每頁視為影像重新辨識,頁面可能被旋轉或拉正。
PDF OCR 可以辨識繁體中文和英文混排嗎?
可以。在「Document language」同時選擇中文與英文即可。最多可合併 5 種語言,但只應選文件確實出現的語言;加入太多不相關語言會使處理較慢,也可能降低部分字元的判讀穩定性。
為什麼 OCR 後有些中文字或數字辨識錯誤?
辨識品質受原始影像影響很大。模糊、過暗、傾斜、反光、印章遮字、手寫內容、影印雜訊和細小字都會增加錯誤。請抽查姓名、金額、日期與型號,必要時調整語言、方向或傾斜校正後重新辨識。
掃描 PDF 直接轉 Word,為什麼文字還是不能編輯?
因為原始掃描 PDF 的每一頁通常只是圖片,沒有真正文字可轉換。PDF 轉 Word 會把這類掃描頁加入 DOCX 作為圖片。應先對 PDF 執行 OCR、下載可搜尋版本,再將該版本轉為 Word,並在 Word 中校對排版與內容。
