Chuyển đến nội dung
PDFToucan Trang chủ PDF Toucan

OCR PDF online: Tạo PDF có thể tìm kiếm và sao chép

PDF Toucan editorial team · Cập nhật lần cuối 20 tháng 9, 2026 · Đọc 8 phút

OCR PDF online: Tạo PDF có thể tìm kiếm và sao chép

Với OCR PDF online, hãy mở công cụ, chọn tệp PDF, đặt đúng ngôn ngữ như Tiếng Việt, nhấn "Nhận dạng văn bản" rồi tải bản PDF có thể tìm kiếm. Nếu trang bị nghiêng hoặc ngược chiều, bật tùy chọn sửa trang trước khi xử lý; sau đó dùng Ctrl+F, Command+F hoặc ô tìm kiếm trên iPhone/Android để kiểm tra chữ đã được nhận dạng.

OCR PDF online là gì và OCR làm được những gì?

PDF quét từ máy scan hoặc camera điện thoại thường chỉ gồm ảnh của từng trang. Mắt người đọc được nội dung, nhưng trình đọc PDF không nhận ra ký tự: Ctrl+F không tìm thấy từ, và thao tác chọn chuột có thể chỉ chọn cả vùng ảnh.

OCR, hay nhận dạng ký tự quang học, phân tích chữ trong ảnh quét và thêm lớp văn bản vào PDF. Hình ảnh gốc của trang vẫn được giữ, nhưng bạn có thể tìm kiếm, bôi đen hoặc sao chép nội dung.

OCR phù hợp khi cần:

  • Tra cứu tên, ngày tháng, mã hồ sơ hoặc số hóa đơn trong bản quét.
  • Sao chép một đoạn chữ thay vì gõ lại thủ công.
  • Tạo bản PDF thuận tiện hơn cho việc lưu trữ và tra cứu.

Tuy nhiên, OCR không bảo đảm bản chép hoàn toàn chính xác và không tự biến tài liệu thành Word có bố cục hoàn hảo. Kết quả phụ thuộc vào độ nét, độ tương phản, phông chữ, ngôn ngữ, góc quét và tình trạng giấy. Chữ in rõ thường cho kết quả tốt hơn ảnh mờ, chữ viết tay, bản photocopy nhiều lớp hoặc trang có dấu đóng đè lên nội dung.

Cách OCR PDF online để tạo PDF có thể tìm kiếm?

Dùng công cụ OCR PDF của PDF Toucan trên máy tính, máy tính bảng hoặc điện thoại theo các bước sau:

  1. Nhấn "Chọn các file PDF" để chọn PDF cần xử lý. Bạn cũng có thể kéo thả tệp ở bất kỳ vị trí nào trên trang hoặc dán tệp từ bộ nhớ tạm.
  2. Trong phần ngôn ngữ tài liệu, chọn ít nhất một ngôn ngữ thực sự có trong bản quét.
  3. Mở phần tùy chọn bổ sung nếu cần đổi phạm vi trang hoặc sửa trang bị nghiêng, xoay sai.
  4. Nhấn "Nhận dạng văn bản".
  5. Chờ xử lý. Tài liệu nhiều trang có thể cần vài phút, vì vậy hãy giữ tab trình duyệt mở.
  6. Khi nhận dạng hoàn tất, chọn "Download the searchable PDF" để tải PDF đã có thể tìm và sao chép chữ.

Bạn có thể thêm nhiều PDF cùng lúc. Mỗi tệp được xử lý riêng, vì vậy nên kiểm tra kết quả từng tài liệu, nhất là khi các tệp có chất lượng quét hoặc ngôn ngữ khác nhau.

Nên chọn ngôn ngữ nào khi OCR PDF tiếng Việt?

Với tài liệu tiếng Việt, hãy chọn Tiếng Việt. Việc này giúp công cụ phân biệt tốt hơn các ký tự như đ, ă, â, ê, ô, ơ, ư và các dấu thanh. Nếu tài liệu song ngữ Việt-Anh, chỉ chọn Tiếng Việt và Tiếng Anh; không nên chọn thêm ngôn ngữ không xuất hiện trong tệp.

Công cụ hỗ trợ 30 ngôn ngữ thuộc các hệ chữ Latin, Cyrillic, Hy Lạp, Ả Rập, Hebrew, Devanagari, Thái, Trung, Nhật và Hàn. Có thể kết hợp tối đa 5 ngôn ngữ trong một lần OCR, nhưng thêm ngôn ngữ sẽ làm xử lý chậm hơn và có thể tăng nhầm lẫn ký tự.

Loại tài liệuThiết lập nên dùngCần đối chiếu kỹ
Văn bản tiếng ViệtTiếng ViệtDấu, họ tên, địa chỉ
Tài liệu Việt-AnhTiếng Việt và Tiếng AnhTên riêng, thuật ngữ, viết tắt
Biểu mẫu nhiều sốNgôn ngữ chính của tài liệu0/O, 1/I/l, 5/S, dấu thập phân
Tài liệu nhiều hệ chữChỉ chọn ngôn ngữ thực sự xuất hiệnTiêu đề, chú thích xen kẽ

Với số tiền, mã định danh, ngày tháng, số tài khoản hoặc mã hàng, luôn đối chiếu lại ảnh gốc. Một lỗi nhỏ khi OCR dữ liệu số có thể gây sai lệch đáng kể.

Khi nào cần làm thẳng hoặc xoay trang PDF trước khi OCR?

Bản quét lệch chỉ vài độ cũng có thể khiến việc nhận dạng dòng chữ kém hơn, đặc biệt với bảng biểu, văn bản nhiều cột hoặc chữ nhỏ. Trong phần sửa trang, cân nhắc hai tùy chọn sau:

  • "Straighten tilted pages": dùng khi giấy bị quét lệch hoặc ảnh chụp hơi nghiêng. Trang được làm thẳng để các dòng chữ nằm ngang hơn.
  • "Fix page orientation automatically": dùng khi trang bị lộn ngược hoặc xoay ngang. Công cụ sẽ tự sửa về chiều đọc phù hợp.

Hãy bật làm thẳng khi đường kẻ bảng hoặc dòng chữ không song song với cạnh trang. Bật sửa hướng tự động nếu tài liệu được quét từ nhiều nguồn, có cả trang dọc và trang ngang, hoặc có một số trang bị lật ngược.

Lưu ý: "Straighten tilted pages" không khả dụng khi chọn "Recognize existing text again". Nếu cần đọc lại lớp chữ cũ và đồng thời cần làm thẳng trang, hãy xem xét chế độ xử lý mọi trang như ảnh, sau khi đã hiểu rõ dữ liệu có thể mất.

Nên quét trang không có chữ hay nhận dạng lại toàn bộ PDF?

Một PDF có thể là tài liệu hỗn hợp: thư chính được tạo bằng Word đã có chữ thật, trong khi phụ lục là ảnh scan. Chọn đúng chế độ giúp bảo toàn phần văn bản tốt sẵn có.

Tùy chọnCách hoạt độngNên dùng khiLưu ý
"Scan pages without text"Chỉ OCR trang chưa có chữHầu hết PDF quét hoặc PDF hỗn hợpĐược khuyến nghị; trang có chữ được giữ nguyên
"Recognize existing text again"Xóa lớp chữ cũ kém rồi đọc lạiSao chép ra chữ rác hoặc lớp OCR cũ saiKhông dùng được chức năng làm thẳng trang
"Treat every page as an image"Biến mọi trang thành ảnh rồi OCR lạiLớp chữ cũ hỏng nặng, không nhất quánMất chữ có thể chọn và các liên kết cũ

Nên bắt đầu bằng "Scan pages without text". Đây là lựa chọn phù hợp cho PDF hỗn hợp vì văn bản số rõ ràng hiện có không bị thay đổi.

Chỉ dùng "Recognize existing text again" khi lớp chữ cũ thực sự sai, chẳng hạn một từ nhìn thấy rõ nhưng không tìm được, hoặc sao chép ra chuỗi vô nghĩa. "Treat every page as an image" chỉ phù hợp khi cần OCR lại từ đầu và bạn chấp nhận việc chữ có thể chọn cùng liên kết cũ sẽ bị mất.

Nếu PDF có chữ ký số, OCR sẽ làm chữ ký số không còn hợp lệ. Hãy giữ nguyên bản gốc đã ký để lưu trữ hoặc xác minh.

Kiểm tra kết quả OCR PDF như thế nào trên máy tính và điện thoại?

Đừng chỉ dựa vào thông báo hoàn tất. Trước khi chia sẻ, tìm dữ liệu hoặc nhập lại thông tin, hãy kiểm tra PDF đã tải về:

  1. Mở PDF đã OCR trong trình đọc PDF quen dùng.
  2. Trên Windows hoặc ChromeOS, nhấn Ctrl+F; trên macOS, nhấn Command+F. Trên Android hoặc iPhone, dùng biểu tượng tìm kiếm trong trình xem PDF.
  3. Tìm một từ đặc trưng hiện rõ trên trang, như họ tên, tên công ty, ngày tháng hoặc mã hóa đơn.
  4. Thử chọn một câu có dấu tiếng Việt, sao chép và dán vào ứng dụng ghi chú.
  5. So sánh nội dung đã dán với ảnh gốc, đặc biệt là tên riêng, số tiền, địa chỉ, mã số và bảng biểu.
  6. Kiểm tra ngẫu nhiên ít nhất một trang ở đầu, giữa và cuối tệp.

Nếu lỗi nhiều, hãy dùng bản quét gốc rõ hơn nếu có thể, chọn lại ngôn ngữ và bật làm thẳng hoặc sửa hướng trang trước khi OCR lại.

Sau OCR, tìm kiếm trong PDF hay chuyển PDF sang Word?

Nếu chỉ cần tra cứu hoặc sao chép nội dung, hãy giữ PDF đã OCR. Hình thức của trang quét được duy trì, trong khi nội dung vẫn có thể tìm kiếm.

Nếu cần làm việc tiếp với tệp DOCX, hãy OCR trước rồi dùng công cụ PDF sang Word:

  1. Hoàn tất OCR và tải PDF có thể tìm kiếm.
  2. Mở công cụ PDF sang Word.
  3. Nhấn "Chọn các file PDF" và chọn chính PDF đã OCR.
  4. Nhấn "Chuyển sang Word".
  5. Tải DOCX về, mở trong Word và kiểm tra trước khi chỉnh sửa.

Công cụ PDF sang Word không tự nhận dạng chữ trên trang scan. Nếu đưa bản quét gốc chưa OCR vào, các trang quét được thêm vào Word dưới dạng ảnh, không phải đoạn văn bản có thể sửa. Ngay cả sau OCR, vẫn cần soát lại bố cục, bảng nhiều cột, chân trang và dữ liệu quan trọng.

Tệp PDF được xử lý và xóa như thế nào?

Với OCR PDF của PDF Toucan, tệp được gửi qua HTTPS đến máy chủ tại Liên minh châu Âu. Tệp được xử lý trong bộ nhớ, không được ghi hoặc lưu trên đĩa, và bị xóa ngay sau khi bạn tải kết quả, muộn nhất sau 10 phút.

Bạn không cần tạo tài khoản. Các công cụ trên trình duyệt không có giới hạn dùng hằng ngày và không thêm hình mờ; quảng cáo hỗ trợ vận hành dịch vụ. Tuy vậy, với hồ sơ cực kỳ nhạy cảm hoặc dữ liệu không được phép rời thiết bị theo chính sách nội bộ, hãy dùng giải pháp OCR ngoại tuyến thay vì bất kỳ dịch vụ trực tuyến nào.

Câu hỏi thường gặp

OCR PDF online có nhận dạng tiếng Việt có dấu không?

Có. Chọn Tiếng Việt trong ngôn ngữ tài liệu để tăng khả năng nhận dạng đ, ă, ơ, ư và dấu thanh. Kết quả vẫn phụ thuộc chất lượng bản quét, nên cần kiểm tra họ tên, địa chỉ, số liệu và các câu có nhiều dấu trước khi sử dụng.

OCR PDF có làm PDF thành Word chỉnh sửa được không?

Không trực tiếp. OCR thêm lớp văn bản để PDF có thể tìm kiếm và sao chép. Nếu cần DOCX, hãy OCR trước rồi chuyển PDF sang Word. PDF quét chưa OCR khi chuyển sang Word sẽ được đưa vào dưới dạng ảnh, không phải văn bản chỉnh sửa được.

Làm sao để tìm kiếm chữ trong PDF sau khi OCR?

Mở PDF đã tải về, nhấn Ctrl+F trên Windows hoặc ChromeOS, Command+F trên macOS, hoặc dùng biểu tượng tìm kiếm trong trình xem PDF trên điện thoại. Thử tìm tên riêng, ngày tháng hoặc mã số rõ ràng và xác nhận trình xem chuyển đến đúng trang.

OCR có làm mất chữ ký số của PDF không?

Có. OCR thay đổi nội dung PDF khi thêm hoặc thay thế lớp văn bản, vì vậy chữ ký số hiện có không còn hợp lệ. Hãy lưu bản gốc đã ký không chỉnh sửa để xác minh, và chỉ dùng bản OCR cho tìm kiếm, sao chép hoặc xử lý công việc.

Tại sao OCR PDF bị sai chữ hoặc sai số?

Nguyên nhân thường là ảnh mờ, độ phân giải thấp, trang nghiêng, chữ quá nhỏ, con dấu che nội dung hoặc chọn sai ngôn ngữ. Hãy chọn đúng ngôn ngữ, bật làm thẳng và sửa hướng khi cần, rồi đối chiếu kỹ các ký tự dễ nhầm như 0/O và 1/I/l.

Cách OCR PDF trực tuyến
Cách OCR PDF trực tuyến

Hướng dẫn liên quan