OCR PDF online: Jadikan imbasan boleh dicari dan disalin
PDF Toucan editorial team · Kemas kini terakhir 20 September 2026 · 7 min baca

Untuk menggunakan OCR PDF online pada imbasan, jalankan pengecaman teks supaya lapisan teks ditambah pada setiap halaman: buka alat OCR PDF, pilih bahasa dokumen, tekan “Kenal pasti teks”, kemudian muat turun PDF boleh dicari dan uji dengan fungsi Cari. Jika anda mahu fail Word yang boleh disunting, lakukan OCR dahulu sebelum menukar PDF itu kepada Word.
Apakah OCR dan bila PDF imbasan memerlukannya?
PDF imbasan lazimnya ialah himpunan imej halaman. Walaupun anda boleh melihat surat, invois atau nota dengan jelas, pembaca PDF hanya melihat piksel, bukan huruf dan perkataan. Oleh sebab itu, carian tidak menemukan apa-apa, pemilihan tetikus memilih satu kawasan imej, dan teks tidak boleh disalin dengan betul.
OCR, atau pengecaman aksara optik, menganalisis bentuk aksara dalam imej halaman dan menambah lapisan teks pada PDF. Rupa halaman asal kekal sama, tetapi anda boleh mencari perkataan, memilih ayat dan menyalin kandungan.
Gunakan OCR apabila satu atau lebih tanda berikut berlaku:
- Anda tidak boleh memilih perkataan secara berasingan dengan tetikus atau jari.
Ctrl+Fdi Windows atauCommand+Fdi Mac tidak menemukan perkataan yang jelas kelihatan pada halaman.- Menyalin teks menghasilkan ruang kosong, aksara rawak atau imej sahaja.
- PDF mengandungi halaman daripada pengimbas, mesin fotostat atau kamera telefon.
OCR bukan jaminan transkripsi sempurna. Imbasan cetakan yang tajam dan lurus biasanya memberi hasil lebih baik berbanding tulisan tangan, teks kecil, dokumen kabur, salinan fotostat berulang, halaman berbayang atau cap yang menindih teks. Semak kandungan penting selepas proses selesai.
Bagaimana menggunakan OCR PDF online di PDF Toucan?
PDF Toucan membolehkan anda memproses satu atau beberapa fail PDF tanpa akaun, tera air atau had harian pada alat pelayar. Untuk beberapa fail, setiap fail diproses secara berasingan.
- Buka OCR PDF percuma.
- Tekan “Pilih fail PDF” dan pilih dokumen anda. Anda juga boleh menyeret fail ke mana-mana bahagian halaman atau menampal fail.
- Dalam bahagian bahasa dokumen, pilih sekurang-kurangnya satu bahasa yang digunakan dalam PDF.
- Jika perlu, buka pilihan tambahan untuk menentukan halaman yang hendak diimbas atau menggunakan pembetulan halaman.
- Tekan “Kenal pasti teks”.
- Tunggu sehingga proses selesai, kemudian muat turun PDF boleh dicari.
- Buka fail yang dimuat turun dalam pembaca PDF anda dan uji fungsi carian sebelum menggunakan atau berkongsi fail tersebut.
Pengecaman teks untuk PDF yang mempunyai banyak halaman boleh mengambil beberapa minit. Biarkan tab pelayar terbuka sehingga hasil tersedia. PDF asal juga kekal sebagai fail berasingan; hasil OCR ialah salinan baharu yang mempunyai lapisan teks.
Bahasa OCR dan tetapan halaman manakah patut dipilih?
Pemilihan bahasa mempengaruhi ketepatan OCR kerana enjin pengecaman menggunakan bentuk aksara, tanda diakritik dan corak perkataan bahasa berkenaan. Pilih hanya bahasa yang benar-benar muncul dalam dokumen. Sebagai contoh, pilih Bahasa Melayu dan Inggeris untuk borang dwibahasa atau laporan yang mengandungi kedua-duanya.
PDF Toucan menyokong 30 bahasa merentas skrip Latin, Cyrillic, Greek, Arab, Ibrani, Devanagari, Thai, Cina, Jepun dan Korea. Anda boleh menggabungkan sehingga lima bahasa dalam satu proses, tetapi bahasa tambahan memperlahankan pengecaman. Jangan pilih semua bahasa hanya sebagai langkah berjaga-jaga.
Pilihan halaman menentukan sama ada alat membaca halaman imej sahaja atau memproses semula teks yang sedia ada.
| Pilihan | Apa yang dilakukan | Sesuai untuk | Perkara yang perlu diketahui |
|---|---|---|---|
| Imbas halaman tanpa teks | Mengenal pasti halaman yang hanya berupa imej dan membiarkan halaman yang sudah ada teks | Kebanyakan PDF imbasan dan PDF campuran | Pilihan disyorkan; teks sedia ada yang lemah tidak diperbaiki |
| Kenal pasti teks sedia ada sekali lagi | Membuang teks lama yang kurang tepat lalu membaca halaman itu semula | PDF dengan lapisan OCR lama yang banyak ralat | Pilihan meluruskan halaman tidak tersedia |
| Anggap setiap halaman sebagai imej | Menukar setiap halaman kepada imej dan menjalankan OCR dari awal | Lapisan teks rosak atau tidak boleh digunakan | Teks boleh pilih dan pautan lama akan hilang |
Mulakan dengan “Imbas halaman tanpa teks”. Ini melindungi teks digital yang sudah baik dan masih memproses semua halaman jika PDF anda ialah imbasan penuh. Pilih OCR semula hanya apabila anda mempunyai bukti teks lama bermasalah, misalnya hasil salinan menjadi tidak masuk akal atau carian gagal menemui perkataan yang jelas kelihatan.
Bagaimana meluruskan dan membetulkan orientasi PDF imbasan?
Halaman yang condong, mengiring atau terbalik menyukarkan pengecaman. Gunakan pembetulan halaman sebelum memulakan proses jika keadaan ini wujud dalam fail anda.
- Aktifkan “Luruskan halaman condong” jika helaian diimbas senget atau gambar dokumen diambil dari sudut yang tidak rata. Garis teks yang lebih mendatar biasanya lebih mudah dikenal pasti.
- Aktifkan “Betulkan orientasi halaman secara automatik” jika sesetengah halaman terbalik atau mengiring. Ini berguna untuk fail daripada telefon atau dokumen yang mencampurkan surat potret dengan jadual landskap.
- Ingat bahawa pilihan meluruskan tidak tersedia apabila “Kenal pasti teks sedia ada sekali lagi” dipilih.
- Jika dokumen terlalu gelap, kabur, terpotong atau mempunyai bayang kuat, imbas semula jika boleh. OCR boleh membantu membaca teks, tetapi tidak boleh memulihkan butiran yang tidak kelihatan dalam imej asal.
Jika anda perlu memproses arkib yang besar, cuba dahulu pada beberapa halaman yang mewakili dokumen tersebut. Ujian ringkas ini boleh menunjukkan sama ada bahasa, orientasi dan kualiti imbasan sudah sesuai sebelum anda memproses ratusan halaman.
Bagaimana menyemak sama ada teks OCR betul dan boleh dicari?
Jangan hanya bergantung pada mesej bahawa teks telah dikenal pasti. Lakukan semakan praktikal, khususnya jika PDF digunakan untuk urusan kewangan, undang-undang, rekod pelanggan atau kerja akademik.
- Buka PDF boleh dicari yang dimuat turun dalam pelayar atau pembaca PDF biasa.
- Tekan
Ctrl+Fpada Windows atauCommand+Fpada Mac. Cari nama, nombor rujukan, tarikh atau istilah khusus yang anda tahu ada pada halaman. - Ulang carian pada bahagian awal, tengah dan akhir dokumen. Kualiti imbasan mungkin berubah antara halaman.
- Pilih dan salin beberapa ayat dari halaman berlainan, kemudian tampal ke dalam editor teks biasa untuk membandingkannya dengan imej asal.
- Semak nombor akaun, jumlah wang, alamat, nama, jadual dan teks kecil dengan lebih teliti.
Beri perhatian khusus kepada pasangan aksara yang mudah dikelirukan, seperti O dan 0, I, l dan 1, atau S dan 5. Jadual berbilang lajur, cap, nota tulisan tangan dan teks yang bertindih juga memerlukan pemeriksaan manual.
Jika hasilnya lemah, jalankan semula OCR dengan bahasa yang betul dan pembetulan orientasi. Jika masalah berpunca daripada lapisan teks lama yang rosak, gunakan “Kenal pasti teks sedia ada sekali lagi” atau “Anggap setiap halaman sebagai imej”, bergantung pada keadaan fail.
Bagaimana mencari teks atau menukar PDF OCR kepada Word?
Untuk mencari, menyalin atau mengekstrak kandungan, gunakan terus PDF yang telah melalui OCR. Lapisan teks membolehkan fungsi Cari berfungsi tanpa mengubah rupa halaman imbasan.
Jika anda juga memerlukan dokumen Word yang boleh disunting, susunan kerja adalah penting:
- Jalankan OCR pada PDF asal dan muat turun PDF boleh dicari.
- Buka penukar PDF ke Word.
- Tekan “Pilih fail PDF” dan pilih PDF yang telah melalui OCR, bukan imbasan asal.
- Tekan “Tukar kepada Word”.
- Muat turun fail DOCX, buka dalam Word dan semak kandungannya sebelum mengedit atau menghantarnya.
Alat PDF ke Word tidak mengenal pasti teks dalam halaman imbasan. Jika anda terus menukar PDF imbasan tanpa OCR, halaman imbasan akan dimasukkan ke dalam dokumen Word sebagai gambar, bukannya perenggan yang boleh diedit. Walaupun OCR telah dijalankan, susun atur jadual, lajur, nota kaki dan elemen kompleks mungkin berubah dalam Word. Bandingkan DOCX dengan PDF boleh dicari semasa menyemak.
Selepas itu, jika fail imbasan masih terlalu besar kerana banyak imej, alat compress boleh dipertimbangkan untuk mengurangkan saiz fail. Semak dahulu kebolehbacaan hasil mampatan, terutamanya jika teks pada halaman asal sudah kecil.
Adakah fail selamat dan apakah yang perlu diketahui sebelum OCR?
OCR memerlukan pemprosesan pada pelayan. Fail dihantar melalui HTTPS ke pelayan di Kesatuan Eropah, diproses dalam memori, tidak ditulis ke cakera atau disimpan, dan dipadam sebaik sahaja hasil dimuat turun atau selewat-lewatnya selepas 10 minit.
Walau bagaimanapun, ikuti dasar organisasi anda. Jika peraturan majikan, sekolah, pelanggan atau undang-undang dalaman melarang pemprosesan dokumen melalui perkhidmatan dalam talian, gunakan perisian OCR luar talian yang diluluskan organisasi tersebut.
Satu kesan penting ialah tandatangan digital. OCR mengubah kandungan PDF dengan menambah lapisan teks, maka tandatangan digital sedia ada tidak lagi sah. Simpan fail asal yang ditandatangani tanpa sebarang perubahan dan gunakan salinan OCR sebagai fail kerja untuk carian, salinan teks atau penukaran Word.
Soalan lazim
Adakah OCR boleh mengenal pasti Bahasa Melayu dan Inggeris dalam PDF yang sama?
Ya. Pilih kedua-dua bahasa dalam tetapan bahasa dokumen sebelum menekan “Kenal pasti teks”. Ini membantu enjin mengenal pasti perkataan dan aksara bagi kedua-dua bahasa. Pilih hanya bahasa yang benar-benar digunakan kerana bahasa tambahan boleh memperlahankan proses.
Mengapa saya masih tidak boleh mencari perkataan selepas OCR?
Mungkin perkataan itu dibaca dengan salah akibat imej kabur, halaman condong, teks terlalu kecil atau bahasa yang tidak tepat dipilih. Uji dengan beberapa istilah lain, semak hasil salinan, kemudian jalankan semula OCR dengan bahasa dan pembetulan halaman yang sesuai.
Patutkah saya pilih “Imbas halaman tanpa teks” atau OCR semula teks sedia ada?
Mulakan dengan “Imbas halaman tanpa teks”, iaitu pilihan disyorkan yang membiarkan teks digital yang baik tidak berubah. Pilih OCR semula hanya apabila lapisan teks sedia ada salah atau tidak boleh digunakan. Gunakan pilihan setiap halaman sebagai imej jika teks dan pautan lama memang perlu diganti.
Bolehkah PDF imbasan terus ditukar kepada Word yang boleh diedit?
Tidak dengan hasil yang dikehendaki. Jika PDF imbasan ditukar terus, halaman akan dimasukkan sebagai gambar dalam DOCX. Jalankan OCR dahulu untuk menambah teks boleh pilih, kemudian gunakan PDF ke Word pada salinan OCR. Semak susun atur dan aksara selepas penukaran.
Adakah tandatangan digital PDF kekal sah selepas OCR?
Tidak. Menambah lapisan teks mengubah dokumen, jadi tandatangan digital dalam PDF tidak lagi sah. Simpan versi asal yang ditandatangani sebagai rekod yang tidak diubah. Gunakan versi OCR hanya untuk carian, penyalinan, semakan atau penukaran kandungan.
