ข้ามไปยังเนื้อหา
PDFToucan หน้าแรก PDF Toucan

แปลงไฟล์ PDF สแกน เป็นข้อความ: ให้ค้นหา คัดลอก และใช้ต่อได้

PDF Toucan editorial team · อัปเดตล่าสุด 20 กันยายน 2569 · อ่าน 8 นาที

แปลงไฟล์ PDF สแกน เป็นข้อความ: ให้ค้นหา คัดลอก และใช้ต่อได้

ต้องการแปลงไฟล์ PDF สแกน เป็นข้อความเพื่อค้นหา คัดลอก และนำไปใช้ต่อ ให้ทำ OCR กับไฟล์นั้นก่อน ระบบจะเพิ่มชั้นข้อความไว้บนภาพสแกน เลือกภาษาไทยและภาษาอื่นที่ใช้จริง ปรับหน้าเอียงหรือกลับหัวเมื่อจำเป็น แล้วดาวน์โหลด PDF ที่ค้นหาได้เพื่อลองค้นหาด้วย Ctrl+F หรือ ⌘+F

OCR ทำอะไรกับ PDF ที่สแกนเป็นรูปภาพ?

PDF ที่สแกนจากเครื่องสแกนหรือกล้องมือถือมักประกอบด้วยภาพของกระดาษในแต่ละหน้า แม้ตาเราจะเห็นเป็นตัวหนังสือ แต่โปรแกรมอ่าน PDF เห็นเพียงพิกเซล จึงเกิดอาการต่อไปนี้

  • กด Ctrl+F หรือ ⌘+F แล้วค้นหาคำไม่พบ
  • ลากเมาส์แล้วเลือกได้เป็นกรอบภาพ แทนที่จะเป็นคำหรือประโยค
  • คัดลอกแล้วไม่ได้ข้อความ หรือได้ข้อความที่ใช้ต่อไม่ได้

OCR ย่อมาจาก Optical Character Recognition หรือการรู้จำอักขระจากภาพ ระบบจะวิเคราะห์รูปทรงของตัวอักษร แล้วใส่ชั้นข้อความที่เลือกและค้นหาได้ทับตำแหน่งเดิมของภาพ หน้าตา PDF แทบไม่เปลี่ยน แต่คุณสามารถค้นหา คัดลอก หรือดึงข้อความไปตรวจทานต่อได้

อย่างไรก็ตาม OCR ไม่ใช่การถอดข้อความที่ถูกต้องสมบูรณ์ คุณภาพผลลัพธ์ขึ้นกับต้นฉบับอย่างมาก เช่น ความคมชัด ฟอนต์ ตัวอักษรเล็ก รอยพับ เงาจากการถ่ายภาพ หน้ากระดาษเอียง ตราประทับ ตัวหนังสือทับกัน และลายมือ เอกสารพิมพ์ที่สแกนตรงและชัดมักอ่านได้ดีกว่าเอกสารสำเนาหลายชั้นหรือภาพจากโทรศัพท์ที่เบลอ

ข้อควรระวังคือ การทำ OCR จะเปลี่ยนเนื้อหา PDF เพื่อเพิ่มชั้นข้อความ หากไฟล์มีลายเซ็นดิจิทัล ลายเซ็นนั้นจะไม่ถูกต้องอีกต่อไป เก็บไฟล์ต้นฉบับที่ลงลายเซ็นไว้แยกต่างหากเสมอ และใช้ไฟล์ OCR เป็นสำเนาสำหรับค้นหาและทำงาน

แปลงไฟล์ PDF สแกนเป็นข้อความด้วย OCR อย่างไร?

ใช้เครื่องมือ OCR PDF ของ PDF Toucan ได้จากเบราว์เซอร์ทั้งคอมพิวเตอร์ แท็บเล็ต และมือถือ โดยผลลัพธ์ยังเป็นไฟล์ PDF ที่ค้นหาและคัดลอกข้อความได้

  1. เปิดหน้า OCR PDF แล้วกดปุ่ม เลือกไฟล์ PDF เพื่อเลือกไฟล์จากอุปกรณ์ คุณยังลากไฟล์มาวางที่ใดก็ได้บนหน้า หรือวางไฟล์จากคลิปบอร์ดได้
  2. ในส่วนภาษาเอกสาร เลือกอย่างน้อย 1 ภาษาที่ปรากฏอยู่จริงในเอกสาร เช่น ไทย สำหรับเอกสารภาษาไทย
  3. หากต้องการ ตั้งค่าหน้าเพิ่มเติมในส่วนตัวเลือกเพิ่มเติม โดยเลือกหน้าที่จะสแกนและการแก้หน้าเอียงหรือการวางแนวหน้า
  4. กด รู้จำข้อความ แล้วรอให้ระบบประมวลผล ไฟล์จำนวนมากหรือไฟล์หลายหน้าอาจใช้เวลาหลายนาที จึงควรเปิดแท็บนี้ค้างไว้จนงานเสร็จ
  5. เมื่อสถานะแจ้งว่ารู้จำข้อความเสร็จแล้ว กดดาวน์โหลด PDF ที่ค้นหาได้ จากนั้นเปิดไฟล์เพื่อทดสอบการค้นหาและการคัดลอก

เครื่องมือนี้รับหลายไฟล์ได้ โดยแต่ละไฟล์จะถูกประมวลผลแยกกัน ใช้งานโดยไม่ต้องสมัครบัญชี ไม่มีลายน้ำ และไม่มีการจำกัดจำนวนครั้งต่อวันสำหรับเครื่องมือบนเบราว์เซอร์

การทำ OCR ต้องใช้การประมวลผลบนเซิร์ฟเวอร์ ไฟล์จึงถูกส่งผ่าน HTTPS ไปยังเซิร์ฟเวอร์ในสหภาพยุโรป ระบบประมวลผลไฟล์ในหน่วยความจำ ไม่เขียนลงดิสก์และไม่จัดเก็บไฟล์ ไฟล์จะถูกลบหลังดาวน์โหลดผลลัพธ์ หรืออย่างช้าที่สุดภายใน 10 นาที หากเอกสารมีข้อกำหนดว่าห้ามออกจากอุปกรณ์โดยเด็ดขาด ควรเลือกซอฟต์แวร์ OCR แบบออฟไลน์แทน

ต้องเลือกภาษาใดสำหรับเอกสารไทยปนอังกฤษ?

การเลือกภาษาไม่ใช่แค่การตั้งค่าประกอบ เพราะช่วยให้ระบบคาดเดารูปอักษรและรูปแบบคำได้เหมาะกับเอกสาร จึงมีผลต่อความแม่นยำโดยตรง

  1. เลือก ไทย สำหรับเอกสารภาษาไทย
  2. เพิ่ม อังกฤษ เมื่อมีหัวข้อภาษาอังกฤษ ชื่อบริษัท ชื่อสินค้า อีเมล URL หรือข้อความในตารางภาษาอังกฤษ
  3. หากมีภาษาอื่นจริง เช่น จีน ญี่ปุ่น หรือเกาหลี ให้เพิ่มเฉพาะภาษานั้นตามเนื้อหา
  4. เริ่มจากภาษาไทยกับอังกฤษก่อนสำหรับเอกสารทั่วไปที่มีตัวเลขปนอยู่ แล้วค่อยเพิ่มภาษาเมื่อพบอักษรของภาษาอื่น

รองรับภาษาและชุดอักษร 30 ภาษา รวมถึงไทย อักษรละติน ซีริลลิก กรีก อาหรับ ฮีบรู เทวนาครี จีน ญี่ปุ่น และเกาหลี และรวมได้สูงสุด 5 ภาษาในครั้งเดียว แต่ไม่ควรเลือกทุกภาษาเผื่อไว้ เพราะภาษาเพิ่มเติมทำให้ประมวลผลช้าลงและอาจเพิ่มโอกาสที่ระบบตีความอักขระคลาดเคลื่อน

ควรเลือกสแกนหน้าไหน และแก้หน้าเอียงอย่างไร?

PDF บางไฟล์เป็นแบบผสม เช่น หน้าจดหมายที่สร้างจากคอมพิวเตอร์มีข้อความอยู่แล้ว แต่เอกสารแนบเป็นภาพสแกน การเลือกโหมดให้เหมาะช่วยรักษาข้อความและลิงก์เดิมไว้

ตัวเลือกระบบทำอะไรเหมาะกับกรณีข้อควรทราบ
สแกนหน้าที่ไม่มีข้อความอ่านเฉพาะหน้าที่เป็นภาพ หน้าที่มีข้อความอยู่แล้วจะไม่ถูกแตะเอกสารสแกนทั่วไปและ PDF แบบผสมเป็นตัวเลือกที่แนะนำ แต่ข้อความเก่าที่อ่านผิดจะยังคงอยู่
รู้จำข้อความเดิมอีกครั้งลบข้อความเดิมที่อ่านได้ไม่ดี แล้วอ่านหน้าใหม่ไฟล์ที่มีชั้นข้อความเดิมแต่ค้นหาและคัดลอกผิดมากใช้ร่วมกับการปรับหน้าที่เอียงให้ตรงไม่ได้
ถือว่าทุกหน้าเป็นรูปภาพเปลี่ยนทุกหน้าเป็นภาพและทำ OCR ใหม่ทั้งหมดไฟล์ที่ชั้นข้อความเสียหรือไม่เชื่อถือทั้งฉบับข้อความที่เลือกได้และลิงก์เดิมจะหายไป

เริ่มด้วย สแกนหน้าที่ไม่มีข้อความ ก่อน เพราะช่วยไม่ให้ข้อความดิจิทัลที่ดีอยู่แล้วถูกแก้ไข สำหรับหน้าที่สแกนเฉียง ให้เปิด ปรับหน้าที่เอียงให้ตรง เพื่อช่วยให้บรรทัดอยู่ในแนวที่ระบบอ่านได้ดีขึ้น ส่วนหน้าที่กลับหัวหรือวางด้านข้าง ให้เปิด แก้ไขการวางแนวหน้าอัตโนมัติ

หากเลือก รู้จำข้อความเดิมอีกครั้ง จะใช้การปรับหน้าที่เอียงให้ตรงไม่ได้ ถ้าไฟล์จำเป็นต้องอ่านใหม่ทั้งชุดและต้องแก้ความเอียงด้วย อาจเลือก ถือว่าทุกหน้าเป็นรูปภาพ ได้ แต่ต้องยอมรับว่าข้อความและลิงก์เดิมจะถูกทิ้ง

ก่อนทำเอกสารจำนวนหลายร้อยหน้า ควรทดสอบกับช่วงสั้น ๆ ก่อน โดยเฉพาะใบเสร็จ แบบฟอร์มที่มีช่อง ตาราง เอกสารหลายคอลัมน์ และหน้าที่มีตราประทับ หากต้นฉบับเบลอหรืออักษรเล็กมาก การสแกนใหม่ให้คม ชัด และตรงย่อมดีกว่าหวังให้ OCR สร้างรายละเอียดที่ไม่มีอยู่ในภาพ

ตรวจผล OCR ว่าค้นหาและคัดลอกข้อความได้จริงอย่างไร?

อย่าเพิ่งใช้ผล OCR กับงานสำคัญโดยไม่ตรวจสอบ ทำตามขั้นตอนนี้หลังดาวน์โหลดไฟล์

  1. เปิด PDF ที่ดาวน์โหลดในเบราว์เซอร์หรือโปรแกรมอ่าน PDF ที่ใช้อยู่
  2. กด Ctrl+F บน Windows หรือ ChromeOS หรือกด ⌘+F บน Mac
  3. ค้นหาคำที่เห็นชัดและรู้แน่นอน เช่น ชื่อบริษัท หัวข้อ เลขที่เอกสาร วันที่ หรือเลขใบแจ้งหนี้
  4. ตรวจว่าโปรแกรมพาไปยังหน้าที่และคำที่ถูกต้อง ลองค้นหาทั้งช่วงต้น กลาง และท้ายเอกสาร
  5. ลากเลือกประโยคสั้น ๆ คัดลอกไปวางในโปรแกรมโน้ต แล้วเทียบกับภาพต้นฉบับ

ควรตรวจเป็นพิเศษสำหรับเลข 0 กับ O, เลข 1 กับ I หรือตัว l, เลข 5 กับ S รวมถึงวันที่ ยอดเงิน เลขบัญชี รหัสอ้างอิง ที่อยู่ และชื่อบุคคล คำเหล่านี้อาจผิดเพียงตัวเดียวแต่ทำให้ข้อมูลใช้งานผิดพลาดได้

ถ้าค้นหาบางคำไม่พบ ให้ตรวจว่าคุณเลือกภาษาได้ตรงกับเนื้อหาหรือไม่ และดูว่าหน้ากลับหัวหรือเอียงหรือเปล่า หากปัญหาเกิดจากชั้นข้อความเดิมที่เสีย ให้ลองทำใหม่ด้วย รู้จำข้อความเดิมอีกครั้ง หรือ ถือว่าทุกหน้าเป็นรูปภาพ ตามความเหมาะสม อย่าใช้ข้อความ OCR แทนการตรวจต้นฉบับในงานกฎหมาย การเงิน หรือข้อมูลที่ต้องแม่นยำสูง

หลังทำ OCR แล้ว จะค้นหาใน PDF หรือแปลงเป็น Word ได้อย่างไร?

หากเป้าหมายคือเก็บเอกสารให้ค้นหาได้ คัดลอกบางส่วน หรืออ้างอิงภายหลัง ให้ใช้ PDF ที่ผ่าน OCR แล้วเปิดด้วยโปรแกรมอ่าน PDF และค้นหาด้วย Ctrl+F หรือ ⌘+F ได้เลย PDF ยังเหมาะสำหรับรักษาหน้าตาเอกสารให้ใกล้กับต้นฉบับ

หากต้องการนำเนื้อหาไปแก้ไขใน Word ให้ทำตามลำดับนี้

  1. ทำ OCR กับ PDF สแกนและดาวน์โหลดไฟล์ PDF ที่ค้นหาได้ก่อน
  2. เปิด PDF เป็น Word แล้วกด เลือกไฟล์ PDF
  3. เลือกไฟล์ PDF ที่ผ่าน OCR แล้ว ไม่ใช่ไฟล์สแกนต้นฉบับ
  4. กด แปลงเป็น Word แล้วดาวน์โหลดไฟล์ DOCX
  5. เปิดใน Word และตรวจทุกหน้าเทียบกับ PDF ก่อนแก้ไขหรือนำส่ง

ลำดับนี้สำคัญ เพราะเครื่องมือ PDF เป็น Word ไม่ได้รู้จำตัวอักษรจากหน้าสแกนเอง หากส่ง PDF ที่เป็นภาพสแกนเข้าไป หน้าสแกนจะถูกใส่เป็นรูปภาพใน DOCX ไม่ได้กลายเป็นข้อความที่แก้ไขได้โดยตรง เมื่อทำ OCR ก่อน ตัวแปลงจึงมีข้อความให้ใช้ต่อได้

ถึงอย่างนั้น ควรตรวจเลย์เอาต์ทุกหน้า โดยเฉพาะตาราง หัวกระดาษ ช่องกรอกข้อมูล เอกสารหลายคอลัมน์ เชิงอรรถ และการตัดบรรทัด การแปลงเป็น Word อาจจัดวางไม่เหมือนต้นฉบับทั้งหมด เก็บ PDF ที่ค้นหาได้ไว้เป็นไฟล์อ้างอิงขณะตรวจ DOCX เสมอ

คำถามที่พบบ่อย

OCR ทำให้ PDF สแกนแก้ไขข้อความได้เลยหรือไม่?

OCR เพิ่มชั้นข้อความเพื่อให้ค้นหา เลือก และคัดลอกได้ใน PDF แต่ไม่ได้หมายความว่าคุณจะแก้ไขข้อความบนหน้ากระดาษเดิมได้อย่างอิสระเสมอไป หากต้องการแก้ไขเนื้อหาเป็นเอกสาร ให้ทำ OCR ก่อน แล้วแปลง PDF ที่ค้นหาได้เป็น Word และตรวจผลลัพธ์อีกครั้ง

PDF ภาษาไทยปนอังกฤษควรเลือกภาษาอะไรตอนทำ OCR?

เลือก ไทย และเพิ่ม อังกฤษ หากมีคำอังกฤษ หัวข้อ ชื่อสินค้า หรือข้อความในตาราง เลือกเฉพาะภาษาที่ปรากฏจริง เพราะระบบรองรับการรวมภาษาได้สูงสุด 5 ภาษา แต่ภาษาเกินจำเป็นทำให้การประมวลผลช้าลงและอาจทำให้อักขระที่คล้ายกันถูกอ่านผิดได้

ทำไมทำ OCR แล้วค้นหาบางคำไม่เจอ?

สาเหตุอาจมาจากภาพเบลอ หน้าเอียง การวางแนวผิด ภาษาไม่ตรงกับเอกสาร หรือชั้นข้อความเดิมที่อ่านผิด ลองค้นหาคำอื่นเพื่อเปรียบเทียบ เปิดการแก้แนวหน้า และเลือกภาษาที่ถูกต้อง หากข้อความเก่าเสียมาก ให้ทำ OCR ใหม่ด้วยตัวเลือกอ่านข้อความเดิมอีกครั้งหรืออ่านทุกหน้าเป็นภาพ

OCR PDF แล้วลายเซ็นดิจิทัลยังใช้ได้หรือไม่?

ไม่ได้ การเพิ่มชั้นข้อความทำให้เนื้อหาไฟล์เปลี่ยนไป จึงทำให้ลายเซ็นดิจิทัลไม่ถูกต้องอีกต่อไป ควรเก็บไฟล์ PDF ต้นฉบับที่ลงลายเซ็นไว้โดยไม่แก้ไข และใช้สำเนาที่ผ่าน OCR สำหรับค้นหา คัดลอก แปลงเป็น Word หรือทำงานภายในเท่านั้น

วิธี แปลง PDF เป็นข้อความ ออนไลน์
วิธี แปลง PDF เป็นข้อความ ออนไลน์

คู่มือที่เกี่ยวข้อง