AI อ่าน PDF ภาษาไทยได้ไหม? เทียบ ChatGPT, Gemini Notebook, Gemini และ Claude ด้วยเนื้อหาเดียวกัน 3 แบบ

SHIRO ผู้ตรวจคุณภาพ AI กำลังเปรียบเทียบ PDF ภาษาไทยสามสภาพ ตั้งแต่ไฟล์คมชัดถึงภาพสแกนมีรอยพับ เพื่อค้นหาความผิดพลาดของ OCR

คุณอัปโหลดรายงานภาษาไทย 80 หน้า ถามว่า “งบประมาณโครงการนี้เพิ่มขึ้นเท่าไร” AI ตอบกลับเป็นย่อหน้าที่อ่านลื่นและดูมั่นใจมาก

ปัญหาคือ ตัวเลขนั้นอาจมาจากตารางผิดปี หรือ AI อาจอ่านเครื่องหมายลบตกหล่นไปหนึ่งตัว

นี่คือกับดักสำคัญของเครื่องมืออ่านเอกสาร: อัปโหลด PDF ได้ ไม่ได้แปลว่าอ่าน PDF ภาษาไทยได้แม่น และคำตอบที่ฟังดูดีก็ไม่ได้แปลว่ามีหลักฐานรองรับ

คำตอบสั้น: ไฟล์คมอ่านได้ดี แต่ไฟล์เสื่อมทำให้ชื่อคนผิดได้

จากการทดสอบ PDF ภาษาไทย 5 หน้า 3 รอบ เครื่องมือทั้งสี่ได้ 16/16 เท่ากันใน Native-text v1 รอบ Scan/OCR v2 แบบภาพล้วนคือ ChatGPT 16/16, Gemini Notebook 15/16, Gemini 15/16 และ Claude 16/16 ส่วนรอบ Degraded-scan/Table Stress v3 คือ ChatGPT 16/16, Gemini Notebook 16/16, Gemini 13/16 และ Claude 16/16 จุดสำคัญไม่ใช่เพียงคะแนนรวม แต่คือ Gemini อ่านชื่อผู้อนุมัติผิดในไฟล์เสื่อมคุณภาพ แม้คำตอบยังดูมั่นใจและมี Citation

รอบทดสอบChatGPT Pro เว็บGemini NotebookGemini ProClaude Opus 4.8 High
Native-text v116/1616/1616/1616/16
Scan/OCR v216/1615/1615/1616/16
Degraded-scan/Table Stress v316/1616/1613/1616/16

ตารางนี้เป็นผลจากการรันไฟล์ละหนึ่งครั้ง ไม่ใช่อัตราความแม่นโดยรวมของผลิตภัณฑ์

ถ้าต้องเลือกจากวิธีทำงาน ChatGPT เหมาะกับผู้ที่ใช้อยู่แล้วและต้องการถามไฟล์แล้วทำงานต่อในบทสนทนาเดียว Gemini Notebook (ชื่อเดิม NotebookLM) เหมาะกับงานอ่านหลายแหล่งและย้อนดูหลักฐานแบบสมุดบันทึก Gemini เหมาะกับการนำข้อมูลไปทำงานต่อในระบบ Google ส่วน Claude น่าสนใจเมื่อต้องทำงานต่อแบบยืดหยุ่นและเอกสารมีภาพหรือกราฟที่โมเดลรองรับมองร่วมกับข้อความได้

อย่างไรก็ตาม คะแนนสามรอบยังไม่พิสูจน์ว่า OCR ของเครื่องมือใดดีที่สุด เพราะเป็นเอกสารเนื้อหาชุดเดียวและรันอย่างละหนึ่งครั้ง Gemini Notebook ยังได้คะแนน v3 สูงกว่า v2 ทั้งที่ภาพเสื่อมกว่า แสดงว่าความคลาดเคลื่อนอาจเกิดได้ทั้งตอน OCR, ค้นหลักฐาน และเรียบเรียงคำตอบ เครื่องมือทั้งสี่ยังอาจพลาดกับตารางข้ามหน้า ตัวเลขที่มีเชิงอรรถ เลขไทย ลายมือ และเอกสารที่เค้าโครงซับซ้อน

Insight Box — ความสามารถสองชั้น คำว่า “รองรับภาษาไทย” อาจหมายถึงพิมพ์คำตอบเป็นภาษาไทยได้ แต่ไม่ได้ยืนยันว่า OCR อ่านภาพสแกนภาษาไทยได้ครบ หรือเข้าใจตารางไทยที่ซับซ้อนได้ถูกต้อง ความแม่นจึงต้องทดสอบกับชนิดไฟล์และชนิดคำถามที่เราจะใช้จริง

ก่อนเลือกเครื่องมือ ต้องรู้ว่า PDF ของเราเป็นแบบไหน

PDF เป็นเพียงภาชนะ ภายในอาจมีข้อมูลต่างชนิดกันมาก

1. PDF ที่เลือกข้อความได้

ไฟล์ประเภทนี้มีตัวอักษรจริงอยู่ข้างใน มักเกิดจากการ Export จาก Word, Google Docs หรือโปรแกรมจัดหน้า AI ดึงข้อความไปค้นและสรุปได้ง่ายกว่าไฟล์สแกน แต่ยังอาจอ่านลำดับคอลัมน์ผิดเมื่อหน้ากระดาษมีหลายคอลัมน์

2. PDF สแกนเป็นภาพ

แม้เราเห็นตัวหนังสือชัด แต่คอมพิวเตอร์อาจเห็นเป็นเพียงรูปภาพ เครื่องมือต้องใช้ OCR แปลงภาพเป็นข้อความก่อน ความผิดพลาดจึงเกิดได้ตั้งแต่สระ วรรณยุกต์ เลขไทย ไปจนถึงข้อความบนพื้นหลังสีเข้ม

3. PDF แบบผสม

รายงานจำนวนมากมีเนื้อความเป็นตัวอักษร แต่ตาราง แผนภูมิ หรือตราประทับเป็นภาพ เครื่องมืออาจตอบส่วนข้อความได้ดีแต่พลาดข้อมูลสำคัญที่อยู่ในภาพ

4. PDF ที่โครงสร้างซับซ้อน

เอกสารราชการ งานวิจัย และรายงานประจำปีมักมีหลายคอลัมน์ เชิงอรรถ ตารางข้ามหน้า และหัวกระดาษซ้ำ หากระบบดึงข้อความผิดลำดับ คำตอบปลายทางก็ผิดได้ แม้โมเดลภาษาจะเขียนเก่งเพียงใด

AI อ่านเอกสารอย่างไร และพลาดตรงไหนได้บ้าง

กระบวนการโดยย่อมีสี่ช่วง

  1. อ่านไฟล์ — ดึงข้อความจาก PDF หรือใช้ OCR กับภาพ
  2. แบ่งเอกสาร — ตัดเนื้อหาเป็นส่วนย่อยเพื่อจัดการได้
  3. ค้นส่วนที่เกี่ยวข้อง — เมื่อเราถาม ระบบเลือกข้อความบางส่วนกลับมาเป็นบริบท
  4. เรียบเรียงคำตอบ — โมเดลภาษาสรุปคำตอบจากบริบทที่ค้นได้

ความผิดพลาดในช่วงต้นจะไหลต่อไปจนถึงคำตอบ หาก OCR อ่าน 1,250,000 เป็น 1,250.000 หรือระบบแยกหัวตารางออกจากตัวเลข โมเดลอาจเรียบเรียงอย่างมั่นใจจากข้อมูลที่ผิดตั้งแต่ต้น

ดังนั้น การมี Citation ช่วยให้ตรวจสอบเร็วขึ้น แต่ Citation ไม่ใช่ตราประทับว่าคำตอบถูก เราต้องเปิดดูว่าข้อความที่อ้างมารองรับข้อสรุปจริงหรือไม่

เปรียบเทียบจากสิ่งที่เอกสารทางการยืนยัน

ข้อมูลในตารางนี้ตรวจเมื่อ 31 กรกฎาคม 2026 และอาจเปลี่ยนได้ตามรุ่น แผนราคา ภูมิภาค และนโยบายของผู้ให้บริการ

เครื่องมือสิ่งที่ยืนยันได้จากเอกสารทางการจุดที่เหมาะใช้เป็นผู้สมัครข้อจำกัดที่ต้องระวัง
ChatGPTรองรับการอัปโหลด PDF และงานดึงข้อมูล สรุป เปรียบเทียบ หรือปรับรูปแบบเอกสาร; ไฟล์หนึ่งรายการจำกัดสูงสุด 512 MB และเอกสารข้อความจำกัด 2 ล้านโทเคนถามเอกสารแล้วนำคำตอบไปเขียน วิเคราะห์ หรือทำงานต่อในแชตทั่วไปรุ่นและระบบจัดเส้นทางอาจเปลี่ยนตามแผนและโหมด; เอกสารทางการไม่ได้รับรองความแม่น OCR ภาษาไทยโดยเฉพาะ
Gemini Notebook (ชื่อเดิม NotebookLM)รองรับ PDF, ตั้งภาษาผลลัพธ์เป็นไทยได้, คำตอบมี Citation เชื่อมกลับไปยังข้อความในแหล่งข้อมูลอ่านหลายเอกสารในหัวข้อเดียวกัน สรุปพร้อมย้อนดูหลักฐานการรองรับภาษาไทยไม่ได้รับประกัน OCR หรือตารางทุกชนิด; ไฟล์ที่ป้องกันการคัดลอกอาจนำเข้าไม่ได้
Geminiอัปโหลด PDF และไฟล์อื่นได้สูงสุด 10 ไฟล์ต่อคำสั่ง; ขีดจำกัดขึ้นกับแผน; บริบทขนาดใหญ่รองรับเอกสารจำนวนมากสนทนากับไฟล์แล้วนำผลไปทำงานต่อในระบบ GoogleGoogle เตือนว่าไฟล์ใหญ่ทำให้พลาดการเชื่อมโยงหรือรายละเอียดได้; การอัปโหลดต้องลงชื่อเข้าใช้
Claudeรองรับ PDF ขนาดไม่เกิน 30 MB ต่อไฟล์และสูงสุด 20 ไฟล์ต่อแชต; โมเดลที่รองรับวิเคราะห์ภาพใน PDF ต่ำกว่า 100 หน้าได้เอกสารที่มีกราฟ ภาพ หรือเลย์เอาต์ซึ่งต้องมองร่วมกับข้อความPDF ตั้งแต่ 100 หน้าขึ้นไปถูกประมวลผลเฉพาะข้อความ; เอกสารทางการที่ตรวจพบไม่ได้รับรองความแม่นภาษาไทยโดยเฉพาะ
Adobe Acrobat AI Assistantมีคำตอบพร้อม Citation และทำงานกับ PDF โดยตรงเอกสารในภาษาที่ Adobe ระบุว่ารองรับรายชื่อภาษาของไฟล์ที่รองรับ ณ วันที่ตรวจ ไม่มีภาษาไทย จึงไม่ใช่ผู้สมัครหลักสำหรับโจทย์นี้

ค่าใช้จ่ายที่ควรรู้ก่อนเริ่ม

  • ChatGPT: หน้าแผนราคามี Free, Go, Plus และ Pro โดยขีดจำกัดการอัปโหลดและการเข้าถึงโมเดลต่างกัน การทดสอบนี้ใช้บัญชี Pro เดิมและไม่มีค่าใช้จ่ายเพิ่ม หน้าเว็บแสดงโหมด Medium แต่ไม่แสดงชื่อโมเดล จึงไม่เติมชื่อรุ่นจากการคาดเดา
  • Gemini Notebook Standard (ชื่อเดิม NotebookLM Standard): สมัครด้วยบัญชี Gmail ได้โดยไม่เสียค่าใช้จ่าย ส่วน Plus, Pro และ Ultra เพิ่มขีดจำกัดและคุณสมบัติ
  • Gemini: บัญชีที่ลงชื่อเข้าใช้สามารถอัปโหลดไฟล์ได้ โดยบัญชีที่ไม่มี Google AI Pro หรือ Ultra มีขีดจำกัดต่ำกว่า ราคาของแผนชำระเงินขึ้นกับประเทศและข้อเสนอที่แสดงในบัญชี จึงควรตรวจอีกครั้งก่อนสมัคร
  • Claude: มีแผน Free ราคา 0 ดอลลาร์สหรัฐ ส่วน Pro ราคา 20 ดอลลาร์สหรัฐต่อเดือน หรือเฉลี่ย 17 ดอลลาร์สหรัฐต่อเดือนเมื่อชำระรายปี 200 ดอลลาร์สหรัฐ ราคายังไม่รวมภาษีและอาจเปลี่ยนได้

สำหรับการลองอ่าน PDF หนึ่งหรือสองไฟล์ ควรเริ่มจากแผนฟรีและประเมินข้อผิดพลาดก่อน การจ่ายเงินเพิ่มมักเพิ่มปริมาณการใช้งานหรือสิทธิ์เข้าถึง แต่ไม่ได้รับประกันว่าภาษาไทยในเอกสารของเราจะถูกอ่านแม่นขึ้น

ChatGPT: สะดวกสำหรับคนที่ใช้แชตอยู่แล้ว

ChatGPT รองรับการอัปโหลด PDF บนเว็บและทำงานได้ทั้งการดึงข้อเท็จจริง สรุป เปรียบเทียบ และแปลงเนื้อหาไปเป็นงานรูปแบบอื่น จุดเด่นเชิง Workflow คือผู้ใช้จำนวนมากเริ่มจากแชตทั่วไปอยู่แล้ว จึงถามไฟล์แล้วให้ช่วยเขียน ตรวจ หรือจัดโครงงานต่อได้โดยไม่ย้ายเครื่องมือ

ในการทดสอบครั้งนี้ ChatGPT Pro บนเว็บตอบถูก 16/16 ทั้ง Native-text, Scan/OCR และ Degraded-scan โดยไฟล์สองรอบหลังไม่มี text layer ผลนี้ยืนยันว่า สภาพแวดล้อมที่ทดสอบอ่านภาพเอกสารชุดนี้ได้ แต่ไม่ควรตีความต่อว่า ChatGPT ทุกแผนหรือทุกโมเดลอ่านภาพสแกนภาษาไทยได้เท่ากัน เพราะหน้าเว็บไม่แสดงชื่อโมเดลและระบบอาจเปลี่ยนการจัดเส้นทางภายใน

เรื่อง Privacy ที่ควรรู้

สำหรับบริการผู้ใช้ทั่วไป OpenAI ระบุว่าเนื้อหาอาจถูกใช้ปรับปรุงโมเดลหากผู้ใช้อนุญาต ผู้ใช้ปิด Improve the model for everyone ใน Data Controls ได้ และแชตใหม่หลังปิดจะไม่ถูกใช้ฝึกโมเดล ส่วน Temporary Chat ไม่ปรากฏในประวัติ ไม่สร้าง Memory ไม่ถูกใช้ฝึกโมเดล และถูกลบจากระบบภายใน 30 วัน แม้อาจถูกตรวจเพื่อเฝ้าระวังการใช้งานที่ไม่เหมาะสม ดังนั้นควรตรวจ Data Controls และนโยบายองค์กรก่อนอัปโหลดเอกสารจริง

Gemini Notebook (ชื่อเดิม NotebookLM): จุดเด่นคือพากลับไปหาหลักฐาน

Gemini Notebook ถูกออกแบบให้ทำงานกับชุดแหล่งข้อมูลที่ผู้ใช้เลือก เมื่อถามคำถาม ระบบใช้แหล่งที่เลือกและแสดง Citation ซึ่งกดกลับไปดูข้อความในบริบทได้ คุณสมบัตินี้เหมาะกับงานอ่านรายงาน งานวิจัย เอกสารประชุม หรือคู่มือหลายฉบับ เพราะช่วยลดเวลาตามหาว่าคำตอบมาจากหน้าไหน Google เปลี่ยนชื่อผลิตภัณฑ์จาก NotebookLM เป็น Gemini Notebook ในช่วงที่ทดสอบ บทความจึงใช้ชื่อใหม่และวงเล็บชื่อเดิมไว้เพื่อให้ผู้อ่านตามเอกสารช่วยเหลือเดิมได้

Google ระบุว่า NotebookLM รองรับภาษาผลลัพธ์มากกว่า 80 ภาษา รวมภาษาไทย และบัญชี Gmail สมัครใช้ NotebookLM Standard ได้โดยไม่เสียค่าใช้จ่าย ขีดจำกัด Standard ณ วันที่ตรวจคือ 100 สมุดบันทึกต่อผู้ใช้ 50 แหล่งต่อสมุดบันทึก 50 คำถามแชตต่อวัน และไฟล์ต้นทางแต่ละรายการไม่เกิน 500,000 คำหรือ 200 MB

แต่จุดแข็งเรื่อง Citation ไม่ได้แก้ทุกปัญหา หากเอกสารต้นทางอ่านผิดหรือคำถามกว้างเกินไป ระบบอาจดึงข้อความที่ใกล้เคียงแต่ไม่ใช่คำตอบ เราจึงควรถามแบบระบุขอบเขต เช่น

“จากตารางงบประมาณปี 2568 เท่านั้น งบรวมหลังปรับปรุงเป็นเท่าไร โปรดอ้างข้อความหรือตารางที่ใช้ และบอกหากข้อมูลไม่เพียงพอ”

เรื่อง Privacy ที่ควรรู้

สำหรับบัญชีผู้ใช้ทั่วไป Google ระบุว่าเนื้อหาใน NotebookLM ไม่ถูกใช้ฝึกโมเดลพื้นฐานโดยตรง เว้นแต่ผู้ใช้ส่ง Feedback ซึ่งข้อมูลที่เกี่ยวข้องกับ Feedback อาจถูกตรวจโดยมนุษย์ ส่วนบัญชี Google Workspace หรือ Workspace for Education ที่เข้าเกณฑ์ระบุว่าไฟล์อัปโหลด คำถาม และคำตอบจะไม่ถูกมนุษย์ตรวจแม้ส่ง Feedback และไม่ถูกใช้ฝึกโมเดล

ถึงอย่างนั้น ไม่ควรอัปโหลดสัญญาลับ ข้อมูลลูกค้า เวชระเบียน หรือข้อมูลส่วนบุคคล เพียงเพราะเครื่องมือมีนโยบายคุ้มครองข้อมูล การอนุญาตภายในองค์กรและระดับความลับของเอกสารยังสำคัญกว่าเสมอ

Gemini: ยืดหยุ่นกว่า แต่ต้องจัดการ Activity ให้เป็น

Gemini รองรับการอัปโหลด PDF และไฟล์ชนิดอื่นเข้าสู่บทสนทนา โดยหน้าช่วยเหลือระบุว่าเพิ่มได้สูงสุด 10 ไฟล์ต่อคำสั่ง ขีดจำกัดจริงขึ้นกับชนิดไฟล์และแผนที่ใช้ Google ยังเตือนตรงไปตรงมาว่า เมื่อไฟล์มีขนาดใหญ่มาก Gemini อาจพลาดการเชื่อมโยงหรือรายละเอียดบางส่วน

จุดแข็งของ Gemini คือความยืดหยุ่น หลังอ่านไฟล์แล้วเราสามารถให้ช่วยทำตาราง เปลี่ยนรูปแบบคำตอบ หรือสร้างไฟล์สำหรับทำงานต่อได้ จึงเหมาะกับผู้ที่ไม่ได้ต้องการเพียงค้นข้อมูล แต่ต้องการนำผลไปทำเป็นเอกสารหรือชีตในขั้นถัดไป

เรื่อง Privacy ที่ควรรู้

Google ระบุว่าไฟล์ที่อัปโหลดเป็นหนึ่งในข้อมูลที่ Gemini Apps เก็บและประมวลผล หากเปิด Keep Activity ไว้ ข้อมูลการสนทนาและไฟล์อัปโหลดอาจถูกใช้ปรับปรุงบริการด้วยความช่วยเหลือจากผู้ตรวจสอบที่ได้รับการฝึก ผู้ใช้ปิด Keep Activity หรือใช้ Temporary Chat ได้ โดยแชตลักษณะนี้ไม่ถูกใช้ฝึกโมเดล AI แต่ยังถูกเก็บชั่วคราว 72 ชั่วโมงเพื่อให้บริการและป้องกันความเสี่ยง

สำหรับเอกสารอ่อนไหว อย่าเริ่มจากการกดอัปโหลด ให้ตรวจบัญชีที่ใช้ นโยบายองค์กร และการตั้งค่า Activity ก่อน

Claude: น่าสนใจเมื่อภาพและกราฟมีความหมาย

Claude รองรับ PDF และเอกสารหลายชนิด โดยการอัปโหลดในแชตรองรับไฟล์ไม่เกิน 30 MB ต่อไฟล์และสูงสุด 20 ไฟล์ต่อแชต เอกสารของ Anthropic ระบุว่า Claude 4, Claude 3.7 Sonnet และ Claude 3.5 Sonnet วิเคราะห์ทั้งข้อความและองค์ประกอบภาพ เช่น กราฟหรือรูปภาพ ใน PDF ที่มีน้อยกว่า 100 หน้าได้

หาก PDF มีตั้งแต่ 100 หน้าขึ้นไป หรือใช้โมเดลที่ไม่รองรับ ระบบจะประมวลผลเฉพาะข้อความ นี่เป็นข้อจำกัดสำคัญสำหรับรายงานที่ตัวเลขหลักอยู่ในกราฟและตารางภาพ

เอกสารทางการที่ตรวจพบไม่ได้ระบุการรับรองความแม่นภาษาไทยโดยเฉพาะ จึงควรมอง Claude เป็นผู้สมัครสำหรับการทดสอบ ไม่ใช่ข้อสรุปว่าเหมาะที่สุดกับภาษาไทย

เรื่อง Privacy ที่ควรรู้

Anthropic ระบุว่าสำหรับบัญชีผู้ใช้ทั่วไป เช่น Free, Pro และ Max จะใช้แชตเพื่อปรับปรุงโมเดลเมื่อผู้ใช้อนุญาต หรือในกรณีตรวจสอบความปลอดภัยและการสมัครเข้าร่วมโดยชัดแจ้ง ผู้ใช้ปรับการตั้งค่าได้ และเมื่อกดส่ง Feedback เนื้อหาการสนทนาที่เกี่ยวข้องอาจถูกเก็บตามเงื่อนไขที่ระบุไว้ Anthropic เองแนะนำให้ระวังการส่งเอกสารธุรกิจหรือข้อมูลส่วนบุคคลที่เป็นความลับ

ทำไม Acrobat AI ยังไม่ใช่คำตอบแรกสำหรับภาษาไทย

Adobe Acrobat AI Assistant มีข้อได้เปรียบคืออยู่ในเครื่องมือ PDF โดยตรงและแสดง Citation ได้ แต่หน้า Technical Requirements ของ Adobe ซึ่งอัปเดตเมื่อ 24 มิถุนายน 2026 แสดงรายชื่อภาษาของไฟล์ที่รองรับโดยไม่มีภาษาไทย

นี่ไม่ได้แปลว่าไฟล์ไทยจะล้มเหลวทุกครั้ง แต่หมายความว่าเราไม่มีฐานจากผู้ให้บริการให้คาดหวังการรองรับอย่างเป็นทางการ จึงไม่ควรวางเป็นตัวเลือกแรกของบทความสำหรับผู้อ่านไทย

ผลทดสอบจริง: Native-text PDF ภาษาไทย 5 หน้า

เราใช้เอกสารสังเคราะห์เรื่อง “โครงการอรุณ” ซึ่งมีตัวอักษรไทยจริง 5 หน้า ไม่มีข้อมูลส่วนบุคคล ภายในมีวันที่ ชื่อบุคคล ตารางงบประมาณ ประโยคปฏิเสธ ผลทดลองที่ต่ำกว่าเป้าหมาย ข้อมูลที่เอกสารตั้งใจไม่รายงาน และตัวเลข 6.4 ล้านบาทที่เป็นเพดานทั้งฝ่าย ไม่ใช่งบของโครงการ

เครื่องมือทุกตัวได้รับไฟล์เดียวกันและ Prompt เดียวกัน ให้ตอบ Q1–Q8 จากเอกสารเท่านั้น ระบุหน้า ห้ามคาดเดา และตอบว่า “ไม่พบข้อมูลในเอกสาร” เมื่อไม่มีหลักฐาน แต่ละข้อให้ 0–2 คะแนน เต็ม 16 คะแนน

สิ่งที่วัดChatGPT Pro เว็บGemini NotebookGemini ProClaude Opus 4.8 High
วันที่และชื่อบุคคล4/44/44/44/4
ตาราง ตัวเลข และการคำนวณ4/44/44/44/4
คำปฏิเสธและการเชื่อมข้อมูลข้ามหน้า4/44/44/44/4
ปฏิเสธเมื่อไม่มีข้อมูล ต้านตัวเลขลวง และตอบครบ4/44/44/44/4
รวม16/1616/1616/1616/16

ChatGPT ตรวจพบว่าตอบเสร็จภายในประมาณ 36.4 วินาที, Gemini ประมาณ 34.7 วินาที และ Claude ประมาณ 37.4 วินาที ส่วน Gemini Notebook ไม่ได้จับเวลาอย่างเป็นระบบ จึงไม่ควรนำเวลามาเรียงอันดับ ทั้งสี่ตัวตอบว่างานทดลองลดเวลาได้ร้อยละ 28 ซึ่งต่ำกว่าเป้าร้อยละ 30 อยู่ 2 จุดร้อยละ ตอบว่าเอกสารไม่มีค่า ROI และแยกงบโครงการ 4.875 ล้านบาทออกจากเพดานทั้งฝ่าย 6.4 ล้านบาทได้ถูกต้อง

ผลรอบนี้มีคุณค่าเพราะแสดงว่าเครื่องมือทั้งสี่รับมือ PDF ที่มีตัวอักษรไทยจริงได้ดีในโจทย์พื้นฐานถึงระดับเชื่อมข้อมูล แต่ยังเป็นเพียง Native-text Success Case หนึ่งชุด และยังไม่ใช่หลักฐานเรื่อง OCR จึงต้องอ่านคู่กับรอบ Scan/OCR ด้านล่าง

รายละเอียดไฟล์ เฉลย และผลสามเครื่องมือเดิมบันทึกไว้ใน research/thai-pdf-benchmark-results-2026-07-31.md ส่วนผล ChatGPT ทั้งสามรอบอยู่ใน research/thai-pdf-benchmark-results-chatgpt-web-2026-07-31.md

ผลทดสอบจริง: Scan/OCR PDF ภาษาไทยแบบภาพล้วน 5 หน้า

รอบที่สองใช้เนื้อหาและลำดับหน้าเดิม แต่แปลงทุกหน้าเป็นภาพ grayscale 160 dpi หมุนเล็กน้อยและบีบอัดแบบ JPEG จากนั้นรวมเป็น PDF ใหม่ที่ ไม่มี text layer เครื่องมือจึงต้องอ่านข้อความจากภาพก่อนตอบคำถาม

สิ่งที่วัดChatGPT Pro เว็บGemini NotebookGemini ProClaude Opus 4.8 High
วันที่และชื่อบุคคล4/44/44/44/4
ตาราง ตัวเลข และการคำนวณ4/44/44/44/4
คำปฏิเสธและการเชื่อมข้อมูลข้ามหน้า4/44/44/44/4
ปฏิเสธเมื่อไม่มีข้อมูล ต้านตัวเลขลวง และตอบครบ4/43/43/44/4
รวม16/1615/1615/1616/16

ChatGPT ตอบครบ 16/16 และตรวจพบคำตอบสมบูรณ์ในประมาณ 38.1 วินาที Gemini Notebook ให้ Citation กลับไปยังแหล่งข้อมูลทุกข้อ Gemini Pro ตอบเสร็จที่ตรวจพบในประมาณ 47.7 วินาที และ Claude Opus 4.8 High ในประมาณ 41.3 วินาที ส่วนเวลาของ Gemini Notebook ตรวจพบเร็วมากแต่เป็นการจับสถานะหน้าเว็บเพียงครั้งเดียว จึงไม่ใช้เรียงอันดับความเร็ว ทั้งสี่ไม่แต่งค่า ROI และไม่หลงคิดว่า 6.4 ล้านบาทคืองบโครงการ แต่ Gemini Notebook กับ Gemini ไม่บอกงบโครงการจริงใน Q8 จึงเสียตัวละหนึ่งคะแนน

ผลรอบนี้บอกว่า ChatGPT และ Claude ได้คะแนนเต็มชุด Scan/OCR v2 แต่ยังไม่บอกว่า OCR ของทั้งสองแม่นกว่าโดยรวม เพราะความผิดพลาดหนึ่งคะแนนของอีกสองเครื่องมือไม่ได้ชี้ชัดว่าเกิดตอนอ่านภาพ ค้นหลักฐาน หรือเรียบเรียงคำตอบ ข้อจำกัดนี้จึงนำไปสู่รอบ v3 ด้านล่าง ซึ่งลดคุณภาพภาพโดยคงเนื้อหา เฉลย และเกณฑ์เดิมไว้

รายละเอียดการสร้างไฟล์ SHA-256 สภาพแวดล้อม รุ่นที่หน้าเว็บแสดง เวลา คำตอบ และคะแนนรายข้อบันทึกไว้ใน research/thai-pdf-benchmark-results-scan-v2-2026-07-31.md

ผลทดสอบจริง: Degraded-scan/Table Stress PDF ภาษาไทย 5 หน้า

รอบที่สามใช้เนื้อหา ตาราง และเฉลยเดิม แต่ทำภาพให้ใกล้ไฟล์สแกนที่ใช้งานยากขึ้น: ลดความละเอียดต้นทางเหลือประมาณ 115 dpi ลด contrast เพิ่ม blur และ noise หมุนหน้าได้ถึงประมาณ 0.85 องศา บีบอัด JPEG quality 42 และใส่รอยพับ/เงาทับบริเวณตาราง หน้า PDF ทั้งหมดเป็นภาพและไม่มี text layer เช่นเดิม

สิ่งที่วัดChatGPT Pro เว็บGemini NotebookGemini ProClaude Opus 4.8 High
วันที่และชื่อบุคคล4/44/42/44/4
ตาราง ตัวเลข และการคำนวณ4/44/44/44/4
คำปฏิเสธและการเชื่อมข้อมูลข้ามหน้า4/44/44/44/4
ปฏิเสธเมื่อไม่มีข้อมูล ต้านตัวเลขลวง และตอบครบ4/44/43/44/4
รวม16/1616/1613/1616/16

Failure Case ที่ชัดที่สุดอยู่ที่ Gemini Pro ซึ่งอ่านชื่อผู้อนุมัติ “ดร.ลลิตา ศิริพงศ์” ผิดเป็นชื่ออื่น แม้ตำแหน่งและหน้าที่อ้างจะถูกต้อง จึงไม่ได้คะแนน Q5 ส่วน Q8 ปฏิเสธตัวเลข 6.4 ล้านบาทได้ แต่ยังไม่ระบุว่างบโครงการหลังปรับปรุงคือ 4.875 ล้านบาท จึงได้ 1/2 คะแนน ขณะที่ ChatGPT, Gemini Notebook และ Claude ตอบครบทั้งแปดข้อ

เวลาที่ตรวจพบคำตอบสมบูรณ์คือ ChatGPT ประมาณ 38.3 วินาที, Gemini Notebook ประมาณ 21.9 วินาที, Gemini Pro ประมาณ 128.6 วินาที และ Claude ประมาณ 46.6 วินาที แต่ Gemini มีช่วงตรวจหน้าเว็บที่ผลยาวเกินขีดจำกัด จึงถือ 128.6 วินาทีเป็นเวลาที่ ยืนยันคำตอบได้ ไม่ใช่เวลาสร้างคำตอบที่แม่นถึงระดับวินาที และไม่ใช้เวลารอบเดียวจัดอันดับความเร็ว

สิ่งที่ควรจำคือ Citation ช่วยพาเราไปตรวจหลักฐาน แต่ไม่ได้รับรองว่า OCR อ่านชื่อในหลักฐานถูก ChatGPT ได้ 16/16 ทั้งสามรอบ ขณะที่ Gemini Notebook กลับได้ 16/16 ใน v3 หลังได้ 15/16 ใน v2 จึงไม่ควรอ่านคะแนนสามรอบเป็นเส้นแนวโน้มตรง ๆ หรือใช้คะแนนเต็มของ ChatGPT สรุปว่าจะทำซ้ำได้กับเอกสารทุกชนิด ผลนี้เป็นหลักฐานว่าคุณภาพภาพสามารถเปิดเผย Failure Case ใหม่ได้ แต่ยังไม่ใช่อันดับ OCR ภาษาไทยโดยรวม

รายละเอียดโปรไฟล์ภาพ SHA-256 เกณฑ์ Q8 และผลสามเครื่องมือเดิมบันทึกไว้ใน research/thai-pdf-benchmark-results-degraded-v3-2026-07-31.md ส่วนคำตอบและคะแนน ChatGPT ทั้งสามรอบอยู่ใน research/thai-pdf-benchmark-results-chatgpt-web-2026-07-31.md

วิธีทดสอบว่า AI อ่าน PDF ภาษาไทยของเราได้จริงหรือไม่

อย่าทดสอบด้วยคำสั่ง “สรุปเอกสารนี้” เพียงข้อเดียว เพราะคำตอบกว้างทำให้ตรวจความถูกต้องยาก ให้ใช้ PDF ที่ไม่มีข้อมูลลับ แล้วถามคำถามอย่างน้อยแปดชนิดต่อไปนี้

สิ่งที่ทดสอบตัวอย่างคำถามสิ่งที่ต้องตรวจ
ข้อเท็จจริงตรงตัวโครงการเริ่มวันที่เท่าไรวันที่ตรงกับต้นฉบับและปี พ.ศ. ไม่สลับ
ตัวเลขในตารางงบปี 2568 รวมเท่าไรแถว คอลัมน์ หน่วย และเชิงอรรถถูกต้อง
คำปฏิเสธเงื่อนไขใด “ไม่” อยู่ในขอบเขตไม่ทำคำว่า “ไม่” ตกหล่น
การเชื่อมข้ามหน้าเป้าหมายในบทนำสอดคล้องกับผลในบทสรุปหรือไม่อ้างหลักฐานจากทั้งสองตำแหน่ง
ชื่อเฉพาะใครเป็นผู้อนุมัติโครงการสะกดชื่อและตำแหน่งถูกต้อง
ข้อมูลจากภาพกราฟแสดงแนวโน้มอย่างไรอ่านแกน หน่วย สี และคำอธิบายถูก
คำถามที่ไม่มีคำตอบเอกสารระบุ ROI เท่าไรควรตอบว่าไม่พบ ไม่แต่งตัวเลขขึ้นมา
Citationหลักฐานอยู่หน้าใดCitation เปิดแล้วรองรับคำตอบจริง

ให้คะแนนแต่ละข้อ 0–2 คะแนน

  • 2 คะแนน: ถูกต้องครบและ Citation ตรง
  • 1 คะแนน: ใจความถูกแต่ขาดรายละเอียดหรือ Citation ไม่ชัด
  • 0 คะแนน: ผิด แต่งข้อมูล หรืออ้างหลักฐานคนละเรื่อง

คะแนนรวมช่วยเปรียบเทียบเครื่องมือในงานของเราเอง แต่ไม่ควรเรียกว่า “ความแม่นโดยรวม” เพราะชุดเอกสารแต่ละประเภทมีความยากต่างกัน

วิธีเริ่มใช้อย่างปลอดภัยใน 10 นาที

  1. เลือก PDF ที่เผยแพร่สาธารณะหรือสร้างขึ้นเอง และไม่มีข้อมูลส่วนบุคคล
  2. ลองเลือกข้อความในไฟล์ หากเลือกไม่ได้ ให้ถือว่าเป็นไฟล์สแกนและเพิ่มการทดสอบ OCR
  3. อัปโหลดเข้าเครื่องมือเพียงหนึ่งไฟล์ก่อน เพื่อลดความสับสนระหว่างแหล่งข้อมูล
  4. ถามคำถามตรงตัวหนึ่งข้อ ตามด้วยคำถามจากตารางและคำถามที่ไม่มีคำตอบ
  5. บังคับให้ระบบแสดง Citation หรือระบุตำแหน่งหลักฐานทุกครั้ง
  6. เปิดต้นฉบับเทียบตัวเลข ชื่อเฉพาะ และคำปฏิเสธอย่างน้อยสามจุด
  7. จดสิ่งที่ผิด ไม่แก้ Prompt ไปเรื่อย ๆ จนลืมว่ารอบแรกพลาดตรงไหน
  8. ตรวจ Privacy, Activity และสิทธิ์การใช้เอกสารก่อนนำไฟล์งานจริงเข้าไป

เลือกตัวไหนดี

ลอง ChatGPT หาก…

  • ใช้ ChatGPT อยู่แล้วและต้องการถามไฟล์ก่อนนำคำตอบไปเขียน วิเคราะห์ หรือจัดโครงงานต่อ
  • ต้องการอัปโหลด PDF แล้วระบุหน้าหลักฐานในบทสนทนาทั่วไป
  • พร้อมตรวจ Data Controls และไม่ตีความคะแนนเต็มจากเอกสารชุดเดียวว่าแม่นกับทุกไฟล์

เริ่มที่ Gemini Notebook หาก…

  • งานหลักคืออ่านแหล่งข้อมูลหลายชิ้นและย้อนดูหลักฐาน
  • ต้องการคำตอบภาษาไทยและ Citation ที่กดกลับไปยังต้นฉบับได้
  • ต้องการเริ่มจากแผนฟรีก่อนประเมินความคุ้มค่า

ลอง Gemini หาก…

  • ต้องการคุยกับไฟล์แล้วนำผลไปสร้างเอกสาร ตาราง หรือ Workflow ต่อ
  • ใช้บริการ Google อยู่แล้วและเข้าใจการตั้งค่า Keep Activity
  • ยอมรับได้ว่าต้องตรวจรายละเอียดมากขึ้นเมื่อไฟล์ยาวหรือซับซ้อน

ลอง Claude หาก…

  • PDF ต่ำกว่า 100 หน้าและมีภาพ กราฟ หรือเลย์เอาต์ที่มีความหมาย
  • ต้องการเปรียบเทียบการตีความองค์ประกอบภาพกับเครื่องมืออื่น
  • พร้อมทดสอบภาษาไทยด้วยชุดคำถามของตนเอง เพราะยังไม่มีคำรับรองเฉพาะจากเอกสารทางการที่ตรวจพบ

ยังไม่ควรอัปโหลดไฟล์เข้าเครื่องมือใดเลย หาก…

  • เอกสารมีข้อมูลลูกค้า ความลับทางการค้า ข้อมูลสุขภาพ หรือข้อมูลระบุตัวบุคคล
  • องค์กรยังไม่มีนโยบายอนุญาตการใช้ AI ภายนอก
  • ผลลัพธ์จะถูกใช้ตัดสินใจด้านกฎหมาย การเงิน การแพทย์ หรือความปลอดภัยโดยไม่มีผู้เชี่ยวชาญตรวจ

Checklist ก่อนเชื่อคำตอบจาก AI

  • รู้ว่า PDF เป็นข้อความ สแกน แบบผสม หรือมีโครงสร้างซับซ้อน
  • ตรวจว่าเครื่องมือและแผนที่ใช้รองรับไฟล์ ขนาด และภาษาที่ต้องการ
  • อ่านนโยบาย Privacy และตรวจการตั้งค่า Activity ก่อนอัปโหลด
  • ใช้เอกสารที่มีสิทธิ์และไม่มีข้อมูลลับในการทดสอบรอบแรก
  • ถามทั้งข้อเท็จจริง ตาราง คำปฏิเสธ และคำถามที่ไม่มีคำตอบ
  • ขอ Citation ทุกคำตอบที่นำไปใช้งาน
  • เปิดต้นฉบับตรวจตัวเลข ชื่อ วันที่ และหน่วย
  • บันทึก Failure Case ไม่ดูเฉพาะรอบที่สำเร็จ
  • ให้มนุษย์รับผิดชอบคำตัดสินขั้นสุดท้าย

บทสรุป

AI ช่วยลดเวลาหาข้อมูลใน PDF ภาษาไทยได้ แต่ความน่าเชื่อถือไม่ได้มาจากความลื่นไหลของคำตอบ มาจากการที่เราย้อนกลับไปตรวจหลักฐานได้ และรู้ว่าเครื่องมือพลาดตรงไหน

ผล Native-text v1 เสมอกันที่ 16/16 รอบ Scan/OCR v2 คือ ChatGPT 16/16, Gemini Notebook 15/16, Gemini 15/16 และ Claude 16/16 ส่วน Degraded-scan/Table Stress v3 คือ ChatGPT 16/16, Gemini Notebook 16/16, Gemini 13/16 และ Claude 16/16 คะแนนที่ลดลงของ Gemini มาจากการอ่านชื่อบุคคลผิดและตอบตัวเลขเปรียบเทียบไม่ครบ จึงเป็นตัวอย่างว่าคำตอบที่มี Citation ก็ยังต้องเปิดต้นฉบับตรวจชื่อและตัวเลข

การเลือกเครื่องมือยังต้องดู Workflow การย้อนดูหลักฐาน การจัดชุดเอกสาร Privacy ราคา และชนิดไฟล์จริง มากกว่าคะแนนจากเอกสารหนึ่งชุด ขั้นต่อไปที่มีคุณค่าคือทดสอบเอกสารสังเคราะห์แบบผสมที่มีหลายคอลัมน์ เลขไทย เชิงอรรถ ตารางข้ามหน้า และกราฟ พร้อมรันซ้ำ เพื่อแยกความผิดพลาดของ OCR ออกจากการค้นและเรียบเรียงคำตอบ

แหล่งข้อมูล

แหล่งข้อมูลทั้งหมดตรวจเมื่อ 31 กรกฎาคม 2026

ChatGPT

Gemini Notebook / NotebookLM

Gemini

Claude

Adobe Acrobat AI Assistant