PDF is a presentation format, not a data format ถ้าคุณ control แหล่งที่มาของเอกสารได้ ให้ผลักดันให้ใช้ Markdown แทน คุณจะตัดปัญหาไปได้เกินครึ่ง
Multi-path extraction with cross-validation คือแพทเทิร์นที่จำเป็นถ้าคุณต้อง support PDF จริงๆ อย่าหวังพึ่ง path เดียว เพราะมันจะพังกับ edge case แน่นอน
สำหรับภาษาที่ซับซ้อนอย่างภาษาไทย spell-check model คือ must-have ไม่ใช่ nice-to-have OCR และ vision model hallucinate หนักมากกับฟอนต์เฉพาะทางและข้อความบนภาพ
Mermaid diagram ใน Markdown คืออาวุธลับ AI parse ได้ทันที ไม่ต้องเสียเวลา OCR แผนภาพจาก PDF แล้วมานั่งตีความใหม่
ทำไมถึงสำคัญกับสถาปัตยกรรมของ NEXT4I
ที่ NEXT4I เราสร้างระบบให้ผู้ใช้งานทั่วไปและองค์กร สามารถคุยกับข้อมูลของตัวเองด้วย AI ทุกอย่างถูกออกแบบโดยยึดหลัก AI Integration by Design ครับ คือออกแบบโดยคิดถึง AI เป็น first-class citizen ตั้งแต่แรก ไม่ใช่แค่ของที่ทำมาเพิ่มทีหลัง
Markdown ไม่ใช่แค่ "อีกหนึ่ง format ที่ support" มันคือ backbone ของ content architecture เราครับ เพราะเราเรียนรู้มาแล้วว่า: format ที่คุณเลือกวันนี้ กำหนด ceiling ของสิ่งที่ AI จะทำได้ในวันพรุ่งนี้
ยิ่งภาษาไทย หรือภาษาที่ลักษณะอักษรพยัญชนะซับซ้อนกว่านี้ไม่ต้องพูดถึง ไหนจะแยกแยะตัวอักษรออกจากพื้นหลัง กลับหน้ากระดาษไปมา บางทีไม่แน่ใจว่าตัวอักษรนั้นแล้วตัวหนาหรือตัวธรรมดา ยังต้องเดาอีกว่าตรงนี้คือหัวข้อหรือเปล่า? นี่คือสิ่งที่เราเจอตอนอ่าน PDF และก็เป็นสิ่งที่ AI เจอเหมือนกันเวลาสรุป PDF ของเราครับ
อย่างแรก ผมใช้เครื่องมืออ่าน PDF ซึ่งมีปัญหาอย่างหนักกับภาษาไทย ข้อความภาษาไทยบนพื้นหลังสีสันสดใส มีลายน้ำ มีรูปประกอบ ข้อความที่สกัดออกมาได้กระจัดกระจาย วรรคตอนหาย สระลอย เครื่องหมายวรรณยุกต์อยู่ผิดตำแหน่งไปหมด ต้องลองและเปลี่ยนอยู่หลายตัว ใช้ AI model เฉพาะก็แล้ว
ยังไม่พอครับ ผมต้องใช้เครื่องมืออีกตัว Render หน้า PDF เหล่านั้นออกมาเป็นรูปภาพ แล้วจับมันแปลงเป็นภาพขาวดำเพื่อให้ตัวอักษรชัดขึ้น เพราะบางทีสีพื้นหลังมันกลบข้อความจนอ่านแทบไม่ออก แล้วก็ใช้ AI Model สรุปเนื้อหาจากภาพพวกนั้น ทั้งภาพสีต้นฉบับ และภาพขาวดำที่แปลงแล้ว
ผมเลยต้องใช้ AI Model อีกตัวมาช่วยตรวจคำผิด วนไปวนมาจนกว่าจะได้เนื้อหาที่ถูกต้อง ...ซึ่ง ผมก็ยอมรับตามตรงครับว่า ก็ไม่ได้ถูกต้องครบถ้วน และต้องใช้คนมาแก้ให้สมบูรณ์