ทำไมไฟล์ Markdown (.md) ถึงคือที่สุดในยุค AI บทเรียนจากสงคราม PDF ของผม
AI-Native by Design ไฟล์ Text ธรรมดาๆ แค่ไฟล์เดียว แต่ AI เข้าใจทันที และสร้างเอกสารได้ไม่จำกัดรูปแบบ นี่คือเรื่องจริงที่ผมเจอมากับตัวตอนสร้าง NEXT4I
TLDR; ตอนสร้างระบบคุยกับเอกสารด้วย AI ของ NEXT4I ผมพบว่า PDF ที่ออกแบบมาสวยแค่ไหน ก็คือนรกสำหรับ AI ครับ แต่ Markdown คือภาษากลางที่ AI เข้าใจทันที การเปลี่ยนมาใช้ .md เป็นเอกสารหลักทำให้ทุกอย่างเปลี่ยนไป
จุดเริ่มต้น: ระบบที่ใช้ AI ในการค้นหาคำตอบ จากเอกสารของคุณ
ผมกำลังทดลองสร้าง RAG Pipeline ที่ทำงานบนเอกสารที่ซับซ้อน เพื่อเป็นตัวตั้งต้นของระบบ ในการใช้ AI ในการค้นหาคำตอบ จากเอกสาร สำหรับ user หรือแม้แต่ในองค์กร กับข้อมูลของตัวเองผ่าน AI แบบส่วนตัว หลักการคือ AI จะอ่านเอกสารของคุณก่อน แล้วค่อยตอบคำถามจากข้อมูลที่เพิ่งอ่านไป แทนที่จะเดาจากข้อมูลที่มันเคยถูกเทรน (train) มา
พูดง่ายๆ คือ คุณถาม AI เกี่ยวกับยอดขายของบริษัทคุณ หรือสถานที่ท่องเที่ยวที่คุณชอบ แล้วมันตอบได้จากเอกสารของคุณ โดยที่ข้อมูลไม่รั่วไหลออกไปข้างนอก นี่คือหัวใจของระบบที่ใช้ AI ในการค้นหาคำตอบ จากเอกสารของคุณ แทบทุกเจ้าในตลาดตอนนี้ครับ
เอกสารทดสอบของผมเป็น PDF แนะนำการท่องเที่ยวในประเทศไทย ออกแบบมาสวยมาก ฟอนต์ไทยสวย ทั้งฟอนต์และภาพ การใช้สี layout สวยงาม
คนเปิดดูต้องชมว่าสวยครับ
แต่สำหรับ Pipeline บน n8n ของผม? นรกชัดๆ
ปัญหา: PDF เกิดมาเพื่อตาคน ไม่ใช่ AI
PDF ถูกออกแบบมาเพื่อสิ่งเดียว: ให้หน้าตาเอกสารเหมือนกันเป๊ะบนทุกหน้าจอและทุกเครื่องพิมพ์ มันคือเลย์เอาต์ที่เนี้ยบสำหรับสายตามนุษย์ ไม่ใช่ structured data สำหรับ AI
นี่คือสิ่งที่เกิดขึ้นตอนผม feed PDF ท่องเที่ยวไทยเข้าไป: