•
19 ก.ย. เวลา 03:00 • วิทยาศาสตร์ & เทคโนโลยี

ก่อนถามว่าใช้ AI Model อะไร ลองถามก่อนว่าเราจัดการข้อมูล หรือจัดการเอกสารดีพอหรือยัง

เวลาพูดถึงการนำ AI มาใช้ในองค์กร บทสนทนามักเริ่มที่ชื่อ Model ครับ
Model ไหนฉลาดกว่า? Context window ใหญ่แค่ไหน? ควรใช้ Cloud หรือรันแบบ local?
คำถามเหล่านี้สำคัญ แต่จากสิ่งที่ผมเจอ มันยังมีอีกคำถามที่มากวนใจอยู่เสมอ
ต่อให้ Model เก่งมาก เราจะพามันไปเจอข้อมูลที่ถูกต้องก่อนตอบได้อย่างไร?
ผมเคยถาม AI เรื่อง RTX 50 Series ตอนกำลังเลือก GPU สำหรับทำ AI Studio Worker แบบ local ด้วยงบที่จำกัด ตอนนั้นข้อมูลที่ได้ไม่น่าเชื่อถือพอสำหรับใช้ตัดสินใจ ผมเสียเวลาเถียงกับ AI แล้วสุดท้ายก็กลับไป Search เอง
เรื่องนี้ไม่ได้แปลว่า AI ไม่มีประโยชน์นะครับ มันเพียงสะท้อนว่า Model ไม่ได้รู้ทุกเหตุการณ์ทันที และไม่ได้รู้ข้อมูลเฉพาะของเราโดยอัตโนมัติ
ถ้าเปลี่ยนคำถามจากเรื่อง GPU เป็นนโยบายบริษัท รายงานยอดขาย หรือคู่มือภายใน ปัญหาก็ยิ่งชัดขึ้น เพราะต่อให้ AI ฉลาดเป็นกรด มันก็อ่านเอกสารที่เราไม่เคยส่งให้ไม่ได้
RAG คือการพา AI ไปที่ชั้นหนังสือก่อนตอบ
RAG หรือ Retrieval-Augmented Generation มี Flow พื้นฐานสามขั้นตอน
- ค้นข้อมูลที่เกี่ยวข้องกับคำถาม
- นำข้อมูลนั้นไปประกอบเป็น Context
- ให้ LLM อ่านแล้วเรียบเรียงคำตอบ
ผมชอบอธิบายด้วยเรื่องการสอบ
AI ปกติเหมือนเด็กหัวกะทิที่ทำข้อสอบแบบปิดหนังสือ ส่วน AI + RAG คือเด็กคนเดิมที่เปิดหนังสือสอบได้
แต่เมื่อมองลึกลงไป เราจะพบว่าการ “เปิดหนังสือ” ยังไม่พอครับ
ใครบางคนต้องจัดหนังสือขึ้นชั้น ระบุว่าฉบับไหนใหม่ที่สุด ทำสารบัญ กำหนดสิทธิ์ และหยิบหน้าที่เกี่ยวข้องมาวางให้ตรงคำถาม หากขั้นตอนเหล่านี้ผิด เด็กหัวกะทิก็ยังตอบจากหน้าที่ผิดได้
ตรงนี้ทำให้ผมมอง RAG ไม่ใช่แค่เรื่องของ LLM แต่เป็นเรื่องของ Knowledge Management และ Information Retrieval ด้วย
Model เก่ง ไม่ได้ช่วยให้เอกสารที่รกหายรกลองนึกภาพเอกสารในองค์กรทั่วไป:
- มีไฟล์ชื่อ final, final-v2 และ final-revised
- ตารางใน PDF ถูกสกัดออกมาไม่ครบ
- Header และ Footer ติดมากับข้อความทุกหน้า
- นโยบายเก่ายังอยู่ข้างนโยบายใหม่
- ไม่มีใครแน่ใจว่าไฟล์ไหนคือ Source of truth
ถ้านำข้อมูลชุดนี้ไปทำ RAG ปัญหาไม่ได้หายไปครับ เราเพียงทำให้ระบบค้นความวุ่นวายได้เร็วขึ้น
จากประสบการณ์ที่ผมลอง feed PDF ท่องเที่ยวภาษาไทยเข้า Pipeline ปัญหาเริ่มตั้งแต่ยังไม่ถึง LLM ด้วยซ้ำ ตัวอักษรจากพื้นหลังสีสดกระจัดกระจาย สระและวรรณยุกต์อยู่ผิดตำแหน่ง ลายน้ำซ้อนข้อความ ตารางกับรูปภาพสูญเสียบริบท และเมื่อใช้หลาย Model ช่วยอ่าน ผลลัพธ์ก็ไม่ได้ตรงกันทั้งหมด
นั่นหมายความว่า “คำตอบจากเอกสาร” จะน่าเชื่อถือแค่ไหน ต้องย้อนกลับไปดูตั้งแต่การเตรียมเอกสาร ไม่ใช่ดูเฉพาะประโยคสุดท้ายที่ AI ตอบ
Grounded ไม่ได้แปลว่าถูกเสมอ
RAG ช่วยให้คำตอบ Grounded กับ Context ที่ส่งเข้าไปได้ แต่ Context นั้นอาจผิด เก่า หรือไม่ครบ
เราจึงไม่ควรสรุปว่า RAG กำจัด Hallucination ได้ทั้งหมด สิ่งที่ทำได้คือจำกัดพื้นที่ในการเดา และออกแบบให้ตรวจสอบที่มาได้ง่ายขึ้น
สำหรับผม ระบบที่น่าใช้ควรตอบคำถามเหล่านี้ได้:
- ข้อความนี้มาจากเอกสารไหน?
- เป็นเอกสารฉบับใดและอัปเดตเมื่อไร?
- Retrieval ดึงข้อความส่วนนี้มาเพราะอะไร?
- ถ้าไม่มีข้อมูลเพียงพอ ระบบยอมบอกว่าไม่พบหรือไม่?
- คนอ่านย้อนกลับไปดู Source ได้ไหม?
Citation จึงไม่ใช่ของตกแต่งท้ายคำตอบ แต่มันเป็นทางให้มนุษย์ตรวจงานของ AI ต่อได้
Permission ต้องอยู่ก่อน Generation
อีกเรื่องที่ไม่ควรมองข้ามคือสิทธิ์การเข้าถึง
การเอาเอกสารใส่ Vector Database ไม่ได้ทำให้เอกสารปลอดภัยขึ้นเอง ถ้า Retrieval ไม่กรองตาม User, Role, Tenant หรือ Metadata ระบบอาจดึงข้อมูลที่ผู้ถามไม่ควรเห็นมาใส่ Context
เมื่อข้อมูลเข้า Context แล้ว ต่อให้หน้าจอไม่แสดง Citation ความลับก็อาจหลุดผ่านคำตอบได้
ดังนั้น Permission filtering, Data isolation และ Audit log ต้องอยู่ใน Retrieval path ไม่ใช่ฝากให้ Prompt บอก Model ว่า “อย่าเปิดเผยข้อมูลลับนะ” อย่างเดียว
RAG ไม่ใช่ Security feature โดยอัตโนมัติครับ Security ต้องถูกออกแบบเข้าไปในระบบ
คำถามก่อนเริ่มโครงการ RAG
ก่อนเลือก Vector Database หรือ Embedding Model ผมอยากชวนเริ่มจากคำถามที่ดูธรรมดากว่า
- ข้อมูลชุดใดควรถูกใช้ตอบคำถามนี้?
- ใครเป็นเจ้าของและใครยืนยันความถูกต้องของข้อมูล?
- เอกสารฉบับไหนเป็น Source of truth?
- ระบบจะรู้ได้อย่างไรว่าข้อมูลเปลี่ยน?
- ผู้ใช้แต่ละคนควรค้นเจออะไร?
- เราจะวัดอย่างไรว่าค้นเจอส่วนที่เกี่ยวข้องจริง?
- คนจะตรวจคำตอบย้อนกลับไปยังหลักฐานได้อย่างไร?
คำถามพวกนี้อาจไม่หวือหวาเท่าการเทียบ Model แต่เป็นฐานที่ทำให้ RAG ใช้งานได้จริงมากกว่า
สรุป
RAG ไม่ได้ทำให้ Model รู้ทุกอย่าง มันเปลี่ยนวิธีทำงานจากการพึ่งความรู้ใน Model เพียงอย่างเดียว เป็นการค้นข้อมูลที่เกี่ยวข้องมาให้ก่อนตอบ
ภาพ “เปิดหนังสือสอบ” ช่วยให้เข้าใจหลักการ แต่การสร้างระบบจริงต้องคิดต่อว่า หนังสือถูกเล่มไหม หน้าถูกไหม ข้อมูลใหม่พอไหม และผู้ถามมีสิทธิ์อ่านหรือเปล่า
สำหรับผม ความแม่นยำของ RAG เริ่มก่อนถึง Prompt ครับ มันเริ่มจาก Detail ของการจัดองค์ความรู้และเส้นทางที่พาข้อมูลไปหา AI
อ่าน Original บน NEXT4I: https://go.next4i.com/next4i/journey/th
#RAG, #GenerativeAI, #KnowledgeManagement, #InformationRetrieval, #AIEngineering #NEXT4I
โฆษณา