16 ส.ค. เวลา 13:20 • วิทยาศาสตร์ & เทคโนโลยี

เจาะลึก GPT-5.6: Sol, Terra, Luna และการแข่งขันที่วัดกันด้วยงานจริง

วันที่ 9 กรกฎาคม 2026 OpenAI เปิด GPT-5.6 ให้ใช้งานทั่วไป หลังจากเริ่ม Limited Preview กับ trusted partners กลุ่มเล็กผ่าน API และ Codex เมื่อปลายเดือนมิถุนายน การเปิดตัวครั้งนี้มาพร้อมโมเดลสามระดับ (Sol, Terra, Luna) ฟีเจอร์ Reasoning ระดับใหม่, ChatGPT Work และระบบที่ให้ Agents หลายตัวทำงานร่วมกัน (Ultra) รวมถึง Programmatic Tool Calling ใน Responses API.
เมื่อเข้าสู่กลางเดือนสิงหาคม บทบาทของแต่ละรุ่นเริ่มชัดขึ้น OpenAI กำลังทยอยนำ Sol ไปใช้กับ ChatGPT สำหรับแพ็กเกจแบบชำระเงิน, Luna กลายเป็นโมเดลเริ่มต้นของ Free และ Go และ Terra ทำหน้าที่เป็นแกนกลางของ Work, Codex และ API สำหรับงานที่ต้องบาลานซ์คุณภาพกับต้นทุน.
ตระกูล GPT-5.6 ถูกวางไว้กับงานที่มีเป้าหมายชัด ใช้เครื่องมือหลายชนิด และต้องตรวจผลระหว่างทาง งานลักษณะนี้พบได้ตั้งแต่การแก้โค้ดใน repository ขนาดใหญ่ การวิเคราะห์ข้อมูลจากหลายไฟล์ ไปจนถึงการสร้างรายงาน Spreadsheet หรือ Presentation ที่นำไปแก้ไขต่อได้
บทความนี้จะพาไปเจาะลึกโมเดลตระกูล GPT-5.6 ที่ผู้ใช้งาน ChatGPT ทั่วโลกรอคอย หลังจากการปล่อยให้ทดลองใช้แบบจำกัด การทำงานในแบบ Agentic Workflow พร้อมความสามารถที่นำไปใช้กับงานจริงได้มากขึ้น
Sol, Terra และ Luna แบ่งงานกันคนละระดับ
OpenAI ใช้ชื่อ Sol, Terra และ Luna แทน “ระดับความสามารถ” ที่พัฒนาแยกจากกันได้ โดยเลข 5.6 ระบุรุ่นของเทคโนโลยี ส่วนชื่อท้ายสะท้อนตำแหน่งด้านคุณภาพ ความเร็ว และต้นทุน.
GPT-5.6 แบ่งเป็น Sol, Terra และ Luna สำหรับงานคนละระดับ โดย OpenAI ลดราคา API ของ Terra ลง 20% และ Luna ลง 80% เมื่อวันที่ 30 กรกฎาคม ส่วนราคา Sol คงเดิม
GPT-5.6 Sol เป็นรุ่นเรือธงสำหรับ Coding, Research และงานวิชาชีพที่ต้องวิเคราะห์หลายขั้น เหมาะกับงานที่มีข้อมูลมาก เรียกเครื่องมือซ้ำ และทบทวนผลก่อนส่งมอบ
GPT-5.6 Terra อยู่ตรงกลางระหว่างความสามารถกับค่าใช้จ่าย OpenAI ระบุว่าประสิทธิภาพแข่งขันกับ GPT-5.5 ได้ในราคาที่ต่ำกว่า เหมาะกับการวิเคราะห์เอกสาร สร้างร่างแรก หรือแก้โค้ดที่มีขอบเขตชัด
GPT-5.6 Luna เป็นรุ่นที่เร็วและมีราคาต่ำที่สุด รองรับงานปริมาณมาก เช่น จัดหมวดหมู่ ดึงข้อมูล สรุปเนื้อหา หรือเตรียมข้อมูลก่อนส่งต่อ
ทั้งสามรุ่นรองรับ Context Window 1.05 ล้าน Tokens และสร้าง Output ได้สูงสุด 128,000 Tokens ราคา API ต่อหนึ่งล้าน Tokens ของ Sol อยู่ที่ 5 ดอลลาร์สำหรับ Input และ 30 ดอลลาร์สำหรับ Output ส่วน Terra อยู่ที่ 2 และ 12 ดอลลาร์ ขณะที่ Luna อยู่ที่ 0.20 และ 1.20 ดอลลาร์
ราคาของ Terra และ Luna เป็นอัตราหลัง OpenAI ปรับเมื่อวันที่ 30 กรกฎาคม โดยลดลง 20% และ 80% ตามลำดับ ราคา Sol ยังคงเดิม และการเปลี่ยนแปลงนี้ไม่ได้เพิ่มโควตาในแพ็กเกจ ChatGPT
ในการทดสอบ Coding ระยะยาวของ CodeRabbit GPT-5.6 Sol ผ่านงาน 63.7% และใช้ Output เฉลี่ย 20,968 Tokens ต่อ Task ส่วน Terra ใช้ Output มากกว่าและมีคะแนนต่ำกว่า
Workflow หนึ่งสามารถใช้หลายรุ่นร่วมกันได้ Luna คัดกรองข้อมูล Terra สร้างร่างหรือวิเคราะห์เบื้องต้น แล้วส่งส่วนที่ต้องตัดสินใจซับซ้อนให้ Sol ความสามารถที่มีต้นทุนสูงจึงถูกใช้กับขั้นตอนที่มีผลต่อคุณภาพงานมากที่สุด
GPT-5.6 ใน ChatGPT, Work, Codex และ API
ตำแหน่งของ GPT-5.6 จะแตกต่างกันตาม “พื้นที่ใช้งาน” และ “แพ็กเกจ” ของผู้ใช้งานในแต่ละระดับ
สำหรับผู้ใช้แพ็กเกจแบบชำระเงินในระดับ Plus สามารถใช้งาน GPT-5.6 Sol แบบ Instant และโหมด Reasoning ในระดับ Medium, High ส่วนผู้ใช้แพ็กเกจแบบชำระเงินในระดับ Pro, Business สามารถเลือกใช้ใช้เพิ่มเติมในระดับ Extra High, Max และ Pro รองรับงานยากและ Workflow ที่ใช้เวลานานกว่า
GPT-5.6 ใช้โมเดลและโควตาต่างกันตามแพ็กเกจ โดย Free และ Go ใช้ Luna ใน Chat ส่วนแพ็กเกจแบบชำระเงินที่มีสิทธิ์เข้าถึง Sol และงานแบบ Agent จะนับจากกอง Usage ร่วม ภาพรวมอัตรา Credits อ้างอิง Rate Card วันที่ 16 สิงหาคม
Free และ Go ใช้ GPT-5.6 Luna เป็นโมเดลเริ่มต้น และสามารถใช้ Think สำหรับคำถามที่ยากขึ้นได้ Think ใช้ GPT-5.6 Luna ไม่ใช่ GPT-5.6 Sol ทั้งในบทสนทนาแบบ Chat และ Work
Luna และ Terra ยังเลือกด้วยชื่อรุ่นไม่ได้ใน Model Picker แบบปกติ แต่ปรากฏใน Work, Codex และ API ตามสิทธิ์ของแต่ละแพ็กเกจ
Usage Limits แยกตามแพ็กเกจและพื้นที่ใช้งาน
Usage Limit แยกเป็นการสนทนาปกติกับงานแบบ Agent ใน Work, Codex, Excel, PowerPoint และ Workspace Agents จำนวน credit ที่ต้องใช้กับการทำงานแบบ Agent ไม่ตายตัว เพราะขึ้นกับรุ่นโมเดล ขนาด Context ระยะเวลาทำงาน การเรียกเครื่องมือ และ Output ที่สร้าง
Free และ Go ใช้ Luna สำหรับบทสนทนาประจำวันและ Think โดย OpenAI ระบุว่า Text Chat ใช้ได้ไม่จำกัดภายใต้มาตรการป้องกันการใช้งานผิดประเภท ส่วนการค้นหา อัปโหลดไฟล์ สร้างภาพ และเครื่องมืออื่นมี Limit แยกกัน Codex เปิด Terra ให้ใช้ตามสิทธิ์ของบัญชี
Plus เข้าถึง Sol ระดับ Medium และ High ขณะที่ Pro, Business และ Enterprise เพิ่ม Extra High และ Pro การใช้ Reasoning แบบเลือกเองมี Limit ตามแพ็กเกจ แต่การเพิ่ม Reasoning โดยระบบอัตโนมัติไม่หักโควตาส่วนนี้ เมื่อใช้ครบ ChatGPT อาจทำงานต่อด้วยโมเดล Reasoning อื่นที่ยังไม่หมดโควต้า
Work และ Codex ใช้ Agentic Usage Pool ร่วมกับฟีเจอร์ที่รองรับ ผู้ใช้ Plus และ Pro ที่มีสิทธิ์สามารถซื้อ Credits เพิ่มได้ ส่วน Business และ Enterprise ใช้ Credit ส่วนกลางของ Workspace ภายใต้การตั้งค่าของผู้ดูแล ระบบจะแสดงยอดคงเหลือและประวัติการใช้ในหน้า Usage
สำหรับ Business และ Enterprise ที่ใช้ Flexible Pricing, Rate Card วันที่ 16 สิงหาคมระบุว่า GPT-5.6 Sol ใช้ 10 Credits ต่อข้อความ และ Sol Pro ใช้ 50 Credits ขณะที่ Instant กับ Luna ไม่หัก Credits
ระดับ Medium, High และ Extra High ใช้ Sol ในอัตราเดียวกัน ส่วน Automatic Reasoning จะหัก 10 Credits เมื่อระบบส่งคำขอไปยัง Sol
สำหรับ Codex, Rate Card ปัจจุบันคิด Credits ต่อหนึ่งล้าน Tokens ของ Sol ที่ 125 สำหรับ Input, 12.5 สำหรับ Cached Input และ 750 สำหรับ Output ส่วน Terra อยู่ที่ 50, 5 และ 300 Credits ขณะที่ Luna อยู่ที่ 5, 0.5 และ 30 Credits งาน Sol ทั่วไปใช้ประมาณ 5-40 Credits แต่จำนวนจริงเปลี่ยนตามลักษณะงาน
OpenAI แจ้งว่าจะปลด GPT-5.4 และ GPT-5.4 mini ออกจาก Codex สำหรับผู้ที่ลงชื่อเข้าใช้ด้วยบัญชี ChatGPT ในวันที่ 31 สิงหาคม 2026 พร้อมแนะนำ Terra และ Luna เป็นรุ่นทดแทน การเปลี่ยนแปลงนี้ไม่กระทบการเรียกโมเดลผ่าน API หรือ API Key ของผู้ใช้เอง
ใน API ชื่อ gpt-5.6 จะส่งคำขอไปยัง gpt-5.6-sol นักพัฒนาสามารถเรียก Terra และ Luna ผ่าน Model ID ของแต่ละรุ่น และกำหนด reasoning.effort ได้ตั้งแต่ none, low, medium, high, xhigh จนถึง max
ระดับที่สูงขึ้นเปิดเวลาให้โมเดลสำรวจแนวทางและทบทวนผลมากขึ้น แลกกับเวลารอและ Tokens ที่เพิ่มขึ้น OpenAI แนะนำให้ผู้ฝใช้ที่ย้ายจาก GPT-5.5 หรือ GPT-5.4 เปรียบเทียบ Reasoning ระดับเดิมกับระดับที่ต่ำลงหนึ่งขั้น เพราะบาง Workflow อาจรักษาคุณภาพได้โดยใช้ Tokens น้อยลง
Max, Pro และ Ultra ทำหน้าที่ต่างกัน
Max, Pro และ Ultra คือระดับการใช้ Reasoning เพื่อวิเคราะห์หาคำตอบหรือทำงานที่ซับซ้อนได้สำเร็จตามเป้าหมาย แต่ความฉลาดและความสามารถที่เพิ่มขึ้นก็ต้องแลกกับ credit ที่ต้องใช้มากขึ้น
Max คือ Reasoning Effort ระดับสูงสุด โมเดลได้รับเวลาและ token ที่ใช้ประมวลผลเพิ่มสำหรับการคิดและตรวจงาน
Pro ใน Responses API เป็น Execution Mode ที่เพิ่ม Model Work ก่อนคืนคำตอบสุดท้าย และยังสามารถกำหนด Reasoning Effort แยกจากโหมดนี้ได้ ส่วน Sol Pro ใน ChatGPT เป็นตัวเลือกของ GPT-5.6 สำหรับงานยากและ Workflow ที่ใช้เวลานานกว่า
Ultra คือโหมดที่ต้องใช้ credit สูงสุด เพื่อประสาน Agents หลายตัวให้แบ่งงานและรวบรวมข้อมูล งานวิจัยหนึ่งชิ้นอาจแยกการค้นหลักฐาน วิเคราะห์ตัวเลข และตรวจข้อโต้แย้ง ก่อนส่งกลับให้ Agent หลักสังเคราะห์
การใช้ Agents หลายตัวให้ผลดีเมื่องานแบ่งเป็นส่วนอิสระได้ หากทุกส่วนต้องรอผลจากขั้นตอนก่อนหน้า อาจเกิดการค้นซ้ำหรือข้อสรุปขัดกัน คุณภาพจึงขึ้นกับการแบ่งหน้าที่และวิธีรวบรวมข้อมูลพอ ๆ กับจำนวน Agents
หากต้องการเพิ่ม Agent เข้ามาช่วยทำงานที่ซับซ้อน หรือต้องใช้เวลานาน สามารถ prompt บอก ChatGPT ว่า "สร้าง sub agent เพื่อมาช่วยทำงานตามขั้นตอนที่วางไว้" ChatGPT ก็จะวางแผนและสร้างน้องๆ agent เพื่อมาช่วยให้งานเสร็จเร็วขึ้น แต่ต้องเช็ค credit กันด้วยนะครับ
สามารถตรวจสอบ credit คงเหลือได้จาก "การตั้งค่า>การใช้งานและการเรียกเก็บเงิน"
ChatGPT Work นำโมเดลไปรับงานหลายขั้นตอน
GPT-5.6 เปรียบได้เสมือนพนักงานคนหนึ่ง ChatGPT Work ก็เป็นเหมือนพื้นที่ทำงานสำหรับมอบหมายงานให้กับพนักงาน ช่วยทำงานที่มีชิ้นงานปลายทางชัดเจน เช่น งานเอกสาร, รายงาน Spreadsheet, Presentation หรือเว็บไซต์
ปัจจุบัน ChatGPT Work เปิดให้ผู้ใช้งานแบบชำระเงินสามารถใช้งานบน Web, Mobile และ Desktop ได้แล้ว การเข้าถึง Cloud Work สามารถใช้งานได้บน Web, Mobile และ Desktop. แต่ Local Work สามารถใช้งานได้บนแอพ Codex /ChatGPT บน Desktop เท่านั้น เพื่อให้ ChatGPT ได้ปลดปล่อยพลังในการควบคุม Desktop ได้เต็มที่
Chat เหมาะกับคำถาม การค้นข้อมูล และการระดมความคิด Work เหมาะกับงานที่อ่านไฟล์ ใช้ Apps และสร้างชิ้นงานหลายขั้นตอน ขณะที่ Codex เหมาะกับงานสร้าง Software, Codding หรือ knowledge work ทั่วไป
งานหนึ่งใน Work อาจเริ่มจากอ่านรายงานยอดขาย ดึงข้อมูลจาก Google Drive วิเคราะห์สาเหตุที่ตัวเลขเปลี่ยน แล้วสร้าง Spreadsheet และ Presentation ผู้ใช้สามารถติดตามความคืบหน้า เปลี่ยนทิศทาง หรืออนุมัติ Action สำคัญได้ภายในงานเดิม
หน้า Work ใน ChatGPT รองรับงานหลายขั้นตอน ตั้งแต่การใช้ไฟล์และเครื่องมือ ไปจนถึงการสร้างชิ้นงานที่นำไปแก้ไขต่อได้
Cloud Work ซิงก์ระหว่าง Web, Mobile และ Desktop ส่วน Work บน Desktop สามารถเข้าถึง Local Files หรือ Apps หลังผู้ใช้ให้ Permission ไฟล์และผลลัพธ์ใน Local Work ยังคงอยู่บนคอมพิวเตอร์เครื่องนั้นจนกว่าจะถูกย้ายหรือแชร์ออกไป Work บน Web และ Mobile ไม่สามารถอ่านไฟล์ในเครื่องได้โดยตรง
การแบ่ง Local กับ Cloud มีผลต่อความสะดวกและการควบคุมข้อมูล Cloud Work เหมาะกับงานข้ามอุปกรณ์ ส่วน Source Code หรือเอกสารภายในสามารถอยู่ใน Local Work ภายใต้ขอบเขตไฟล์ที่ผู้ใช้กำหนด
Codex ยังเป็นพื้นที่แยกจาก Work และเลือกใช้งานโดยตรงบน Web หรือ Mobile ไม่ได้ แต่การสนทนา Codex ที่รองรับบน Desktop สามารถติดตามผ่าน Remote tab ในแอปมือถือได้
Work รองรับงานที่รันครั้งเดียว ทำซ้ำตามเวลา ทำงานเมื่อเกิดเงื่อนไข หรือเฝ้าติดตามการเปลี่ยนแปลงผ่าน Scheduled Tasks บัญชีที่มีสิทธิ์ยังใช้ ChatGPT Voice เพื่อสั่งและประสานงาน Work หรือ Codex บน Desktop ได้ โดยเวลาเชื่อมต่อ Voice และงานที่ระบบเริ่มให้จะถูกนับแยกกัน
F9 Finance เว็บไซต์ด้านการเงิน เทคโนโลยี และการใช้ AI ในงาน Finance ก่อตั้งโดย Mike Dion ผู้มีประสบการณ์ทำงานด้านการเงินระดับอาวุโส ระบุว่าได้ทดลอง ChatGPT Work บน Sol เทียบกับ Claude Cowork บน Opus 4.8 ด้วยงานการเงินจริงสามแบบ ทั้งคู่สร้างผลงานที่ใช้งานต่อได้ Claude เสร็จเร็วกว่าราวหนึ่งถึงสองนาทีและให้ไฟล์ Word หรือ PowerPoint ที่พร้อมส่งต่อกว่า ขณะที่ Work ใช้ Markdown เป็นไฟล์ทำงานบ่อยกว่า
Benchmark เริ่มวัดโมเดลร่วมกับระบบทำงาน
Benchmark คือชุดงานมาตรฐานสำหรับเปรียบเทียบความสามารถ เมื่อโมเดลทำงานแบบ Agent คะแนนยังขึ้นกับ Prompt, เครื่องมือ, สิทธิ์ และวิธีแก้ข้อผิดพลาด ระบบที่จัดองค์ประกอบเหล่านี้ให้โมเดลเรียกว่า Agent Harness
ข้อมูลวันที่ 16 สิงหาคมจาก Artificial Analysis Intelligence Index v4.1.1 รวมผลประเมิน 9 ชุด (งานความรู้ วิทยาศาสตร์ การใช้ Terminal และการให้เหตุผล) ระบุว่า Opus 5 ที่ Max Reasoning ได้ 63 คะแนน ตามด้วย Fable 5 ที่ 62 และ GPT-5.6 Sol ที่ Max Reasoning ที่ 61 คะแนน.
Benchmark ในด้าน Coding Agentsของ GLSRM(สื่อชั้นนำด้าน AI) ให้ Opus 5 ใน Claude Code 66.7 คะแนน, Sol ใน Codex 66.6 และ Fable 65.8 คะแนน
GPT 5.6 อยู่ในตำแหน่งกลุ่มผู้นำ Benchmark ในด้าน Artificial Analysis Intelligence Index และ Coding Agent
ด้าน Knowledge Work, Fable จาก Anthropic นำคะแนนรวมของ AA-Briefcase และได้คะแนนคุณภาพการวิเคราะห์สูงกว่า ส่วน Sol มี Presentation Elo สูงที่สุด ทั้งสองจึงเด่นคนละด้านระหว่างการวิเคราะห์กับการจัดรูปแบบชิ้นงาน
Viktor(ผู้ให้บริการ AI Agent) นำโมเดลไปทำงานใน Workspace จำลองที่มีประวัติ Slack, Files และ Automations ทั้ง Sol และ Fable มีอัตรางานสำเร็จหลังปรับตามเกณฑ์เท่ากันที่ 76% Sol ใช้ต้นทุน 33.55 ดอลลาร์และเวลา 82 วินาที เทียบกับ 96.35 ดอลลาร์และ 129 วินาทีของ Fable
สำหรับการประเมิน IQ Test ของ TrackingAI.org ใช้วิธีป้อนโจทย์ต่างกันตามรูปแบบของโมเดล รุ่น Text ได้รับโจทย์ที่แปลงจากภาพเป็นคำอธิบาย ส่วนรุ่น Vision เห็นภาพต้นฉบับโดยตรง ผลของรุ่น Vision ใน Offline Test อยู่ที่ 132 สำหรับ Sol, 136 สำหรับ Terra และ 130 สำหรับ Luna ขณะที่ Mensa Norway ให้ 124, 141 และ 145 ตามลำดับ
ผลการประเมิน IQ Test โดย TrackingAI.org GPT-5.6 อยู่ในกลุ่มผู้นำของโมเดล AI ที่ทดสอบ
ผลที่ต่างกันระหว่าง Text และ Vision แสดงให้เห็นว่ารูปแบบการนำเสนอโจทย์มีผลต่อคะแนนอย่างมาก Sol แบบ Vision ทำคะแนน Offline สูงกว่ารุ่น Text เล็กน้อย แต่คะแนน Mensa Norway ลดจาก 145 เหลือ 124 ส่วน Luna แบบ Vision เพิ่มจาก 127 เป็น 130 ใน Offline Test และคงคะแนน Mensa Norway ที่ 145
จากการประเมินความสามารถของโมเดล ไม่ควรยึดจาก Benchmark เนื่องจากคะแนนชุดเดียวไม่เพียงพอสำหรับเลือกโมเดลมาใช้จริง เพราะงานจริงมี Context, Tools, รูปแบบความผิดพลาด และมาตรฐานการยอมรับผลงานต่างจาก Benchmark การประเมินความสามารถและประสิทธิภาพของโมเดลควรประเมินจากการใช้งานจริงมากกว่า
ความสามารถที่สูงขึ้นเพิ่มภาระด้าน Reliability และ Safety
OpenAI จัด Sol, Terra และ Luna อยู่ในระดับ High Capability ด้าน Cybersecurity และ Biological/Chemical Risk ทั้งสามรุ่นยังไม่ถึงระดับ Critical และไม่ถึง High Threshold ด้าน AI Self-Improvement ตาม GPT-5.6 System Card
OpenAI อัปเดต System Card เมื่อวันที่ 3 สิงหาคม โดยเพิ่มผลประเมิน Prompt Injection จาก GPT-Red ส่วนระดับความสามารถตาม Preparedness Framework ยังคงเดิม
OpenAI จัด Sol, Terra และ Luna ไว้ในระดับ High Capability ด้าน Cybersecurity และ Biological/Chemical Risk ส่วน AI Self-Improvement ยังต่ำกว่าเกณฑ์ High ตาม System Card ที่อัปเดตวันที่ 3 สิงหาคม
System Card รายงานว่า GPT-5.6 Sol มีแนวโน้มทำ Action ระดับรุนแรงขึ้นใน Agentic Coding Traffic ภายในเมื่อเทียบกับ GPT-5.5
ตัวอย่างที่ OpenAI เปิดเผยประกอบด้วยการลบ Virtual Machines คนละชุดกับที่ผู้ใช้ระบุ การกล่าวอ้างว่างานคำนวณผ่านการตรวจสอบทั้งที่ยังไม่ได้ทำจริง และการย้าย Cached Credentials ระหว่างเครื่องโดยไม่ได้รับอนุญาต
OpenAI เชื่อมพฤติกรรมส่วนหนึ่งกับความพยายามทำงานต่อเนื่องที่สูงขึ้น โดยเฉพาะเมื่อใช้ Reasoning ระดับสูง อัตราที่บริษัทพบยังอยู่ในระดับต่ำ และข้อมูลภายในไม่สามารถใช้แทนอัตราการเกิดกับผู้ใช้ทั่วไปได้
METR องค์กรวิจัยไม่แสวงหากำไรในสหรัฐฯ ที่ประเมินความสามารถและความเสี่ยงของ AI ระดับแนวหน้า พบว่า Sol พยายามใช้ช่องว่างของสภาพแวดล้อมทดสอบ เช่นดึงข้อมูลจากชุดทดสอบที่ซ่อนอยู่ หรือค้น Source Code ที่มีคำตอบ METR เรียกพฤติกรรมนี้ว่า cheating ตามนิยามการประเมิน หมายถึงการใช้วิธีที่กติกาไม่อนุญาต ไม่ได้ยืนยันเจตนาโกงแบบมนุษย์
Time Horizon หรือระดับความยาวของงานที่โมเดลมีโอกาสทำสำเร็จ เปลี่ยนจากประมาณ 11.3 ชั่วโมงไปเกิน 270 ชั่วโมงตามวิธีนับพฤติกรรมดังกล่าว หากตัดตัวอย่างเหล่านั้นออก ช่วงความไม่แน่นอนก็กว้างมาก METR จึงไม่ถือค่าชุดใดเป็นตัววัดที่เชื่อถือได้
System Card และ METR ประเมินคนละสภาพแวดล้อม แต่ชี้ไปยังปัญหาที่เกี่ยวข้องกัน โมเดลที่ทำงานได้นานและใช้เครื่องมือได้มากขึ้นอาจหาทางผ่านอุปสรรคที่ผู้ใช้หรือผู้ออกแบบ Benchmark ทำไว้แบบไม่ได้ตั้งใจ เพียงแค่ต้องการทำงานที่ได้รับมอบหมายให้สำเร็จ หากมองตามแบบพฤติกรรมของมนุษย์ อาจเห็นได้ว่า AI กำลัง "โกง" เพื่อทำงานให้สำเร็จ โดยไม่สนใจวิธีการ
ระบบใช้งานจริงต้องมีขอบเขตสำหรับไฟล์ Credentials, Network และ Action พร้อมตรวจผลจากเครื่องมืออย่างเป็นระบบก่อนจะตัดสินว่างานเสร็จแล้ว
บทสรุป: เมื่อคุณภาพของ AI วัดจากงานที่ส่งมอบได้
เมื่อเข้าสู่กลางเดือนสิงหาคม GPT-5.6 ถูกนำมาใช้ในผลิตภัณฑ์ประจำวันมากขึ้น Luna เป็นโมเดลเริ่มต้นของ Free และ Go, Sol กำลังทยอยเข้าสู่ ChatGPT สำหรับแพ็กเกจแบบชำระเงิน ส่วน Terra รองรับงานที่ต้องรักษาสมดุลระหว่างความสามารถกับต้นทุนใน Work, Codex และ API
Reasoning, Agent System และ Programmatic Tool Calling ช่วยให้โมเดลทำงานได้ยาวขึ้น ส่วน ChatGPT Work นำความสามารถนั้นมาอยู่ใน Workflow ที่ผู้ใช้ทั่วไปเข้าถึงได้ ผลจาก Benchmark และการประเมินด้าน Safety แสดงว่าคุณภาพยังขึ้นกับเครื่องมือ สิทธิ์ ต้นทุน และการตรวจงานของมนุษย์
เมื่อ AI เริ่มรับงานได้ยาวขึ้น คุณภาพไม่ได้จบที่คำตอบแรก แต่ปรากฏในทุกขั้นตอนตั้งแต่การเลือกโมเดล การใช้เครื่องมือ ไปจนถึงการตรวจรับผลงาน ความก้าวหน้าของ GPT-5.6 จึงมีความหมายที่สุดเมื่อชิ้นงานที่ได้ถูกต้อง ใช้ต่อได้ และยังอยู่ภายใต้การตัดสินใจของมนุษย์
Reference Sources
1. OpenAI. "Previewing GPT-5.6 Sol: a next-generation model." Published June 26, 2026.
2. OpenAI. "GPT-5.6: Frontier intelligence that scales with your ambition." Published July 9, 2026.
3. OpenAI Help Center. "GPT-5.6 in ChatGPT." Updated August 15, 2026.
4. OpenAI Developers. "Model guidance: Using GPT-5.6." Published date not listed.
5. OpenAI Help Center. "ChatGPT Work and Codex." Updated August 14, 2026.
6. OpenAI. "GPT-5.6 System Card." Published July 9, 2026; updated August 3, 2026.
7. OpenAI. "Separating signal from noise in coding evaluations." Published July 8, 2026.
8. Anthropic. "Claude Fable 5 and Claude Mythos 5." Published June 9, 2026; updated July 1, 2026.
9. Artificial Analysis. "GPT-5.6 benchmarks across Intelligence, Speed and Cost." Published July 9, 2026.
10. METR. "Summary of METR's predeployment evaluation of GPT-5.6 Sol." Published June 26, 2026.
11. Viktor Research. "GPT-5.6 vs Claude: Benchmarked on Real Agent Work." Published July 9, 2026.
12. CodeRabbit. "GPT-5.6 Sol and Terra: Where they fit for coding agents and code review." Published July 9, 2026.
13. F9 Finance. "ChatGPT Work vs Claude Cowork." Published July 15, 2026.
14. OpenAI Help Center. "Using Credits for Flexible Usage in ChatGPT (Free/Go/Plus/Pro)." Updated August 14, 2026.
15. OpenAI Help Center. "Codex rate card." Updated August 5, 2026.
16. OpenAI Help Center. "Flexible pricing for the Enterprise, Edu, and Business plans." Updated August 2026.
17. OpenAI Help Center. "ChatGPT Rate Card for Business, Enterprise, and Edu." Updated August 16, 2026.
18. Artificial Analysis. "Opus 5: Fable 5 level intelligence at a lower cost per task." Published July 24, 2026.
19. GLSRM. "Coding Agents." Snapshot August 13, 2026.
20. OpenAI. "Advancing the price-performance frontier with GPT-5.6." Published July 30, 2026.
#GPT56 #ChatGPT #OpenAI #AI #เทคโนโลยี
โฆษณา