GPT-6 Astra โมเดลสุขภาพของ OpenAI ทำคะแนนสูงสุดบน HealthBench Professional
OpenAI เปิดตัว GPT-6 Astra ซึ่งเป็นโมเดลรุ่นใหม่ที่เน้นความสามารถด้านสุขภาพและการแพทย์ โดยทำคะแนนสูงสุดใหม่บน HealthBench Professional [1] ซึ่งเป็นมาตรฐานที่วัดงานจริงของบุคลากรทางการแพทย์ ทั้งการให้คำปรึกษาดูแลผู้ป่วย การจัดทำเอกสารทางการแพทย์ และงานวิจัย
ผลการทดสอบ
Karan Singhal จาก OpenAI ระบุว่า GPT-6 Astra ทำคะแนน 63.4% [2] บน HealthBench Professional (แบบปรับตามความยาว) ซึ่งสูงกว่า GPT-5.6 Sol ที่ทำได้ 60.5% และสูงกว่า Claude Fable 5.1 ที่ทำได้ 58.1%
จุดสำคัญคือ Astra ทำคะแนนนี้ได้ที่ระดับการใช้เหตุผลต่ำสุด (lowest reasoning effort) ซึ่งหมายความว่าต้นทุนการประมวลผลต่ำกว่า GPT-5.6 Sol ที่ต้องใช้ระดับสูงสุดเพื่อทำคะแนนใกล้เคียงกัน โดย Singhal ระบุว่า Astra แซงคะแนนที่ดีที่สุดของ GPT-5.6 Sol ได้ที่ต้นทุนประมาณครึ่งหนึ่ง
ความแม่นยำด้านข้อเท็จจริง
นอกจากคะแนนบน HealthBench Professional แล้ว OpenAI ยังรายงานผลการประเมินภายในอีกชุดหนึ่งที่สะท้อนคำถามสุขภาพที่ผู้ใช้ถาม ChatGPT ทั่วไป โดยพบว่า Astra มีโอกาสทำผิดพลาดด้านข้อเท็จจริงน้อยกว่า GPT-5.6 Sol มากกว่าสามเท่าเมื่อเทียบที่ระดับการใช้เหตุผลสูงสุดของทั้งคู่
การประเมิน HealthBench Professional ถูกออกแบบให้ยากโดยเจตนา โดยเน้นสถานการณ์ที่ซับซ้อนและพบได้ยาก เพื่อทดสอบขีดจำกัดของโมเดลมากกว่าการวัดงานประจำวัน
บริบทและความหมาย
การเปิดตัว GPT-6 Astra สะท้อนทิศทางที่ OpenAI ให้ความสำคัญกับความน่าเชื่อถือในงานเฉพาะทาง โดยเฉพาะด้านสุขภาพที่ความผิดพลาดมีผลกระทบสูง
ตารางเปรียบเทียบคะแนน HealthBench Professional (แบบปรับตามความยาว) จาก OpenAI [3]:
- GPT-6 Astra: 63.4%
- GPT-5.6 Sol: 60.5%
- Claude Fable 5.1: 58.1%
- Claude Fable 5: 60.9%
- Claude Opus 5: 56.4%
- Gemini 3.8 Flash: 52.1%
ตัวเลขเหล่านี้เป็นผลการประเมินของ OpenAI โดยโมเดล Claude ถูกประเมินโดย OpenAI เองตามขั้นตอนของ HealthBench Professional
ผลกระทบต่อคนไทย
สำหรับวงการสุขภาพไทย การพัฒนาโมเดลที่แม่นยำด้านการแพทย์มีนัยสำคัญหลายประการ
ประการแรกคือศักยภาพในการช่วยงานเอกสารทางการแพทย์ ซึ่งเป็นภาระงานที่บุคลากรทางการแพทย์ไทยใช้เวลามาก การมีโมเดลที่แม่นยำขึ้นช่วยลดเวลาทำเอกสารและเพิ่มเวลาดูแลผู้ป่วย
ประการที่สองคือการให้คำปรึกษาเบื้องต้น แต่ควรระลึกว่าโมเดล AI ไม่ได้ทดแทนแพทย์ และผลการทดสอบเป็นข้อมูลจากผู้พัฒนา ประสิทธิภาพจริงอาจแตกต่างกันตามบริบทการใช้งาน
ประการที่สามคือการเข้าถึง โมเดลระดับนี้ยังเป็นบริการคลาวด์ของ OpenAI ซึ่งมีข้อจำกัดด้านภาษาและบริบทท้องถิ่น ผู้ใช้ไทยควรพิจารณาความเหมาะสมกับระบบสุขภาพของไทยโดยเฉพาะ
แหล่งอ้างอิง
[1] OpenAI, "GPT-6 Astra: A new generation of intelligence" (2026), https://openai.com/index/gpt-6-astra/
[2] Karan Singhal (@thekaransinghal), โพสต์ X ประกาศ GPT-6 Astra (3 ก.ย. 2026), https://x.com/thekaransinghal/status/2095608369621139773
[3] Vellum, "GPT-6 Astra Benchmarks Explained" (2026), https://www.vellum.ai/blog/gpt-6-astra-benchmarks-explained
Top comments (0)