DEV Community

Nokka
Nokka

Posted on AI-assisted

GPT-6 Astra โมเดลสุขภาพของ OpenAI ทำคะแนนสูงสุดบน HealthBench Professional

GPT-6 Astra โมเดลสุขภาพของ OpenAI ทำคะแนนสูงสุดบน HealthBench Professional

OpenAI เปิดตัว GPT-6 Astra ซึ่งเป็นโมเดลรุ่นใหม่ที่เน้นความสามารถด้านสุขภาพและการแพทย์ โดยทำคะแนนสูงสุดใหม่บน HealthBench Professional [1] ซึ่งเป็นมาตรฐานที่วัดงานจริงของบุคลากรทางการแพทย์ ทั้งการให้คำปรึกษาดูแลผู้ป่วย การจัดทำเอกสารทางการแพทย์ และงานวิจัย

ผลการทดสอบ

Karan Singhal จาก OpenAI ระบุว่า GPT-6 Astra ทำคะแนน 63.4% [2] บน HealthBench Professional (แบบปรับตามความยาว) ซึ่งสูงกว่า GPT-5.6 Sol ที่ทำได้ 60.5% และสูงกว่า Claude Fable 5.1 ที่ทำได้ 58.1%

จุดสำคัญคือ Astra ทำคะแนนนี้ได้ที่ระดับการใช้เหตุผลต่ำสุด (lowest reasoning effort) ซึ่งหมายความว่าต้นทุนการประมวลผลต่ำกว่า GPT-5.6 Sol ที่ต้องใช้ระดับสูงสุดเพื่อทำคะแนนใกล้เคียงกัน โดย Singhal ระบุว่า Astra แซงคะแนนที่ดีที่สุดของ GPT-5.6 Sol ได้ที่ต้นทุนประมาณครึ่งหนึ่ง

ความแม่นยำด้านข้อเท็จจริง

นอกจากคะแนนบน HealthBench Professional แล้ว OpenAI ยังรายงานผลการประเมินภายในอีกชุดหนึ่งที่สะท้อนคำถามสุขภาพที่ผู้ใช้ถาม ChatGPT ทั่วไป โดยพบว่า Astra มีโอกาสทำผิดพลาดด้านข้อเท็จจริงน้อยกว่า GPT-5.6 Sol มากกว่าสามเท่าเมื่อเทียบที่ระดับการใช้เหตุผลสูงสุดของทั้งคู่

การประเมิน HealthBench Professional ถูกออกแบบให้ยากโดยเจตนา โดยเน้นสถานการณ์ที่ซับซ้อนและพบได้ยาก เพื่อทดสอบขีดจำกัดของโมเดลมากกว่าการวัดงานประจำวัน

บริบทและความหมาย

การเปิดตัว GPT-6 Astra สะท้อนทิศทางที่ OpenAI ให้ความสำคัญกับความน่าเชื่อถือในงานเฉพาะทาง โดยเฉพาะด้านสุขภาพที่ความผิดพลาดมีผลกระทบสูง

ตารางเปรียบเทียบคะแนน HealthBench Professional (แบบปรับตามความยาว) จาก OpenAI [3]:

  • GPT-6 Astra: 63.4%
  • GPT-5.6 Sol: 60.5%
  • Claude Fable 5.1: 58.1%
  • Claude Fable 5: 60.9%
  • Claude Opus 5: 56.4%
  • Gemini 3.8 Flash: 52.1%

ตัวเลขเหล่านี้เป็นผลการประเมินของ OpenAI โดยโมเดล Claude ถูกประเมินโดย OpenAI เองตามขั้นตอนของ HealthBench Professional

ผลกระทบต่อคนไทย

สำหรับวงการสุขภาพไทย การพัฒนาโมเดลที่แม่นยำด้านการแพทย์มีนัยสำคัญหลายประการ

ประการแรกคือศักยภาพในการช่วยงานเอกสารทางการแพทย์ ซึ่งเป็นภาระงานที่บุคลากรทางการแพทย์ไทยใช้เวลามาก การมีโมเดลที่แม่นยำขึ้นช่วยลดเวลาทำเอกสารและเพิ่มเวลาดูแลผู้ป่วย

ประการที่สองคือการให้คำปรึกษาเบื้องต้น แต่ควรระลึกว่าโมเดล AI ไม่ได้ทดแทนแพทย์ และผลการทดสอบเป็นข้อมูลจากผู้พัฒนา ประสิทธิภาพจริงอาจแตกต่างกันตามบริบทการใช้งาน

ประการที่สามคือการเข้าถึง โมเดลระดับนี้ยังเป็นบริการคลาวด์ของ OpenAI ซึ่งมีข้อจำกัดด้านภาษาและบริบทท้องถิ่น ผู้ใช้ไทยควรพิจารณาความเหมาะสมกับระบบสุขภาพของไทยโดยเฉพาะ

แหล่งอ้างอิง

[1] OpenAI, "GPT-6 Astra: A new generation of intelligence" (2026), https://openai.com/index/gpt-6-astra/

[2] Karan Singhal (@thekaransinghal), โพสต์ X ประกาศ GPT-6 Astra (3 ก.ย. 2026), https://x.com/thekaransinghal/status/2095608369621139773

[3] Vellum, "GPT-6 Astra Benchmarks Explained" (2026), https://www.vellum.ai/blog/gpt-6-astra-benchmarks-explained

Top comments (0)