Alibaba เปิดตัว Qwen 3.8-Max ในช่วงต้นเดือนสิงหาคม 2026 และตอนนี้มีราคาสำหรับการใช้งานทั่วไปอย่างเป็นทางการแล้ว หลังสิ้นสุดช่วงพรีวิวที่มีข่าวเรื่องส่วนลด 10% หน้าราคา Model Studio อย่างเป็นทางการ ระบุว่า qwen3.8-max คิดราคา $2 ต่อ 1 ล้านโทเค็นอินพุต และ $6 ต่อ 1 ล้านโทเค็นเอาต์พุต โดยใช้อัตราเดียวตลอดหน้าต่างบริบทสูงสุด 1 ล้านโทเค็น
จุดเด่นคือไม่มีการปรับราคาเป็นขั้นตามความยาวบริบท: ไม่ว่าจะส่ง prompt 5,000 หรือ 900,000 โทเค็น อัตรายังคงเป็น $2/$6 บทความนี้อธิบายวิธีคำนวณต้นทุนจริง การใช้แคช การตั้งค่า reasoning_effort และการทดสอบ usage ก่อนนำไปใช้งานจริง สำหรับภาพรวมโมเดล อ่าน Qwen 3.8 คืออะไร และทำไมจึงสำคัญ ก่อน
ราคาหน้าตารางไม่ใช่ต้นทุนสุดท้ายเสมอไป เพราะ Qwen 3.8-Max ใช้ reasoning_effort: xhigh เป็นค่าเริ่มต้น และโทเค็นการคิดถูกคิดเป็นเอาต์พุต วิธีที่แม่นยำที่สุดคือส่งคำขอจริงและตรวจสอบ usage จาก response โดย Apidog ช่วยให้ตรวจสอบ token breakdown ของแต่ละคำขอได้ระหว่างทดสอบ
ตัวเลข GA: อินพุต $2, เอาต์พุต $6, หนึ่งระดับราคา
ตารางต่อไปนี้อ้างอิงจาก หน้าราคา Model Studio ณ วันที่ 3 สิงหาคม 2026
| รายการ | ราคา (ต่อ 1 ล้านโทเค็น) |
|---|---|
| อินพุต | $2.00 |
| เอาต์พุต รวมโทเค็นการคิด | $6.00 |
| อินพุตที่แคชไว้ (cache hit) | 10% ของอัตราอินพุต |
| การสร้างแคชโดยชัดแจ้ง | 125% ของอัตราอินพุต |
| ระดับบริบท | ระดับเดียว: 0 ถึง 1 ล้านโทเค็น |
| โหมดคิดและไม่คิด | อัตราเดียวกัน |
สิ่งที่ควรนำไปใช้ในโมเดลต้นทุนมี 3 ข้อ:
- ไม่มีค่าปรับสำหรับ prompt ยาว ภายในบริบท 1M โทเค็น
- โทเค็นการคิดคิดราคาเป็นเอาต์พุต แม้อัตราของโหมดคิดและไม่คิดจะเท่ากัน
-
เอาต์พุตสูงสุดคือ 65,536 โทเค็นต่อคำขอ ดังนั้นค่าเอาต์พุตสูงสุดต่อคำขออยู่ที่ประมาณ
$0.39
ประกาศอย่างเป็นทางการของ Qwen 3.8 ระบุว่าโมเดลมีพารามิเตอร์ทั้งหมด 2.4 ล้านล้านตัว มี 95 พันล้านตัวที่ทำงานอยู่ รองรับบริบท 1 ล้านโทเค็น และรับอินพุตแบบ multimodal
เหตุใดราคาเดียวตลอด 1 ล้านโทเค็นจึงสำคัญ
โมเดลจำนวนมากใช้ราคาแบบแบ่งระดับตามขนาดบริบท: เมื่อ prompt ยาวเกินเกณฑ์ที่กำหนด ราคาต่อโทเค็นจะเพิ่มขึ้น เนื่องจากบริบทที่ยาวมีต้นทุนการให้บริการสูงกว่า
แม้แต่ใน หน้า Model Studio โมเดลอย่าง qwen3-max และ qwen3-coder-plus ก็มีราคาแยกตามช่วงความยาวบริบท แต่ qwen3.8-max แสดงเพียงช่วงเดียวคือ 0<Token≤1M
สำหรับนักพัฒนา ผลคือการคำนวณงบประมาณแบบเชิงเส้น:
ต้นทุน = (โทเค็นอินพุต × $2 / 1,000,000)
+ (โทเค็นเอาต์พุต × $6 / 1,000,000)
รูปแบบนี้เหมาะกับงานต่อไปนี้เป็นพิเศษ:
- RAG ที่ส่งเอกสารจำนวนมากเข้า prompt
- เอเจนต์ที่อ่าน codebase ขนาดใหญ่
- การวิเคราะห์เอกสารยาว
- เวิร์กโฟลว์ที่ส่ง schema หรือ tool definition เดิมซ้ำหลายครั้ง
ถูกกว่า Qwen 3.7-Max ที่ราคาปกติ
ราคา list price ของรุ่นก่อนหน้าและรุ่นใหม่มีดังนี้:
- Qwen 3.7-Max: อินพุต $2.50 / เอาต์พุต $7.50 ต่อ 1 ล้านโทเค็น
- Qwen 3.8-Max: อินพุต $2.00 / เอาต์พุต $6.00 ต่อ 1 ล้านโทเค็น
นั่นหมายถึง Qwen 3.8-Max ถูกลง 20% ทั้งอินพุตและเอาต์พุตเมื่อเทียบกับราคาปกติของ Qwen 3.7-Max
อย่างไรก็ตาม Qwen 3.7-Max มีโปรโมชั่นลด 50% ในขณะนี้ ทำให้เหลือ $1.25/$3.75 หาก workload ของคุณไม่ต้องใช้บริบท 1M, multimodal input หรือความสามารถ agentic ที่เพิ่มขึ้น รุ่นเดิมในราคาโปรโมชันอาจคุ้มค่ากว่าในระยะสั้น
สำหรับงบประมาณต่ำกว่า Qwen 3.7-Plus อยู่ที่ $0.4/$1.6 และยังมีส่วนลดโปรโมชันของตัวเอง
โทเค็นการคิดถูกเรียกเก็บเงินเป็นเอาต์พุต
Qwen 3.8-Max รองรับ reasoning_effort 3 ระดับ:
xhigh
medium
low
ค่าเริ่มต้นคือ xhigh ในโหมดนี้ โมเดลสามารถสร้างโทเค็นการให้เหตุผลก่อนตอบคำตอบสุดท้าย และโทเค็นดังกล่าวถูกนับรวมในเอาต์พุตที่ราคา $6 ต่อ 1M โทเค็น
ดังนั้นอย่าประเมินต้นทุนจากจำนวนโทเค็นของคำตอบที่มองเห็นได้เพียงอย่างเดียว ตัวอย่างเช่น คำตอบที่เห็นมี 800 โทเค็นอาจใช้โทเค็นการคิดอีกหลายพันโทเค็นสำหรับโจทย์ที่ซับซ้อน
แนวทางลดต้นทุน
- ใช้
mediumหรือlowสำหรับงานง่าย เช่น classification, extraction และ formatting - วัด
usageแยกตามประเภทงานก่อนประมาณการค่าใช้จ่ายรายเดือน - ติดตามเอาต์พุตอย่างใกล้ชิด เพราะมีราคาแพงกว่าอินพุต 3 เท่า
- จำกัด
max_tokensให้เหมาะกับงานเมื่อไม่จำเป็นต้องตอบยาว
ตัวอย่าง payload สำหรับงาน extraction ที่ไม่จำเป็นต้องใช้ reasoning สูง:
{
"model": "qwen3.8-max",
"reasoning_effort": "low",
"messages": [
{
"role": "user",
"content": "ดึงชื่อบริษัท อีเมล และประเทศจากข้อความนี้ในรูปแบบ JSON"
}
]
}
การแคชบริบท: cache hit ราคา 10%
หากแอปส่ง prompt prefix เดิมซ้ำ เช่น system prompt ยาว เอกสารที่คงที่ หรือ tool definitions การแคชบริบทช่วยลดค่าใช้จ่ายได้มาก
| สถานะ | ราคา |
|---|---|
| อินพุตปกติ | $2.00 / 1M โทเค็น |
| Cache hit | $0.20 / 1M โทเค็น |
| สร้างแคชโดยชัดแจ้ง | $2.50 / 1M โทเค็น |
กล่าวคือ:
- Cache hit มีค่าใช้จ่ายเพียง 10% ของอินพุตปกติ
- การสร้างแคช แพงกว่าอินพุตปกติ 25% เพียงครั้งเดียว
- หากนำ prefix เดิมมาใช้ซ้ำอย่างน้อย 2 ครั้ง การแคชเริ่มคุ้มทุน
ใช้แคชกับข้อมูลที่เปลี่ยนไม่บ่อย เช่น:
- system prompt
- เอกสารผลิตภัณฑ์
- API schema
- คำจำกัดความของเครื่องมือ
- policy หรือคู่มือภายใน
โควตาฟรี: 1 ล้านโทเค็นในสิงคโปร์ 90 วัน
Model Studio มีโควตาฟรีสำหรับ qwen3.8-max โดยมีเงื่อนไขดังนี้:
- ขนาด: 1 ล้านโทเค็น
- ภูมิภาค: สิงคโปร์เท่านั้น
- ระยะเวลา: 90 วันหลังเปิดใช้งาน
Endpoint ที่ต้องใช้คือ:
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
โควตานี้ใช้ไม่ได้กับปักกิ่งหรือ US-Virginia และโทเค็นการคิดก็นับรวมในโควตาด้วย งาน reasoning ที่ใช้ xhigh จึงอาจใช้โควตาหมดเร็วกว่าที่คาด
ดูตัวเลือกการเข้าถึงแบบไม่มีค่าใช้จ่ายเพิ่มเติมได้ใน วิธีใช้งาน Qwen 3.8 ฟรี
Qwen 3.8 เปรียบเทียบราคาอย่างไร
ตารางนี้ใช้ราคาปกติต่อ 1 ล้านโทเค็น และแยกราคาโปรโมชันไว้ในหมายเหตุ
| โมเดล | อินพุต | เอาต์พุต | หมายเหตุ |
|---|---|---|---|
| Qwen 3.8-Max | $2.00 | $6.00 | ราคาเดียวตลอดบริบท 1M; cache hit 10% |
| Qwen 3.7-Max | $2.50 | $7.50 | ปัจจุบันลด 50%: $1.25/$3.75 |
| Qwen 3.7-Plus | $0.40 | $1.60 | ปัจจุบันลด 20% |
| Kimi K3 | $3.00 | $15.00 | Cache hit $0.30 |
| Claude Opus 5 | $5.00 | $25.00 | |
| GPT-5.6 Terra | $2.00 | $12.00 |
ประเด็นที่นำไปตัดสินใจได้:
- เทียบกับ Kimi K3: Qwen 3.8-Max มีราคาอินพุตต่ำกว่าหนึ่งในสาม และเอาต์พุตถูกกว่า 60% โดย cache hit ของ Qwen อยู่ที่ $0.20 เทียบกับ $0.30 ของ K3 ดูรายละเอียดเพิ่มเติมใน คู่มือ Kimi K3 API
- เทียบกับ Claude Opus 5: Qwen ถูกกว่า 60% สำหรับอินพุต และ 76% สำหรับเอาต์พุต
- เทียบกับ GPT-5.6 Terra: ราคาอินพุตเท่ากันที่ $2 แต่ Qwen มีราคาเอาต์พุตเพียงครึ่งเดียว
ราคาไม่ใช่ตัวแทนคุณภาพทั้งหมด แต่หาก workload ของคุณเน้นเอาต์พุตยาวหรือ reasoning ต้นทุนเอาต์พุตที่ต่ำกว่าจะส่งผลโดยตรงต่องบประมาณ
ตัวอย่างคำนวณต้นทุนจริง
ตัวอย่างที่ 1: เซสชันเอเจนต์ 50K โทเค็น
สมมติว่าเซสชันหนึ่งใช้:
- อินพุต 38,000 โทเค็น
- เอาต์พุต 12,000 โทเค็น
คำนวณต้นทุน:
อินพุต = 38,000 × $2 / 1,000,000 = $0.076
เอาต์พุต = 12,000 × $6 / 1,000,000 = $0.072
รวม = $0.148
ต้นทุนอยู่ที่ประมาณ $0.15 ต่อเซสชัน
หาก xhigh เพิ่มโทเค็นการคิด 8,000 โทเค็น:
เอาต์พุตรวม = 20,000 โทเค็น
เอาต์พุต = 20,000 × $6 / 1,000,000 = $0.12
รวม = $0.076 + $0.12 = $0.196
ต้นทุนเพิ่มเป็นประมาณ $0.20 ต่อเซสชัน หรือเพิ่มขึ้นราว 33%
ตัวอย่างที่ 2: วิเคราะห์เอกสารยาว 800K โทเค็น
สมมติว่าโหลดเอกสาร 800,000 โทเค็น และขอสรุป 5,000 โทเค็น:
อินพุต = 800,000 × $2 / 1,000,000 = $1.60
เอาต์พุต = 5,000 × $6 / 1,000,000 = $0.03
รวม = $1.63
ต้นทุนคือประมาณ $1.63 ต่อการวิเคราะห์หนึ่งครั้ง โดยไม่มีค่าปรับจากการอยู่ใกล้ขีดจำกัดบริบท 1M
ตัวอย่างที่ 3: system prompt ที่แคชไว้ 100K โทเค็น จำนวน 50 คำขอต่อวัน
สมมติว่าแต่ละคำขอใช้ prefix เดิมขนาด 100,000 โทเค็น
หากไม่ใช้แคช:
100,000 × $2 / 1,000,000 = $0.20 ต่อคำขอ
$0.20 × 50 = $10.00 ต่อวัน
หากใช้ explicit cache:
ค่าเขียนแคช = 100,000 × $2.50 / 1,000,000 = $0.25
cache hit 49 ครั้ง = 49 × (100,000 × $0.20 / 1,000,000)
= $0.98
รวมต่อวัน = $1.23
ต้นทุนลดจาก $10.00 เหลือประมาณ $1.23 ต่อวัน หรือประหยัดราว 88%
สร้างโมเดลต้นทุนจาก usage ที่วัดได้
อย่าประมาณค่าใช้จ่ายจาก prompt length เพียงอย่างเดียว โดยเฉพาะเมื่อใช้ reasoning ให้วัด usage ของคำขอจริงสำหรับแต่ละ workload
ขั้นตอนแนะนำ:
- เตรียม API key และ endpoint สำหรับภูมิภาคที่ใช้งาน
- ส่งคำขอที่เป็นตัวแทนของแต่ละประเภทงาน
- รันแต่ละประเภทงานอย่างน้อย 10 ครั้ง
- เก็บค่าเฉลี่ยของ input, output และ reasoning tokens จาก
usage - คูณด้วยอัตรา $2/$6
- เปรียบเทียบต้นทุนและคุณภาพระหว่าง
low,mediumและxhigh
โครงสร้างการคำนวณสามารถเขียนได้ดังนี้:
function estimateCost(inputTokens, outputTokens) {
const inputCost = (inputTokens / 1_000_000) * 2;
const outputCost = (outputTokens / 1_000_000) * 6;
return {
inputCost,
outputCost,
totalCost: inputCost + outputCost
};
}
console.log(estimateCost(38_000, 20_000));
// { inputCost: 0.076, outputCost: 0.12, totalCost: 0.196 }
ใน Apidog ให้บันทึก base URL ของแต่ละภูมิภาคเป็น environment จากนั้นส่ง prompt เดิมด้วย reasoning_effort หลายระดับและอ่านค่า usage จาก response inspector โดยตรง
ดูการตั้งค่า API และ endpoint ที่รองรับได้ใน คู่มือ Qwen 3.8 API และสามารถ ดาวน์โหลด Apidog เพื่อเริ่มวัดต้นทุนของ workload จริงได้
สรุป
Qwen 3.8-Max ราคา $2/$6 เป็นอัตราที่แข่งขันได้สำหรับโมเดลระดับเรือธง โดยมีจุดเด่นสำคัญคือ:
- ราคาปกติถูกกว่า Qwen 3.7-Max
- เอาต์พุตถูกกว่า GPT-5.6 Terra ครึ่งหนึ่ง
- ใช้อัตราเดียวตลอดบริบท 1M โทเค็น
- cache hit คิดเพียง 10% ของราคาอินพุต
- เหมาะกับ workload ที่มีบริบทยาวหรือใช้ prefix ซ้ำบ่อย
ข้อควรระวังคือ reasoning_effort: xhigh สามารถเพิ่มต้นทุนเอาต์พุตได้มาก และข้อเสนออย่างส่วนลด Qwen 3.7-Max หรือโควตาฟรีสิงคโปร์อาจมีระยะเวลาจำกัด
ก่อนนำไปใช้งานจริง ให้ทดสอบ prompt ของคุณเอง ตรวจสอบ usage และเลือก reasoning_effort ตามความซับซ้อนของงาน
คำถามที่พบบ่อย
Qwen 3.8 มีค่าใช้จ่ายสูงขึ้นสำหรับ prompt ที่ยาวหรือไม่?
ไม่ ราคาอย่างเป็นทางการ ระบุอัตราเดียวตั้งแต่ 0 ถึง 1 ล้านโทเค็น ดังนั้น prompt ขนาด 900K โทเค็นจะใช้อัตราอินพุต $2 ต่อ 1M โทเค็นเช่นเดียวกับ prompt สั้น ต่างจากโมเดลที่มีราคาแบบแบ่งระดับ รวมถึงบางโมเดลใน รายการโมเดล Model Studio
โทเค็นการคิดมีค่าใช้จ่ายเพิ่มเติมใน Qwen 3.8 หรือไม่?
ไม่มีอัตรา reasoning แยกต่างหาก โหมดคิดและไม่คิดใช้ราคา $2/$6 เท่ากัน แต่โทเค็นการคิดถูกนับรวมเป็นเอาต์พุตในอัตรา $6 ต่อ 1M โทเค็น เนื่องจากค่าเริ่มต้นคือ reasoning_effort: xhigh งานที่ต้องให้เหตุผลมากจึงอาจมีต้นทุนสูงกว่าที่คำตอบที่มองเห็นได้แสดง
มีวิธีทดลองใช้ Qwen 3.8 ฟรีหรือไม่?
มี Model Studio ให้โควตาฟรี 1 ล้านโทเค็น เป็นเวลา 90 วัน สำหรับ endpoint ในภูมิภาคสิงคโปร์เท่านั้น นอกจากนี้ Qwen Chat ยังเข้าถึงได้ผ่านเบราว์เซอร์ ดูรายละเอียดใน วิธีใช้งาน Qwen 3.8 ฟรี
ราคา “10% preview pricing” ยังใช้ได้อยู่หรือไม่?
ไม่ ราคา 10% เป็นโปรโมชั่นช่วงพรีวิวในเดือนกรกฎาคม 2026 หลังเปิดให้บริการทั่วไป ตารางอัตรามาตรฐานคือ $2/$6 ให้ตรวจสอบ หน้าราคา Model Studio เป็นแหล่งข้อมูลล่าสุดเสมอ
Top comments (0)