DEV Community

Cover image for Qwen 3.8 อัตราค่าบริการ: $2 อินพุต / $6 เอาต์พุต สำหรับบริบท 1M
Thanawat Wongchai
Thanawat Wongchai

Posted on • Originally published at apidog.com

Qwen 3.8 อัตราค่าบริการ: $2 อินพุต / $6 เอาต์พุต สำหรับบริบท 1M

Alibaba เปิดตัว Qwen 3.8-Max ในช่วงต้นเดือนสิงหาคม 2026 และตอนนี้มีราคาสำหรับการใช้งานทั่วไปอย่างเป็นทางการแล้ว หลังสิ้นสุดช่วงพรีวิวที่มีข่าวเรื่องส่วนลด 10% หน้าราคา Model Studio อย่างเป็นทางการ ระบุว่า qwen3.8-max คิดราคา $2 ต่อ 1 ล้านโทเค็นอินพุต และ $6 ต่อ 1 ล้านโทเค็นเอาต์พุต โดยใช้อัตราเดียวตลอดหน้าต่างบริบทสูงสุด 1 ล้านโทเค็น

ลองใช้ Apidog วันนี้

จุดเด่นคือไม่มีการปรับราคาเป็นขั้นตามความยาวบริบท: ไม่ว่าจะส่ง prompt 5,000 หรือ 900,000 โทเค็น อัตรายังคงเป็น $2/$6 บทความนี้อธิบายวิธีคำนวณต้นทุนจริง การใช้แคช การตั้งค่า reasoning_effort และการทดสอบ usage ก่อนนำไปใช้งานจริง สำหรับภาพรวมโมเดล อ่าน Qwen 3.8 คืออะไร และทำไมจึงสำคัญ ก่อน

ราคาหน้าตารางไม่ใช่ต้นทุนสุดท้ายเสมอไป เพราะ Qwen 3.8-Max ใช้ reasoning_effort: xhigh เป็นค่าเริ่มต้น และโทเค็นการคิดถูกคิดเป็นเอาต์พุต วิธีที่แม่นยำที่สุดคือส่งคำขอจริงและตรวจสอบ usage จาก response โดย Apidog ช่วยให้ตรวจสอบ token breakdown ของแต่ละคำขอได้ระหว่างทดสอบ

ตัวเลข GA: อินพุต $2, เอาต์พุต $6, หนึ่งระดับราคา

ตารางต่อไปนี้อ้างอิงจาก หน้าราคา Model Studio ณ วันที่ 3 สิงหาคม 2026

รายการ ราคา (ต่อ 1 ล้านโทเค็น)
อินพุต $2.00
เอาต์พุต รวมโทเค็นการคิด $6.00
อินพุตที่แคชไว้ (cache hit) 10% ของอัตราอินพุต
การสร้างแคชโดยชัดแจ้ง 125% ของอัตราอินพุต
ระดับบริบท ระดับเดียว: 0 ถึง 1 ล้านโทเค็น
โหมดคิดและไม่คิด อัตราเดียวกัน

สิ่งที่ควรนำไปใช้ในโมเดลต้นทุนมี 3 ข้อ:

  1. ไม่มีค่าปรับสำหรับ prompt ยาว ภายในบริบท 1M โทเค็น
  2. โทเค็นการคิดคิดราคาเป็นเอาต์พุต แม้อัตราของโหมดคิดและไม่คิดจะเท่ากัน
  3. เอาต์พุตสูงสุดคือ 65,536 โทเค็นต่อคำขอ ดังนั้นค่าเอาต์พุตสูงสุดต่อคำขออยู่ที่ประมาณ $0.39

ประกาศอย่างเป็นทางการของ Qwen 3.8 ระบุว่าโมเดลมีพารามิเตอร์ทั้งหมด 2.4 ล้านล้านตัว มี 95 พันล้านตัวที่ทำงานอยู่ รองรับบริบท 1 ล้านโทเค็น และรับอินพุตแบบ multimodal

เหตุใดราคาเดียวตลอด 1 ล้านโทเค็นจึงสำคัญ

โมเดลจำนวนมากใช้ราคาแบบแบ่งระดับตามขนาดบริบท: เมื่อ prompt ยาวเกินเกณฑ์ที่กำหนด ราคาต่อโทเค็นจะเพิ่มขึ้น เนื่องจากบริบทที่ยาวมีต้นทุนการให้บริการสูงกว่า

แม้แต่ใน หน้า Model Studio โมเดลอย่าง qwen3-max และ qwen3-coder-plus ก็มีราคาแยกตามช่วงความยาวบริบท แต่ qwen3.8-max แสดงเพียงช่วงเดียวคือ 0<Token≤1M

สำหรับนักพัฒนา ผลคือการคำนวณงบประมาณแบบเชิงเส้น:

ต้นทุน = (โทเค็นอินพุต × $2 / 1,000,000)
       + (โทเค็นเอาต์พุต × $6 / 1,000,000)
Enter fullscreen mode Exit fullscreen mode

รูปแบบนี้เหมาะกับงานต่อไปนี้เป็นพิเศษ:

  • RAG ที่ส่งเอกสารจำนวนมากเข้า prompt
  • เอเจนต์ที่อ่าน codebase ขนาดใหญ่
  • การวิเคราะห์เอกสารยาว
  • เวิร์กโฟลว์ที่ส่ง schema หรือ tool definition เดิมซ้ำหลายครั้ง

ถูกกว่า Qwen 3.7-Max ที่ราคาปกติ

ราคา list price ของรุ่นก่อนหน้าและรุ่นใหม่มีดังนี้:

  • Qwen 3.7-Max: อินพุต $2.50 / เอาต์พุต $7.50 ต่อ 1 ล้านโทเค็น
  • Qwen 3.8-Max: อินพุต $2.00 / เอาต์พุต $6.00 ต่อ 1 ล้านโทเค็น

นั่นหมายถึง Qwen 3.8-Max ถูกลง 20% ทั้งอินพุตและเอาต์พุตเมื่อเทียบกับราคาปกติของ Qwen 3.7-Max

อย่างไรก็ตาม Qwen 3.7-Max มีโปรโมชั่นลด 50% ในขณะนี้ ทำให้เหลือ $1.25/$3.75 หาก workload ของคุณไม่ต้องใช้บริบท 1M, multimodal input หรือความสามารถ agentic ที่เพิ่มขึ้น รุ่นเดิมในราคาโปรโมชันอาจคุ้มค่ากว่าในระยะสั้น

สำหรับงบประมาณต่ำกว่า Qwen 3.7-Plus อยู่ที่ $0.4/$1.6 และยังมีส่วนลดโปรโมชันของตัวเอง

โทเค็นการคิดถูกเรียกเก็บเงินเป็นเอาต์พุต

Qwen 3.8-Max รองรับ reasoning_effort 3 ระดับ:

xhigh
medium
low
Enter fullscreen mode Exit fullscreen mode

ค่าเริ่มต้นคือ xhigh ในโหมดนี้ โมเดลสามารถสร้างโทเค็นการให้เหตุผลก่อนตอบคำตอบสุดท้าย และโทเค็นดังกล่าวถูกนับรวมในเอาต์พุตที่ราคา $6 ต่อ 1M โทเค็น

ดังนั้นอย่าประเมินต้นทุนจากจำนวนโทเค็นของคำตอบที่มองเห็นได้เพียงอย่างเดียว ตัวอย่างเช่น คำตอบที่เห็นมี 800 โทเค็นอาจใช้โทเค็นการคิดอีกหลายพันโทเค็นสำหรับโจทย์ที่ซับซ้อน

แนวทางลดต้นทุน

  • ใช้ medium หรือ low สำหรับงานง่าย เช่น classification, extraction และ formatting
  • วัด usage แยกตามประเภทงานก่อนประมาณการค่าใช้จ่ายรายเดือน
  • ติดตามเอาต์พุตอย่างใกล้ชิด เพราะมีราคาแพงกว่าอินพุต 3 เท่า
  • จำกัด max_tokens ให้เหมาะกับงานเมื่อไม่จำเป็นต้องตอบยาว

ตัวอย่าง payload สำหรับงาน extraction ที่ไม่จำเป็นต้องใช้ reasoning สูง:

{
  "model": "qwen3.8-max",
  "reasoning_effort": "low",
  "messages": [
    {
      "role": "user",
      "content": "ดึงชื่อบริษัท อีเมล และประเทศจากข้อความนี้ในรูปแบบ JSON"
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

การแคชบริบท: cache hit ราคา 10%

หากแอปส่ง prompt prefix เดิมซ้ำ เช่น system prompt ยาว เอกสารที่คงที่ หรือ tool definitions การแคชบริบทช่วยลดค่าใช้จ่ายได้มาก

สถานะ ราคา
อินพุตปกติ $2.00 / 1M โทเค็น
Cache hit $0.20 / 1M โทเค็น
สร้างแคชโดยชัดแจ้ง $2.50 / 1M โทเค็น

กล่าวคือ:

  • Cache hit มีค่าใช้จ่ายเพียง 10% ของอินพุตปกติ
  • การสร้างแคช แพงกว่าอินพุตปกติ 25% เพียงครั้งเดียว
  • หากนำ prefix เดิมมาใช้ซ้ำอย่างน้อย 2 ครั้ง การแคชเริ่มคุ้มทุน

ใช้แคชกับข้อมูลที่เปลี่ยนไม่บ่อย เช่น:

  • system prompt
  • เอกสารผลิตภัณฑ์
  • API schema
  • คำจำกัดความของเครื่องมือ
  • policy หรือคู่มือภายใน

โควตาฟรี: 1 ล้านโทเค็นในสิงคโปร์ 90 วัน

Model Studio มีโควตาฟรีสำหรับ qwen3.8-max โดยมีเงื่อนไขดังนี้:

  • ขนาด: 1 ล้านโทเค็น
  • ภูมิภาค: สิงคโปร์เท่านั้น
  • ระยะเวลา: 90 วันหลังเปิดใช้งาน

Endpoint ที่ต้องใช้คือ:

https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode

โควตานี้ใช้ไม่ได้กับปักกิ่งหรือ US-Virginia และโทเค็นการคิดก็นับรวมในโควตาด้วย งาน reasoning ที่ใช้ xhigh จึงอาจใช้โควตาหมดเร็วกว่าที่คาด

ดูตัวเลือกการเข้าถึงแบบไม่มีค่าใช้จ่ายเพิ่มเติมได้ใน วิธีใช้งาน Qwen 3.8 ฟรี

Qwen 3.8 เปรียบเทียบราคาอย่างไร

ตารางนี้ใช้ราคาปกติต่อ 1 ล้านโทเค็น และแยกราคาโปรโมชันไว้ในหมายเหตุ

โมเดล อินพุต เอาต์พุต หมายเหตุ
Qwen 3.8-Max $2.00 $6.00 ราคาเดียวตลอดบริบท 1M; cache hit 10%
Qwen 3.7-Max $2.50 $7.50 ปัจจุบันลด 50%: $1.25/$3.75
Qwen 3.7-Plus $0.40 $1.60 ปัจจุบันลด 20%
Kimi K3 $3.00 $15.00 Cache hit $0.30
Claude Opus 5 $5.00 $25.00
GPT-5.6 Terra $2.00 $12.00

ประเด็นที่นำไปตัดสินใจได้:

  • เทียบกับ Kimi K3: Qwen 3.8-Max มีราคาอินพุตต่ำกว่าหนึ่งในสาม และเอาต์พุตถูกกว่า 60% โดย cache hit ของ Qwen อยู่ที่ $0.20 เทียบกับ $0.30 ของ K3 ดูรายละเอียดเพิ่มเติมใน คู่มือ Kimi K3 API
  • เทียบกับ Claude Opus 5: Qwen ถูกกว่า 60% สำหรับอินพุต และ 76% สำหรับเอาต์พุต
  • เทียบกับ GPT-5.6 Terra: ราคาอินพุตเท่ากันที่ $2 แต่ Qwen มีราคาเอาต์พุตเพียงครึ่งเดียว

ราคาไม่ใช่ตัวแทนคุณภาพทั้งหมด แต่หาก workload ของคุณเน้นเอาต์พุตยาวหรือ reasoning ต้นทุนเอาต์พุตที่ต่ำกว่าจะส่งผลโดยตรงต่องบประมาณ

ตัวอย่างคำนวณต้นทุนจริง

ตัวอย่างที่ 1: เซสชันเอเจนต์ 50K โทเค็น

สมมติว่าเซสชันหนึ่งใช้:

  • อินพุต 38,000 โทเค็น
  • เอาต์พุต 12,000 โทเค็น

คำนวณต้นทุน:

อินพุต  = 38,000 × $2 / 1,000,000 = $0.076
เอาต์พุต = 12,000 × $6 / 1,000,000 = $0.072
รวม     = $0.148
Enter fullscreen mode Exit fullscreen mode

ต้นทุนอยู่ที่ประมาณ $0.15 ต่อเซสชัน

หาก xhigh เพิ่มโทเค็นการคิด 8,000 โทเค็น:

เอาต์พุตรวม = 20,000 โทเค็น
เอาต์พุต    = 20,000 × $6 / 1,000,000 = $0.12
รวม         = $0.076 + $0.12 = $0.196
Enter fullscreen mode Exit fullscreen mode

ต้นทุนเพิ่มเป็นประมาณ $0.20 ต่อเซสชัน หรือเพิ่มขึ้นราว 33%

ตัวอย่างที่ 2: วิเคราะห์เอกสารยาว 800K โทเค็น

สมมติว่าโหลดเอกสาร 800,000 โทเค็น และขอสรุป 5,000 โทเค็น:

อินพุต  = 800,000 × $2 / 1,000,000 = $1.60
เอาต์พุต = 5,000 × $6 / 1,000,000 = $0.03
รวม     = $1.63
Enter fullscreen mode Exit fullscreen mode

ต้นทุนคือประมาณ $1.63 ต่อการวิเคราะห์หนึ่งครั้ง โดยไม่มีค่าปรับจากการอยู่ใกล้ขีดจำกัดบริบท 1M

ตัวอย่างที่ 3: system prompt ที่แคชไว้ 100K โทเค็น จำนวน 50 คำขอต่อวัน

สมมติว่าแต่ละคำขอใช้ prefix เดิมขนาด 100,000 โทเค็น

หากไม่ใช้แคช:

100,000 × $2 / 1,000,000 = $0.20 ต่อคำขอ
$0.20 × 50 = $10.00 ต่อวัน
Enter fullscreen mode Exit fullscreen mode

หากใช้ explicit cache:

ค่าเขียนแคช  = 100,000 × $2.50 / 1,000,000 = $0.25
cache hit 49 ครั้ง = 49 × (100,000 × $0.20 / 1,000,000)
                  = $0.98
รวมต่อวัน = $1.23
Enter fullscreen mode Exit fullscreen mode

ต้นทุนลดจาก $10.00 เหลือประมาณ $1.23 ต่อวัน หรือประหยัดราว 88%

สร้างโมเดลต้นทุนจาก usage ที่วัดได้

อย่าประมาณค่าใช้จ่ายจาก prompt length เพียงอย่างเดียว โดยเฉพาะเมื่อใช้ reasoning ให้วัด usage ของคำขอจริงสำหรับแต่ละ workload

ขั้นตอนแนะนำ:

  1. เตรียม API key และ endpoint สำหรับภูมิภาคที่ใช้งาน
  2. ส่งคำขอที่เป็นตัวแทนของแต่ละประเภทงาน
  3. รันแต่ละประเภทงานอย่างน้อย 10 ครั้ง
  4. เก็บค่าเฉลี่ยของ input, output และ reasoning tokens จาก usage
  5. คูณด้วยอัตรา $2/$6
  6. เปรียบเทียบต้นทุนและคุณภาพระหว่าง low, medium และ xhigh

โครงสร้างการคำนวณสามารถเขียนได้ดังนี้:

function estimateCost(inputTokens, outputTokens) {
  const inputCost = (inputTokens / 1_000_000) * 2;
  const outputCost = (outputTokens / 1_000_000) * 6;

  return {
    inputCost,
    outputCost,
    totalCost: inputCost + outputCost
  };
}

console.log(estimateCost(38_000, 20_000));
// { inputCost: 0.076, outputCost: 0.12, totalCost: 0.196 }
Enter fullscreen mode Exit fullscreen mode

ใน Apidog ให้บันทึก base URL ของแต่ละภูมิภาคเป็น environment จากนั้นส่ง prompt เดิมด้วย reasoning_effort หลายระดับและอ่านค่า usage จาก response inspector โดยตรง

ดูการตั้งค่า API และ endpoint ที่รองรับได้ใน คู่มือ Qwen 3.8 API และสามารถ ดาวน์โหลด Apidog เพื่อเริ่มวัดต้นทุนของ workload จริงได้

สรุป

Qwen 3.8-Max ราคา $2/$6 เป็นอัตราที่แข่งขันได้สำหรับโมเดลระดับเรือธง โดยมีจุดเด่นสำคัญคือ:

  • ราคาปกติถูกกว่า Qwen 3.7-Max
  • เอาต์พุตถูกกว่า GPT-5.6 Terra ครึ่งหนึ่ง
  • ใช้อัตราเดียวตลอดบริบท 1M โทเค็น
  • cache hit คิดเพียง 10% ของราคาอินพุต
  • เหมาะกับ workload ที่มีบริบทยาวหรือใช้ prefix ซ้ำบ่อย

ข้อควรระวังคือ reasoning_effort: xhigh สามารถเพิ่มต้นทุนเอาต์พุตได้มาก และข้อเสนออย่างส่วนลด Qwen 3.7-Max หรือโควตาฟรีสิงคโปร์อาจมีระยะเวลาจำกัด

ก่อนนำไปใช้งานจริง ให้ทดสอบ prompt ของคุณเอง ตรวจสอบ usage และเลือก reasoning_effort ตามความซับซ้อนของงาน

คำถามที่พบบ่อย

Qwen 3.8 มีค่าใช้จ่ายสูงขึ้นสำหรับ prompt ที่ยาวหรือไม่?

ไม่ ราคาอย่างเป็นทางการ ระบุอัตราเดียวตั้งแต่ 0 ถึง 1 ล้านโทเค็น ดังนั้น prompt ขนาด 900K โทเค็นจะใช้อัตราอินพุต $2 ต่อ 1M โทเค็นเช่นเดียวกับ prompt สั้น ต่างจากโมเดลที่มีราคาแบบแบ่งระดับ รวมถึงบางโมเดลใน รายการโมเดล Model Studio

โทเค็นการคิดมีค่าใช้จ่ายเพิ่มเติมใน Qwen 3.8 หรือไม่?

ไม่มีอัตรา reasoning แยกต่างหาก โหมดคิดและไม่คิดใช้ราคา $2/$6 เท่ากัน แต่โทเค็นการคิดถูกนับรวมเป็นเอาต์พุตในอัตรา $6 ต่อ 1M โทเค็น เนื่องจากค่าเริ่มต้นคือ reasoning_effort: xhigh งานที่ต้องให้เหตุผลมากจึงอาจมีต้นทุนสูงกว่าที่คำตอบที่มองเห็นได้แสดง

มีวิธีทดลองใช้ Qwen 3.8 ฟรีหรือไม่?

มี Model Studio ให้โควตาฟรี 1 ล้านโทเค็น เป็นเวลา 90 วัน สำหรับ endpoint ในภูมิภาคสิงคโปร์เท่านั้น นอกจากนี้ Qwen Chat ยังเข้าถึงได้ผ่านเบราว์เซอร์ ดูรายละเอียดใน วิธีใช้งาน Qwen 3.8 ฟรี

ราคา “10% preview pricing” ยังใช้ได้อยู่หรือไม่?

ไม่ ราคา 10% เป็นโปรโมชั่นช่วงพรีวิวในเดือนกรกฎาคม 2026 หลังเปิดให้บริการทั่วไป ตารางอัตรามาตรฐานคือ $2/$6 ให้ตรวจสอบ หน้าราคา Model Studio เป็นแหล่งข้อมูลล่าสุดเสมอ

Top comments (0)