Kimi K3 เปิดตัวเมื่อวันที่ 16 กรกฎาคม 2026 พร้อมตารางราคาที่ดูเรียบง่าย: อินพุตแบบ cache-hit ราคา $0.30 ต่อ 1 ล้านโทเค็น, cache-miss ราคา $3.00 และเอาต์พุตราคา $15.00 แต่ตัวเลขที่กำหนดค่าใช้จ่ายจริงคือ อัตราอินพุตแบบผสม (blended input rate) ที่เกิดจาก cache-hit ของปริมาณงานคุณเอง สำหรับงานเขียนโค้ดที่แคชได้ดี ต้นทุนมักใกล้ $0.30 มากกว่า $3.00 บทความนี้จะแสดงวิธีคำนวณต้นทุนจริงต่อภารกิจ วิธีวัด cache-hit rate และเปรียบเทียบกับ Claude Opus 4.8, GPT-5.6 Sol และ DeepSeek V4
TL;DR
Kimi K3 คิดราคา:
| ประเภทโทเค็น | ราคาต่อ 1 ล้านโทเค็น |
|---|---|
| อินพุตแบบ cache-hit | $0.30 |
| อินพุตแบบ cache-miss | $3.00 |
| เอาต์พุต | $15.00 |
Moonshot รายงานว่า Kimi K3 ซึ่งทำงานบนสถาปัตยกรรมอนุมานแบบกระจายของ Mooncake มี cache-hit rate มากกว่า 90% สำหรับงานเขียนโค้ด หากปริมาณงานของคุณมีโครงสร้างพร้อมต์ที่คงที่ ต้นทุนอินพุตจริงจึงอาจอยู่ราว $0.57 ต่อ 1 ล้านโทเค็น แทนที่จะเป็น $3.00
ข้อสรุปสำหรับการควบคุมต้นทุน:
- รักษา system prompt, tool schema และ context prefix ให้คงที่เพื่อเพิ่ม cache-hit
- จำกัดความยาวเอาต์พุตด้วย
max_tokens - ขอเฉพาะ diff, patch หรือคำตอบที่ต้องใช้จริง
- วัดค่า usage จริงจากการตอบกลับ แทนการอิงตัวเลข cache-hit ที่รายงานโดยผู้ให้บริการ
คุณสามารถตรวจสอบการแบ่ง cache-hit จาก usage object ของแต่ละคำขอผ่าน Apidog ได้ขณะทดสอบโมเดล
ราคาตามป้ายในตารางเดียว
Moonshot เผยแพร่ราคาสำหรับโมเดล kimi-k3 ดังนี้:
| ประเภทโทเค็น | ราคาต่อ 1 ล้านโทเค็น |
|---|---|
| อินพุตแบบ Cache-hit | $0.30 |
| อินพุตแบบ Cache-miss | $3.00 |
| เอาต์พุต | $15.00 |
ส่วนต่างของราคาคือประเด็นสำคัญ:
- cache-miss แพงกว่า cache-hit 10 เท่า
- เอาต์พุตแพงกว่า cache-miss 5 เท่า
- เอาต์พุตแพงกว่า cache-hit 50 เท่า
หากคุณคิดว่าอินพุตทุกโทเค็นถูกคิดที่ $3.00 คุณอาจประเมินต้นทุนสูงเกินจริงมาก สำหรับงานที่ใช้ context เดิมซ้ำหลายรอบ ในทางกลับกัน หากมองว่าเอาต์พุตเป็นค่าใช้จ่ายเล็กน้อย คุณอาจพลาดจุดที่ทำให้บิลสูงที่สุด
อ่านภาพรวมของโมเดลได้ที่ คำอธิบาย Kimi K3 ของเรา และดูการตั้งค่า request, base URL และ SDK ได้ใน คู่มือ API ของ Kimi K3
ทำไมราคา cache-hit จึงเปลี่ยนการคำนวณ
Prompt caching คือสิ่งที่ทำให้ราคาตามป้ายต่างจากราคาที่จ่ายจริง
เมื่อส่งคำขอ ผู้ให้บริการจะเก็บ prefix ของพร้อมต์ที่ผ่านการแปลงเป็นโทเค็นแล้ว หากคำขอถัดไปใช้ prefix เดิม ระบบสามารถอ่านจากแคชแทนการประมวลผลใหม่ โทเค็นส่วนนั้นจึงถูกคิดในอัตรา cache-hit ที่ $0.30 แทน cache-miss ที่ $3.00
Moonshot ให้บริการ Kimi K3 ผ่าน Mooncake ซึ่งแยกขั้นตอน prefill และ decode เพื่อให้ reuse prefix ที่แคชไว้ได้อย่างมีประสิทธิภาพ บริษัทระบุว่า cache-hit rate สำหรับงานเขียนโค้ดสูงกว่า 90%
สูตรคำนวณอัตราอินพุตแบบผสม
กำหนดให้:
-
H= cache-hit rate -
P_hit= ราคา cache-hit -
P_miss= ราคา cache-miss
สูตรคือ:
blended_input_rate = (H × P_hit) + ((1 - H) × P_miss)
หาก cache-hit rate เท่ากับ 90%:
(0.90 × $0.30) + (0.10 × $3.00)
= $0.27 + $0.30
= $0.57 ต่อ 1 ล้านโทเค็นอินพุต
หากเพิ่ม cache-hit rate เป็น 95%:
(0.95 × $0.30) + (0.05 × $3.00)
= $0.285 + $0.15
= $0.435 ต่อ 1 ล้านโทเค็นอินพุต
ค่า 90% เป็นตัวเลขที่ Moonshot รายงานสำหรับงานเขียนโค้ด ไม่ใช่ค่าที่รับประกันสำหรับทุกระบบ อัตราจริงขึ้นกับความคงที่ของ prompt prefix:
- เอเจนต์ที่ส่ง repo context, system prompt และ tool definitions เดิมซ้ำ ๆ มักแคชได้ดี
- แชตที่เปลี่ยนโครงสร้าง prompt หรือเรียง context ใหม่เกือบทุกครั้ง มักมี cache-hit ต่ำกว่า
ดังนั้นควรวัดจากคำขอจริงก่อนใช้ตัวเลขนี้ในการวางงบประมาณ
ตัวอย่างต้นทุนจริง: งานเขียนโค้ดแบบ agentic หนึ่งงาน
สมมติว่าเซสชันเขียนโค้ดแบบ agentic หนึ่งครั้งมีการใช้:
- อินพุตรวม: 2,000,000 โทเค็น
- เอาต์พุตรวม: 200,000 โทเค็น
ปริมาณอินพุตอาจสูงเพราะเอเจนต์ส่ง context ของ repository ซ้ำในหลายรอบ
กรณีไม่มีการแคช
อินพุต: 2,000,000 × $3.00 / 1,000,000 = $6.00
เอาต์พุต: 200,000 × $15.00 / 1,000,000 = $3.00
รวม = $9.00
กรณี cache-hit 90%
Cache-hit input:
1,800,000 × $0.30 / 1,000,000 = $0.54
Cache-miss input:
200,000 × $3.00 / 1,000,000 = $0.60
อินพุตรวม = $1.14
เอาต์พุต:
200,000 × $15.00 / 1,000,000 = $3.00
รวม = $4.14
การแคชช่วยลดค่าอินพุตจาก $6.00 เหลือ $1.14 และลดต้นทุนรวมจาก $9.00 เหลือ $4.14 หรือประมาณ 54%
สิ่งที่ไม่เปลี่ยนคือค่าเอาต์พุต: ยังอยู่ที่ $3.00 ในทั้งสองกรณี เพราะคุณไม่สามารถแคชข้อความที่โมเดลยังไม่ได้สร้างได้
อินพุตมีราคาถูก เอาต์พุตคือราคาพรีเมียม
สำหรับ Kimi K3 กลยุทธ์ควบคุมค่าใช้จ่ายควรเน้นที่เอาต์พุตมากกว่าอินพุต:
- เอาต์พุต $15.00 ต่อ 1 ล้านโทเค็น
- cache-miss input $3.00 ต่อ 1 ล้านโทเค็น
- cache-hit input $0.30 ต่อ 1 ล้านโทเค็น
สิ่งที่ควรทำ
ตั้ง
max_tokensให้เหมาะสม
จำกัดเอาต์พุตสูงสุดตามประเภทงาน เช่น งานสร้าง patch ไม่จำเป็นต้องเปิดเพดานเท่ากับงานสร้างเอกสารระบุรูปแบบคำตอบให้ชัดเจน
ขอเฉพาะสิ่งที่จำเป็น เช่น:
ส่งเฉพาะ unified diff
ห้ามอธิบายขั้นตอน
จำกัดคำตอบไม่เกิน 300 โทเค็น
รักษา prefix ให้เสถียร
อย่าสลับลำดับ system prompt, tool definitions หรือ context block โดยไม่จำเป็น เพราะการเปลี่ยนเพียงเล็กน้อยอาจทำให้ cache-hit ลดลงรวมงานที่เกี่ยวข้องไว้ภายใต้ warm prefix เดียวกัน
หากเอเจนต์ต้องตรวจหลายไฟล์ใน repository เดียวกัน ให้ reuse context เดิมแทนการสร้าง prompt ใหม่ทุกคำขอ
สิ่งที่อาจไม่ช่วยเท่าที่คิด
การตัดอินพุตเพื่อประหยัดเงินอาจไม่คุ้มเสมอไป เพราะอินพุตที่แคชแล้วมีราคาถูกอยู่แล้ว และ context ที่น้อยเกินไปอาจทำให้โมเดล:
- ถามคำถามเพิ่ม
- สร้างคำตอบที่ไม่แม่นยำ
- ส่งเอาต์พุตยาวขึ้นเพื่อชดเชยข้อมูลที่ขาด
สำหรับโมเดลที่มีโครงสร้างราคาแบบ Kimi K3 การส่ง context ที่มีประโยชน์และควบคุมเอาต์พุตให้กระชับ มักคุ้มกว่า
จุดอ้างอิงราคา: Kimi K3 เปรียบเทียบเป็นอย่างไร
| โมเดล | อินพุต (ต่อ 1 ล้าน) | เอาต์พุต (ต่อ 1 ล้าน) | หมายเหตุ |
|---|---|---|---|
| Kimi K3 | $0.30 cache-hit / $3.00 cache-miss | $15.00 | บริบท 1 ล้าน, โมเดลแบบโอเพนซอร์สประมาณ 27 กรกฎาคม |
| Claude Opus 4.8 | $5.00 | $25.00 | ระดับพรีเมียม; ตรวจสอบราคาปัจจุบัน |
| GPT-5.6 Sol | ~$5.00 | ~$30.00 | ระดับเรือธง; มีระดับ GPT-5.6 ที่ถูกกว่า |
| DeepSeek V4 | ระดับคุ้มค่า | ระดับคุ้มค่า | ยืนยันอัตราปัจจุบัน |
เทียบกับ Claude Opus 4.8
จาก ราคา Claude Opus 4.8 ที่อินพุต $5.00 และเอาต์พุต $25.00:
- Kimi K3 cache-miss ยังถูกกว่าอินพุตของ Opus
- เอาต์พุต Kimi K3 ถูกกว่า 40%
- สำหรับตัวอย่าง 2M input และ 200K output:
- Opus ตามราคาป้าย: ประมาณ $15.00
- Kimi K3 ที่ cache-hit 90%: ประมาณ $4.14
Anthropic มี prompt caching ของตัวเอง ซึ่งอาจลดค่าใช้จ่ายจริงของ Opus ได้เช่นกัน ดังนั้นให้ใช้ตัวเลขนี้เป็นแนวทางและทดสอบกับ workload ของคุณ
เทียบกับ GPT-5.6 Sol
จาก ราคา GPT-5.6 GPT-5.6 Sol มีราคาประมาณ $5 สำหรับอินพุตและ $30 สำหรับเอาต์พุต
Kimi K3 ถูกกว่า Sol โดยเฉพาะในงานที่:
- มีอินพุตจำนวนมาก
- reuse context ได้ดี
- จำกัดเอาต์พุตได้
อย่างไรก็ตาม GPT-5.6 มีระดับ Terra และ Luna ที่ถูกกว่า จึงควรเปรียบเทียบความสามารถและราคาในระดับโมเดลที่คุณจะใช้งานจริง
เทียบกับ DeepSeek V4
จาก ราคา DeepSeek V4 DeepSeek V4 เป็นอีกตัวเลือกในกลุ่มโมเดลโอเพนซอร์สที่เน้นความคุ้มค่า
DeepSeek อาจมีราคาที่ดีกว่าในด้านเอาต์พุตดิบ ขณะที่ Kimi K3 มีจุดเด่นด้าน:
- context window ขนาด 1 ล้านโทเค็น
- ส่วนลด cache-hit สำหรับอินพุตที่ใช้ซ้ำ
- ความคุ้มค่าที่เพิ่มขึ้นเมื่อ workload แคชได้ดี
การทดสอบการใช้โทเค็นด้วย Apidog
การคำนวณทั้งหมดจะมีประโยชน์ก็ต่อเมื่อคุณตรวจสอบ usage ของระบบจริงได้ การตอบกลับ Kimi K3 จะมี usage object ที่แสดงข้อมูล เช่น:
- จำนวนโทเค็นอินพุต
- จำนวนโทเค็นเอาต์พุต
- จำนวนโทเค็นที่เป็น cache-hit
ขั้นตอนทดสอบ cache-hit rate
- เชื่อมต่อ Apidog กับ endpoint ของ Kimi K3
- กำหนดค่า base URL, Bearer token และ model ID เป็น
kimi-k3 - ส่งคำขอที่มี system prompt และ context เดิม
- ส่งคำขอเดิมซ้ำอีกครั้ง
- เปรียบเทียบ usage object ของทั้งสองการตอบกลับ
- ใช้จำนวน cache-hit เพื่อคำนวณอัตรา cache-hit จริงของคุณ
Kimi K3 เข้ากันได้กับ OpenAI SDK จึงสามารถตั้งค่าได้ในรูปแบบเดียวกับ OpenAI-style API อื่น ๆ
ตัวอย่างโครงสร้าง request:
{
"model": "kimi-k3",
"messages": [
{
"role": "system",
"content": "คุณคือผู้ช่วยเขียนโค้ด ตอบเป็น unified diff เท่านั้น"
},
{
"role": "user",
"content": "แก้ไขฟังก์ชันนี้เพื่อเพิ่ม validation"
}
],
"max_tokens": 500
}
สำหรับการเปรียบเทียบโมเดล ให้บันทึก request เดียวกันสำหรับ kimi-k3 และโมเดลปัจจุบันของคุณ จากนั้นเปรียบเทียบ:
- คุณภาพคำตอบ
- จำนวน input tokens
- จำนวน output tokens
- จำนวน cache-hit tokens
- ต้นทุนที่คำนวณจาก usage จริง
หากคุณทำงานใน editor โปรดดู คู่มือการใช้ Apidog ภายใน VS Code และ ดาวน์โหลด Apidog เพื่อเริ่มสร้างชุดทดสอบได้
คำตัดสินที่ซื่อสัตย์
Kimi K3 มีราคาถูกในการป้อนข้อมูล และมีราคาแพงในการสนทนา
ราคา cache-hit ที่ $0.30 เมื่อรวมกับ cache-hit rate มากกว่า 90% ที่ Moonshot รายงานสำหรับงานเขียนโค้ด หมายความว่าปริมาณงานที่ reuse context ได้ดีอาจมีต้นทุนอินพุตใกล้ระดับต่ำสุด แต่เอาต์พุตที่ $15.00 ต่อ 1 ล้านโทเค็นคือจุดที่ต้องควบคุมอย่างจริงจัง
แนวทางใช้งานที่เหมาะสมคือ:
- reuse prefix ให้มากที่สุด
- วัด cache-hit rate จาก usage object จริง
- จำกัด
max_tokens - กำหนดรูปแบบเอาต์พุตที่กระชับ
- เปรียบเทียบโมเดลด้วย request และ token usage เดียวกัน
Kimi K3 มีราคาต่ำกว่า Claude Opus 4.8 ในทุกอัตราตามป้าย และถูกกว่า GPT-5.6 Sol ขณะยังแข่งขันกับ DeepSeek V4 ได้ โดยเฉพาะสำหรับ workload ที่เน้นอินพุตและแคชได้ดี
Moonshot ระบุว่า Kimi K3 อยู่หลัง Claude Fable 5 และ GPT-5.6 Sol ในด้านความสามารถ และทำงานช้ากว่าค่าเฉลี่ยของระดับราคาเดียวกันเล็กน้อย แต่สำหรับคุณภาพที่ใกล้เคียงโมเดลระดับแนวหน้า, context ขนาด 1 ล้าน และราคาอินพุตที่คุ้มค่าเมื่อใช้แคช Kimi K3 เป็นตัวเลือกที่ควรทดสอบกับ workload จริงของทีมคุณ
เริ่มจาก ดาวน์โหลด Apidog ส่ง representative request ไปยัง kimi-k3 และอ่านค่า cache-hit จาก usage object ก่อนตัดสินใจใช้งานในระดับ production
คำถามที่พบบ่อย
API ของ Kimi K3 มีค่าใช้จ่ายเท่าไร?
Kimi K3 คิดราคา $0.30 ต่อ 1 ล้านโทเค็นสำหรับอินพุตแบบ cache-hit, $3.00 สำหรับ cache-miss และ $15.00 สำหรับเอาต์พุตบน API โดยตรงของ Moonshot
รายการจากบุคคลที่สาม เช่น OpenRouter แสดงราคาคงที่ $3.00 สำหรับอินพุตและ $15.00 สำหรับเอาต์พุต โดยไม่มีระดับ cache-hit แยกต่างหาก ดูการตั้งค่าได้ที่ คู่มือ API ของ Kimi K3
อัตราการเข้าถึงแคชคืออะไร และทำไมจึงสำคัญ?
Cache-hit rate คือสัดส่วนของโทเค็นอินพุตที่ระบบอ่านจาก prompt cache ได้แทนการประมวลผลใหม่
Moonshot รายงาน cache-hit rate มากกว่า 90% สำหรับงานเขียนโค้ด เมื่อ cache-hit rate อยู่ที่ 90% ต้นทุนอินพุตแบบผสมจะอยู่ที่ประมาณ $0.57 ต่อ 1 ล้านโทเค็น แทนที่จะเป็น $3.00
Kimi K3 ถูกกว่า Claude Opus 4.8 หรือไม่?
ใช่ตามราคาป้าย Kimi K3 มีเอาต์พุตราคา $15.00 ต่อ 1 ล้านโทเค็น เทียบกับ $25.00 ของ Claude Opus 4.8 และอินพุต Kimi K3 ก็มีราคาต่ำกว่าเช่นกัน
สำหรับตัวอย่าง 2M input และ 200K output Kimi K3 ที่ cache-hit 90% มีค่าใช้จ่ายประมาณ $4.14 เทียบกับประมาณ $15.00 ของ Opus ตามราคาป้าย อย่างไรก็ตาม Anthropic มีการแคชของตัวเอง จึงควรทดสอบกับ workload จริง ดู ราคา Claude Opus 4.8 และ การเปรียบเทียบ Kimi K3 กับ Claude Opus 4.8
ราคาของ Kimi K3 เปรียบเทียบกับ GPT-5.6 และ DeepSeek V4 อย่างไร?
Kimi K3 ถูกกว่า GPT-5.6 Sol ซึ่งมีราคาประมาณ $5 สำหรับอินพุตและ $30 สำหรับเอาต์พุต แต่ GPT-5.6 มีระดับ Terra และ Luna ที่ราคาต่ำกว่า
DeepSeek V4 เป็นทางเลือกในกลุ่มคุ้มค่าที่อาจมีค่าเอาต์พุตดิบต่ำกว่า Kimi K3 โปรดยืนยันราคาปัจจุบันผ่าน ราคา GPT-5.6 และ ราคา DeepSeek V4 ก่อนตัดสินใจ
ฉันจะลดค่าใช้จ่าย Kimi K3 ได้อย่างไร?
ให้เน้นลดเอาต์พุตมากกว่าอินพุต:
- จำกัด
max_tokens - ขอคำตอบที่กระชับ
- ขอเฉพาะ diff หรือ structured output ที่ต้องใช้
- รักษา system prompt และ context prefix ให้คงที่
- reuse tool definitions และ repository context
การตัดอินพุตอาจไม่ช่วยมากนัก เพราะอินพุตที่แคชแล้วมีราคาถูกอยู่แล้ว และ context ที่น้อยเกินไปอาจทำให้เอาต์พุตยาวขึ้น
ฉันจะยืนยัน cache-hit rate ที่แท้จริงได้อย่างไร?
ตรวจสอบ usage object ในการตอบกลับ Kimi K3 แต่ละครั้ง ซึ่งรายงานจำนวนโทเค็นอินพุต เอาต์พุต และ cache-hit
ส่งคำขอเดิมผ่าน Apidog สองครั้ง แล้วเปรียบเทียบจำนวน cache-hit ของแต่ละ response จากนั้นใช้ตัวเลขนั้นในสูตร blended input rate เพื่อคำนวณต้นทุนจริงของระบบคุณ


Top comments (0)