DEV Community

Cover image for ราคา Kimi K3: ต้นทุน API และการคำนวณแคชฮิต
Thanawat Wongchai
Thanawat Wongchai

Posted on • Originally published at apidog.com

ราคา Kimi K3: ต้นทุน API และการคำนวณแคชฮิต

Kimi K3 เปิดตัวเมื่อวันที่ 16 กรกฎาคม 2026 พร้อมตารางราคาที่ดูเรียบง่าย: อินพุตแบบ cache-hit ราคา $0.30 ต่อ 1 ล้านโทเค็น, cache-miss ราคา $3.00 และเอาต์พุตราคา $15.00 แต่ตัวเลขที่กำหนดค่าใช้จ่ายจริงคือ อัตราอินพุตแบบผสม (blended input rate) ที่เกิดจาก cache-hit ของปริมาณงานคุณเอง สำหรับงานเขียนโค้ดที่แคชได้ดี ต้นทุนมักใกล้ $0.30 มากกว่า $3.00 บทความนี้จะแสดงวิธีคำนวณต้นทุนจริงต่อภารกิจ วิธีวัด cache-hit rate และเปรียบเทียบกับ Claude Opus 4.8, GPT-5.6 Sol และ DeepSeek V4

ลองใช้ Apidog วันนี้

TL;DR

Kimi K3 คิดราคา:

ประเภทโทเค็น ราคาต่อ 1 ล้านโทเค็น
อินพุตแบบ cache-hit $0.30
อินพุตแบบ cache-miss $3.00
เอาต์พุต $15.00

Moonshot รายงานว่า Kimi K3 ซึ่งทำงานบนสถาปัตยกรรมอนุมานแบบกระจายของ Mooncake มี cache-hit rate มากกว่า 90% สำหรับงานเขียนโค้ด หากปริมาณงานของคุณมีโครงสร้างพร้อมต์ที่คงที่ ต้นทุนอินพุตจริงจึงอาจอยู่ราว $0.57 ต่อ 1 ล้านโทเค็น แทนที่จะเป็น $3.00

ข้อสรุปสำหรับการควบคุมต้นทุน:

  • รักษา system prompt, tool schema และ context prefix ให้คงที่เพื่อเพิ่ม cache-hit
  • จำกัดความยาวเอาต์พุตด้วย max_tokens
  • ขอเฉพาะ diff, patch หรือคำตอบที่ต้องใช้จริง
  • วัดค่า usage จริงจากการตอบกลับ แทนการอิงตัวเลข cache-hit ที่รายงานโดยผู้ให้บริการ

คุณสามารถตรวจสอบการแบ่ง cache-hit จาก usage object ของแต่ละคำขอผ่าน Apidog ได้ขณะทดสอบโมเดล

ราคาตามป้ายในตารางเดียว

Moonshot เผยแพร่ราคาสำหรับโมเดล kimi-k3 ดังนี้:

ประเภทโทเค็น ราคาต่อ 1 ล้านโทเค็น
อินพุตแบบ Cache-hit $0.30
อินพุตแบบ Cache-miss $3.00
เอาต์พุต $15.00

ส่วนต่างของราคาคือประเด็นสำคัญ:

  • cache-miss แพงกว่า cache-hit 10 เท่า
  • เอาต์พุตแพงกว่า cache-miss 5 เท่า
  • เอาต์พุตแพงกว่า cache-hit 50 เท่า

หากคุณคิดว่าอินพุตทุกโทเค็นถูกคิดที่ $3.00 คุณอาจประเมินต้นทุนสูงเกินจริงมาก สำหรับงานที่ใช้ context เดิมซ้ำหลายรอบ ในทางกลับกัน หากมองว่าเอาต์พุตเป็นค่าใช้จ่ายเล็กน้อย คุณอาจพลาดจุดที่ทำให้บิลสูงที่สุด

อ่านภาพรวมของโมเดลได้ที่ คำอธิบาย Kimi K3 ของเรา และดูการตั้งค่า request, base URL และ SDK ได้ใน คู่มือ API ของ Kimi K3

ภาพรวมราคา Kimi K3

ทำไมราคา cache-hit จึงเปลี่ยนการคำนวณ

Prompt caching คือสิ่งที่ทำให้ราคาตามป้ายต่างจากราคาที่จ่ายจริง

เมื่อส่งคำขอ ผู้ให้บริการจะเก็บ prefix ของพร้อมต์ที่ผ่านการแปลงเป็นโทเค็นแล้ว หากคำขอถัดไปใช้ prefix เดิม ระบบสามารถอ่านจากแคชแทนการประมวลผลใหม่ โทเค็นส่วนนั้นจึงถูกคิดในอัตรา cache-hit ที่ $0.30 แทน cache-miss ที่ $3.00

Moonshot ให้บริการ Kimi K3 ผ่าน Mooncake ซึ่งแยกขั้นตอน prefill และ decode เพื่อให้ reuse prefix ที่แคชไว้ได้อย่างมีประสิทธิภาพ บริษัทระบุว่า cache-hit rate สำหรับงานเขียนโค้ดสูงกว่า 90%

สูตรคำนวณอัตราอินพุตแบบผสม

กำหนดให้:

  • H = cache-hit rate
  • P_hit = ราคา cache-hit
  • P_miss = ราคา cache-miss

สูตรคือ:

blended_input_rate = (H × P_hit) + ((1 - H) × P_miss)
Enter fullscreen mode Exit fullscreen mode

หาก cache-hit rate เท่ากับ 90%:

(0.90 × $0.30) + (0.10 × $3.00)
= $0.27 + $0.30
= $0.57 ต่อ 1 ล้านโทเค็นอินพุต
Enter fullscreen mode Exit fullscreen mode

หากเพิ่ม cache-hit rate เป็น 95%:

(0.95 × $0.30) + (0.05 × $3.00)
= $0.285 + $0.15
= $0.435 ต่อ 1 ล้านโทเค็นอินพุต
Enter fullscreen mode Exit fullscreen mode

ค่า 90% เป็นตัวเลขที่ Moonshot รายงานสำหรับงานเขียนโค้ด ไม่ใช่ค่าที่รับประกันสำหรับทุกระบบ อัตราจริงขึ้นกับความคงที่ของ prompt prefix:

  • เอเจนต์ที่ส่ง repo context, system prompt และ tool definitions เดิมซ้ำ ๆ มักแคชได้ดี
  • แชตที่เปลี่ยนโครงสร้าง prompt หรือเรียง context ใหม่เกือบทุกครั้ง มักมี cache-hit ต่ำกว่า

ดังนั้นควรวัดจากคำขอจริงก่อนใช้ตัวเลขนี้ในการวางงบประมาณ

ตัวอย่างต้นทุนจริง: งานเขียนโค้ดแบบ agentic หนึ่งงาน

สมมติว่าเซสชันเขียนโค้ดแบบ agentic หนึ่งครั้งมีการใช้:

  • อินพุตรวม: 2,000,000 โทเค็น
  • เอาต์พุตรวม: 200,000 โทเค็น

ปริมาณอินพุตอาจสูงเพราะเอเจนต์ส่ง context ของ repository ซ้ำในหลายรอบ

กรณีไม่มีการแคช

อินพุต: 2,000,000 × $3.00 / 1,000,000 = $6.00
เอาต์พุต: 200,000 × $15.00 / 1,000,000 = $3.00

รวม = $9.00
Enter fullscreen mode Exit fullscreen mode

กรณี cache-hit 90%

Cache-hit input:
1,800,000 × $0.30 / 1,000,000 = $0.54

Cache-miss input:
200,000 × $3.00 / 1,000,000 = $0.60

อินพุตรวม = $1.14

เอาต์พุต:
200,000 × $15.00 / 1,000,000 = $3.00

รวม = $4.14
Enter fullscreen mode Exit fullscreen mode

การแคชช่วยลดค่าอินพุตจาก $6.00 เหลือ $1.14 และลดต้นทุนรวมจาก $9.00 เหลือ $4.14 หรือประมาณ 54%

สิ่งที่ไม่เปลี่ยนคือค่าเอาต์พุต: ยังอยู่ที่ $3.00 ในทั้งสองกรณี เพราะคุณไม่สามารถแคชข้อความที่โมเดลยังไม่ได้สร้างได้

อินพุตมีราคาถูก เอาต์พุตคือราคาพรีเมียม

สำหรับ Kimi K3 กลยุทธ์ควบคุมค่าใช้จ่ายควรเน้นที่เอาต์พุตมากกว่าอินพุต:

  • เอาต์พุต $15.00 ต่อ 1 ล้านโทเค็น
  • cache-miss input $3.00 ต่อ 1 ล้านโทเค็น
  • cache-hit input $0.30 ต่อ 1 ล้านโทเค็น

สิ่งที่ควรทำ

  1. ตั้ง max_tokens ให้เหมาะสม

    จำกัดเอาต์พุตสูงสุดตามประเภทงาน เช่น งานสร้าง patch ไม่จำเป็นต้องเปิดเพดานเท่ากับงานสร้างเอกสาร

  2. ระบุรูปแบบคำตอบให้ชัดเจน

    ขอเฉพาะสิ่งที่จำเป็น เช่น:

   ส่งเฉพาะ unified diff
   ห้ามอธิบายขั้นตอน
   จำกัดคำตอบไม่เกิน 300 โทเค็น
Enter fullscreen mode Exit fullscreen mode
  1. รักษา prefix ให้เสถียร

    อย่าสลับลำดับ system prompt, tool definitions หรือ context block โดยไม่จำเป็น เพราะการเปลี่ยนเพียงเล็กน้อยอาจทำให้ cache-hit ลดลง

  2. รวมงานที่เกี่ยวข้องไว้ภายใต้ warm prefix เดียวกัน

    หากเอเจนต์ต้องตรวจหลายไฟล์ใน repository เดียวกัน ให้ reuse context เดิมแทนการสร้าง prompt ใหม่ทุกคำขอ

สิ่งที่อาจไม่ช่วยเท่าที่คิด

การตัดอินพุตเพื่อประหยัดเงินอาจไม่คุ้มเสมอไป เพราะอินพุตที่แคชแล้วมีราคาถูกอยู่แล้ว และ context ที่น้อยเกินไปอาจทำให้โมเดล:

  • ถามคำถามเพิ่ม
  • สร้างคำตอบที่ไม่แม่นยำ
  • ส่งเอาต์พุตยาวขึ้นเพื่อชดเชยข้อมูลที่ขาด

สำหรับโมเดลที่มีโครงสร้างราคาแบบ Kimi K3 การส่ง context ที่มีประโยชน์และควบคุมเอาต์พุตให้กระชับ มักคุ้มกว่า

จุดอ้างอิงราคา: Kimi K3 เปรียบเทียบเป็นอย่างไร

โมเดล อินพุต (ต่อ 1 ล้าน) เอาต์พุต (ต่อ 1 ล้าน) หมายเหตุ
Kimi K3 $0.30 cache-hit / $3.00 cache-miss $15.00 บริบท 1 ล้าน, โมเดลแบบโอเพนซอร์สประมาณ 27 กรกฎาคม
Claude Opus 4.8 $5.00 $25.00 ระดับพรีเมียม; ตรวจสอบราคาปัจจุบัน
GPT-5.6 Sol ~$5.00 ~$30.00 ระดับเรือธง; มีระดับ GPT-5.6 ที่ถูกกว่า
DeepSeek V4 ระดับคุ้มค่า ระดับคุ้มค่า ยืนยันอัตราปัจจุบัน

เทียบกับ Claude Opus 4.8

จาก ราคา Claude Opus 4.8 ที่อินพุต $5.00 และเอาต์พุต $25.00:

  • Kimi K3 cache-miss ยังถูกกว่าอินพุตของ Opus
  • เอาต์พุต Kimi K3 ถูกกว่า 40%
  • สำหรับตัวอย่าง 2M input และ 200K output:
    • Opus ตามราคาป้าย: ประมาณ $15.00
    • Kimi K3 ที่ cache-hit 90%: ประมาณ $4.14

Anthropic มี prompt caching ของตัวเอง ซึ่งอาจลดค่าใช้จ่ายจริงของ Opus ได้เช่นกัน ดังนั้นให้ใช้ตัวเลขนี้เป็นแนวทางและทดสอบกับ workload ของคุณ

เทียบกับ GPT-5.6 Sol

จาก ราคา GPT-5.6 GPT-5.6 Sol มีราคาประมาณ $5 สำหรับอินพุตและ $30 สำหรับเอาต์พุต

Kimi K3 ถูกกว่า Sol โดยเฉพาะในงานที่:

  • มีอินพุตจำนวนมาก
  • reuse context ได้ดี
  • จำกัดเอาต์พุตได้

อย่างไรก็ตาม GPT-5.6 มีระดับ Terra และ Luna ที่ถูกกว่า จึงควรเปรียบเทียบความสามารถและราคาในระดับโมเดลที่คุณจะใช้งานจริง

เทียบกับ DeepSeek V4

จาก ราคา DeepSeek V4 DeepSeek V4 เป็นอีกตัวเลือกในกลุ่มโมเดลโอเพนซอร์สที่เน้นความคุ้มค่า

DeepSeek อาจมีราคาที่ดีกว่าในด้านเอาต์พุตดิบ ขณะที่ Kimi K3 มีจุดเด่นด้าน:

  • context window ขนาด 1 ล้านโทเค็น
  • ส่วนลด cache-hit สำหรับอินพุตที่ใช้ซ้ำ
  • ความคุ้มค่าที่เพิ่มขึ้นเมื่อ workload แคชได้ดี

การทดสอบการใช้โทเค็นด้วย Apidog

การคำนวณทั้งหมดจะมีประโยชน์ก็ต่อเมื่อคุณตรวจสอบ usage ของระบบจริงได้ การตอบกลับ Kimi K3 จะมี usage object ที่แสดงข้อมูล เช่น:

  • จำนวนโทเค็นอินพุต
  • จำนวนโทเค็นเอาต์พุต
  • จำนวนโทเค็นที่เป็น cache-hit

ตัวอย่างการตรวจสอบ usage ใน Apidog

ขั้นตอนทดสอบ cache-hit rate

  1. เชื่อมต่อ Apidog กับ endpoint ของ Kimi K3
  2. กำหนดค่า base URL, Bearer token และ model ID เป็น kimi-k3
  3. ส่งคำขอที่มี system prompt และ context เดิม
  4. ส่งคำขอเดิมซ้ำอีกครั้ง
  5. เปรียบเทียบ usage object ของทั้งสองการตอบกลับ
  6. ใช้จำนวน cache-hit เพื่อคำนวณอัตรา cache-hit จริงของคุณ

Kimi K3 เข้ากันได้กับ OpenAI SDK จึงสามารถตั้งค่าได้ในรูปแบบเดียวกับ OpenAI-style API อื่น ๆ

ตัวอย่างโครงสร้าง request:

{
  "model": "kimi-k3",
  "messages": [
    {
      "role": "system",
      "content": "คุณคือผู้ช่วยเขียนโค้ด ตอบเป็น unified diff เท่านั้น"
    },
    {
      "role": "user",
      "content": "แก้ไขฟังก์ชันนี้เพื่อเพิ่ม validation"
    }
  ],
  "max_tokens": 500
}
Enter fullscreen mode Exit fullscreen mode

สำหรับการเปรียบเทียบโมเดล ให้บันทึก request เดียวกันสำหรับ kimi-k3 และโมเดลปัจจุบันของคุณ จากนั้นเปรียบเทียบ:

  • คุณภาพคำตอบ
  • จำนวน input tokens
  • จำนวน output tokens
  • จำนวน cache-hit tokens
  • ต้นทุนที่คำนวณจาก usage จริง

หากคุณทำงานใน editor โปรดดู คู่มือการใช้ Apidog ภายใน VS Code และ ดาวน์โหลด Apidog เพื่อเริ่มสร้างชุดทดสอบได้

คำตัดสินที่ซื่อสัตย์

Kimi K3 มีราคาถูกในการป้อนข้อมูล และมีราคาแพงในการสนทนา

ราคา cache-hit ที่ $0.30 เมื่อรวมกับ cache-hit rate มากกว่า 90% ที่ Moonshot รายงานสำหรับงานเขียนโค้ด หมายความว่าปริมาณงานที่ reuse context ได้ดีอาจมีต้นทุนอินพุตใกล้ระดับต่ำสุด แต่เอาต์พุตที่ $15.00 ต่อ 1 ล้านโทเค็นคือจุดที่ต้องควบคุมอย่างจริงจัง

แนวทางใช้งานที่เหมาะสมคือ:

  1. reuse prefix ให้มากที่สุด
  2. วัด cache-hit rate จาก usage object จริง
  3. จำกัด max_tokens
  4. กำหนดรูปแบบเอาต์พุตที่กระชับ
  5. เปรียบเทียบโมเดลด้วย request และ token usage เดียวกัน

Kimi K3 มีราคาต่ำกว่า Claude Opus 4.8 ในทุกอัตราตามป้าย และถูกกว่า GPT-5.6 Sol ขณะยังแข่งขันกับ DeepSeek V4 ได้ โดยเฉพาะสำหรับ workload ที่เน้นอินพุตและแคชได้ดี

Moonshot ระบุว่า Kimi K3 อยู่หลัง Claude Fable 5 และ GPT-5.6 Sol ในด้านความสามารถ และทำงานช้ากว่าค่าเฉลี่ยของระดับราคาเดียวกันเล็กน้อย แต่สำหรับคุณภาพที่ใกล้เคียงโมเดลระดับแนวหน้า, context ขนาด 1 ล้าน และราคาอินพุตที่คุ้มค่าเมื่อใช้แคช Kimi K3 เป็นตัวเลือกที่ควรทดสอบกับ workload จริงของทีมคุณ

เริ่มจาก ดาวน์โหลด Apidog ส่ง representative request ไปยัง kimi-k3 และอ่านค่า cache-hit จาก usage object ก่อนตัดสินใจใช้งานในระดับ production

คำถามที่พบบ่อย

API ของ Kimi K3 มีค่าใช้จ่ายเท่าไร?

Kimi K3 คิดราคา $0.30 ต่อ 1 ล้านโทเค็นสำหรับอินพุตแบบ cache-hit, $3.00 สำหรับ cache-miss และ $15.00 สำหรับเอาต์พุตบน API โดยตรงของ Moonshot

รายการจากบุคคลที่สาม เช่น OpenRouter แสดงราคาคงที่ $3.00 สำหรับอินพุตและ $15.00 สำหรับเอาต์พุต โดยไม่มีระดับ cache-hit แยกต่างหาก ดูการตั้งค่าได้ที่ คู่มือ API ของ Kimi K3

อัตราการเข้าถึงแคชคืออะไร และทำไมจึงสำคัญ?

Cache-hit rate คือสัดส่วนของโทเค็นอินพุตที่ระบบอ่านจาก prompt cache ได้แทนการประมวลผลใหม่

Moonshot รายงาน cache-hit rate มากกว่า 90% สำหรับงานเขียนโค้ด เมื่อ cache-hit rate อยู่ที่ 90% ต้นทุนอินพุตแบบผสมจะอยู่ที่ประมาณ $0.57 ต่อ 1 ล้านโทเค็น แทนที่จะเป็น $3.00

Kimi K3 ถูกกว่า Claude Opus 4.8 หรือไม่?

ใช่ตามราคาป้าย Kimi K3 มีเอาต์พุตราคา $15.00 ต่อ 1 ล้านโทเค็น เทียบกับ $25.00 ของ Claude Opus 4.8 และอินพุต Kimi K3 ก็มีราคาต่ำกว่าเช่นกัน

สำหรับตัวอย่าง 2M input และ 200K output Kimi K3 ที่ cache-hit 90% มีค่าใช้จ่ายประมาณ $4.14 เทียบกับประมาณ $15.00 ของ Opus ตามราคาป้าย อย่างไรก็ตาม Anthropic มีการแคชของตัวเอง จึงควรทดสอบกับ workload จริง ดู ราคา Claude Opus 4.8 และ การเปรียบเทียบ Kimi K3 กับ Claude Opus 4.8

ราคาของ Kimi K3 เปรียบเทียบกับ GPT-5.6 และ DeepSeek V4 อย่างไร?

Kimi K3 ถูกกว่า GPT-5.6 Sol ซึ่งมีราคาประมาณ $5 สำหรับอินพุตและ $30 สำหรับเอาต์พุต แต่ GPT-5.6 มีระดับ Terra และ Luna ที่ราคาต่ำกว่า

DeepSeek V4 เป็นทางเลือกในกลุ่มคุ้มค่าที่อาจมีค่าเอาต์พุตดิบต่ำกว่า Kimi K3 โปรดยืนยันราคาปัจจุบันผ่าน ราคา GPT-5.6 และ ราคา DeepSeek V4 ก่อนตัดสินใจ

ฉันจะลดค่าใช้จ่าย Kimi K3 ได้อย่างไร?

ให้เน้นลดเอาต์พุตมากกว่าอินพุต:

  • จำกัด max_tokens
  • ขอคำตอบที่กระชับ
  • ขอเฉพาะ diff หรือ structured output ที่ต้องใช้
  • รักษา system prompt และ context prefix ให้คงที่
  • reuse tool definitions และ repository context

การตัดอินพุตอาจไม่ช่วยมากนัก เพราะอินพุตที่แคชแล้วมีราคาถูกอยู่แล้ว และ context ที่น้อยเกินไปอาจทำให้เอาต์พุตยาวขึ้น

ฉันจะยืนยัน cache-hit rate ที่แท้จริงได้อย่างไร?

ตรวจสอบ usage object ในการตอบกลับ Kimi K3 แต่ละครั้ง ซึ่งรายงานจำนวนโทเค็นอินพุต เอาต์พุต และ cache-hit

ส่งคำขอเดิมผ่าน Apidog สองครั้ง แล้วเปรียบเทียบจำนวน cache-hit ของแต่ละ response จากนั้นใช้ตัวเลขนั้นในสูตร blended input rate เพื่อคำนวณต้นทุนจริงของระบบคุณ

Top comments (0)