Moonshot AI เปิดตัว Kimi K3 เมื่อวันที่ 16 กรกฎาคม 2026 โดยเรียกว่าเป็น “โมเดล 3T-class แบบเปิดรุ่นแรกของโลก” สำหรับนักพัฒนา จุดที่ควรประเมินไม่ใช่แค่คำโฆษณา แต่คือการนำไปใช้จริง: K3 เป็นโมเดล Mixture-of-Experts (MoE) ขนาด 2.8 ล้านล้านพารามิเตอร์, รองรับบริบท 1 ล้านโทเค็น, ใช้ API ที่เข้ากันได้กับ OpenAI SDK และมีโครงสร้างราคาที่คุ้มค่ามากเมื่อเกิด cache hit โมเดลเปิดให้ใช้ผ่าน Kimi.com, Kimi Work, Kimi Code และ Kimi API ตั้งแต่วันเปิดตัว โดย Moonshot ระบุว่าจะเผยแพร่น้ำหนักโมเดลทั้งหมดภายในวันที่ 27 กรกฎาคม 2026
สรุปสั้นๆ: Kimi K3 คืออะไร?
Kimi K3 คือ LLM เรือธงของ Moonshot AI ที่เปิดตัวเมื่อวันที่ 16 กรกฎาคม 2026 โดยมีรายละเอียดสำคัญดังนี้
- พารามิเตอร์รวม: 2.8 ล้านล้านตัว
- สถาปัตยกรรม: Mixture-of-Experts
- การเปิดใช้ expert: 16 จาก 896 expert ต่อโทเค็น
- Context window: 1,048,576 โทเค็น หรือ 1M
- API model ID:
kimi-k3 - ราคาอินพุตแบบ cache hit: $0.30 / 1M tokens
- ราคาอินพุตแบบ cache miss: $3.00 / 1M tokens
- ราคาเอาต์พุต: $15.00 / 1M tokens
- Artificial Analysis Intelligence Index: 57 คะแนน อันดับ 4 จาก 189 โมเดล
Moonshot ระบุเองว่า K3 ยังตามหลัง Claude Fable 5 และ GPT-5.6 Sol ดังนั้นควรวางตำแหน่ง K3 เป็นโมเดลแบบเปิดที่มีประสิทธิภาพใกล้แนวหน้า ไม่ใช่โมเดลที่ดีที่สุดในทุกงาน
ทำไม Kimi K3 จึงสำคัญสำหรับนักพัฒนา
Kimi K3 น่าสนใจเพราะรวมองค์ประกอบที่นักพัฒนาต้องใช้ตัดสินใจจริงไว้ในโมเดลเดียว:
- คุณภาพใกล้เคียงโมเดลแนวหน้า
- API ที่เข้ากันได้กับ OpenAI SDK
- บริบทขนาด 1M โทเค็น
- ราคา cache-hit ต่ำกว่าราคา cache-miss 10 เท่า
- มีแผนเผยแพร่น้ำหนักโมเดลสำหรับการโฮสต์ด้วยตนเอง
หากแอปของคุณใช้ OpenAI-compatible client อยู่แล้ว งานเริ่มต้นคือเปลี่ยน base URL ไปยัง Kimi endpoint และกำหนดโมเดลเป็น kimi-k3 จากนั้นทดสอบพฤติกรรมของ streaming, tool calling และ structured output ก่อนนำเข้าสู่ production
Apidog รองรับการทดสอบ OpenAI-compatible endpoint โดยตรง คุณจึงสามารถส่งคำขอ streaming, ตรวจสอบ Server-Sent Events (SSE) แบบโทเค็นต่อโทเค็น และดู payload ของ tool_calls ก่อนเขียน integration เต็มรูปแบบ
สำหรับรายละเอียดเฉพาะด้าน ดูเพิ่มเติมได้ที่:
Kimi K3 อยู่ตรงไหนในสายผลิตภัณฑ์ Moonshot
Moonshot วาง K3 เป็น “โมเดลที่ทรงพลังที่สุดของเรา” และเป็นรุ่นถัดจากตระกูล Kimi K2
หากคุณเคยใช้ Kimi K2 หรือ Kimi K2.7 Code มาก่อน K3 คือรุ่นที่สร้างแกน Attention ใหม่ ไม่ใช่เพียงการเพิ่มจำนวนพารามิเตอร์ของ K2
คำว่า “open 3T-class” ควรอ่านอย่างระมัดระวัง:
- Open: ในวันเปิดตัว K3 ใช้งานผ่านผลิตภัณฑ์ที่โฮสต์และ API แบบชำระเงินเท่านั้น Moonshot ระบุว่าจะเปิดเผยน้ำหนักทั้งหมดภายในวันที่ 27 กรกฎาคม 2026
- 3T-class: หมายถึงขนาดรวม 2.8 ล้านล้านพารามิเตอร์ ไม่ได้หมายความว่าพารามิเตอร์ทั้งหมดทำงานในทุกโทเค็น เพราะ K3 ใช้ MoE และเปิดใช้เพียง 16 expert จาก 896 expert ต่อโทเค็น
สำหรับทีมที่กำลังพิจารณา self-hosting ควรถือว่าการเปิดน้ำหนักโมเดลเป็นเหตุการณ์ในอนาคต ไม่ใช่สิ่งที่พร้อมดาวน์โหลดในวันเปิดตัว
สถาปัตยกรรม: สิ่งที่เปลี่ยนไปใน K3
K3 ไม่ใช่ K2 ที่ใหญ่ขึ้นเฉยๆ Moonshot ระบุองค์ประกอบหลักของสถาปัตยกรรมไว้หลายส่วน
Kimi Delta Attention (KDA)
KDA คือกลไก Attention แบบ linear-hybrid ที่ Moonshot อธิบายว่าออกแบบมาเพื่อรองรับการขยายขนาดของ Attention อย่างมีประสิทธิภาพ
ในเชิงปฏิบัติ Attention แบบ linear ช่วยควบคุมต้นทุนหน่วยความจำและการคำนวณเมื่อ context ยาวขึ้น จึงช่วยให้ context window ขนาด 1M โทเค็นใช้งานได้จริงมากขึ้น
Attention Residuals (AttnRes)
AttnRes เป็นส่วนประกอบที่ Moonshot ใช้แทน residual connection แบบมาตรฐาน โดยมีเป้าหมายให้โมเดลเลือกดึง representation จากระดับความลึกต่างๆ ของเครือข่ายได้
ผลที่ต้องติดตามจากมุมมองผู้ใช้คือความสามารถในการรักษาข้อมูลจากเลเยอร์ก่อนหน้าเมื่อประมวลผล context ที่ยาวและซับซ้อน
Stable LatentMoE
Stable LatentMoE คือชั้น routing ของ Mixture-of-Experts ใน K3
K3 มี expert ทั้งหมด 896 ตัว และเปิดใช้งาน 16 ตัวต่อโทเค็น โดย Moonshot ใช้แนวทางที่เรียกว่า Quantile Balancing เพื่อทำให้ routing มีเสถียรภาพระหว่างการฝึก
การเปิดใช้ expert แบบ sparse ทำให้โมเดลเก็บความจุรวมระดับล้านล้านพารามิเตอร์ได้ โดยไม่ต้องจ่ายต้นทุนการคำนวณเท่ากับการเปิดใช้ทุกพารามิเตอร์ในทุกโทเค็น
Moonshot ยังกล่าวถึงองค์ประกอบอื่น ได้แก่:
- Per-Head Muon
- Sigmoid Tanh Unit (SiTU)
- Gated MLA
- น้ำหนัก MXFP4
- activation แบบ MXFP8 สำหรับ quantization
ข้อมูลจำเพาะ Kimi K3
| คุณสมบัติ | Kimi K3 |
|---|---|
| ผู้พัฒนา | Moonshot AI |
| วันเปิดตัว | 16 กรกฎาคม 2026 |
| พารามิเตอร์รวม | 2.8 trillion (Mixture-of-Experts) |
| Expert ที่ใช้งาน | 16 จาก 896 ต่อโทเค็น |
| Context window | 1,048,576 tokens (1M) |
| API model ID | kimi-k3 |
| OpenRouter slug | moonshotai/kimi-k3 |
| ความเข้ากันได้ของ API | OpenAI SDK compatible |
| อินพุตแบบ cache hit | $0.30 / 1M tokens |
| อินพุตแบบ cache miss | $3.00 / 1M tokens |
| เอาต์พุต | $15.00 / 1M tokens |
| ความเร็วเอาต์พุต | ประมาณ 62 tokens/sec |
| เวลาถึงโทเค็นแรก | ประมาณ 1.99 วินาที |
| Intelligence Index | 57 คะแนน อันดับ 4 จาก 189 |
| น้ำหนักแบบเปิด | คาดการณ์ประมาณ 27 กรกฎาคม 2026 |
หากต้องการคำนวณค่าใช้จ่ายตามจำนวนโทเค็นของแอป ให้ดู คู่มือราคา Kimi K3
Context window 1M และผลกระทบต่อค่าใช้จ่าย
Context window ขนาด 1,048,576 โทเค็นทำให้คุณสามารถส่งข้อมูลจำนวนมากในคำขอเดียว เช่น
- โค้ดเบสขนาดใหญ่
- เอกสารออกแบบหลายชุด
- บันทึกการประชุมหลายชั่วโมง
- รายงานวิจัยและชุดข้อมูลขนาดยาว
- schema, API specification และตัวอย่าง payload จำนวนมาก
จุดที่สำคัญกว่าความยาว context คือราคาอินพุต:
- Cache hit: $0.30 / 1M tokens
- Cache miss: $3.00 / 1M tokens
ต่างกัน 10 เท่า
Moonshot ระบุว่า Mooncake ซึ่งเป็นระบบ inference แบบ disaggregated ของตน มีอัตรา cache hit สูงกว่า 90% สำหรับงานเขียนโค้ด หากระบบของคุณส่งบริบทเดิมซ้ำ เช่น system prompt ยาว, โครงสร้าง repository, เอกสาร API หรือคำสั่ง agent ที่คงที่ ต้นทุนอินพุตส่วนมากอาจถูกคิดในอัตรา cache hit
ตัวอย่าง workload ที่น่าจะได้รับประโยชน์:
รอบที่ 1:
- ส่ง repository context
- ส่ง system prompt
- ส่ง task ของผู้ใช้
รอบที่ 2-10:
- ใช้ repository context และ system prompt เดิม
- ส่งเฉพาะ task หรือ tool result ใหม่
สำหรับ agentic coding loop รูปแบบนี้สามารถลดต้นทุนอินพุตได้อย่างมีนัยสำคัญ
อย่างไรก็ตาม K3 ไม่ใช่โมเดลที่เร็วที่สุด Artificial Analysis วัดความเร็วเอาต์พุตได้ประมาณ 62 tokens ต่อวินาที ซึ่งต่ำกว่าค่ามัธยฐาน 72.7 tokens ต่อวินาทีในกลุ่มราคาเดียวกัน ขณะที่เวลาถึงโทเค็นแรกอยู่ที่ประมาณ 1.99 วินาที
หากแอปของคุณไวต่อ latency เช่น autocomplete หรือ chatbot แบบ real-time ควร benchmark K3 เทียบกับโมเดลที่เร็วกว่าโดยใช้ prompt และ context จริงของระบบคุณ
การวางตำแหน่ง: แข็งแกร่ง เปิดกว้าง แต่ไม่ใช่อันดับหนึ่ง
Moonshot ระบุใน บล็อกเปิดตัว Kimi K3 อย่างเป็นทางการ ว่า K3 ยังตามหลังโมเดลกรรมสิทธิ์ที่ทรงพลังที่สุด เช่น Claude Fable 5 และ GPT-5.6 Sol แม้จะมีประสิทธิภาพระดับแนวหน้าบนชุดการประเมินของ Moonshot เอง
ข้อมูลจาก Artificial Analysis Intelligence Index สอดคล้องกับภาพนี้ โดย K3 ได้ 57 คะแนนและอยู่ในอันดับ 4 จาก 189 โมเดล
สรุปสำหรับการเลือกโมเดล:
| ความต้องการ | มุมมองต่อ Kimi K3 |
|---|---|
| ต้องการคุณภาพสูงสุดสำหรับ reasoning ที่ยากมาก | โมเดลกรรมสิทธิ์ระดับบนอาจยังเหมาะกว่า |
| ต้องการคุณภาพใกล้แนวหน้า | K3 เป็นตัวเลือกที่น่าสนใจ |
| ต้องการ API ที่เข้ากันได้กับ OpenAI | K3 ใช้งานได้สะดวก |
| ต้องการควบคุมการโฮสต์ในอนาคต | ติดตามการเผยแพร่น้ำหนักโมเดล |
| ต้องการลดค่าใช้จ่ายของ context ที่ใช้ซ้ำ | ราคา cache hit ของ K3 เป็นจุดเด่น |
ดูการเปรียบเทียบโดยตรงเพิ่มเติมได้ที่:
ใช้ Kimi K3 ได้ที่ไหนบ้าง
| แพลตฟอร์ม | สิ่งที่คุณได้รับ |
|---|---|
| Kimi.com | แอปแชทบนเว็บ โดย K3 เป็นโมเดลเริ่มต้น |
| Kimi Work | ผลิตภัณฑ์ workspace สำหรับทีม |
| Kimi Code | coding agent บนเทอร์มินัล |
| Kimi API | การเข้าถึงแบบโปรแกรมผ่าน kimi-k3
|
| แอปมือถือ | iOS, Android และ HarmonyOS |
| เดสก์ท็อป | Kimi Work เวอร์ชัน 3.1.0 ขึ้นไป |
| OpenRouter | ใช้งานผ่าน moonshotai/kimi-k3
|
หากคุณใช้งานจากเทอร์มินัล คู่มือ Kimi Code CLI อธิบายรูปแบบการตั้งค่าจากยุค K2 ซึ่ง workflow ของ K3 มีลักษณะใกล้เคียงกัน
ลิงก์ที่เกี่ยวข้อง:
ความสามารถของ API
K3 รองรับความสามารถที่จำเป็นสำหรับแอปแบบ agentic และ workflow ที่มีโครงสร้าง:
- Context caching
- Tool calling
- การจำกัดการเลือก tool
- JSON mode และ structured output
- Partial mode สำหรับการเติมข้อความแบบควบคุม
- การค้นหาอินเทอร์เน็ต
- Dynamic tool loading
- การปรับระดับ reasoning effort รวมถึงระดับ “สูงสุด”
รูปแบบการใช้งานหลักคือชี้ OpenAI client ไปยัง Kimi-compatible endpoint และใช้ kimi-k3 เป็นชื่อโมเดล
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["KIMI_API_KEY"],
base_url="https://<kimi-compatible-endpoint>/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "system",
"content": "คุณเป็นผู้ช่วยสำหรับรีวิวโค้ด"
},
{
"role": "user",
"content": "ช่วยอธิบายความเสี่ยงของโค้ดนี้"
}
]
)
print(response.choices[0].message.content)
ก่อนใช้งานจริง ให้ยืนยัน base URL ล่าสุดบน platform.kimi.ai เนื่องจากคอนโซลมีการย้ายไปยังโดเมนใหม่ในช่วงเปิดตัว
สำหรับตัวอย่าง request และ response แบบเต็ม ดู คู่มือ Kimi K3 API
ทดสอบ Kimi K3 ก่อน deploy
ก่อนเชื่อม K3 เข้ากับ agent หรือ production service ให้ตรวจสอบอย่างน้อย 4 เรื่อง:
- Streaming response มีรูปแบบตรงกับ parser ของคุณหรือไม่
-
tool_callsมีชื่อฟังก์ชันและ argument ตรงตาม schema หรือไม่ - JSON output ผ่าน validation หรือไม่
- reasoning effort ที่สูงขึ้นส่งผลต่อ latency และต้นทุนอย่างไร
ตัวอย่างคำขอ streaming:
{
"model": "kimi-k3",
"messages": [
{
"role": "user",
"content": "สรุปความแตกต่างระหว่าง cache hit และ cache miss"
}
],
"stream": true
}
ตัวอย่างคำขอ tool calling:
{
"model": "kimi-k3",
"messages": [
{
"role": "user",
"content": "ตรวจสอบสถานะ deployment ของ service api"
}
],
"tools": [
{
"type": "function",
"function": {
"name": "get_deployment_status",
"description": "ตรวจสอบสถานะ deployment ของบริการ",
"parameters": {
"type": "object",
"properties": {
"service": {
"type": "string"
}
},
"required": ["service"]
}
}
}
]
}
ใช้ Apidog เพื่อสร้าง request, เก็บ API key เป็น environment variable และตรวจสอบ streaming response หรือ tool_calls ก่อนให้โค้ด agent เรียกใช้จริง
แนวทางที่ควรทำ:
- อย่าเก็บ API key ไว้ใน collection ที่แชร์ร่วมกัน
- ทดสอบ schema ของ tool argument ก่อน execute tool
- เปรียบเทียบ latency ระหว่าง prompt สั้นและ prompt ที่มี context ยาว
- วัด cache hit จาก workload จริง ไม่ใช่แค่ตัวอย่างขนาดเล็ก
- ทำ regression test สำหรับ prompt สำคัญก่อนเปลี่ยนโมเดลใน production
คำถามที่พบบ่อย
Kimi K3 คืออะไร?
Kimi K3 คือ LLM เรือธงของ Moonshot AI ที่เปิดตัวเมื่อวันที่ 16 กรกฎาคม 2026 ใช้สถาปัตยกรรม Mixture-of-Experts มีพารามิเตอร์รวม 2.8 ล้านล้านตัว รองรับ context 1M โทเค็น และให้บริการผ่าน API model ID kimi-k3
Kimi K3 มีพารามิเตอร์เท่าไร?
K3 มีพารามิเตอร์รวม 2.8 ล้านล้านตัว และเปิดใช้ expert 16 จาก 896 ตัวต่อโทเค็น Moonshot ยังไม่ได้เปิดเผยจำนวนพารามิเตอร์ active ที่แน่นอน จึงไม่ควรอ้างตัวเลข active parameters เฉพาะเจาะจงเป็นข้อเท็จจริง
Kimi K3 API ราคาเท่าไร?
- Cache-hit input: $0.30 / 1M tokens
- Cache-miss input: $3.00 / 1M tokens
- Output: $15.00 / 1M tokens
ดูรายละเอียดเพิ่มเติมใน การวิเคราะห์ราคา Kimi K3
Kimi K3 เป็นโอเพนซอร์สหรือไม่?
ไม่ใช่ในวันเปิดตัว Moonshot ระบุว่าจะเผยแพร่น้ำหนักโมเดลทั้งหมดภายในวันที่ 27 กรกฎาคม 2026 ก่อนถึงเวลานั้น K3 ใช้งานผ่านผลิตภัณฑ์ที่โฮสต์และ API แบบชำระเงิน
Kimi K3 ดีกว่า Claude Fable 5 หรือ GPT-5.6 Sol หรือไม่?
ไม่ Moonshot ระบุว่า K3 ยังตามหลังโมเดลกรรมสิทธิ์ที่ทรงพลังที่สุดเหล่านั้น อย่างไรก็ตาม K3 ได้ 57 คะแนนและอันดับ 4 จาก 189 โมเดลใน Artificial Analysis Intelligence Index
ใช้ Kimi K3 กับ OpenAI SDK ได้หรือไม่?
ได้ API ของ Moonshot เข้ากันได้กับ OpenAI SDK กำหนด base URL เป็น Kimi-compatible endpoint และใช้ kimi-k3 เป็น model ID ก่อนใช้งาน ให้ยืนยัน URL ล่าสุดที่ platform.kimi.ai
คุณสามารถตรวจสอบ request และ response ก่อนเชื่อมเข้ากับแอปได้ด้วย Apidog
Kimi K3 เร็วแค่ไหน?
Artificial Analysis วัดความเร็วเอาต์พุตได้ประมาณ 62 tokens ต่อวินาที และเวลาถึงโทเค็นแรกประมาณ 1.99 วินาที K3 เน้น reasoning depth มากกว่าความเร็วสูงสุด จึงควร benchmark เทียบกับโมเดลอื่นหาก latency เป็นข้อจำกัดหลัก
Kimi K3 ต่างจาก Kimi K2.7 Code อย่างไร?
K3 คือโมเดลเรือธงรุ่นถัดจากตระกูล K2 โดยมีสถาปัตยกรรม Attention ที่สร้างใหม่และ Moonshot ระบุว่ามีประสิทธิภาพการปรับขนาดดีกว่า K2 ประมาณ 2.5 เท่า ขณะที่ K2.7 Code ยังคงเป็นตัวเลือกที่แข็งแกร่งสำหรับงานเขียนโค้ดเฉพาะทาง
ดูการเปรียบเทียบโดยตรงได้ที่ Kimi K3 vs Kimi K2.7 Code



Top comments (0)