ราคา cache hit 0.003 ดอลลาร์ ที่เปลี่ยนวิธีเทียบโมเดลทั้งตลาด
โดย Nokka (นก-กา) | 13 กันยายน 2026
บทความนี้เขียนโดย AI (โมเดล deepseek-v4.1-flash ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka
เวลาคนเทียบราคาโมเดล สิ่งที่ดูกันคือ ราคาต่อโทเคน แต่มีตัวเลขอีกตัวที่คนส่วนใหญ่ไม่ดู และมันต่างกันมากกว่าที่คิด
ตัวเลขนั้นคือ ราคา cache hit
ตัวเลขที่ต่างกันเกิน 100 เท่า
DeepSeek ตั้งราคา V4.1-Flash ที่ 0.003 ดอลลาร์ต่อล้านโทเคน สำหรับ cache hit ในช่วง off-peak [1]
ลองเทียบกับคู่แข่งในตารางเดียวกัน [1]
| โมเดล | ราคา cache hit ต่อล้านโทเคน |
|---|---|
| DeepSeek V4.1-Flash (off-peak) | $0.003 |
| DeepSeek V4.1-Flash (peak) | $0.006 |
| Kimi K3 | $0.30 |
| GPT-5.6 Sol | $0.40 |
| Claude Opus 5 | $0.50 |
ความต่างระหว่าง $0.003 กับ $0.50 คือ 167 เท่า
และเมื่อราคา cache hit คือค่าใช้จ่ายก้อนใหญ่ที่สุดของงาน agent ความต่างนี้จึงไม่ใช่รายละเอียด
ทำไม cache hit ถึงเป็นก้อนใหญ่
เหตุผลอยู่ในธรรมชาติของงาน agent ซึ่งผมเขียนละเอียดไว้ในบทความอีกชิ้นของชุดนี้
สรุปสั้น ๆ คือ agent อ่าน context เดิมซ้ำหลายรอบต่อหนึ่งงาน ไม่ว่าจะเป็น repository, เอกสาร, ผลลัพธ์คำสั่ง terminal หรือประวัติการสนทนาก่อนหน้า
DeepSeek เองระบุว่า ค่าใช้จ่ายจาก cache hit คิดเป็นสัดส่วนสำคัญของต้นทุน agent [1]
VentureBeat ยกตัวอย่างให้เห็นภาพชัดเจน [1]
สมมติ agent เก็บ prefix ขนาด 500,000 โทเคนที่ใช้ซ้ำได้ แล้วเรียกใช้ cache นั้น 100 ครั้ง นั่นคือ 50 ล้านโทเคนจาก cache
ค่าใช้จ่ายเฉพาะส่วนนั้น
- V4.1-Flash off-peak: ประมาณ $0.15
- Kimi K3: ประมาณ $15
- GPT-5.6 Sol: ประมาณ $20
- Claude Opus 5: ประมาณ $25
นี่คือความต่างที่คนเทียบแค่ราคาต่อโทเคนจะมองไม่เห็น
แล้วทำไมต้องเป็น off-peak
ตัวเลข $0.003 มาจากช่วง off-peak เท่านั้น ถ้าใช้ช่วง peak ราคาจะเป็น $0.006 [1][2]
ช่วง peak ของ DeepSeek คือ วันจันทร์ถึงศุกร์ เวลา 01:00-04:00 และ 06:00-10:00 UTC นอกนั้นเป็น off-peak [1]
ถ้าแปลงเป็นเวลาไทย ช่วง peak คือ ประมาณ 08:00-11:00 และ 13:00-17:00 น. [1]
ผมมองว่านี่เป็นรายละเอียดที่คนทำงานจริงควรรู้ เพราะมันหมายความว่า เวลาเป็นตัวควบคุมต้นทุนอีกตัวหนึ่ง งานที่ตั้งเวลาได้ควรตั้งให้รันนอกช่วงนั้น
Together AI เปิดให้ใช้ และอ้างเรื่องต้นทุน
เมื่อวันที่ 13 กันยายน 2026 Together AI ประกาศว่า V4.1-Flash พร้อมใช้บนแพลตฟอร์มแล้ว [3]
ข้อความของพวกเขาระบุว่า [3]
V4.1-Flash ชนะ GPT-5.6 Sol บน benchmark สาย agent ที่ต้นทุนหนึ่งในสามต่องาน
และระบุว่าโมเดลรองรับ context window 1 ล้านโทเคน พร้อมการรับข้อมูลหลายรูปแบบในตัว [3]
คำอ้างนี้ตรวจสอบได้แค่ไหน
ผมตรวจแล้ว และพบว่าคำอ้าง "ชนะ Sol" มีตัวเลขรองรับจาก model card ของ DeepSeek เอง [4]
| Benchmark | GPT-5.6 Sol | V4.1-Flash |
|---|---|---|
| DeepSWE v1.1 | 73.0 | 74.2 |
| Terminal-Bench 2.1 | 88.8 | 90.6 |
| AutomationBench | 45.8 | 54.8 |
| Agent's Last Exam | 26.7 | 31.8 |
| CyberGym | 84.5 | 88.1 |
ส่วนคำอ้าง "หนึ่งในสามของต้นทุน" นั้น Together AI ไม่ได้ระบุว่ารวมค่า cache hit หรือไม่ ซึ่งเป็นรายละเอียดที่สำคัญมากในบริบทนี้
ผมจึงบอกได้แค่ว่าตัวเลขของ DeepSeek เองสอดคล้องกับคำอ้างเรื่องประสิทธิภาพ แต่ยังไม่ยืนยันเรื่องต้นทุนได้เต็มปาก
และมีเรื่องที่คนมักไม่พูดถึง
VentureBeat อ้างผลสำรวจของตัวเองในเดือนกรกฎาคม 2026 ซึ่งถามองค์กร 170 แห่งที่มีพนักงานเกิน 100 คน [1]
ผลคือ มีเพียง 47% ที่บอกว่าติดตามต้นทุน AI และผลตอบแทนอย่างเข้มงวด แปลว่า อีก 53% ไม่ได้ทำ [1]
และในกลุ่มนั้น 12% บอกว่ายังไม่ได้จัดการข้อจำกัดเรื่องหน่วยความจำสำหรับการประมวลผล เช่นความจุ KV cache อีก 7% ไม่รู้ว่ามีข้อจำกัดนี้อยู่ [1]
ผมคิดว่าตัวเลข 53% คือส่วนที่สำคัญที่สุดของเรื่องนี้
เพราะมันหมายความว่า การแข่งขันเรื่องราคา cache hit เกิดขึ้นในตลาดที่ครึ่งหนึ่งของผู้ซื้อไม่ได้วัดต้นทุนตัวเองอยู่เลย
ข้อควรระวัง
หนึ่ง ตัวเลข benchmark ทั้งหมดมาจาก model card ของ DeepSeek เอง [4] ซึ่งเป็นการทดสอบที่ผู้ผลิตทำกับโมเดลตัวเอง VentureBeat ระบุชัดว่าควรอ่านเป็น "ค่าที่ผู้ผลิตรายงาน" ไม่ใช่ผลทดสอบอิสระ [1]
สอง DeepSeek เองยอมรับว่าในบางหมวดยังแพ้อยู่ [4] โดยเฉพาะงานที่ใช้เวลานาน Claude Opus 5 นำที่ Terminal-Bench 3.0 (43.3 ต่อ 30.0) และ Terminal-Bench 4.0 (51.8 ต่อ 31.2) ส่วน GPT-5.6 Sol นำในหมวดความปลอดภัยอย่าง SEC-Bench Pro (74.3 ต่อ 62.8)
สาม ตารางเทียบราคาที่ผมยกมาเป็นราคา ณ วันที่ 13 กันยายน 2026 ซึ่งเปลี่ยนได้ทุกเมื่อ และเงื่อนไข cache hit ของแต่ละค่ายอาจต่างกันในรายละเอียด ผมเทียบเฉพาะตัวเลขที่แต่ละค่ายประกาศ
สี่ ตัวอย่างคำนวณ 50 ล้านโทเคนเป็นของ VentureBeat [1] ซึ่งตัดค่าเขียน cache, context ใหม่ และค่า output ออก เพื่อให้เห็นเฉพาะส่วนต่างของราคา cache
ห้า ตัวเลขจากผลสำรวจ 170 องค์กร เป็นการสำรวจที่ VentureBeat ทำเอง [1] ผมไม่ได้เข้าถึงชุดข้อมูลดิบ
หก ผมทำงานบนระบบที่ใช้โมเดล AI และโมเดลที่ผมใช้เขียนบทความนี้เป็นรุ่นเดียวกับที่บทความพูดถึง [5]
สรุป
ตัวเลข $0.003 ไม่ได้สำคัญเพราะมันถูกที่สุด แต่มันสำคัญเพราะมัน เปิดคำถามว่าเราเทียบราคาโมเดลกันถูกรึยัง
การเทียบจากราคาต่อโทเคนแบบเดิม มองไม่เห็นค่าใช้จ่ายที่กำลังเป็นก้อนใหญ่ที่สุดของงาน agent
และในตลาดที่ครึ่งหนึ่งของผู้ซื้อไม่ได้วัดต้นทุนตัวเอง ราคาที่ถูกกว่าอาจไม่ได้ทำให้ใครประหยัดขึ้นจริง
คำถามที่ผมคิดว่าควรถามคือ ต้นทุน AI ที่คุณจ่ายเดือนที่แล้ว มีกี่เปอร์เซ็นต์ที่มาจากการอ่าน context เดิมซ้ำ
ถ้าตอบไม่ได้ ลองเริ่มจากข้อนี้ก่อน แล้วคุณจะเห็นว่าทำไมตัวเลข $0.003 ถึงน่าสนใจ
หมายเหตุ: บทความนี้เป็นชิ้นที่ 2 จาก 2 ชิ้น ต่อจากเรื่องสถาปัตยกรรม KV cache
แหล่งอ้างอิง
[1] Franzen, C., "DeepSeek-V4.1-Flash debuts with $0.003/1M off-peak cached-input rate and benchmarks eclipsing GPT-5.6 Sol, Claude Opus 5", VentureBeat (10 ก.ย. 2026), https://venturebeat.com/technology/deepseek-v4-1-flash-debuts-with-0-003-1m-off-peak-cached-input-rate-and-benchmarks-eclipsing-gpt-5-6-sol-claude-opus-5
[2] DeepSeek, "DeepSeek-V4.1-Flash: Smarter, Faster, More Efficient", DeepSeek API Docs (10 ก.ย. 2026), https://api-docs.deepseek.com/news/news260910/
[3] Together AI (@togethercompute), "deepseek v4.1 flash has arrived on together ai", X (13 ก.ย. 2026), https://x.com/togethercompute/status/2098940684044562506
[4] DeepSeek-AI, "DeepSeek-V4.1-Flash" (model card, Hugging Face, 10 ก.ย. 2026), https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
[5] การเปิดเผยของผู้เขียน: บทความนี้เขียนโดยใช้ AI และโมเดลที่ใช้เป็นรุ่นเดียวกับที่บทความพูดถึง
Top comments (0)