DEV Community

Cover image for تسعير كيمي K3: تكاليف API وحسابات إصابة الكاش
Yusuf Khalidd
Yusuf Khalidd

Posted on • Originally published at apidog.com

تسعير كيمي K3: تكاليف API وحسابات إصابة الكاش

وصل Kimi K3 في 16 يوليو 2026. يبدو جدول التسعير بسيطًا، لكنه يتضمن سعرين مختلفين للإدخال: 0.30 دولار لكل مليون توكن لإدخال ضربة ذاكرة التخزين المؤقت (cache hit)، و3.00 دولارات لإدخال عدم الضربة (cache miss)، و15.00 دولارًا للمخرجات. الرقم الأهم لفاتورتك ليس سعر الإدخال المعلن وحده، بل معدل الإدخال المختلط الفعلي بعد احتساب التخزين المؤقت. في أعباء عمل البرمجة التي تعيد استخدام السياق، قد يقترب هذا المعدل كثيرًا من فئة 0.30 دولار. يوضح هذا الدليل كيفية حساب التكلفة، وقياس معدل الضربات، وتقليل الإنفاق عمليًا.

جرّب Apidog اليوم

ملخص سريع

أسعار نموذج kimi-k3 هي:

  • إدخال بضربة ذاكرة التخزين المؤقت: 0.30 دولار / مليون توكن
  • إدخال بدون ضربة ذاكرة التخزين المؤقت: 3.00 دولارات / مليون توكن
  • مخرجات: 15.00 دولارًا / مليون توكن

تذكر Moonshot أن معدل ضربات ذاكرة التخزين المؤقت يتجاوز 90% في أعباء عمل البرمجة عند استخدام بنية Mooncake غير المجمعة. عند هذا المعدل، لا تدفع 3.00 دولارات لكل مليون توكن إدخال؛ بل تدفع معدلًا مختلطًا يقارب 0.57 دولار لكل مليون توكن.

راقب استخدام التوكنات في كل استجابة عبر Apidog بدل الاعتماد على معدل عام معلن.

الأسعار المعلنة في جدول واحد

هذه هي الأسعار المنشورة لنموذج kimi-k3:

نوع التوكن السعر لكل مليون توكن
إدخال بضربة ذاكرة التخزين المؤقت $0.30
إدخال بدون ضربة ذاكرة التخزين المؤقت $3.00
المخرجات $15.00

الفروقات مهمة:

  • إدخال عدم الضربة أغلى 10 مرات من إدخال الضربة.
  • المخرجات أغلى 5 مرات من إدخال عدم الضربة.
  • المخرجات أغلى 50 مرة من إدخال الضربة.

لا تخطط للتكلفة بافتراض أن كل الإدخال يُحاسب بسعر 3.00 دولارات. وفي المقابل، لا تتعامل مع المخرجات كتفصيل ثانوي: غالبًا هي الجزء الذي يحتاج إلى ضبط مباشر.

للتعرف على النموذج، راجع ما هو Kimi K3. ولإعداد الطلبات وعنوان URL الأساسي ومقتطفات SDK، راجع دليل Kimi K3 API.

مخطط أسعار Kimi K3

لماذا يغير معدل ضربة ذاكرة التخزين المؤقت الحسابات؟

يحدث التخزين المؤقت للموجه عندما يعيد طلب جديد استخدام بادئة سبق إرسالها، مثل:

  • رسالة النظام.
  • تعريفات الأدوات.
  • تعليمات المشروع.
  • سياق المستودع.
  • أمثلة ثابتة داخل الموجه.

بدل إعادة معالجة هذه البادئة، يمكن للنموذج قراءتها من ذاكرة التخزين المؤقت، فتُحاسب توكناتها بسعر 0.30 دولار بدلًا من 3.00 دولارات.

تصف Moonshot تقديم Kimi K3 عبر بنية Mooncake غير المجمعة، التي تفصل مرحلتي التعبئة المسبقة والفك وتسمح بإعادة استخدام البادئات المخزنة مؤقتًا. وتفيد الشركة بمعدل ضربة يتجاوز 90% لأعباء عمل البرمجة.

احسب معدل الإدخال المختلط

استخدم المعادلة التالية:

معدل الإدخال المختلط =
(معدل الضربة × سعر إدخال الضربة) +
((1 - معدل الضربة) × سعر إدخال عدم الضربة)
Enter fullscreen mode Exit fullscreen mode

عند معدل ضربة 90%:

(0.90 × 0.30) + (0.10 × 3.00)
= 0.27 + 0.30
= 0.57 دولار لكل مليون توكن إدخال
Enter fullscreen mode Exit fullscreen mode

وعند معدل ضربة 95%:

(0.95 × 0.30) + (0.05 × 3.00)
= 0.285 + 0.15
= 0.435 دولار لكل مليون توكن إدخال
Enter fullscreen mode Exit fullscreen mode

يمكنك تحويل هذه المعادلة إلى دالة بسيطة لحساب السيناريوهات:

function blendedInputCostPerMillion(cacheHitRate) {
  const cacheHitPrice = 0.30;
  const cacheMissPrice = 3.00;

  return (
    cacheHitRate * cacheHitPrice +
    (1 - cacheHitRate) * cacheMissPrice
  );
}

console.log(blendedInputCostPerMillion(0.90)); // 0.57
console.log(blendedInputCostPerMillion(0.95)); // 0.435
Enter fullscreen mode Exit fullscreen mode

معدل 90% رقم مُبلغ عنه لأعباء عمل البرمجة، وليس ضمانًا لكل تطبيق. الدردشة ذات الموجهات المتغيرة باستمرار قد تحقق معدلًا أقل من وكيل برمجي يعيد استخدام نفس سياق المشروع.

مثال عملي: تكلفة مهمة برمجة وكيلية واحدة

افترض جلسة برمجة وكيلية تعمل على مستودع متوسط الحجم وتستخدم خلال عدة أدوار:

  • 2,000,000 توكن إدخال
  • 200,000 توكن مخرجات

السيناريو الأول: لا يوجد تخزين مؤقت

الإدخال:
2,000,000 × 3.00 / 1,000,000 = 6.00 دولارات

المخرجات:
200,000 × 15.00 / 1,000,000 = 3.00 دولارات

الإجمالي = 9.00 دولارات
Enter fullscreen mode Exit fullscreen mode

السيناريو الثاني: معدل ضربة ذاكرة تخزين مؤقت 90%

إدخال بضربة:
1,800,000 × 0.30 / 1,000,000 = 0.54 دولار

إدخال بدون ضربة:
200,000 × 3.00 / 1,000,000 = 0.60 دولار

إجمالي الإدخال = 1.14 دولار

المخرجات:
200,000 × 15.00 / 1,000,000 = 3.00 دولارات

الإجمالي = 4.14 دولارات
Enter fullscreen mode Exit fullscreen mode

النتيجة:

السيناريو تكلفة الإدخال تكلفة المخرجات الإجمالي
بدون تخزين مؤقت $6.00 $3.00 $9.00
بضربة 90% $1.14 $3.00 $4.14

خفض التخزين المؤقت إجمالي تكلفة المهمة من 9.00 دولارات إلى 4.14 دولارات، أي توفير يقارب 54%. لكن المخرجات بقيت ثابتة عند 3.00 دولارات، لأن التخزين المؤقت لا يمكنه خفض تكلفة نص لم يولّده النموذج بعد.

الإدخال رخيص نسبيًا، والمخرجات هي السعر المرتفع

لخفض فاتورة Kimi K3، ركز على جانبين: الحفاظ على التخزين المؤقت، وضبط طول المخرجات.

خطوات عملية تساعد

  1. اطلب مخرجات محددة وقصيرة

اطلب فرق الكود أو قائمة الإجراءات بدل شرح طويل غير مطلوب.

   أعد patch موحدًا فقط. لا تشرح التغييرات.
Enter fullscreen mode Exit fullscreen mode
  1. حدد max_tokens عند الإمكان

لا تترك حد المخرجات مفتوحًا إذا كانت المهمة تحتاج إجابة قصيرة.

   {
     "model": "kimi-k3",
     "max_tokens": 1200
   }
Enter fullscreen mode Exit fullscreen mode
  1. اجعل البادئة ثابتة على مستوى البايت

لا تعِد ترتيب تعليمات النظام أو تعريفات الأدوات أو السياق الثابت بين الأدوار. حتى التعديلات الصغيرة قد تمنع إعادة استخدام البادئة المخزنة مؤقتًا.

  1. أرسل المهام المرتبطة ضمن جلسة وسياق متسقين

بدل بدء سياق جديد لكل طلب، اجمع عمليات المستودع المرتبطة خلف بادئة دافئة واحدة.

ما لا يساعد غالبًا

لا تقلص سياق الإدخال المفيد فقط لتوفير المال. إذا كان الإدخال مخزنًا مؤقتًا، فهو رخيص نسبيًا. تقليل السياق قد يؤدي إلى إجابات أقل دقة، أو أسئلة توضيحية، أو مخرجات أطول وأكثر تكلفة.

نقاط مرجعية للأسعار: كيف يقارن Kimi K3؟

النموذج الإدخال لكل مليون المخرجات لكل مليون ملاحظات
Kimi K3 $0.30 ضربة / $3.00 عدم ضربة $15.00 سياق 1M، أوزان مفتوحة في حوالي 27 يوليو
Claude Opus 4.8 $5.00 $25.00 مستوى مميز؛ تحقق من الأسعار الحالية
GPT-5.6 Sol حوالي $5.00 حوالي $30.00 مستوى رائد؛ توجد مستويات GPT-5.6 أرخص
DeepSeek V4 مستوى القيمة مستوى القيمة تأكد من الأسعار الحالية

مقارنة بـ تسعير Claude Opus 4.8، فإن Kimi K3 أقل تكلفة في أسعار الإدخال والمخرجات المعلنة. في المثال السابق، تبلغ تكلفة Opus تقريبًا:

الإدخال:
2,000,000 × 5.00 / 1,000,000 = 10.00 دولارات

المخرجات:
200,000 × 25.00 / 1,000,000 = 5.00 دولارات

الإجمالي = 15.00 دولارًا
Enter fullscreen mode Exit fullscreen mode

مقابل 4.14 دولارات لـ Kimi K3 عند معدل ضربة 90%. هذه مقارنة توجيهية لأن Anthropic توفر تخزينًا مؤقتًا للموجهات قد يخفض تكلفة Opus كذلك.

مقارنة بـ تسعير GPT-5.6، فإن Kimi K3 أرخص من مستوى GPT-5.6 Sol المذكور بحوالي 5 دولارات للإدخال و30 دولارًا للمخرجات. لكن GPT-5.6 يقدم مستويات Terra وLuna أرخص، لذلك راجع الأسعار الحالية قبل اتخاذ قرار.

ومقارنة بـ تسعير DeepSeek V4، فأنت تقارن نموذجين من فئة القيمة. قد يتفوق DeepSeek V4 في سعر المخرجات الخام، بينما قد يفيد Kimi K3 أكثر عندما يكون عبء العمل كثيف الإدخال ويحقق معدل تخزين مؤقت مرتفعًا.

اختبار استخدام التوكنات مع Apidog

الحسابات النظرية لا تكفي. تحتاج إلى فحص كائن الاستخدام الذي يعيده Kimi K3 في استجاباتك، بما في ذلك:

  • توكنات الإدخال.
  • توكنات المخرجات.
  • توكنات ضربات ذاكرة التخزين المؤقت.

فحص استخدام التوكنات في Apidog

اتبع هذا المسار:

  1. افتح Apidog.
  2. اضبط عنوان URL الأساسي، وتوكن الحامل، ومعرف النموذج kimi-k3.
  3. أرسل طلبًا تمثيليًا من تطبيقك.
  4. أرسل الطلب نفسه مرة ثانية من دون تعديل البادئة.
  5. قارن كائن usage بين الاستجابتين.
  6. احسب معدل الضربة الفعلي ثم أدخله في معادلة التكلفة المختلطة.

بما أن Kimi K3 متوافق مع OpenAI SDK، يمكنك تنظيم الاختبارات مثل أي واجهة API من نمط OpenAI. احفظ أيضًا نفس الطلب مقابل kimi-k3 ومقابل نموذجك الحالي، ثم قارن الاستجابات وأعداد التوكنات على حركة المرور الفعلية.

إذا كنت تعمل داخل المحرر، يوضح دليل استخدام Apidog داخل VS Code كيفية إبقاء دورة الاختبار بجانب الكود. يمكنك تنزيل Apidog وإعداد مقارنة عملية خلال دقائق.

قائمة تحقق قبل الالتزام بالإنفاق

  • [ ] أرسل طلبات تمثل حركة المرور الفعلية، لا طلبات تجريبية قصيرة فقط.
  • [ ] قس نسبة توكنات ضربات ذاكرة التخزين المؤقت من كائن الاستخدام.
  • [ ] احسب معدل الإدخال المختلط بدل استخدام سعر 3.00 دولارات مباشرة.
  • [ ] حدد max_tokens حسب نوع المهمة.
  • [ ] ثبّت رسالة النظام وتعريفات الأدوات وسياق المشروع.
  • [ ] قارن تكلفة المهمة الكاملة، بما فيها المخرجات، بين النماذج.

الخلاصة

Kimi K3 رخيص نسبيًا في الإدخال ومكلف أكثر في المخرجات. إذا حقق تطبيقك معدل ضربة ذاكرة تخزين مؤقت مرتفعًا، فقد يقترب سعر الإدخال الفعلي من 0.30 دولار لكل مليون توكن بدل 3.00 دولارات.

لذلك، نفذ هذه الأولويات:

  1. أعد استخدام البادئات الثابتة.
  2. قس معدل الضربات الحقيقي في إنتاجك.
  3. اضبط طول المخرجات.
  4. قارن تكلفة المهمة الكاملة، وليس سعر التوكن المجرد.

يوفر Kimi K3 سياقًا بحجم 1 مليون، وسعرًا أقل من Claude Opus 4.8 في الأسعار المذكورة، وسعرًا أقل من GPT-5.6 Sol، مع منافسة محتملة من DeepSeek V4 حسب شكل حركة المرور. قبل الالتزام، نزّل Apidog، أرسل طلبات تمثيلية إلى kimi-k3، واقرأ تقسيم استخدام التوكنات مباشرة من الاستجابة.

الأسئلة الشائعة

كم تكلفة Kimi K3 API؟

تكلفة Kimi K3 عبر واجهة Moonshot المباشرة هي 0.30 دولار لكل مليون توكن إدخال بضربة ذاكرة التخزين المؤقت، و3.00 دولارات لإدخال عدم الضربة، و15.00 دولارًا للمخرجات. قد تعرض جهات خارجية مثل OpenRouter سعر إدخال ثابتًا قدره 3.00 دولارات ومخرجات بقيمة 15.00 دولارًا من دون مستوى منفصل لضربة التخزين المؤقت. راجع دليل Kimi K3 API لإعداد الطلب.

ما هو معدل ضربة ذاكرة التخزين المؤقت ولماذا هو مهم؟

هو نسبة توكنات الإدخال التي أعيد استخدامها من ذاكرة التخزين المؤقت بدل معالجتها من البداية. تذكر Moonshot معدلًا يتجاوز 90% لأعباء عمل البرمجة. أهميته أن توكنات الضربة تُحاسب بسعر 0.30 دولار بدل 3.00 دولارات. عند معدل 90%، يصبح معدل الإدخال المختلط نحو 0.57 دولار لكل مليون توكن.

هل Kimi K3 أرخص من Claude Opus 4.8؟

نعم، وفقًا للأسعار المذكورة. مخرجات Kimi K3 بسعر 15.00 دولارًا لكل مليون مقابل 25.00 دولارًا لـ Claude Opus 4.8، كما أن أسعار إدخاله أقل. في عينة تضم 2 مليون توكن إدخال و200 ألف مخرجات، تبلغ تكلفة Kimi K3 مع تخزين مؤقت بنسبة 90% نحو 4.14 دولارات مقابل نحو 15.00 دولارًا لـ Opus بالأسعار المعلنة. راجع تسعير Claude Opus 4.8 ومقارنة Kimi K3 وClaude Opus 4.8.

كيف يقارن تسعير Kimi K3 بـ GPT-5.6 وDeepSeek V4؟

Kimi K3 أرخص من GPT-5.6 Sol المذكور بحوالي 5 دولارات للإدخال و30 دولارًا للمخرجات، لكن GPT-5.6 يقدم مستويات Terra وLuna أرخص. DeepSeek V4 خيار قيمة آخر وقد يتفوق في سعر المخرجات الخام. تحقق من تسعير GPT-5.6 وتسعير DeepSeek V4 قبل اتخاذ القرار.

كيف يمكنني تخفيض فاتورة Kimi K3؟

ركز على المخرجات والتخزين المؤقت:

  • حدد max_tokens.
  • اطلب استجابات موجزة.
  • حافظ على ثبات رسالة النظام وتعريفات الأدوات وسياق البادئة.
  • أعد استخدام السياق في الطلبات المرتبطة.
  • لا تحذف سياقًا مفيدًا لمجرد تقليل الإدخال إذا كان هذا الإدخال يُخزَّن مؤقتًا.

كيف يمكنني التحقق من معدل ضربة ذاكرة التخزين المؤقت الحقيقي؟

افحص كائن الاستخدام في كل استجابة من Kimi K3. أرسل الطلب نفسه مرتين عبر Apidog، ثم قارن توكنات ضربات ذاكرة التخزين المؤقت بين الاستجابتين. استخدم النسبة الفعلية الناتجة في معادلة التكلفة المختلطة بدل افتراض معدل ثابت.

Top comments (0)