غادر DeepSeek V4 Pro مرحلة المعاينة في 12 أغسطس 2026. إصدار التوفر العام (GA) بختم 0813 متاح الآن عبر نقطة نهاية deepseek-v4-pro، مع نافذة سياق تبلغ مليون رمز، وحد إخراج يصل إلى 384 ألف رمز، وسعر إدخال يبدأ من 0.003625 دولار لكل مليون رمز عند إصابة ذاكرة التخزين المؤقت. وكما ذكرت Unite.AI، أصبح النموذج الذي أمضى أربعة أشهر في المعاينة هو النموذج الرائد لـ DeepSeek.
يركز هذا الدليل على التنفيذ العملي: إرسال أول طلب عبر OpenAI SDK، اختيار وضع التفكير، التعامل مع reasoning_content، البث المتدفق، استدعاء الأدوات، وحساب تكلفة التخزين المؤقت للموجهات. للخلفية المعمارية، راجع ما هو DeepSeek V4 أولًا.
ملخص
- استخدم
deepseek-v4-proللوصول إلى لقطة GA0813اعتبارًا من 12 أغسطس 2026. - الواجهة متوافقة مع OpenAI: اضبط
base_urlعلىhttps://api.deepseek.comثم استخدمmodel="deepseek-v4-pro". - يدعم النموذج نافذة سياق من مليون رمز، وحد إخراج 384 ألف رمز، وأوضاع
non-thinkوthink highوthink max. - تبلغ تكلفة الإدخال 0.435 دولار/مليون رمز عند فقد ذاكرة التخزين المؤقت، و0.003625 دولار/مليون عند الإصابة. تكلفة الإخراج 0.87 دولار/مليون رمز.
- التخزين المؤقت تلقائي للبادئات المتكررة؛ ضع المحتوى الثابت في بداية الموجه.
- اختبر الطلبات والبث وبيئات Pro/Flash قبل الإنتاج باستخدام Apidog.
ما الذي يغيره إصدار GA 0813 للمطورين؟
افتتحت المعاينة في أبريل 2026، ثم صدر V4 Flash في يوليو، وأصبح V4 Pro متاحًا عمومًا في 12 أغسطس كلقطة 0813.
عمليًا، يعني ذلك:
-
لقطة أكثر استقرارًا: الإصدار
0813هدف ثابت للتقييمات وضبط الموجهات إلى أن تعلن DeepSeek لقطة جديدة. -
اسم مستعار للإنتاج: استدعِ
deepseek-v4-proعبر API الرسمية. ولتثبيت اللقطة صراحةً، يسردها OpenRouter باسمdeepseek/deepseek-v4-pro-0813. - توفر سطح الميزات الكامل: أوضاع التفكير، استدعاء الوظائف، المخرجات المهيكلة، تخزين الموجهات مؤقتًا، وتنسيقات OpenAI وAnthropic وResponses.
تحت الغطاء، V4 Pro نموذج مزيج خبراء بإجمالي 1.6 تريليون معلمة و49 مليار معلمة نشطة لكل رمز. يستخدم "الانتباه المتفرق المضغوط" و"الانتباه المضغوط بشدة"، ما يخفض حساب الاستدلال لرمز واحد إلى 27% من V3.2 وذاكرة KV إلى 10%.
DeepSeek V4 Pro 0813: المواصفات
| المواصفة | DeepSeek V4 Pro 0813 |
|---|---|
| الإصدار | التوفر العام في 12 أغسطس 2026، لقطة 0813
|
| المعمارية | مزيج خبراء، 1.6 تريليون معلمة إجمالية، 49 مليار نشطة لكل رمز |
| الانتباه | الانتباه المتفرق المضغوط + الانتباه المضغوط بشدة |
| تكلفة الاستدلال مقابل V3.2 | 27% من حساب الرمز الواحد، 10% من ذاكرة KV |
| نافذة السياق | 1,000,000 رمز |
| الحد الأقصى للإخراج | 384 ألف رمز |
| أوضاع التفكير |
non-think، think high، think max
|
| سعر الإدخال | 0.435 دولار/مليون رمز عند الفقد، 0.003625 دولار/مليون عند الإصابة |
| سعر الإخراج | 0.87 دولار/مليون رمز |
| تنسيقات API | OpenAI Chat Completions، Anthropic Messages، DeepSeek Responses |
| معرف النموذج | deepseek-v4-pro |
| النموذج الأصغر |
deepseek-v4-flash، 284 مليار إجمالي / 13 مليار نشط |
تسرد بطاقة نموذج DeepSeek نسبًا مثل SWE-bench Verified بنسبة 80.6% وTerminal Bench 2.0 بنسبة 67.9% وGPQA Diamond بنسبة 90.1%. هذه أرقام أعلنها البائع ولم تتحقق منها جهة خارجية بعد، لذا شغّل تقييماتك على مهامك الفعلية قبل الترحيل.
احصل على مفتاح API وأرسل أول طلب
نفّذ الخطوات التالية:
- أنشئ حسابًا في platform.deepseek.com وأضف رصيدًا.
- أنشئ مفتاح API وانسخه فورًا.
- خزّنه في متغير بيئة بدلًا من وضعه داخل الكود:
export DEEPSEEK_API_KEY="sk-..."
استخدم حزمة openai القياسية. يعمل كل من https://api.deepseek.com وhttps://api.deepseek.com/v1 كعنوان أساسي؛ المسار /v1 للتوافق البروتوكولي وليس إصدارًا للنموذج.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "system", "content": "You are a concise technical assistant."},
{
"role": "user",
"content": "Explain idempotency in REST APIs in two sentences.",
},
],
)
print(response.choices[0].message.content)
print(response.usage)
سجّل response.usage من أول يوم. عند وجود فرق كبير بين تكلفة إصابة وفقد ذاكرة التخزين المؤقت، تصبح محاسبة الرموز جزءًا من مراقبة التكلفة.
لاختبار سريع عبر HTTP:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "List three ways to version a REST API."}
]
}'
راجع وثائق DeepSeek الرسمية لمعلمات Anthropic Messages وواجهة DeepSeek Responses.
العمل مع أوضاع التفكير
يوفر V4 Pro ثلاثة أوضاع:
-
non-think: إجابة مباشرة؛ مناسب للتصنيف والاستخراج والتنسيق والملخصات. -
think high: يعيد التفكير فيreasoning_contentقبل الإجابة؛ مناسب للترميز وتصحيح الأخطاء والتحليل متعدد الخطوات. -
think max: أعلى ميزانية تفكير؛ استخدمه للمشكلات الصعبة فقط.
اضبط الوضع عبر reasoning_effort:
response = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high", # "none" | "high" | "max"
messages=[
{
"role": "user",
"content": (
"Our API returns 502s under load but only behind the CDN. "
"Walk through likely causes in order of probability."
),
},
],
)
message = response.choices[0].message
print("--- Reasoning ---")
print(message.reasoning_content)
print("--- Answer ---")
print(message.content)
نقطتان مهمتان:
- لا تضف
reasoning_contentإلى سجل المحادثة في الطلب التالي؛ أعد إرسالcontentفقط. - رموز التفكير تُحاسب كرموز إخراج بسعر 0.87 دولار/مليون، لذلك يزيد
think maxالتكلفة وزمن الاستجابة.
الاستجابات المتدفقة
فعّل البث للطلبات الطويلة عبر stream=True. في أوضاع التفكير، تصل أجزاء reasoning_content أولًا، ثم تبدأ أجزاء الإجابة في content.
stream = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high",
stream=True,
messages=[
{
"role": "user",
"content": (
"Design a rate limiter for a public API. "
"Compare token bucket and sliding window."
),
},
],
)
for chunk in stream:
if not chunk.choices:
continue # قد تحتوي القطعة النهائية على usage فقط
delta = chunk.choices[0].delta
if getattr(delta, "reasoning_content", None):
print(delta.reasoning_content, end="", flush=True)
elif delta.content:
print(delta.content, end="", flush=True)
في واجهة المستخدم، اعرض التفكير في قسم مطوي أو مؤشر "جارٍ التفكير"، ثم انتقل إلى الإجابة عند وصول content. يعتمد ذلك على Server-Sent Events؛ راجع دليل تدفق استجابات API باستخدام SSE للتفاصيل.
استدعاء الأدوات والمخرجات المهيكلة
يدعم النموذج استدعاء الوظائف بأسلوب OpenAI. عرّف الأداة، افحص tool_calls، نفّذ الاستدعاء في خدمتك، ثم أضف النتيجة إلى المحادثة.
tools = [{
"type": "function",
"function": {
"name": "get_endpoint_status",
"description": "Check the health of an internal API endpoint",
"parameters": {
"type": "object",
"properties": {
"endpoint": {
"type": "string",
"description": "Path, e.g. /v1/orders",
}
},
"required": ["endpoint"],
},
},
}]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "user",
"content": "Is /v1/orders healthy right now?",
}
],
tools=tools,
)
print(response.choices[0].message.tool_calls)
استخدم response_format عند الحاجة إلى JSON قابل للتحليل. راجع الوثائق الرسمية لتفاصيل رسائل الأدوات وحلقات التنفيذ متعددة الخطوات.
اقتصاديات التخزين المؤقت للموجهات
يخزن DeepSeek بادئات الموجهات المتكررة مؤقتًا تلقائيًا. لا تحتاج إلى رؤوس تحكم أو إعداد TTL. تكلفة الإدخال المتكرر هي 0.003625 دولار/مليون رمز بدلًا من 0.435 دولار/مليون، أي خصم يبلغ 120 مرة تقريبًا.
مثال: وكيل برمجة يحتفظ بسياق مستودع حجمه 200 ألف رمز ويجري 50 استدعاءً:
-
بدون تخزين مؤقت:
50 × 200,000 × 0.435 / 1,000,000≈ 4.35 دولار إدخال. - مع التخزين المؤقت: فقد واحد ≈ 0.087 دولار، و49 إصابة ≈ 0.0007 دولار لكل منها، بإجمالي يقارب 0.12 دولار.
لتحقيق ذلك، رتّب الموجه بهذا الشكل:
- المحتوى الثابت أولًا: تعليمات النظام، الوثائق، سياق المستودع.
- المحتوى المتغير أخيرًا: رسالة المستخدم الأخيرة، الطوابع الزمنية، معرفات الطلب.
أي تغيير مبكر يبطل البادئة المخزنة مؤقتًا من موضع التغيير. تجنب، مثلًا، وضع طابع زمني متغير في رسالة النظام.
ملء نافذة سياق مليون رمز يكلف 0.435 دولار عند الفقد، لكن إعادة استخدام البادئة نفسها تكلف نحو ثلث سنت لكل استدعاء. للمزيد، راجع ما هو التخزين المؤقت للموجهات.
اختبار deepseek-v4-pro في Apidog
اختبر التكامل قبل ربطه بتدفقات الإنتاج. بما أن API متوافقة مع OpenAI، يتعامل Apidog معها دون إعداد خاص.
اتبع هذا التدفق:
-
استورد الطلب: الصق أمر
curlالسابق في Apidog لتحويله إلى طلب قابل للتعديل مع تحليل تلقائي للرؤوس والمصادقة والنص. -
أنشئ بيئتين: أنشئ بيئة لـ Pro وأخرى لـ Flash. خزّن
base_urlوالمفتاح واسم النموذج كمتغيرات. -
اختبر البث: أرسل
"stream": trueوافحص تسلسل أحداث SSE ووصولreasoning_contentقبل الإجابة. - احفظ مجموعة اختبارات: عند صدور لقطة جديدة، أعد تشغيل الطلبات نفسها وقارن السلوك والتكلفة قبل الترقية.
افحص كتلة usage في كل استجابة لقياس أثر تغييرات بنية الموجه على إصابات ذاكرة التخزين المؤقت.
التسعير اليوم والزيادة القادمة
| النموذج | الإدخال: فقد | الإدخال: إصابة ذاكرة التخزين المؤقت | الإخراج |
|---|---|---|---|
deepseek-v4-pro |
0.435 دولار/مليون | 0.003625 دولار/مليون | 0.87 دولار/مليون |
deepseek-v4-flash |
0.14 دولار/مليون | — | 0.28 دولار/مليون |
في 6 أغسطس 2026، حذرت DeepSeek من زيادة "كبيرة" قادمة في أسعار API، دون تحديد أرقام أو تاريخ سريان. تعامل مع ذلك عمليًا:
- قس تكلفة كل مهمة الآن باستخدام
usageمن أحمال العمل الحقيقية. - حسّن ترتيب الموجهات لزيادة إصابات ذاكرة التخزين المؤقت.
- احتفظ بـ V4 Flash لمسارات التصنيف والاستخراج والدردشة البسيطة عالية الحجم.
- وجّه المهام حسب صعوبتها، لا حسب نموذج واحد ثابت.
راجع دليل تسعير DeepSeek V4 API لمقارنة أعمق.
الأسئلة الشائعة
هل سيعمل كود OpenAI SDK الحالي دون تغيير؟
تقريبًا. غيّر base_url إلى https://api.deepseek.com، استبدل مفتاح API، واضبط:
model="deepseek-v4-pro"
تتبع Chat Completions والبث والأدوات والمخرجات المهيكلة صيغ OpenAI. ويمكن لمستخدمي Anthropic SDK استخدام نقطة نهاية DeepSeek Anthropic Messages.
متى أستخدم V4 Flash بدلًا من V4 Pro؟
استخدم Flash للتصنيف والاستخراج والدردشة البسيطة والمهام الحساسة لزمن الاستجابة. استخدم Pro للترميز المعقد وتحليل السياق الطويل وأوضاع التفكير.
هل يمكن استخدام V4 Pro 0813 في Cursor؟
نعم. يقبل Cursor نقاط نهاية مخصصة متوافقة مع OpenAI، لذا يمكن استخدام إصدار GA كنموذج مخصص. راجع كيفية استخدام DeepSeek V4 Pro مع Cursor.
الخلاصة
ابدأ بالمفتاح وأول طلب، ثم اختبر أوضاع التفكير والبث واستدعاء الأدوات. بعد ذلك، ركّز على بنية الموجه: خصم التخزين المؤقت البالغ 120 مرة يجعل ترتيب المحتوى قرارًا معماريًا مباشرًا.
راقب usage، احفظ مجموعة اختبارات في Apidog، وأعد التحقق من السلوك عند صدور لقطة جديدة أو تغير الأسعار.


Top comments (0)