DeepSeek a lancé l’API officielle DeepSeek-V4-Flash ce matin. L’annonce a été faite le 31 juillet 2026, et les notes de version précisent trois changements : les capacités d’agent ont été améliorées, le modèle prend désormais en charge nativement l’API Responses d’OpenAI, et il fonctionne avec Codex dès le premier jour.
Essayez Apidog dès aujourd’hui
Si vous appeliez déjà deepseek-v4-flash depuis avril, vous utilisiez la préversion. Cette publication fait passer le modèle à la version officielle, DeepSeek-V4-Flash-0731, sans migration : le nom du modèle reste deepseek-v4-flash.
Ce guide montre comment :
- créer une clé API ;
- effectuer un premier appel avec
curl, Python ou Node.js ; - activer ou désactiver le mode de réflexion ;
- diffuser les réponses avec SSE ;
- tester les variantes de requêtes ;
- estimer les coûts pendant la bêta publique.
Si vous découvrez la gamme DeepSeek, consultez d’abord Qu’est-ce que DeepSeek V4 ?.
💡 Une fois votre clé créée, testez vos requêtes avant de les intégrer à votre application. Apidog permet d’envoyer des appels à l’API DeepSeek, d’inspecter les réponses SSE événement par événement et d’enregistrer les requêtes fonctionnelles comme tests réutilisables.
Ce qui a réellement été livré le 31 juillet
Selon le journal des modifications officiel, cette version concerne uniquement l’API. L’application DeepSeek, les modèles web et l’API V4-Pro restent inchangés.
Points essentiels :
- DeepSeek-V4-Flash-0731 est la version officielle de V4-Flash, disponible en bêta publique via l’API.
- Le modèle conserve la même architecture et la même taille que V4-Flash-Preview. DeepSeek indique qu’il a été ré-entraîné : les gains annoncés proviennent donc de l’entraînement, pas d’un réseau plus grand.
- DeepSeek annonce de meilleurs résultats d’agent que V4-Pro-Preview : Terminal Bench 2.1 à 82,7, Cybergym à 76,7, Toolathlon vérifié à 70,3 et DeepSWE à 54,4.
- Le modèle prend nativement en charge l’API Responses et l’intégration Codex. Consultez DeepSeek-V4-Flash prend désormais en charge l’API de réponses et Codex pour la configuration.
- La version officielle de DeepSeek-V4-Pro doit suivre. Le journal des modifications prévoit la prise en charge de l’API Responses et de Codex pour V4-Pro début août 2026.
Les scores de benchmark proviennent des évaluations publiées par DeepSeek. Deux jeux de tests mentionnés, DSBench-FullStack et DSBench-Hard, sont internes ; attendez des résultats indépendants avant de conclure sur vos propres cas d’usage.
Étape 1 : obtenir votre clé API
- Ouvrez la plateforme DeepSeek.
- Connectez-vous.
- Créez une clé depuis la page Clés API.
- Stockez-la dans une variable d’environnement.
Les clés commencent par sk-. Évitez de les coder en dur dans votre dépôt :
export DEEPSEEK_API_KEY="sk-your-key-here"
L’API DeepSeek est compatible avec les formats OpenAI et Anthropic. Vous pouvez donc utiliser les SDK existants sans SDK DeepSeek spécifique.
| Format | URL de base |
|---|---|
| Compatible OpenAI | https://api.deepseek.com |
| Compatible Anthropic | https://api.deepseek.com/anthropic |
Étape 2 : effectuer votre premier appel
Tester avec curl
Commencez par un appel non-streaming pour vérifier la clé, l’URL de base et le modèle :
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "system",
"content": "Tu es un assistant utile."
},
{
"role": "user",
"content": "Résume les changements de DeepSeek-V4-Flash-0731."
}
],
"stream": false
}'
Utiliser le SDK OpenAI en Python
Installez le SDK :
pip3 install openai
Puis configurez l’URL DeepSeek :
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "system",
"content": "Tu es un assistant utile.",
},
{
"role": "user",
"content": "Écris une fonction Python qui valide une adresse e-mail.",
},
],
stream=False,
)
print(response.choices[0].message.content)
Utiliser le SDK OpenAI en Node.js
Installez le package :
npm install openai
Créez ensuite votre client :
import OpenAI from "openai";
const openai = new OpenAI({
baseURL: "https://api.deepseek.com",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const completion = await openai.chat.completions.create({
model: "deepseek-v4-flash",
messages: [
{
role: "user",
content: "Bonjour !",
},
],
});
console.log(completion.choices[0].message.content);
Le nom deepseek-v4-flash cible maintenant la version 0731. Si vous utilisiez déjà la préversion avec ce nom, votre intégration reçoit automatiquement le nouveau modèle.
Étape 3 : contrôler le mode de réflexion et l’effort de raisonnement
V4-Flash prend en charge deux modes :
- mode de réflexion, activé par défaut ;
- mode sans réflexion, utile lorsque la latence est prioritaire.
Contrôlez le mode avec thinking et la profondeur de raisonnement avec reasoning_effort :
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Planifie une migration de base de données de MySQL vers PostgreSQL.",
}
],
reasoning_effort="high",
extra_body={
"thinking": {
"type": "enabled",
}
},
)
Avant de modifier ces paramètres, retenez deux contraintes :
-
temperatureettop_pn’ont aucun effet lorsque le mode de réflexion est activé. - La complétion FIM (fill-in-the-middle), encore en bêta, fonctionne uniquement en mode sans réflexion.
Choisissez le mode selon votre charge :
| Cas d’usage | Réglage recommandé |
|---|---|
| Autocomplétion, interface temps réel, faible latence | Désactiver la réflexion |
| Débogage, planification, agents multi-étapes | Activer la réflexion |
| Tâches de raisonnement complexes | reasoning_effort="high" |
Étape 4 : diffuser la réponse en continu avec SSE
Définissez stream=True pour recevoir les événements envoyés par le serveur (SSE) au fil de la génération.
stream = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Explique le fonctionnement du pooling de connexions.",
}
],
stream=True,
)
for chunk in stream:
content = chunk.choices[0].delta.content
if content:
print(content, end="")
Pour comprendre et déboguer le format SSE, consultez ce guide sur le streaming des réponses LLM avec les événements envoyés par le serveur.
Tarification pendant la bêta publique
D’après la page officielle Modèles et Tarification, les tarifs affichés sont les suivants :
| Élément | deepseek-v4-flash |
deepseek-v4-pro |
|---|---|---|
| Entrée, succès de cache (par 1 M de jetons) | $0.0028 | $0.003625 |
| Entrée, échec de cache (par 1 M de jetons) | $0.14 | $0.435 |
| Sortie (par 1 M de jetons) | $0.28 | $0.87 |
| Longueur de contexte | 1 M de jetons | 1 M de jetons |
| Sortie maximale | 384 K | 384 K |
| Limite de concurrence | 2 500 | 500 |
Trois implications pratiques :
- La mise en cache du contexte est automatique. Un succès de cache coûte 50 fois moins qu’un échec. Les agents qui réutilisent une longue invite système peuvent donc réduire fortement leurs coûts.
- Une tarification heures pleines/heures creuses est annoncée. DeepSeek indique que les créneaux 9 h–12 h et 14 h–18 h, heure de Pékin, pourraient être facturés deux fois le prix normal. Au 31 juillet, cette mesure n’était pas encore active : surveillez la page de tarification.
- La concurrence est plus élevée pour Flash. Avec 2 500 requêtes simultanées contre 500 pour Pro, Flash semble conçu pour des flottes d’agents à haut débit.
Pour comparer les coûts de la famille V4, consultez l’historique de la baisse de prix permanente du V4-Pro et notre analyse des tarifs de l’API DeepSeek V4.
Tester et déboguer l’API dans Apidog
curl suffit pour vérifier un appel isolé. Pour comparer les réponses avec et sans réflexion, inspecter un flux SSE ou rejouer des tests après une mise à jour du modèle, utilisez un client API avec des environnements et des requêtes enregistrées.
Voici un flux de travail rapide dans Apidog :
Créez un projet et ajoutez l’endpoint.
AjoutezPOST https://api.deepseek.com/chat/completions. Vous pouvez aussi importer une spécification compatible OpenAI pour créer plusieurs endpoints en une fois.Ajoutez la clé dans un environnement.
Créez la variableDEEPSEEK_API_KEY, puis définissez l’en-tête :
Authorization: Bearer {{DEEPSEEK_API_KEY}}
Vous pouvez ainsi basculer entre une clé de test et une clé de production sans modifier la requête.
Créez deux requêtes de comparaison.
Enregistrez une variante avec réflexion activée et une autre avec réflexion désactivée. Utilisez le même prompt pour comparer latence, structure et qualité des réponses.Inspectez les flux SSE.
Pour les appels streaming, observez les événements au fur et à mesure de leur arrivée au lieu de lire manuellement des lignesdata:brutes.Transformez les requêtes validées en tests.
Réexécutez vos prompts après chaque mise à jour du modèle. Cela permet de détecter rapidement un changement de comportement lié à une mise à jour silencieuse dedeepseek-v4-flash.
Téléchargez Apidog gratuitement pour mettre en place ce flux de test.
FAQ
Dois-je modifier mon code pour obtenir le nouveau modèle ?
Non. Le nom deepseek-v4-flash sert désormais DeepSeek-V4-Flash-0731. Les intégrations existantes sont mises à jour automatiquement.
Est-ce le même modèle que dans l’application DeepSeek ?
Non. La mise à jour du 31 juillet concerne uniquement l’API. Les modèles de l’application et du web restent inchangés.
Que sont devenus deepseek-chat et deepseek-reasoner ?
Ces noms de modèles hérités devaient être abandonnés le 24 juillet 2026. Utilisez deepseek-v4-flash ou deepseek-v4-pro. Consultez le guide sur l’utilisation de l’API DeepSeek V4 pour la migration.
Puis-je utiliser l’API gratuitement ?
L’API DeepSeek est facturée à l’usage et ne propose pas de niveau gratuit permanent. La tarification avec succès de cache peut toutefois réduire fortement le coût des expérimentations. Consultez comment utiliser l’API DeepSeek V4 gratuitement pour les options actuelles.
V4-Flash fonctionne-t-il avec Codex et l’API Responses ?
Oui. Au moment de cette annonce, V4-Flash est le seul modèle DeepSeek à prendre en charge les deux. La prise en charge de V4-Pro est attendue début août 2026. Retrouvez la configuration dans le guide sur l’API Responses et Codex.
En résumé
DeepSeek-V4-Flash-0731 conserve le même nom de modèle, la même architecture et les mêmes prix que la préversion, tout en apportant des améliorations annoncées sur les charges de travail d’agent. Le support de l’API Responses et de Codex cible clairement les intégrations d’agents à forte concurrence.
Pour l’adopter :
- créez une clé ;
- pointez votre SDK OpenAI vers
https://api.deepseek.com; - testez
deepseek-v4-flashavec vos propres prompts ; - comparez les modes de réflexion ;
- enregistrez vos scénarios de régression.
Ne vous fiez pas uniquement aux benchmarks publiés : exécutez votre propre suite de tests. Apidog peut accélérer ce cycle en enregistrant vos prompts comme cas de test et en les rejouant à chaque mise à jour du modèle.


Top comments (0)