DEV Community

Cover image for L'API DeepSeek-V4-Flash est en ligne : Guide d'utilisation de l'API officielle (Bêta Publique)
Antoine Laurent
Antoine Laurent

Posted on • Originally published at apidog.com

L'API DeepSeek-V4-Flash est en ligne : Guide d'utilisation de l'API officielle (Bêta Publique)

DeepSeek a lancé l’API officielle DeepSeek-V4-Flash ce matin. L’annonce a été faite le 31 juillet 2026, et les notes de version précisent trois changements : les capacités d’agent ont été améliorées, le modèle prend désormais en charge nativement l’API Responses d’OpenAI, et il fonctionne avec Codex dès le premier jour.

Essayez Apidog dès aujourd’hui

Si vous appeliez déjà deepseek-v4-flash depuis avril, vous utilisiez la préversion. Cette publication fait passer le modèle à la version officielle, DeepSeek-V4-Flash-0731, sans migration : le nom du modèle reste deepseek-v4-flash.

Ce guide montre comment :

  • créer une clé API ;
  • effectuer un premier appel avec curl, Python ou Node.js ;
  • activer ou désactiver le mode de réflexion ;
  • diffuser les réponses avec SSE ;
  • tester les variantes de requêtes ;
  • estimer les coûts pendant la bêta publique.

Si vous découvrez la gamme DeepSeek, consultez d’abord Qu’est-ce que DeepSeek V4 ?.

💡 Une fois votre clé créée, testez vos requêtes avant de les intégrer à votre application. Apidog permet d’envoyer des appels à l’API DeepSeek, d’inspecter les réponses SSE événement par événement et d’enregistrer les requêtes fonctionnelles comme tests réutilisables.

Ce qui a réellement été livré le 31 juillet

Selon le journal des modifications officiel, cette version concerne uniquement l’API. L’application DeepSeek, les modèles web et l’API V4-Pro restent inchangés.

Points essentiels :

  • DeepSeek-V4-Flash-0731 est la version officielle de V4-Flash, disponible en bêta publique via l’API.
  • Le modèle conserve la même architecture et la même taille que V4-Flash-Preview. DeepSeek indique qu’il a été ré-entraîné : les gains annoncés proviennent donc de l’entraînement, pas d’un réseau plus grand.
  • DeepSeek annonce de meilleurs résultats d’agent que V4-Pro-Preview : Terminal Bench 2.1 à 82,7, Cybergym à 76,7, Toolathlon vérifié à 70,3 et DeepSWE à 54,4.
  • Le modèle prend nativement en charge l’API Responses et l’intégration Codex. Consultez DeepSeek-V4-Flash prend désormais en charge l’API de réponses et Codex pour la configuration.
  • La version officielle de DeepSeek-V4-Pro doit suivre. Le journal des modifications prévoit la prise en charge de l’API Responses et de Codex pour V4-Pro début août 2026.

Les scores de benchmark proviennent des évaluations publiées par DeepSeek. Deux jeux de tests mentionnés, DSBench-FullStack et DSBench-Hard, sont internes ; attendez des résultats indépendants avant de conclure sur vos propres cas d’usage.

Résultats et annonce DeepSeek V4 Flash

Étape 1 : obtenir votre clé API

  1. Ouvrez la plateforme DeepSeek.
  2. Connectez-vous.
  3. Créez une clé depuis la page Clés API.
  4. Stockez-la dans une variable d’environnement.

Les clés commencent par sk-. Évitez de les coder en dur dans votre dépôt :

export DEEPSEEK_API_KEY="sk-your-key-here"
Enter fullscreen mode Exit fullscreen mode

L’API DeepSeek est compatible avec les formats OpenAI et Anthropic. Vous pouvez donc utiliser les SDK existants sans SDK DeepSeek spécifique.

Format URL de base
Compatible OpenAI https://api.deepseek.com
Compatible Anthropic https://api.deepseek.com/anthropic

Étape 2 : effectuer votre premier appel

Tester avec curl

Commencez par un appel non-streaming pour vérifier la clé, l’URL de base et le modèle :

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {
        "role": "system",
        "content": "Tu es un assistant utile."
      },
      {
        "role": "user",
        "content": "Résume les changements de DeepSeek-V4-Flash-0731."
      }
    ],
    "stream": false
  }'
Enter fullscreen mode Exit fullscreen mode

Utiliser le SDK OpenAI en Python

Installez le SDK :

pip3 install openai
Enter fullscreen mode Exit fullscreen mode

Puis configurez l’URL DeepSeek :

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("DEEPSEEK_API_KEY"),
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "system",
            "content": "Tu es un assistant utile.",
        },
        {
            "role": "user",
            "content": "Écris une fonction Python qui valide une adresse e-mail.",
        },
    ],
    stream=False,
)

print(response.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

Utiliser le SDK OpenAI en Node.js

Installez le package :

npm install openai
Enter fullscreen mode Exit fullscreen mode

Créez ensuite votre client :

import OpenAI from "openai";

const openai = new OpenAI({
  baseURL: "https://api.deepseek.com",
  apiKey: process.env.DEEPSEEK_API_KEY,
});

const completion = await openai.chat.completions.create({
  model: "deepseek-v4-flash",
  messages: [
    {
      role: "user",
      content: "Bonjour !",
    },
  ],
});

console.log(completion.choices[0].message.content);
Enter fullscreen mode Exit fullscreen mode

Le nom deepseek-v4-flash cible maintenant la version 0731. Si vous utilisiez déjà la préversion avec ce nom, votre intégration reçoit automatiquement le nouveau modèle.

Étape 3 : contrôler le mode de réflexion et l’effort de raisonnement

V4-Flash prend en charge deux modes :

  • mode de réflexion, activé par défaut ;
  • mode sans réflexion, utile lorsque la latence est prioritaire.

Contrôlez le mode avec thinking et la profondeur de raisonnement avec reasoning_effort :

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "user",
            "content": "Planifie une migration de base de données de MySQL vers PostgreSQL.",
        }
    ],
    reasoning_effort="high",
    extra_body={
        "thinking": {
            "type": "enabled",
        }
    },
)
Enter fullscreen mode Exit fullscreen mode

Avant de modifier ces paramètres, retenez deux contraintes :

  • temperature et top_p n’ont aucun effet lorsque le mode de réflexion est activé.
  • La complétion FIM (fill-in-the-middle), encore en bêta, fonctionne uniquement en mode sans réflexion.

Choisissez le mode selon votre charge :

Cas d’usage Réglage recommandé
Autocomplétion, interface temps réel, faible latence Désactiver la réflexion
Débogage, planification, agents multi-étapes Activer la réflexion
Tâches de raisonnement complexes reasoning_effort="high"

Étape 4 : diffuser la réponse en continu avec SSE

Définissez stream=True pour recevoir les événements envoyés par le serveur (SSE) au fil de la génération.

stream = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "user",
            "content": "Explique le fonctionnement du pooling de connexions.",
        }
    ],
    stream=True,
)

for chunk in stream:
    content = chunk.choices[0].delta.content

    if content:
        print(content, end="")
Enter fullscreen mode Exit fullscreen mode

Pour comprendre et déboguer le format SSE, consultez ce guide sur le streaming des réponses LLM avec les événements envoyés par le serveur.

Tarification pendant la bêta publique

D’après la page officielle Modèles et Tarification, les tarifs affichés sont les suivants :

Élément deepseek-v4-flash deepseek-v4-pro
Entrée, succès de cache (par 1 M de jetons) $0.0028 $0.003625
Entrée, échec de cache (par 1 M de jetons) $0.14 $0.435
Sortie (par 1 M de jetons) $0.28 $0.87
Longueur de contexte 1 M de jetons 1 M de jetons
Sortie maximale 384 K 384 K
Limite de concurrence 2 500 500

Trois implications pratiques :

  1. La mise en cache du contexte est automatique. Un succès de cache coûte 50 fois moins qu’un échec. Les agents qui réutilisent une longue invite système peuvent donc réduire fortement leurs coûts.
  2. Une tarification heures pleines/heures creuses est annoncée. DeepSeek indique que les créneaux 9 h–12 h et 14 h–18 h, heure de Pékin, pourraient être facturés deux fois le prix normal. Au 31 juillet, cette mesure n’était pas encore active : surveillez la page de tarification.
  3. La concurrence est plus élevée pour Flash. Avec 2 500 requêtes simultanées contre 500 pour Pro, Flash semble conçu pour des flottes d’agents à haut débit.

Pour comparer les coûts de la famille V4, consultez l’historique de la baisse de prix permanente du V4-Pro et notre analyse des tarifs de l’API DeepSeek V4.

Tester et déboguer l’API dans Apidog

curl suffit pour vérifier un appel isolé. Pour comparer les réponses avec et sans réflexion, inspecter un flux SSE ou rejouer des tests après une mise à jour du modèle, utilisez un client API avec des environnements et des requêtes enregistrées.

Interface de test DeepSeek dans Apidog

Voici un flux de travail rapide dans Apidog :

  1. Créez un projet et ajoutez l’endpoint.

    Ajoutez POST https://api.deepseek.com/chat/completions. Vous pouvez aussi importer une spécification compatible OpenAI pour créer plusieurs endpoints en une fois.

  2. Ajoutez la clé dans un environnement.

    Créez la variable DEEPSEEK_API_KEY, puis définissez l’en-tête :

   Authorization: Bearer {{DEEPSEEK_API_KEY}}
Enter fullscreen mode Exit fullscreen mode

Vous pouvez ainsi basculer entre une clé de test et une clé de production sans modifier la requête.

  1. Créez deux requêtes de comparaison.

    Enregistrez une variante avec réflexion activée et une autre avec réflexion désactivée. Utilisez le même prompt pour comparer latence, structure et qualité des réponses.

  2. Inspectez les flux SSE.

    Pour les appels streaming, observez les événements au fur et à mesure de leur arrivée au lieu de lire manuellement des lignes data: brutes.

  3. Transformez les requêtes validées en tests.

    Réexécutez vos prompts après chaque mise à jour du modèle. Cela permet de détecter rapidement un changement de comportement lié à une mise à jour silencieuse de deepseek-v4-flash.

Téléchargez Apidog gratuitement pour mettre en place ce flux de test.

FAQ

Dois-je modifier mon code pour obtenir le nouveau modèle ?

Non. Le nom deepseek-v4-flash sert désormais DeepSeek-V4-Flash-0731. Les intégrations existantes sont mises à jour automatiquement.

Est-ce le même modèle que dans l’application DeepSeek ?

Non. La mise à jour du 31 juillet concerne uniquement l’API. Les modèles de l’application et du web restent inchangés.

Que sont devenus deepseek-chat et deepseek-reasoner ?

Ces noms de modèles hérités devaient être abandonnés le 24 juillet 2026. Utilisez deepseek-v4-flash ou deepseek-v4-pro. Consultez le guide sur l’utilisation de l’API DeepSeek V4 pour la migration.

Puis-je utiliser l’API gratuitement ?

L’API DeepSeek est facturée à l’usage et ne propose pas de niveau gratuit permanent. La tarification avec succès de cache peut toutefois réduire fortement le coût des expérimentations. Consultez comment utiliser l’API DeepSeek V4 gratuitement pour les options actuelles.

V4-Flash fonctionne-t-il avec Codex et l’API Responses ?

Oui. Au moment de cette annonce, V4-Flash est le seul modèle DeepSeek à prendre en charge les deux. La prise en charge de V4-Pro est attendue début août 2026. Retrouvez la configuration dans le guide sur l’API Responses et Codex.

En résumé

DeepSeek-V4-Flash-0731 conserve le même nom de modèle, la même architecture et les mêmes prix que la préversion, tout en apportant des améliorations annoncées sur les charges de travail d’agent. Le support de l’API Responses et de Codex cible clairement les intégrations d’agents à forte concurrence.

Pour l’adopter :

  1. créez une clé ;
  2. pointez votre SDK OpenAI vers https://api.deepseek.com ;
  3. testez deepseek-v4-flash avec vos propres prompts ;
  4. comparez les modes de réflexion ;
  5. enregistrez vos scénarios de régression.

Ne vous fiez pas uniquement aux benchmarks publiés : exécutez votre propre suite de tests. Apidog peut accélérer ce cycle en enregistrant vos prompts comme cas de test et en les rejouant à chaque mise à jour du modèle.

Top comments (0)