DEV Community

Cover image for 딥시크-V4-플래시 API 출시: 공식 API 사용 및 연동 가이드 (공개 베타)
Rihpig
Rihpig

Posted on • Originally published at apidog.com

딥시크-V4-플래시 API 출시: 공식 API 사용 및 연동 가이드 (공개 베타)

딥시크(DeepSeek)는 2026년 7월 31일 공식 DeepSeek-V4-Flash API를 출시했습니다. 공식 발표에 따르면 이번 업데이트의 핵심은 에이전트 기능 강화, OpenAI Responses API 네이티브 지원, 그리고 Codex 호환입니다.

지금 Apidog 사용해 보기

4월부터 deepseek-v4-flash를 사용했다면 프리뷰 버전을 호출하고 있었을 가능성이 높습니다. 이제 동일한 모델 이름이 공식 릴리스인 DeepSeek-V4-Flash-0731을 가리키므로, 기존 코드를 수정하지 않아도 자동으로 업그레이드됩니다.

이 글에서는 API 키 발급부터 첫 요청, 사고 모드 설정, 스트리밍, 가격 확인, 회귀 테스트까지 실제 구현 순서대로 다룹니다. DeepSeek V4 제품군이 처음이라면 먼저 DeepSeek V4란 무엇인가?를 확인하세요.

💡 API 키를 만든 뒤에는 애플리케이션 코드에 연결하기 전에 엔드포인트부터 검증하는 것이 좋습니다. Apidog에서는 DeepSeek API 요청을 보내고, 스트리밍 이벤트를 확인하고, 정상 요청을 재사용 가능한 테스트 케이스로 저장할 수 있습니다.

7월 31일에 실제로 출시된 것

공식 변경 로그에 따르면 이번 변경은 API 전용입니다. DeepSeek 앱, 웹 모델, V4-Pro API는 이번 릴리스 대상이 아닙니다.

  • DeepSeek-V4-Flash-0731은 V4-Flash 라인의 공식 공개 베타 릴리스입니다.
  • V4-Flash-Preview와 아키텍처 및 모델 크기는 같습니다. DeepSeek는 재사후 학습으로 성능을 개선했다고 설명합니다.
  • DeepSeek는 에이전트 벤치마크에서 V4-Pro-Preview를 넘어섰다고 보고했습니다.
    • Terminal Bench 2.1: 82.7
    • Cybergym: 76.7
    • Toolathlon 검증: 70.3
    • DeepSWE: 54.4
  • OpenAI Responses API와 Codex를 공식 지원합니다. 구현 방법은 DeepSeek-V4-Flash Responses API 및 Codex 가이드에서 확인할 수 있습니다.
  • DeepSeek-V4-Pro 공식 릴리스는 “곧 출시될 예정”이며, Responses API 및 Codex 지원은 2026년 8월 초에 제공될 것으로 예상됩니다.

벤치마크 수치는 DeepSeek 자체 평가 결과입니다. 특히 DSBench-FullStack 및 DSBench-Hard는 내부 테스트 세트이므로, 프로덕션 도입 전에는 자체 프롬프트와 테스트 데이터로 검증해야 합니다.

DeepSeek-V4-Flash 벤치마크

1단계: API 키 발급받기

DeepSeek 플랫폼에 로그인한 뒤 API 키 페이지에서 키를 생성합니다. 키는 sk-로 시작합니다.

키를 코드에 직접 작성하지 말고 환경 변수로 관리하세요.

export DEEPSEEK_API_KEY="sk-your-key-here"
Enter fullscreen mode Exit fullscreen mode

DeepSeek는 OpenAI 및 Anthropic 호환 형식을 지원하므로 전용 SDK가 반드시 필요하지는 않습니다.

형식 기본 URL
OpenAI 호환 https://api.deepseek.com
Anthropic 호환 https://api.deepseek.com/anthropic

2단계: 첫 요청 보내기

먼저 curl로 인증, 모델 이름, 네트워크 연결이 정상인지 확인하세요.

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {
        "role": "system",
        "content": "You are a helpful assistant."
      },
      {
        "role": "user",
        "content": "Summarize what changed in DeepSeek-V4-Flash-0731."
      }
    ],
    "stream": false
  }'
Enter fullscreen mode Exit fullscreen mode

Python: OpenAI SDK 사용

# pip install openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "system",
            "content": "You are a helpful assistant."
        },
        {
            "role": "user",
            "content": "Write a Python function that validates an email address."
        }
    ],
    stream=False
)

print(response.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

Node.js: OpenAI SDK 사용

// npm install openai
import OpenAI from "openai";

const openai = new OpenAI({
  baseURL: "https://api.deepseek.com",
  apiKey: process.env.DEEPSEEK_API_KEY,
});

const completion = await openai.chat.completions.create({
  model: "deepseek-v4-flash",
  messages: [
    { role: "user", content: "Hello!" }
  ],
});

console.log(completion.choices[0].message.content);
Enter fullscreen mode Exit fullscreen mode

기존에 deepseek-v4-flash를 사용 중이었다면 마이그레이션 작업은 필요하지 않습니다. 해당 모델 별칭이 이제 0731 공식 릴리스를 제공합니다.

3단계: 사고 모드와 추론 노력 제어

V4-Flash는 비사고 모드와 사고 모드를 모두 지원하며, 사고 모드가 기본값입니다.

  • thinking: 사고 모드 활성화 여부
  • reasoning_effort: 추론 깊이 조절

예를 들어 데이터베이스 마이그레이션처럼 복잡한 계획 작업에는 높은 추론 노력을 지정할 수 있습니다.

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "user",
            "content": "Plan a database migration from MySQL to Postgres."
        }
    ],
    reasoning_effort="high",
    extra_body={
        "thinking": {
            "type": "enabled"
        }
    }
)
Enter fullscreen mode Exit fullscreen mode

설정 시 다음 제한 사항을 확인하세요.

  • 사고 모드가 켜져 있으면 temperaturetop_p는 영향을 미치지 않습니다.
  • FIM(Fill-in-the-Middle) 완성 기능은 베타이며 비사고 모드에서만 작동합니다.

실무에서는 다음처럼 선택하면 됩니다.

작업 유형 권장 설정
자동 완성, 짧은 질의, 지연 시간 민감 기능 사고 모드 비활성화
에이전트 루프, 복잡한 분석, 디버깅 사고 모드 활성화 + 높은 reasoning_effort

4단계: 응답 스트리밍하기

stream: true를 지정하면 API는 SSE(Server-Sent Events) 형식으로 응답을 전송합니다. SSE 구조가 익숙하지 않다면 SSE로 LLM 응답 스트리밍하기를 참고하세요.

stream = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "user",
            "content": "Explain connection pooling."
        }
    ],
    stream=True
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")
Enter fullscreen mode Exit fullscreen mode

스트리밍을 구현할 때는 다음을 테스트하세요.

  1. 첫 번째 토큰이 도착하는 시간
  2. 연결 종료 및 재시도 처리
  3. 빈 델타 처리
  4. 사고 내용과 최종 답변 델타의 구분
  5. 프록시 또는 로드 밸런서의 SSE 버퍼링 여부

공개 베타 기간 동안의 가격

공식 모델 및 가격 페이지에 따르면 V4-Flash의 가격은 다음과 같습니다.

항목 deepseek-v4-flash deepseek-v4-pro
입력, 캐시 히트(100만 토큰당) $0.0028 $0.003625
입력, 캐시 미스(100만 토큰당) $0.14 $0.435
출력(100만 토큰당) $0.28 $0.87
컨텍스트 길이 100만 토큰 100만 토큰
최대 출력 384K 384K
동시성 제한 2,500 500

비용을 관리하려면 다음 세 가지를 확인하세요.

  1. 컨텍스트 캐싱은 자동 적용됩니다. 캐시 히트 비용은 캐시 미스보다 50배 낮습니다. 시스템 프롬프트를 반복 사용하는 에이전트 세션에서 특히 유리합니다.
  2. 피크 시간 정책을 확인하세요. DeepSeek는 베이징 시간 기준 9:00–12:00, 14:00–18:00 사용량에 일반 가격의 2배를 청구하는 정책을 발표했습니다. 7월 31일 기준 문서에는 적용 시점이 “공식 발표에 따름”으로 표시되어 있으므로, 실제 활성화 여부는 가격 페이지에서 확인해야 합니다.
  3. 동시성 제한을 배포 설계에 반영하세요. Flash는 2,500개, Pro는 500개의 동시 요청을 지원합니다. 워커 수, 큐, 재시도 정책을 이 한도에 맞춰 구성하세요.

V4-Pro 영구 가격 인하를 포함한 전체 가격 구조는 DeepSeek V4 API 가격 분석V4-Pro 영구 가격 인하에서 확인할 수 있습니다.

Apidog에서 API 테스트 및 디버깅

curl은 스모크 테스트에 적합하지만, 사고 모드별 응답 차이, 스트리밍 이벤트, 모델 업데이트 후 회귀 여부를 확인하려면 저장 가능한 테스트 환경이 필요합니다. Apidog에서는 다음 순서로 구성할 수 있습니다.

Apidog에서 DeepSeek API 테스트하기

  1. 프로젝트와 엔드포인트를 생성합니다.

    POST https://api.deepseek.com/chat/completions를 추가합니다. OpenAI 호환 명세를 가져와 여러 엔드포인트를 한 번에 구성할 수도 있습니다.

  2. 키를 환경 변수로 저장합니다.

    Apidog 환경에 DEEPSEEK_API_KEY를 추가하고 Authorization 헤더에 다음 값을 설정합니다.

   Bearer {{DEEPSEEK_API_KEY}}
Enter fullscreen mode Exit fullscreen mode

개발, 스테이징, 프로덕션 키는 별도 환경으로 관리하세요.

  1. 스트리밍 응답을 검사합니다.

    stream: true 요청을 실행한 뒤 SSE 이벤트가 도착하는 순서와 내용을 확인합니다. 추론과 최종 응답이 별도 델타로 전달되는지 검증할 수 있습니다.

  2. 변형 요청을 테스트 케이스로 저장합니다.

    사고 모드 활성화/비활성화 요청을 각각 저장하고, 모델이 업데이트될 때마다 다시 실행하세요. deepseek-v4-flash의 무음 업그레이드 이후에도 기존 프롬프트가 기대한 결과를 내는지 빠르게 확인할 수 있습니다.

Apidog를 무료로 다운로드하면 위 워크플로우를 무료 플랜에서 구성할 수 있습니다.

자주 묻는 질문

새 모델을 사용하려면 코드를 변경해야 하나요?

아니요. deepseek-v4-flash는 이제 DeepSeek-V4-Flash-0731을 가리킵니다. 기존 통합은 자동으로 새 릴리스를 사용합니다.

DeepSeek 앱과 동일한 모델인가요?

아니요. 7월 31일 업데이트는 API에만 적용됩니다. DeepSeek 앱과 웹 모델은 변경되지 않았습니다.

deepseek-chatdeepseek-reasoner는 어떻게 되었나요?

이 레거시 모델 이름은 2026년 7월 24일에 서비스 종료될 예정이었습니다. 새 구현에서는 deepseek-v4-flash 또는 deepseek-v4-pro를 사용하세요. 마이그레이션 절차는 DeepSeek V4 API 사용 방법에서 확인할 수 있습니다.

무료로 사용할 수 있나요?

DeepSeek API는 영구 무료 티어가 없는 종량제 서비스입니다. 다만 캐시 히트 비용이 낮아 반복 프롬프트 기반 실험 비용은 매우 낮을 수 있습니다. 현재 옵션은 DeepSeek V4 API를 무료로 사용하는 방법을 참고하세요.

V4-Flash는 Codex 및 Responses API와 작동하나요?

네. V4-Flash는 현재 Codex와 Responses API를 모두 지원하는 DeepSeek 모델입니다. V4-Pro 지원은 2026년 8월 초에 제공될 것으로 예상됩니다. 설정 방법은 Responses API 및 Codex 가이드에서 확인하세요.

결론

DeepSeek-V4-Flash-0731은 기존 모델 이름과 가격을 유지하면서 에이전트 성능, Responses API, Codex 호환성을 강화한 API 릴리스입니다.

도입 절차는 간단합니다.

  1. API 키를 환경 변수에 저장합니다.
  2. OpenAI SDK의 base_urlhttps://api.deepseek.com으로 설정합니다.
  3. deepseek-v4-flash로 스모크 테스트를 실행합니다.
  4. 사고 모드와 비사고 모드를 실제 워크로드로 비교합니다.
  5. 프롬프트와 스트리밍 요청을 테스트 케이스로 저장해 모델 업데이트마다 재검증합니다.

벤치마크 수치만으로 프로덕션 성능을 판단하지 말고, 자체 테스트 스위트로 지연 시간, 비용, 도구 호출, 출력 품질을 검증하세요. Apidog를 사용하면 이 검증 과정을 반복 가능한 API 테스트로 관리할 수 있습니다.

Top comments (0)