딥시크(DeepSeek)는 2026년 7월 31일 공식 DeepSeek-V4-Flash API를 출시했습니다. 공식 발표에 따르면 이번 업데이트의 핵심은 에이전트 기능 강화, OpenAI Responses API 네이티브 지원, 그리고 Codex 호환입니다.
4월부터 deepseek-v4-flash를 사용했다면 프리뷰 버전을 호출하고 있었을 가능성이 높습니다. 이제 동일한 모델 이름이 공식 릴리스인 DeepSeek-V4-Flash-0731을 가리키므로, 기존 코드를 수정하지 않아도 자동으로 업그레이드됩니다.
이 글에서는 API 키 발급부터 첫 요청, 사고 모드 설정, 스트리밍, 가격 확인, 회귀 테스트까지 실제 구현 순서대로 다룹니다. DeepSeek V4 제품군이 처음이라면 먼저 DeepSeek V4란 무엇인가?를 확인하세요.
💡 API 키를 만든 뒤에는 애플리케이션 코드에 연결하기 전에 엔드포인트부터 검증하는 것이 좋습니다. Apidog에서는 DeepSeek API 요청을 보내고, 스트리밍 이벤트를 확인하고, 정상 요청을 재사용 가능한 테스트 케이스로 저장할 수 있습니다.
7월 31일에 실제로 출시된 것
공식 변경 로그에 따르면 이번 변경은 API 전용입니다. DeepSeek 앱, 웹 모델, V4-Pro API는 이번 릴리스 대상이 아닙니다.
- DeepSeek-V4-Flash-0731은 V4-Flash 라인의 공식 공개 베타 릴리스입니다.
- V4-Flash-Preview와 아키텍처 및 모델 크기는 같습니다. DeepSeek는 재사후 학습으로 성능을 개선했다고 설명합니다.
- DeepSeek는 에이전트 벤치마크에서 V4-Pro-Preview를 넘어섰다고 보고했습니다.
- Terminal Bench 2.1: 82.7
- Cybergym: 76.7
- Toolathlon 검증: 70.3
- DeepSWE: 54.4
- OpenAI Responses API와 Codex를 공식 지원합니다. 구현 방법은 DeepSeek-V4-Flash Responses API 및 Codex 가이드에서 확인할 수 있습니다.
- DeepSeek-V4-Pro 공식 릴리스는 “곧 출시될 예정”이며, Responses API 및 Codex 지원은 2026년 8월 초에 제공될 것으로 예상됩니다.
벤치마크 수치는 DeepSeek 자체 평가 결과입니다. 특히 DSBench-FullStack 및 DSBench-Hard는 내부 테스트 세트이므로, 프로덕션 도입 전에는 자체 프롬프트와 테스트 데이터로 검증해야 합니다.
1단계: API 키 발급받기
DeepSeek 플랫폼에 로그인한 뒤 API 키 페이지에서 키를 생성합니다. 키는 sk-로 시작합니다.
키를 코드에 직접 작성하지 말고 환경 변수로 관리하세요.
export DEEPSEEK_API_KEY="sk-your-key-here"
DeepSeek는 OpenAI 및 Anthropic 호환 형식을 지원하므로 전용 SDK가 반드시 필요하지는 않습니다.
| 형식 | 기본 URL |
|---|---|
| OpenAI 호환 | https://api.deepseek.com |
| Anthropic 호환 | https://api.deepseek.com/anthropic |
2단계: 첫 요청 보내기
먼저 curl로 인증, 모델 이름, 네트워크 연결이 정상인지 확인하세요.
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "system",
"content": "You are a helpful assistant."
},
{
"role": "user",
"content": "Summarize what changed in DeepSeek-V4-Flash-0731."
}
],
"stream": false
}'
Python: OpenAI SDK 사용
# pip install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "system",
"content": "You are a helpful assistant."
},
{
"role": "user",
"content": "Write a Python function that validates an email address."
}
],
stream=False
)
print(response.choices[0].message.content)
Node.js: OpenAI SDK 사용
// npm install openai
import OpenAI from "openai";
const openai = new OpenAI({
baseURL: "https://api.deepseek.com",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const completion = await openai.chat.completions.create({
model: "deepseek-v4-flash",
messages: [
{ role: "user", content: "Hello!" }
],
});
console.log(completion.choices[0].message.content);
기존에 deepseek-v4-flash를 사용 중이었다면 마이그레이션 작업은 필요하지 않습니다. 해당 모델 별칭이 이제 0731 공식 릴리스를 제공합니다.
3단계: 사고 모드와 추론 노력 제어
V4-Flash는 비사고 모드와 사고 모드를 모두 지원하며, 사고 모드가 기본값입니다.
-
thinking: 사고 모드 활성화 여부 -
reasoning_effort: 추론 깊이 조절
예를 들어 데이터베이스 마이그레이션처럼 복잡한 계획 작업에는 높은 추론 노력을 지정할 수 있습니다.
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Plan a database migration from MySQL to Postgres."
}
],
reasoning_effort="high",
extra_body={
"thinking": {
"type": "enabled"
}
}
)
설정 시 다음 제한 사항을 확인하세요.
- 사고 모드가 켜져 있으면
temperature와top_p는 영향을 미치지 않습니다. - FIM(Fill-in-the-Middle) 완성 기능은 베타이며 비사고 모드에서만 작동합니다.
실무에서는 다음처럼 선택하면 됩니다.
| 작업 유형 | 권장 설정 |
|---|---|
| 자동 완성, 짧은 질의, 지연 시간 민감 기능 | 사고 모드 비활성화 |
| 에이전트 루프, 복잡한 분석, 디버깅 | 사고 모드 활성화 + 높은 reasoning_effort
|
4단계: 응답 스트리밍하기
stream: true를 지정하면 API는 SSE(Server-Sent Events) 형식으로 응답을 전송합니다. SSE 구조가 익숙하지 않다면 SSE로 LLM 응답 스트리밍하기를 참고하세요.
stream = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Explain connection pooling."
}
],
stream=True
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
스트리밍을 구현할 때는 다음을 테스트하세요.
- 첫 번째 토큰이 도착하는 시간
- 연결 종료 및 재시도 처리
- 빈 델타 처리
- 사고 내용과 최종 답변 델타의 구분
- 프록시 또는 로드 밸런서의 SSE 버퍼링 여부
공개 베타 기간 동안의 가격
공식 모델 및 가격 페이지에 따르면 V4-Flash의 가격은 다음과 같습니다.
| 항목 | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| 입력, 캐시 히트(100만 토큰당) | $0.0028 | $0.003625 |
| 입력, 캐시 미스(100만 토큰당) | $0.14 | $0.435 |
| 출력(100만 토큰당) | $0.28 | $0.87 |
| 컨텍스트 길이 | 100만 토큰 | 100만 토큰 |
| 최대 출력 | 384K | 384K |
| 동시성 제한 | 2,500 | 500 |
비용을 관리하려면 다음 세 가지를 확인하세요.
- 컨텍스트 캐싱은 자동 적용됩니다. 캐시 히트 비용은 캐시 미스보다 50배 낮습니다. 시스템 프롬프트를 반복 사용하는 에이전트 세션에서 특히 유리합니다.
- 피크 시간 정책을 확인하세요. DeepSeek는 베이징 시간 기준 9:00–12:00, 14:00–18:00 사용량에 일반 가격의 2배를 청구하는 정책을 발표했습니다. 7월 31일 기준 문서에는 적용 시점이 “공식 발표에 따름”으로 표시되어 있으므로, 실제 활성화 여부는 가격 페이지에서 확인해야 합니다.
- 동시성 제한을 배포 설계에 반영하세요. Flash는 2,500개, Pro는 500개의 동시 요청을 지원합니다. 워커 수, 큐, 재시도 정책을 이 한도에 맞춰 구성하세요.
V4-Pro 영구 가격 인하를 포함한 전체 가격 구조는 DeepSeek V4 API 가격 분석과 V4-Pro 영구 가격 인하에서 확인할 수 있습니다.
Apidog에서 API 테스트 및 디버깅
curl은 스모크 테스트에 적합하지만, 사고 모드별 응답 차이, 스트리밍 이벤트, 모델 업데이트 후 회귀 여부를 확인하려면 저장 가능한 테스트 환경이 필요합니다. Apidog에서는 다음 순서로 구성할 수 있습니다.
프로젝트와 엔드포인트를 생성합니다.
POST https://api.deepseek.com/chat/completions를 추가합니다. OpenAI 호환 명세를 가져와 여러 엔드포인트를 한 번에 구성할 수도 있습니다.키를 환경 변수로 저장합니다.
Apidog 환경에DEEPSEEK_API_KEY를 추가하고 Authorization 헤더에 다음 값을 설정합니다.
Bearer {{DEEPSEEK_API_KEY}}
개발, 스테이징, 프로덕션 키는 별도 환경으로 관리하세요.
스트리밍 응답을 검사합니다.
stream: true요청을 실행한 뒤 SSE 이벤트가 도착하는 순서와 내용을 확인합니다. 추론과 최종 응답이 별도 델타로 전달되는지 검증할 수 있습니다.변형 요청을 테스트 케이스로 저장합니다.
사고 모드 활성화/비활성화 요청을 각각 저장하고, 모델이 업데이트될 때마다 다시 실행하세요.deepseek-v4-flash의 무음 업그레이드 이후에도 기존 프롬프트가 기대한 결과를 내는지 빠르게 확인할 수 있습니다.
Apidog를 무료로 다운로드하면 위 워크플로우를 무료 플랜에서 구성할 수 있습니다.
자주 묻는 질문
새 모델을 사용하려면 코드를 변경해야 하나요?
아니요. deepseek-v4-flash는 이제 DeepSeek-V4-Flash-0731을 가리킵니다. 기존 통합은 자동으로 새 릴리스를 사용합니다.
DeepSeek 앱과 동일한 모델인가요?
아니요. 7월 31일 업데이트는 API에만 적용됩니다. DeepSeek 앱과 웹 모델은 변경되지 않았습니다.
deepseek-chat과 deepseek-reasoner는 어떻게 되었나요?
이 레거시 모델 이름은 2026년 7월 24일에 서비스 종료될 예정이었습니다. 새 구현에서는 deepseek-v4-flash 또는 deepseek-v4-pro를 사용하세요. 마이그레이션 절차는 DeepSeek V4 API 사용 방법에서 확인할 수 있습니다.
무료로 사용할 수 있나요?
DeepSeek API는 영구 무료 티어가 없는 종량제 서비스입니다. 다만 캐시 히트 비용이 낮아 반복 프롬프트 기반 실험 비용은 매우 낮을 수 있습니다. 현재 옵션은 DeepSeek V4 API를 무료로 사용하는 방법을 참고하세요.
V4-Flash는 Codex 및 Responses API와 작동하나요?
네. V4-Flash는 현재 Codex와 Responses API를 모두 지원하는 DeepSeek 모델입니다. V4-Pro 지원은 2026년 8월 초에 제공될 것으로 예상됩니다. 설정 방법은 Responses API 및 Codex 가이드에서 확인하세요.
결론
DeepSeek-V4-Flash-0731은 기존 모델 이름과 가격을 유지하면서 에이전트 성능, Responses API, Codex 호환성을 강화한 API 릴리스입니다.
도입 절차는 간단합니다.
- API 키를 환경 변수에 저장합니다.
- OpenAI SDK의
base_url을https://api.deepseek.com으로 설정합니다. -
deepseek-v4-flash로 스모크 테스트를 실행합니다. - 사고 모드와 비사고 모드를 실제 워크로드로 비교합니다.
- 프롬프트와 스트리밍 요청을 테스트 케이스로 저장해 모델 업데이트마다 재검증합니다.
벤치마크 수치만으로 프로덕션 성능을 판단하지 말고, 자체 테스트 스위트로 지연 시간, 비용, 도구 호출, 출력 품질을 검증하세요. Apidog를 사용하면 이 검증 과정을 반복 가능한 API 테스트로 관리할 수 있습니다.


Top comments (0)