DeepSeek V4 Pro는 2026년 8월 12일 미리보기 단계를 종료했습니다. 0813으로 표기된 GA 빌드는 이제 deepseek-v4-pro API 엔드포인트를 제공하며, 100만 토큰 컨텍스트 창, 최대 384K 토큰 출력, 캐시 적중 시 백만 토큰당 $0.003625라는 입력 가격을 지원합니다. Unite.AI가 보도한 바와 같이, 4개월간 미리보기로 제공된 이 모델은 이제 DeepSeek의 주력 모델이 되었습니다.
출시 보도 자료는 무엇이 출시되었는지는 알려주지만, 실제로 어떻게 호출하는지는 설명하지 않습니다. 이 가이드에서는 OpenAI SDK를 사용한 첫 요청부터 사고 모드, reasoning_content, 스트리밍, 도구 호출, 프롬프트 캐싱 비용 계산까지 실제 구현에 필요한 내용을 다룹니다. 아키텍처 배경이 먼저 궁금하다면 DeepSeek V4란 무엇인가를 먼저 읽어보세요.
핵심 요약
- DeepSeek-V4-Pro-0813은 2026년 8월 12일 기준
deepseek-v4-pro엔드포인트의 GA 스냅샷입니다. - API는 OpenAI와 호환됩니다.
openaiSDK의base_url을https://api.deepseek.com으로 지정하고model="deepseek-v4-pro"를 설정하면 됩니다. - Anthropic Messages 형식과 DeepSeek 자체 Responses API도 지원합니다.
- 1M 토큰 컨텍스트, 최대 384K 출력, 세 가지 사고 모드를 제공합니다.
non-thinkthink highthink max
- 가격은 다음과 같습니다.
- 입력 캐시 미스: $0.435/M 토큰
- 입력 캐시 적중: $0.003625/M 토큰
- 출력: $0.87/M 토큰
- 반복되는 프롬프트 접두사에는 캐싱이 자동 적용됩니다.
- DeepSeek은 8월 6일 API 가격이 “상당히” 인상될 수 있다고 경고했지만, 구체적인 금액과 날짜는 발표하지 않았습니다.
- 운영 시스템에 연결하기 전에 Apidog에서 엔드포인트와 SSE 스트림을 테스트하고, Pro와 Flash 환경을 나란히 유지하는 것이 좋습니다.
GA 빌드 0813이 개발자에게 제공하는 변화
DeepSeek V4 Pro 미리보기는 2026년 4월에 시작되었고, 작은 모델인 V4 Flash는 7월에 출시되었습니다. 8월 12일에는 DeepSeek의 날짜 스탬프 규칙에 따라 Pro 모델이 0813 빌드로 GA 단계에 진입했습니다. v3-0324가 V3 스냅샷을 나타낸 것과 같은 방식입니다.
GA 전환으로 달라지는 점은 다음과 같습니다.
스냅샷이 안정적입니다.
미리보기 모델은 예고 없이 변경될 수 있어 평가 결과와 프롬프트 튜닝을 무효화할 수 있습니다.0813빌드는 DeepSeek이 새 스냅샷을 발표할 때까지 고정된 목표로 사용할 수 있습니다.프로덕션 별칭을 사용합니다.
공식 API에서는deepseek-v4-pro를 호출하면 0813 빌드를 사용합니다. 스냅샷을 명시적으로 고정하려면 OpenRouter의deepseek/deepseek-v4-pro-0813모델을 사용할 수 있습니다.주요 기능이 활성화되었습니다.
사고 모드, 함수 호출, 구조화된 출력, 프롬프트 캐싱, OpenAI·Anthropic·Responses 형식이 GA 엔드포인트에서 활성화됩니다.
내부적으로 V4 Pro는 총 1.6조 개의 매개변수와 토큰당 490억 개의 활성 매개변수를 사용하는 전문가 혼합(Mixture-of-Experts) 모델입니다. Compressed Sparse Attention과 Heavily Compressed Attention을 사용해 단일 토큰 추론 연산 비용을 V3.2 대비 27%로, KV 캐시를 10%로 줄였습니다. 이러한 KV 캐시 감소 덕분에 1M 토큰 컨텍스트를 제공할 수 있습니다.
DeepSeek V4 Pro 0813 사양
| 사양 | DeepSeek V4 Pro 0813 |
|---|---|
| 출시 | 2026년 8월 12일 GA (0813 스냅샷) |
| 아키텍처 | 전문가 혼합, 총 1.6조 개 매개변수, 토큰당 490억 개 활성 |
| 어텐션 | Compressed Sparse Attention + Heavily Compressed Attention |
| V3.2 대비 추론 비용 | 단일 토큰 연산의 27%, KV 캐시의 10% |
| 컨텍스트 창 | 1,000,000 토큰 |
| 최대 출력 | 384K 토큰 |
| 사고 모드 | 비사고(non-think), 고사고(think high), 최대사고(think max) |
| 입력 가격 | $0.435/M 토큰(캐시 미스), $0.003625/M 토큰(캐시 적중) |
| 출력 가격 | $0.87/M 토큰 |
| API 형식 | OpenAI Chat Completions, Anthropic Messages, DeepSeek Responses |
| 모델 ID | deepseek-v4-pro |
| 하위 모델 |
deepseek-v4-flash — 총 2840억 / 활성 130억, 입력 $0.14/M, 출력 $0.28/M |
DeepSeek 자체 모델 카드에는 최대 사고 구성인 V4-Pro-Max의 성능을 다음과 같이 제시합니다.
- SWE-bench Verified: 80.6%
- Terminal Bench 2.0: 67.9%
- GPQA Diamond: 90.1%
- LiveCodeBench: 93.5%
이 수치는 아직 제3자가 검증하지 않은 공급업체 자체 보고 수치입니다. 중요한 시스템을 마이그레이션하기 전에는 작업별 평가를 직접 실행하세요.
API 키 발급과 첫 요청
설정은 다음 순서로 진행합니다.
- DeepSeek 플랫폼에서 계정을 생성하고 크레딧을 충전합니다. API는 선불 방식입니다.
- API 키를 생성하고 즉시 복사합니다. 키는 한 번만 표시됩니다.
- 키를 코드에 직접 입력하지 말고 환경 변수로 저장합니다.
export DEEPSEEK_API_KEY="sk-..."
DeepSeek API는 OpenAI Chat Completions 프로토콜을 사용하므로 표준 openai 패키지를 사용할 수 있습니다. https://api.deepseek.com과 https://api.deepseek.com/v1 모두 작동하며, /v1은 프로토콜 호환성을 위한 경로이지 모델 버전을 의미하지 않습니다.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "system",
"content": "You are a concise technical assistant.",
},
{
"role": "user",
"content": "Explain idempotency in REST APIs in two sentences.",
},
],
)
print(response.choices[0].message.content)
print(response.usage)
처음부터 response.usage를 기록하세요. 이 모델은 캐시 적중 여부에 따라 입력 비용 차이가 크기 때문에, 예상 토큰 수와 실제 청구량이 달라질 수 있습니다.
원시 HTTP 요청은 스모크 테스트나 API 도구로 가져올 때 유용합니다.
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "List three ways to version a REST API."}
]
}'
전체 매개변수와 메시지 형식은 공식 DeepSeek 문서에서 확인할 수 있습니다. Anthropic SDK나 Claude Code를 사용하는 팀은 Anthropic 호환 엔드포인트를 사용할 수도 있습니다.
세 가지 사고 모드 사용하기
V4 Pro는 추론을 별도 모델이 아닌 모드로 노출합니다.
-
비사고(
non-think): 가장 빠르고 저렴합니다. 추출, 분류, 형식 지정, 요약에 적합합니다. -
고사고(
think high): 답변 전에 추론하며, 추론 내용은reasoning_content필드로 반환됩니다. 코딩, 디버깅, 다단계 분석에 적합합니다. -
최대사고(
think max): 가장 큰 추론 예산을 사용합니다. 복잡한 문제에만 사용하세요.
이 모드는 표준 reasoning_effort 매개변수에 매핑됩니다.
response = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high", # "none" | "high" | "max"
messages=[
{
"role": "user",
"content": (
"Our API returns 502s under load but only behind the CDN. "
"Walk through likely causes in order of probability."
),
},
],
)
message = response.choices[0].message
print("--- Reasoning ---")
print(message.reasoning_content)
print("--- Answer ---")
print(message.content)
두 가지를 기억하세요.
-
reasoning_content를 다음 대화 턴의 메시지에 다시 넣지 마세요. 이전 턴의content만 전달해야 합니다. - 추론 토큰은 출력 토큰으로 청구되며 가격은 $0.87/M 토큰입니다.
think max는 비용과 지연 시간을 모두 증가시킬 수 있으므로 작업에 맞는 모드를 선택하세요.
스트리밍 응답 처리
최대 384K 출력과 긴 추론을 지원하므로, 사용자에게 결과를 즉시 보여주려면 스트리밍을 사용하는 편이 좋습니다. reasoning_content와 content 델타를 모두 처리해야 합니다.
stream = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high",
stream=True,
messages=[
{
"role": "user",
"content": (
"Design a rate limiter for a public API. "
"Compare token bucket and sliding window."
),
},
],
)
for chunk in stream:
if not chunk.choices:
continue # 사용량 정보만 포함하는 마지막 청크일 수 있음
delta = chunk.choices[0].delta
if getattr(delta, "reasoning_content", None):
print(delta.reasoning_content, end="", flush=True)
elif delta.content:
print(delta.content, end="", flush=True)
UI에서는 추론 델타를 접을 수 있는 “생각 중” 영역에 표시하고, content 델타가 시작되면 일반 답변 렌더링으로 전환할 수 있습니다. 내부적으로는 표준 서버 전송 이벤트(SSE)입니다. 자세한 내용은 SSE로 API 응답 스트리밍하기를 참고하세요.
도구 호출과 구조화된 출력
V4 Pro는 OpenAI 스타일의 함수 호출을 지원합니다. 기존 에이전트 루프는 일반적으로 다음 순서로 이식할 수 있습니다.
- 도구를 정의합니다.
-
tool_calls를 확인합니다. - 애플리케이션에서 도구를 실행합니다.
- 도구 결과를 메시지에 추가합니다.
- 다음 모델 호출을 수행합니다.
tools = [
{
"type": "function",
"function": {
"name": "get_endpoint_status",
"description": "Check the health of an internal API endpoint",
"parameters": {
"type": "object",
"properties": {
"endpoint": {
"type": "string",
"description": "Path, e.g. /v1/orders",
}
},
"required": ["endpoint"],
},
},
}
]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "user", "content": "Is /v1/orders healthy right now?"}
],
tools=tools,
)
print(response.choices[0].message.tool_calls)
파싱 가능한 JSON이 필요하면 표준 response_format 매개변수를 사용하세요. 메시지 형식의 세부 사항은 공식 문서에서 확인할 수 있습니다.
프롬프트 캐싱 비용 계산하기
V4 Pro에서 벤치마크만큼 중요한 사양이 프롬프트 캐싱입니다. DeepSeek은 프롬프트 접두사를 자동으로 캐시하므로 별도의 캐시 제어 헤더나 TTL 설정이 필요하지 않습니다.
반복되는 접두사는 다음 가격으로 청구됩니다.
- 캐시 미스: $0.435/M 토큰
- 캐시 적중: $0.003625/M 토큰
이는 이미 처리한 입력에 대해 약 120배 저렴한 가격입니다.
예를 들어 200K 토큰의 저장소 컨텍스트를 유지하고, 한 세션에서 50번 호출하는 코딩 에이전트를 생각해 보겠습니다.
- 캐싱 없음:
50 × 200K × $0.435/M ≈ $4.35 - 자동 캐싱 적용:
캐시 미스 1회
$0.087+ 캐시 적중 49회(각 약$0.0007) ≈$0.12
같은 세션에서 입력 비용이 약 35배 저렴해집니다. 핵심은 프롬프트 구조입니다.
[안정적인 콘텐츠]
- 시스템 프롬프트
- 문서
- 저장소 컨텍스트
[변경되는 콘텐츠]
- 사용자의 최신 메시지
- 타임스탬프
- 요청 ID
안정적인 내용을 앞에 배치하고 변경되는 내용을 뒤에 배치하세요. 프롬프트 앞부분이 변경되면 해당 지점부터 캐시된 접두사가 무효화됩니다. 예를 들어 시스템 프롬프트에 타임스탬프를 포함하면 모든 호출이 전체 가격의 캐시 미스로 전환될 수 있습니다.
따라서 1M 컨텍스트는 단순히 큰 입력을 한 번 보내는 기능이 아닙니다. 캐시 미스 시에는 $0.435가 들지만, 안정적인 세션 접두사로 재사용하면 호출당 약 0.33센트가 청구됩니다. 프롬프트 캐싱의 일반적인 개념은 프롬프트 캐싱이란 무엇인가를 참고하세요.
Apidog에서 deepseek-v4-pro 테스트하기
프로덕션 코드에 연결하기 전에 API 요청과 스트림을 먼저 검사하세요. DeepSeek API는 OpenAI와 호환되므로 Apidog에서 별도 처리 없이 테스트할 수 있습니다.
1. 엔드포인트 가져오기
앞에서 사용한 curl 명령을 Apidog에 붙여넣으면 편집 가능한 요청으로 변환할 수 있습니다. 헤더, 인증, 요청 본문을 확인하고 필요에 따라 수정하세요.
2. Pro와 Flash 환경 만들기
base_url과 API 키를 환경 변수로 저장하고 모델 이름도 변수로 관리하세요.
MODEL=deepseek-v4-pro
이렇게 하면 deepseek-v4-pro와 deepseek-v4-flash를 클릭 한 번으로 전환할 수 있습니다. 같은 프롬프트를 두 모델에 실행해 Pro의 품질이 Flash보다 높은 비용을 정당화하는지 비교할 수 있습니다.
3. SSE 스트림 검사하기
"stream": true로 요청을 보내면 Apidog에서 원시 data: 라인 대신 이벤트 스트림을 타임라인으로 확인할 수 있습니다. 델타가 병합되는 과정과 reasoning_content가 답변보다 먼저 도착하는지도 확인할 수 있습니다.
think max 호출이 느리게 느껴질 때는 이 타임라인으로 지연 시간이 추론 단계에 사용되는지 확인할 수 있습니다.
4. 요청을 컬렉션으로 저장하기
테스트 세션을 컬렉션으로 저장하면 DeepSeek이 다음 스냅샷을 출시했을 때 동일한 요청을 다시 실행해 동작을 비교할 수 있습니다. 스냅샷 업그레이드 전후의 응답, 지연 시간, 사용량을 같은 조건에서 비교할 수 있습니다.
응답 뷰어의 usage 블록은 프롬프트 구조를 조정하면서 캐시 적중 여부를 확인하는 데도 유용합니다.
현재 가격과 예정된 인상
두 V4 엔드포인트의 현재 정가는 다음과 같습니다.
| 모델 | 입력(캐시 미스) | 입력(캐시 적중) | 출력 |
|---|---|---|---|
deepseek-v4-pro |
$0.435/M | $0.003625/M | $0.87/M |
deepseek-v4-flash |
$0.14/M | - | $0.28/M |
Pro 가격은 서구의 선도 모델보다 훨씬 저렴하지만, 가격 변경 가능성은 고려해야 합니다. 2026년 8월 6일, GA 출시 6일 전에 DeepSeek은 API 가격이 “상당히” 인상될 수 있다고 경고했습니다. 구체적인 금액과 적용 날짜는 발표되지 않았습니다.
현재 가격을 기준으로 다음과 같이 대비할 수 있습니다.
- 실제 작업 부하의
usage데이터를 수집해 작업당 비용을 계산합니다. - 캐시 적중률을 높여 가격 인상 이후에도 접두사 재사용의 이점을 유지합니다.
-
deepseek-v4-flash를 라우팅 대체 모델로 유지합니다. - 분류, 추출, 간단한 채팅처럼 깊은 추론이 필요 없는 요청은 Flash로 보냅니다.
- 에이전트 코딩, 긴 컨텍스트 분석, 사고 모드가 필요한 요청에만 Pro를 사용합니다.
가격 구조와 공급업체별 비교는 DeepSeek V4 API 가격 가이드를 참고하세요.
FAQ
기존 OpenAI SDK 코드가 변경 없이 작동할까요?
대부분의 경우 그렇습니다. 다음 세 가지만 변경하세요.
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
)
Chat Completions, 스트리밍, 도구 호출, 구조화된 출력은 OpenAI 형식을 따릅니다. Anthropic SDK를 사용하는 팀은 DeepSeek의 Anthropic Messages 엔드포인트를 사용할 수 있습니다.
V4 Pro 대신 V4 Flash는 언제 사용해야 할까요?
Flash는 대량 처리 모델입니다. 분류, 추출, 간단한 채팅, 지연 시간에 민감하고 깊은 추론이 필요하지 않은 작업에 적합합니다.
Pro는 에이전트 코딩, 긴 컨텍스트 분석, 사고 모드가 필요한 작업에 사용하세요. 모델에 대한 선호보다 작업 유형과 비용을 기준으로 라우팅하는 것이 좋습니다.
Cursor에서 V4 Pro 0813을 사용할 수 있나요?
Cursor는 사용자 지정 OpenAI 호환 엔드포인트를 허용하므로 GA 빌드를 사용자 지정 모델로 사용할 수 있습니다. 설정 방법은 Cursor에서 DeepSeek V4 Pro를 사용하는 방법을 참고하세요.
마무리
DeepSeek V4 Pro를 도입할 때는 다음 순서로 검증하세요.
- OpenAI SDK 또는
curl로 기본 요청을 보냅니다. -
response.usage를 기록해 실제 토큰 사용량을 확인합니다. - 작업에 맞게 사고 모드를 선택합니다.
- 긴 응답에는 스트리밍을 적용합니다.
- 도구 호출과 구조화된 출력이 필요한지 확인합니다.
- 안정적인 프롬프트 접두사를 앞에 배치해 캐시 적중률을 높입니다.
- Apidog 컬렉션에 요청을 저장해 다음 스냅샷이나 가격 변경을 비교합니다.
V4 Pro에서는 프롬프트 구조가 단순한 구현 세부 사항이 아니라 비용과 아키텍처를 결정하는 요소입니다. 위 예제를 실행하고, 실제 usage 데이터를 확인한 뒤, Pro와 Flash를 작업별로 라우팅하세요.


Top comments (0)