DeepSeek V4-Flash Vision Exp API 사용법: 이미지 입력, 비용, 제한 사항
DeepSeek의 가장 저렴한 모델이 이제 이미지를 처리할 수 있습니다. 2026년 8월 21일, DeepSeek은 텍스트 전용 모델과 동일한 가격으로 이미지를 입력받고, 동일한 프로덕션 API를 사용하는 비전 지원 모델 deepseek-v4-flash-vision-exp를 출시했습니다. 이미지는 이미지당 최대 384개의 입력 토큰으로 요금이 계산됩니다. 공식 출시 노트에 따르면 이 모델은 V4-Flash의 텍스트 기능에 이미지 이해 기능을 더했으며, DeepSeek은 멀티모달 에이전트 성능이 Opus 4.8에 가깝다고 설명합니다.
이 가이드에서는 deepseek-v4-flash-vision-exp의 특징, 모델 ID의 Exp가 프로덕션 사용에 의미하는 것, 이미지를 전송하는 세 가지 방법, 주요 제한 사항, 멀티모달 요청을 테스트하는 방법을 설명합니다. 비전 요청은 텍스트와 이미지가 섞이고 페이로드가 빠르게 커지므로, 터미널에서 JSON을 직접 편집하기보다 Apidog에서 요청을 관리하는 편이 효율적입니다.
deepseek-v4-flash-vision-exp란 무엇인가
이 모델은 이미지 인코더가 추가된 V4-Flash-0731입니다. DeepSeek에 따르면 에이전트 워크로드, 추론, 세계 지식 등 텍스트 작업에서는 기본 V4-Flash와 일치합니다. 따라서 기존 V4-Flash 요청에 이미지 입력이 필요하다면 동일한 텍스트 기능을 유지하면서 비전 모델로 전환할 수 있습니다.
OpenRouter 모델 목록은 이 모델을 총 284B개 매개변수 중 13B개가 활성화되는 희소 MoE(Mixture-of-Experts) 모델로 설명합니다.
V4-Flash는 DeepSeek의 보급형 모델 라인입니다. 텍스트 모델이 출시됐을 때의 내용은 DeepSeek V4-Flash API 가이드에서 확인할 수 있습니다.
비전 기능도 플래시 가격이 적용되므로, 멀티모달 API 중에서도 비용이 낮은 편입니다. 다만 “멀티모달 에이전트 벤치마크에서 Opus 4.8에 가깝다”는 내용은 공급업체의 주장입니다. 실제 워크로드를 이전하기 전에 자체 문서와 평가 데이터로 성능을 검증해야 합니다.
Exp라는 라벨이 붙어 있지만 샌드박스 전용 모델은 아닙니다. 다른 V4 모델과 동일한 속도 제한 및 SLA(서비스 수준 계약)를 사용하는 프로덕션 API 엔드포인트에서 실행되며, 대기 목록이나 별도의 접근 요청도 필요하지 않습니다.
가격: 텍스트 모델과 동일한 플래시 요율
DeepSeek의 가격 페이지에 따르면 deepseek-v4-flash-vision-exp의 가격은 텍스트 전용 deepseek-v4-flash와 동일합니다.
| 구분 | 비피크 시간 | 피크 시간 |
|---|---|---|
| 입력, 캐시 히트(100만 토큰당) | $0.007 | $0.014 |
| 입력, 캐시 미스(100만 토큰당) | $0.22 | $0.44 |
| 출력(100만 토큰당) | $0.66 | $1.32 |
이미지는 이미지당 최대 384개의 입력 토큰으로 토큰화되어 입력 요율로 청구됩니다. 피크 시간의 캐시 미스 요율을 적용하면 이미지 한 장의 최대 비용은 다음과 같습니다.
384 / 1,000,000 × $0.44 = 약 $0.00017
따라서 이미지 1,000장의 입력 비용은 커피 한 잔보다 낮을 수 있습니다. 단, 실제 비용에는 텍스트 입력과 모델 출력 토큰도 포함됩니다.
텍스트 모델의 두 가지 가격 정책도 그대로 적용됩니다.
- 비피크 시간 요율은 피크 시간의 절반입니다.
- 피크 시간은 평일 UTC 01:00~04:00 및 06:00~10:00입니다.
- 반복되는 입력에는 컨텍스트 캐싱이 적용됩니다.
- V4 라인의 컨텍스트 창은 가격 페이지에 1M 토큰으로 명시되어 있지만, 실제 출력 길이는 이보다 훨씬 짧게 제한됩니다.
반복적인 시스템 프롬프트를 여러 이미지에 함께 보내는 워크로드라면 캐시 히트 요율을 활용할 수 있습니다.
이미지를 전송하는 세 가지 방법
모델은 DeepSeek의 표준 Chat Completions 엔드포인트를 사용합니다.
https://api.deepseek.com/chat/completions
메시지의 content 배열에 텍스트와 이미지 블록을 함께 넣어 요청합니다. V4-Flash Responses API 출시 안내에 설명된 것처럼 메시지 스타일 및 응답 스타일 호출도 지원됩니다.
1. Base64 인라인 이미지
이미지를 읽어 데이터 URL로 인코딩하는 방식입니다. 별도의 파일 호스팅이 필요 없고 요청 하나만으로 테스트할 수 있지만, 이미지당 32MiB 제한이 있습니다.
import base64
from openai import OpenAI
client = OpenAI(
[REDACTED CREDENTIAL]
base_url="https://api.deepseek.com",
)
with open("invoice.png", "rb") as f:
b64 = base64.b64encode(f.read()).decode()
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{
"type": "text",
"text": "Extract the line items and totals as JSON.",
},
{
"type": "image_url",
"image_url": {
"url": f"data:image/png;base64,{b64}"
},
},
],
}
],
)
print(response.choices[0].message.content)
2. 외부 URL
이미지를 Base64로 인코딩하지 않고 공개적으로 접근 가능한 URL을 전달합니다. URL 길이는 최대 8,192자입니다.
{
"type": "image_url",
"image_url": {
"url": "https://example.com/chart.png"
}
}
이미지가 이미 CDN이나 공개 스토리지에 있다면 이 방법이 가장 간단합니다.
3. Files API의 file_id 참조
이미지를 먼저 업로드한 뒤 반환된 파일 ID를 요청에서 재사용합니다. DeepSeek Files API는 이미지 업로드를 무료로 허용하며, 이미지당 64MiB까지 지원합니다.
{
"type": "file",
"file": {
"file_id": "file-api-xxxxxxxxxxxxxxxx"
}
}
다음 기준으로 전송 방식을 선택하면 됩니다.
- 일회성 호출: Base64 인라인
- 이미지가 공개 CDN에 있음: 외부 URL
- 같은 이미지를 여러 요청에서 재사용: Files API의
file_id
detail 매개변수 설정
각 이미지에는 선택적 detail 필드를 지정할 수 있습니다.
-
"low": 이미지를 512×512로 축소합니다. 가장 저렴하고 빠르며 분류 수준의 질문에 적합합니다. -
"high"또는"original": 원본 치수를 유지합니다. 밀집된 문서나 작은 텍스트를 읽을 때 유리합니다. -
"auto": API가 적절한 수준을 선택합니다.
내부적으로 이미지는 토큰 계산을 위해 대략 800×800 크기로 정규화되며, 이미지당 384토큰 상한이 적용됩니다.
영수증, 문서, 대시보드처럼 OCR 정확도가 중요한 작업이라면 실제 데이터셋으로 "low"와 "high"를 비교하세요. 이 모델의 이미지 입력 비용 차이는 작지만, 해상도에 따른 인식 정확도 차이는 클 수 있습니다.
프로덕션 전에 확인할 제한 사항
| 제한 사항 | 값 |
|---|---|
| 요청당 최대 이미지 수 | 600 |
| 인라인(Base64) 이미지 크기 | 32 MiB |
| Files API 이미지 크기 | 64 MiB |
| 총 요청 본문 크기 | 48 MiB |
| 이미지 치수 | 각 면당 8,192px |
| 이미지 15개 이상 포함 시 이미지 치수 | 각 면당 4,096px |
| 외부 URL 길이 | 8,192자 |
| 이미지가 허용되는 메시지 |
user 메시지만 가능 |
마지막 제한은 특히 중요합니다. system 또는 assistant 메시지에 이미지를 넣으면 400 오류가 발생합니다.
여러 이미지를 하나의 요청에 포함할 수 있으며, 텍스트와 이미지도 자유롭게 섞을 수 있습니다. 따라서 다음과 같은 에이전트 루프를 구성할 수 있습니다.
- 화면이나 문서 이미지를 캡처합니다.
- 모델에 이미지와 질문을 함께 보냅니다.
- 모델의 추론 결과를 확인합니다.
- 툴 호출이나 다음 작업을 실행합니다.
DeepSeek은 같은 날 DeepSeek Harness 0.1.1에 이 모델의 기본 지원을 추가했습니다. 해당 스택은 DeepSeek Harness 개요에서 확인할 수 있습니다.
또한 텍스트 모델과 동일하게 툴 호출도 비전 기능과 함께 사용할 수 있습니다. 자세한 흐름은 함수 호출 가이드를 참고하세요.
Exp가 프로덕션 코드에 의미하는 것
Exp는 결제나 접근 권한에 대한 제한이 아니라, 모델이 예고 없이 수정되거나 교체될 수 있음을 나타내는 라벨입니다.
다음과 같이 운영 환경을 구성하면 변경 영향을 줄일 수 있습니다.
모델 ID를 한 곳에서 관리하기
애플리케이션 코드 여러 곳에 모델 ID를 직접 입력하지 말고 환경 변수나 설정 파일에서 관리합니다.
DEEPSEEK_VISION_MODEL=deepseek-v4-flash-vision-exp
코드에서는 설정값을 참조합니다.
import os
model = os.environ["DEEPSEEK_VISION_MODEL"]
텍스트 전용 대체 모델 유지하기
이미지가 없는 요청은 안정적인 deepseek-v4-flash로 라우팅할 수 있습니다. DeepSeek에 따르면 비전 모델은 텍스트 작업에서 기본 텍스트 모델과 일치하므로, 이미지 입력이 필요한 트래픽만 비전 모델로 분리하는 보수적인 구성이 가능합니다.
평가 결과를 스냅샷으로 저장하기
실험 모델이 수정되거나 비실험적 후속 모델이 출시되면 동일한 데이터셋으로 이전·이후 결과를 비교해야 합니다. 공급업체 벤치마크보다 자체 문서, 영수증, 스크린샷, 차트 등 실제 입력에 대한 평가 결과를 기준으로 판단하세요.
예제: 문서 파이프라인 비용 계산
월간 스캔 청구서 50,000장을 처리한다고 가정해 보겠습니다.
- 청구서당 이미지 1개
- 청구서당 지시 프롬프트 200토큰
- 호출당 JSON 출력 약 400토큰
이미지 입력 비용
50,000 × 384 = 19.2M 토큰
19.2M × $0.44 = $8.45
텍스트 입력 비용
50,000 × 200 = 10M 토큰
10M × $0.44 = 약 $4.40
반복되는 지시 블록에 컨텍스트 캐싱이 적용되면 대부분의 입력이 캐시 히트 요율로 계산됩니다.
10M × $0.014 = 약 $0.14
출력 비용
50,000 × 400 = 20M 토큰
20M × $1.32 = $26.40
피크 시간 요율을 기준으로 계산한 총비용은 한 달에 약 $35~$40입니다. 배치 작업을 평일 UTC 01:00~10:00의 피크 시간 외에 실행하면 비용은 대략 절반으로 줄어듭니다.
이 계산에서 출력 토큰이 비용의 대부분을 차지한다는 점에 주목하세요. 이미지 입력이 저렴한 경우에는 이미지를 더 작게 만드는 것보다 응답 형식을 제한하는 편이 효과적일 수 있습니다. 산문 설명 대신 필요한 필드만 포함한 간결한 JSON을 요청하면 이미지 전처리보다 더 큰 비용 절감 효과를 얻을 수 있습니다.
이러한 비용 구조는 에이전트 루프에도 영향을 줍니다. 최고급 멀티모달 모델에서는 비용 때문에 반복 실행하기 어려웠던 “스크린샷 → 추론 → 행동” 사이클을 프레임당 384토큰 수준으로 운영할 수 있습니다.
Apidog에서 멀티모달 요청 테스트하기
비전 요청은 터미널에서 수동으로 반복하기 어렵습니다. Base64 문자열은 요청 본문을 읽기 힘들게 만들고, detail 설정을 비교할 때마다 거의 동일한 페이로드를 다시 편집해야 합니다.
다음 순서로 테스트 환경을 구성하세요.
1. 요청 템플릿을 한 번 저장하기
Apidog 프로젝트에 요청을 저장하고 모델과 detail 값을 변수로 분리합니다.
{{model_id}}
{{detail}}
테스트 이미지나 detail 수준을 바꿀 때 요청 본문 전체를 수정하지 않고 변수만 변경할 수 있습니다.
2. 이미지 인코딩 자동화하기
사전 요청 스크립트에서 이미지 파일을 읽고 Base64 문자열을 주입합니다. 그러면 화면에 표시되는 요청 본문은 읽기 쉬운 상태로 유지하면서 실제 전송 시에는 데이터 URL을 사용할 수 있습니다.
3. 구조화된 응답을 검증하기
모델에 JSON 출력을 요청했다면 응답을 파싱하고 필수 필드를 어설션으로 검사하세요.
예를 들어 청구서 파이프라인이라면 다음 항목을 검증할 수 있습니다.
- 항목 배열이 존재하는가
- 총액 필드가 숫자 형식인가
- 각 항목에 설명과 금액이 있는가
이렇게 하면 “응답이 괜찮아 보인다”는 주관적인 판단을, 실험 모델이 변경될 때마다 다시 실행할 수 있는 통과·실패 테스트로 바꿀 수 있습니다.
4. 프런트엔드 응답을 모의하기
프롬프트를 조정하는 동안에는 실제 API 호출 없이 프런트엔드 개발을 진행할 수 있도록 응답 형태를 모의하세요. Apidog의 스마트 목업을 사용하면 정의한 스키마에 맞는 응답을 제공할 수 있습니다.
Apidog 무료 다운로드를 통해 설정을 완료한 뒤, DeepSeek이 실험 모델을 수정할 때 동일한 요청과 어설션을 다시 실행할 수 있습니다.
자주 묻는 질문
deepseek-v4-flash-vision-exp는 무료인가요?
무료는 아니지만 비용이 매우 낮습니다. 텍스트 모델의 플래시 요율과 동일하게 청구되며, 이미지는 이미지당 최대 384개의 입력 토큰으로 계산됩니다. DeepSeek Files API의 이미지 저장소는 무료이고, 이미지가 요청에 포함될 때만 사용량이 발생합니다.
deepseek-v4-flash를 대체하나요?
아닙니다. 텍스트 모델은 안정적인 ID로 유지됩니다. 비전 모델은 텍스트 작업에서 텍스트 모델과 일치한다고 설명되지만, Exp 모델의 변경 가능성을 감수해야 합니다. 보수적인 구성은 이미지 트래픽만 deepseek-v4-flash-vision-exp로 라우팅하는 것입니다.
Anthropic 스타일 API 형식으로 사용할 수 있나요?
가능합니다. DeepSeek의 V4 엔드포인트는 Chat Completions, Messages, Responses 형식의 호출을 모두 허용합니다. 따라서 기존 클라이언트의 호출 스타일을 유지하면서 이미지 블록을 추가할 수 있습니다.
전체 제품군에서 공유되는 엔드포인트 메커니즘은 V4 Pro API 상세 가이드에서 확인할 수 있습니다.
GPT 또는 Claude 비전 모델과 가격을 비교하면 어떤가요?
이미지당 384토큰으로 계산되며, 입력 비용은 100만 토큰당 $0.22~$0.44입니다. 따라서 최고급 멀티모달 모델보다 한 자릿수 낮은 가격대일 수 있습니다. 다만 실제 선택 기준은 가격만이 아니라 자신의 워크로드에서의 정확도입니다. 앞서 설명한 평가 시나리오로 직접 비교해야 합니다.
요약
deepseek-v4-flash-vision-exp는 V4-Flash의 텍스트 기능에 이미지 입력을 추가한 실험적 비전 모델입니다. 텍스트 모델과 동일한 플래시 가격이 적용되고, 이미지당 최대 384개의 입력 토큰으로 계산되며, Base64·외부 URL·Files API 참조라는 세 가지 입력 경로를 제공합니다.
프로덕션에 적용할 때는 다음을 지키세요.
- 모델 ID를 설정값으로 분리합니다.
- 이미지가 허용되는
user메시지에만 이미지 블록을 넣습니다. -
detail수준을 실제 데이터로 평가합니다. - 응답을 구조화된 JSON으로 제한하고 필드를 어설션합니다.
- 실험 모델의 변경에 대비해 평가 결과를 스냅샷으로 저장합니다.
Apidog에서 요청 템플릿과 어설션을 한 번 구성해 두면, 지금 Exp 모델을 테스트할 수 있을 뿐 아니라 후속 모델이 출시된 날에도 동일한 기준으로 다시 평가할 수 있습니다.
Top comments (0)