구글은 3.6 Flash 출시 3주 후인 2026년 8월 13일에 Gemini 3.7 Flash를 출시했으며, 이를 “가장 지능적인 워크호스 모델”이라고 부릅니다. API 비용을 지불하는 사람들에게 가장 중요한 세부 사항은 벤치마크가 아닌 가격표에 있습니다. 출시 가격은 1백만 입력 토큰당 $0.75, 1백만 출력 토큰당 $3.75이며 2026년 12월 31일에 만료됩니다. 2027년 1월 1일부터 두 요율은 모두 두 배가 됩니다.
이는 이 모델을 기반으로 구축하는 모든 작업 부하에 예정된 2배의 비용 증가가 있음을 의미합니다. 오늘날 월 $790가 드는 챗봇은 코드, 트래픽 또는 프롬프트 변경 없이 1월에 월 $1,575가 들게 됩니다. 따라서 3.7 Flash 프로젝트 예산을 책정할 때는 정가 대신 두 가지 요금제를 모두 고려해야 합니다.
이 가이드에서는 두 가지 요금제, 세 가지 실제 작업 부하의 토큰 계산 방식, 다른 모델 API와 비교한 가격, 그리고 요금이 두 배가 되기 전에 비용을 절감하는 방법을 설명합니다. 아직 첫 요청을 보내지 않았다면 Gemini 3.7 Flash API 퀵스타트에서 설정 방법을 확인할 수 있습니다. 호출을 시작하면 Apidog은 모든 응답에서 usageMetadata 토큰 수를 표시하므로 아래 추정치를 실제 트래픽과 비교할 수 있습니다.
요약 (TL;DR)
- 출시 가격: 2026년 12월 31일까지 1백만 입력 토큰당 $0.75, 1백만 출력 토큰당 $3.75입니다.
- 표준 가격: 2027년 1월 1일부터 입력 $1.50, 출력 $7.50으로 정확히 두 배가 됩니다.
- 출시 가격은 Gemini 3.6 Flash 출시 당시 비용의 절반입니다.
- 이 모델은 1백만 토큰 컨텍스트 창에서 텍스트, 이미지, 비디오, 오디오 및 PDF 입력을 처리하며 출력 제한은 64k 토큰입니다.
- 예시로, 하루 10,000건을 처리하는 챗봇은 출시 가격에서 하루 약 $26.25, 표준 가격에서 하루 약 $52.50가 듭니다.
- 비용 절감의 핵심은 컨텍스트 캐싱, 출력 제한, 배치 처리, 가벼운 트래픽의 소형 모델 라우팅입니다.
두 가지 가격 등급
Gemini 3.7 Flash는 영구 가격이 아닌 한시적인 할인율로 출시되었습니다.
| 등급 | 기간 | 입력(1백만 토큰당) | 출력(1백만 토큰당) |
|---|---|---|---|
| 출시 가격 | 2026년 8월 13일 ~ 2026년 12월 31일 | $0.75 | $3.75 |
| 표준 가격 | 2027년 1월 1일부터 | $1.50 | $7.50 |
두 가지를 우선 확인해야 합니다.
- 출시 가격은 Gemini 3.6 Flash 출시 당시 비용의 절반입니다. 3.6에서 업그레이드를 검토한다면 3.6에서 3.7 Flash로의 마이그레이션 가이드를 참고해 전환과 회귀 테스트를 진행하세요.
- 두 등급 모두 출력 토큰 비용이 입력 토큰 비용의 5배입니다. 시스템 프롬프트를 줄이는 것도 도움이 되지만, 폭주하는 출력을 제한하는 편이 더 큰 비용 절감 효과를 냅니다.
위 요금은 AI Studio 키를 통해 청구되는 Gemini API에 적용됩니다. Vertex AI는 별도 SKU와 Google Cloud 청구 체계를 사용하며, 컨텍스트 캐싱과 배치 처리도 별도 항목을 가질 수 있습니다. 예산을 확정하기 전에는 공식 가격 페이지에서 현재 가격을 확인하세요.
실제 작업 부하 비용
1백만 토큰당 가격은 실제 트래픽과 곱해야 의미가 있습니다. 아래 세 가지 예시의 가정을 자체 요청 수와 평균 토큰 수로 교체해 예산을 계산할 수 있습니다.
비용 계산식은 다음과 같습니다.
일일 입력 비용 = (일일 입력 토큰 / 1,000,000) × 입력 단가
일일 출력 비용 = (일일 출력 토큰 / 1,000,000) × 출력 단가
일일 총비용 = 일일 입력 비용 + 일일 출력 비용
작업 부하 1: 고객 지원 챗봇
하루 10,000건의 요청을 가정합니다. 각 요청은 약 2,000개의 입력 토큰(시스템 프롬프트, 짧은 기록 창, 사용자 메시지)을 사용하고 약 300개의 출력 토큰을 반환합니다.
| 항목 | 일일 토큰 | 출시 가격/일 | 표준 가격/일 |
|---|---|---|---|
| 입력 | 20M | $15.00 | $30.00 |
| 출력 | 3M | $11.25 | $22.50 |
| 총계 | 23M | $26.25 | $52.50 |
30일 기준으로 출시 가격에서는 월 약 $788, 표준 가격에서는 월 약 $1,575입니다. 현재는 대화 턴당 약 0.25센트를 지불하는 셈입니다.
구현 시에는 챗봇 엔드포인트에 출력 상한을 명시적으로 설정하세요.
{
"generationConfig": {
"maxOutputTokens": 500
}
}
지원 응답에 긴 답변이 필요하지 않다면 64k 기본 상한에 의존하지 않는 것이 안전합니다.
작업 부하 2: PDF 문서 파이프라인
Gemini 3.7 Flash는 PDF를 기본적으로 읽을 수 있습니다. GDP.pdf 벤치마크 점수가 3.6 Flash 대비 22.0%에서 34.0%로 상승했으므로, 구글은 문서 추출 작업을 주요 사용 사례로 예상하는 것으로 보입니다.
하루 500개 문서를 가정합니다. 문서당 평균 40,000개의 입력 토큰을 사용하고, 1,000토큰 규모의 구조화된 요약을 생성합니다.
| 항목 | 일일 토큰 | 출시 가격/일 | 표준 가격/일 |
|---|---|---|---|
| 입력 | 20M | $15.00 | $30.00 |
| 출력 | 0.5M | $1.88 | $3.75 |
| 총계 | 20.5M | $16.88 | $33.75 |
월 비용은 현재 약 $506이며, 1월부터는 약 $1,013입니다. 긴 문서와 짧은 요약의 조합에서는 입력 비용이 대부분을 차지합니다. 이 유형의 작업에는 캐싱과 배치 처리가 가장 큰 영향을 줍니다.
작업 부하 3: 에이전트 루프
에이전트는 호출 수를 증폭시킵니다. 하루 200개의 작업을 가정하고, 각 작업이 평균 12회의 모델 호출을 수행한다고 가정합니다. 각 호출은 증가하는 컨텍스트와 도구 결과를 포함해 8,000개의 입력 토큰을 사용하고, 400개의 출력 토큰을 반환합니다.
| 항목 | 일일 토큰 | 출시 가격/일 | 표준 가격/일 |
|---|---|---|---|
| 입력 | 19.2M | $14.40 | $28.80 |
| 출력 | 0.96M | $3.60 | $7.20 |
| 총계 | 20.16M | $18.00 | $36.00 |
월 비용은 출시 가격에서 $540, 표준 가격에서 $1,080입니다. 에이전트 작업에서는 호출 수와 컨텍스트 길이가 함께 증가합니다. 12회 호출에서 20회 호출로 증가하면 비용도 67% 늘어나지만, 가격표만 봐서는 이런 증폭을 알기 어렵습니다.
또한 64k 출력 제한은 호출당 최악의 경우를 현재 약 $0.24, 표준 가격에서는 약 $0.48로 제한합니다. 재시도 루프가 매번 최대 출력을 사용하면 빠르게 비싸질 수 있으므로, 단계별 출력 제한과 재시도 횟수 제한을 함께 적용하세요.
에이전트 작업 비용
= 작업 수 × 작업당 호출 수 × 호출당 평균 토큰 비용
3.7 Flash 가격 비교
공급업체 간 정확한 토큰당 비교는 빠르게 바뀌므로, 아래 내용은 고정 가격표보다 포지셔닝으로 보는 편이 좋습니다.
Gemini 3.7 Flash는 워크호스 등급에 속합니다. Gemini Pro 라인, Claude의 대규모 모델, OpenAI 플래그십 등급처럼 최첨단 모델보다 저렴하면서도, 얼마 전 플래그십 모델이 기록했던 벤치마크 점수와 겹칩니다. 예를 들어 DeepSWE v1.1은 65.3%, WebDev Arena Elo는 1588점입니다.
핵심은 대부분의 프로덕션 트래픽이 최첨단 모델을 항상 필요로 하지 않는다는 점입니다. 출시 할인 기간은 자체 워크로드에서 이 가정을 검증할 수 있는 기간입니다.
경쟁 환경도 고려해야 합니다. 보급형 공급업체의 가격은 변동할 수 있습니다. DeepSeek의 API 가격 인상 사례는 DeepSeek 가격 인상 및 비용 최적화 가이드에서 확인할 수 있습니다. Gemini도 마찬가지로 가격 변동 가능성을 예산에 반영해야 하며, 여기서는 구글이 인상 날짜와 금액을 미리 공개했습니다.
프로토타입 비용이 $3에서 $6로 바뀌는 것은 큰 문제가 아닐 수 있습니다. 하지만 월 $10,000 파이프라인이 $20,000가 되는 경우는 사전에 계획해야 할 운영 비용입니다.
토큰 지출을 줄이는 5가지 방법
출력 토큰이 입력 토큰보다 5배 비싸고, 2027년 1월에 전체 요금이 두 배가 된다는 점을 기준으로 최적화 우선순위를 정하세요.
1. 엔드포인트별 출력 토큰 제한
generationConfig.maxOutputTokens를 엔드포인트에 필요한 최소값으로 설정하세요. 지원 응답에는 보통 500토큰 이상이 필요하지 않습니다.
{
"generationConfig": {
"maxOutputTokens": 500
}
}
출력 토큰은 입력보다 5배 비싸므로, 이 변경이 가장 높은 비용 절감 효과를 낼 수 있습니다.
2. 정적 컨텍스트 캐싱
모든 요청에서 동일한 3,000토큰 시스템 프롬프트와 정책 문서를 반복 전송한다면, 같은 입력 토큰에 매번 전체 비용을 지불하게 됩니다. 컨텍스트 캐싱을 적용하면 반복 토큰에 할인된 요율을 적용할 수 있습니다.
현재 지원 범위와 요금은 Gemini API 문서에서 확인하세요. 위 챗봇 예시에서 1,500토큰의 정적 접두사를 캐싱하면 입력 비용을 거의 절반까지 줄일 수 있습니다.
3. 비대화형 작업 배치 처리
문서 파이프라인은 보통 1초 미만의 응답 시간이 필요하지 않습니다. 배치 처리는 지연 시간을 허용하는 대신 할인된 요금을 활용할 수 있으므로, 야간 문서 처리와 같은 작업에 적합합니다.
다음처럼 요청을 분리하세요.
실시간 경로: 사용자 대화, 즉시 응답이 필요한 작업
배치 경로: 문서 요약, 분류, 대량 추출, 야간 처리
4. 경로별 모델 크기 조정
모든 요청에 3.7 Flash를 사용할 필요는 없습니다. 분류, 라우팅, 짧은 추출 작업은 Flash-Lite 등급 모델에서 더 저렴하게 처리할 수 있습니다.
3.7 Flash는 다음처럼 성능 가치가 큰 경로에 집중하세요.
- 다단계 계획
- 디버깅
- 복잡한 도구 호출 체인
- 긴 문서 추론
- 품질 요구가 높은 생성 작업
5. 무료 티어에서 프로토타입 제작
AI Studio의 무료 할당량을 사용해 프롬프트와 응답 스키마를 먼저 확정하세요. 청구 토큰을 사용하기 전에 출력 길이, 구조화된 응답, 실패 처리 방식을 검증할 수 있습니다.
무료 Gemini API 액세스 가이드에서 무료 경로의 범위와 제한을 확인할 수 있습니다.
Apidog로 엔드포인트별 지출 추적
추정치는 예산 수립에 도움이 되지만, 실제 요청별 측정이 있어야 예산을 유지할 수 있습니다. Gemini 응답에는 프롬프트 및 출력 토큰 수를 포함하는 usageMetadata 블록이 있으므로 API 테스트 계층을 비용 측정기로도 활용할 수 있습니다.
Apidog에서는 다음 워크플로우를 구성하세요.
-
프로덕션 엔드포인트별로 요청을 컬렉션에 저장합니다.
- 챗봇 턴
- 문서 요약
- 에이전트 단계
API 키를
GEMINI_API_KEY환경 변수에 바인딩합니다.실제 페이로드로 요청을 실행하고 응답의 아래 값을 기록합니다.
usageMetadata.promptTokenCount
usageMetadata.candidatesTokenCount
- 토큰 수에 대한 어설션을 추가합니다. 예를 들어 채팅 엔드포인트의 입력 토큰이 2,500을 초과하면 테스트가 실패하도록 설정할 수 있습니다.
promptTokenCount <= 2500
candidatesTokenCount <= 500
- 프롬프트, 도구 정의, 응답 스키마를 변경할 때마다 시나리오를 다시 실행합니다.
토큰 수는 대기 시간처럼 회귀합니다. 차이점은 토큰 회귀가 나중에 청구서로 나타난다는 점입니다. 측정된 카운트에 이 가이드의 등급별 가격을 곱하면 추측이 아닌 실제 응답 기준의 엔드포인트별 비용을 계산할 수 있습니다.
어설션 기반 API 테스트 스위트를 운영 중이라면 이 패턴을 쉽게 적용할 수 있습니다. QA 엔지니어를 위한 API 테스트 가이드에서 전체 서비스에 걸쳐 시나리오를 구성하는 방법을 확인하세요.
자주 묻는 질문
Gemini 3.7 Flash 가격은 언제 두 배가 되나요?
2027년 1월 1일입니다. 1백만 입력 토큰당 $0.75, 1백만 출력 토큰당 $3.75의 출시 가격은 2026년 12월 31일까지 적용됩니다. 이후 표준 가격인 입력 $1.50, 출력 $7.50으로 변경됩니다.
구글이 출시 시점에 두 요금제를 모두 공개했으므로, 이 인상은 추측이 아니라 예정된 가격 변경입니다.
Gemini 3.7 Flash가 Gemini 3.6 Flash보다 저렴한가요?
출시 시점에는 그렇습니다. 3.7 Flash의 출시 가격은 3.6 Flash 출시 가격의 절반이며, 벤치마크도 전반적으로 향상되었습니다. DeepSWE v1.1은 49.0%에서 65.3%로 상승했습니다.
자세한 사양과 벤치마크는 Gemini 3.7 Flash 빠른 참조에서 확인할 수 있습니다.
Vertex AI에도 출시 가격이 적용되나요?
이 가이드의 요금은 AI Studio 키를 통해 청구되는 Gemini API 요금입니다. Vertex AI는 자체 SKU와 기업 약관을 통해 Google Cloud에서 청구됩니다.
Vertex에서 프로덕션 트래픽을 실행한다면 동일한 가격이 적용된다고 가정하지 말고, GCP 청구 콘솔과 공식 가격 페이지에서 현재 가격을 확인하세요.
입력 토큰 청구에는 무엇이 포함되나요?
보내는 모든 입력이 포함됩니다.
- 텍스트
- 이미지
- 비디오
- 오디오
- PDF 페이지
이 데이터는 토큰으로 변환되어 입력 요율로 청구됩니다. 긴 문서와 미디어가 많은 요청에서는 입력 비용이 예상보다 커질 수 있습니다. 실제 사용량은 각 응답의 usageMetadata 블록에서 확인하세요.
요청을 보내기 전에 토큰을 어떻게 예측하나요?
API의 countTokens 엔드포인트로 생성 없이 페이로드를 측정하거나, 대표 요청을 몇 건 실행한 뒤 응답의 usageMetadata를 확인하세요.
어떤 방식을 사용하든 실제 페이로드로 측정해야 합니다. 다른 공급업체의 토크나이저 기준은 Gemini 모델 제품군에 그대로 적용되지 않을 수 있습니다.
3.7 Flash가 스택에 들어가는 위치
출시 가격의 Gemini 3.7 Flash는 강력한 워크호스 모델을 낮은 비용으로 검증할 수 있는 기간을 제공합니다. 실용적인 운영 전략은 다음과 같습니다.
- 워크호스 트래픽을 3.7 Flash로 이전합니다.
- 출시 할인 기간 동안 엔드포인트별 실제 토큰 소비량을 측정합니다.
- 측정 데이터를 기준으로 3.7 Flash에 유지할 경로와 더 가벼운 모델로 이전할 경로를 구분합니다.
- 표준 요금이 적용되기 전에 월 비용 시나리오를 계산합니다.
측정에는 도구가 필요합니다. Apidog를 다운로드해 Gemini 요청, 환경 변수, 토큰 어설션 및 비용 확인을 하나의 작업 공간에서 관리하세요. 그러면 1월 청구서는 나중에 발견하는 숫자가 아니라 미리 예측한 숫자가 됩니다.
Top comments (0)