Gemini 3.6 Flash는 입력 100만 토큰당 $1.50, 출력 100만 토큰당 $7.50입니다. 이전에 대체하던 모델보다 저렴하며, Google은 2026년 7월 21일 이 업데이트를 출시했습니다. API 비용을 관리하는 입장에서는 핵심 Flash 티어가 더 빠르고 더 저렴해졌다는 점이 중요합니다.
이 글에서는 토큰당 요금, 컨텍스트 캐싱 비용, 무료 티어 범위와 함께 코드 작성 전에 월별 비용을 예측하는 방법을 다룹니다. 모든 수치는 Google의 Gemini API 가격 문서와 출시 발표를 기준으로 합니다. 모델 개요는 Gemini 3.6 Flash란 무엇인가에서 확인할 수 있습니다.
먼저 버전 표기를 구분해야 합니다. 핵심 작업 모델은 Gemini 3.6 Flash지만, 저비용 티어인 Flash-Lite는 3.5 버전에 머뭅니다. 같은 출시 흐름에 속하지만 모델 버전은 다릅니다.
Gemini 3.6 Flash 가격 한눈에 보기
| 항목 | 비용 |
|---|---|
| 입력 | 100만 토큰당 $1.50 |
| 출력(사고 토큰 포함) | 100만 토큰당 $7.50 |
| 컨텍스트 캐싱: 캐시된 입력 읽기 | 100만 토큰당 $0.15 |
| 컨텍스트 캐싱: 저장 | 시간당 100만 토큰당 $1.00 |
| 무료 티어 | 예, Google AI Studio 제공(속도 제한 적용) |
비용을 계산할 때는 다음 두 가지를 기억하세요.
- 출력 비용에는 사고 토큰이 포함됩니다. 모델의 추론 과정은 별도 항목으로 청구되지 않지만, 총 출력 토큰에 포함되어 100만 토큰당 $7.50 요금이 적용됩니다.
- 캐싱에는 읽기 비용과 저장 비용이 있습니다. 캐시된 입력은 저렴하게 읽을 수 있지만, 캐시를 유지하는 동안 시간당 저장 비용이 발생합니다. 동일한 시스템 프롬프트나 참조 문서를 반복 사용하는 경우에만 캐싱 효과가 커집니다.
Gemini 3.5 Flash와 비교
Gemini 3.5 Flash의 출력 요금은 100만 토큰당 $9.00이었지만, Gemini 3.6 Flash에서는 $7.50로 낮아졌습니다. 출력 토큰 단가만 보면 약 17% 인하입니다.
또한 Google의 DeepMind Flash 모델 페이지에 따르면, Gemini 3.6 Flash는 동일한 작업에서 약 17% 적은 출력 토큰을 생성합니다. 더 적은 단계로 추론하고 다단계 작업에서 도구 호출도 줄어듭니다.
즉, 다음 두 효과가 동시에 적용됩니다.
- 출력 토큰 단가 하락: $9.00 → $7.50
- 출력 토큰 사용량 감소: 약 17%
이전 모델을 기준으로 예산을 수립했다면 Gemini 3.5 Flash 가격 분석도 함께 확인하세요. 기능 및 벤치마크 차이는 Gemini 3.6 Flash vs 3.5 Flash에서 비교할 수 있습니다.
특히 긴 응답, 에이전트 워크플로, 반복적인 도구 호출이 많은 워크로드에서는 토큰 절감 효과가 누적됩니다.
무료 티어가 제공하는 것
Google AI Studio를 사용하면 신용카드 없이 Gemini 3.6 Flash를 호출하고 프로토타입을 만들 수 있습니다.
다만 무료 티어는 프로덕션 용도가 아닙니다.
- 속도 제한이 적용됩니다.
- 프로토타입과 가벼운 테스트에 적합합니다.
- Google은 제품 개선을 위해 무료 티어 데이터를 사용할 수 있습니다.
- 민감한 데이터, 독점 데이터, 고객 데이터에는 유료 키를 사용해야 합니다.
무료 티어 설정과 제한 사항은 Gemini 3.6 Flash를 무료로 사용하는 방법에서 확인하세요. 무제한 무료 옵션은 아니므로, 서비스 출시 이후에는 유료 사용량을 기준으로 예산을 수립해야 합니다.
비용 계산 예시
하루에 다음 사용량을 처리하는 검색 중심 에이전트를 가정해 보겠습니다.
- 입력: 200만 토큰
- 출력: 50만 토큰
- 동작: 문서를 읽고 짧은 답변 반환
Gemini 3.6 Flash의 일일 비용은 다음과 같습니다.
입력 비용 = 2M × $1.50 = $3.00
출력 비용 = 0.5M × $7.50 = $3.75
일일 총비용 = $6.75
월간 비용(30일) = $202.50
3.5 Flash 대비 출력 비용
이전 3.5 Flash에서 같은 작업이 60만 출력 토큰을 생성했다고 가정해 보겠습니다. Gemini 3.6 Flash에서는 출력량이 약 17% 감소하여 약 50만 토큰이 됩니다.
3.5 Flash 출력 비용 = 0.6M × $9.00 = 일일 $5.40
3.6 Flash 출력 비용 = 0.5M × $7.50 = 일일 $3.75
출력 비용만 비교하면 다음과 같습니다.
일일 절감액 = $5.40 - $3.75 = $1.65
월간 절감액 = $1.65 × 30 = $49.50
단가 인하와 토큰 감소가 각각 약 17%이지만, 두 효과가 결합되면 출력 비용은 약 31% 줄어들 수 있습니다.
Flash-Lite는 훨씬 저렴합니다
단순하고 대량인 작업에는 Gemini 3.5 Flash-Lite를 고려할 수 있습니다.
| 항목 | Gemini 3.5 Flash-Lite 비용 |
|---|---|
| 입력 | 100만 토큰당 $0.30 |
| 출력 | 100만 토큰당 $2.50 |
| 캐시된 입력 읽기 | 100만 토큰당 $0.03 |
| 캐시 저장 | 시간당 100만 토큰당 $1.00 |
Flash-Lite는 초당 약 350개의 출력 토큰으로 빠르게 실행됩니다.
동일하게 입력 200만 토큰, 출력 50만 토큰을 사용한다고 가정하면 다음과 같습니다.
입력 비용 = 2M × $0.30 = $0.60
출력 비용 = 0.5M × $2.50 = $1.25
일일 총비용 = $1.85
월간 비용(30일) = $55.50
같은 토큰 수 기준으로 Gemini 3.6 Flash보다 약 70% 저렴합니다.
다만 Flash-Lite는 단순한 대량 처리용입니다. 다음과 같은 작업에 적합합니다.
- 분류
- 정보 추출
- 라우팅
- 짧은 구조화된 응답
복잡한 다단계 추론이 필요하면 Gemini 3.6 Flash를 사용하세요. Flash-Lite는 단순히 성능이 낮은 모델이 아니라, 비용·품질·지연 시간의 균형점이 다른 모델입니다.
자세한 비교는 Gemini 3.5 Flash-Lite란 무엇인가와 Gemini 3.5 Flash-Lite vs 3.6 Flash에서 확인할 수 있습니다.
비용을 제어하고 측정하는 방법
비용을 줄이려면 다음 네 단계를 적용하세요.
반복되는 컨텍스트를 캐시하세요.
긴 시스템 프롬프트나 공통 참조 문서를 모든 요청에 포함한다면 캐싱이 효과적입니다. 일반 입력은 100만 토큰당 $1.50이지만, 캐시된 입력 읽기는 $0.15입니다. 단, 시간당 100만 토큰당 $1.00의 저장 비용을 함께 계산해야 합니다.프롬프트와 최대 출력 길이를 제한하세요.
출력 비용은 입력 비용보다 5배 높습니다. 불필요한 지시문을 제거하고 최대 출력 토큰을 제한해 예상보다 긴 응답을 방지하세요.간단한 작업은 Flash-Lite로 라우팅하세요.
분류와 추출은 Flash-Lite로 보내고, 다단계 추론이나 복잡한 응답 생성은 Gemini 3.6 Flash에 맡기세요. 모델 라우팅을 적용하면 모든 요청을 하나의 모델로 처리하는 것보다 비용 효율적인 경우가 많습니다.실제 토큰 사용량을 측정하세요.
추정치가 아니라 응답의usageMetadata를 기준으로 비용을 계산하세요. 이 필드에는 호출에서 사용한 입력, 출력, 사고 토큰 수가 포함되며 실제 청구량을 검증하는 기준이 됩니다.
예를 들어 API 응답에서 토큰 사용량을 기록하는 로직을 추가할 수 있습니다.
const usage = response.usageMetadata;
console.log({
promptTokens: usage?.promptTokenCount,
outputTokens: usage?.candidatesTokenCount,
totalTokens: usage?.totalTokenCount,
});
프롬프트 변경 전후의 usageMetadata를 비교하면 출력 토큰이 급증하는 회귀를 빠르게 찾을 수 있습니다.
Apidog에서는 Gemini API POST 요청을 만들고, API 키를 환경 변수로 관리하며, 실제 프롬프트에 대한 응답의 usageMetadata를 바로 확인할 수 있습니다. 토큰 수 임계값을 기준으로 테스트 어설션을 추가하면, 프롬프트 변경으로 출력 비용이 증가했을 때 자동으로 감지할 수 있습니다.
또한 API 테스트를 예약하여 비용 회귀를 주기적으로 확인할 수 있습니다. Apidog 다운로드 후 프로덕션 연결 전에 Gemini 엔드포인트와 토큰 사용량을 검증해 보세요.
자주 묻는 질문
Gemini 3.6 Flash는 100만 토큰당 얼마인가요?
입력은 $1.50, 출력은 $7.50입니다. 컨텍스트 캐싱 읽기는 100만 토큰당 $0.15이며, 저장 비용은 시간당 100만 토큰당 $1.00입니다.
출력 가격에 사고 토큰이 포함되나요?
예. 모델이 응답 전 수행하는 추론은 출력 요금에 포함됩니다. 사고 토큰에 별도 요금은 없지만 총 출력량에 포함되므로, 추론량이 많으면 비용도 증가합니다.
무료 티어가 있나요?
예. Google AI Studio에서 제공되지만 속도 제한이 적용됩니다. 프로토타입과 테스트용이며, 민감한 데이터는 유료 키로 처리해야 합니다.
Gemini 3.6 Flash는 3.5 Flash보다 저렴한가요?
예. 출력 단가가 $9.00에서 $7.50로 낮아졌고, 같은 작업에서 출력 토큰도 약 17% 줄어듭니다. 이 두 효과가 결합되면 실제 출력 비용은 약 31% 감소할 수 있습니다.
Flash-Lite는 언제 사용해야 하나요?
분류, 추출, 라우팅처럼 단순하고 대량인 작업에 사용하세요. 입력 $0.30, 출력 $2.50으로 저렴하고 빠르지만, 복잡한 추론은 Gemini 3.6 Flash가 더 적합합니다.
Gemini 3.6 Flash의 예산은 입력 100만 토큰당 $1.50, 출력 100만 토큰당 $7.50을 기준으로 계산하면 됩니다. 사고 토큰이 출력 비용에 포함된다는 점을 반영하고, 반복 컨텍스트에는 캐싱을 적용하며, 단순 작업은 Flash-Lite로 라우팅하세요.
릴리스별 Gemini API 비용 변화를 확인하려면 Gemini 3.0 API 비용 분석도 참고할 수 있습니다. 마지막으로 Apidog에서 실제 호출의 usageMetadata를 측정해, 예상한 토큰 사용량과 실제 청구량이 일치하는지 검증하세요.
Top comments (0)