DEV Community

Cover image for 제미니 3.8 플래시 가격: 초기 요금, 사고 토큰, 작업당 실제 비용
Rihpig
Rihpig

Posted on Originally published at apidog.com

제미니 3.8 플래시 가격: 초기 요금, 사고 토큰, 작업당 실제 비용

Gemini 3.8 Flash의 가격은 100만 입력 토큰당 $0.75, 100만 출력 토큰당 $3.75입니다. Google이 Gemini 3.7 Flash에 적용한 출시 기념 가격과 같습니다. 이 가격은 2026년 12월 31일까지 유지되며, 2027년 1월 1일부터는 입력 $1.50, 출력 $7.50로 두 배 인상됩니다. 같은 날 Gemini 3.6 Flash와 3.7 Flash의 가격도 두 배가 됩니다.

오늘 Apidog를 사용해 보세요

가격 자체는 바뀌지 않았지만, 모델이 사용하는 토큰 수가 증가했습니다. Google에 따르면 3.8 Flash는 더 많은 추론 단계를 수행하고 도구를 반복적으로 호출하며, 복잡한 작업에 더 많은 토큰을 사용할 수 있습니다. Artificial Analysis도 이를 측정했습니다. Intelligence Index를 높은 사고 수준으로 실행할 때 3.8 Flash는 작업당 $0.58, 3.7 Flash는 $0.40가 들었습니다. 3.8 Flash가 작업당 약 30% 더 많은 출력 토큰을 사용했기 때문입니다.

이 글에서는 공식 Gemini API 가격 페이지의 가격 구조, 사고 수준별 하루 1,000개 작업 비용, Flash-Lite·Claude Sonnet 5·GPT-5.6 Luna와의 비교, 그리고 Apidog를 이용한 토큰 비용 회귀 테스트 방법을 정리합니다. 모델 개요는 Gemini 3.8 Flash란 무엇인가에서 확인할 수 있습니다.

Gemini 3.8 Flash 가격 요약

모든 가격은 유료 등급 기준 100만 토큰당 가격입니다.

요금 출시 기념
(2026년 12월 31일까지)
표준
(2027년 1월 1일부터)
입력
(텍스트, 이미지, 비디오, 오디오, PDF)
$0.75 $1.50
출력
(사고 토큰 포함)
$3.75 $7.50
컨텍스트 캐시 읽기 $0.075 $0.15
캐시 저장
(시간당 100만 토큰당)
$0.50 $1.00
배치 API 입력
(50% 할인)
$0.375 $0.75
배치 API 출력
(50% 할인)
$1.875 $3.75
Google 검색 기반 제공 Gemini 3.x 전체에서 월 5,000회 무료 요청 공유, 이후 1,000회당 $14 동일
무료 등급 $0, 속도 제한, Google 제품 개선을 위한 데이터 사용 동일

다음 세 가지를 특히 확인해야 합니다.

  1. 출력 가격에는 사고 토큰이 포함됩니다. 내부 추론도 입력 요금인 $0.75가 아니라 출력 요금인 $3.75로 청구됩니다.
  2. 출시 기념 가격에는 2026년 12월 31일이라는 종료일이 있습니다.
  3. Gemini 3.6 Flash와 3.7 Flash도 2027년 1월 1일에 같은 폭으로 인상됩니다.

이전 Flash 모델이 더 적은 토큰을 사용하는지는 3.7 Flash 가격 분석에서 확인할 수 있습니다.

사고 토큰은 출력 토큰으로 청구됩니다

Gemini 3.8 Flash는 답변 전에 추론하며, 추론에 사용한 모든 토큰을 출력으로 계산합니다. generateContent 응답에서는 다음 필드로 사용량을 확인할 수 있습니다.

  • promptTokenCount: 사용자 입력 토큰
  • thoughtsTokenCount: 사고 토큰
  • candidatesTokenCount: 사용자에게 표시되는 답변 토큰

사고 토큰과 표시되는 답변 토큰 모두 100만 토큰당 $3.75로 청구됩니다.

thinking_level을 사용하면 추론 수준을 low, medium, high로 조정할 수 있습니다.

  • 기본값은 medium입니다. Gemini 3 Pro의 기본값인 high와 다릅니다.
  • minimal은 제거되었으며 유효성 검사 오류를 반환합니다. 이전 모델 설정에서 minimal을 사용했다면 low로 변경해야 합니다.
  • Google의 사고 문서는 각 수준을 고정 토큰 예산이 아닌 상대적인 노력으로 설명합니다. 따라서 이전의 정수형 thinking_budget처럼 사고 토큰 수를 직접 제한할 수 없습니다.

각 수준의 지연 시간과 비용 영향은 3.8 Flash 사고 수준 가이드에서 확인할 수 있습니다.

요청당 비용 계산 예시

다음 요청을 가정해 보겠습니다.

  • 입력: 10,000토큰
  • 표시되는 출력: 2,000토큰
  • 사고 토큰: 6,000토큰

출시 기념 가격 기준 비용은 다음과 같습니다.

  • 입력: 10,000 × $0.75 / 1,000,000 = $0.0075
  • 출력: (2,000 + 6,000) × $3.75 / 1,000,000 = $0.03
  • 총합: 요청당 $0.0375

사고 토큰은 출력 비용의 75%, 전체 요청 비용의 60%를 차지합니다. 2027년 1월 1일부터 같은 요청에는 $0.015 + $0.06 = $0.075가 청구됩니다.

따라서 “3.7과 동일한 가격”이라는 설명은 토큰당 요금만 보면 맞지만, 실제 청구액은 모델의 토큰 사용량에 따라 더 높아질 수 있습니다.

가격은 같은데 작업당 비용이 증가한 이유

Google의 출시 게시물에 따르면 복잡한 작업에서 모델은 추가 추론 단계를 실행하고 도구를 반복 호출해 결과를 검증합니다. 그 결과 다음이 증가합니다.

  • 사고 토큰 수
  • 에이전트 루프의 도구 호출 횟수
  • 작업당 총 출력 토큰
  • 작업당 비용과 지연 시간

Google이 제시한 대응 방법은 thinking_level을 낮추거나 Gemini 3.7 Flash를 계속 사용하는 것입니다.

Artificial Analysis는 9가지 평가로 Intelligence Index를 측정했습니다.

  • Gemini 3.8 Flash (high): 59점
  • Gemini 3.7 Flash (high): 56점
  • Gemini 3.8 Flash의 평균 출력 토큰: 약 48,000개
  • 3.7 Flash 대비 출력 토큰 증가량: 약 30%
구성 작업당 비용
(Artificial Analysis, 출시 기념 가격)
작업당 시간
Gemini 3.8 Flash, high $0.58 2.5분
Gemini 3.8 Flash, medium $0.41 미공개
Gemini 3.8 Flash, low $0.24 0.8분
Gemini 3.7 Flash, high $0.40 2.2분

이 결과는 두 가지로 해석할 수 있습니다.

  • 3.8 Flash high는 3.7 Flash high보다 3점 높은 점수를 얻는 대신 작업당 비용이 45% 증가합니다. $0.58 / $0.40 = 1.45
  • 3.8 Flash에서 highmedium으로 낮추면 비용이 29% 감소합니다. $0.41 / $0.58 = 0.71
  • low로 낮추면 비용이 59% 감소합니다. $0.24 / $0.58 = 0.41
  • 3.8 Flash medium은 3.7 Flash high보다 작업당 비용이 1센트 높아, 업그레이드 여부를 판단하는 기준점으로 사용할 수 있습니다.

3.8 Flash와 3.7 Flash 비교에서 워크로드별 선택 기준을 확인할 수 있습니다.

Artificial Analysis는 입력과 출력 비율을 3:1로 가정해 혼합 가격도 100만 토큰당 $0.58로 제시했습니다. 이는 토큰당 가격과 모델이 실제로 사용하는 토큰 수가 서로 다른 지표이기 때문에 작업당 비용과 우연히 일치한 것입니다.

2026년 12월 31일 전에 할 일

출시 기념 가격은 계약 가격이 아닙니다. Google은 토큰을 사용한 시점의 요금으로 청구하므로, 2026년 가격으로 2027년 사용량을 선결제할 수 없습니다. 3.7 또는 3.6 Flash로 전환해도 가격 인상을 피할 수 없습니다.

대신 다음 작업을 12월 31일 전에 진행할 수 있습니다.

1. 배치 작업을 앞당기기

백필과 일회성 문서 처리를 배치 API로 실행하세요.

100만 토큰 단위로 입력 7,500만 토큰과 출력 2,500만 토큰을 사용하는 1억 토큰 백필의 비용은 다음과 같습니다.

  • 2026년 배치 비용: 75 × $0.375 + 25 × $1.875 = $28.13 + $46.88 = $74.99
  • 2027년 비용: $149.98

2. 평가 세트와 기준 토큰 수 만들기

가격 인상 전에 동일한 평가 세트를 실행하고 입력·사고·출력 토큰 기준선을 저장하세요. 그러면 1월 청구서에서 가격과 토큰 사용량이라는 두 변수가 동시에 바뀌는 일을 피할 수 있습니다.

3. 경로별 사고 수준 결정하기

이번 분기에 각 프로덕션 경로의 사고 수준을 결정하세요.

  • 기본값 medium을 비용 검토 없이 사용하지 않기
  • low에서도 평가를 통과하는 경로는 low로 설정하기
  • 경로별 최대 토큰과 비용을 테스트에 추가하기

가격이 제공업체 선택의 핵심이라면 가장 저렴한 LLM API 제공업체 비교를 참고하세요. 프리미엄 모델 비교는 Fable 5.1 및 GPT-5.6 Sol 비교에서 다룹니다.

Flash-Lite, Sonnet 5, GPT-5.6 Luna 비교

토큰당 요금은 다음과 같습니다. 단위는 100만 토큰입니다.

모델 입력 출력 비고
Gemini 3.8 Flash
(출시 기념)
$0.75 $3.75 사고 토큰은 출력으로 청구; 캐시 읽기 $0.075
Gemini 3.8 Flash
(2027년 1월 1일부터)
$1.50 $7.50 캐시 읽기 $0.15
Gemini 3.5 Flash-Lite $0.30 $2.50 초당 약 350토큰
Claude Sonnet 5 $2 $10 영구; 9월 1일 인상 취소
GPT-5.6 Luna $1 $6

출시 기념 가격 기준으로 Gemini 3.8 Flash는 다음과 같습니다.

  • Flash-Lite보다 입력은 2.5배, 출력은 1.5배 비쌉니다.
  • Sonnet 5보다 입력과 출력 모두 약 2.7배 저렴합니다.
  • Luna보다 입력은 $0.75 대 $1, 출력은 $3.75 대 $6로 저렴합니다.

하지만 2027년 1월 1일부터는 가격이 달라집니다.

  • Gemini 3.8 Flash는 Luna보다 입력과 출력 모두 비싸집니다.
  • Sonnet 5와의 가격 차이는 약 1.3배로 줄어듭니다. $2 / $1.50, $10 / $7.50
  • Flash-Lite는 계속 더 저렴합니다.

출시 기념 가격 때문에 3.8 Flash를 선택했다면 1월 재평가 일정을 지금 등록하세요.

토큰당 가격만으로는 충분하지 않습니다. 더 높은 요금의 모델이 답변당 더 적은 토큰을 사용하면 작업당 비용이 오히려 낮아질 수 있습니다. 같은 작업 세트를 모든 후보 모델에서 실행하고 usageMetadata를 비교해야 합니다. 3.8 Flash API 가이드에서 Interactions API와 레거시 generateContent의 사용량 확인 방법을 볼 수 있습니다.

Apidog 토큰 어설션으로 비용 회귀 감지하기

Gemini 3.8 Flash의 대표적인 비용 회귀는 잘못된 답변이 아닙니다. 프롬프트나 사고 수준을 변경한 뒤에도 정답을 반환하지만 토큰을 40% 더 사용하는 경우입니다. Apidog는 토큰 수를 상태 코드처럼 검증 가능한 필드로 다뤄 이 문제를 조기에 발견할 수 있게 합니다.

1. API 키를 환경 변수로 저장하기

Apidog 환경에 GEMINI_API_KEY를 만들고, x-goog-api-key 헤더에서 {{GEMINI_API_KEY}}로 참조하세요. 키가 요청에 직접 저장되지 않도록 하는 방식입니다.

2. 골든 프롬프트 저장하기

대표 프롬프트와 명시적인 thinkingConfig.thinkingLevel을 사용해 다음 엔드포인트로 POST 요청을 저장하세요.

https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent
Enter fullscreen mode Exit fullscreen mode

각 프로덕션 경로마다 하나의 기준 요청을 만들면 됩니다.

3. 사용량 필드 어설션 추가하기

응답의 usageMetadata를 읽고 기준선을 초과하면 테스트를 실패시키세요.

const usage = pm.response.json().usageMetadata;

pm.test("thinking tokens within budget", () => {
  pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});

pm.test("visible output within budget", () => {
  pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});

pm.test("request cost within budget", () => {
  const cost = usage.promptTokenCount * 0.75 / 1e6
    + (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;

  pm.expect(cost).to.be.below(0.05);
});
Enter fullscreen mode Exit fullscreen mode

4. 정기 실행 예약하기

요청을 테스트 시나리오에 추가하고 예약된 시간에 실행하세요. 토큰 사용량이 증가하면 해당 날짜의 실패한 실행으로 즉시 확인할 수 있습니다. 설정 방법은 Apidog에서 API 테스트 예약하는 방법에서 확인할 수 있습니다.

2027년 1월 1일에는 코드의 비용 상수 두 개를 업데이트하세요.

이 시나리오는 제공업체 비교에도 사용할 수 있습니다. Flash-Lite, Sonnet 5, Luna용 요청을 복제한 뒤 사용량 필드를 나란히 비교하세요. 시작하려면 Apidog를 다운로드하면 됩니다. 무료 플랜에서도 이 워크플로를 사용할 수 있습니다.

자주 묻는 질문

Gemini 3.8 Flash는 3.7 Flash보다 비싼가요?

토큰당 가격은 같습니다. 두 모델 모두 2026년 12월 31일까지 입력 $0.75, 출력 $3.75이며, 이후에는 각각 $1.50와 $7.50가 됩니다. 그러나 작업당 비용은 더 높을 수 있습니다. Artificial Analysis는 3.8 Flash high에서 작업당 $0.58, 3.7 Flash에서 $0.40를 측정했으며, 3.8 Flash가 약 30% 더 많은 출력 토큰을 사용했기 때문입니다.

사고 토큰은 별도로 청구되나요?

아니요. 사고 토큰은 출시 기념 가격 기준 100만 토큰당 $3.75의 출력 토큰으로 청구되며, usageMetadata.thoughtsTokenCount에 표시됩니다. thinking_level로 간접 조절할 수 있습니다. 3.8 Flash에는 엄격한 토큰 예산 설정이 없고 minimal은 오류를 반환합니다.

Gemini 3.8 Flash에 무료 등급이 있나요?

있습니다. AI Studio 무료 등급은 입력과 출력에 비용을 청구하지 않지만 속도 제한이 적용되며, Google은 무료 등급의 데이터를 제품 개선에 사용할 수 있습니다. 소비자용 Gemini 앱에서는 AI Pro와 Ultra 구독자만 3.8 Flash를 사용할 수 있습니다. 자세한 내용은 무료 사용 가이드를 참고하세요.

2027년 1월 1일부터 비용은 어떻게 되나요?

입력, 출력, 캐시 읽기, 캐시 저장, 배치 요금이 모두 두 배가 됩니다. 토큰 사용량이 동일하게 유지되면 청구서도 두 배가 됩니다. Gemini 3.6 Flash와 3.7 Flash의 요금도 같은 날 두 배로 인상됩니다.

어떤 사고 수준이 비용을 절감하나요?

Artificial Analysis의 분산형 분석에서는 작업당 비용이 low $0.24, medium $0.41, high $0.58였습니다. 각 수준에서 자체 평가를 실행한 뒤 통과하는 가장 낮은 수준을 선택하세요. 이후 토큰 수를 어설션해 설정 변경을 감지해야 합니다.

이번 주에 할 일

Gemini 3.8 Flash는 Gemini 3.7 Flash와 동일한 가격으로 출시되었지만, 복잡한 작업에서는 더 많은 토큰을 사용합니다.

이번 주에는 다음을 완료하세요.

  1. 경로별 thinking_level을 설정합니다.
  2. low, medium, high별 품질과 토큰 사용량을 측정합니다.
  3. 기준 토큰 수와 최대 비용을 Apidog 어설션으로 등록합니다.
  4. 12월 31일 전에 배치 처리 가능한 작업을 출시 기념 기간으로 옮깁니다.
  5. 2027년 1월 1일 재평가 일정을 등록합니다.

지금 기준선을 만들어 두면 가격 인상과 토큰 사용량 증가를 별도로 추적할 수 있습니다.

Top comments (0)