DEV Community

Cover image for 제미니 3.8 플래시란 무엇인가요?
Rihpig
Rihpig

Posted on Originally published at apidog.com

제미니 3.8 플래시란 무엇인가요?

Gemini 3.8 Flash: 더 깊은 추론과 에이전트 성능, 그리고 작업당 비용

Gemini 3.8 Flash는 Google의 최신 Flash 등급 모델로, Gemini 3.8 Flash Cyber라는 보안 게이트 적용 쌍둥이 모델과 함께 2026년 9월 2일 출시되었습니다. 7월 21일 Gemini 3.6 Flash, 8월 13일 Gemini 3.7 Flash에 이어 6주 만에 출시된 세 번째 Flash 모델입니다. 출시 가격은 2026년 12월 31일까지 백만 입력 토큰당 $0.75, 백만 출력 토큰당 $3.75이며, Google은 이를 “장기적인 소프트웨어 엔지니어링, 자율 에이전트 및 복잡한 엔터프라이즈 워크플로를 위해 설계된 가장 지능적인 Flash 모델”이라고 설명합니다.

지금 Apidog를 사용해 보세요

핵심 변화는 가격이나 컨텍스트 창이 아니라 모델의 동작입니다. Gemini 3.8 Flash는 어려운 작업에서 더 많은 추론 단계를 수행하고, 작업 중 결과를 검증하며, 도구를 반복 호출하도록 설계되었습니다.

그 결과 에이전트 벤치마크 성능은 향상되지만, 작업당 사용하는 토큰도 증가합니다. Artificial Analysis는 Gemini 3.7 Flash보다 약 30% 더 많은 출력 토큰을 측정했습니다. 토큰 단위로 예산을 책정하면 가격은 동일하지만, 작업 단위로 예산을 책정하면 비용이 증가합니다.

이 글에서는 Gemini 3.8 Flash의 사양, 추론 비용, 벤치마크, 가격, 가용성, Cyber 쌍둥이 모델, 제한 사항과 API 호출 방법을 정리합니다. 모든 요청은 JSON을 사용하는 일반 HTTP이므로 애플리케이션 코드에 적용하기 전에 Apidog에서 구축하고 검증할 수 있습니다. 주요 정보원은 Google의 출시 게시물모델 페이지입니다.

Gemini 3.8 Flash 한눈에 보기

사양
API 모델 ID gemini-3.8-flash (안정 버전)
출시일 2026년 9월 2일
기반 모델 Gemini 3.7 Flash
컨텍스트 창 1,048,576 입력 토큰
최대 출력 65,536 토큰
입력 텍스트, 이미지, 비디오, 오디오, PDF
출력 텍스트 전용
사고 수준 low, medium(기본값), high
출시 가격 입력 $0.75 / 출력 $3.75 (백만 토큰당, 2026년 12월 31일까지)
표준 가격 입력 $1.50 / 출력 $7.50 (백만 토큰당, 2027년 1월 1일부터)
컨텍스트 캐싱 백만 캐시 토큰당 $0.075(출시), $0.15(표준)
Batch API 50% 할인: $0.375 / $1.875 (출시 가격)
지식 마감일 2026년 3월
개발자 가용성 Gemini API, Google AI Studio, Android Studio, Google Antigravity, Stitch, Gemini Enterprise
소비자 가용성 Gemini 앱(AI Pro·Ultra 구독자), 검색 AI 모드, Google Sheets의 Gemini
Gemini 3.7 Flash 지원 중단일 없이 계속 지원

다음 세 가지는 마이그레이션 전에 확인해야 합니다.

  • 기본 사고 수준은 Gemini 3 Pro의 high가 아니라 medium입니다. Pro용 프롬프트를 그대로 사용하면 추론량이 줄어들 수 있습니다.
  • minimallow로 자동 변환되지 않고 유효성 검사 오류를 반환합니다. 해결 방법은 사고 수준 가이드를 참고하세요.
  • 지식 마감일은 2026년 3월이지만, 모델 카드에 따르면 일부 도메인의 지식은 2025년 1월로 제한될 수 있습니다.

Gemini 3.8 Flash란?

Flash는 Google의 주력 모델 등급입니다. Pro가 가장 어려운 문제를 처리하는 동안, 대부분의 프로덕션 트래픽을 담당하도록 설계되었습니다.

Google은 Gemini 3.8 Flash를 “현재까지 가장 지능적인 주력 모델”이라고 부릅니다. 다만 DeepMind 모델 카드에 따르면 완전히 새로운 기본 모델이 아니라 Gemini 3.7 Flash를 기반으로 합니다. 따라서 Gemini 3.8 Flash는 3.7 Flash를 장기적인 소프트웨어 엔지니어링과 에이전트 작업에 맞게 개선한 후속 모델로 보는 것이 정확합니다.

출시 주기도 짧았습니다.

  • Gemini 3.6 Flash: 2026년 7월 21일, $1.50 / $7.50
  • Gemini 3.7 Flash: 2026년 8월 13일, 출시 가격 $0.75 / $3.75
  • Gemini 3.8 Flash: 2026년 9월 2일, 출시 가격 $0.75 / $3.75

Google은 이를 “6주 만에 세 번째 Flash 출시”라고 표현합니다. Artificial Analysis는 3.5 Flash-Lite까지 포함해 4개월 내 네 번째 Flash 모델로 계산합니다.

이번 출시와 함께 Gemini 3.8 Pro, Gemini 4, 새로운 Flash-Lite가 발표되지는 않았습니다. Google은 Pro 업데이트 일정도 공개하지 않았습니다. 또한 Gemini 3.7 Flash의 새로운 기능은 불과 3주 전에 발표되었지만, 이제 이전 세대 모델을 설명하는 자료가 되었습니다.

“더 열심히 일하는” 설계와 비용

Google이 설명한 Gemini 3.8 Flash의 동작 변화는 다음과 같습니다.

  • 추가 추론 단계 실행
  • 작은 단위로 작업 수행
  • 작업 중 자체 검증
  • 도구 반복 호출

Google은 특히 높은 노력 수준에서 모델이 “설계상 더 오래 실행되고 복잡한 작업에서 더 많은 토큰을 사용할 수 있다”고 명시합니다.

Artificial Analysis의 독립 보고서에 따르면 Intelligence Index 실행 시 Gemini 3.8 Flash는 높은 추론 수준에서 작업당 평균 48,000개의 출력 토큰을 사용했습니다. 이는 Gemini 3.7 Flash보다 30% 많은 수치입니다.

토큰당 가격은 동일하지만 작업당 비용은 다음과 같이 증가했습니다.

  • Gemini 3.7 Flash high: 약 $0.40
  • Gemini 3.8 Flash high: 약 $0.58
  • 실행 시간: 2.2분 → 2.5분

사고 수준을 낮추면 비용과 지연 시간을 줄일 수 있습니다.

  • medium: 약 $0.41
  • low: 약 $0.24, 작업당 약 0.8분

따라서 thinking_level은 단순한 전역 설정이 아니라 라우팅 기준으로 사용해야 합니다.

  • 지연 시간에 민감한 엔드포인트: low
  • 일반적인 에이전트 작업: medium
  • 성공률이 중요한 복잡한 작업: high

각 수준에서 하루 1,000개의 에이전트 작업을 실행했을 때의 비용은 가격 분석에서 확인할 수 있습니다.

속도 자체는 크게 변하지 않았습니다. Google의 Logan Kilpatrick은 Gemini 3.8 Flash를 “3.7과 동일한 가격, 거의 동일한 속도”라고 설명했습니다. Artificial Analysis는 높은 추론 수준에서 초당 302.1개의 출력 토큰과 첫 토큰까지 13.30초를 측정했습니다. 이 시간은 네트워크 지연보다 답변 전 추론에 사용된 시간으로 해석할 수 있습니다.

벤치마크 결과

Google은 DeepMind Flash 페이지에 다음 벤치마크 결과를 게시했습니다.

벤치마크 3.8 Flash 3.7 Flash Claude Opus 5 GPT-5.6 Sol GPT-5.6 Terra Claude Sonnet 5
Vals 금융 에이전트 v2 61.4% 59.0% 58.6% 53.8% 54.4% 53.9%
Harvey 법률 에이전트 벤치마크 10.0% 8.8% 6.7% 2.5% 0.8% 5.0%
HLE-검증됨 54.9% 53.6% 54.4% 54.5% 51.1% 31.0%

Gemini 3.7 Flash 대비 개선 폭은 각각 2.4, 1.2, 1.3포인트입니다. 절대적인 차이는 작지만, 금융·법률 벤치마크에서는 Flash 가격대의 Gemini 3.8 Flash가 토큰당 훨씬 비싼 Opus 5와 GPT-5.6 Sol을 앞섰습니다.

전날 출시된 Claude Fable 5.1은 Google 표에 포함되지 않았습니다. 삼자 비교는 공개된 Anthropic 모델 중 Opus 5와 Sonnet 5를 비교 대상으로 사용합니다.

Google은 다음과 같은 추가 결과도 제시했지만, 모든 수치를 텍스트로 공개하지는 않았습니다.

  • DeepSWE v1.1: 적은 비용으로 대부분의 더 큰 최첨단 모델을 능가한다고 주장합니다. 수치는 모델 카드 이미지 표에만 있으며, Gemini 3.7 Flash는 65.3%를 기록했습니다.
  • 장기 문서 워크플로: 내부 평가에서 Gemini 3.7 Flash보다 세 배 이상 많은 작업을 완료했습니다.
  • Gray Swan 프롬프트 주입: 수치 없이 “상당한 도약”을 보고했습니다.
  • SWE-Bench Pro, Terminal-bench, OSWorld: Gemini 3.8 Flash의 텍스트 결과는 공개되지 않았습니다.

Artificial Analysis의 독립 평가에서는 다음 점수를 기록했습니다.

  • Intelligence Index: Gemini 3.8 Flash high 59점
  • Gemini 3.7 Flash: 56점
  • Gemini 3.6 Flash: 52점
  • GPT-5.6 Sol xhigh, Grok 4.6 medium: 59점
  • GPT-5.6 Terra max, Claude Fable 5.1 medium, Muse Spark 1.2 xhigh: 57점
  • τ³-Banking 도구 사용: 45점, Gemini 3.7 Flash보다 12점 상승

Gemini 3.8 Flash와 3.7 Flash 비교에서는 워크로드별 토큰 비용과 성능 개선을 함께 비교합니다.

가격: 토큰당 동일하지만 작업당 증가

Google 가격 페이지에 따르면 Gemini 3.8 Flash는 Gemini 3.6 및 3.7 Flash와 같은 가격표를 사용합니다. 세 모델 모두 2027년 1월 1일부터 가격이 두 배로 인상됩니다.

항목 2026년 12월 31일까지 2027년 1월 1일부터
입력 $0.75 / 백만 토큰 $1.50 / 백만 토큰
출력(사고 토큰 포함) $3.75 / 백만 토큰 $7.50 / 백만 토큰
캐시된 입력 $0.075 / 백만 토큰 $0.15 / 백만 토큰
캐시 저장소 $0.50 / 백만 토큰 / 시간 $1.00 / 백만 토큰 / 시간
Batch 입력 / 출력 $0.375 / $1.875 $0.75 / $3.75

주의할 점은 두 가지입니다.

  1. 사고 토큰은 출력 토큰으로 청구됩니다. 다만 usageMetadata.thoughtsTokenCount에 별도로 보고됩니다. 따라서 짧은 답변이라도 high 수준의 사고 토큰이 많으면 low 수준의 긴 답변보다 비쌀 수 있습니다.
  2. Google Search grounding에는 별도 과금 기준이 있습니다. 모든 Gemini 3.x 모델에 월 5,000건의 무료 요청이 제공되며, 이후에는 1,000건당 $14가 부과됩니다.

AI Studio와 API에는 사용량 제한이 있는 무료 등급이 있습니다. Google은 무료 등급에서 수집된 데이터가 “제품 개선에 사용된다”고 설명합니다. 모델별 사용량 제한은 문서가 아니라 AI Studio에서 확인할 수 있습니다.

청구 계정을 연결하면 Tier 1이 활성화됩니다. 이후 $100 지출 및 3일 경과 시 Tier 2, $1,000 지출 및 30일 경과 시 Tier 3가 활성화됩니다.

API 호출 방법

Google은 Gemini 3.x의 기본 경로로 Interactions API를 제시합니다. generateContent는 레거시 경로로 분류되지만 완전히 지원되며 서비스 중단일도 발표되지 않았습니다.

최소 요청은 다음과 같습니다.

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-[REDACTED CREDENTIAL]" \
  -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"medium"}}'
Enter fullscreen mode Exit fullscreen mode

다중 턴 대화에서는 previous_interaction_id를 전달해 서버 측 상태를 유지할 수 있습니다.

함수 호출은 JSON 스키마로 도구를 선언한 뒤 다음 단계를 처리합니다.

  1. function_call 수신
  2. 함수 실행
  3. function_result 반환

Gemini 3.8 Flash에서는 function_resultcall_idname을 모두 포함해야 합니다. 레거시 generateContent에서는 필드 이름이 id입니다.

Gemini 3.7 Flash에서 마이그레이션하기

변경 사항은 작지만 다음 항목은 오류를 일으킬 수 있습니다.

  • minimal 사고 수준은 거부됩니다.
  • thinking_budgetthinking_level로 대체되었습니다.
  • candidate_count는 지원되지 않습니다.
  • temperature는 기본값인 1.0을 유지하는 것이 권장됩니다. 낮추면 루프나 성능 저하가 발생할 수 있습니다.

마이그레이션 가이드에서 변경 전후 JSON과 체크리스트를 확인할 수 있습니다.

Gemini 3.8 Flash가 지원하지 않는 기능

모델 페이지에 따르면 지원되지 않는 기능은 다음과 같습니다.

  • 오디오 생성
  • Live API
  • 이미지 생성

입력은 텍스트, 이미지, 비디오, 오디오, PDF를 지원하지만 출력은 텍스트 전용입니다. Gemini 3 모델에서는 이미지 분할도 지원되지 않습니다.

실시간 음성이나 이미지 출력이 필요한 제품이라면 Gemini 3.8 Flash는 전체 솔루션이 아니라 추론·도구 호출 계층으로 사용해야 합니다.

복잡한 추론 없이 저렴하고 처리량이 높은 텍스트가 필요하다면 Gemini 3.5 Flash-Lite를 고려할 수 있습니다. 가격은 입력 $0.30, 출력 $2.50(백만 토큰당)입니다.

그 밖에 함수 호출, 구조화된 출력, 컨텍스트 캐싱, 코드 실행, 검색·지도 기반 작업, Batch API, 프리뷰의 컴퓨터 사용은 지원됩니다.

Gemini 3.8 Flash Cyber: 게이트가 적용된 쌍둥이 모델

Gemini 3.8 Flash Cyber는 같은 날 출시되었지만 일반적으로 등록할 수 없습니다. 새로운 Fairwind Program을 통해서만 접근할 수 있으며, 대상은 다음과 같습니다.

  • 신뢰할 수 있는 정부 기관
  • 중요 인프라 운영자
  • 소프트웨어 관리자

신원 조사와 피싱 방지 MFA 등의 요구 사항이 적용됩니다. 공개 API, 공개 가격, 자체 호스팅 옵션은 제공되지 않으며, Gemini 3.5 Flash Cyber의 제한적 시범 프로그램을 대체합니다.

Google은 다음과 같은 결과를 주장합니다.

  • 20개 프로그래밍 언어에서 실제 취약점 발견 성공률 70% 이상
  • Chrome 보안 팀 기준, 훨씬 더 큰 상용 모델보다 Chrome 취약점 패치 정확도가 2.6배 높음

두 수치는 모두 Google이 보고한 결과입니다. 자격 요건과 의무, 일반 팀이 접근할 수 없는 이유는 Cyber 설명에서 확인할 수 있습니다.

Apidog에서 Gemini 3.8 Flash 테스트하기

토큰당 가격은 동일하지만 작업당 비용이 달라지므로, 테스트의 성공 기준을 HTTP 200 응답에만 두면 안 됩니다. 다음 항목을 함께 검증하세요.

  1. 상태 코드가 200인지 확인
  2. 애플리케이션이 사용하는 JSON 필드 검증
  3. usageMetadata.thoughtsTokenCount 상한선 검증
  4. 동일한 프롬프트를 low, medium, high로 실행
  5. 수준별 토큰 분포와 작업 시간을 비교

GEMINI_API_KEY를 환경 변수에 저장하고, Interactions API와 generateContent 요청을 Apidog 엔드포인트로 등록하면 됩니다. 이렇게 하면 Artificial Analysis의 평균값 대신 자신의 프롬프트와 워크로드에 맞는 비용 데이터를 얻을 수 있습니다.

스트리밍 응답은 SSE로 렌더링됩니다. includeThoughts: true로 사고 요약을 디버깅할 때 유용하며, 자세한 방법은 SSE 테스트 가이드에서 확인할 수 있습니다.

테스트 시나리오를 매일 예약하면 토큰 사용량이 증가하는 회귀를 청구서에 반영하기 전에 감지할 수 있습니다. 무료 플랜으로 시작하려면 Apidog를 다운로드하세요.

자주 묻는 질문

Gemini 3.8 Flash는 새로운 모델인가요, Gemini 3.7 Flash의 업데이트인가요?

DeepMind 모델 카드에 따르면 Gemini 3.7 Flash를 기반으로 한 조정된 후속 모델입니다. 가격, 속도, 컨텍스트 창은 비슷하지만 어려운 작업에서 더 많은 추론과 도구 호출 단계를 수행합니다. Gemini 3.7 Flash도 지원 중단일 없이 계속 지원됩니다.

왜 Gemini 3.7 Flash보다 더 많은 토큰을 사용하나요?

설계상 더 오래 실행되기 때문입니다. Google은 복잡한 작업에서 더 많은 토큰을 사용할 수 있다고 설명했으며, Artificial Analysis는 약 30% 더 많은 출력 토큰을 측정했습니다. 추가 추론이 필요하지 않은 경로에서는 thinking_levelmedium 또는 low로 낮추세요. 수준별 비용은 사고 수준 가이드에서 확인할 수 있습니다.

컨텍스트 창은 얼마인가요?

입력 1,048,576토큰, 출력 65,536토큰입니다. 2026년 12월 31일까지 컨텍스트 캐싱은 백만 캐시 토큰당 $0.075입니다.

무료 Gemini 앱에서도 사용할 수 있나요?

출시 정보에 따르면 Gemini 앱에서는 Google AI Pro 및 Ultra 구독자에게 제공됩니다. 개발자는 AI Studio와 API에서 사용량 제한이 있는 무료 등급을 이용할 수 있습니다.

Claude Fable 5.1과 비교하면 어떤가요?

Artificial Analysis 점수는 Gemini 3.8 Flash 59점, Claude Fable 5.1 57점입니다. Claude Fable 5.1의 가격은 백만 토큰당 입력 $10, 출력 $50으로, Gemini 3.8 Flash 출시 가격보다 약 13배 높습니다. 다만 작업당 토큰 사용량까지 반영하면 실제 격차는 줄어듭니다.

다음 단계

Gemini 3.8 Flash는 더 오래 생각하는 주력 모델입니다. 에이전트 벤치마크에서 개선되고 도구 사용 평가에서 12점 상승했지만, 높은 추론 수준에서는 약 30% 더 많은 출력 토큰을 사용합니다.

  • Gemini 3.7 Flash에서 에이전트가 한계에 도달했다면: medium 또는 high로 업그레이드
  • 지연 시간에 민감한 채팅이라면: low 사용
  • 기존 워크플로가 안정적이라면: 계속 지원되는 Gemini 3.7 Flash 유지
  • 운영 전환 전에는: Apidog에서 토큰 수와 사고 수준별 비용을 검증

API 튜토리얼로 첫 요청을 보내고, 토큰 수 어설션을 추가하세요. 출시 발표의 평균값보다 실제 워크로드의 측정 결과가 각 경로에 적합한 사고 수준을 결정해야 합니다.

Top comments (0)