Google은 2026년 7월 21일 Flash 티어를 업데이트하며 주력 모델을 Gemini 3.6 Flash로 업그레이드했습니다. 프로덕션에서 3.5 Flash를 사용 중이라면 핵심은 간단합니다. 3.6 Flash는 동일한 모델 패밀리, 1M 토큰 컨텍스트, 입력 가격을 유지하면서 출력 비용과 토큰 사용량을 줄인 드롭인 대체 모델입니다. 대부분의 팀은 평가 후 업그레이드해야 합니다. 자세한 내용은 Gemini 3.6 Flash란 무엇인가를 참고하세요.
간단한 답변
업그레이드하세요.
Gemini 3.6 Flash는 다음을 제공합니다.
- 입력 가격 유지: 1백만 토큰당 $1.50
- 출력 가격 인하: 1백만 토큰당 $9.00 → $7.50
- 동일 작업에서 약 17% 적은 출력 토큰
- 컴퓨터 사용 벤치마크 향상: OSWorld-Verified 78.4 → 83.0
- 다단계 워크플로우에서 더 적은 추론 단계와 도구 호출
다만 3.5 Flash를 이미 프로덕션에 고정했고, 아직 평가와 회귀 테스트를 다시 실행할 수 없다면 일시적으로 유지하세요. 검증 없이 모델을 교체하는 것은 권장하지 않습니다.
Gemini 3.6 Flash와 3.5 Flash 비교
다음은 Google이 공개한 주요 비교 수치입니다. 자세한 내용은 Google 블로그 게시물과 DeepMind Flash 모델 페이지에서 확인할 수 있습니다.
| 속성 | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| 모델 ID | gemini-3.6-flash |
gemini-3.5-flash |
| 입력 가격(1백만 토큰당) | $1.50 | $1.50 |
| 출력 가격(1백만 토큰당) | $7.50 | $9.00 |
| 출력 토큰 효율성 | 출력 토큰 약 17% 감소 | 기준 |
| 컴퓨터 사용(OSWorld-Verified) | 83.0 | 78.4 |
| 컨텍스트 창 | 1M 입력 토큰 | 1M 입력 토큰 |
변하지 않은 부분은 입력 가격과 컨텍스트 창입니다. 실질적인 차이는 출력 비용과 작업 완료에 필요한 출력 토큰 수입니다.
실제로 개선된 점
1. 출력 토큰 감소
Gemini 3.6 Flash는 동일한 작업에서 3.5 Flash보다 약 17% 적은 출력 토큰을 생성합니다.
출력 토큰에는 사고(thinking) 토큰도 포함됩니다. 즉, 모델이 같은 답을 얻기 위해 더 적게 추론하고 더 적게 생성한다는 의미입니다. 출력 토큰은 직접 과금 대상이므로, 이는 단순한 벤치마크 지표가 아니라 실제 비용 절감으로 연결됩니다.
2. 출력 토큰 단가 인하
출력 가격은 1백만 토큰당 $9.00에서 $7.50으로 낮아졌습니다.
이는 토큰당 약 17% 가격 인하입니다. 여기에 출력 토큰 자체도 약 17% 줄어들므로, 출력 비중이 큰 워크로드에서는 두 절감 효과가 함께 적용됩니다.
3. 컴퓨터 사용 능력 향상
OSWorld-Verified에서 Gemini 3.6 Flash는 83.0점을 기록했고, 3.5 Flash는 78.4점이었습니다.
UI 조작, 폼 입력, 브라우저 자동화, 도구 기반 에이전트를 구현한다면 이 차이는 실패 단계 감소로 이어질 수 있습니다.
4. 추론 단계 및 도구 호출 감소
다단계 에이전트 워크플로우에서 3.6 Flash는 목표에 도달하기 위한 추론 단계와 도구 호출을 줄입니다.
도구 호출이 하나 줄어들면 다음 비용을 함께 줄일 수 있습니다.
- 모델 출력 토큰
- 외부 API 호출 비용
- 네트워크 왕복 시간
- 전체 에이전트 실행 시간
코드 생성과 파일 편집처럼 작은 오류가 빌드 실패로 이어질 수 있는 작업에서도 정확도 향상은 중요합니다.
이 업데이트는 API 형식을 바꾸지 않습니다. 요청 형식, 인증 방식, 입력 모달리티(텍스트, 이미지, 비디오, 오디오, PDF), 텍스트 출력은 동일하게 유지됩니다.
청구서에 미치는 영향
비용 절감은 두 가지가 겹쳐서 발생합니다.
- 출력 토큰당 가격이 낮아집니다.
- 생성되는 출력 토큰 수가 줄어듭니다.
예를 들어, 하루에 1천만 출력 토큰을 생성하는 워크로드를 가정해 보겠습니다.
-
Gemini 3.5 Flash
10M × $9.00 / 1M- 출력 비용: 하루 $90.00
-
Gemini 3.6 Flash
- 출력 토큰 17% 감소: 약 830만 토큰
8.3M × $7.50 / 1M- 출력 비용: 하루 $62.25
이 예시에서는 출력 비용이 약 31% 감소합니다. 프롬프트를 변경하지 않아도 발생하는 절감입니다.
입력 가격은 두 모델 모두 1백만 토큰당 $1.50이므로, 입력 토큰 사용량이 같다면 입력 비용은 변하지 않습니다. 반면 도구 호출이 많은 에이전트 워크로드는 왕복 자체가 줄어들 수 있으므로 전체 실행 비용이 더 크게 감소할 수 있습니다.
실제 절감률은 입력과 출력의 비율에 따라 달라집니다.
- 읽기 중심 작업: 분류, 추출, 짧은 응답 → 출력 비용 비중이 낮아 전체 절감폭이 작을 수 있습니다.
- 쓰기 중심 작업: 초안 작성, 코드 생성, 긴 에이전트 추적 → 출력 토큰 비중이 높아 더 큰 절감 효과를 기대할 수 있습니다.
요금, 캐싱, 사고 토큰 관련 세부 사항은 Gemini 3.6 Flash 가격 및 공식 Gemini API 가격 문서를 확인하세요.
3.5 Flash를 유지해야 하는 경우
제한적인 경우에는 3.5 Flash를 유지하는 것이 합리적입니다.
다음 조건에 해당한다면 즉시 교체하지 마세요.
- 규정 준수 승인과 연결된 평가 스위트가 잠겨 있음
- 다운스트림 파서가 특정 출력 형식이나 문구에 의존함
- 이번 배포 주기에 회귀 테스트 기간이 없음
- 모델 출력 변경을 검증할 수 있는 트래픽 샘플이 없음
모델 ID만 바꾸면 API 호출은 동작할 수 있습니다. 하지만 출력 문구, JSON 구조, 필드 누락 여부, 도구 호출 순서 등은 달라질 수 있습니다. “더 저렴하다”는 이유만으로 검증할 수 없는 프로덕션 시스템에 변경을 적용하지 마세요.
Gemini 3.5 Flash는 3.6 Flash 출시와 함께 사라지는 것이 아닙니다. API에서 계속 사용할 수 있으므로, 검증 기간이 열릴 때까지 gemini-3.5-flash에 고정한 뒤 계획적으로 마이그레이션하면 됩니다.
마이그레이션 방법
코드 변경 자체는 모델 ID 한 줄 교체입니다.
- gemini-3.5-flash
+ gemini-3.6-flash
예를 들어 요청 본문에서 모델 이름을 사용하는 경우 다음처럼 변경합니다.
{
"model": "gemini-3.6-flash",
"contents": [
{
"role": "user",
"parts": [
{
"text": "이 요청을 처리해 주세요."
}
]
}
]
}
요청 본문 구조, 인증, 엔드포인트는 동일하게 유지됩니다. 요청별 구현은 Gemini 3.6 Flash API 사용 방법 및 Gemini API 문서를 참고하세요.
중요한 작업은 코드 교체가 아니라 검증입니다. 새 모델을 프로덕션에 배포하기 전에 다음 절차를 수행하세요.
- 기존 평가 스위트를 3.6 Flash에서 다시 실행합니다.
- 3.5 Flash 기준 결과와 품질 점수를 비교합니다.
- 출력 문구와 구조를 대상으로 회귀 테스트를 수행합니다.
- JSON 키, 정규식, 다운스트림 스키마 검증처럼 정확한 구조에 의존하는 코드를 확인합니다.
- 실제 트래픽 샘플에서 지연 시간과 토큰 사용량을 측정합니다.
- 처음에는 기능 플래그 또는 일부 트래픽으로 제한 배포합니다.
- 결과가 기준을 만족하면 전체 트래픽으로 승격합니다.
다른 서비스로 모델 출력이 전달된다면, 일반적인 의존성 업그레이드와 동일하게 다루세요. 변경을 플래그 뒤에 두고, 비교하고, 검증한 뒤 승격해야 합니다.
Apidog에서 교체 회귀 테스트
Apidog는 API 클라이언트이자 테스트 플랫폼이므로, 3.6 Flash를 프로덕션에 적용하기 전에 요청과 응답 계약을 검증하는 데 사용할 수 있습니다.
핵심은 모델 자체를 실행하는 것이 아니라, 동일한 요청을 두 모델에 보내고 응답을 비교하는 것입니다.
A/B 비교 절차
기존 Gemini 요청을 저장합니다.
Apidog에서 Gemini APIPOST요청을 만들고, API 키는 환경 변수로 저장합니다. API 키를 요청 본문이나 컬렉션에 직접 노출하지 마세요.요청을 복제합니다.
복제본에서 모델 ID만 변경합니다.
- gemini-3.5-flash
+ gemini-3.6-flash
프롬프트, 파라미터, 헤더, 도구 정의 등 나머지 값은 동일하게 유지해야 공정한 비교가 가능합니다.
- 응답 어설션을 추가합니다. 상태 코드뿐 아니라 애플리케이션이 실제로 사용하는 JSON 필드를 검증하세요.
예를 들어 다음 항목을 확인할 수 있습니다.
- HTTP 상태 코드가 성공인지
- 필수 JSON 키가 존재하는지
- 응답이 예상 스키마를 만족하는지
- 파싱 가능한 형식인지
- 금지된 오류 메시지나 빈 응답이 없는지
응답, 지연 시간, 토큰 사용량을 비교합니다.
두 요청을 실행한 뒤 출력 내용을 나란히 확인하세요. 3.6 Flash가 3.5 Flash에서 통과한 모든 계약 테스트를 통과하는지 검증합니다.회귀 테스트로 예약합니다.
두 요청을 테스트 시나리오로 보관하고 회귀 테스트로 예약하세요. 이후 프롬프트나 모델 변경이 계약을 조용히 깨는 문제를 조기에 발견할 수 있습니다.
실무 워크플로우는 단순합니다.
- 요청을 복제합니다.
- 모델 ID만 교체합니다.
- 동일한 어설션을 실행합니다.
- 품질, 응답 형식, 지연 시간, 토큰 사용량을 비교합니다.
- 기준을 만족할 때만 프로덕션으로 승격합니다.
직접 Gemini 호출을 비교하려면 Apidog를 다운로드하세요.
자주 묻는 질문
Gemini 3.6 Flash는 3.5 Flash의 드롭인 대체 모델인가요?
기계적으로는 그렇습니다. 모델 ID를 gemini-3.5-flash에서 gemini-3.6-flash로 변경하면 나머지 요청 구조는 동일하게 유지됩니다.
다만 출력 문구와 구조는 버전 간에 달라질 수 있습니다. 프로덕션 배포 전에는 평가와 회귀 테스트를 다시 실행하세요.
입력 가격이 변경되었나요?
아니요. 두 모델 모두 입력 가격은 1백만 토큰당 $1.50입니다.
변경된 것은 출력 가격이며, 1백만 출력 토큰당 $9.00에서 $7.50으로 낮아졌습니다.
모델은 3.6인데 Lite와 Cyber 변형은 왜 3.5인가요?
이번 업데이트에서는 주력 Flash 모델만 3.6으로 올라갔습니다. Flash-Lite와 Flash Cyber는 3.5 버전으로 출시되었습니다.
티어 전체의 버전 번호가 항상 동기화되는 것은 아니므로, 모델 패밀리 이름이 아니라 실제 모델 ID를 확인하세요.
청구서가 항상 31% 줄어드나요?
아니요. 31%는 출력 중심 워크로드를 가정한 예시입니다.
실제 절감률은 입력과 출력 토큰 비율에 따라 달라집니다. 출력이 많은 코드 생성, 긴 문서 생성, 에이전트 작업은 더 큰 절감 효과를 얻을 수 있고, 분류나 추출처럼 입력이 많은 작업은 전체 절감폭이 작을 수 있습니다.
3.5 Flash는 계속 사용할 수 있나요?
네. API를 통해 계속 사용할 수 있습니다.
이미 3.5 Flash를 검증했고 현재 재평가가 불가능하다면, 단기적으로 고정하는 것이 합리적입니다. 다만 다음 테스트 기간에는 3.6 Flash 마이그레이션을 계획하세요.
이 모델이 대체하는 이전 세대는 Gemini 3.5란 무엇인가에서 확인할 수 있습니다.
대부분의 팀에게 권장하는 절차는 다음과 같습니다.
- 모델 ID를
gemini-3.6-flash로 교체합니다. - 기존 평가와 빠른 회귀 테스트를 실행합니다.
- Apidog에서 응답 계약, 지연 시간, 토큰 사용량을 비교합니다.
- 검증 결과가 기준을 만족하면 배포합니다.
검증 잠금 때문에 재테스트할 수 없는 경우에만 3.5 Flash를 유지하고, 가능한 가장 빠른 검증 기간에 마이그레이션하세요.

Top comments (0)