Gemini 3.6 Flash는 Google의 새로운 주력 모델입니다. 2026년 7월 21일에 정식 출시되었으며, 이전 모델인 Gemini 3.5 Flash보다 저렴하고 토큰 효율성이 뛰어납니다. 대량의 API 트래픽을 처리하면서 플래그십 가격 없이 견고한 품질을 원한다면 이 모델이 적합합니다.
이 글에서는 Gemini 3.6 Flash의 사양, 가격, 성능 지표, API 액세스 방법과 함께 실제 요청을 보내고 회귀 테스트하는 방법을 다룹니다. 마이그레이션 전에는 벤치마크 수치만 보지 말고, 실제 프롬프트와 컨텍스트 길이로 응답 품질·비용·지연 시간을 검증하세요.
Gemini 3.6 Flash란 무엇인가요?
Gemini 3.6 Flash는 Google Gemini 제품군의 중간 계층 고처리량 모델입니다. 요약, 정보 추출, 분류, 채팅, 다단계 도구 호출처럼 대부분의 프로덕션 트래픽을 차지하는 작업에 맞춰 설계되었습니다.
단일 요청에서 다음 입력을 처리할 수 있습니다.
- 텍스트
- 이미지
- 비디오
- 오디오
출력은 텍스트 전용입니다.
Google은 2026년 7월 21일에 Gemini 3.6 Flash를 포함한 세 가지 모델을 공개했습니다.
- Gemini 3.6 Flash: 일반적인 프로덕션 워크로드용 주력 모델
- Gemini 3.5 Flash-Lite: 더 저렴하고 빠른 대용량 처리용 모델
- Gemini 3.5 Flash Cyber: 정부 및 신뢰할 수 있는 파트너에만 제공되는 게이티드 보안 모델
각 모델의 용도는 명확히 구분해야 합니다. 저비용 대량 처리에는 Gemini 3.5 Flash-Lite란 무엇인가를, 보안 모델 관련 내용은 Gemini 3.5 Flash Cyber란 무엇인가를 참고하세요.
주의할 점은 버전 번호입니다. 주력 모델은 3.6으로 올라갔지만 Flash-Lite와 Flash Cyber는 3.5에 머물러 있습니다.
gemini-3.6-flash
gemini-3.5-flash-lite
두 ID는 오타가 아니라 서로 다른 모델 등급입니다. 환경 변수나 배포 설정에서 모델 ID를 하드코딩했다면 마이그레이션 전에 반드시 확인하세요.
Google의 공식 발표는 Google 블로그에서, 모델 정보는 DeepMind Flash 페이지에서 확인할 수 있습니다.
Gemini 3.5 Flash 대비 달라진 점
핵심 변경점은 출력 토큰 효율성과 출력 비용입니다.
Gemini 3.6 Flash는 동일한 작업을 완료할 때 Gemini 3.5 Flash보다 약 17% 적은 출력 토큰을 사용합니다. 출력 토큰은 일반적으로 비용과 응답 시간에 가장 큰 영향을 주므로, 이 변화는 대량 트래픽에서 특히 중요합니다.
| 항목 | Gemini 3.5 Flash | Gemini 3.6 Flash |
|---|---|---|
| 출력 가격 | 1M 토큰당 $9.00 | 1M 토큰당 $7.50 |
| 출력 토큰 사용량 | 기준 | 약 17% 감소 |
예를 들어, 기존 프롬프트가 평균 10,000개의 출력 토큰을 생성했다면, 새 모델에서는 출력 길이가 줄어들 수 있습니다. 다만 실제 절감률은 시스템 프롬프트, 응답 형식, 도구 호출 횟수, 모델 설정에 따라 달라집니다.
또한 Gemini 3.6 Flash는 코딩 및 컴퓨터 사용 작업이 개선되었고, 다단계 워크플로에서 더 적은 추론 단계와 도구 호출로 응답에 도달하도록 개선되었습니다. 에이전트 워크플로에서는 다음 비용을 줄이는 데 도움이 됩니다.
- 도구 호출 횟수
- 총 출력 토큰
- 재시도 횟수
- 전체 실행 지연 시간
기존 트래픽을 이전하기 전에는 Gemini 3.6 Flash vs 3.5 Flash 비교 자료를 확인하고, 운영 프롬프트로 A/B 테스트를 수행하세요.
Gemini 3.6 Flash 사양
| 속성 | Gemini 3.6 Flash |
|---|---|
| 모델 ID | gemini-3.6-flash |
| 입력 컨텍스트 창 | 1M 토큰 |
| 최대 출력 | 64k 토큰 |
| 입력 양식 | 텍스트, 이미지, 비디오, 오디오, PDF |
| 출력 | 텍스트 전용 |
| 입력 가격 | 1M 토큰당 $1.50 |
| 출력 가격 | 1M 토큰당 $7.50, 생각 토큰 포함 |
| 무료 등급 | 예, Google AI Studio를 통해 제공, 속도 제한 있음 |
| 출시일 | 2026년 7월 21일 |
구현 시 특히 확인할 값은 다음 두 가지입니다.
1M 입력 컨텍스트 창
대규모 문서, 긴 스크립트, 전체 코드베이스를 한 요청에 전달할 수 있습니다. 그러나 컨텍스트 창이 크다고 해서 모든 위치의 정보를 동일한 정확도로 회수하는 것은 아닙니다.64k 최대 출력
단일 응답의 상한입니다. 책 길이의 문서 생성, 대규모 코드 변환, 긴 보고서 생성은 여러 단계로 나누고 각 단계의 결과를 검증하는 방식으로 설계해야 합니다.
성능
벤치마크는 실제 운영 품질을 보장하지는 않지만, 모델의 상대적 강점을 파악하는 데 유용합니다. Google이 보고한 공개 스위트 결과는 다음과 같습니다.
| 영역 | 벤치마크 | Gemini 3.6 Flash 결과 |
|---|---|---|
| 소프트웨어 엔지니어링 | SWE-Bench Pro | 58.7% |
| 소프트웨어 엔지니어링 | DeepSWE v1.1 | 49% |
| 터미널 작업 | Terminal-bench 2.1 | 78.0% |
| 컴퓨터 사용 | OSWorld-Verified | 83.0% |
| 광범위한 전문가 작업 | GDPVal-AA v2 Elo | 1421 |
코딩 작업에서는 SWE-Bench Pro 58.7%, DeepSWE v1.1 49%를 기록했습니다. 실제 터미널 명령 실행을 측정하는 Terminal-bench 2.1에서는 78.0%에 도달했습니다.
컴퓨터 사용 분야에서는 OSWorld-Verified 점수가 Gemini 3.5 Flash의 78.4%에서 83.0%로 상승했습니다. 브라우저나 데스크톱 UI를 조작하는 에이전트를 구축한다면 이 수치가 특히 관련 있습니다.
긴 컨텍스트에서는 결과를 보수적으로 해석해야 합니다.
- 128k 토큰 검색: 평균 91.8%
- 전체 1M 토큰 창의 포인트별 검색: 54.0%
즉, 대규모 입력을 처리할 수는 있지만 컨텍스트 전체를 채운 상태에서 완벽한 회수를 기대해서는 안 됩니다. RAG나 대규모 문서 분석을 운영한다면 다음 테스트를 직접 추가하세요.
1. 문서 앞부분, 중간, 끝부분에 각각 정답 정보를 삽입한다.
2. 각 위치의 정보를 묻는 프롬프트를 만든다.
3. 컨텍스트 길이를 128k, 256k, 512k, 1M으로 늘린다.
4. 정확도, 응답 시간, 출력 토큰 수를 기록한다.
5. 운영에서 사용할 최대 문서 길이를 결정한다.
가격 한눈에 보기
Gemini 3.6 Flash의 기본 가격은 다음과 같습니다.
입력: 1M 토큰당 $1.50
출력: 1M 토큰당 $7.50
출력 가격에는 사용자가 최종 응답에서 직접 보지 못하는 생각 토큰도 포함됩니다. 따라서 비용을 예측할 때는 최종 출력 텍스트 길이만 보지 말고 실제 청구 토큰과 요청별 응답 길이를 함께 측정해야 합니다.
컨텍스트 캐싱 비용은 다음과 같습니다.
캐시된 입력: 1M 토큰당 $0.15
캐시 저장: 시간당 1M 토큰당 $1.00
동일한 대규모 시스템 프롬프트, 제품 문서 또는 코드 컨텍스트를 반복 전송한다면 캐싱을 검토할 수 있습니다.
Google AI Studio에는 무료 등급이 제공되지만 속도 제한이 있고, Google은 제품 개선을 위해 무료 등급 데이터를 사용할 수 있습니다. 따라서 무료 등급은 프로토타입과 기능 검증에 적합하며, 민감한 데이터나 프로덕션 트래픽은 별도의 정책 검토가 필요합니다.
Gemini 3.6 Flash 액세스 방법
Gemini 3.6 Flash는 여러 경로로 사용할 수 있습니다.
- Google AI Studio를 통한 Gemini API
- Google의 에이전트 개발 환경인 Google Antigravity
- 관리형 에이전트 구축용 Gemini Enterprise Agent Platform
- 대화형 사용을 위한 Gemini 앱
개발자에게 가장 일반적인 경로는 Gemini API입니다. API 키를 발급받은 뒤 모델 ID로 gemini-3.6-flash를 지정합니다.
다음은 REST 요청 구조를 검증할 때 사용할 수 있는 예시입니다.
curl -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent?key=$GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [
{
"parts": [
{
"text": "다음 내용을 JSON으로 요약하세요: ..."
}
]
}
]
}'
운영 코드에서는 API 키를 소스에 넣지 말고 환경 변수나 비밀 관리 도구에 저장하세요.
export GEMINI_API_KEY="YOUR_API_KEY"
요청 형식과 인증 방식은 Gemini 3.6 Flash API 사용 방법 및 Google Gemini 3 API 가이드에서 확인할 수 있습니다. 공식 API 참조는 ai.google.dev에 있습니다.
Google 제품군 내 위치
Flash 모델군은 비용과 품질의 사다리로 생각하면 이해하기 쉽습니다.
| 모델 | 적합한 작업 |
|---|---|
| Gemini 3.5 Flash-Lite | 대용량, 낮은 지연 시간, 비용 민감형 작업 |
| Gemini 3.6 Flash | 일반적인 프로덕션 작업, 에이전트, 코딩, 다단계 워크플로 |
| Gemini 3.5 Flash Cyber | 제한된 보안 환경 및 게이티드 액세스 시나리오 |
Gemini 3.5 Flash-Lite는 Gemini 3.6 Flash보다 저렴합니다.
Flash-Lite 입력: 1M 토큰당 $0.30
Flash-Lite 출력: 1M 토큰당 $2.50
출력 속도: 초당 약 350개 토큰
다음과 같은 작업은 Flash-Lite가 더 적합할 수 있습니다.
- 단순 분류
- 짧은 요약
- 대량 데이터 추출
- 낮은 지연 시간이 중요한 반복 요청
- 완벽한 품질보다 비용 효율이 중요한 배치 작업
반대로 출력 품질, 코딩 능력, 도구 호출 안정성이 더 중요하다면 Gemini 3.6 Flash를 우선 검토하세요.
Gemini 3.5 Pro는 아직 공개 출시되지 않았습니다. Google은 파트너와 테스트 중이라고 밝혔으며, Gemini 4 사전 훈련 실행도 예고된 상태입니다. 따라서 지금 호출 가능한 모델 기준으로 설계해야 하며, 출시 예정 모델을 운영 의존성으로 두면 안 됩니다.
이전 세대 기준은 Gemini 3.5란 무엇인가에서 확인할 수 있습니다.
Apidog에서 Gemini 3.6 Flash 테스트하기
모델 페이지의 벤치마크는 특정 조건에서의 결과입니다. 실제 운영 품질을 확인하려면 여러분의 프롬프트, 문서 길이, 응답 스키마, 도구 호출 흐름으로 직접 테스트해야 합니다.
Apidog를 사용하면 Gemini API 요청을 저장하고, 환경별 키를 분리하고, 응답 검증과 회귀 테스트를 자동화할 수 있습니다.
1. 요청 생성
새 POST 요청을 만들고 Gemini API 엔드포인트를 설정합니다. 모델 ID는 gemini-3.6-flash를 사용합니다.
POST /v1beta/models/gemini-3.6-flash:generateContent
2. API 키를 환경 변수로 분리
키를 URL이나 요청 본문에 직접 고정하지 말고 환경 변수로 저장하세요.
GEMINI_API_KEY={{gemini_api_key}}
이렇게 하면 개발, 스테이징, 프로덕션 환경 간에 요청 본문을 수정하지 않고 키만 전환할 수 있습니다.
3. 응답 검증 추가
최소한 다음 항목은 자동 검증 대상으로 추가하세요.
- HTTP 상태 코드가
200인지 - 응답에 예상 텍스트 필드가 존재하는지
- JSON 출력이 필요한 경우 파싱 가능한지
- 응답 시간이 허용 범위 안인지
- 필수 키워드 또는 구조가 유지되는지
예를 들어, JSON 형식의 응답을 기대한다면 단순히 성공 코드만 확인하지 말고 예상 필드를 검사해야 합니다.
{
"summary": "문서 요약",
"risk_level": "low"
}
모델 업데이트 후에도 이 구조가 유지되는지 검증하면 스키마 변경을 빠르게 발견할 수 있습니다.
4. 회귀 테스트 예약
기준 프롬프트를 저장한 후 정기 실행을 예약하세요. 실행 일정 예약을 설정하면 다음 변경을 조기에 감지할 수 있습니다.
- 응답 JSON 구조 변경
- 응답 시간 증가
- 특정 프롬프트 품질 저하
- 출력 길이 및 토큰 사용량 변화
- 오류율 증가
Apidog는 모델을 실행하는 AI 프레임워크가 아닙니다. API 요청을 만들고, 보내고, 검증하고, 회귀 테스트하는 도구입니다. Google이 이후 Flash 모델을 업데이트했을 때 저장된 테스트를 실행하면 애플리케이션이 의존하는 동작이 바뀌었는지 빠르게 확인할 수 있습니다.
첫 요청을 구성하려면 Apidog를 다운로드하세요.
자주 묻는 질문
Gemini 3.6 Flash는 무료인가요?
Google AI Studio를 통해 무료 등급이 제공되지만 속도 제한이 있으며 프로토타이핑용입니다. Google은 제품 개선을 위해 무료 등급 데이터를 사용할 수 있습니다. 프로덕션 트래픽은 입력 1M 토큰당 $1.50, 출력 1M 토큰당 $7.50 기준으로 비용이 발생합니다.
Gemini 3.6 Flash가 3.5 Flash보다 더 좋은가요?
대부분의 작업에서는 그렇습니다. 약 17% 적은 출력 토큰을 사용하며, 출력 가격은 1M 토큰당 $9.00에서 $7.50로 낮아졌습니다. 코딩과 컴퓨터 사용 능력도 향상되었으며, OSWorld-Verified 점수는 78.4%에서 83.0%로 증가했습니다.
Gemini 3.5 Pro는 출시되었나요?
아니요. Google은 여전히 파트너와 Gemini 3.5 Pro를 테스트 중이라고 밝혔습니다. Gemini 4 사전 훈련 실행도 예고되었지만 공개 출시된 모델은 아닙니다.
모델 ID는 무엇인가요?
gemini-3.6-flash
더 저렴한 Flash-Lite 모델인 gemini-3.5-flash-lite와 혼동하지 마세요.
Gemini 3.6 Flash가 할 수 없는 것은 무엇인가요?
출력은 텍스트 전용이므로 이미지, 오디오, 비디오는 생성하지 않습니다. 또한 1M 토큰 컨텍스트 창 전체를 사용할 때는 정보 회수 정확도가 떨어질 수 있으며, 전체 길이 포인트별 검색에서는 약 54.0%를 기록했습니다. 최첨단 플래그십 모델이 아니라 비용 효율적인 중간 계층 모델이라는 점도 고려해야 합니다.
Gemini 3.6 Flash는 대부분의 Gemini API 트래픽에서 우선 검토할 수 있는 모델입니다. 이전 버전보다 저렴하고 토큰 효율이 높으며, 에이전트 및 다단계 작업에 적합합니다. 전체 트래픽을 이전하기 전에 핵심 프롬프트를 저장하고, 응답 구조·지연 시간·비용을 기준으로 회귀 테스트를 먼저 구성하세요.


Top comments (0)