Gemini 3.7 Flash는 Google의 최신 주력 AI 모델로, Gemini 3.6 Flash 출시 3주 후인 2026년 8월 13일에 공개되었습니다. 이전 모델의 1M 토큰 컨텍스트 창과 멀티모달 입력 기능을 유지하면서 코딩 및 에이전트 벤치마크에서 큰 향상을 보였으며, 1M 입력 토큰당 $0.75의 출시 기념 API 가격으로 제공됩니다. Google은 이를 “가장 지능적인 주력 모델”이라고 부릅니다.
출시 간격이 3주라는 점은 중요합니다. Google은 Gemini 3.5 Pro가 계속 지연되는 동안 Flash 업데이트를 빠르게 출시하고 있습니다. 즉, 중간 계층 모델에서 새로운 엔지니어링 개선이 먼저 적용되고 있다는 의미입니다. 공개 벤치마크에서도 변화가 확인됩니다. DeepSWE는 16.3점, AutomationBench는 13.4점 상승했으며, 출시 기념 가격은 3.6 Flash 출시 가격의 절반입니다.
이 글에서는 벤치마크 변화, 가격 적용 기간, 모델을 사용할 수 있는 경로, 그리고 바로 실행할 수 있는 cURL 요청을 정리합니다. 엔드포인트 중심의 실습이 필요하다면 Gemini 3.7 Flash API 빠른 시작을 참고하세요. Apidog에서는 기존 프롬프트로 새 모델을 테스트하고 결과를 비교할 수 있습니다.
TL;DR
- Gemini 3.7 Flash는 3.6 Flash 출시 3주 후인 2026년 8월 13일에 출시되었습니다. 모델 ID는
gemini-3.7-flash입니다. - 코딩 및 에이전트 벤치마크가 상승했습니다. DeepSWE v1.1은 49.0%에서 65.3%, AutomationBench는 17.0%에서 30.4%, WebDev Arena Elo는 1538에서 1588로 증가했습니다.
- 출시 기념 API 가격은 1M 입력 토큰당 $0.75, 1M 출력 토큰당 $3.75입니다. 표준 요금인 $1.50 / $7.50은 2027년 1월 1일부터 적용됩니다.
- 사양은 유지됩니다. 1M 입력 토큰 컨텍스트, 64k 출력 제한, 텍스트·이미지·비디오·오디오·PDF 입력, 함수 호출, 검색 도구, 컴퓨터 사용을 지원합니다.
- Gemini API, AI Studio, Gemini 앱, Gemini Spark, Google Antigravity, Android Studio, Gemini Enterprise에서 160개 이상의 국가에 제공됩니다.
- 기존 3.6 Flash 워크로드가 있다면 모델 ID를 변경하고 회귀 테스트를 실행하는 방식으로 빠르게 평가할 수 있습니다.
Gemini 3.7 Flash란 무엇인가
Flash는 Gemini 라인의 중간 계층입니다. Pro보다 저렴하고 빠르며, Flash-Lite보다 높은 성능을 제공하도록 설계되었습니다. 따라서 대량의 프로덕션 AI 트래픽, 코드 보조, 문서 처리, 에이전트 워크플로에 적합한 위치입니다.
Gemini 3.7 Flash는 3.x 라인의 세 번째 Flash 출시입니다. 공식 발표에서도 이 모델을 일반 채팅 모델보다 코딩 및 에이전트 모델로 먼저 설명합니다.
3.6 Flash에서 유지된 주요 사양은 다음과 같습니다.
- 컨텍스트: 1M 토큰 입력 창, 64k 토큰 출력 제한
- 입력 모달리티: 텍스트, 이미지, 비디오, 오디오, PDF
- 출력: 텍스트
- 도구: 함수 호출, 도구로서의 검색, 컴퓨터 사용
- 안전: 업데이트된 CBRN 및 사이버 보호 기능
핵심 변화는 사양보다 동작 품질입니다. Google은 3.7 Flash가 다음 작업에서 개선되었다고 설명합니다.
- 디버깅 시 증상보다 근본 원인 파악
- 첫 생성 결과에서 더 배포 가능한 코드 생성
- 도구 호출 실패나 누락된 파일에 대한 계획 조정
- 모호한 요청에 대한 명확화 질문
- 긴 대화에서의 지시 및 출력 형식 준수
이 주장은 반드시 자체 프롬프트와 코드베이스에서 검증해야 합니다. 다음 벤치마크는 우선 평가 대상을 정하는 기준으로 사용할 수 있습니다.
벤치마크 개선: 3.6 Flash vs 3.7 Flash
Google은 관련 수치를 블로그 게시물과 모델 카드에 분산하여 공개했습니다. 비교에 필요한 핵심 값은 다음과 같습니다.
| 벤치마크 | Gemini 3.6 Flash | Gemini 3.7 Flash | 변경점 |
|---|---|---|---|
| DeepSWE v1.1 (에이전트 코딩) | 49.0% | 65.3% | +16.3 pts |
| FrontierCode 1.1 Main | 34.4% | 43.6% | +9.2 pts |
| WebDev Arena (Elo) | 1538 | 1588 | +50 Elo |
| GDP.pdf (문서 추론) | 22.0% | 34.0% | +12.0 pts |
| AutomationBench (에이전트 작업) | 17.0% | 30.4% | +13.4 pts |
추가로 공개된 개별 점수는 다음과 같습니다.
- Harvey LAB-AA: 90.7%
- 128k-needle 장문 컨텍스트 검색: 97.0%
긴 계약서, 기술 문서, PDF 묶음, 저장소 문서를 모델에 공급하는 경우 128k-needle 결과를 특히 주목할 만합니다. 장문 컨텍스트 품질은 단순 요약보다 특정 근거를 정확히 찾아야 하는 워크로드에서 중요합니다.
실무적으로는 에이전트 계열 점수의 상승폭이 가장 눈에 띕니다. AutomationBench가 17.0%에서 30.4%로 상승한 만큼, 기존에 상위 계층 모델에만 맡기던 다단계 작업을 Flash 계층에서 평가할 근거가 생겼습니다.
출시 보도는 DeepSWE 상승을 핵심 결과로 다뤘습니다. 경쟁 모델 간 벤치마크 격차가 실제 워크로드에서 어떤 차이로 이어지는지 확인하려면 Grok 4.6 vs GPT 5.6 vs Claude 비교도 참고할 수 있습니다.
코딩 및 에이전트 개선 사항
벤치마크 수치를 실제 테스트 항목으로 바꾸면 다음과 같습니다.
1. 디버깅
Google은 모델이 단순히 오류 메시지를 패치하는 대신 실패 원인을 추적하는 데 더 강하다고 설명합니다. 이를 확인하려면 실제 저장소의 버그 이슈를 준비하세요.
테스트 입력에는 다음을 포함하는 것이 좋습니다.
- 재현 절차
- 오류 로그
- 관련 파일 2~5개
- 기대 동작
- 수정 범위 제약 조건
DeepSWE는 여러 파일에 걸친 실제 저장소 버그 수정을 평가하므로, 이 개선을 확인하기에 가장 가까운 공개 지표입니다.
2. 첫 시도에서 실행 가능한 코드
Google은 생성 코드가 수정 없이 더 자주 실행된다고 주장합니다. FrontierCode의 9.2점 상승은 이 주장과 가장 가까운 공개 측정치입니다.
평가 시에는 “좋아 보이는 코드”보다 다음 기준을 사용하세요.
- 생성된 코드를 그대로 실행한다.
- 테스트가 통과하는지 확인한다.
- 린트 및 타입 검사를 실행한다.
- 필요한 import, 환경 변수, 예외 처리가 포함되었는지 확인한다.
- 수정 횟수와 재시도 토큰 수를 기록한다.
3. 도구 실패와 난관 처리
도구 호출이 실패하거나 필요한 파일이 없을 때, 모델이 같은 요청을 반복하는 대신 계획을 수정하는지 확인하세요. 이 동작은 AutomationBench가 강조하는 영역입니다.
에이전트 평가 시 다음 시나리오를 넣어볼 수 있습니다.
- 존재하지 않는 파일 경로 반환
- 권한 없는 API 응답
- 빈 검색 결과
- 잘못된 함수 인자
- 예상과 다른 JSON 스키마
성공 여부뿐 아니라 실패 후 다음 행동이 유효한지 기록해야 합니다.
4. 의도 명확화
요청이 모호할 때 모델이 임의로 구현하지 않고 질문하는지도 확인해야 합니다. 한 번의 명확화 질문은 잘못된 방향으로 생성된 수천 토큰보다 비용이 적게 듭니다.
예를 들어 다음처럼 모호한 요구 사항을 테스트할 수 있습니다.
사용자 목록 API를 만들어 줘. 빠르고 안전해야 해.
평가 기준은 모델이 즉시 구현을 시작하는지, 아니면 인증 방식·데이터베이스·페이지네이션·권한 모델 같은 누락된 요구 사항을 먼저 확인하는지입니다.
5. 지시 충실도
출력 형식, 길이 제한, 제외 조건이 긴 대화에서도 유지되는지 테스트하세요.
다음 규칙을 모두 지켜 JSON만 반환해.
- 키: summary, risks, next_steps
- next_steps는 정확히 3개
- 마크다운 금지
- 250자 이내
응답 품질뿐 아니라 JSON 파싱 성공률, 금지된 형식 사용 여부, 제한 위반 여부를 함께 수집하면 비교가 쉬워집니다.
함수 호출과 도구로서의 검색은 3.6에서 유지되었습니다. 컴퓨터 사용은 API가 없는 대상에 브라우저 기반으로 접근할 수 있다는 의미지만, 구조화된 API보다 느리고 결과가 덜 결정적일 수 있습니다. 컴퓨터 사용과 구조화된 API의 비교 분석에서 각 방식을 선택할 기준을 확인할 수 있습니다.
가격: 2026년 12월 31일까지 반값
Gemini 3.7 Flash는 Gemini API에서 두 단계 가격 일정으로 제공됩니다.
| 기간 | 입력 (1M 토큰당) | 출력 (1M 토큰당) |
|---|---|---|
| 2026년 12월 31일까지 | $0.75 | $3.75 |
| 2027년 1월 1일부터 | $1.50 | $7.50 |
출시 기념 가격은 Gemini 3.6 Flash 출시 가격의 절반입니다. 그러나 2027년 1월 1일부터 입력과 출력 가격 모두 두 배가 됩니다.
비용 계획은 다음 순서로 진행하세요.
- 출시 기념 요금과 표준 요금을 분리해 계산합니다.
- 실제
usageMetadata에서 입력·출력 토큰을 수집합니다. - 트래픽 증가율을 반영합니다.
- 2027년 이후 예산은 반드시 표준 요금으로 산정합니다.
- 프로덕션 배포 전에 현재 가격을 다시 확인합니다.
현재 가격은 공식 가격 페이지에서 확인하세요. 출시 기념 기간은 변경될 수 있습니다.
챗봇, 문서 파이프라인, 에이전트 루프의 토큰 비용 계산 예시는 Gemini 3.7 Flash 가격 분석에서 확인할 수 있습니다.
오늘 어디서 사용할 수 있나요
Google은 3.7 Flash를 출시 첫날부터 160개 이상의 국가에서 서비스 영역 전반에 배포했습니다.
-
Gemini API: 개발자용 직접 호출 경로입니다. AI Studio에서 키를 생성한 뒤
gemini-3.7-flash를 호출합니다. - Google AI Studio: 코드 작성 전 프롬프트를 테스트할 수 있는 브라우저 기반 플레이그라운드입니다.
- Gemini 앱: 소비자용 채팅 앱입니다.
- Gemini Spark: AI Pro 및 Ultra 구독자에게 제공됩니다.
- Google Antigravity: Google의 에이전트 개발 환경입니다.
- Android Studio: IDE 코드 지원에 사용됩니다.
- Gemini Enterprise: 규정 준수 요구 사항이 있는 조직을 위한 관리형 서비스입니다.
대규모 API 사용에는 Vertex AI 경로도 사용할 수 있습니다. aiplatform.googleapis.com을 통해 OAuth, IAM, 감사 로깅을 적용할 수 있습니다. 모델과 요청 스키마는 동일하지만, 인증과 호스팅 보장 방식은 다릅니다.
Google이 Gemini 3.5 Pro보다 Flash를 먼저 출시한 이유
일반적으로는 주력 모델이 먼저 출시되고 더 저렴한 계층이 뒤따릅니다. 이번 순서는 반대입니다.
- 7월 말: Gemini 3.6 Flash
- 3주 후: Gemini 3.7 Flash
- Gemini 3.5 Pro: 아직 출시일 미정
Axios는 Pro가 지연되는 동안 Google이 다음 주력 모델에 앞서 Flash 업데이트를 의도적으로 출시하고 있다고 보도했습니다.
이를 전략으로 보면 이유는 명확합니다. 대부분의 프로덕션 트래픽은 비용과 품질의 균형이 맞는 중간 계층 모델에서 실행됩니다. Flash를 개선하면 많은 사용자가 매일 사용하는 모델을 직접 개선하는 효과가 있습니다.
개발자 입장에서는 Flash 계층을 단순한 저가 대체재로 보기보다, 에이전트 기능을 우선 평가할 대상이라고 보는 편이 적절합니다. 3.6 Flash에서 마이그레이션할 계획이라면 3.6에서 3.7 Flash로의 마이그레이션 가이드를 참고하세요. 대부분의 코드베이스에서는 모델 ID 변경과 회귀 테스트가 핵심입니다.
5분 안에 API를 사용해 보는 방법
먼저 AI Studio에서 API 키를 생성합니다. 키를 환경 변수로 설정한 뒤 다음 요청을 실행하세요.
export GEMINI_API_KEY="AIza..."
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"parts": [{
"text": "Review this function for bugs: def dedupe(items): return list(set(items))"
}]
}],
"generationConfig": {
"temperature": 0.4,
"maxOutputTokens": 1024
}
}'
응답에서는 다음 필드를 먼저 확인하세요.
-
candidates: 생성된 응답 배열 -
candidates[].content.parts: 생성된 텍스트 -
usageMetadata: 입력 및 출력 토큰 사용량
usageMetadata는 비용 측정의 기준입니다. 첫 요청부터 저장하거나 로그로 수집하는 것이 좋습니다.
스트리밍이 필요하면 엔드포인트를 다음처럼 변경합니다.
:generateContent
를 다음으로 바꿉니다.
:streamGenerateContent?alt=sse
이 경우 API는 Server-Sent Events(SSE)를 반환합니다.
기존 3.6 Flash와 비교하는 방법
첫 호출이 성공했다면 동일 프롬프트를 두 모델에 실행해 비교하세요.
gemini-3.6-flash
gemini-3.7-flash
비교할 항목은 다음과 같습니다.
| 항목 | 확인 방법 |
|---|---|
| 정확성 | 기대 답변 또는 테스트 결과와 비교 |
| 지시 준수 | JSON, 길이, 금지 조건 위반 여부 확인 |
| 코드 실행성 | 생성 코드를 빌드·테스트·린트 |
| 응답 시간 | 첫 토큰 및 전체 응답 시간 기록 |
| 비용 |
usageMetadata의 입력·출력 토큰 비교 |
| 에이전트 복구 | 도구 실패 후 다음 행동 평가 |
Apidog에서는 Generative Language API 사양을 가져온 뒤 환경 변수 GEMINI_API_KEY를 x-goog-api-key 헤더에 바인딩할 수 있습니다. 모델 ID를 경로 변수로 저장하면 동일한 요청을 gemini-3.6-flash와 gemini-3.7-flash에 반복 실행하기 쉽습니다.
또한 응답을 예시로 저장해 회귀 테스트에 활용할 수 있습니다. 이는 Google의 “더 나은 지시 준수” 주장을 자신의 프롬프트와 실제 워크로드에서 검증하는 빠른 방법입니다.
자주 묻는 질문
Gemini 3.7 Flash는 무료로 사용할 수 있나요?
Gemini API는 AI Studio를 통해 일일 할당량이 있는 무료 티어를 제공하며, 프로토타이핑에 사용할 수 있습니다. 유료 사용은 2026년 12월 31일까지 1M 입력 토큰당 $0.75의 출시 기념 요금으로 시작됩니다.
무료 할당량과 제한 사항은 무료 Gemini API 액세스 가이드에서 확인할 수 있습니다.
Gemini 3.6 Flash와 3.7 Flash의 차이점은 무엇인가요?
컨텍스트 창, 출력 제한, 모달리티, 도구 지원은 동일합니다. 차이는 주로 동작 품질과 벤치마크 결과에 있습니다.
- DeepSWE: +16.3점
- AutomationBench: +13.4점
- WebDev Arena: +50 Elo
- GDP.pdf: +12.0점
Google은 디버깅, 지시 준수, 다단계 계획에서도 개선이 있다고 설명합니다.
Gemini 3.7 Flash가 Gemini 3.5 Pro를 대체하나요?
아니요. Pro는 가장 어려운 추론 작업을 위한 주력 계층으로 남아 있으며, Gemini 3.5 Pro는 여전히 개발 중입니다. Gemini 3.7 Flash는 비용과 지연 시간이 중요한 대용량 프로덕션 작업에 적합한 계층입니다.
2027년 1월 1일에 가격은 어떻게 되나요?
출시 기념 요금이 종료되고 표준 가격이 적용됩니다.
- 입력: 1M 토큰당 $1.50
- 출력: 1M 토큰당 $7.50
2026년 이후에도 유지할 워크로드라면 표준 요금 기준으로 예산을 책정하세요.
Gemini 3.7 Flash는 이미지와 PDF를 처리할 수 있나요?
네. 동일한 contents 배열에서 텍스트, 이미지, 비디오, 오디오, PDF를 입력으로 사용할 수 있습니다. 출력은 텍스트 전용입니다.
GDP.pdf 점수가 22.0%에서 34.0%로 상승한 것은 Google이 제시한 문서 이해 개선의 근거입니다.
귀하의 스택에서 3.7 Flash가 적합한 곳
Gemini 3.7 Flash는 에이전트 계층 벤치마크 개선과 출시 기념 가격을 함께 제공하는 중간 계층 모델입니다. 평가 여부보다 중요한 것은 얼마나 빠르게 자체 워크로드로 검증하느냐입니다.
권장 순서는 다음과 같습니다.
- 기존 프롬프트와 테스트 케이스를 준비합니다.
- 동일한 요청을
gemini-3.6-flash와gemini-3.7-flash에 실행합니다. - 출력 품질, 테스트 통과율, 지시 준수율, 토큰 사용량을 수집합니다.
- 에이전트 작업에는 도구 실패와 모호한 요구 사항을 포함합니다.
- 표준 가격 기준의 장기 비용을 계산합니다.
- 결과가 우수한 워크로드부터 점진적으로 전환합니다.
Apidog를 다운로드하면 하나의 작업 공간에서 모델별 요청과 응답을 비교할 수 있습니다. 3.6 응답을 예시로 저장하고 같은 요청을 3.7에 다시 실행하면, 공개 벤치마크의 개선이 실제 워크로드에서도 유효한지 빠르게 확인할 수 있습니다.

Top comments (0)