구글은 2026년 7월 21일 Flash 티어를 업데이트했고, Gemini 3.5 Flash-Lite를 가장 저렴한 모델로 공개했습니다. 이 모델은 높은 처리량과 낮은 비용이 중요한 분류, 정보 추출, 짧은 채팅 응답, 간단한 검색 증강 생성(RAG) 작업에 적합합니다. 하루에 수백만 건의 작은 요청을 처리해야 한다면 gemini-3.5-flash-lite를 우선 검토할 수 있습니다.
이번 업데이트에는 세 가지 모델이 함께 출시되었습니다. 이름과 버전이 혼합되어 있으므로, 먼저 모델 구성을 정리한 뒤 사양, 가격, 선택 기준, API 테스트 방법을 살펴보겠습니다.
Gemini 3.5 Flash-Lite는 무엇인가요?
Gemini 3.5 Flash-Lite는 구글 Gemini 제품군에서 가장 작고 저렴한 모델입니다. 복잡한 추론보다 속도와 처리량에 최적화되어 있으며, 구글에 따르면 초당 약 350개의 출력 토큰을 처리합니다.
Gemini API에서 다음 모델 ID로 호출합니다.
gemini-3.5-flash-lite
다음과 같이 반복적이고 요청 수가 많은 작업에 적합합니다.
- 지원 티켓 자동 태그 지정
- 문서·이메일·양식에서 필드 추출
- 검색된 텍스트 청크를 기반으로 한 짧은 답변 생성
- 지연 시간에 민감한 채팅 위젯
- 대량 콘텐츠의 요약 또는 카테고리 분류
이번 Flash 업데이트에는 다음 세 모델이 포함됩니다.
| 모델 | 역할 |
|---|---|
| Gemini 3.6 Flash | 주력 Flash 모델 |
| Gemini 3.5 Flash-Lite | 가장 저렴하고 빠른 대량 처리용 모델 |
| Gemini 3.5 Flash Cyber | 게이트 보안 모델 |
구글의 설명은 Google 블로그와 DeepMind Flash 페이지에서 확인할 수 있습니다.
왜 3.6이 아니라 3.5인가요?
혼란스러운 부분은 모델 버전입니다. 같은 날 출시되었지만 주력 모델은 Gemini 3.6 Flash, Lite와 Cyber 변형은 3.5 버전을 사용합니다.
이는 오타가 아니라 구글의 모델 라인 기준 버전 관리입니다.
- 주력 Flash 모델:
3.6 - Lite 모델:
3.5 - Cyber 모델:
3.5
즉, 버전 번호는 출시일이 아니라 각 모델 라인의 변화를 나타냅니다.
또한 Gemini 3.5 Flash-Lite는 이전 세대인 Gemini 3.1 Flash-Lite와 다른 모델입니다. 기존 구현을 마이그레이션하거나 새 요청을 작성할 때는 이름이 아니라 모델 ID를 확인하세요.
# 이전 세대
gemini-3.1-flash-lite
# 새 모델
gemini-3.5-flash-lite
사양 및 가격
모든 가격은 Gemini API 기준 100만 토큰당 가격입니다.
| 속성 | 값 |
|---|---|
| 모델 ID | gemini-3.5-flash-lite |
| 입력 가격 | $0.30 / 1M 토큰 |
| 출력 가격 | $2.50 / 1M 토큰 |
| 속도 | 약 350 출력 토큰/초 |
| 무료 티어 | 예 — Google AI Studio, 사용량 제한 |
| 컨텍스트 캐싱 | $0.03 / 1M 토큰 + $1.00 / 1M/시간 저장 |
입력 토큰은 $0.30, 출력 토큰은 $2.50으로 공개된 Gemini 라인업 중 가장 낮은 가격대입니다.
비교하면 Gemini 3.6 Flash의 가격은 다음과 같습니다.
| 모델 | 입력 가격 | 출력 가격 |
|---|---|---|
| Gemini 3.5 Flash-Lite | $0.30 / 1M | $2.50 / 1M |
| Gemini 3.6 Flash | $1.50 / 1M | $7.50 / 1M |
대량의 짧은 요청을 처리한다면 이 차이는 전체 비용에 직접적인 영향을 줍니다. 최신 가격은 Gemini API 가격 문서에서 확인하세요.
컨텍스트 캐싱을 적용할 때
다음처럼 매 요청마다 반복되는 데이터가 있다면 컨텍스트 캐싱을 검토할 수 있습니다.
- 길고 고정된 시스템 프롬프트
- 제품 카탈로그 또는 정책 문서
- 자주 바뀌지 않는 참고 자료
- 반복적으로 전달하는 RAG 컨텍스트
캐시 생성 및 저장 비용은 발생하지만, 동일한 입력을 반복해서 보내는 경우 요청 비용을 줄일 수 있습니다.
성능은 어떤가요?
Gemini 3.5 Flash-Lite는 Terminal-Bench 2.1에서 54%를 기록했습니다. 이전 모델의 31%보다 상승한 수치입니다.
이 모델은 다음 유형의 작업에 특히 적합합니다.
- 분류: 입력을 카테고리 또는 우선순위로 분류
- 추출: 비정형 텍스트에서 JSON 형태의 구조화된 데이터 추출
- 짧은 응답: 검색 결과나 FAQ를 기반으로 한 간단한 답변
- 경량 채팅: 빠른 초기 응답이 필요한 챗봇
- 간단한 RAG: 검색된 문단을 근거로 하는 짧은 질의응답
예를 들어 지원 티켓을 분류할 때는 모델이 반드시 긴 추론 과정을 보여줄 필요가 없습니다. 대신 빠르고 일관되게 결과를 반환하는 것이 더 중요합니다.
{
"category": "billing",
"priority": "high",
"summary": "결제는 완료됐지만 계정 권한이 활성화되지 않았습니다."
}
반대로 다음 작업에는 Flash-Lite가 적합하지 않을 수 있습니다.
- 복잡한 에이전트 코딩
- 긴 다단계 도구 호출 체인
- 복잡한 코드베이스 분석
- 높은 정확도가 필요한 심층 추론
- 여러 단계의 계획과 검증이 필요한 작업
이런 경우에는 Gemini 3.6 Flash 또는 더 큰 모델을 선택하는 편이 낫습니다.
구글은 Flash-Lite를 어디에 사용하나요?
구글은 Flash-Lite를 개발자용 API 모델로만 제공하는 것이 아니라 구글 검색에도 통합하고 있습니다.
이는 대규모 검색 트래픽처럼 요청 수가 많고 지연 시간 요구가 높은 환경에서 이 모델의 비용과 처리량이 유효하다는 신호입니다. 개발 환경에서는 비슷한 특성을 가진 다음 워크로드에 적용할 수 있습니다.
- 실시간 콘텐츠 분류 파이프라인
- 대량 고객 문의 라우팅
- 검색 결과 기반 Q&A
- 짧은 자동 완성 또는 채팅 응답
- 문서 처리 및 필드 추출 배치 작업
Flash-Lite와 Gemini 3.6 Flash 중 무엇을 선택해야 하나요?
선택 기준은 간단합니다.
| 요구 사항 | 권장 모델 |
|---|---|
| 간단하고 반복적인 대량 요청 | Gemini 3.5 Flash-Lite |
| 낮은 비용과 빠른 응답이 우선 | Gemini 3.5 Flash-Lite |
| 짧은 분류·추출·채팅 응답 | Gemini 3.5 Flash-Lite |
| 복잡한 추론 및 코딩 | Gemini 3.6 Flash |
| 다단계 에이전트 워크플로우 | Gemini 3.6 Flash |
| 높은 품질이 비용보다 중요 | Gemini 3.6 Flash |
실무에서는 난이도 기반 라우팅을 적용할 수 있습니다.
1. 기본 요청은 Flash-Lite로 처리
2. 응답이 불확실하거나 검증에 실패하면 3.6 Flash로 에스컬레이션
3. 고난도 작업만 3.6 Flash에 직접 전달
이 방식이면 대부분의 트래픽은 저렴하게 처리하면서, 어려운 요청에만 더 높은 비용을 지불할 수 있습니다.
가격과 성능 차이는 Gemini 3.5 Flash-Lite 대 3.6 Flash 비교를 참고하세요. 3.6 Flash의 가격은 3.6 Flash 가격에서 확인할 수 있습니다.
접근 및 테스트 방법
Flash-Lite는 Gemini API를 통해 호출합니다. 시작 절차는 다음과 같습니다.
- Google AI Studio에서 API 키를 발급합니다.
- 모델 ID를
gemini-3.5-flash-lite로 지정합니다. - 간단한 프롬프트로 응답 형식과 지연 시간을 확인합니다.
- 실제 서비스에서는 요청 실패, 응답 구조, 비용을 모니터링합니다.
Gemini API 문서는 Gemini API 문서에서 확인할 수 있습니다.
cURL로 첫 요청 보내기
환경 변수에 API 키를 저장합니다.
export GEMINI_API_KEY="YOUR_API_KEY"
그런 다음 모델 ID를 지정해 요청합니다.
curl \
-X POST \
"https://generativelanguage.googleapis.com/v1beta/models/gemini-3.5-flash-lite:generateContent?key=${GEMINI_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"contents": [
{
"parts": [
{
"text": "다음 문의를 billing, technical, account 중 하나로 분류하세요: 결제는 됐는데 플랜이 활성화되지 않았습니다."
}
]
}
]
}'
프로덕션 환경에서는 다음 항목을 함께 검증하세요.
- HTTP 상태 코드
- 응답 JSON의 필수 필드
- 예상하지 못한 빈 응답
- 응답 시간 증가
- 모델 응답 품질 저하
- 사용량 및 가격 변동
Apidog을 사용하면 Gemini 엔드포인트용 POST 요청을 저장하고, API 키를 환경 변수로 관리하며, 응답 검증을 추가할 수 있습니다.
예를 들어 다음 검증을 구성할 수 있습니다.
- 상태 코드가 200인지 확인
- candidates 배열이 비어 있지 않은지 확인
- 응답 텍스트가 존재하는지 확인
- 예상 JSON 스키마를 만족하는지 확인
- 응답 시간이 팀 기준을 초과하지 않는지 확인
저장한 요청은 회귀 테스트로 활용할 수 있습니다. API 테스트 예약 실행을 설정하면 응답 구조 변경, 실패율 증가, 예기치 않은 동작을 사용자보다 먼저 감지할 수 있습니다.
Apidog는 Gemini API나 모델을 대체하지 않습니다. Gemini 엔드포인트를 호출하고, 검증하고, 모니터링하는 API 클라이언트 역할을 합니다.
자주 묻는 질문
Gemini 3.5 Flash-Lite는 Gemini 3.6 Flash와 동일한가요?
아니요. 두 모델은 2026년 7월 21일 같은 업데이트로 출시됐지만 서로 다른 모델입니다. Flash-Lite는 간단한 대량 작업을 위한 가장 저렴하고 빠른 티어이며, 3.6 Flash는 더 강력한 추론 및 코딩 기능을 갖춘 주력 모델입니다.
왜 3.6이 아니라 3.5인가요?
구글이 모델 라인별로 버전을 관리하기 때문입니다. 주력 Flash는 3.6으로 올라갔지만, Flash-Lite와 Cyber 모델은 같은 출시에서 3.5 라벨을 유지했습니다.
이전 Gemini 3.1 Flash-Lite와 같은 모델인가요?
아니요. Gemini 3.5 Flash-Lite는 새 모델이며, Gemini 3.1 Flash-Lite는 이전 세대 모델입니다. 반드시 gemini-3.5-flash-lite 모델 ID를 확인하세요.
Gemini 3.5 Flash-Lite는 무료인가요?
Google AI Studio를 통해 사용량 제한이 있는 무료 티어가 제공됩니다. 테스트와 가벼운 사용에 적합하지만, 실제 서비스 규모에서는 유료 API 키 사용을 고려해야 합니다. 또한 구글은 제품 개선을 위해 무료 티어 데이터를 사용할 수 있으므로 민감한 데이터는 주의해서 처리해야 합니다.
Flash-Lite는 어떤 작업에 가장 적합한가요?
대량 분류, 정보 추출, 짧은 채팅 응답, 간단한 검색 증강 답변에 적합합니다. 어려운 에이전트 코딩, 긴 다단계 추론, 복잡한 도구 호출 워크플로우에는 Gemini 3.6 Flash가 더 적합합니다.


Top comments (0)