DEV Community

Cover image for 제미니 3.5 플래시 라이트란 무엇인가요?
Rihpig
Rihpig

Posted on • Originally published at apidog.com

제미니 3.5 플래시 라이트란 무엇인가요?

구글은 2026년 7월 21일 Flash 티어를 업데이트했고, Gemini 3.5 Flash-Lite를 가장 저렴한 모델로 공개했습니다. 이 모델은 높은 처리량과 낮은 비용이 중요한 분류, 정보 추출, 짧은 채팅 응답, 간단한 검색 증강 생성(RAG) 작업에 적합합니다. 하루에 수백만 건의 작은 요청을 처리해야 한다면 gemini-3.5-flash-lite를 우선 검토할 수 있습니다.

지금 Apidog 사용해 보기

이번 업데이트에는 세 가지 모델이 함께 출시되었습니다. 이름과 버전이 혼합되어 있으므로, 먼저 모델 구성을 정리한 뒤 사양, 가격, 선택 기준, API 테스트 방법을 살펴보겠습니다.

Gemini 3.5 Flash-Lite는 무엇인가요?

Gemini 3.5 Flash-Lite는 구글 Gemini 제품군에서 가장 작고 저렴한 모델입니다. 복잡한 추론보다 속도와 처리량에 최적화되어 있으며, 구글에 따르면 초당 약 350개의 출력 토큰을 처리합니다.

Gemini API에서 다음 모델 ID로 호출합니다.

gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode

Gemini 3.5 Flash-Lite 소개

다음과 같이 반복적이고 요청 수가 많은 작업에 적합합니다.

  • 지원 티켓 자동 태그 지정
  • 문서·이메일·양식에서 필드 추출
  • 검색된 텍스트 청크를 기반으로 한 짧은 답변 생성
  • 지연 시간에 민감한 채팅 위젯
  • 대량 콘텐츠의 요약 또는 카테고리 분류

Flash-Lite 활용 예시

이번 Flash 업데이트에는 다음 세 모델이 포함됩니다.

모델 역할
Gemini 3.6 Flash 주력 Flash 모델
Gemini 3.5 Flash-Lite 가장 저렴하고 빠른 대량 처리용 모델
Gemini 3.5 Flash Cyber 게이트 보안 모델

구글의 설명은 Google 블로그DeepMind Flash 페이지에서 확인할 수 있습니다.

왜 3.6이 아니라 3.5인가요?

혼란스러운 부분은 모델 버전입니다. 같은 날 출시되었지만 주력 모델은 Gemini 3.6 Flash, Lite와 Cyber 변형은 3.5 버전을 사용합니다.

이는 오타가 아니라 구글의 모델 라인 기준 버전 관리입니다.

  • 주력 Flash 모델: 3.6
  • Lite 모델: 3.5
  • Cyber 모델: 3.5

즉, 버전 번호는 출시일이 아니라 각 모델 라인의 변화를 나타냅니다.

또한 Gemini 3.5 Flash-Lite는 이전 세대인 Gemini 3.1 Flash-Lite와 다른 모델입니다. 기존 구현을 마이그레이션하거나 새 요청을 작성할 때는 이름이 아니라 모델 ID를 확인하세요.

# 이전 세대
gemini-3.1-flash-lite

# 새 모델
gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode

사양 및 가격

모든 가격은 Gemini API 기준 100만 토큰당 가격입니다.

속성
모델 ID gemini-3.5-flash-lite
입력 가격 $0.30 / 1M 토큰
출력 가격 $2.50 / 1M 토큰
속도 약 350 출력 토큰/초
무료 티어 예 — Google AI Studio, 사용량 제한
컨텍스트 캐싱 $0.03 / 1M 토큰 + $1.00 / 1M/시간 저장

입력 토큰은 $0.30, 출력 토큰은 $2.50으로 공개된 Gemini 라인업 중 가장 낮은 가격대입니다.

비교하면 Gemini 3.6 Flash의 가격은 다음과 같습니다.

모델 입력 가격 출력 가격
Gemini 3.5 Flash-Lite $0.30 / 1M $2.50 / 1M
Gemini 3.6 Flash $1.50 / 1M $7.50 / 1M

대량의 짧은 요청을 처리한다면 이 차이는 전체 비용에 직접적인 영향을 줍니다. 최신 가격은 Gemini API 가격 문서에서 확인하세요.

컨텍스트 캐싱을 적용할 때

다음처럼 매 요청마다 반복되는 데이터가 있다면 컨텍스트 캐싱을 검토할 수 있습니다.

  • 길고 고정된 시스템 프롬프트
  • 제품 카탈로그 또는 정책 문서
  • 자주 바뀌지 않는 참고 자료
  • 반복적으로 전달하는 RAG 컨텍스트

캐시 생성 및 저장 비용은 발생하지만, 동일한 입력을 반복해서 보내는 경우 요청 비용을 줄일 수 있습니다.

성능은 어떤가요?

Gemini 3.5 Flash-Lite는 Terminal-Bench 2.1에서 54%를 기록했습니다. 이전 모델의 31%보다 상승한 수치입니다.

이 모델은 다음 유형의 작업에 특히 적합합니다.

  1. 분류: 입력을 카테고리 또는 우선순위로 분류
  2. 추출: 비정형 텍스트에서 JSON 형태의 구조화된 데이터 추출
  3. 짧은 응답: 검색 결과나 FAQ를 기반으로 한 간단한 답변
  4. 경량 채팅: 빠른 초기 응답이 필요한 챗봇
  5. 간단한 RAG: 검색된 문단을 근거로 하는 짧은 질의응답

예를 들어 지원 티켓을 분류할 때는 모델이 반드시 긴 추론 과정을 보여줄 필요가 없습니다. 대신 빠르고 일관되게 결과를 반환하는 것이 더 중요합니다.

{
  "category": "billing",
  "priority": "high",
  "summary": "결제는 완료됐지만 계정 권한이 활성화되지 않았습니다."
}
Enter fullscreen mode Exit fullscreen mode

반대로 다음 작업에는 Flash-Lite가 적합하지 않을 수 있습니다.

  • 복잡한 에이전트 코딩
  • 긴 다단계 도구 호출 체인
  • 복잡한 코드베이스 분석
  • 높은 정확도가 필요한 심층 추론
  • 여러 단계의 계획과 검증이 필요한 작업

이런 경우에는 Gemini 3.6 Flash 또는 더 큰 모델을 선택하는 편이 낫습니다.

구글은 Flash-Lite를 어디에 사용하나요?

구글은 Flash-Lite를 개발자용 API 모델로만 제공하는 것이 아니라 구글 검색에도 통합하고 있습니다.

이는 대규모 검색 트래픽처럼 요청 수가 많고 지연 시간 요구가 높은 환경에서 이 모델의 비용과 처리량이 유효하다는 신호입니다. 개발 환경에서는 비슷한 특성을 가진 다음 워크로드에 적용할 수 있습니다.

  • 실시간 콘텐츠 분류 파이프라인
  • 대량 고객 문의 라우팅
  • 검색 결과 기반 Q&A
  • 짧은 자동 완성 또는 채팅 응답
  • 문서 처리 및 필드 추출 배치 작업

Flash-Lite와 Gemini 3.6 Flash 중 무엇을 선택해야 하나요?

선택 기준은 간단합니다.

요구 사항 권장 모델
간단하고 반복적인 대량 요청 Gemini 3.5 Flash-Lite
낮은 비용과 빠른 응답이 우선 Gemini 3.5 Flash-Lite
짧은 분류·추출·채팅 응답 Gemini 3.5 Flash-Lite
복잡한 추론 및 코딩 Gemini 3.6 Flash
다단계 에이전트 워크플로우 Gemini 3.6 Flash
높은 품질이 비용보다 중요 Gemini 3.6 Flash

실무에서는 난이도 기반 라우팅을 적용할 수 있습니다.

1. 기본 요청은 Flash-Lite로 처리
2. 응답이 불확실하거나 검증에 실패하면 3.6 Flash로 에스컬레이션
3. 고난도 작업만 3.6 Flash에 직접 전달
Enter fullscreen mode Exit fullscreen mode

이 방식이면 대부분의 트래픽은 저렴하게 처리하면서, 어려운 요청에만 더 높은 비용을 지불할 수 있습니다.

가격과 성능 차이는 Gemini 3.5 Flash-Lite 대 3.6 Flash 비교를 참고하세요. 3.6 Flash의 가격은 3.6 Flash 가격에서 확인할 수 있습니다.

접근 및 테스트 방법

Flash-Lite는 Gemini API를 통해 호출합니다. 시작 절차는 다음과 같습니다.

  1. Google AI Studio에서 API 키를 발급합니다.
  2. 모델 ID를 gemini-3.5-flash-lite로 지정합니다.
  3. 간단한 프롬프트로 응답 형식과 지연 시간을 확인합니다.
  4. 실제 서비스에서는 요청 실패, 응답 구조, 비용을 모니터링합니다.

Gemini API 문서는 Gemini API 문서에서 확인할 수 있습니다.

cURL로 첫 요청 보내기

환경 변수에 API 키를 저장합니다.

export GEMINI_API_KEY="YOUR_API_KEY"
Enter fullscreen mode Exit fullscreen mode

그런 다음 모델 ID를 지정해 요청합니다.

curl \
  -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.5-flash-lite:generateContent?key=${GEMINI_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "text": "다음 문의를 billing, technical, account 중 하나로 분류하세요: 결제는 됐는데 플랜이 활성화되지 않았습니다."
          }
        ]
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

프로덕션 환경에서는 다음 항목을 함께 검증하세요.

  • HTTP 상태 코드
  • 응답 JSON의 필수 필드
  • 예상하지 못한 빈 응답
  • 응답 시간 증가
  • 모델 응답 품질 저하
  • 사용량 및 가격 변동

Apidog을 사용하면 Gemini 엔드포인트용 POST 요청을 저장하고, API 키를 환경 변수로 관리하며, 응답 검증을 추가할 수 있습니다.

예를 들어 다음 검증을 구성할 수 있습니다.

- 상태 코드가 200인지 확인
- candidates 배열이 비어 있지 않은지 확인
- 응답 텍스트가 존재하는지 확인
- 예상 JSON 스키마를 만족하는지 확인
- 응답 시간이 팀 기준을 초과하지 않는지 확인
Enter fullscreen mode Exit fullscreen mode

저장한 요청은 회귀 테스트로 활용할 수 있습니다. API 테스트 예약 실행을 설정하면 응답 구조 변경, 실패율 증가, 예기치 않은 동작을 사용자보다 먼저 감지할 수 있습니다.

Apidog는 Gemini API나 모델을 대체하지 않습니다. Gemini 엔드포인트를 호출하고, 검증하고, 모니터링하는 API 클라이언트 역할을 합니다.

자주 묻는 질문

Gemini 3.5 Flash-Lite는 Gemini 3.6 Flash와 동일한가요?

아니요. 두 모델은 2026년 7월 21일 같은 업데이트로 출시됐지만 서로 다른 모델입니다. Flash-Lite는 간단한 대량 작업을 위한 가장 저렴하고 빠른 티어이며, 3.6 Flash는 더 강력한 추론 및 코딩 기능을 갖춘 주력 모델입니다.

왜 3.6이 아니라 3.5인가요?

구글이 모델 라인별로 버전을 관리하기 때문입니다. 주력 Flash는 3.6으로 올라갔지만, Flash-Lite와 Cyber 모델은 같은 출시에서 3.5 라벨을 유지했습니다.

이전 Gemini 3.1 Flash-Lite와 같은 모델인가요?

아니요. Gemini 3.5 Flash-Lite는 새 모델이며, Gemini 3.1 Flash-Lite는 이전 세대 모델입니다. 반드시 gemini-3.5-flash-lite 모델 ID를 확인하세요.

Gemini 3.5 Flash-Lite는 무료인가요?

Google AI Studio를 통해 사용량 제한이 있는 무료 티어가 제공됩니다. 테스트와 가벼운 사용에 적합하지만, 실제 서비스 규모에서는 유료 API 키 사용을 고려해야 합니다. 또한 구글은 제품 개선을 위해 무료 티어 데이터를 사용할 수 있으므로 민감한 데이터는 주의해서 처리해야 합니다.

Flash-Lite는 어떤 작업에 가장 적합한가요?

대량 분류, 정보 추출, 짧은 채팅 응답, 간단한 검색 증강 답변에 적합합니다. 어려운 에이전트 코딩, 긴 다단계 추론, 복잡한 도구 호출 워크플로우에는 Gemini 3.6 Flash가 더 적합합니다.

Top comments (0)