DEV Community

Cover image for Gemini 3.8 Flash 대 Claude Fable 5.1 대 GPT-5.6 Sol: 개발자에게 최적의 API는?
Rihpig
Rihpig

Posted on Originally published at apidog.com

Gemini 3.8 Flash 대 Claude Fable 5.1 대 GPT-5.6 Sol: 개발자에게 최적의 API는?

세 가지 최첨단 API가 일주일 간격으로 출시되거나 가격이 재조정되었고, 서로 다른 가격대에 속하게 되었습니다. Google은 2026년 9월 2일 Gemini 3.8 Flash를 출시했으며 가격은 백만 입력 토큰당 0.75달러, 백만 출력 토큰당 3.75달러입니다. Anthropic은 하루 전 Claude Fable 5.1을 10달러와 50달러에 출시했고, OpenAI의 GPT-5.6 Sol은 그 중간인 5달러와 30달러입니다. Artificial Analysis의 독립적인 인텔리전스 지수에서 세 모델은 각각 59점, 57점, 59점을 기록했습니다. 최고급 모델 가격의 약 13분의 1에 불과한 모델이 동일한 방식으로 테스트한 지수에서 최고급 모델과 같은 점수를 기록한 셈입니다.

오늘 Apidog를 사용해 보세요

문제는 “지수”라는 단어에 있습니다. 벤치마크는 작업당 답변 수를 측정하지만, 청구서는 작업당 토큰 수를 계산합니다. Gemini 3.8 Flash는 복잡한 작업에서 더 많은 토큰을 사용하도록 설계되었습니다.

이 글에서는 세 모델을 다음 기준으로 비교합니다.

  • 모델 사양
  • Google의 자체 벤치마크
  • Artificial Analysis의 독립적인 수치
  • 실제 가격과 작업당 비용
  • 작업량에 따른 모델 선택 기준

Gemini 3.8 Flash 핵심 내용은 모델 자체의 용어를 설명합니다. Google의 출시 게시물은 아래에 인용한 Google의 주된 출처입니다.

참고: 8월에 발표한 Gemini 3.7 Flash vs Claude vs GPT 비교는 Claude Fable 5와 비교한 글입니다. Anthropic이 9월 1일 해당 모델을 교체했으므로, 이 글은 업데이트가 아니라 새로운 비교입니다.

한눈에 보는 사양

항목 Gemini 3.8 Flash Claude Fable 5.1 GPT-5.6 Sol
업체 Google Anthropic OpenAI
컨텍스트 창 1,048,576 토큰 1M 토큰 1M 토큰
최대 출력 65,536 토큰 128K 토큰 128K 토큰
입력 가격(백만 토큰당) 도입 가격 0.75달러
2027년 1월 1일부터 1.50달러
10달러 5달러
출력 가격(백만 토큰당) 도입 가격 3.75달러
2027년 1월 1일부터 7.50달러
50달러 30달러
캐시 읽기(백만 토큰당) 도입 가격 0.075달러
2027년 1월 1일부터 0.15달러
0.25달러 0.50달러
지식 차단 시점 2026년 3월 2026년 6월 명시되지 않음
추론 제어 thinking_level: 낮음 / 중간 / 높음
기본값: 중간
확장된 사고, 항상 켜짐 노력 수준, xhigh까지
Artificial Analysis 지수 59(높음) 57(중간) 59(xhigh)

두 가지가 특히 중요합니다.

  1. Gemini 3.8 Flash의 최대 출력은 65,536 토큰으로, Fable 5.1과 Sol의 128K보다 짧습니다. 짧은 단계를 반복하는 에이전트 루프보다는 한 번에 긴 문서를 생성하는 작업에서 더 큰 제약이 될 수 있습니다.
  2. 도입 가격은 2026년 12월 31일에 종료됩니다. 2027년 1월 1일부터 Gemini 가격이 두 배가 되므로, 아래의 모든 가격 비율도 바뀝니다.

Gemini 3.8 Flash 가격 가이드에서 인상 후 요금, 캐싱, 배치 및 그라운딩 가격을 확인할 수 있습니다.

독립적인 수치: 59, 57, 59

Artificial Analysis는 모든 모델에 동일한 9가지 평가를 실행하고 하나의 인텔리전스 지수 점수를 발표합니다.

  • 높은 사고 수준의 Gemini 3.8 Flash: 59점
  • xhigh 노력 수준의 GPT-5.6 Sol: 59점
  • 중간 노력 수준의 Claude Fable 5.1: 57점
  • 비교 기준으로 Gemini 3.7 Flash: 56점
  • Gemini 3.6 Flash: 52점
  • GPT-5.6 Terra의 최대 설정: 57점
  • Muse Spark 1.2의 xhigh: 57점
  • 중간 수준의 Grok 4.6: 59점

점수보다 먼저 추론 설정을 확인해야 합니다. Fable 5.1은 최고 설정이 아닌 중간 수준으로, Sol은 최고 설정인 xhigh로 테스트되었습니다. 설정이 다르므로 2점 차이를 순위처럼 해석할 수 없습니다.

정확한 결론은 다음과 같습니다.

테스트된 설정에서 Gemini 3.8 Flash는 이 지수에서 두 프리미엄 모델과 비슷한 점수를 기록했으며, 59점을 받은 모델 중 가장 저렴합니다.

작업당 비용도 확인해야 한다

Artificial Analysis는 점수뿐 아니라 해당 점수를 얻는 데 필요한 비용도 측정했습니다.

  • 높은 사고 수준에서 작업당 평균 출력 토큰: 48,000개
  • Gemini 3.7 Flash 대비 출력 토큰: 30% 증가
  • 작업당 API 비용: 0.58달러
  • 작업당 실행 시간: 약 2.5분
  • 출력 속도: 초당 약 300토큰
  • 첫 토큰까지의 시간: 13.3초
  • 도구 사용 평가 τ³-Banking: 45%
  • τ³-Banking에서 Gemini 3.7 Flash 대비: 12점 향상

모델이 답변 전에 사고하고 도구를 반복 호출하기 때문에, 토큰당 가격만 보면 실제 비용을 과소평가할 수 있습니다.

Google의 벤치마크 표와 누락된 모델

Google의 Flash 페이지에는 세 가지 교차 공급업체 벤치마크 행이 게시되어 있습니다. 그러나 Claude Fable 5.1은 포함되어 있지 않습니다.

대신 Anthropic의 Claude Opus 5와 Sonnet 5가 포함되어 있습니다. Fable 5.1은 표가 게시될 당시 출시된 지 하루밖에 되지 않았기 때문입니다. 따라서 아래 Anthropic 열은 이 글의 대상인 Fable 5.1이 아니라 다음 모델을 나타냅니다.

  • Claude Opus 5: 입력 5달러 / 출력 25달러
  • Claude Sonnet 5: 입력 2달러 / 출력 10달러

직접 비교가 아닌, 당시 이용 가능한 최선의 대리 모델로 봐야 합니다.

벤치마크(Google 실행) Gemini 3.8 Flash Claude Opus 5 Claude Sonnet 5 GPT-5.6 Sol GPT-5.6 Terra
HLE-Verified 54.9% 54.4% 31.0% 54.5% 51.1%
Vals Finance Agent v2 61.4% 58.6% 53.9% 53.8% 54.4%
Harvey Legal Agent Benchmark 10.0% 6.7% 5.0% 2.5% 0.8%

벤치마크 해석

  • HLE-Verified: Gemini 3.8 Flash, Opus 5, Sol이 0.5점 이내로 사실상 동률입니다. Sonnet 5는 크게 뒤처집니다.
  • Vals Finance Agent v2: 다단계 금융 에이전트 작업에서 Gemini 3.8 Flash가 Opus 5보다 2.8점, Sol보다 7.6점 앞섰습니다.
  • Harvey Legal: 모든 모델이 11% 미만이므로 절대 점수보다 상대 순위를 보는 편이 적절합니다.

Google이 텍스트로 공개하지 않은 결과도 중요합니다. Gemini 3.8 Flash에 대해서는 다음 수치가 텍스트로 제공되지 않습니다.

  • SWE-Bench Pro
  • Terminal-bench
  • OSWorld

DeepSWE v1.1도 “대부분의 더 큰 최첨단 모델을 성능 면에서 능가한다”는 설명과 이미지 표의 수치만 제공되며, 텍스트 결과는 없습니다.

코딩과 컴퓨터 사용 능력을 비교하려면 각 업체의 자체 실행 결과를 확인해야 합니다. 다만 서로 겹치는 모델이 없으므로 완전한 교차 비교는 어렵습니다.

어떤 업체도 경쟁사의 모델을 직접 실행하지 않았기 때문에, 동일한 조건의 비교 자료로는 Artificial Analysis가 가장 유용합니다.

가격 차이, 항목별로

도입 가격 기준으로 계산하면 다음과 같습니다.

  • Fable 5.1 입력 가격은 Gemini 3.8 Flash보다 13.3배 높습니다.
  • Fable 5.1 출력 가격도 Gemini 3.8 Flash보다 13.3배 높습니다.
  • Sol 입력 가격은 Gemini보다 6.7배 높습니다.
  • Sol 출력 가격은 Gemini보다 8배 높습니다.
  • Gemini 캐시 읽기는 Fable 5.1보다 3.3배 저렴합니다.
  • Gemini 캐시 읽기는 Sol보다 6.7배 저렴합니다.
  • Fable 5.1의 캐시 읽기 가격은 Sol의 절반입니다.

100만 입력 토큰 + 20만 출력 토큰

캐시를 사용하지 않는 실행을 가정하면 다음과 같습니다.

  • Gemini 3.8 Flash: $0.75 + $0.75 = $1.50
  • GPT-5.6 Sol: $5.00 + $6.00 = $11.00
  • Claude Fable 5.1: $10.00 + $10.00 = $20.00

2027년 1월 1일부터 동일한 Gemini 실행 비용은 3.00달러가 됩니다. 이때 Gemini와의 가격 차이는 다음과 같이 줄어듭니다.

  • Sol보다 3.7배 저렴
  • Fable 5.1보다 6.7배 저렴

가격 인상은 Gemini 3.6 Flash와 3.7 Flash에도 적용되므로, 더 저렴한 Gemini Flash로 단순히 전환할 수는 없습니다.

관련 요금은 다음 문서에서 확인할 수 있습니다.

토큰당 비용이 아닌 작업당 비용

위 계산에는 중요한 함정이 있습니다. Google은 Gemini 3.8 Flash가 “더 오래 실행되고 복잡한 작업에서 설계상 더 많은 토큰을 사용할 수 있다”고 설명합니다.

어려운 문제에서는 모델이 다음 작업을 반복합니다.

  • 더 작은 추론 단계 실행
  • 중간 결과 검증
  • 도구 반복 호출
  • 답변 전 추가 사고

Artificial Analysis의 측정 결과는 이를 보여줍니다.

Gemini 3.8 Flash 설정 작업당 비용
높음 0.58달러
중간 0.41달러
낮음 0.24달러

높은 설정에서 작업당 출력 토큰은 48,000개로, Gemini 3.7 Flash보다 30% 많았습니다. 그 결과 토큰당 가격은 낮아지지 않았지만, 지수 실행 비용은 Gemini 3.7 Flash의 0.40달러에서 Gemini 3.8 Flash의 0.58달러로 증가했습니다.

두 가지 결론을 얻을 수 있습니다.

  1. 프리미엄 모델이 더 적은 토큰이나 도구 호출로 작업을 완료한다면, 토큰당 13.3배의 가격 차이가 실제 청구서에서도 13.3배로 유지되지는 않습니다. Artificial Analysis는 동일한 텍스트에서 Fable 5.1이나 Sol의 작업당 비용을 발표하지 않았으므로, 자체 프롬프트로 측정해야 합니다.
  2. Gemini에서는 사고 수준이 주요 비용 레버입니다. 높은 수준에서 낮은 수준으로 바꾸면 설정에 따라 작업당 비용을 절반 이상 줄일 수 있습니다.

Gemini 사고 수준 가이드에서 엔드포인트별 설정 방법을 확인할 수 있습니다. 또한 3.8 Flash vs 3.7 Flash 비교에서는 이전 모델이 작업당 31% 저렴해 더 나은 선택이 되는 경우를 설명합니다.

각 모델을 선택할 시점

대량 처리와 에이전트 비용 효율성: Gemini 3.8 Flash

매일 수천 개의 에이전트 작업을 실행한다면 Gemini 3.8 Flash부터 시작하는 것이 합리적입니다.

  • 독립 지수에서 프리미엄 모델과 비슷한 점수
  • Google 금융 및 법률 에이전트 벤치마크에서 선두
  • 2027년 가격 인상 후에도 낮은 토큰당 비용
  • 비디오, 오디오, PDF 입력 지원
  • 배치 처리 50% 할인
  • 월 5,000건의 무료 Google 검색 그라운딩 요청
  • 프로토타이핑을 위한 무료 티어

단점도 있습니다.

  • 텍스트 전용 출력
  • Live API 미지원
  • 최대 출력 65,536 토큰
  • 중간 또는 높은 사고 수준에서 토큰 소비 증가

가장 어려운 장기 추론: Claude Fable 5.1

Fable 5.1은 모든 작업의 기본 모델이라기보다, 저렴한 모델의 평가가 부족할 때 확장하는 모델입니다.

다음과 같은 작업에 적합합니다.

  • 몇 시간 동안 실행되는 연구 에이전트
  • 긴 터미널 세션
  • 저렴한 모델이 충분히 검증하지 못한 추론 체인
  • 잘못된 답변의 손실이 토큰 비용보다 큰 작업

128K 출력과 0.25달러의 캐시 읽기 가격은 매 턴 동일한 대규모 컨텍스트를 재사용하는 프리픽스-헤비(prefix-heavy) 에이전트 루프에 유리합니다. 이런 환경에서는 캐시 사용으로 실제 가격 차이가 13.3배보다 훨씬 작아질 수 있습니다.

모델 사양은 Claude Fable 5.1이란 무엇인가에서 확인할 수 있습니다.

OpenAI 생태계의 에이전트 실행: GPT-5.6 Sol

Sol은 다음 조건에서 적합합니다.

  • xhigh 설정에서 Artificial Analysis 59점
  • HLE-Verified에서 Gemini 3.8 Flash와 동률
  • 5달러 / 30달러 가격
  • 128K 출력 지원
  • 에이전트, 평가, 도구가 이미 OpenAI 스택에 구축되어 있음

세 모델 중 캐시 읽기 가격이 가장 비싸므로, 긴 캐시 세션보다는 새로운 컨텍스트를 사용하는 실행에 더 적합합니다.

Grok 4.6 vs GPT-5.6 vs Claude Fable 5 비교에서 Sol과 이전 Anthropic 플래그십 모델의 성능을 비교할 수 있습니다.

하나의 Apidog 작업 공간에서 세 모델 테스트하기

가장 정확한 비교 방법은 동일한 프롬프트를 직접 실행하고 작업당 비용을 측정하는 것입니다. Apidog는 API 클라이언트이자 테스트 플랫폼으로, 세 공급업체에 동일한 요청을 보내고 응답을 비교하는 데 사용할 수 있습니다.

1. 세 가지 환경 만들기

하나의 프로젝트에 다음 환경을 구성합니다.

환경 기본 URL 키 변수
Gemini https://generativelanguage.googleapis.com GEMINI_API_KEY
Claude Anthropic 기본 URL Claude 키
OpenAI OpenAI 기본 URL OpenAI 키

키는 환경 변수에 저장하고, 요청 본문이나 공유 컬렉션에는 포함하지 않습니다.

2. 동일한 프롬프트 실행하기

동일한 프롬프트를 사용하는 세 가지 요청 단계를 하나의 테스트 시나리오로 구성합니다.

  • Gemini: /v1beta/interactions에 게시
    • "model": "gemini-3.8-flash"
    • "thinking_level": "medium"
  • Claude: Anthropic의 채팅 또는 메시지 엔드포인트에 게시
  • OpenAI: OpenAI의 채팅 엔드포인트에 게시

각 단계에 다음 어설션을 추가합니다.

  • HTTP 상태 코드가 200인지 확인
  • 응답 JSON 경로에 답변이 존재하는지 확인
  • 토큰 사용량 상한 설정

토큰 상한을 설정하면 사고 토큰이 갑자기 두 배로 증가하는 실행을 즉시 감지할 수 있습니다. Gemini의 레거시 엔드포인트에서는 사용량 필드가 usageMetadata.thoughtsTokenCount입니다. Claude와 OpenAI에는 각각 해당하는 사용량 블록에 어설션을 적용합니다.

3. 골든 프롬프트를 매일 실행하기

골든 프롬프트 세트로 시나리오를 실행한 뒤 매일 실행되도록 예약합니다. 공급업체가 기본값을 변경하거나 모델이 더 많은 토큰을 사용하기 시작하면 청구서가 도착하기 전에 실패한 어설션으로 알 수 있습니다.

자주 묻는 질문

Gemini 3.8 Flash가 Claude Fable 5.1보다 낫습니까?

Artificial Analysis 지수에서 Gemini 3.8 Flash는 높은 설정으로 59점, Fable 5.1은 중간 설정으로 57점을 기록했습니다. 따라서 테스트된 설정에서는 비슷한 수준입니다.

Google의 표에는 Fable 5.1이, Anthropic의 벤치마크에는 Gemini 3.8 Flash가 포함되어 있지 않아 더 넓은 직접 비교는 없습니다. 토큰당 가격만 보면 Flash가 도입 가격 기준 13.3배 저렴합니다.

에이전트 작업량에 가장 저렴한 모델은 무엇입니까?

토큰당으로는 Gemini 3.8 Flash가 가장 저렴합니다.

  • 2026년 12월 31일까지: 0.75달러 / 3.75달러
  • 높은 사고 수준의 작업당 비용: 0.58달러
  • 중간 사고 수준의 작업당 비용: 0.41달러
  • 낮은 사고 수준의 작업당 비용: 0.24달러

Gemini 3.8 Flash는 Gemini 3.7 Flash보다 약 30% 더 많은 출력 토큰을 사용할 수 있으므로, 최종 결정 전에는 토큰당 가격이 아니라 완료된 작업당 비용을 측정해야 합니다.

세 모델 모두 1M 컨텍스트 창을 가지고 있습니까?

예.

  • Gemini 3.8 Flash: 1,048,576 입력 토큰
  • Claude Fable 5.1: 1M 토큰
  • GPT-5.6 Sol: 1M 토큰

최대 출력은 다릅니다. Gemini 3.8 Flash는 65,536 토큰이고, Fable 5.1과 Sol은 128K 토큰입니다.

Claude Fable 5.1이 Google의 벤치마크 표에 없는 이유는 무엇입니까?

Google의 표에는 Anthropic 모델로 Claude Opus 5와 Claude Sonnet 5가 나열되어 있습니다. Fable 5.1은 Gemini 3.8 Flash 출시 하루 전인 9월 1일에 출시되었으므로 표에 포함되지 않았습니다.

Fable 5.1 자체의 Anthropic 실행 수치는 Claude Fable 5.1 vs Opus 5 비교에서 확인할 수 있습니다.

Gemini의 가격 우위는 2027년에도 유지됩니까?

부분적으로 유지됩니다. 2027년 1월 1일부터 Gemini 3.8 Flash는 1.50달러 / 7.50달러로 변경됩니다.

그 결과 Fable 5.1은 입력과 출력 모두 Gemini보다 6.7배 비싸고, Sol은 입력에서 3.3배, 출력에서 4배 비싸집니다. Gemini가 여전히 저렴하지만 격차는 절반으로 줄어듭니다.

어떤 모델을 먼저 호출해야 할까요?

다음 순서로 시작해 보세요.

  1. 대량 작업은 Gemini 3.8 Flash로 시작합니다.
  2. 작업별로 thinking_level을 설정합니다.
  3. 정가가 아니라 작업당 토큰 사용량과 완료 비용을 측정합니다.
  4. 저렴한 모델의 평가가 부족하거나 매 턴 컨텍스트가 캐시되는 작업은 Claude Fable 5.1로 전환합니다.
  5. 전체 스택이 OpenAI이고 두 번째 공급업체 없이 프리미엄 티어를 원한다면 GPT-5.6 Sol을 선택합니다.
  6. 모델을 결정하기 전에 하나의 테스트 시나리오에서 동일한 프롬프트를 세 모델 모두에 실행합니다.

공개된 가격 비율은 참고 자료일 뿐입니다. 실제 프롬프트에서의 작업당 비용 비율은 직접 측정해야 합니다.

Top comments (0)