Gemini 4 Argon은 GPT-6 Astra, Claude Opus 5.5 및 Claude Fable 5.1에 비해 Google의 벤치마크 표 19개 행 중 13개에서 선두를 차지했습니다. 하지만 점수보다 중요한 점은 오늘 Astra와 Opus 5.5는 구매할 수 있지만 Argon은 구매할 수 없다는 사실입니다. Google의 새 프론티어 모델은 현재 Fairwind 프로그램 방어자에게만 제공되며, 소개 기간에는 백만 토큰당 입력/출력 $2/$10, 이후 $4/$20입니다. 이는 Opus 5.5의 표준 가격과 동일합니다.
이 글에서는 네 모델의 가격과 제한을 비교하고, 각 모델이 우세한 벤치마크를 작업 유형별로 정리합니다. 또한 점수를 직접 비교하기 어려운 이유와 라우팅 기준, 그리고 Apidog에서 실제 프롬프트로 모델을 비교하는 방법을 다룹니다. Argon이 처음이라면 Gemini 4 Argon이란 무엇인가부터 확인하세요. 출시 시점은 Argon 출시일 가이드를 참고하면 됩니다.
가격 및 제한 비교
Google의 비교 표에는 Claude Fable 5.1도 포함되어 있으므로 함께 비교해야 합니다. 가격은 모두 백만 토큰당 기준이며, 각 공급업체의 Google 출시 게시물, OpenAI GPT-6 Astra 모델 페이지, Anthropic 가격 페이지를 기준으로 합니다.
| 항목 | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Fable 5.1 |
|---|---|---|---|---|
| 오늘 사용할 수 있나요? | 아니요, Fairwind 전용 | 예 | 예 | 예 |
| API 모델 ID | 미공개 | gpt-6-astra |
claude-opus-5-5 |
claude-fable-5-1 |
| 입력 | 소개 $2, 이후 $4 | $10 | $4 | $10 |
| 캐시된 입력 | 소개 $0.10, 이후 $0.20 | $1 | $0.20 | $0.25 |
| 출력 | 소개 $10, 이후 $20 | $50 | $20 | $50 |
| 최대 출력 | 1M, Google 명시 제한 | 128K | 128K, Batch에서 300K 베타 | 128K |
| 컨텍스트 창 | 미공개 | 1,050,000, 최대 입력 922K | 1M | 1M |
| 긴 프롬프트 할증료 | 명시되지 않음 | 272K 입력 초과 시 전체 요청에서 입력·캐시 2배, 출력 1.5배 | 없음 | 없음 |
실무적으로는 다음 세 가지를 확인해야 합니다.
Argon의 표준 가격은 Opus 5.5와 동일합니다.
입력, 캐시된 입력, 출력 가격이 모두 일치합니다. 따라서 Argon의 비용 우위는 소개 기간에만 적용되며, Google은 소개 기간의 종료 시점을 공개하지 않았습니다.Astra와 Fable 5.1은 토큰 단가가 높습니다.
Argon의 표준 입력/출력 요금 기준으로는 약 2.5배, 소개 요금 기준으로는 약 5배입니다.최대 출력 제한은 실제 테스트 구성에 따라 달라질 수 있습니다.
Google은 Argon의 최대 출력을 1M 토큰으로 명시하지만, Vals AI는 테스트한 Argon 구성에서 최대 262K 출력을 기록했습니다.
요청별 비용 계산이 필요하면 Gemini 4 Argon 가격 책정을 참고하세요.
Google 표에서 각 모델이 선두를 차지하는 부분
먼저 전제 조건이 있습니다. 아래 수치는 Google의 표에서 가져온 것입니다. Argon 점수는 Google이 자체 평가하거나 리더보드에서 수집한 값이며, 경쟁 모델 점수는 대체로 공급업체 공개 수치 또는 공용 리더보드 결과입니다. 가능한 경우 최대 추론 설정을 기준으로 했지만, 실행 하네스가 다르므로 작은 차이는 노이즈로 보는 편이 안전합니다.
| 선두 모델 | 벤치마크 | Argon | Astra | Fable 5.1 | Opus 5.5 |
|---|---|---|---|---|---|
| Argon: 지식 작업 | Vals 인덱스 | 68.9% | 63.1% | 65.8% | 67.0% |
| Argon: 지식 작업 | AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% |
| Argon: 지식 작업 | Harvey의 법률 에이전트 벤치마크 | 19.6% | 5.4% | 6.7% | 3.8% |
| Argon: 코딩 | DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
| Argon: 긴 컨텍스트 | GraphWalks 256K ~ 1M, F1 | 84.2% | 71.8% | 65.0% | 66.8% |
| Argon: 멀티모달 | LV벤치 | 91.7% | 87.5% | 79.7% | 83.7% |
| Argon: 멀티모달 | 차트 작성 | 71.6% | 71.0% | 46.2% | 66.3% |
| Astra | FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% |
| Astra | 터미널 벤치 과학 0.1 | 57.6% | 68.1% | 52.6% | 63.3% |
| Astra | OSWorld-2.0, 오프라인 부분 | 69.2% | 72.6% | 보고되지 않음 | 보고되지 않음 |
| Opus 5.5 | 터미널 벤치 4.0 | 57.4% | 58.2% | 57.9% | 66.4% |
| Opus 5.5 | PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% |
| 동점 | CWE-벤치 v1 | 68.0% | 68.0% | 58.0% | 67.0% |
Argon이 우세한 추가 항목은 다음과 같습니다.
- Vals Finance Agent v2
- Vibe Code Bench
- LABBench 2
- RiemannBench
- 최대 128K GraphWalks
- Agent’s Last Exam
Fable 5.1은 이 표에서 어떤 행에서도 선두를 차지하지 못했습니다. CWE-bench v1에서는 DeepMind의 사이버 리더보드가 Argon, Astra, Grok 4.7의 68% 동점을 기록했고, Opus 5.5는 67%였습니다.
Gemini 4 Argon과 Fable 5.1만 비교하면, 두 모델이 모두 점수를 보고한 17개 항목 중 Argon이 15개에서 더 높은 점수를 기록했습니다. Fable은 FrontierSWE v2에서 56.3% 대 55.0%, Terminal-bench 4.0에서 57.9% 대 57.4%로 근소하게 앞섰습니다. Anthropic의 자체 수치는 Claude Fable 5.1 벤치마크에서, 전체 19개 행은 Gemini 4 Argon 벤치마크에서 확인할 수 있습니다.
격차를 신뢰하기 전에 확인할 세 가지
1. 경쟁 모델 점수는 Google이 직접 실행한 결과가 아닐 수 있습니다
Google의 평가 방법론에 따르면, 비-Gemini 모델 결과는 “별도로 언급되지 않는 한 공급업체의 자체 보고 수치에서 가져온 것”입니다. 일부 항목은 Vals AI, Proximal, Surge가 운영하는 공개 리더보드 결과입니다.
2. 벤치마크 하네스가 다릅니다
DeepSWE v1.1에서 Google은 mini-swe-agent 하네스로 Argon의 77.9%를 자체 계산했습니다. Astra 점수는 공개 리더보드에서 가져왔고, Anthropic 모델 점수는 시스템 카드에서 가져왔습니다.
LVBench에서는 비디오 프레임 수에도 차이가 있습니다.
- Gemini: 초당 1프레임
- Astra: 800프레임
- Opus 5.5: 600프레임
- Fable 5.1: 300프레임
Google은 이 차이가 API 제한 때문이라고 설명합니다. 따라서 멀티모달 점수를 비교할 때는 점수만 보지 말고 입력 샘플링 조건도 함께 확인해야 합니다.
3. 같은 모델도 차트마다 점수가 다를 수 있습니다
Opus 5.5의 Terminal-bench 4.0 결과는 하네스와 노력 설정에 따라 달라집니다. Anthropic은 xhigh 노력 설정에서 66.4%를 보고합니다.
여러 출처의 점수를 한 표에 합칠 때는 다음 메타데이터를 함께 기록하세요.
- 모델 버전
- 추론 또는 노력 설정
- 실행 하네스
- 도구 사용 가능 여부
- 입력 제한 및 출력 제한
- 벤치마크 실행 날짜
제3자 평가자의 의견
독립 리더보드는 공급업체 발표와 다른 관점을 제공합니다.
Artificial Analysis는 Argon을 223개 중 8위로 나열합니다. 다만 이 리더보드는 추론 설정별로 개별 항목을 계산합니다. 개별 모델 기준으로는 Argon이 53점으로 GPT-6 Astra 및 Claude Fable 5.1과 동점이며, Claude Opus 5.5의 최대 58점과 Claude Sonnet 5.5의 56점보다 낮습니다.
Artificial Analysis의 AA-Omniscience에서는 Argon의 환각률을 15%로, Astra의 최대 설정 환각률을 51%로 나열합니다.
Arena에서는 Argon이 4,942표를 기준으로 예비 1525점으로 텍스트 부문 1위를 기록했고, Opus 5.5는 4위였습니다. Vals AI에서는 Argon이 Vals 인덱스 41개 모델 중 1위를 차지했으며, 이 인덱스에서 1위를 기록한 최초의 Gemini 모델입니다.
다만 실제 사용 경험은 벤치마크와 다를 수 있습니다. 블룸버그 보도에 따르면, Argon 접근 권한이 있는 일부 Google 직원은 일부 코딩 및 프론트엔드 디자인 작업에서 기대에 미치지 못한다고 평가했습니다. Google은 이 특징화가 부정확하다고 밝혔습니다.
어떤 모델로 라우팅할 것인가
2026년에는 모든 작업에서 최고인 단일 프론티어 모델은 없습니다. 모델 라우팅은 작업 특성, 비용, 지연 시간, 출력 길이, 도구 호출 품질을 기준으로 결정해야 합니다.
| 작업 | 오늘 라우팅 | Argon 출시 시 |
|---|---|---|
| 법률, 금융 및 사무 자동화 에이전트 | Opus 5.5, Vals 인덱스 67.0% | Argon 테스트: 지식 작업 4개 행에서 선두 |
| 터미널 중심 코딩 에이전트 | Opus 5.5, 터미널 벤치 4.0 66.4% | Opus 5.5가 여전히 선두 |
| 에이전트 소프트웨어 엔지니어링 | Astra, FrontierSWE v2 65.5%, 또는 Opus 5.5 | Argon은 DeepSWE 선두지만 FrontierSWE에서는 뒤처짐. 둘 다 테스트 |
| 컴퓨터 사용 및 GUI 에이전트 | Astra, OSWorld-2.0 72.6% | Astra는 OSWorld 선두, Argon은 Agent’s Last Exam 선두 |
| 256K+ 토큰 프롬프트 추론 | Opus 5.5, 할증료 없음, 또는 Astra, 272K 초과 할증료 | Argon, GraphWalks 256K ~ 1M 84.2% |
| 비디오 및 차트 이해 | Astra, LV벤치 87.5% | Argon, 91.7%. 프레임 수 조건 확인 필요 |
| 과학 및 ML 엔지니어링 | Astra, 터미널 벤치 과학, Opus 5.5, PostTrainBench | Argon은 LABBench 2와 RiemannBench에서 선두. 자체 테스트 필요 |
| 128K 토큰 초과 단일 응답 | Batch의 Opus 5.5, 300K 베타 | Argon, Google 명시 기준 최대 1M |
| 대량·비용 민감 작업 | Opus 5.5, $4/$20 | Argon 소개 기간에는 $2/$10 |
최고 점수보다 비용이 중요하다면 GPT-6 Sol 대 Claude Opus 5.5 비교로 OpenAI의 저렴한 Sol 라인과 Opus를 함께 검토하세요.
자신의 프롬프트로 세 모델 비교하기
공급업체 벤치마크만으로는 실제 사용자 프롬프트의 품질, 비용, 지연 시간을 알 수 없습니다. Apidog에서 작은 평가 시나리오를 만들면 현재 구매 가능한 모델을 비교하고, Argon 출시 후 동일한 조건으로 재실행할 수 있습니다.
1. 모델별 요청을 준비합니다
한 프로젝트에 다음 세 요청을 만듭니다.
- GPT-6 Astra 요청
- Claude Opus 5.5 요청
- Gemini 요청
Gemini 요청의 모델 필드는 하드코딩하지 말고 변수로 관리합니다.
{
"model": "{{GEMINI_MODEL}}",
"input": "{{SHARED_PROMPT}}"
}
Google이 Argon의 모델 ID를 공개하기 전까지는 GEMINI_MODEL을 gemini-3.8-flash로 설정하고, 출시 후 Argon ID로 교체합니다.
각 공급업체의 요청 형식은 GPT-6 Astra API 가이드와 Claude Opus 5.5란 무엇인가에서 확인할 수 있습니다.
2. 환경 변수로 API 키와 공통 프롬프트를 관리합니다
다음처럼 공급업체별 키와 공통 입력을 분리합니다.
OPENAI_API_KEY=...
ANTHROPIC_API_KEY=...
GOOGLE_API_KEY=...
SHARED_PROMPT=...
GEMINI_MODEL=gemini-3.8-flash
세 요청이 정확히 같은 입력을 받도록 SHARED_PROMPT를 사용해야 합니다. 비교 시 시스템 프롬프트, 온도, 최대 출력 토큰, 도구 정의도 가능한 한 동일하게 맞추세요.
3. 품질과 비용을 함께 검증하는 어설션을 추가합니다
각 요청에 최소한 다음 검증을 추가합니다.
- HTTP 상태 코드가 200인지
- 응답 텍스트가 비어 있지 않은지
- 출력 토큰이 상한선 이내인지
- 계산된 요청 비용이 예산 이내인지
- JSON 출력이 필요하다면 스키마를 충족하는지
- 도구 호출이 필요하다면 함수명과 인수가 유효한지
예를 들어 비용 검증용 기준 값을 다음처럼 환경 변수로 분리할 수 있습니다.
MAX_OUTPUT_TOKENS=8000
MAX_REQUEST_COST_USD=0.50
4. 테스트 시나리오로 묶어 반복 실행합니다
세 요청을 하나의 테스트 시나리오로 구성한 뒤, 같은 프롬프트 세트로 반복 실행합니다. 결과에서 다음 항목을 비교하세요.
- 성공률
- 응답 시간
- 출력 토큰 수
- 계산된 비용
- 형식 준수 여부
- 도구 호출 성공률
- 사람이 검토한 품질 점수
비용 계산 예시
20,000 입력 토큰과 4,000 출력 토큰을 사용하는 요청을 가정해 보겠습니다.
GPT-6 Astra
입력: 20,000 × $10 / 1,000,000 = $0.20
출력: 4,000 × $50 / 1,000,000 = $0.20
총비용: $0.40
Claude Opus 5.5
입력: 20,000 × $4 / 1,000,000 = $0.08
출력: 4,000 × $20 / 1,000,000 = $0.08
총비용: $0.16
Gemini 4 Argon
소개 요금에서는 다음과 같습니다.
입력: 20,000 × $2 / 1,000,000 = $0.04
출력: 4,000 × $10 / 1,000,000 = $0.04
총비용: $0.08
표준 요금에서는 총 $0.16으로 Opus 5.5와 동일합니다.
다만 토큰당 가격과 작업당 비용은 다릅니다. Artificial Analysis는 Argon이 작업당 약 62K 출력 토큰을, Astra가 최대 노력 설정에서 약 27K 출력 토큰을 기록했다고 측정했습니다. 따라서 실제 비용을 판단하려면 자신의 프롬프트에서 출력 토큰 수를 측정해야 합니다.
Argon이 출시되면 GEMINI_MODEL만 변경하고 같은 시나리오를 재실행하세요. 그러면 현재 구매 가능한 Astra 및 Opus 5.5와 동일한 조건에서 비교할 수 있습니다.
자주 묻는 질문
Gemini 4 Argon이 GPT-6 Astra보다 좋나요?
Artificial Analysis에서는 두 모델이 53점으로 동점입니다. Google의 표에서는 Argon이 다수 항목에서 더 높은 점수를 기록했지만, Astra는 FrontierSWE v2, Terminal-Bench Science 0.1, OSWorld-2.0에서 승리했습니다. 또한 Astra는 오늘 바로 사용할 수 있습니다.
Gemini 4 Argon과 Claude Opus 5.5 중 어떤 모델이 더 좋나요?
Google의 표는 대부분의 행에서 Argon에 유리합니다. 반면 Opus 5.5는 Terminal-bench 4.0과 PostTrainBench에서 승리했고, Artificial Analysis에서는 58 대 53으로 앞섭니다. Argon의 표준 가격과 Opus 5.5의 가격은 동일합니다.
Gemini 4 Argon이 Claude Opus 5.5보다 저렴한가요?
소개 기간에는 Argon이 입력/출력 $2/$10으로 Opus 5.5의 $4/$20보다 저렴합니다. 소개 기간 이후에는 표준 가격이 동일하며, Google은 소개 기간의 종료 시점을 명시하지 않았습니다.
가장 큰 출력 제한을 제공하는 모델은 무엇인가요?
Argon은 Google이 명시한 기준으로 최대 1M 토큰 출력입니다. 다만 Vals AI는 테스트 구성에서 최대 262K를 기록했습니다. 나머지 모델은 동기식 출력이 128K로 제한됩니다. 1M 출력 토큰 가이드에서 클라이언트 구현 시 고려할 점을 확인하세요.
오늘 Gemini 4 Argon을 사용할 수 있나요?
현재는 Google Fairwind 프로그램을 통한 검증된 사이버 방어 파트너만 사용할 수 있습니다. 유료 API 고객과 Google AI Ultra 구독자가 다음 대상이지만, 제공 날짜는 공개되지 않았습니다.
작업 부하별로 선택하고, 반드시 테스트하세요
Argon은 지식 작업, 긴 컨텍스트, 멀티모달 벤치마크에서 가장 강력해 보입니다. Astra는 FrontierSWE, Terminal-Bench Science, OSWorld에서 강점을 보이며, Opus 5.5는 터미널 작업과 ML 엔지니어링에서 강합니다.
구현 전략은 단순합니다.
- 지금 구매 가능한 Astra와 Opus 5.5로 먼저 구축합니다.
- Gemini 모델 ID는 환경 변수로 관리합니다.
- 공통 프롬프트와 어설션을 포함한 평가 시나리오를 만듭니다.
- Argon이 출시되면 모델 변수만 변경해 동일한 테스트를 재실행합니다.
- 벤치마크 점수 대신 실제 성공률, 비용, 지연 시간으로 라우팅 결정을 내립니다.
한 프로젝트에서 세 모델 요청을 비교하려면 Apidog를 다운로드하세요.
Top comments (0)