DEV Community

Cover image for Gemini 4 Argon API: 확정된 내용, 예상 비용, 코드 준비 방법
Rihpig
Rihpig

Posted on Originally published at apidog.com

Gemini 4 Argon API: 확정된 내용, 예상 비용, 코드 준비 방법

아직 공개된 Gemini 4 Argon API는 없으며, Google도 모델 ID를 게시하지 않았습니다. Google은 2026년 9월 30일 Argon을 발표했고, 현재는 Fairwind 프로그램 방어자들(Fairwind 파트너가 Gemini Enterprise에서 관리형 모델로 사용하는 집단)에게만 제공하고 있습니다. Artificial Analysis는 Google AI Studio를 Argon의 유일한 API 제공업체로 기재하지만 속도나 지연 시간 데이터는 없습니다. 현재 상태는 가입 가능한 공개 엔드포인트가 아니라 허용 목록 기반의 사전 출시 액세스에 가깝습니다. Google은 더 넓은 출시가 시작되면 “유료 API 고객과 Google AI Ultra 구독자”부터 제공한다고 밝혔으므로, 유료 Gemini API 키를 사용하는 프로젝트가 우선 대상이 될 가능성이 높습니다.

오늘 Apidog를 사용해 보세요

발표와 실제 액세스 사이의 기간에는 전환 준비를 끝낼 수 있습니다. 이 글에서는 Google이 Argon API에 대해 확인한 내용과 아직 공개하지 않은 내용을 구분하고, 오늘 바로 실행 가능한 Gemini 3.8 Flash 코드로 전환 경로를 준비합니다. 목표는 Argon 모델 ID가 공개되었을 때 환경 변수 하나만 바꿔 전환하는 것입니다.

이 과정에서 다음을 구현합니다.

  • 모델 ID와 사고 수준을 환경 변수로 분리
  • Interactions API와 generateContent 경로 동시 지원
  • models.list 기반 출시 감지
  • Apidog 응답 모의(mock)
  • Argon 표준 가격 기준 비용 상한선 테스트

모델 자체는 Gemini 4 Argon이 무엇인지, 출시 단계는 Gemini 4 Argon 출시일 가이드를 참고하세요.

Gemini 4 Argon API: 확인된 사항과 미공개 사항

Google의 출시 게시물에서는 가격과 출력 제한을 확인할 수 있습니다. 반면 실제 통합에 필요한 모델 ID, 요율 제한, 배치 지원 등의 정보는 아직 공개되지 않았습니다.

항목 상태 세부 정보
입력 가격 확인됨 100만 토큰당 $2(도입), 도입 기간 후 $4
출력 가격 확인됨 100만 토큰당 $10(도입), 도입 기간 후 $20
캐시된 입력 확인됨 입력 95% 할인: 도입 $0.10, 일반 $0.20
출력 제한 확인됨 64K에서 1M 토큰으로 증가
API 표면 신호됨 Google 문서에 따르면 모든 새 모델은 Interactions API에서 출시
모델 ID 미공개 모델 페이지, 가격 페이지, 변경 로그에 없음
입력 컨텍스트 창 미공개 장문 컨텍스트 평가는 최대 1M 토큰 프롬프트를 사용했으나 사양은 아님
사고 수준 미공개 평가는 “최고 사고 설정”으로 실행됨. 이름과 기본값은 미공개
요율 제한 미공개 발표된 계층 없음
배치 지원 미공개 배치 또는 Flex 가격 없음
장문 프롬프트 계층 미공개 3.1 Pro는 200K 이상에서 추가 비용이 발생하지만 Argon 규칙은 미공개
도입 기간 길이 미공개 $2/$10 가격의 종료일 없음

특히 다음 두 항목을 기준으로 구현 전략을 세우는 것이 좋습니다.

  1. API 표면

    Interactions API 문서는 모든 새 모델이 Interactions API에서 출시된다고 명시합니다. Argon도 먼저 이 API에서 제공될 가능성이 높습니다. 다만 Google은 generateContent 지원 여부를 아직 밝히지 않았습니다.

  2. 출력 제한

    Google은 최대 1M 출력 토큰을 언급했지만, Vals AI는 테스트한 구성에서 최대 262K 출력을 나열합니다. 따라서 첫날부터 모든 엔드포인트와 모든 계층에서 1M 출력이 가능하다고 가정하면 안 됩니다. 1M 출력 토큰 가이드에서 스트리밍, 시간 초과, 저장소에 미치는 영향을 확인할 수 있습니다.

Gemini 4 Argon 관련 이미지

가격 계산도 배포 전에 코드로 검증해 두는 것이 좋습니다. 예를 들어 입력 20,000 토큰, 출력 5,000 토큰 요청의 비용은 다음과 같습니다.

도입 가격:
20,000 × $2 / 1,000,000 + 5,000 × $10 / 1,000,000
= $0.04 + $0.05
= $0.09

표준 가격:
20,000 × $4 / 1,000,000 + 5,000 × $20 / 1,000,000
= $0.18
Enter fullscreen mode Exit fullscreen mode

Argon의 도입 출력 가격($10)은 Gemini 3.1 Pro Preview의 $12보다 낮고, 표준 출력 가격은 Claude Opus 5.5와 같습니다. 캐시 입력과 최대 1M 토큰 출력 시나리오는 Gemini 4 Argon 가격 분석에서 확인하세요.

온라인에서 찾은 모델 ID를 하드코딩하지 마세요

Argon 모델 ID를 검색하면 벤치마크 사이트, 집계 서비스, 오픈소스 PR에서 여러 문자열을 찾을 수 있습니다. 하지만 현재 이 값들은 신뢰할 수 없습니다.

  • Vals AI는 자체 모델 페이지용 슬러그를 사용합니다.
  • 일부 GitHub PR은 “임시” 모델 ID를 추가합니다.
  • OpenRouter 스타일 경로는 실제 모델 페이지로 연결되지 않을 수 있습니다.
  • Google은 이러한 문자열을 공식적으로 확인하지 않았습니다.

추측한 모델 ID를 하드코딩하면 출시 당일 404 오류가 발생할 수 있습니다. 더 나쁜 경우, 클라이언트 래퍼가 오류를 과도하게 처리해 자동 실패로 이어질 수 있습니다.

모델 ID는 반드시 환경 변수로 관리하세요. 아래 예제에서는 현재 호출 가능한 안정 모델인 gemini-3.8-flash를 기본값으로 사용합니다.

export GEMINI_MODEL="gemini-3.8-flash"
Enter fullscreen mode Exit fullscreen mode

Google이 Argon의 실제 모델 ID를 공개하면 다음 한 줄만 변경하면 됩니다.

export GEMINI_MODEL="공식-argon-모델-id"
Enter fullscreen mode Exit fullscreen mode

Gemini 3.8 Flash에서 전환 코드를 준비하세요

Gemini 3.8 Flash(gemini-3.8-flash)는 Argon이 사용할 것으로 예상되는 엔드포인트, 헤더, 응답 형식으로 실행됩니다. 2026년 12월 31일까지 가격은 입력 100만 토큰당 $0.75, 출력 100만 토큰당 $3.75입니다.

API 키는 코드에 넣지 말고 환경 변수로 관리하세요.

export GEMINI_API_KEY="your-api-key"
export GEMINI_MODEL="gemini-3.8-flash"
export GEMINI_THINKING="medium"
Enter fullscreen mode Exit fullscreen mode

전체 설정은 Gemini 3.8 Flash API 가이드를 참고하세요.

1단계: Interactions API 요청 보내기

Interactions API는 Google의 주요 API이며 2026년 6월부터 일반적으로 사용할 수 있습니다. Argon의 사고 수준 이름과 기본값은 아직 공개되지 않았으므로, 모델과 사고 수준을 모두 변수로 유지하세요.

MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
THINKING="${GEMINI_THINKING:-medium}"

curl -s -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d "{
    \"model\": \"${MODEL}\",
    \"input\": \"List the retry rules a REST client should follow for HTTP 429.\",
    \"generation_config\": {\"thinking_level\": \"${THINKING}\"}
  }"
Enter fullscreen mode Exit fullscreen mode

Python에서는 Interactions API를 사용하기 위해 google-genai 2.3.0 이상이 필요합니다.

# pip install "google-genai>=2.3.0"
import os
from google import genai

MODEL = os.environ.get("GEMINI_MODEL", "gemini-3.8-flash")
THINKING = os.environ.get("GEMINI_THINKING", "medium")

client = genai.Client()  # GEMINI_API_KEY를 환경 변수에서 읽음

interaction = client.interactions.create(
    model=MODEL,
    input="List the retry rules a REST client should follow for HTTP 429.",
    generation_config={"thinking_level": THINKING},
)

print(interaction.output_text)
Enter fullscreen mode Exit fullscreen mode

Gemini 3.8 Flash에서 유효한 사고 수준은 다음과 같습니다.

low
medium  # 기본값
high
Enter fullscreen mode Exit fullscreen mode

minimal을 보내면 HTTP 400이 반환됩니다. 수준별 비용과 응답 품질의 차이는 사고 수준 가이드에서 확인할 수 있습니다.

다중 턴 작업에서는 이전 응답 ID를 previous_interaction_id로 전달합니다. 서버 측 저장소를 사용하지 않으려면 store: false도 함께 전송하세요.

2단계: generateContent 경로도 계속 유지하기

기존 Gemini 코드는 대부분 generateContent 엔드포인트를 사용합니다. Google은 이 경로를 계속 지원한다고 밝혔으므로, 현재 클라이언트 호환성을 위해 유지할 수 있습니다.

curl -s "https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d "{
    \"contents\": [{
      \"parts\": [{
        \"text\": \"List the retry rules a REST client should follow for HTTP 429.\"
      }]
    }],
    \"generationConfig\": {
      \"thinkingConfig\": {
        \"thinkingLevel\": \"${THINKING}\"
      }
    }
  }"
Enter fullscreen mode Exit fullscreen mode

두 API의 사고 수준 필드 경로는 다릅니다.

API 사고 수준 경로
Interactions API generation_config.thinking_level
generateContent generationConfig.thinkingConfig.thinkingLevel

새 모델은 기본적으로 Interactions API로 라우팅하고, generateContent는 기존 통합 호환용 대체 경로로 유지하는 편이 안전합니다. 함수 호출까지 사용한다면 Gemini 3.8 Flash 함수 호출도 함께 확인하세요.

3단계: models.list로 출시 감지 자동화하기

변경 로그를 수동으로 새로고침하지 말고 API를 직접 확인하세요. 모델 목록 엔드포인트는 사용 가능한 모델, 토큰 제한, 지원 메서드를 반환합니다.

import os
import sys
import requests

resp = requests.get(
    "https://generativelanguage.googleapis.com/v1beta/models",
    params={"pageSize": 1000},
    headers={"x-goog-api-key": os.environ["GEMINI_API_KEY"]},
    timeout=30,
)

resp.raise_for_status()

hits = [
    model
    for model in resp.json().get("models", [])
    if "argon" in model["name"].lower()
]

for model in hits:
    print(
        model["name"],
        "in:", model.get("inputTokenLimit"),
        "out:", model.get("outputTokenLimit"),
        "methods:", model.get("supportedGenerationMethods"),
    )

sys.exit(1 if hits else 0)  # 일치 시 실패 처리하여 알림 트리거
Enter fullscreen mode Exit fullscreen mode

이 스크립트는 프로덕션 앱에서 사용하는 동일한 API 키로 실행하세요. cron 또는 CI 스케줄러에서 시간 단위로 실행하면 됩니다.

Argon이 목록에 나타난 날에는 다음 정보를 즉시 확인할 수 있습니다.

  • 실제 모델 이름
  • outputTokenLimit이 전체 1M인지 여부
  • 지원되는 생성 메서드 목록
  • Interactions API 또는 generateContent 지원 여부

4단계: 응답을 모의(mock)해 액세스 전 클라이언트 만들기

Argon 액세스가 없어도 Argon 전환용 클라이언트는 만들 수 있습니다.

  1. Apidog에 GEMINI_API_KEY, GEMINI_MODEL을 환경 변수로 저장합니다.
  2. Gemini 3.8 Flash 대상으로 요청을 한 번 전송합니다.
  3. 실제 응답을 엔드포인트의 응답 예제로 저장합니다.
  4. 프로젝트 설정에서 기본 모의 방식을 Response example first로 변경합니다. 경로: 프로젝트 설정 → 기능 설정 → 모의 설정
  5. 생성된 모의 URL을 프런트엔드, 큐 워커, 파서 테스트에 연결합니다.

Apidog의 기본 Smart Mock은 스키마에서 데이터를 생성합니다. 하지만 이 경우에는 실제 Gemini 응답 구조를 그대로 재현해야 하므로, 저장된 응답 예제를 우선 반환하도록 설정하는 편이 적합합니다.

중요한 점은 이 모의 응답이 Argon 전용 스키마가 아니라 현재 Gemini 응답 스키마라는 것입니다. Google이 Argon 전용 스키마를 아직 공개하지 않았기 때문입니다. 다만 Argon이 동일한 API 표면에서 제공될 것으로 예상되므로, 현재 시점에서는 이 접근이 가장 실용적입니다.

대용량 Argon 응답 처리도 미리 테스트할 수 있습니다. 저장된 응답 예제의 usageMetadata 값을 크게 변경한 뒤 다음을 확인하세요.

  • 청구 알림이 발생하는지
  • 큐 처리 시간이 제한을 넘는지
  • 응답 저장소가 충분한지
  • 프런트엔드 렌더링이 대형 응답을 처리하는지

5단계: usageMetadata와 비용 상한선에 대한 테스트 추가하기

모든 generateContent 응답에는 usageMetadata가 포함됩니다. Apidog 후처리 스크립트로 응답 비용을 Argon의 표준 요율로 계산하고, 요청당 예산을 넘으면 테스트를 실패시키세요.

// Apidog 후처리 스크립트:
// Gemini 4 Argon의 표준 요율로 현재 응답 비용 계산

const u = pm.response.json().usageMetadata;

const IN = 4 / 1e6;   // 도입 기간 후 입력 토큰당 USD
const OUT = 20 / 1e6; // 도입 기간 후 출력 토큰당 USD

// 현재 Gemini 모델에서는 사고(thinking) 토큰도 출력으로 청구됨
const out =
  (u.candidatesTokenCount || 0) +
  (u.thoughtsTokenCount || 0);

const cost =
  u.promptTokenCount * IN +
  out * OUT;

pm.test("usageMetadata가 존재합니다", () => {
  pm.expect(u).to.be.an("object");
});

pm.test("Argon 요율에서 비용이 $0.10 미만입니다", () => {
  pm.expect(cost).to.be.below(0.10);
});
Enter fullscreen mode Exit fullscreen mode

$0.10은 짧은 프롬프트 테스트에 적합한 예시입니다. 실제 서비스에서는 요청 유형별로 별도 상한선을 두는 편이 좋습니다.

요청 유형 권장 방식
짧은 질의응답 요청당 낮은 비용 상한선
문서 요약 입력 토큰 수와 출력 토큰 수 각각 제한
장문 생성 스트리밍, 시간 초과, 저장소 한도 동시 적용
에이전트 작업 단계별 예산과 전체 작업 예산 분리

Google은 Argon에서 사고 토큰을 어떻게 과금할지 아직 명시하지 않았습니다. 위 스크립트는 현재 Gemini의 과금 규칙을 기준으로 합니다. 같은 요청을 지금 Gemini 3.8 Flash에 실행하고, 나중에 Argon에서도 실행하면 토큰 사용량과 비용 차이를 회귀 비교에 활용할 수 있습니다.

자주 묻는 질문

Gemini 4 Argon API를 지금 사용할 수 있나요?

공개적으로는 아직 사용할 수 없습니다. Argon은 현재 Fairwind 프로그램 파트너에게만 배포되며, 이들은 Gemini Enterprise를 통해 모델을 사용합니다. 유료 API 고객과 Google AI Ultra 구독자가 다음 대상이지만 구체적인 날짜는 공개되지 않았습니다.

Gemini 4 Argon 모델 ID는 무엇인가요?

Google은 아직 모델 ID를 게시하지 않았습니다. 타사 사이트의 문자열은 자리 표시자일 수 있으므로, 모델 이름은 환경 변수로 관리하고 models.list를 주기적으로 확인하세요.

Gemini 4 Argon API 비용은 얼마인가요?

기간이 명시되지 않은 도입 기간에는 입력 100만 토큰당 $2, 출력 100만 토큰당 $10입니다. 이후 표준 가격은 입력 $4, 출력 $20입니다. 캐시된 입력은 95% 할인됩니다. 자세한 내용은 Gemini 4 Argon 가격 책정을 참고하세요.

Argon은 generateContent와 함께 작동하나요?

Google은 아직 언급하지 않았습니다. 문서에는 모든 새 모델이 Interactions API에서 출시된다고 명시되어 있으므로, 새 통합은 Interactions API를 기준으로 구현하고 generateContent는 대체 경로로 취급하세요.

Google AI Ultra만 있으면 API에 액세스할 수 있나요?

아니요. Google AI Ultra는 소비자 구독이며 API 키가 아닙니다. API 접근은 유료 Gemini API 고객부터 시작된다고 발표되었습니다.

다음 단계

Argon 출시 전에 다음 체크리스트를 완료하세요.

  • [ ] 모든 환경에 GEMINI_MODEL 설정
  • [ ] GEMINI_THINKING을 환경 변수로 분리
  • [ ] Interactions API 요청 저장
  • [ ] generateContent 호환 경로 유지
  • [ ] models.list 감지 스크립트를 CI 또는 cron에 등록
  • [ ] Apidog에 실제 응답 예제와 모의 URL 구성
  • [ ] usageMetadata 기반 비용 상한선 테스트 추가
  • [ ] 대형 응답을 위한 스트리밍, 시간 초과, 저장소 한도 검증

Apidog를 다운로드해 요청, 모의 응답, 테스트를 하나의 작업 공간에서 관리하세요. Google이 공식 Argon 모델 ID를 게시하면 GEMINI_MODEL 값 하나만 변경해 전환할 수 있습니다.

Top comments (0)