DEV Community

Cover image for 오픈AI GPT-5.6 API 가격 대폭 인하: 루나 80%, 테라 20% 인하 (신규 요금 분석)
Rihpig
Rihpig

Posted on • Originally published at apidog.com

오픈AI GPT-5.6 API 가격 대폭 인하: 루나 80%, 테라 20% 인하 (신규 요금 분석)

2026년 7월 30일, OpenAI는 세 가지 GPT-5.6 모델 중 두 가지의 API 가격을 인하했습니다. GPT-5.6 Luna는 이제 80% 저렴해져 백만 입력 토큰당 0.20달러, 백만 출력 토큰당 1.20달러입니다. GPT-5.6 Terra는 20% 인하되어 입력 2달러, 출력 12달러가 되었습니다. 플래그십 추론 모델인 GPT-5.6 Sol은 입력 5달러, 출력 30달러 요금을 유지하지만, 표준 가격의 두 배로 2.5배 더 빠르게 실행되는 새로운 Fast 모드를 제공합니다.

지금 Apidog 사용해 보기

GPT-5.6 출시 당시 가격으로 비용 모델을 만들었다면 지금 업데이트해야 합니다. 이번 변경은 단순한 단가 조정이 아니라 모델 라우팅 기준을 바꿀 수 있는 수준입니다. 특히 Luna는 대량 처리, 에이전트 루프, 분류·추출 작업에서 우선 검토할 대상이 되었습니다. Apidog 같은 API 테스트 도구를 사용하면 동일한 프롬프트를 Sol, Terra, Luna에 나란히 보내고 실제 토큰 사용량과 응답 품질을 비교할 수 있습니다.

새로운 GPT-5.6 요금 카드

백만 토큰당 변경 전후 가격은 다음과 같습니다.

모델 이전 입력 새 입력 이전 출력 새 출력 변경 사항
GPT-5.6 Sol $5.00 $5.00 $30.00 $30.00 변경 없음
GPT-5.6 Terra $2.50 $2.00 $15.00 $12.00 -20%
GPT-5.6 Luna $1.00 $0.20 $6.00 $1.20 -80%

새 가격은 2026년 7월 30일부터 표준 API 계층에 적용됩니다. 이 제품군의 최고가와 최저가 간 차이는 7월 9일 일반 출시 당시 5배에서 현재 25배로 확대되었습니다.

라우팅 관점에서 보면 차이가 명확합니다.

  • 3주 전 Sol 대신 Luna를 선택하면 비용을 약 80% 절감할 수 있었습니다.
  • 이제 동일한 비교에서 Luna는 Sol보다 약 96% 저렴합니다.
  • 품질 요구사항을 충족한다면 Luna로 이동할 수 있는 워크로드가 크게 늘어납니다.

프롬프트 캐싱 할인도 계속 적용됩니다. 다만 OpenAI는 새 Luna 및 Terra 요금에 대한 별도 캐시 입력 가격을 발표에서 공개하지 않았습니다. 캐시 읽기 비용을 포함한 예산을 다시 계산하기 전에는 공식 가격 페이지를 확인하세요.

Sol에 무슨 일이 있었는가

Sol의 표준 가격은 바뀌지 않았지만, 지연 시간 옵션은 변경되었습니다. OpenAI는 Sol에 Fast 모드를 도입했습니다.

  • 표준 요금의 두 배
  • 토큰 생성 속도는 2.5배 향상
  • 기존 Priority Processing 계층 대체

현재 Priority Processing으로 프로덕션 트래픽을 처리하고 있다면 다음 작업을 수행하세요.

  1. 현재 요청 설정에서 Priority Processing 사용 여부를 확인합니다.
  2. Sol Fast 모드에 맞게 구성과 배포 스크립트를 업데이트합니다.
  3. 변경 후 청구서 항목과 응답 지연 시간을 함께 검증합니다.
  4. 지연 시간 SLA가 있는 엔드포인트는 표준 Sol과 Fast 모드를 각각 부하 테스트합니다.

즉, OpenAI는 Sol을 할인하는 대신 지연 시간에 따라 세분화하고 있습니다. 대화형 속도의 플래그십 추론이 필요하면 Fast 모드 프리미엄을 지불하고, 그렇지 않다면 Terra 또는 Luna로 라우팅하는 구조입니다.

OpenAI가 가격을 인하한 이유

OpenAI는 이번 가격 인하를 손실을 감수하는 전략이 아니라 효율성 개선의 결과로 설명했습니다. 발표에서 언급한 주요 요인은 다음과 같습니다.

  • 추론 플릿 전반의 하드웨어 라우팅 개선
  • 프로덕션 추론 소프트웨어 개선
  • 더 스마트한 컨텍스트 캐싱 알고리즘
  • GPT-5.6 Sol이 직접 다시 작성한 프로덕션 코드 커널

특히 OpenAI는 Sol이 서빙 커널을 자율적으로 다시 작성해 엔드투엔드 서빙 오버헤드를 20% 줄이고, 토큰 생성 효율성을 15% 이상 개선했다고 밝혔습니다. 이 효율성 향상이 Luna 가격을 80% 낮추면서도 마진을 유지할 수 있게 한 기반입니다.

경쟁 요인도 무시하기 어렵습니다. VentureBeat의 보도에 따르면, 이번 인하는 Google Flash 계층에 대한 직접적인 대응으로 해석됩니다.

정가 기준 결합 비용은 다음과 같습니다.

모델 입력 + 출력 기준 백만 토큰당 비용
GPT-5.6 Luna $1.40
Gemini 3.5 Flash-Lite $2.80
Gemini 3.6 Flash $9.00

가격만으로 모델을 선택할 수는 없지만, 대량 요청을 처리하는 워크로드에서는 Luna를 반드시 평가 후보에 넣을 만한 변화입니다.

가격 인하가 워크로드에 미치는 영향

80%의 Luna 가격 인하가 실제 아키텍처 결정을 바꿀 가능성이 큽니다. 다음 워크로드부터 재평가하세요.

에이전트 루프

에이전트 워크로드는 계획, 도구 호출, 결과 읽기, 재시도 과정에서 많은 토큰을 사용합니다. 이전 Luna 가격에서도 비용 효율적인 선택이었지만, 입력 0.20달러·출력 1.20달러가 된 지금은 복잡한 반복 루프의 기본 후보가 될 수 있습니다.

다음과 같은 작업을 Luna로 테스트해 보세요.

  • 다단계 계획 생성
  • 함수 또는 도구 호출 기반 에이전트
  • 문서 검색 후 답변 생성
  • 실패 시 재시도하는 자동화 파이프라인
  • 대량 콘텐츠 처리 배치 작업

분류, 추출, 요약

Terra에 유지하던 분류, 정보 추출, 요약 작업도 다시 평가할 시점입니다. 모델 품질은 바뀌지 않았고 가격만 바뀌었으므로, 이전 평가 결과를 그대로 신뢰하지 말고 새 비용 기준으로 비교해야 합니다.

예를 들어 Terra에서 하루 100달러가 들던 워크로드는 새 요금 기준 Luna에서 약 11달러 수준이 될 수 있습니다. 물론 실제 비용은 입력·출력 토큰 비율에 따라 달라지므로, 사용량 데이터를 기준으로 계산해야 합니다.

Terra를 기본값으로 사용하는 경우

Sol 대 Terra 대 Luna 비교 분석에서 Terra는 일상적인 작업을 위한 합리적인 기본값으로 제안되었습니다. 이 판단은 여전히 유효하며, 이제 같은 선택을 20% 낮은 비용으로 유지할 수 있습니다.

노력 수준 설정

GPT-5.6은 6가지 추론 노력 수준을 제공합니다. 높은 노력 수준은 더 많은 출력 토큰을 생성하며, 출력 토큰은 모든 계층에서 비용이 큰 방향입니다.

가격 인하가 과도한 노력 수준 설정을 해결해 주지는 않습니다. 다음을 함께 점검하세요.

  • 작업별로 필요한 최소 노력 수준은 무엇인가?
  • 응답 품질이 실제로 높은 노력 수준에서 개선되는가?
  • 출력 길이 제한이 적절한가?
  • 재시도 비용까지 포함하면 어떤 설정이 가장 저렴한가?

자신의 수치를 다시 확인하는 방법

백분율만 보고 모델을 교체하지 말고, 실제 트래픽으로 검증하세요. 다음 절차를 권장합니다.

  1. 프로덕션을 대표하는 프롬프트 샘플을 수집합니다.
  2. 각 샘플을 gpt-5.6-luna, gpt-5.6-terra, gpt-5.6-sol에 동일하게 전송합니다.
  3. 응답의 usage 블록에서 입력 및 출력 토큰 수를 수집합니다.
  4. 새 가격을 적용해 요청별 비용을 계산합니다.
  5. 자체 평가 세트로 정확성, 형식 준수, 지연 시간, 실패율을 비교합니다.
  6. 비용과 품질 기준을 모두 통과한 모델만 라우팅 후보로 승격합니다.

비용 계산은 다음 형태로 구현할 수 있습니다.

const pricing = {
  luna: { input: 0.20, output: 1.20 },
  terra: { input: 2.00, output: 12.00 },
  sol: { input: 5.00, output: 30.00 },
};

function estimateCost(model, inputTokens, outputTokens) {
  const rate = pricing[model];

  return (
    (inputTokens / 1_000_000) * rate.input +
    (outputTokens / 1_000_000) * rate.output
  );
}

const cost = estimateCost("luna", 12_000, 2_000);
console.log(`예상 비용: $${cost.toFixed(6)}`);
Enter fullscreen mode Exit fullscreen mode

Apidog를 사용하면 이 비교를 빠르게 반복할 수 있습니다.

  1. 채팅 완료 엔드포인트를 한 번 정의합니다.
  2. 모델 ID를 환경 변수로 분리합니다.
  3. 같은 요청 시나리오를 세 모델에 실행합니다.
  4. 응답의 usage 값을 기록합니다.
  5. 결과를 비용 및 품질 평가 데이터와 함께 비교합니다.

예를 들어 환경 변수는 다음처럼 구성할 수 있습니다.

OPENAI_MODEL=gpt-5.6-luna
Enter fullscreen mode Exit fullscreen mode

이후 같은 요청을 gpt-5.6-terra, gpt-5.6-sol로 전환해 실행하면 됩니다. 응답 뷰어의 usage 블록을 사용하면 추정치가 아닌 실제 입력·출력 토큰 수를 기반으로 계산할 수 있습니다.

GPT-5.6을 앱에 처음 연결한다면 GPT-5.6 API 사용 가이드에서 인증, 모델 ID, 요청 형식을 확인할 수 있습니다. 예산 승인 전에는 엔드포인트를 모의(mock)하고, 승인 후 실제 트래픽으로 전환하는 방식도 가능합니다. 비교 테스트를 시작하려면 Apidog를 무료로 다운로드하세요.

더 큰 그림: 가격 전쟁이 시작되다

이번 변화는 올여름 저가 모델 시장에서 발생한 세 번째 주요 가격 변동입니다.

플래그십 모델은 여전히 품질로 차별화되지만, 주력(workhorse) 계층에서는 단순한 원칙이 강해지고 있습니다. 즉, 품질 기준을 통과하는 모델 중 이번 달에 가장 저렴한 모델이 배치 작업을 가져갈 가능성이 높습니다.

API 팀은 모델 선택을 연간 계획이 아니라 운영 프로세스로 다뤄야 합니다.

  • 모델 ID를 코드에 하드코딩하지 말고 구성 값으로 관리합니다.
  • 공급업체와 모델별 상시 평가 스위트를 유지합니다.
  • 가격 변경 시 비용 계산을 자동으로 다시 실행합니다.
  • 품질, 지연 시간, 오류율, 토큰 사용량을 함께 모니터링합니다.
  • 라우팅 규칙을 기능 플래그로 제어해 빠르게 롤백할 수 있게 합니다.

이렇게 하면 분기별 계획을 기다리지 않고 며칠 안에 가격 인하의 효과를 반영할 수 있습니다.

자주 묻는 질문

새로운 GPT-5.6 API 가격은 얼마입니까?

2026년 7월 30일 기준 가격은 다음과 같습니다.

  • Luna: 백만 입력 토큰당 0.20달러, 백만 출력 토큰당 1.20달러
  • Terra: 백만 입력 토큰당 2달러, 백만 출력 토큰당 12달러
  • Sol: 백만 입력 토큰당 5달러, 백만 출력 토큰당 30달러

Sol에는 표준 요금의 두 배로 2.5배 빠른 처리를 제공하는 Fast 모드도 추가되었습니다.

GPT-5.6 Sol도 가격 인하가 있었나요?

아닙니다. Sol의 표준 요금은 변경되지 않았습니다. 대신 새로운 Fast 모드가 기존 Priority Processing 계층을 대체합니다. Fast 모드는 두 배의 가격으로 2.5배 빠른 속도를 제공합니다.

GPT-5.6 Luna가 이제 Gemini Flash보다 저렴한가요?

정가 기준으로는 그렇습니다. Luna의 결합 입력·출력 요금은 백만 토큰당 1.40달러이며, Gemini 3.5 Flash-Lite는 2.80달러, Gemini 3.6 Flash는 9달러입니다.

다만 가격이 곧 품질을 의미하지는 않습니다. 전환 전에는 자체 평가 세트로 정확성, 지연 시간, 출력 형식 준수 여부를 확인하세요. 무료 경로가 필요하다면 GPT-5.6을 무료로 사용하는 방법을 참조하세요.

가격 인하가 자동으로 적용되나요?

예. 새 요금은 2026년 7월 30일부터 표준 API 사용에 자동 적용되며 코드 변경은 필요하지 않습니다.

단, Sol에서 Priority Processing을 사용 중이라면 Fast 모드 전환을 위한 구성 변경이 필요합니다.

이번 주에 할 일

이번 주에는 다음 순서로 진행하세요.

  1. 새 요금으로 비용 모델을 다시 계산합니다.
  2. Luna가 흡수할 수 있는 Sol 또는 Terra 워크로드를 식별합니다.
  3. Terra의 20% 인하가 현재 라우팅 임계값을 바꾸는지 확인합니다.
  4. 실제 프로덕션 프롬프트로 세 모델을 비교합니다.
  5. usage 데이터를 수집해 예상 비용이 아닌 실제 비용으로 판단합니다.
  6. Priority Processing 사용 중이라면 Sol Fast 모드 마이그레이션 계획을 세웁니다.

정가표만으로 결정하지 마세요. Apidog에서 하나의 테스트 시나리오와 세 가지 모델 ID를 준비하고, usage 수치로 가격 인하가 실제 워크로드에 얼마나 큰 영향을 주는지 확인하세요.

Top comments (0)