DEV Community

Cover image for 키미 K3 가격: API 비용과 캐시 적중률 계산법
Rihpig
Rihpig

Posted on • Originally published at apidog.com

키미 K3 가격: API 비용과 캐시 적중률 계산법

Kimi K3는 2026년 7월 16일에 출시되었습니다. 가격표는 단순해 보이지만, 입력 가격이 캐시-히트와 캐시-미스로 나뉘기 때문에 실제 비용 계산은 조금 더 복잡합니다. Moonshot AI는 캐시-히트 입력에 백만 토큰당 $0.30, 캐시-미스 입력에 $3.00, 출력에 $15.00를 책정합니다. 월별 청구서를 결정하는 핵심은 공시 입력 단가가 아니라 실제 캐시-히트율을 반영한 혼합 입력 요율입니다. 특히 반복적인 컨텍스트를 사용하는 코딩 작업에서는 이 요율이 $3.00보다 $0.30 계층에 훨씬 가까워질 수 있습니다. 이 글에서는 혼합 비용을 계산하는 방법, 에이전트 코딩 작업의 실제 비용 예시, Claude Opus 4.8·GPT-5.6 Sol·DeepSeek V4와의 가격 비교 방법을 다룹니다.

지금 Apidog을 사용해 보세요

요약

Kimi K3의 가격은 다음과 같습니다.

  • 캐시-히트 입력: 백만 토큰당 $0.30
  • 캐시-미스 입력: 백만 토큰당 $3.00
  • 출력: 백만 토큰당 $15.00

Moonshot은 Mooncake의 분산 추론 아키텍처를 통해 모델을 제공하며, 코딩 작업 부하에서 90% 이상의 캐시-히트율을 보고했습니다. 이 수치가 실제 워크로드에서도 유지된다면 입력 비용은 $3.00보다 $0.30에 가까워집니다.

실무에서는 다음 두 가지가 중요합니다.

  1. 시스템 프롬프트, 도구 스키마, 저장소 컨텍스트처럼 반복되는 접두사를 안정적으로 유지해 캐시 적중률을 높입니다.
  2. 출력 토큰은 캐시할 수 없으므로, 응답 길이와 max_tokens를 관리합니다.

모델을 테스트할 때는 Apidog에서 응답별 토큰 사용량을 확인해 캐시-히트 비율을 직접 측정할 수 있습니다.

공시 가격표

Moonshot이 kimi-k3 모델에 게시한 가격은 다음과 같습니다.

토큰 유형 백만 토큰당 가격
캐시-히트 입력 $0.30
캐시-미스 입력 $3.00
출력 $15.00

세 가지 가격 차이가 비용 구조의 핵심입니다.

  • 캐시-미스 입력은 캐시-히트 입력보다 10배 비쌉니다.
  • 출력은 캐시-미스 입력보다 5배 비쌉니다.
  • 출력은 캐시-히트 입력보다 50배 비쌉니다.

따라서 모든 입력 토큰이 $3.00로 과금된다고 가정하면 입력 비용을 과대평가할 수 있습니다. 반대로 출력 비용이 작다고 보면 실제 지출의 큰 부분을 놓칠 수 있습니다.

모델 특성과 현재 모델 환경은 Kimi K3 설명서를 참고하세요. 기본 URL, 요청 설정, SDK 연결 방법은 Kimi K3 API 가이드에서 확인할 수 있습니다.

Kimi K3 가격 관련 이미지

왜 캐시-히트 계층이 계산을 바꾸는가

프롬프트 캐싱은 표시된 가격과 실제 비용의 차이를 만듭니다.

요청을 보내면 제공자는 프롬프트의 토큰화된 접두사를 저장합니다. 다음 요청이 같은 접두사를 재사용하면 모델은 해당 토큰을 다시 처리하지 않고 캐시에서 읽습니다. 재사용된 토큰은 캐시-미스 요율이 아니라 캐시-히트 요율로 과금됩니다.

Moonshot은 Kimi K3에 Mooncake의 분산 추론 아키텍처를 사용합니다. 프리필(prefill)과 디코드(decode) 단계를 분리해 캐시된 접두사를 재사용할 수 있도록 설계된 구조입니다.

Moonshot이 보고한 코딩 작업 부하의 캐시-히트율 90%를 적용하면, 백만 입력 토큰의 혼합 요율은 다음과 같습니다.

캐시-히트 비용 = 0.90 × $0.30 = $0.27
캐시-미스 비용 = 0.10 × $3.00 = $0.30

혼합 입력 요율 = $0.27 + $0.30 = $0.57 / 1M 토큰
Enter fullscreen mode Exit fullscreen mode

즉, 캐시-히트율이 90%라면 실질 입력 비용은 백만 토큰당 약 $0.57입니다.

캐시-히트율별 혼합 입력 요율도 간단히 계산할 수 있습니다.

혼합 입력 요율 =
(캐시-히트율 × $0.30) +
((1 - 캐시-히트율) × $3.00)
Enter fullscreen mode Exit fullscreen mode

예를 들어 95% 적중률이면 다음과 같습니다.

0.95 × $0.30 + 0.05 × $3.00 = $0.435 / 1M 토큰
Enter fullscreen mode Exit fullscreen mode

다만 90%는 Moonshot이 코딩 작업 부하에 대해 보고한 수치입니다. 실제 적중률은 프롬프트 구조에 따라 달라집니다.

  • 동일한 저장소와 시스템 프롬프트를 반복 사용하는 코딩 에이전트: 적중률이 높아질 가능성이 큼
  • 매 요청마다 컨텍스트가 크게 바뀌는 채팅 서비스: 적중률이 낮아질 가능성이 큼
  • 도구 정의나 프롬프트 순서를 자주 바꾸는 워크플로: 캐시 재사용이 깨질 수 있음

따라서 보고된 비율만 믿기보다, 운영 트래픽에서 직접 측정해야 합니다.

비용 예시: 하나의 에이전트 코딩 작업

중간 규모 리포지토리에서 에이전트 코딩 세션을 실행한다고 가정해 보겠습니다.

세션 전체에서 다음 토큰을 사용합니다.

  • 입력: 2,000,000 토큰
  • 출력: 200,000 토큰

에이전트는 매 차례 컨텍스트를 다시 전송하는 경우가 많으므로 입력 토큰이 크게 늘어날 수 있습니다.

캐시가 전혀 없는 경우

입력 비용 = 2,000,000 × $3.00 / 1,000,000 = $6.00
출력 비용 =   200,000 × $15.00 / 1,000,000 = $3.00

총 비용 = $9.00
Enter fullscreen mode Exit fullscreen mode

입력의 90%가 캐시되는 경우

캐시-히트 입력 = 1,800,000 × $0.30 / 1,000,000 = $0.54
캐시-미스 입력 =   200,000 × $3.00 / 1,000,000 = $0.60

입력 소계 = $1.14

출력 비용 = 200,000 × $15.00 / 1,000,000 = $3.00

총 비용 = $4.14
Enter fullscreen mode Exit fullscreen mode
시나리오 입력 비용 출력 비용 총 비용
캐시 없음 $6.00 $3.00 $9.00
캐시-히트율 90% $1.14 $3.00 $4.14

캐싱은 입력 비용을 $6.00에서 $1.14로 줄이고, 전체 작업 비용을 $9.00에서 $4.14로 낮춥니다. 이 예시에서는 총비용이 약 54% 감소합니다.

중요한 점은 출력 비용이 변하지 않는다는 것입니다. 캐싱은 이미 처리한 입력 토큰을 재사용하는 기능이므로, 새로 생성하는 출력 토큰 비용에는 영향을 주지 않습니다.

입력은 저렴하고, 출력은 프리미엄입니다

Kimi K3의 비용을 줄이는 우선순위는 명확합니다.

출력은 백만 토큰당 $15.00으로 다음과 같습니다.

  • 캐시-히트 입력보다 50배 비쌈
  • 캐시-미스 입력보다 5배 비쌈

따라서 비용 최적화는 무작정 입력을 줄이는 것보다 출력 제어와 캐시 재사용에 집중해야 합니다.

효과적인 최적화 방법

  • 응답 형식을 제한하세요.

    “설명 없이 diff만 반환”, “세 줄 이내로 요약”, “JSON만 반환”처럼 필요한 출력 범위를 명확히 지정합니다.

  • max_tokens를 설정하세요.

    작업에 필요한 상한을 지정해 장황한 응답을 방지합니다.

  • 접두사를 바이트 단위로 안정적으로 유지하세요.

    시스템 프롬프트, 도구 스키마, 저장소 설명, 공통 컨텍스트의 순서와 내용을 매 요청마다 바꾸지 마세요.

  • 관련 작업을 같은 컨텍스트에서 처리하세요.

    매 요청마다 완전히 새로운 컨텍스트를 시작하기보다, 동일한 준비된 접두사 뒤에 관련 호출을 이어 붙이는 편이 캐시 재사용에 유리합니다.

예를 들어 OpenAI 스타일 API를 사용할 때 출력 제한은 다음처럼 적용할 수 있습니다.

const response = await client.chat.completions.create({
  model: "kimi-k3",
  messages: [
    {
      role: "system",
      content: "코드 리뷰를 수행하세요. 문제와 수정 diff만 간결하게 반환하세요."
    },
    {
      role: "user",
      content: "다음 변경 사항을 검토해 주세요: ..."
    }
  ],
  max_tokens: 800
});
Enter fullscreen mode Exit fullscreen mode

덜 효과적인 접근

캐시가 잘 작동하는 워크로드에서 비용 절감을 위해 유용한 입력 컨텍스트를 제거하는 방식은 주의해야 합니다.

입력은 캐시될 경우 이미 저렴합니다. 필요한 파일, 오류 로그, 도구 결과를 제거하면 모델이 추가 질문을 하거나 불완전한 답변을 생성할 수 있습니다. 결과적으로 출력이 길어지면 오히려 비용이 늘어날 수 있습니다.

Kimi K3에서는 다음 원칙이 더 적합합니다.

입력은 충분히 제공하되 재사용 가능하게 구성하고, 출력은 의도적으로 짧게 제한합니다.

가격 기준점: Kimi K3는 어떻게 비교되는가

경쟁 모델 가격은 변경될 수 있으므로, 실제 도입 전에는 항상 현재 요율을 확인해야 합니다.

모델 입력(백만 토큰당) 출력(백만 토큰당) 참고
Kimi K3 $0.30 캐시-히트 / $3.00 캐시-미스 $15.00 1M 컨텍스트, 7월 27일경 오픈 웨이트
Claude Opus 4.8 $5.00 $25.00 프리미엄 계층, 현재 가격 확인 필요
GPT-5.6 Sol 약 $5.00 약 $30.00 플래그십 계층, 더 저렴한 GPT-5.6 계층 존재
DeepSeek V4 가치 계층 가치 계층 현재 요율 확인 필요

Claude Opus 4.8과 비교

Claude Opus 4.8 가격을 기준으로 보면, Kimi K3는 공시 가격상 모든 항목에서 더 저렴합니다.

앞서 사용한 2M 입력·200K 출력 작업을 Claude Opus 4.8의 공시 가격으로 계산하면 다음과 같습니다.

입력 = 2,000,000 × $5.00 / 1,000,000 = $10.00
출력 =   200,000 × $25.00 / 1,000,000 = $5.00

총 비용 = 약 $15.00
Enter fullscreen mode Exit fullscreen mode

캐시-히트율 90%를 적용한 Kimi K3의 $4.14와 비교하면 차이가 큽니다.

다만 Anthropic도 자체 프롬프트 캐싱을 제공하므로, 이 비교는 방향성으로 해석해야 합니다. 실제 비용은 각 모델의 캐싱 정책과 워크로드의 프롬프트 구조를 함께 반영해 계산하세요.

GPT-5.6 Sol과 비교

GPT-5.6 가격 기준으로 GPT-5.6 Sol은 입력 약 $5.00, 출력 약 $30.00의 플래그십 계층입니다.

이 기준에서는 Kimi K3가 더 저렴합니다. 특히 캐시가 잘 작동하는 입력 중심 워크로드에서는 차이가 커질 수 있습니다.

다만 GPT-5.6에는 Terra 및 Luna처럼 더 저렴한 계층이 존재합니다. 필요한 기능 수준과 품질 절충이 허용된다면 해당 계층이 가격 경쟁력을 가질 수 있으므로, 실시간 가격과 작업 품질을 함께 비교해야 합니다.

DeepSeek V4와 비교

DeepSeek V4 가격과 비교하면 두 모델 모두 가치 지향적인 오픈 웨이트 계열 선택지로 볼 수 있습니다.

DeepSeek은 역사적으로 공격적인 가격 정책을 사용해 왔기 때문에 원시 출력 가격에서는 Kimi K3보다 저렴할 수 있습니다. 반면 Kimi K3는 1M 컨텍스트와 캐시-히트 입력 할인으로 대응합니다.

워크로드가 다음 조건에 가깝다면 Kimi K3의 비용 경쟁력이 커질 수 있습니다.

  • 입력 비중이 높음
  • 동일한 시스템 프롬프트와 도구 정의를 반복 사용함
  • 같은 저장소 컨텍스트를 여러 차례 재사용함
  • 캐시-히트율이 안정적으로 높음

Apidog으로 토큰 사용량 테스트하기

캐시 비용은 실제 사용량 객체를 확인할 때만 정확하게 계산할 수 있습니다.

Kimi K3 응답은 입력 토큰, 출력 토큰, 캐시-히트 부분을 포함하는 사용량 객체를 반환합니다. 이 데이터를 사용하면 보고된 평균값이 아니라 실제 트래픽의 혼합 입력 요율을 계산할 수 있습니다.

Apidog에서 Kimi K3 토큰 사용량을 확인하는 화면

Apidog에서 Kimi K3를 테스트하는 절차는 다음과 같습니다.

  1. Kimi K3 엔드포인트를 생성합니다.
  2. 기본 URL과 베어러 토큰을 설정합니다.
  3. 모델 ID에 kimi-k3를 입력합니다.
  4. 대표 프롬프트를 저장합니다.
  5. 동일한 요청을 두 번 이상 실행합니다.
  6. 각 응답의 사용량 객체에서 캐시-히트 토큰 수를 비교합니다.

Kimi K3는 OpenAI SDK와 호환되므로 OpenAI 스타일 API와 동일한 방식으로 구성할 수 있습니다.

curl https://YOUR_KIMI_ENDPOINT/v1/chat/completions \
  -H "Authorization: Bearer $KIMI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [
      {
        "role": "system",
        "content": "당신은 코드 리뷰어입니다. 답변은 간결하게 작성하세요."
      },
      {
        "role": "user",
        "content": "이 변경 사항의 문제를 찾아주세요: ..."
      }
    ],
    "max_tokens": 800
  }'
Enter fullscreen mode Exit fullscreen mode

동일한 요청을 반복하면 두 번째 요청 이후 캐시-히트 토큰 수가 증가하는지 확인할 수 있습니다. 이 값을 사용해 실제 혼합 입력 요율을 계산하세요.

캐시-히트율 = 캐시-히트 입력 토큰 / 전체 입력 토큰
Enter fullscreen mode Exit fullscreen mode

그다음 다음 공식에 대입합니다.

혼합 입력 요율 =
(캐시-히트율 × $0.30) +
((1 - 캐시-히트율) × $3.00)
Enter fullscreen mode Exit fullscreen mode

Apidog에서는 kimi-k3와 현재 사용 중인 모델에 대해 동일한 요청을 저장하고, 응답과 토큰 수를 나란히 비교할 수 있습니다. VS Code에서 테스트하려면 VS Code에서 Apidog을 실행하는 방법을 참고하세요. Apidog 다운로드 후 대표 요청 몇 개만 실행해도 비교를 시작할 수 있습니다.

솔직한 평가

Kimi K3의 가격 구조는 한 문장으로 정리할 수 있습니다.

입력은 저렴하고, 출력은 프리미엄입니다.

캐시-히트 입력은 백만 토큰당 $0.30입니다. Moonshot이 보고한 코딩 작업의 90% 이상 캐시-히트율이 실제 환경에서도 유지된다면, 입력 비용은 $3.00보다 하한선에 가까워집니다.

반면 출력은 백만 토큰당 $15.00이므로, 비용 최적화의 핵심은 프롬프트를 지나치게 줄이는 것이 아니라 응답을 제어하는 것입니다.

실무 체크리스트는 다음과 같습니다.

  • 시스템 프롬프트와 도구 정의를 고정합니다.
  • 공통 컨텍스트 블록의 순서를 바꾸지 않습니다.
  • 관련 작업을 동일한 접두사 아래에서 처리합니다.
  • max_tokens를 설정합니다.
  • 필요한 출력 형식을 구체적으로 지정합니다.
  • 사용량 객체를 기반으로 실제 캐시-히트율을 측정합니다.

Kimi K3는 Claude Opus 4.8보다 공시 가격이 낮고, GPT-5.6 Sol과 비교해도 가격 경쟁력이 있습니다. DeepSeek V4와는 워크로드의 입력 비중 및 캐시 효율에 따라 결과가 달라질 수 있습니다.

Moonshot은 Kimi K3가 Claude Fable 5 및 GPT-5.6 Sol보다 기능 면에서 뒤처진다고 평가하며, 가격 계층의 중간값보다 약간 느리게 실행된다고 설명합니다. 그러나 최첨단에 준하는 품질, 1M 컨텍스트, 캐시-히트 할인, 그리고 7월 27일경 예정된 오픈 웨이트 버전을 고려하면 특정 코딩 워크로드에서는 실용적인 선택지가 될 수 있습니다.

도입 전에는 Apidog을 다운로드하고 kimi-k3에 대표 요청을 실행하세요. 사용량 객체에서 캐시-히트 분할을 확인한 뒤, 자신의 트래픽 기준 혼합 요율로 비용을 계산하는 것이 가장 정확합니다.

자주 묻는 질문

Kimi K3 API 비용은 얼마인가요?

Moonshot의 직접 API에서 Kimi K3는 다음과 같이 과금됩니다.

  • 캐시-히트 입력: 백만 토큰당 $0.30
  • 캐시-미스 입력: 백만 토큰당 $3.00
  • 출력: 백만 토큰당 $15.00

OpenRouter와 같은 타사 목록에서는 별도 캐시-히트 계층 없이 입력 $3.00, 출력 $15.00를 표시할 수 있습니다. 요청 설정은 Kimi K3 API 가이드를 참고하세요.

캐시-히트율은 무엇이며 왜 중요한가요?

캐시-히트율은 전체 입력 중 이전 요청의 접두사를 재사용한 입력 토큰의 비율입니다.

캐시된 입력은 $3.00이 아니라 $0.30으로 과금되므로, 캐시-히트율은 실제 입력 비용을 크게 바꿉니다. Moonshot이 보고한 90% 적중률에서는 혼합 입력 비용이 백만 토큰당 약 $0.57입니다.

Kimi K3가 Claude Opus 4.8보다 저렴한가요?

공시 가격 기준으로는 그렇습니다.

Kimi K3의 출력은 백만 토큰당 $15.00이며, Claude Opus 4.8의 $25.00보다 낮습니다. 입력도 Kimi K3의 캐시-미스 가격 $3.00이 Opus의 $5.00보다 낮고, 캐시-히트 시에는 $0.30까지 내려갑니다.

2M 입력·200K 출력 예시에서 캐싱을 적용한 Kimi K3는 약 $4.14이며, Opus의 공시 가격 기준 비용은 약 $15.00입니다. 다만 Anthropic도 캐싱을 제공하므로 실제 비교 시에는 각 서비스의 현재 캐싱 정책을 확인하세요. Claude Opus 4.8 가격Kimi K3 vs Claude Opus 4.8 비교를 참고할 수 있습니다.

Kimi K3 가격은 GPT-5.6 및 DeepSeek V4와 어떻게 비교되나요?

Kimi K3는 플래그십 계층인 GPT-5.6 Sol보다 저렴합니다. GPT-5.6 Sol은 입력 약 $5.00, 출력 약 $30.00으로 언급됩니다.

다만 GPT-5.6에는 더 저렴한 Terra 및 Luna 계층이 있어, 필요한 기능 수준에 따라 더 낮은 비용으로 사용할 수 있습니다.

DeepSeek V4는 원시 출력 가격에서 Kimi K3보다 저렴할 수 있는 가치 계층 선택지입니다. 하지만 Kimi K3는 캐시-히트 입력 할인과 1M 컨텍스트를 제공하므로, 반복 입력이 많은 워크로드에서는 비용 차이가 줄어들거나 역전될 수 있습니다. 결정 전 GPT-5.6 가격DeepSeek V4 가격에서 현재 요율을 확인하세요.

Kimi K3 비용을 낮추려면 어떻게 해야 하나요?

입력 축소보다 출력 제어와 캐시 재사용에 집중하세요.

  • max_tokens를 제한합니다.
  • 간결한 응답 형식을 요청합니다.
  • 시스템 프롬프트와 컨텍스트 접두사를 안정적으로 유지합니다.
  • 도구 스키마와 공통 컨텍스트의 순서를 자주 변경하지 않습니다.
  • 실제 사용량 객체에서 캐시-히트율을 측정합니다.

캐시된 입력은 이미 저렴하므로, 비용 절감만을 위해 유용한 컨텍스트를 제거하면 모델 출력이 길어지거나 품질이 떨어질 수 있습니다.

실제 캐시-히트율을 어떻게 확인할 수 있나요?

Kimi K3 응답의 사용량 객체를 검사하세요. 이 객체에는 입력, 출력, 캐시-히트 토큰 수가 포함됩니다.

Apidog에서 같은 요청을 두 번 이상 실행하고 각 응답의 캐시-히트 토큰 수를 비교하면 캐싱 동작을 확인할 수 있습니다. 그 결과를 혼합 입력 요율 공식에 대입하면 실제 트래픽 기준 비용을 계산할 수 있습니다.

Top comments (0)