DEV Community

Cover image for Kimi K3 Yerelde Nasıl Çalıştırılır (ve Hangi Durumlarda Kaçınılmalı)
Tobias Hoffmann
Tobias Hoffmann

Posted on • Originally published at apidog.com

Kimi K3 Yerelde Nasıl Çalıştırılır (ve Hangi Durumlarda Kaçınılmalı)

Moonshot AI, Kimi K3'ün açık ağırlıklarını 27 Temmuz'da yayınladı ve Hugging Face'teki indirme sayacı şimdiden 100.000'e yaklaştı. Vaat açık: Moonshot'un yayınladığı her kıyaslamada Claude Opus 4.8'i yenen 2,8 trilyon parametreli bir model ve artık onu kendiniz barındırabilirsiniz.

Apidog'u bugün deneyin

Sayıları incelediğinizde sorun da açıkça ortaya çıkıyor. Tam hassasiyetli çıkarım için 1,57 TB disk alanı gerekiyor. Yayınlanan MXFP4 ağırlıkları bile 594 GB'lık bir indirme. Bu, sahip olabileceğiniz bir model; ancak bu ölçekte “yerel” kavramı, 8B Llama için olduğundan farklı bir anlama geliyor.

Bu kılavuz; K3'ü kendi donanımınızda çalıştırmak için gerekenleri, topluluğun tüketici makinelerinde neleri başardığını ve hizmet vermeye başladığında kendi barındırdığınız K3 uç noktasını Apidog ile API iş akışınıza nasıl bağlayacağınızı kapsar.

Ne indiriyorsunuz?

Önce modelin yapısını netleştirin. Ayrıntılı geçmiş için Kimi K3 Nedir? yazısıyla başlayabilirsiniz. Kısa sürüm:

  • Toplam 2,8T parametre, token başına 104B aktif parametre: K3, 896 uzmana sahip bir Uzman Karışımı (Mixture-of-Experts, MoE) modelidir. Her token, 16 seçilmiş uzman ve 2 paylaşılan uzman üzerinden yönlendirilir. Bu nedenle token başına hesaplama maliyeti, toplam parametre sayısından düşüktür.
  • 93 katman: 69 Kimi Delta Attention (KDA) katmanı ve 24 Gated MLA katmanı bulunur. KDA tasarımı, 1 milyon tokenlık bağlam penceresini mümkün kılan temel unsurlardan biridir.
  • Doğal görme desteği: 401M parametreli MoonViT-V2 kodlayıcısı üzerinden metin, görsel ve video girdilerini işler.
  • MXFP4 ağırlıkları ve MXFP8 aktivasyonları: Moonshot, niceleme farkındalıklı eğitim (quantization-aware training) kullandı. Bu nedenle 4 bit sürüm sonradan eklenmiş bir alternatif değil, amaçlanan servis formatıdır. Ek düşük bit niceleme için baş payı sınırlıdır.
  • Yalnızca düşünme modu: K3, düşük, yüksek ve maksimum çaba seviyeleriyle yanıt üretmeden önce mantık yürütür. Anında yanıt modu yoktur.

Ağırlıklar, Hugging Face deposundaki Kimi K3 Lisansı'nın arkasında kilitlidir. Lisansı kabul ettikten sonra huggingface-cli ile indirin. 1 Gbps bağlantıda 594 GB indirme için yaklaşık 80–90 dakika planlayın.

Seçenek 1: vLLM veya SGLang ile veri merkezi sınıfı hizmet sunumu

Moonshot üç motor önerir: vLLM, SGLang ve TokenSpeed. KDA prefill-cache katkıları ağırlıklarla birlikte vLLM'e eklendiğinden, vLLM en düşük sürtünmeli başlangıç yoludur.

vllm serve moonshotai/Kimi-K3 \
  --tensor-parallel-size 8 \
  --max-model-len 131072
Enter fullscreen mode Exit fullscreen mode

Başlangıç yapılandırması için şu noktaları uygulayın:

  • Donanımı doğru boyutlandırın. Moonshot değerlendirmelerini H20 kümelerinde yaptı. Gerçekçi başlangıç noktası, tensor parallelism için en az 8 GPU'lu bir düğümdür. B200 sınıfı donanımda saniyede 100 token üzeri verim elde edilebilir.
  • Bağlam uzunluğunu sınırlı başlatın. Model 1.048.576 tokene kadar destekler; ancak tam bağlamda yalnızca KV önbelleği yaklaşık 27 GB tüketir. Önce --max-model-len 131072 ile başlayın. İş yükünüz gerektiriyorsa değeri artırın.
  • Örnekleme varsayılanlarını koruyun. Moonshot'un varsayılanları temperature=1.0 ve top_p=0.95 değerleridir. Agentic iş yüklerinde sıcaklığı 1.0 tutup top_p değerini 1.0 yapabilirsiniz.

Bu yaklaşım, veri egemenliği açısından yereldir: altyapı, günlükler ve uyumluluk süreci sizin kontrolünüzdedir. Ancak dizüstü bilgisayar anlamında yerel değildir. Hiçbir niceleme seviyesi, bu modeli etkileşimli kullanım için sıradan bir bilgisayara uygun hâle getirmez.

Seçenek 2: Büyük bir iş istasyonunda GGUF nicelemeleri

Unsloth, llama.cpp kullanıcıları için GGUF dönüşümleri yayınladı. Dinamik nicelemeler, K3'ü resmî sürüm boyutunun altına indirmenin en gerçekçi yoludur.

Niceleme Boyut Ne anlama geliyor
UD-IQ1_M ~345 GB Taban seviye. Agresif 1 bit dinamik niceleme.
UD-IQ1_S ~650 GB Unsloth'un önerdiği denge noktası.
UD-Q4_K_XL ~1,55 TB Tama yakın hassasiyet.
UD-Q8_K_XL ~1,6 TB Etkili olarak kayıpsız.

Pratik kural: Toplam RAM ve VRAM kapasiteniz, kabaca seçtiğiniz niceleme boyutuna eşit olmalıdır. Kapasite yetersizse llama.cpp offloading ile yine çalışabilir; ancak bellekte olmayan her gigabayt ciddi hız kaybı oluşturur.

128 GB bellekli bir Mac Studio veya DGX Station, pratik alt sınır olarak düşünülebilir.

Görsel projektör dahil minimal bir llama.cpp çağrısı:

./llama.cpp/llama-cli \
  --model unsloth/Kimi-K3-GGUF/UD-IQ1_S/Kimi-K3-UD-IQ1_M-00001-of-00015.gguf \
  --mmproj unsloth/Kimi-K3-GGUF/mmproj-F16.gguf \
  --temp 1.0 \
  --top-p 0.95
Enter fullscreen mode Exit fullscreen mode

Donanımınız bu seviyenin altındaysa zorlamayın. 2026'nın en iyi yerel LLM'leri listesinde 24–128 GB belleğe sığan ve gerçek zamanlı yanıt verebilen açık modeller bulunur. Yetersiz RAM üzerinde 1 bit K3 ile aynı deneyimi elde edemezsiniz.

M1 Max deneyi: Evet, ama token başına 16 saniye

Bir Hacker News başlığı, K3'ün 64 GB M1 Max üzerinde çalıştırıldığını belgeledi. Kurulum, ağırlıkları bellekte tutmak yerine 2 TB SSD'den akışla aktarıyor.

Bu deneyin neden teknik olarak mümkün ama pratikte kullanışsız olduğunu sayılar gösteriyor:

  • K3, her tokenın dokunduğu yaklaşık 115 GB yoğun parametre ve token başına yaklaşık 25 GB yönlendirilmiş uzman ağırlığı taşır. Yoğun bölüm tek başına makinenin RAM kapasitesini aşar; bu nedenle SSD yavaş bellek gibi kullanılır.
  • Sonuç yaklaşık token başına 16 saniyedir. Bazı yapılandırmalarda token başına bir dakikadan uzun süreler bildirildi.
  • Disk aktarım hızı kritik faktördür. M1 dönemindeki SSD'ler güncel Apple Silicon cihazlarından daha yavaş okur. Uzman ağırlıklarını ağ üzerinden aktarmak ise daha da yavaştır.

Bu sonuç, MoE seyrekliğinin ve mmap yaklaşımının 2,8T parametreli bir modeli dizüstü bilgisayarda teknik olarak çalıştırabildiğini gösteren ilginç bir kanıttır. Ancak K3'ü günlük kullanımda çalıştırmanın uygun yolu değildir.

MacBook üzerinde K3 yanıtları istiyorsanız, ücretsiz katmanlar veya barındırılan API daha iyi bir seçenek olacaktır.

Yerel K3'ünüzü API iş akışına bağlama

İster vLLM ister llama.cpp'nin sunucu modunu kullanın, sonuç aynıdır: localhost üzerinde OpenAI uyumlu bir HTTP uç noktası.

Bu noktadan sonra kurulum, diğer API'ler gibi ele alınabilir. Yerel LLM'leri API olarak test etme iş akışını uygulayın:

  1. Apidog ortamını yerel uç noktaya bağlayın. base_url değerini vLLM varsayılanı olan http://localhost:8000/v1 olarak ayarlayın. Aynı değişkeni daha sonra Moonshot'un barındırılan uç noktasıyla değiştirebilirsiniz. Böylece aynı istekleri iki farklı arka uçta çalıştırabilirsiniz.

  2. Düşünme akışını inceleyin. K3 düşünme odaklıdır; yanıtlar, nihai çıktıdan önce muhakeme içeriği taşıyabilir. Apidog SSE hata ayıklama görünümü, akışı geldiği anda işler. Bu sayede muhakeme çabası seviyelerinin çıktıyı nasıl değiştirdiğini izleyebilirsiniz.

  3. Çıktı yapısını otomatik doğrulayın. Yanıt şeması, gecikme bütçesi ve token kullanımını doğrulayan testler ekleyin. Böylece çıktı kalitesini etkileyen niceleme değişiklikleri veya motor yükseltmeleri kullanıcı raporundan önce başarısız test olarak görünür.

  4. GPU'lar yüklenirken K3 yanıtlarını taklit edin. 594 GB'lık bir modelin yüklenmesi zaman alır. Gerçek yanıtları bir kez kaydedin ve bir taklit sunucudan döndürün. Böylece ön uç geliştirmesi çıkarım sunucusunu beklemez. Bunu ücretsiz kurmak için Apidog'u indirin. Taklit ve test araçları, OpenAI uyumlu herhangi bir sunucuyla çalışır.

İstek biçimi, Kimi K3 API kılavuzundaki biçimle aynıdır. Bu nedenle barındırılan API için yazdığınız testleri doğrudan yerel dağıtımınıza taşıyabilirsiniz.

Peki, yerel olarak çalıştırmalı mısınız?

Durumunuz Öneri
8+ GPU düğümü, veri egemenliği veya uyumluluk ihtiyacı Evet. Tensor parallelism ile vLLM ve MXFP4 ağırlıklarını kullanın.
350 GB+ RAM/VRAM'li iş istasyonu Çalıştırılabilir. Unsloth 1 bit GGUF'leri deneyin, ancak beklentileri düşük tutun.
64–128 GB Mac veya PC Hayır. Saniye başına token yerine token başına saniye alırsınız.
Sadece ürününüzde K3 kullanmak istiyorsanız Barındırılan API'yi kullanın; OpenAI ve Anthropic uyumludur.

Dürüst özet: K3'ün açık ağırlıkları önemlidir; çünkü sınır sınıfı bir modeli denetleyebilir, ince ayar yapabilir ve kendi altyapınızda barındırabilirsiniz. Bu, herkesin modeli yerel olarak çalıştırması gerektiği anlamına gelmez.

Donanıma sahip ekipler için vLLM yolu bugün çalışır ve iyi performans verir. Diğer kullanıcılar için açık sürümün değeri; daha ucuz barındırılan erişim ve modeli sunmak için rekabet eden üçüncü taraf sağlayıcılar aracılığıyla ortaya çıkar.

Hangi seçeneği kullanırsanız kullanın, kritik nokta uç noktanın kodunuzla buluştuğu yerdir. Uç noktayı bir model bileşeni gibi test edin: şema kontrolleri ekleyin, akışı inceleyin ve model düşünürken geliştirmeyi sürdürmek için taklit yanıtlar kullanın.

Top comments (0)