OpenAI API'ına token başına para ödemek yerine, açık kaynak dil modellerini (Llama 3, DeepSeek, Mistral, Qwen) kendi sunucunda çalıştırabilirsin. Verin dışarı çıkmaz, sabit maliyet, sınırsız istek. Bu yazıda Ollama ile pratik kurulumu ve gereken donanımı anlatıyorum.
Neden self-hosting?
- Veri gizliliği: İstemlerin üçüncü taraf buluta gitmez. KVKK kapsamındaki projeler için kritik.
- Maliyet: Yoğun kullanımda token faturası yerine sabit sunucu kirası.
- Kontrol: Model seçimi, fine-tuning, sistem entegrasyonu tamamen sende.
Donanım: ne kadar VRAM lazım?
Belirleyici olan GPU'nun VRAM'i:
| Model boyutu | Önerilen VRAM |
|---|---|
| 7-8B (Llama 3 8B, Mistral 7B) | 6-8 GB (4-bit) |
| 13-14B | 10-16 GB |
| 30-34B | 24 GB |
| 70B+ | 40 GB+ / çoklu GPU |
Türkiye'de düşük gecikmeli, RTX ekran kartlı bir GPU sunucu ile başlamak istersen Vulut GPU sunucuları NVMe + Ryzen ile bu iş için hazır geliyor.
Kurulum (Ubuntu)
# 1. Ollama kur
curl -fsSL https://ollama.com/install.sh | sh
# 2. Bir model indir ve çalıştır
ollama run llama3
# veya
ollama run deepseek-r1
# 3. REST API otomatik olarak açılır:
curl http://localhost:11434/api/generate -d '{
"model": "llama3",
"prompt": "Merhaba, nasılsın?"
}'
Dışarıdan güvenli erişim için önüne Nginx reverse proxy + SSL koy ve 11434'ü sadece kendi IP'ne aç.
Hangi model?
- Llama 3 (8B): genel amaçlı, Türkçe dahil çok dilli, güvenli başlangıç.
- DeepSeek-R1: akıl yürütme ve kod.
- Mistral/Mixtral: hız/verimlilik.
- Qwen: çok dilli + uzun bağlam.
Kendi sunucunda hepsini ücretsiz test edip karşılaştırabilirsin, bulut API'da her deneme para demek.
Bulut API mı, self-hosting mi?
Düşük/ara sıra kullanım → bulut API pratik. Yoğun, sürekli kullanım + veri gizliliği → kendi GPU sunucun daha ekonomik ve güvenli. Detaylı maliyet/gizlilik karşılaştırmasını bu rehberde yazdım.
Sunucunun gerçek performansını ölçmek istersen açık kaynak vulut-bench scriptini kullanabilir, ya da tarayıcıdan hız testi yapabilirsin.
Top comments (1)
Ollama ile yerel yapay zeka kurulumunun pratik olması gerçekten dikkat çekici, özellikle KVKK kapsamındaki projeler için veri gizliliği söz konusu olduğunda self-hosting bir çözüm sunuyor. Belirtilen donanım gereksinimleri ve önerilen VRAM miktarları, özellikle büyük model boyutlarına sahip projelerde crucial görünüyor. Llama 3 ve DeepSeek modellerinin karşılaştırılması da ilginç, özellikle akıl yürütme ve kodlama yetenekleri açısından DeepSeek-R1'in performansı nasıl oluyor? Kullanıcıların bu modelleri kendi sunucularında test etmeleri ve karşılaştırmaları gerçekten maliyet ve performans açısından faydalı olabilir.