DEV Community

Cover image for Qwen 3.8 Kodlama için: 16 Günlük Otonom Çalışmalar ve Claude Kod Entegrasyonu
Tobias Hoffmann
Tobias Hoffmann

Posted on • Originally published at apidog.com

Qwen 3.8 Kodlama için: 16 Günlük Otonom Çalışmalar ve Claude Kod Entegrasyonu

Çoğu model lansmanı kodlama yeteneğini HumanEval puanları veya basit algoritma örnekleriyle gösterir. Alibaba ise Qwen 3.8-Max için farklı bir iddia öne sürüyor: modelin haftalar süren bir yazılım projesini planlayabilmesi, sorun açabilmesi, pull request birleştirebilmesi ve insan müdahalesi olmadan özellik gönderebilmesi.

Apidog'u bugün deneyin

Bu yazıda Alibaba'nın yayınladığı üç kodlama demosunu, arkasındaki kıyaslama sonuçlarını ve qwen3.8-max modelini Claude Code, Codex, Qoder, Qwen Code ve OpenClaw ile kullanmak için gereken yapılandırmaları ele alacağız. Ayrıca modelin ürettiği API kodunu nasıl test edip güvenli şekilde doğrulayabileceğinizi göreceksiniz.

Model hakkında genel bir başlangıç için Qwen 3.8 nedir? yazısına bakabilirsiniz: toplam 2.4T parametre, 95B aktif parametre ve 1M token bağlam penceresi sunuluyor. Bu makale kodlama kullanımına odaklanır. Bilgiler 3 Ağustos 2026 itibarıyla geçerlidir.

Alibaba'nın Aslında İddia Ettiği Şey

Resmi Qwen 3.8 sürüm gönderisinde, model yalnızca kod parçası üreten bir araç olarak değil; uzun süreli mühendislik görevlerini planlayan, yürüten, hatalardan toparlanan ve incelenebilir çıktı üreten bir ajan olarak konumlandırılıyor.

Qwen 3.8-Max kodlama yetenekleri

Bu iddiayı ilginç yapan üç nokta var:

  1. Demolar uzun sürüyor. On altı günlük çalışma; hata kurtarma, bağlam yönetimi ve görev sapması gibi ajan davranışlarını kısa benchmark koşularından daha iyi görünür kılıyor.
  2. Bir demo herkese açık. Commit'leri, sorunları ve pull request'leri doğrudan inceleyebilirsiniz.
  3. Claude Code deney düzeneği kullanılmış. Alibaba, kıyaslamalarının çoğunu Claude Code üzerinden çalıştırdığını ve yapılandırmayı paylaştığını belirtiyor.

Buradaki tüm skorlar ve demo sonuçları Alibaba'nın kendi lansman materyallerinden gelir. Ağustos 2026 başı itibarıyla bağımsız doğrulama yoktur. Sonuçları kesin hüküm yerine satıcı demoları olarak değerlendirin.

Üç Kodlama Tanıtımı

oh-my-cli: 16 Günlük Otonom Geliştirme

Alibaba'nın öne çıkan demosunda Qwen 3.8-Max, bir komut satırı aracı geliştirmek üzere çalıştırıldı. 30 Temmuz itibarıyla çalışma 16 gün sürmüş; modelin açtığı, üzerinde çalıştığı ve kapattığı işler kapsamında şu çıktılar oluşmuş:

  • 265 commit
  • 127 pull request
  • 151 sorun

Depo herkese açık: qwen-code-dev-bot/oh-my-cli.

Bu depoyu değerlendirirken yalnızca commit sayısına bakmayın. Şunları kontrol edin:

  • PR gerçekten ilişkilendirildiği sorunu çözüyor mu?
  • Sorunlar gerçek ihtiyaçlardan mı oluşuyor, yoksa aktivite üretmek için mi açılmış?
  • Model regresyonları nasıl ele alıyor?
  • Testler, hata senaryoları ve dokümantasyon değişiklikle uyumlu mu?
  • Commit'ler anlamlı ve geri alınabilir mi?

Uzun süreli ajan değerlendirmelerinde bu inceleme, tek bir benchmark skorundan daha fazla bilgi sağlar.

Makale Çoğaltma Çalışması: Araştırma Kodu

İkinci demo, sıfırdan bir makine öğrenimi araştırma makalesini çoğaltmaya odaklanıyor. Alibaba'nın verilerine göre çalışma:

  • Yaklaşık 125 saat sürdü
  • Yaklaşık 7.600 satır kod üretti
  • 33 GPU eğitim turu gerçekleştirdi

Makale çoğaltma demosu

Alibaba'ya göre model, makaledeki 6 bulguyu çoğalttı ve AIME24 için raporlanan sonucu 2.7 puan geçti.

Araştırma kodunda başarısızlık noktaları genellikle farklıdır:

  • Eksik veya belirsiz hiperparametreler
  • Bozulan eğitim ortamları
  • Sessiz veri işleme hataları
  • Yanlış metrik uygulamaları
  • Saatler sonra fark edilen geçersiz eğitim koşuları

Bu nedenle 33 eğitim turu sonunda eşleşen sonuçlar elde edildiği iddiası, basit kod tamamlama senaryolarından daha iddialıdır. Bu demo, aşağıda yer alan PaperBench sonucu ile de uyumludur.

Tianchi Yarışması: İnsan Ekiplerine Karşı 24 Saat

Üçüncü demo, Qwen 3.8-Max'i Alibaba'nın Tianchi platformundaki canlı bir veri bilimi yarışmasına yerleştiriyor. Modelin 24 saat içinde:

  • 45 gönderim yaptığı,
  • her sonuçtan sonra yaklaşımını yinelediği,
  • 0.853 doğruluk skoruna ulaştığı,
  • 526 insan ekibinin 458'ini geçtiği

belirtiliyor.

Tianchi yarışması sonucu

Model yarışmayı kazanmadı; ancak katılımcıların yaklaşık %87'sini geçti. Bu demo, özellikle geri bildirim döngüsü içeren işler için dikkat çekici: her gönderimin skoru, sonraki denemenin yönünü belirliyor.

Buradaki önemli uyarı şu: Tianchi Alibaba'nın kendi platformu. Demo gerçek olabilir, ancak ortam satıcının kontrolünde.

Demoların Arkasındaki Kodlama Kıyaslamaları

Alibaba'nın yayınladığı tabloda kodlama ile ilgili üç temel satır bulunuyor:

Kıyaslama Qwen 3.8-Max En iyi rakip — Alibaba'nın tablosuna göre
Terminal Bench 2.1 86.6 88.8 — GPT-5.6 Sol
SWE-bench Pro 67.7 80.0 — Fable 5
PaperBench 93.0 90.5 — GPT-5.6 Sol

Bu sonuçları kullanırken görev türüne göre karar verin:

  • Terminal Bench 2.1: 86.6

    Terminal tabanlı ajan görevlerinde güçlü bir sonuç. Alibaba'nın tablosunda Claude Opus 4.8 ve Fable 5'in 84.6 skorunun üzerinde. oh-my-cli demosuyla en doğrudan ilişkili metrik bu.

  • SWE-bench Pro: 67.7

    Depo ölçekli hata düzeltmede lider değil. Aynı tabloda Fable 5'in 80.0 aldığı belirtiliyor. “Bu kod tabanındaki hatayı bul ve düzelt” türü işler ana kullanım alanınızsa, bu farkı kendi deponuzda test etmelisiniz.

  • PaperBench: 93.0

    Alibaba'nın en güçlü kodlama sonucu. Araştırma kodu ve makale çoğaltma demosunu destekleyen benchmark olarak sunuluyor.

Kritik ayrıntı: Alibaba, rakip modeller dahil olmak üzere birçok kodlama benchmark'ını Claude Code deney düzeneğiyle çalıştırdığını belirtiyor. Ajan benchmark'larında kullanılan araç zinciri, istemci davranışı ve prompt düzeni sonuçları etkileyebilir. Bu nedenle tabloyu tek bir veri noktası olarak ele alın.

Bugün Qwen 3.8 ile Nasıl Kod Yazılır?

Qwen 3.8-Max, Alibaba Cloud Model Studio üzerinden genel kullanıma açık olarak sunuluyor. Başlamak için home.qwencloud.com üzerinden bir DashScope API anahtarına ihtiyacınız var.

Resmi Model Studio fiyatlandırmasına göre:

  • 1 milyon giriş tokeni: 2 ABD Doları
  • 1 milyon çıktı tokeni: 6 ABD Doları

Fiyatlar 1M bağlam boyunca sabit olarak belirtiliyor. Ayrıntılar için resmi Model Studio fiyatlandırma sayfasına bakın.

Claude Code

Claude Code'u Qwen 3.8-Max'e yönlendirmek için Anthropic uyumlu uç noktayı kullanın:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

Ardından Claude Code'u normal şekilde başlatın.

Bu yaklaşım, Alibaba'nın kıyaslamalarında kullandığını belirttiği deney düzeneğine en yakın kurulumdur. İlk denemenizi küçük ve doğrulanabilir bir görevle yapın:

1. Bu depodaki testleri çalıştır.
2. Başarısız testleri sınıflandır.
3. Önce çözüm planını çıkar.
4. Yalnızca ilgili dosyalarda değişiklik yap.
5. Testleri tekrar çalıştır ve sonuçları özetle.
Enter fullscreen mode Exit fullscreen mode

Codex

Codex için sağlayıcı tanımını yapılandırma dosyanıza ekleyin:

model = "qwen3.8-max"
model_provider = "qwencloud"

[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
Enter fullscreen mode Exit fullscreen mode

Ardından API anahtarını ortam değişkeni olarak ayarlayın:

export DASHSCOPE_API_KEY=your-dashscope-api-key
Enter fullscreen mode Exit fullscreen mode

Bu kurulum Anthropic yerine OpenAI uyumlu uç noktayı kullanır.

Qoder, Qwen Code ve OpenClaw

Diğer resmi seçenekler için temel kurulum yaklaşımı şöyledir:

  • Qoder CLI: Model olarak qwen3.8-max seçin. Alibaba'nın birinci taraf ajan kodlama aracı olduğu için kurulum bir model seçimiyle tamamlanır.
  • Qwen Code: DASHSCOPE_API_KEY ortam değişkenini ayarlayın ve qwen3.8-max modelini seçin.
  • OpenClaw: Resmi yapılandırmada model kimliği ile birlikte maxTokens değeri 65536 olarak ayarlanır.

Tam ve güncel yapılandırmalar için lansman gönderisindeki resmi talimatları tercih edin.

reasoning_effort Ayarını Göreve Göre Seçin

Qwen 3.8-Max şu reasoning_effort seviyelerini destekler:

  • xhigh — varsayılan
  • medium
  • low

Kodlama işlerinde bu parametreyi görevin karmaşıklığına göre seçin.

Görev türü Önerilen ayar
Çok dosyalı refactor xhigh
Karmaşık hata ayıklama xhigh
Planlama gerektiren ajan görevi xhigh
Basit yeniden adlandırma low
Docstring veya format güncellemesi low
Mekanik kod dönüşümleri low

Örneğin, yalnızca isim değiştiren bir görev için xhigh kullanmak maliyeti artırabilir. Düşünme tokenleri çıktı tokeni olarak ücretlendirilir; yani milyon token başına 6 ABD Doları fiyatlandırmasına dahildir.

Qwen 3.8-Max göreviniz için gereğinden büyükse, özel kodlama işleri için Qwen3 Coder serisini veya daha hızlı seçenek için Qwen3 Coder Flash modelini değerlendirebilirsiniz. Alternatif açık ağırlıklı seçeneklerden biri için Kimi K3'ün kodlama yaklaşımına bakın.

Modelin Oluşturduklarını Test Etme: Apidog Adımı

Bir kodlama ajanının kod üretmesi, ürettiği API çağrılarının doğru olduğu anlamına gelmez. Kod derlenebilir; ancak yine de:

  • yanlış uç noktaya istek atabilir,
  • 429 Too Many Requests yanıtlarını yanlış işleyebilir,
  • hatalı istek gövdesi gönderebilir,
  • yetkilendirme akışında başarısız olabilir,
  • üretim verisini beklenmedik şekilde değiştirebilir.

Bu riski azaltmak için iki uygulamayı çalışma akışınıza ekleyin.

1. Üretilen Kodun Çağırdığı Uç Noktaları Test Edin

Qwen 3.8-Max bir API istemcisi veya servis iskeleti oluşturduğunda, ilgili API spesifikasyonunu Apidog'a aktarın ve uç noktaları doğrudan çalıştırın.

Kontrol listeniz şunları içermeli:

  • Başarılı istekler
  • Yetkilendirme hataları
  • Geçersiz istek gövdeleri
  • Eksik zorunlu alanlar
  • Sınır değerler
  • Sayfalama davranışı
  • Hız limiti yanıtları
  • Timeout ve ağ hataları

Modelin API kullanımını değerlendirmek istiyorsanız, Qwen 3.8 API kılavuzu hem OpenAI hem Anthropic uyumlu kurulumları kapsar. Apidog ile iki protokol biçimini, akış yanıtlarını ve muhakeme davranışlarını yan yana test edebilirsiniz.

2. Uzun Ajan Çalışmalarında Gerçek API Yerine Mock Kullanın

Uzun süre çalışan ajanları doğrudan üretim API'lerine bağlamayın. Bu yaklaşım şunlara yol açabilir:

  • Beklenmeyen hız limiti tüketimi
  • Gerçek verinin değiştirilmesi
  • Tekrarlanan çağrılardan doğan maliyetler
  • Hatalı entegrasyonların üretime ulaşması

Apidog mock sunucuları ile ajanınıza gerçekçi API yanıtları sağlayabilirsiniz.

Önerilen akış:

  1. API spesifikasyonunuzu Apidog'a aktarın.
  2. Gerekli başarı ve hata yanıtları için mock örnekleri oluşturun.
  3. Ajanın temel URL'sini mock sunucu URL'sine yönlendirin.
  4. Ajanın ürettiği kodu ve test sonuçlarını inceleyin.
  5. İnsan incelemesinden sonra gerçek temel URL'ye geçin.

Mock sunucuyu birkaç dakikada kurmak için Apidog'u ücretsiz indirin.

Kodlama modeline verdiğiniz özerklik arttıkça, API katmanı daha önemli bir kontrol yüzeyi haline gelir. Her commit'i anlık inceleyemeyebilirsiniz; ancak kodun hangi servislerle konuşabileceğini ve hangi yanıtları alacağını kontrol edebilirsiniz.

Sıkça Sorulan Sorular

Qwen 3.8 kodlama için iyi mi?

Alibaba'nın yayınladığı verilere göre model, ajan tabanlı ve araştırma odaklı kodlama görevlerinde güçlü sonuçlar gösteriyor:

  • Terminal Bench 2.1: 86.6
  • PaperBench: 93.0

Depo ölçekli hata düzeltmede ise SWE-bench Pro skoru 67.7; aynı tabloda Fable 5 için 80.0 belirtiliyor.

Pratik yorum: uzun vadeli otonom görevler ve araştırma tarzı çalışmalar için dikkat çekici; klasik repository hata düzeltmede lider olduğu henüz gösterilmiş değil. Sonuçlar satıcı tarafından yayınlandığı için kendi kod tabanınızda doğrulama yapın.

Qwen 3.8'i Claude Code'da kullanabilir miyim?

Evet. Şu değişkenleri ayarlayın:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

Alibaba bu yapılandırmayı resmi olarak yayınladı ve kodlama benchmark'larının çoğunu Claude Code deney düzeneğiyle çalıştırdığını belirtti.

Qwen 3.8 ile kodlama ne kadara mal olur?

Belirtilen fiyatlandırma:

  • 1 milyon giriş tokeni: 2 ABD Doları
  • 1 milyon çıktı tokeni: 6 ABD Doları

Düşünme tokenleri çıktı tokeni olarak ücretlendirilir. Varsayılan xhigh muhakeme seviyesi daha fazla çıktı tokeni üretebileceğinden, uzun ajan oturumları için ek bütçe planlayın.

Karşılaştırmalı maliyet bilgileri için Qwen 3.8 benchmark analizi yazısına bakabilirsiniz.

16 günlük oh-my-cli çalışması gerçekten otonom muydu?

Bu, Alibaba'nın iddiasıdır. Ancak çoğu satıcı demosundan farklı olarak çıktıyı doğrudan inceleyebilirsiniz: qwen-code-dev-bot/oh-my-cli deposu, 30 Temmuz 2026 itibarıyla 265 commit, 127 PR ve 151 sorun içeriyor.

Gerçek değerlendirme için depoyu klonlayın, PR'ları inceleyin, testleri çalıştırın ve değişikliklerin sorunları gerçekten çözüp çözmediğini kontrol edin.

Top comments (0)