Sebagian besar peluncuran model menggambarkan kemampuan pengodean dengan cara yang sama: inilah skor HumanEval kami, inilah cuplikan model yang menulis pencarian biner. Alibaba mengambil rute yang berbeda dengan Qwen 3.8-Max. Klaimnya bukan “ini menulis fungsi yang bagus.” Klaimnya adalah bahwa ia dapat menjalankan proyek perangkat lunak sendiri selama berminggu-minggu: membuka masalah, menggabungkan pull request, dan mengirimkan fitur tanpa campur tangan manusia.
Itu adalah klaim yang berani, dan patut dicermati. Artikel ini membahas tiga pameran pengodean yang diterbitkan Alibaba saat peluncuran—semuanya demo vendor, salah satunya memiliki repo publik yang dapat Anda audit—angka benchmark pengodean di baliknya, lalu bagian praktisnya: cara mengode dengan qwen3.8-max di Claude Code, Codex, Qoder, Qwen Code, dan OpenClaw, serta cara menguji output API yang dihasilkan kode Anda.
Jika Anda baru mengenal model ini, mulailah dengan gambaran umum tentang apa itu Qwen 3.8: total 2.4T parameter, 95B aktif, jendela konteks 1M token, dan bobot terbuka yang dijanjikan seminggu setelah peluncuran. Di sini, fokusnya tetap pada pengodean. Semua informasi di bawah mencerminkan keadaan per 3 Agustus 2026.
Apa yang Sebenarnya Diklaim Alibaba
Pembingkaian dalam postingan rilis resmi Qwen 3.8 adalah otonomi, bukan sekadar cuplikan. Alibaba memposisikan Qwen 3.8-Max sebagai model yang dapat menangani tugas rekayasa jangka panjang: merencanakan pekerjaan, menjalankannya selama berhari-hari, pulih dari kesalahannya sendiri, dan menghasilkan output yang dapat ditinjau pada akhirnya.
Tiga hal membuat klaim ini lebih menarik daripada pemasaran hari peluncuran biasa:
- Demo-nya panjang. Enam belas hari adalah rezim yang berbeda dari benchmark agen 20 menit. Pemulihan kesalahan, manajemen konteks, dan pergeseran prioritas jauh lebih penting pada skala tersebut.
- Satu demo bersifat publik. Anda dapat menelusuri repo, membaca commit, dan menilai kualitas kode sendiri. Sebagian besar pameran vendor tidak menawarkan hal itu.
- Harness-nya milik pesaing. Alibaba menjalankan sebagian besar benchmark pengodean menggunakan harness Claude Code, lalu menerbitkan konfigurasi resmi agar Anda dapat mereproduksi setup tersebut.
Peringatan standar berlaku untuk seluruh artikel ini: setiap angka berasal dari materi peluncuran Alibaba sendiri. Belum ada verifikasi independen hingga awal Agustus 2026. Perlakukan pameran ini sebagai demo, bukan audit.
Tiga Pameran Pengodean
oh-my-cli: 16 Hari Pengembangan Otonom
Ini adalah demo utama. Alibaba membiarkan Qwen 3.8-Max membangun alat baris perintah dan menjalankannya tanpa pengawasan. Hingga 30 Juli, proses tersebut telah berjalan selama 16 hari dan menghasilkan:
- 265 commit
- 127 pull request
- 151 masalah
Semua pekerjaan tersebut diklaim dibuka, dikerjakan, dan ditutup oleh model itu sendiri.
Repo-nya bersifat publik di qwen-code-dev-bot/oh-my-cli. Ini adalah bagian paling berguna dari seluruh pameran karena Anda tidak perlu mempercayai angka commit begitu saja. Audit langsung repo tersebut dengan langkah berikut:
- Baca deskripsi PR dan masalah yang dirujuk.
- Periksa apakah perubahan benar-benar menyelesaikan masalah.
- Cari masalah atau PR yang tampak artifisial hanya untuk ditutup.
- Telusuri commit setelah regresi untuk melihat bagaimana model memperbaiki kesalahannya sendiri.
- Jalankan proyek secara lokal jika instruksi repo memungkinkan.
Pola ini memberi Anda sinyal yang lebih berguna tentang keandalan jangka panjang daripada satu skor benchmark.
Proses Reproduksi Makalah: Kode Penelitian, Bukan Kode Aplikasi
Demo kedua menargetkan kelas pengodean yang lebih sulit: mereproduksi makalah penelitian machine learning dari awal. Menurut angka Alibaba, proses tersebut:
- Memakan waktu sekitar 125 jam
- Menghasilkan sekitar 7.600 baris kode
- Menjalankan 33 putaran pelatihan GPU
Hasilnya, model tersebut mereproduksi enam temuan makalah, lalu mengalahkan hasil yang dilaporkan makalah sebesar 2,7 poin pada AIME24.
Reproduksi penelitian adalah pekerjaan yang berat. Lingkungan bisa rusak, hiperparameter dapat tersembunyi di catatan kaki, dan satu bug diam dapat membatalkan proses pelatihan yang baru diketahui beberapa jam kemudian. Model yang mampu menjalani 33 putaran pelatihan dan menghasilkan angka yang cocok melakukan sesuatu di luar pelengkapan otomatis biasa.
Demo ini selaras dengan benchmark terkuat Qwen 3.8-Max: PaperBench.
Kontes Tianchi: 24 Jam Melawan Tim Manusia
Pameran ketiga menempatkan model dalam kompetisi ilmu data langsung di platform Tianchi Alibaba dengan batas waktu 24 jam. Model tersebut melakukan 45 submisi, mengulang pendekatannya berdasarkan hasil sebelumnya, dan berakhir dengan akurasi 0.853.
Hasil itu menempatkannya di depan 458 dari 526 tim manusia yang bersaing.
Perhatikan bentuk hasilnya: model tidak menang, tetapi mengalahkan sekitar 87% peserta. Ini menunjukkan kemampuan yang tidak ditampilkan dua demo lainnya: iterasi cepat di bawah tenggat waktu, saat skor setiap submisi menjadi masukan untuk percobaan berikutnya.
Tetap ada peringatan penting: Tianchi adalah platform milik Alibaba. Demo ini nyata, tetapi vendor juga mengontrol tempat pelaksanaannya.
Benchmark Pengodean di Balik Demo
Alibaba menerbitkan tabel benchmark lengkap saat peluncuran. Berikut baris yang paling relevan untuk pengodean. Semua angka adalah hasil pengujian Alibaba sendiri.
| Benchmark | Qwen 3.8-Max | Pesaing Terbaik (berdasarkan tabel Alibaba) |
|---|---|---|
| Terminal Bench 2.1 | 86.6 | 88.8 (GPT-5.6 Sol) |
| SWE-bench Pro | 67.7 | 80.0 (Fable 5) |
| PaperBench | 93.0 | 90.5 (GPT-5.6 Sol) |
Tiga poin yang perlu diperhatikan:
-
Terminal Bench 2.1 (86.6): Menempatkan Qwen 3.8-Max di depan Claude Opus 4.8 dan Fable 5, yang masing-masing mencetak 84.6 dalam tabel Alibaba. Angka ini mendukung demo
oh-my-cli. - SWE-bench Pro (67.7): Ini adalah kelemahan yang cukup jelas. Fable 5 mencetak 80.0 pada tabel yang sama. Untuk perbaikan bug skala repositori—skenario yang paling dekat dengan “perbaiki masalah ini di codebase saya”—Qwen 3.8-Max tertinggal lebih dari 12 poin dari pemimpin.
- PaperBench (93.0): Ini adalah baris unggulan terkuat model, mengalahkan semua model dalam kumpulan perbandingan Alibaba. Hasil ini mendukung demo reproduksi makalah.
Detail yang mudah terlewat: Alibaba menjalankan sebagian besar benchmark pengodean menggunakan harness Claude Code, termasuk untuk model pesaing. Catatan kaki tabel juga menunjukkan bahwa hasil Fable 5 mungkin melibatkan fallback.
Pilihan harness dapat memengaruhi skor benchmark agentik secara material. Jadi, tabel vendor yang berjalan pada harness tertentu adalah satu titik data, bukan keputusan akhir.
Namun, detail Claude Code juga praktis: Alibaba mengoptimalkan model ini untuk harness yang mungkin sudah Anda gunakan dan menerbitkan konfigurasi resminya.
Cara Mengode dengan Qwen 3.8 Hari Ini
Qwen 3.8-Max sudah GA di Alibaba Cloud Model Studio. Alibaba menerbitkan konfigurasi resmi untuk lima alat pengodean saat peluncuran.
Anda memerlukan kunci API DashScope dari home.qwencloud.com. Berdasarkan halaman harga resmi Model Studio, harganya adalah:
- $2 per juta token masukan
- $6 per juta token keluaran
- Harga tetap untuk seluruh konteks 1M token
Claude Code
Qwen 3.8-Max menyediakan endpoint API yang kompatibel dengan Anthropic. Konfigurasikan Claude Code dengan tiga variabel lingkungan berikut:
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=kunci-api-dashscope-anda
export ANTHROPIC_MODEL=qwen3.8-max
Lalu jalankan Claude Code seperti biasa.
claude
Setiap permintaan akan diarahkan ke Qwen 3.8-Max, bukan Claude. Karena Alibaba menjalankan benchmark pengodeannya pada harness ini, setup tersebut adalah cara paling dekat untuk mencoba lingkungan yang mereka ukur.
Sebelum menjalankan sesi agentik pada repo penting, lakukan langkah dasar berikut:
- Gunakan branch terpisah.
- Batasi akses kredensial dan file
.env. - Mulai dari tugas kecil yang dapat diverifikasi.
- Tinjau diff sebelum menerapkan perubahan.
- Jalankan test suite setelah setiap tugas besar.
Codex
Codex membutuhkan entri penyedia model dalam konfigurasi. Berikut sketsa dari dokumen resmi:
model = "qwen3.8-max"
model_provider = "qwencloud"
[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
Kemudian ekspor kunci API Anda:
export DASHSCOPE_API_KEY=kunci-api-dashscope-anda
Konfigurasi ini menggunakan endpoint yang kompatibel dengan OpenAI, bukan endpoint Anthropic. Model dan kuncinya sama; format protokolnya yang berbeda.
Qoder, Qwen Code, dan OpenClaw
Tiga alat lainnya dapat dikonfigurasikan lebih cepat:
-
Qoder CLI: Pilih
qwen3.8-maxsebagai model. Ini adalah integrasi pihak pertama, sehingga setup dilakukan melalui nilai konfigurasi. -
Qwen Code: Atur
DASHSCOPE_API_KEY, lalu pilih modelqwen3.8-max. Jika Anda sudah memakai Qwen Code dengan model Qwen sebelumnya, tidak banyak yang berubah. -
OpenClaw: Konfigurasi resmi menetapkan ID model dan
maxTokenssebesar65536, yang juga merupakan batas output maksimum model.
Selalu ambil konfigurasi terbaru dari postingan peluncuran resmi, bukan dari tangkapan layar atau konfigurasi lama di blog.
Atur Upaya Penalaran dengan Sengaja
Qwen 3.8-Max mendukung parameter reasoning_effort dengan tiga tingkat:
-
xhigh— default mediumlow
Untuk pengodean, gunakan parameter ini berdasarkan jenis pekerjaan.
Gunakan xhigh untuk pekerjaan agentik:
- Refaktor multi-file
- Debugging yang membutuhkan investigasi
- Implementasi fitur dengan banyak dependensi
- Tugas yang perlu perencanaan sebelum pengeditan
- Analisis codebase besar
Gunakan low untuk perubahan mekanis:
- Mengganti nama variabel
- Menambahkan atau memperbarui docstring
- Mengubah format sederhana
- Memperbarui path impor
- Edit yang ruang lingkupnya jelas
Token “berpikir” ditagih sebagai token keluaran dengan tarif $6 per juta token. Karena xhigh adalah default, sesi agentik panjang dapat menghasilkan biaya nyata. Hindari menjalankan edit mekanis pada xhigh jika tidak membutuhkan penalaran mendalam.
Jika Qwen 3.8-Max lebih besar dari kebutuhan Anda, lini Qwen3 Coder masih tersedia untuk pekerjaan pengodean khusus, sementara Qwen3 Coder Flash menargetkan kebutuhan yang cepat dan lebih murah. Untuk model bobot terbuka besar lainnya, lihat bagaimana Kimi K3 menangani pekerjaan pengodean.
Menguji Apa yang Dibangun Model: Langkah Apidog
Ada celah dalam setiap demo pengodean otonom, termasuk milik Alibaba: model dapat menulis kode yang memanggil API, tetapi panggilan API tersebut tetap perlu diverifikasi.
Agen dapat menghasilkan ribuan baris kode yang berhasil dikompilasi, tetapi masih mungkin:
- Memanggil endpoint yang salah
- Salah menangani respons
429 - Mengirim payload yang gagal validasi
- Melewatkan header otorisasi
- Salah memproses respons error
- Mengirim mutasi ke lingkungan produksi
Dua kebiasaan berikut membantu menutup celah tersebut.
Uji Endpoint yang Dipanggil Kode Hasil Generate
Saat Qwen 3.8-Max membuat kerangka layanan atau klien API, impor spesifikasi yang relevan ke Apidog, lalu jalankan endpoint secara langsung.
Uji setidaknya:
- Alur autentikasi.
- Respons error
4xxdan5xx. - Payload kosong atau tidak valid.
- Nilai batas dan kasus ekstrem.
- Pagination dan rate limit.
- Timeout serta retry.
- Respons streaming, jika digunakan.
Lebih murah menemukan asumsi yang salah dalam pengujian manual atau otomatis daripada dalam stack trace dua hari setelah sesi agentik berjalan.
Jika Anda ingin mengevaluasi API model sebelum menggunakannya, panduan API Qwen 3.8 membahas setup protokol OpenAI dan Anthropic secara lebih rinci. Apidog dapat membantu memeriksa kedua bentuk protokol secara berdampingan, termasuk respons streaming dan delta penalaran.
Gunakan Mock API agar Agen Tidak Menyentuh Produksi
Hal ini semakin penting saat proses agentik berjalan lebih lama. Sesi otonom selama 16 hari yang melakukan panggilan langsung ke infrastruktur produksi adalah risiko besar:
- Batas kecepatan dapat habis.
- Data dapat berubah tanpa sengaja.
- Biaya API dapat meningkat tak terduga.
- Agen dapat menguji alur berbahaya terhadap sistem nyata.
Gunakan server mock di Apidog untuk memberi respons realistis tanpa menyentuh sistem produksi.
Pola implementasinya sederhana:
- Buat mock endpoint dari spesifikasi API.
- Arahkan
BASE_URLaplikasi ke URL mock selama proses agentik. - Biarkan agen menulis dan menguji integrasi terhadap respons mock.
- Tinjau kode, test, dan perubahan konfigurasi secara manual.
- Ganti
BASE_URLke endpoint staging. - Jalankan integration test sebelum menggunakan endpoint produksi.
Anda dapat mengunduh Apidog secara gratis untuk menyiapkan mock dalam beberapa menit. Untuk proses agen tanpa pengawasan, ini adalah salah satu lapisan perlindungan paling murah.
Prinsipnya sederhana: semakin banyak otonomi yang Anda berikan kepada model pengodean, semakin penting API menjadi permukaan kendali. Anda mungkin tidak dapat meninjau setiap commit secara real-time, tetapi Anda dapat mengontrol sistem mana yang diizinkan menerima komunikasi dari kode tersebut.
Pertanyaan yang Sering Diajukan
Apakah Qwen 3.8 Bagus untuk Pengodean?
Berdasarkan angka Alibaba sendiri, model ini kuat untuk pengodean agentik dan gaya penelitian:
- Terminal Bench 2.1: 86.6
- PaperBench: 93.0
Namun, untuk perbaikan bug skala repositori, hasilnya berada di tengah:
- SWE-bench Pro: 67.7
- Fable 5 pada tabel yang sama: 80.0
Semua angka tersebut adalah hasil pengujian vendor dan belum memiliki verifikasi independen hingga saat ini. Pembacaan yang jujur: Qwen 3.8-Max tampak kuat untuk pekerjaan otonom jangka panjang, tetapi bukan pemimpin untuk perbaikan masalah klasik pada codebase.
Bisakah Saya Menggunakan Qwen 3.8 di Claude Code?
Ya, secara resmi. Atur variabel berikut:
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=kunci-api-dashscope-anda
export ANTHROPIC_MODEL=qwen3.8-max
Alibaba menerbitkan konfigurasi ini dan menjalankan sebagian besar benchmark pengodeannya pada harness Claude Code.
Berapa Biaya Pengodean dengan Qwen 3.8?
Harganya adalah:
- $2 per juta token masukan
- $6 per juta token keluaran
- Harga tetap di seluruh konteks 1M token
Token “berpikir” ditagih sebagai token keluaran. Karena reasoning_effort=xhigh adalah default dan dapat menghasilkan banyak token penalaran, anggarkan biaya lebih tinggi untuk sesi agentik panjang.
Untuk perhitungan biaya dan perbandingan lebih lanjut, lihat rincian benchmark Qwen 3.8 serta liputan harga yang terhubung di sana.
Apakah Proses oh-my-cli Selama 16 Hari Benar-benar Otonom?
Itu adalah klaim Alibaba. Tidak seperti sebagian besar demo vendor, Anda dapat memeriksa artefaknya sendiri: repo publik qwen-code-dev-bot/oh-my-cli mencatat 265 commit, 127 PR, dan 151 masalah per 30 Juli 2026.
Apakah kualitas kode tersebut membenarkan pembingkaian “otonom” adalah penilaian yang perlu Anda buat sendiri dengan mengaudit repo, membaca PR, dan menjalankan proyeknya. Justru keterbukaan artefak ini yang membuat pamerannya lebih kredibel daripada sekadar tangkapan layar.



Top comments (0)