Alibaba merilis Qwen 3.8-Max pada awal Agustus 2026. Sejak itu, hasil pencarian dipenuhi klaim “gratis selamanya” yang tidak sesuai dengan ketentuan resmi. Artikel ini merangkum opsi yang benar-benar tersedia berdasarkan halaman Alibaba per 3 Agustus 2026.
Ada empat jalur yang perlu dipertimbangkan. Dua sudah berfungsi hari ini, satu masih berupa janji dengan tanggal perkiraan, dan satu lagi adalah alternatif menggunakan model Qwen generasi sebelumnya. Untuk konteks model—2,4 triliun total parameter, 95B parameter aktif, dan konteks 1 juta token—baca ikhtisar Qwen 3.8 terlebih dahulu.
Peta opsi akses gratis
| Jalur | Gratis? | Berfungsi hari ini? | Kekurangan |
|---|---|---|---|
| Qwen Chat | Ya | Ya | Aplikasi konsumen, tanpa API |
| Kuota API Model Studio | 1 juta token | Ya | Hanya wilayah Singapura, berlaku 90 hari |
| Bobot terbuka (self-host) | Bobot gratis | Belum | Dijanjikan “minggu depan”; perangkat keras tidak gratis |
| Model Qwen lama | Ya | Ya | Bukan Qwen 3.8 |
Jalur 1: Qwen Chat untuk mencoba tanpa penyiapan
Cara tercepat untuk mencoba Qwen 3.8-Max adalah melalui Qwen Chat:
- Buka Qwen Chat dan masuk.
- Pilih Qwen 3.8-Max.
- Kirim prompt, gambar, atau dokumen untuk menguji kapabilitas model.
Pos rilis resmi menunjuk Qwen Chat sebagai cara default untuk mencoba model tersebut.
Yang Anda dapatkan:
- Akses gratis ke model unggulan melalui antarmuka chat.
- Dukungan pemahaman gambar dan dokumen seperti yang digunakan dalam demo peluncuran.
- Tidak perlu kartu pembayaran atau konsol cloud.
Yang tidak Anda dapatkan:
- Tidak ada API key.
- Tidak ada otomatisasi.
- Tidak ada integrasi langsung ke aplikasi, agen, atau suite pengujian.
- Perilaku chat tidak selalu identik dengan API mentah karena aplikasi menerapkan system prompt dan pengaturannya sendiri.
Kesimpulan: gunakan Qwen Chat untuk eksplorasi cepat dan validasi manual. Jangan gunakan hasilnya sebagai satu-satunya benchmark API untuk produk Anda.
Jalur 2: kuota gratis Model Studio
Untuk penggunaan programatis, Alibaba Cloud Model Studio menyediakan kuota gratis 1 juta token bagi aktivasi baru untuk model qwen3.8-max.
Kuota ini cukup untuk evaluasi awal, tetapi ada beberapa batas penting yang perlu Anda konfigurasi sejak awal.
1. Gunakan endpoint wilayah Singapura
Kuota gratis hanya berlaku di wilayah Singapura (internasional). Gunakan base URL berikut:
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Jika Anda mengarah ke endpoint Beijing atau US-Virginia, penggunaan akan ditagihkan sejak token pertama. Jadi, sebelum menjalankan skrip atau CI, pastikan environment Anda benar-benar memakai endpoint Singapura.
2. Kuota berlaku 90 hari
Kuota berlaku selama 90 hari sejak aktivasi.
Token yang tidak digunakan tidak akan diakumulasikan dan akan kedaluwarsa. Aktifkan kuota ketika Anda siap melakukan evaluasi, bukan jauh sebelum proyek dimulai.
3. Setelah kuota habis, API menjadi berbayar
Setelah kuota habis atau kedaluwarsa, tarifnya adalah:
- $2 per 1 juta token input
- $6 per 1 juta token output
Tarif ini berlaku di seluruh konteks 1 juta token tanpa tier tambahan. Tetap atur peringatan penagihan sebelum mengaktifkan workload berulang, terutama jika Anda menjalankan evaluasi otomatis atau agen.
Rincian biaya untuk skenario penggunaan nyata tersedia dalam panduan harga Qwen 3.8.
Langkah setup API
- Buat akun di Model Studio.
- Aktifkan layanan Model Studio.
- Buat API key.
- Simpan key sebagai variabel lingkungan:
export DASHSCOPE_API_KEY="your_api_key"
- Pastikan model yang dipilih adalah
qwen3.8-max.
Katalog model mencantumkan qwen3.8-max pada bagian model yang direkomendasikan.
Endpoint mendukung protokol yang kompatibel dengan OpenAI dan juga endpoint yang kompatibel dengan Anthropic. Untuk implementasi streaming dan output penalaran, lihat panduan API Qwen 3.8.
Contoh permintaan menggunakan endpoint kompatibel OpenAI:
curl https://dashscope-intl.aliyuncs.com/compatible-mode/v1/chat/completions \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{
"role": "user",
"content": "Jelaskan cara membuat endpoint health check di Node.js."
}
],
"reasoning_effort": "low"
}'
Verifikasi nama parameter dan format request terhadap dokumentasi Model Studio sebelum memasukkannya ke production.
Jebakan kuota: reasoning_effort aktif di xhigh
Qwen 3.8-Max dikirimkan dengan reasoning_effort bernilai xhigh. Token penalaran ditagih sebagai token output.
Akibatnya, satu prompt kompleks dapat menghasilkan ribuan token penalaran sebelum jawaban final mulai dikirim. Pada akun berbayar, ini meningkatkan biaya. Pada kuota gratis 1 juta token, ini dapat memangkas masa evaluasi secara signifikan.
Gunakan level yang lebih rendah untuk tugas rutin:
{
"reasoning_effort": "low"
}
Atau, jika tugas membutuhkan analisis lebih dalam:
{
"reasoning_effort": "medium"
}
Simpan xhigh hanya untuk tugas yang benar-benar membutuhkan penalaran intensif.
Cara memaksimalkan 1 juta token
Beberapa kebiasaan berikut membantu memperpanjang masa evaluasi:
- Validasi request sebelum memasukkannya ke loop aplikasi. Buat dan uji request satu per satu di Apidog, lalu periksa parameter, header, dan respons streaming sebelum menjalankan otomatisasi.
- Simpan respons contoh sebagai mock. Setelah memahami struktur respons, gunakan mock untuk pengembangan frontend atau agen. Anda tidak perlu memanggil model langsung pada setiap iterasi UI.
- Pantau token per request. Periksa informasi penggunaan token di setiap respons dan hitung burn rate berdasarkan input, output, serta token penalaran.
- Pisahkan environment. Simpan URL dasar Singapura, Beijing, dan AS sebagai environment berbeda agar tidak salah mengirim request ke endpoint berbayar.
- Batasi retry otomatis. Retry tanpa batas dapat menghabiskan kuota lebih cepat daripada request utama Anda.
Unduh Apidog secara gratis jika Anda ingin menguji request, menyimpan environment, memantau respons, dan membuat mock dalam satu workflow.
Kesimpulan: ini adalah jalur pengembang terbaik saat ini, selama Anda memakai wilayah Singapura dan menyelesaikan evaluasi dalam 90 hari.
Jalur 3: bobot terbuka, dijanjikan tetapi belum tersedia
Kabar penting bagi pengguna yang mencari akses gratis: Qwen 3.8-Max disebut sebagai model kelas Qwen-Max pertama dengan bobot terbuka.
Alibaba mengatakan bobot akan tersedia di Hugging Face dan ModelScope “minggu depan”, sekitar 10 Agustus.
Namun, per 3 Agustus 2026:
- Bobot belum dapat diunduh.
- Belum ada artefak yang dapat dikuantisasi.
- Belum ada setup lokal yang dapat dijalankan.
- Tutorial yang mengklaim Qwen 3.8 sudah dapat dijalankan lokal perlu diperlakukan dengan skeptis jika dipublikasikan sebelum bobot tersedia.
Sebagai pembanding, Kimi K3 juga menjanjikan bobot terbuka saat peluncuran dan mengirimkannya 11 hari kemudian. Jadwal tersebut masuk akal, tetapi bobot Qwen 3.8-Max belum tersedia pada saat artikel ini ditulis.
Realita self-host
“Bobot gratis” tidak berarti “inferensi gratis”.
Qwen 3.8-Max memiliki total 2,4 triliun parameter. Preseden terdekat adalah Kimi K3, model 2,8T parameter yang tersedia sebagai bobot sekitar 594 GB bahkan dengan kuantisasi MXFP4 agresif.
Dengan skala tersebut, Qwen 3.8-Max tetap akan membutuhkan:
- Ratusan gigabyte bobot.
- Konfigurasi serving multi-GPU.
- Kemungkinan setup multi-node.
- Infrastruktur GPU server, bukan GPU konsumen atau laptop.
Tidak ada GPU konsumen tunggal yang realistis untuk menampung model ini. Tidak ada workstation tunggal yang menjadi target praktis untuk deployment penuh.
Untuk gambaran kebutuhan hardware kelas ini, lihat panduan menjalankan Kimi K3 secara lokal.
Manfaat utama bobot terbuka kemungkinan besar adalah munculnya penyedia hosting pihak ketiga. Setelah bobot tersedia, kompetisi antarpenyedia dapat menurunkan harga hosting dibandingkan tarif pihak pertama.
Bagi sebagian besar developer, “bobot terbuka gratis” lebih realistis berarti akses API hosted yang lebih murah, bukan menjalankan model 2,4T di laptop.
Kesimpulan: belum tersedia. Periksa kembali pada pertengahan Agustus dan siapkan anggaran hosting, bukan anggaran untuk workstation tunggal.
Jalur 4: model Qwen lama sebagai alternatif gratis
Jika kebutuhan Anda adalah model Qwen yang kompeten tanpa biaya, bukan Qwen 3.8-Max secara spesifik, model generasi sebelumnya memiliki opsi yang lebih langsung.
Model Qwen berbobot terbuka dengan ukuran lebih kecil sudah dapat dijalankan pada perangkat keras yang lebih umum. Beberapa jalur akses gratis untuk jajaran model sebelumnya juga tidak memiliki masa berlaku 90 hari.
Lihat panduan menggunakan Qwen 3.7 secara gratis untuk opsi yang masih relevan.
Pertukarannya jelas: Anda tidak mendapatkan peningkatan benchmark yang membuat Qwen 3.8-Max menjadi berita. Namun, untuk proyek sampingan, klasifikasi, prototyping, atau mempelajari bentuk API Qwen, model lama sering kali sudah cukup.
Yang belum tersedia
Per 3 Agustus 2026, berikut yang tidak tersedia:
- Tidak ada API gratis tanpa batas. Batasnya adalah 1 juta token dan kuota akan kedaluwarsa.
- Tidak ada kuota gratis di luar Singapura. Endpoint Beijing dan US-Virginia ditagih sejak token pertama.
- Belum ada bobot Qwen 3.8-Max yang dapat diunduh. “Minggu depan” adalah janji, bukan tautan unduhan.
- Tidak ada akses resmi Qwen 3.8-Max gratis melalui agregator pihak ketiga. Akses hosted pihak ketiga kemungkinan baru muncul setelah bobot dirilis.
FAQ
Apakah API Qwen 3.8 benar-benar gratis?
Sebagian. Alibaba Cloud Model Studio menyediakan 1 juta token gratis yang berlaku 90 hari dan hanya untuk wilayah Singapura. Setelah itu, tarifnya adalah $2 per juta token input dan $6 per juta token output.
Bisakah saya mengunduh dan menjalankan Qwen 3.8 secara lokal sekarang?
Tidak. Bobot dijanjikan tersedia di Hugging Face dan ModelScope sekitar 10 Agustus 2026, tetapi belum dirilis pada saat artikel ini ditulis. Saat tersedia, rencanakan kebutuhan ratusan gigabyte bobot dan serving multi-GPU.
Apa perbedaannya dengan opsi gratis Kimi K3?
Bobot Kimi K3 sudah tersedia sehingga jalur self-host-nya nyata hari ini. Qwen 3.8-Max masih menunggu rilis bobot. Namun, keduanya terlalu besar untuk perangkat keras konsumen.
Untuk membandingkan jalurnya, lihat panduan menggunakan Kimi K3 secara gratis.
Apakah kuota gratis mencakup token penalaran?
Ya. Token penalaran dihitung sebagai output dan dapat menguras kuota dengan cepat. Karena reasoning_effort default adalah xhigh, turunkan nilainya untuk request rutin.
Intinya
Akses gratis Qwen 3.8 memang ada, tetapi sangat spesifik:
- Gunakan Qwen Chat untuk mencoba model secara manual.
- Gunakan 1 juta token Model Studio di Singapura untuk evaluasi API selama 90 hari.
- Tunggu rilis bobot terbuka jika Anda ingin melihat opsi hosting pihak ketiga.
- Gunakan model Qwen lama jika Anda membutuhkan opsi gratis yang tersedia sekarang.
Jika memilih jalur API, gunakan kuota untuk evaluasi yang bermakna, bukan debugging berulang. Buat prototipe request di Apidog, mock respons saat membangun integrasi, lalu gunakan endpoint langsung hanya untuk verifikasi dan evaluasi final.

Top comments (0)