DEV Community

Cover image for Cara Menggunakan Qwen 3.8 API
Walse
Walse

Posted on • Originally published at apidog.com

Cara Menggunakan Qwen 3.8 API

Alibaba merilis Qwen 3.8-Max pada awal Agustus 2026 dan API-nya tersedia melalui Model Studio. Model ini memiliki 2,4T parameter total (95B aktif), jendela konteks 1 juta token, serta harga tetap $2 untuk input dan $6 untuk output per 1 juta token. Untuk memahami modelnya lebih dahulu, baca penjelasan Qwen 3.8. Artikel ini berfokus pada implementasi: membuat API key, memilih region, mengirim request pertama, streaming respons, dan menghubungkannya ke tooling yang sudah Anda gunakan.

Coba Apidog hari ini

Qwen 3.8-Max mendukung dua protokol sejak awal: endpoint kompatibel OpenAI dan endpoint kompatibel Anthropic. Artinya, Anda dapat memakai OpenAI SDK dengan perubahan minimal, atau mengarahkan Claude Code ke endpoint Qwen melalui variabel lingkungan. Anda juga dapat menguji kedua protokol tersebut di Apidog menggunakan prompt yang sama.

Apa yang Anda Butuhkan Sebelum Memulai

Gunakan referensi berikut sebelum mengirim request.

Item Nilai
ID model qwen3.8-max
Jendela konteks 1.000.000 token
Output maksimum 65.536 token
Tipe input Teks dan gambar
Harga $2 input / $6 output per 1M token, rata di seluruh konteks
Kontrol penalaran reasoning_effort: xhigh (default), medium, low
Protokol Chat Completions dan Responses OpenAI, Anthropic Messages
Variabel lingkungan DASHSCOPE_API_KEY

Informasi model Qwen 3.8-Max

Data ini merujuk pada postingan rilis resmi Qwen 3.8 dan dokumentasi Alibaba Cloud Model Studio. Alibaba menjanjikan bobot terbuka di Hugging Face dan ModelScope pada minggu berikutnya, tetapi hingga awal Agustus 2026 bobot tersebut belum tersedia untuk diunduh. Jadi, seluruh contoh di bawah menggunakan API yang di-host.

Langkah 1: Buat API Key

Buka home.qwencloud.com, masuk atau buat akun, lalu buat API key dari konsol.

Alibaba masih menggunakan nama DashScope secara internal. Simpan key sebagai variabel lingkungan DASHSCOPE_API_KEY:

export DASHSCOPE_API_KEY="sk-your-key-here"
Enter fullscreen mode Exit fullscreen mode

Jangan simpan key di source code atau commit ke repository. Pilihan yang umum:

  • Tambahkan ke profil shell seperti .zshrc atau .bashrc.
  • Simpan dalam file .env.
  • Kelola melalui secret manager di environment deployment Anda.

Jika ingin evaluasi tanpa biaya awal, akun baru mendapat kuota gratis 1 juta token selama 90 hari. Kuota ini hanya tersedia di region Singapura.

Langkah 2: Pilih Base URL Berdasarkan Region

Model Studio menyediakan endpoint kompatibel OpenAI di tiga region.

Region Base URL
Beijing https://dashscope.aliyuncs.com/compatible-mode/v1
Singapura https://dashscope-intl.aliyuncs.com/compatible-mode/v1
AS (Virginia) https://dashscope-us.aliyuncs.com/compatible-mode/v1

Untuk sebagian besar pengguna internasional, gunakan endpoint Singapura:

https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode

Region ini juga diperlukan jika Anda ingin menggunakan kuota gratis. Daftar model Model Studio mencantumkan bahwa qwen3.8-max mendukung pembuatan teks serta pemahaman gambar dan video.

Contoh berikut menggunakan region Singapura. Ganti base_url jika aplikasi Anda lebih dekat ke Beijing atau Virginia.

Langkah 3: Kirim Request Pertama dengan OpenAI SDK

Endpoint Qwen menggunakan format Chat Completions OpenAI. Jika proyek Anda sudah memakai OpenAI Python SDK, cukup ubah base_url dan ID model.

Instal SDK jika belum tersedia:

pip install openai
Enter fullscreen mode Exit fullscreen mode

Lalu kirim request:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "system",
            "content": "You are a precise technical assistant."
        },
        {
            "role": "user",
            "content": "Explain idempotency in REST APIs in two sentences."
        },
    ],
)

print(completion.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

Untuk verifikasi cepat tanpa SDK, gunakan cURL:

curl https://dashscope-intl.aliyuncs.com/compatible-mode/v1/chat/completions \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [
      {
        "role": "user",
        "content": "Explain idempotency in REST APIs in two sentences."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Migrasi dari provider kompatibel OpenAI biasanya hanya membutuhkan dua perubahan:

  1. Ganti URL dasar ke endpoint DashScope.
  2. Ganti ID model menjadi qwen3.8-max.

Alurnya serupa dengan panduan API Qwen 3.7 Plus, dengan ID model dan karakteristik model yang berbeda.

Langkah 4: Streaming Respons dan Penalaran

Qwen 3.8-Max adalah model penalaran dan berpikir secara default. Saat streaming:

  • Delta reasoning_content berisi proses penalaran.
  • Delta content berisi jawaban akhir.

Tangani keduanya secara terpisah agar UI atau log Anda tidak mencampur proses penalaran dengan respons akhir.

stream = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Design a rate limiting strategy for a public API."
        }
    ],
    stream=True,
)

thinking_done = False

for chunk in stream:
    delta = chunk.choices[0].delta
    reasoning = getattr(delta, "reasoning_content", None)

    if reasoning:
        print(reasoning, end="", flush=True)
    elif delta.content:
        if not thinking_done:
            print("\n--- answer ---")
            thinking_done = True

        print(delta.content, end="", flush=True)
Enter fullscreen mode Exit fullscreen mode

Perhatikan dua hal saat mengaktifkan streaming:

  1. Token penalaran ditagih sebagai token output.
  2. Mode default xhigh dapat meningkatkan latensi, terutama untuk UI chat interaktif.

Jika Anda hanya membutuhkan klasifikasi, ekstraksi, atau respons sederhana, gunakan tingkat penalaran lebih rendah.

Langkah 5: Atur reasoning_effort dan Thinking Flags

API menyediakan tiga nilai reasoning_effort:

  • xhigh: default; cocok untuk coding, analisis kompleks, dan agen.
  • medium: kompromi antara kualitas, biaya, dan latensi.
  • low: cocok untuk klasifikasi, ekstraksi, routing, atau chat sederhana.

Dua flag tambahan mengatur perilaku penalaran:

  • enable_thinking: mengaktifkan atau menonaktifkan penalaran.
  • preserve_thinking: mempertahankan konteks penalaran antar-giliran; aktif secara default.

Karena parameter ini adalah ekstensi DashScope, teruskan melalui extra_body saat memakai OpenAI SDK:

completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Classify this ticket: 'Login page 500s on Safari.'"
        }
    ],
    extra_body={
        "reasoning_effort": "low",
        "enable_thinking": True,
    },
)

print(completion.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

Biaya tetap dihitung per token, baik thinking diaktifkan maupun tidak. Faktor utama yang memengaruhi biaya adalah jumlah token penalaran yang dihasilkan, dan reasoning_effort mengontrol jumlah tersebut.

Gunakan baseline berikut, lalu ukur pada workload Anda sendiri:

Use case Rekomendasi
Agen coding dan analisis xhigh
Produksi volume tinggi low
Use case yang belum jelas medium

Jangan hanya mengandalkan default atau benchmark vendor. Uji prompt, latensi, kualitas, dan penggunaan token pada traffic Anda sendiri.

Endpoint yang Kompatibel dengan Anthropic

Selain endpoint OpenAI, Qwen 3.8-Max menyediakan endpoint Anthropic Messages:

https://dashscope-intl.aliyuncs.com/apps/anthropic
Enter fullscreen mode Exit fullscreen mode

Endpoint ini memungkinkan tooling yang dibuat untuk ekosistem Claude berkomunikasi dengan Qwen 3.8-Max. Untuk Claude Code, atur tiga variabel lingkungan berikut:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=$DASHSCOPE_API_KEY
export ANTHROPIC_MODEL=qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

Setelah itu, jalankan:

claude
Enter fullscreen mode Exit fullscreen mode

Claude Code akan menjalankan siklus agennya terhadap Qwen 3.8-Max.

Endpoint Anthropic relevan jika tim Anda sudah memiliki tooling Claude atau kode yang menggunakan Anthropic Messages. Untuk aplikasi baru yang langsung memanggil API, endpoint kompatibel OpenAI tetap menjadi jalur yang lebih terdokumentasi untuk reasoning_effort, enable_thinking, dan streaming reasoning_content.

Untuk konteks penggunaan coding agent dan benchmark terkait, lihat analisis Qwen 3.8 untuk pengkodean.

Berapa Biayanya?

Harga Qwen 3.8-Max adalah:

  • $2 per 1 juta token input
  • $6 per 1 juta token output
  • Satu tingkat harga untuk konteks dari 0 hingga 1 juta token

Tidak ada biaya tambahan khusus untuk konteks panjang. Context caching menurunkan biaya input berulang menjadi 10% dari harga input saat cache hit, sementara pembuatan cache eksplisit ditagih sebesar 125%.

Untuk angka terbaru, lihat halaman harga resmi Model Studio.

Ringkasan harga Qwen 3.8-Max

Harga peluncuran ini lebih rendah daripada harga daftar Qwen 3.7-Max yang sebesar $2,5/$7,5. Namun, perhitungan biaya harus memasukkan token penalaran karena token tersebut dihitung sebagai output. Dengan default xhigh, biaya aktual dapat lebih tinggi daripada estimasi token respons akhir saja.

Untuk contoh perhitungan biaya dan strategi memakai kuota gratis, baca rincian harga Qwen 3.8.

Uji dan Debug API Qwen 3.8 di Apidog

API dengan streaming, beberapa region, dan dua protokol akan lebih mudah diuji jika request disimpan dan dapat dijalankan ulang. Berikut setup praktis di Apidog.

Pengujian API di Apidog

1. Buat endpoint OpenAI-compatible

Tambahkan endpoint berikut ke project:

POST /chat/completions
Enter fullscreen mode Exit fullscreen mode

Gunakan skema request OpenAI Chat Completions, lalu atur server ke base URL DashScope. Karena format request kompatibel dengan OpenAI, Anda dapat menggunakan spesifikasi OpenAI yang sudah ada dan hanya mengganti URL server.

Tambahkan endpoint Anthropic Messages sebagai request kedua dalam project yang sama agar kedua protokol dapat diuji berdampingan.

2. Modelkan region sebagai environment

Buat tiga environment:

  • Beijing
  • Singapura
  • AS-Virginia

Di setiap environment, simpan variabel berikut:

base_url
DASHSCOPE_API_KEY
Enter fullscreen mode Exit fullscreen mode

Contoh nilai base_url untuk Singapura:

https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode

Dengan setup ini, Anda dapat mengganti region dari dropdown tanpa mengedit setiap request. Gunakan juga untuk membandingkan latensi antar-region sebelum deployment produksi.

3. Inspeksi event SSE saat streaming

Kirim request dengan body berikut:

{
  "model": "qwen3.8-max",
  "stream": true,
  "messages": [
    {
      "role": "user",
      "content": "Design a rate limiting strategy for a public API."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Periksa event server-sent mentah pada respons. Urutan yang diharapkan:

  1. Delta reasoning_content
  2. Delta content

Jika parser streaming Anda bermasalah di produksi, bandingkan output aplikasi dengan event mentah di Apidog. Ini membantu membedakan bug parser internal dari masalah di sisi provider.

4. Bandingkan model dengan prompt yang sama

Duplikat request, lalu ubah model:

{
  "model": "qwen3.7-max"
}
Enter fullscreen mode Exit fullscreen mode

Jalankan kedua request dengan prompt yang identik. Catat:

  • Waktu respons
  • Jumlah token
  • Kualitas output
  • Perilaku streaming
  • Biaya estimasi

Anda juga dapat menyimpan request Kimi K3 API dalam project yang sama untuk melakukan evaluasi A/B pada workload nyata. Benchmark vendor adalah titik awal; prompt dan data Anda sendiri adalah evaluasi yang lebih relevan.

Unduh Apidog untuk membuat koleksi request, environment region, dan pengujian streaming yang dapat digunakan ulang oleh seluruh tim.

FAQ

Apakah ada cara gratis untuk mencoba API Qwen 3.8?

Ya. Akun Model Studio baru mendapat kuota gratis 1 juta token untuk qwen3.8-max, berlaku selama 90 hari, dan hanya tersedia di region Singapura. Arahkan request evaluasi ke dashscope-intl untuk menggunakan kuota tersebut.

Bisakah saya menjalankan Qwen 3.8 secara lokal?

Belum. Alibaba menjanjikan bobot terbuka di Hugging Face dan ModelScope untuk minggu berikutnya, tetapi hingga awal Agustus 2026 bobot tersebut belum dapat diunduh. Dengan total 2,4T parameter, self-hosting juga akan membutuhkan infrastruktur multi-node bahkan dalam konfigurasi terkuantisasi. Saat ini, API yang di-host adalah satu-satunya cara menjalankan model.

Apakah endpoint Anthropic mendukung fitur yang sama dengan endpoint OpenAI?

Endpoint Anthropic menggunakan protokol Anthropic Messages dan terutama ditujukan untuk tooling di ekosistem tersebut, termasuk Claude Code. Untuk kode aplikasi langsung, endpoint kompatibel OpenAI lebih terdokumentasi, termasuk dukungan untuk reasoning_effort, enable_thinking, dan streaming reasoning_content.

Bagaimana qwen3.8-max dibandingkan dengan Qwen3-Coder untuk coding?

Keduanya ditujukan untuk kebutuhan berbeda. Qwen3-Coder adalah lini model coding khusus, sedangkan qwen3.8-max adalah flagship general-purpose dengan hasil coding agent yang kuat pada benchmark Alibaba sendiri, termasuk 86,6 pada Terminal Bench 2.1 menurut benchmark yang dijalankan vendor.

Untuk memilih model, uji keduanya melalui interface API yang sama. Request-nya identik; cukup ganti ID model.

Kesimpulan

Adopsi API Qwen 3.8-Max relatif langsung:

  1. Buat DASHSCOPE_API_KEY.
  2. Pilih region, biasanya Singapura untuk evaluasi gratis.
  3. Arahkan OpenAI SDK ke base URL DashScope.
  4. Gunakan reasoning_effort sesuai kebutuhan latensi dan biaya.
  5. Aktifkan streaming untuk memproses reasoning_content dan content.
  6. Gunakan endpoint Anthropic jika tooling Anda bergantung pada Claude Code atau Anthropic Messages.

Hal utama yang perlu dipantau adalah token penalaran. Token ini ditagih sebagai output, dan default xhigh dapat menaikkan latensi serta biaya. Mulailah dari kuota gratis Singapura, ukur respons terhadap prompt nyata, lalu pilih konfigurasi yang sesuai dengan workload Anda.

Menyimpan kedua protokol dan semua region sebagai request serta environment di Apidog membuat evaluasi lebih mudah diulang saat tim Anda membandingkan model berikutnya.

Top comments (0)