Pilih Auto, TokenLab Verified, atau Official untuk setiap permintaan, dengan harga yang ditampilkan di awal.Lihat yang baru

Alibaba: Qwen3.5-Flash

Qwen3.5 Flash adalah opsi yang berorientasi pada efisiensi untuk pekerjaan teks konteks panjang di lini 3.5. Model ini dapat mendukung peringkasan dan langkah-langkah pemrosesan dokumen berulang di mana sumber besar yang sama perlu dirujuk sepanjang tugas.
Bandingkan model
qwen3.5-flash
TersediaAlibabaObrolan
Masukan / Keluaran
$0.10 / $0.40
Konteks
992K
Output maksimal
64K
Modalitas
Obrolan
Kapabilitas
Cache Prompt

Tentang Qwen3.5-Flash

Qwen3.5-Flash adalah tingkat layanan yang lebih ringan dari keluarga Qwen3.5 Alibaba, yang dibuat untuk pemrosesan teks yang lebih cepat dan lebih murah daripada Qwen3.5-Plus. Model ini memiliki konteks yang sangat besar dan penembolokan prompt (prompt caching), yang cocok untuk peringkasan dan pemrosesan berulang atas sumber besar yang sama. Model ini berbagi cakupan bahasa yang luas dari keluarga Qwen3.5.

Kelebihan

  • Penembolokan prompt membantu konsultasi berulang terhadap satu sumber besar.
  • Disesuaikan untuk kecepatan dibandingkan tingkat Plus.
  • Berbagi cakupan 201 bahasa dari keluarga Qwen3.5.
  • Sangat cocok untuk langkah-langkah alur kerja seperti meringkas atau memberi tag.

Kapan harus beralih

  • Qwen3.5-Plus lebih baik untuk analisis yang lebih sulit.
  • Model ini hanya menerima teks, sehingga tidak dapat menggantikan model visi.
  • Lebih lama daripada Qwen3.8-Flash, yang melaporkan hasil pengodean agen.

Memulai

  1. Buat API key

    Buat kunci di Console, gunakan untuk semua model di platform.

  2. Kirim permintaan pertama Anda

    Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.

    Teks ke teksResponses API
    POST/v1/responses
    Format API:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "qwen3.5-flash",
        "input": "Hello!"
      }'

Penetapan Harga

Harga TokenLab berlaku untuk Verified yang lebih terjangkau. Harga Official mengikuti standar penyedia model untuk keandalan lebih tinggi. Auto akan menagih berdasarkan jalur yang berhasil menyelesaikan permintaan.

Masukan token <= 125K

per 1M token
Harga Official
Masukan $0.10 / Keluaran $0.40 / Pembacaan cache $0.01 / Penulisan cache $0.125 / Teks Masukan $0.10 / Teks Keluaran $0.40
Official
Masukan $0.10 / Keluaran $0.40 / Pembacaan cache $0.01 / Penulisan cache $0.125 / Teks Masukan $0.10 / Teks Keluaran $0.40
Diskon
—

Masukan token <= 250K

per 1M token
Harga Official
Masukan $0.10 / Keluaran $0.40 / Pembacaan cache $0.01 / Penulisan cache $0.125 / Teks Masukan $0.10 / Teks Keluaran $0.40
Official
Masukan $0.10 / Keluaran $0.40 / Pembacaan cache $0.01 / Penulisan cache $0.125 / Teks Masukan $0.10 / Teks Keluaran $0.40
Diskon
—

Masukan token <= 1M

per 1M token
Harga Official
Masukan $0.10 / Keluaran $0.40 / Pembacaan cache $0.01 / Penulisan cache $0.125 / Teks Masukan $0.10 / Teks Keluaran $0.40
Official
Masukan $0.10 / Keluaran $0.40 / Pembacaan cache $0.01 / Penulisan cache $0.125 / Teks Masukan $0.10 / Teks Keluaran $0.40
Diskon
—
Harga cache prompt

Pembacaan cache

Harga Official
$0.01
Official
$0.01
Diskon
—

Penulisan cache

Harga Official
$0.125
Official
$0.125
Diskon
—

Penggunaan & aktivitas

Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.

Penggunaan & ketersediaan

24 jam terakhir
Permintaan
Tingkat keberhasilan
Latensi P95
Total token
Performa model
Metrik akan muncul setelah ambang batas privasi dan volume data terpenuhi.

Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.

Buka di Console

Buka Qwen3.5-Flash di Console dengan prompt siap diedit atau dikirim.

Bantu saya mencoba qwen3.5-flash dengan pesan singkat di /v1/responses. Tampilkan balasan, latensi, dan biayanya.

Skenario penggunaan

  • Peringkasan batch

    Ringkas laporan panjang dalam alur kerja malam hari, dengan sumber besar yang sama di-cache di seluruh bagian yang Anda tanyakan.

  • Penandaan dan perutean dokumen

    Beri label pada teks panjang berdasarkan topik, urgensi, atau pemilik dan kembalikan hasilnya dalam format tetap yang dapat diurai oleh kode hilir.

  • Tanya jawab berulang atas satu sumber

    Cache manual atau kebijakan sekali dan ajukan banyak pertanyaan terhadapnya tanpa harus membayar untuk memproses ulang seluruh teks setiap saat.

  • Pembersihan draf

    Perbaiki tata bahasa, nada, dan struktur dalam draf panjang sambil menjaga klaim dan angka penulis tetap utuh.

Contoh prompt

Ringkas setiap bagian dari buku panduan ini dalam dua baris.

Beri tag pada tiket ini dengan area produk dan urgensi, lalu kembalikan dalam format JSON.

Jawab pertanyaan tentang kebijakan yang ditempelkan; balas 'tidak disebutkan' jika tidak ada.

Model ini memiliki harga kondisional. Total token bulanan saja tidak dapat menghasilkan estimasi yang andal; gunakan harga detail untuk spesifikasi permintaan, cache, dan jendela waktu yang berlaku.

FAQ

Apa sebenarnya Qwen3.5-Flash itu?

Ini adalah tingkat layanan yang lebih ringan dari keluarga Qwen3.5 Alibaba, yang ditujukan untuk pemrosesan cepat teks panjang. Model ini berada di bawah Qwen3.5-Plus dalam hal kekuatan dan ditujukan untuk langkah-langkah dokumen rutin yang berulang.

Kapan saya harus memilih Flash dibandingkan Qwen3.5-Plus?

Pilih Flash ketika kecepatan dan biaya lebih penting daripada kedalaman, seperti untuk peringkasan massal, penandaan, atau tanya jawab atas sumber tetap. Beralihlah ke Plus ketika jawaban memerlukan analisis yang lebih cermat di banyak bagian.

Apakah Qwen3.5-Flash mendukung penembolokan prompt?

Ya. Penembolokan prompt membantu ketika sumber panjang yang sama dikirim berulang kali, seperti dalam langkah-langkah pemrosesan dokumen berulang di mana hanya pertanyaan yang berubah di antara panggilan.

Bisakah Qwen3.5-Flash membaca gambar?

Tidak. Qwen3.5-Flash hanya menerima teks. Gunakan Qwen3.8-Flash, Qwen3.7-Plus, atau Qwen3-VL Plus jika tangkapan layar, pindaian, atau bagan merupakan bagian dari tugas, dan kirim teks yang diekstrak ke model ini sebagai gantinya.

Apakah ada model Flash yang lebih baru dari Alibaba?

Ya. Qwen3.8-Flash adalah model campuran pakar multimodal yang lebih baru yang ditujukan untuk pengodean agen dan pekerjaan agen jangka panjang. Tetap gunakan Qwen3.5-Flash untuk alur kerja teks biasa yang sudah berkinerja baik.

Berapa biaya Qwen3.5-Flash?

Di TokenLab, Qwen3.5-Flash dikenakan Masukan $0.10 / Keluaran $0.40 per 1M token. Tabel harga di atas menampilkan rincian lengkap. Tarif bergantung pada unit penagihan, spesifikasi, dan penggunaan. Bandingkan kondisi yang sama dalam harga detail model; satu tarif tidak menentukan total biaya.

Berapa batas konteks dan output Qwen3.5-Flash?

Qwen3.5-Flash mendukung hingga 991.808 token konteks dan menghasilkan hingga 65.536 token per respons.

Endpoint mana yang harus digunakan Qwen3.5-Flash?

Pakai https://api.tokenlab.sh/v1/responses sebagai default untuk Qwen3.5-Flash. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.

Operasi apa saja yang didukung Qwen3.5-Flash?

Qwen3.5-Flash mendukung Teks ke teks. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.

Bandingkan Qwen3.5-Flash

Sumber

Ditinjau 2 Okt 2026

Lainnya dari Qwen 3 / QwQ

Model terkait