Pilih Auto, TokenLab Verified, atau Official untuk setiap permintaan, dengan harga yang ditampilkan di awal.Lihat yang baru

Alibaba: Qwen Flash

Qwen Flash menangani tugas teks sehari-hari dengan jendela konteks yang besar. Model ini adalah kandidat untuk peringkasan volume tinggi, transformasi konten, dan asisten yang harus menjaga materi sumber yang panjang tetap tersedia dalam percakapan.
Bandingkan model
qwen-flash
TersediaAlibabaObrolan
Masukan / Keluaran
$0.05 / $0.40
Konteks
998K
Output maksimal
32K
Modalitas
Obrolan
Kapabilitas
Cache PromptPenalaran

Tentang Qwen Flash

Qwen Flash adalah model teks umum yang cepat dan berbiaya rendah dari Alibaba dalam lini Qwen, yang ditujukan untuk pekerjaan bervolume tinggi seperti peringkasan, penulisan ulang, dan asisten sederhana. Model ini berada di bawah Qwen Plus dan Qwen Max dalam hal kemampuan dan merupakan model yang harus dicoba terlebih dahulu ketika volume lebih penting daripada kedalaman. Alibaba mencantumkannya di antara nama-nama Qwen lama, dengan generasi Qwen3 yang lebih baru direkomendasikan untuk proyek baru.

Kelebihan

  • Meringkas dan memformat ulang sejumlah besar teks dengan latensi rendah per permintaan.
  • Menjaga dokumen sumber yang panjang tetap tersedia dalam percakapan saat meringkas atau menjawab.
  • Mode berpikir opsional memungkinkan Anda menggunakan penalaran hanya pada permintaan yang membutuhkannya.
  • Caching prompt mengurangi pekerjaan berulang saat prompt sistem atau dokumen yang panjang digunakan kembali.

Kapan harus beralih

  • Hanya input teks, tanpa pemanggilan alat (tool calling).
  • Kedalaman penalaran dan kualitas penulisan tertinggal dari Qwen Plus dan Qwen Max pada tugas analisis yang sulit.
  • Alibaba mencantumkannya sebagai nama lama, jadi model Qwen3 saat ini mungkin lebih cocok untuk pengembangan baru.

Memulai

  1. Buat API key

    Buat kunci di Console, gunakan untuk semua model di platform.

  2. Kirim permintaan pertama Anda

    Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.

    Teks ke teksResponses API
    POST/v1/responses
    Format API:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "qwen-flash",
        "input": "Hello!"
      }'

Penetapan Harga

Harga Verified berlaku untuk Verified yang lebih murah di sebagian besar model. Harga Official adalah harga resmi dari pembuat model dan berlaku untuk rute Official yang lebih andal. Auto menagihkan biaya berdasarkan rute yang menyelesaikan permintaan.

Masukan token <= 125K

per 1M token
Harga Official
Masukan $0.05 / Keluaran $0.40 / Pembacaan cache $0.01 / Penulisan cache $0.0625 / Teks Masukan $0.05 / Teks Keluaran $0.40
Harga Verified
—
Diskon
—

Masukan token <= 250K

per 1M token
Harga Official
Masukan $0.05 / Keluaran $0.40 / Pembacaan cache $0.01 / Penulisan cache $0.0625 / Teks Masukan $0.05 / Teks Keluaran $0.40
Harga Verified
—
Diskon
—

Masukan token <= 1M

per 1M token
Harga Official
Masukan $0.25 / Keluaran $2.00 / Pembacaan cache $0.05 / Penulisan cache $0.3125 / Teks Masukan $0.25 / Teks Keluaran $2.00
Harga Verified
—
Diskon
—
Harga cache prompt

Pembacaan cache

Harga Official
$0.01
Harga Verified
—
Diskon
—

Penulisan cache

Harga Official
$0.0625
Harga Verified
—
Diskon
—

Penggunaan & aktivitas

Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.

Penggunaan & ketersediaan

24 jam terakhir
Permintaan
Tingkat keberhasilan
Latensi P95
Total token
Performa model
Metrik akan muncul setelah ambang batas privasi dan volume data terpenuhi.

Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.

Buka di Console

Buka Qwen Flash di Console dengan prompt siap diedit atau dikirim.

Bantu saya mencoba qwen-flash dengan pesan singkat di /v1/responses. Tampilkan balasan, latensi, dan biayanya.

Skenario penggunaan

Cocok untuk
  • Penalaran
  • Peringkasan massal

    Ringkas ribuan artikel, transkrip panggilan, atau ulasan menjadi ringkasan singkat, dengan prompt yang sama diterapkan pada setiap item.

  • Transformasi konten

    Ubah teks antar nada, bahasa, atau format, seperti mengubah catatan menjadi email yang dipoles atau tabel menjadi prosa.

  • Asisten obrolan ringan

    Dukung bot FAQ atau pembantu dalam aplikasi di mana jawabannya singkat dan waktu respons lebih penting daripada nuansa.

  • Tanya jawab dokumen panjang

    Tempel manual atau kumpulan kebijakan yang panjang ke dalam prompt dan jawab pertanyaan staf langsung darinya.

Contoh prompt

Tulis ulang deskripsi produk berikut dengan nada ramah, maksimal 60 kata, dan pertahankan nomor model.

Ringkas transkrip rapat ini menjadi keputusan, poin tindakan beserta penanggung jawabnya, dan pertanyaan yang belum terselesaikan.

Hanya menggunakan teks kebijakan di atas, jawab: bisakah kontraktor mengklaim biaya perjalanan? Kutip klausul yang Anda gunakan.

Model ini memiliki harga kondisional. Total token bulanan saja tidak dapat menghasilkan estimasi yang andal; gunakan harga detail untuk spesifikasi permintaan, cache, dan jendela waktu yang berlaku.

FAQ

Apa kegunaan terbaik Qwen Flash?

Tugas teks sehari-hari bervolume tinggi: ringkasan, penulisan ulang, transformasi gaya terjemahan, dan asisten sederhana. Ini adalah tingkat yang cepat dan murah dari lini Qwen, jadi gunakan saat throughput penting dan tugas tidak memerlukan penalaran mendalam.

Apa perbedaan Qwen Flash dengan Qwen Plus?

Flash adalah tingkat yang berorientasi pada kecepatan dan Plus adalah tingkat yang seimbang. Plus memberikan analisis dan penulisan yang lebih kuat; Flash menyelesaikan pekerjaan sederhana dengan lebih cepat dan lebih murah. Mulailah dengan Flash dan pindahkan tugas tertentu ke Plus jika jawabannya kurang memadai.

Apakah Qwen Flash mendukung mode berpikir?

Ya. Berpikir dapat diaktifkan untuk permintaan yang memerlukan penalaran langkah demi langkah dan dimatikan untuk permintaan sederhana. Dokumentasi Alibaba mencantumkan mode berpikir sebagai fitur yang didukung untuk model ini.

Bisakah Qwen Flash menerima gambar atau memanggil alat?

Tidak. Ini adalah model teks-masuk, teks-keluar tanpa input gambar atau pemanggilan alat. Pilih model visi Qwen atau keluarga lain jika permintaan memerlukan salah satunya.

Apakah Qwen Flash pilihan yang baik untuk proyek baru?

Pipeline yang ada dapat tetap menggunakannya, dan model ini tetap dapat digunakan untuk pekerjaan bervolume tinggi yang stabil. Untuk pengembangan baru, Alibaba mengarahkan ke generasi Qwen3 yang lebih baru, jadi bandingkan terlebih dahulu dengan Qwen3.8 Flash.

Berapa biaya Qwen Flash?

Di TokenLab, Qwen Flash dikenakan Masukan $0.05 / Keluaran $0.40 per 1M token. Tabel harga di atas menampilkan rincian lengkap. Tarif bergantung pada unit penagihan, spesifikasi, dan penggunaan. Bandingkan kondisi yang sama dalam harga detail model; satu tarif tidak menentukan total biaya.

Berapa batas konteks dan output Qwen Flash?

Qwen Flash mendukung hingga 997.952 token konteks dan menghasilkan hingga 32.768 token per respons.

Endpoint mana yang harus digunakan Qwen Flash?

Pakai https://api.tokenlab.sh/v1/responses sebagai default untuk Qwen Flash. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.

Operasi apa saja yang didukung Qwen Flash?

Qwen Flash mendukung Teks ke teks. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.

Bandingkan Qwen Flash

Sumber

Ditinjau 2 Okt 2026

Lainnya dari Qwen

Model terkait