Alibaba: Qwen Flash
qwen-flash- Masukan / Keluaran
- $0.05 / $0.40
- Konteks
- 998K
- Output maksimal
- 32K
- Modalitas
- Obrolan
- Kapabilitas
- Cache PromptPenalaran
Tentang Qwen Flash
Qwen Flash adalah model teks umum yang cepat dan berbiaya rendah dari Alibaba dalam lini Qwen, yang ditujukan untuk pekerjaan bervolume tinggi seperti peringkasan, penulisan ulang, dan asisten sederhana. Model ini berada di bawah Qwen Plus dan Qwen Max dalam hal kemampuan dan merupakan model yang harus dicoba terlebih dahulu ketika volume lebih penting daripada kedalaman. Alibaba mencantumkannya di antara nama-nama Qwen lama, dengan generasi Qwen3 yang lebih baru direkomendasikan untuk proyek baru.
Kelebihan
- Meringkas dan memformat ulang sejumlah besar teks dengan latensi rendah per permintaan.
- Menjaga dokumen sumber yang panjang tetap tersedia dalam percakapan saat meringkas atau menjawab.
- Mode berpikir opsional memungkinkan Anda menggunakan penalaran hanya pada permintaan yang membutuhkannya.
- Caching prompt mengurangi pekerjaan berulang saat prompt sistem atau dokumen yang panjang digunakan kembali.
Kapan harus beralih
- Hanya input teks, tanpa pemanggilan alat (tool calling).
- Kedalaman penalaran dan kualitas penulisan tertinggal dari Qwen Plus dan Qwen Max pada tugas analisis yang sulit.
- Alibaba mencantumkannya sebagai nama lama, jadi model Qwen3 saat ini mungkin lebih cocok untuk pengembangan baru.
Memulai
Buat API key
Buat kunci di Console, gunakan untuk semua model di platform.
Kirim permintaan pertama Anda
Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.
Teks ke teksResponses APIPOST/v1/responsesFormat API:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "qwen-flash", "input": "Hello!" }'
Penetapan Harga
Harga Verified berlaku untuk Verified yang lebih murah di sebagian besar model. Harga Official adalah harga resmi dari pembuat model dan berlaku untuk rute Official yang lebih andal. Auto menagihkan biaya berdasarkan rute yang menyelesaikan permintaan.
Masukan token <= 125K
per 1M token- Harga Official
- Masukan $0.05 / Keluaran $0.40 / Pembacaan cache $0.01 / Penulisan cache $0.0625 / Teks Masukan $0.05 / Teks Keluaran $0.40
- Harga Verified
- —
- Diskon
- —
Masukan token <= 250K
per 1M token- Harga Official
- Masukan $0.05 / Keluaran $0.40 / Pembacaan cache $0.01 / Penulisan cache $0.0625 / Teks Masukan $0.05 / Teks Keluaran $0.40
- Harga Verified
- —
- Diskon
- —
Masukan token <= 1M
per 1M token- Harga Official
- Masukan $0.25 / Keluaran $2.00 / Pembacaan cache $0.05 / Penulisan cache $0.3125 / Teks Masukan $0.25 / Teks Keluaran $2.00
- Harga Verified
- —
- Diskon
- —
Pembacaan cache
- Harga Official
- $0.01
- Harga Verified
- —
- Diskon
- —
Penulisan cache
- Harga Official
- $0.0625
- Harga Verified
- —
- Diskon
- —
| Harga Officialper 1M token | Harga Verifiedper 1M token | Diskon | |
|---|---|---|---|
| Masukan token <= 125K | Masukan $0.05 / Keluaran $0.40 / Pembacaan cache $0.01 / Penulisan cache $0.0625 / Teks Masukan $0.05 / Teks Keluaran $0.40 | — | — |
| Masukan token <= 250K | Masukan $0.05 / Keluaran $0.40 / Pembacaan cache $0.01 / Penulisan cache $0.0625 / Teks Masukan $0.05 / Teks Keluaran $0.40 | — | — |
| Masukan token <= 1M | Masukan $0.25 / Keluaran $2.00 / Pembacaan cache $0.05 / Penulisan cache $0.3125 / Teks Masukan $0.25 / Teks Keluaran $2.00 | — | — |
| Harga cache prompt | |||
| Pembacaan cache | $0.01 | — | — |
| Penulisan cache | $0.0625 | — | — |
Penggunaan & aktivitas
Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.
Penggunaan & ketersediaan
24 jam terakhir- Permintaan
- Tingkat keberhasilan
- Latensi P95
- Total token
Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.
Buka di Console
Buka Qwen Flash di Console dengan prompt siap diedit atau dikirim.
Bantu saya mencoba qwen-flash dengan pesan singkat di /v1/responses. Tampilkan balasan, latensi, dan biayanya.
Skenario penggunaan
Cocok untuk- Penalaran
Peringkasan massal
Ringkas ribuan artikel, transkrip panggilan, atau ulasan menjadi ringkasan singkat, dengan prompt yang sama diterapkan pada setiap item.
Transformasi konten
Ubah teks antar nada, bahasa, atau format, seperti mengubah catatan menjadi email yang dipoles atau tabel menjadi prosa.
Asisten obrolan ringan
Dukung bot FAQ atau pembantu dalam aplikasi di mana jawabannya singkat dan waktu respons lebih penting daripada nuansa.
Tanya jawab dokumen panjang
Tempel manual atau kumpulan kebijakan yang panjang ke dalam prompt dan jawab pertanyaan staf langsung darinya.
Contoh prompt
Tulis ulang deskripsi produk berikut dengan nada ramah, maksimal 60 kata, dan pertahankan nomor model.
Ringkas transkrip rapat ini menjadi keputusan, poin tindakan beserta penanggung jawabnya, dan pertanyaan yang belum terselesaikan.
Hanya menggunakan teks kebijakan di atas, jawab: bisakah kontraktor mengklaim biaya perjalanan? Kutip klausul yang Anda gunakan.
Model ini memiliki harga kondisional. Total token bulanan saja tidak dapat menghasilkan estimasi yang andal; gunakan harga detail untuk spesifikasi permintaan, cache, dan jendela waktu yang berlaku.
FAQ
Apa kegunaan terbaik Qwen Flash?
Tugas teks sehari-hari bervolume tinggi: ringkasan, penulisan ulang, transformasi gaya terjemahan, dan asisten sederhana. Ini adalah tingkat yang cepat dan murah dari lini Qwen, jadi gunakan saat throughput penting dan tugas tidak memerlukan penalaran mendalam.
Apa perbedaan Qwen Flash dengan Qwen Plus?
Flash adalah tingkat yang berorientasi pada kecepatan dan Plus adalah tingkat yang seimbang. Plus memberikan analisis dan penulisan yang lebih kuat; Flash menyelesaikan pekerjaan sederhana dengan lebih cepat dan lebih murah. Mulailah dengan Flash dan pindahkan tugas tertentu ke Plus jika jawabannya kurang memadai.
Apakah Qwen Flash mendukung mode berpikir?
Ya. Berpikir dapat diaktifkan untuk permintaan yang memerlukan penalaran langkah demi langkah dan dimatikan untuk permintaan sederhana. Dokumentasi Alibaba mencantumkan mode berpikir sebagai fitur yang didukung untuk model ini.
Bisakah Qwen Flash menerima gambar atau memanggil alat?
Tidak. Ini adalah model teks-masuk, teks-keluar tanpa input gambar atau pemanggilan alat. Pilih model visi Qwen atau keluarga lain jika permintaan memerlukan salah satunya.
Apakah Qwen Flash pilihan yang baik untuk proyek baru?
Pipeline yang ada dapat tetap menggunakannya, dan model ini tetap dapat digunakan untuk pekerjaan bervolume tinggi yang stabil. Untuk pengembangan baru, Alibaba mengarahkan ke generasi Qwen3 yang lebih baru, jadi bandingkan terlebih dahulu dengan Qwen3.8 Flash.
Berapa biaya Qwen Flash?
Di TokenLab, Qwen Flash dikenakan Masukan $0.05 / Keluaran $0.40 per 1M token. Tabel harga di atas menampilkan rincian lengkap. Tarif bergantung pada unit penagihan, spesifikasi, dan penggunaan. Bandingkan kondisi yang sama dalam harga detail model; satu tarif tidak menentukan total biaya.
Berapa batas konteks dan output Qwen Flash?
Qwen Flash mendukung hingga 997.952 token konteks dan menghasilkan hingga 32.768 token per respons.
Endpoint mana yang harus digunakan Qwen Flash?
Pakai https://api.tokenlab.sh/v1/responses sebagai default untuk Qwen Flash. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.
Operasi apa saja yang didukung Qwen Flash?
Qwen Flash mendukung Teks ke teks. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.
Bandingkan Qwen Flash
Sumber
Ditinjau 2 Okt 2026