Alibaba: Fun-ASR Realtime
fun-asr-realtime- Harga
- Mulai dari $0.00009
- Modalitas
- Audio
Tentang Fun-ASR Realtime
Fun-ASR Realtime adalah model pengenalan ucapan streaming milik Alibaba: model ini menerima audio melalui sesi langsung dan mengembalikan teks saat orang berbicara. Ini adalah varian Fun-ASR untuk teks, input suara, dan bantuan dalam panggilan, di mana Fun-ASR audio rekaman akan memaksa pengguna menunggu hingga rekaman selesai. Alibaba mencantumkan kata kunci (hotwords), stempel waktu, dan bahasa Mandarin dengan dialek seperti Kanton dan Sichuan.
Kelebihan
- Mengalirkan teks parsial saat pembicara masih berbicara, sehingga teks muncul tanpa menunggu rekaman selesai.
- Mengenali bahasa Mandarin dengan akurasi tinggi dan beberapa dialek, termasuk Kanton dan Sichuan, menurut dokumentasi Alibaba.
- Kata kunci khusus (hotwords) mengarahkan pengenalan langsung ke nama dan istilah yang spesifik untuk produk Anda.
- Stempel waktu tingkat kata dan kalimat tiba bersama aliran, yang membantu menyelaraskan teks.
Kapan harus beralih
- Model ini memerlukan sesi WebSocket, yang membutuhkan upaya integrasi lebih besar daripada mengunggah rekaman ke Fun-ASR.
- Dekode langsung tidak dapat meninjau kembali audio sebelumnya, jadi untuk akurasi pengarsipan, Fun-ASR audio rekaman adalah pilihan yang lebih aman.
Memulai
Buat API key
Buat kunci di Console, gunakan untuk semua model di platform.
Kirim permintaan pertama Anda
Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.
Suara ke teksWebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=fun-asr-realtime", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
Penetapan Harga
Harga Official adalah baseline publik pembuat model. Harga TokenLab adalah yang Anda bayar untuk model ini di TokenLab.
Real-time / Suara ke teks
per detik- Harga Official
- $0.00009
- Official
- $0.00009
- Diskon
- —
| Harga Officialper detik | Officialper detik | Diskon | |
|---|---|---|---|
| Real-time / Suara ke teks | $0.00009 | $0.00009 | — |
Penggunaan & aktivitas
Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.
Penggunaan & ketersediaan
24 jam terakhir- Permintaan
- Tingkat keberhasilan
- Latensi P95
- Total token
Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.
Buka di Console
Buka Fun-ASR Realtime di Console dengan prompt siap diedit atau dikirim.
Bantu saya mencoba fun-asr-realtime dengan permintaan audio singkat di /v1/realtime. Tampilkan hasil dan biayanya.
Skenario penggunaan
Teks langsung
Tampilkan subtitle untuk webinar atau acara saat pembicara berbicara, memperbarui setiap kalimat saat sudah selesai.
Input suara
Biarkan pengguna mendikte ke dalam formulir atau kotak obrolan dan melihat kata-kata mereka muncul saat mereka berbicara.
Asisten yang memahami dialek
Tangani permintaan lisan dalam bahasa Mandarin dan dialek regional di aplikasi yang tidak dapat menunggu rekaman penuh.
Contoh prompt
Alirkan audio mikrofon untuk peluncuran produk bahasa Mandarin dan cetak teks saat setiap kalimat berakhir.
Transkripsikan panggilan pelanggan bahasa Kanton secara langsung dengan kata kunci 'pengembalian dana' dan 'nomor pesanan'.
Alirkan sesi pelatihan dan simpan stempel waktu kata untuk pemotongan nanti.
FAQ
Kapan saya harus memilih Fun-ASR Realtime dibandingkan Fun-ASR?
Pilih Realtime jika teks harus muncul saat audio masih diucapkan, seperti teks atau dikte. Pilih Fun-ASR audio rekaman jika Anda memiliki rekaman yang sudah selesai dan menginginkan diarisasi atau akurasi pengarsipan.
Bagaimana cara saya mengirim audio ke model ini?
Melalui sesi WebSocket streaming, baik melalui SDK DashScope Alibaba atau protokol mentah. Anda mendorong potongan audio dan menerima peristiwa teks yang dikenali kembali saat sesi berlanjut.
Apakah model ini mendukung dialek?
Ya. Dokumentasi waktu nyata Alibaba mencantumkan bahasa Mandarin ditambah Kanton, Sichuan, dan dialek lainnya, bersama dengan kata kunci khusus yang membantu dengan nama dan istilah produk. Ucapan dialek dikenali dalam sesi langsung yang sama dengan bahasa Mandarin standar.
Bisakah model ini menangani keheningan di antara kalimat?
Ya, model ini menyertakan deteksi aktivitas suara yang memfilter audio non-ucapan dan memutuskan di mana kalimat berakhir. Ambang batas keheningan dapat dikonfigurasi dalam pengaturan sesi, sehingga Anda dapat menyesuaikan seberapa cepat teks muncul.
Berapa biaya Fun-ASR Realtime?
Di TokenLab, Fun-ASR Realtime dikenakan $0.00009 per detik. Tabel harga di atas menampilkan rincian lengkap. Tarif bergantung pada unit penagihan, spesifikasi, dan penggunaan. Bandingkan kondisi yang sama dalam harga detail model; satu tarif tidak menentukan total biaya.
Endpoint mana yang harus digunakan Fun-ASR Realtime?
Pakai https://api.tokenlab.sh/v1/realtime sebagai default untuk Fun-ASR Realtime. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.
Operasi apa saja yang didukung Fun-ASR Realtime?
Fun-ASR Realtime mendukung Suara ke teks. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.
Bandingkan Fun-ASR Realtime
Sumber
- Model Studio: real-time speech recognition
- Model Studio: speech-to-text models for real-time and file transcription
Ditinjau 2 Okt 2026