Alibaba: Paraformer Realtime v2
paraformer-realtime-v2- Harga
- Mulai dari $0.000035
- Modalitas
- Audio
Tentang Paraformer Realtime v2
Paraformer Realtime v2 adalah pengenal suara streaming serbaguna dari Alibaba, yang mengembalikan teks saat audio masih masuk. Model ini menargetkan teks keterangan, input suara, dan antarmuka rapat di mana transkrip harus diperbarui saat orang terus berbicara. Berbeda dengan varian 8K, model ini tidak terikat pada bandwidth telepon, dan berbeda dengan Fun-ASR Realtime, model ini termasuk dalam lini Paraformer yang lebih lama.
Kelebihan
- Memperbarui transkrip secara terus-menerus, yang cocok untuk teks keterangan langsung dan layar rapat.
- Bekerja pada audio pita lebar umum seperti headset dan mikrofon ruangan, bukan hanya saluran telepon.
- Mendukung kata kunci untuk nama dan istilah yang sering muncul dalam sesi Anda.
- Menyediakan stempel waktu (timestamp) dengan hasil streaming untuk menyelaraskan teks keterangan.
Kapan harus beralih
- Audio 8 kHz kualitas telepon lebih cocok dengan Paraformer Realtime 8K v2.
- Streaming berarti tidak ada proses kedua pada audio; gunakan model file jika akurasi akhir adalah yang terpenting.
Memulai
Buat API key
Buat kunci di Console, gunakan untuk semua model di platform.
Kirim permintaan pertama Anda
Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.
Suara ke teksWebSocketWS/v1/realtime// npm install ws import WebSocket from 'ws'; const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=paraformer-realtime-v2", { headers: { Authorization: "Bearer sk-xxx" } }); socket.on('open', () => { // Send the input events supported by this model with socket.send(...). // https://tokenlab.sh/docs/en/api-reference/realtime/connect }); socket.on('message', (data) => console.log(data.toString())); socket.on('error', (error) => console.error(error)); socket.on('close', (code, reason) => console.log(code, reason.toString())); // Close the session when finished. process.on('SIGINT', () => socket.close());
Penetapan Harga
Harga Official adalah baseline publik pembuat model. Harga TokenLab adalah yang Anda bayar untuk model ini di TokenLab.
Real-time / Suara ke teks
per detik- Harga Official
- $0.00003529
- Official
- $0.00003529
- Diskon
- —
| Harga Officialper detik | Officialper detik | Diskon | |
|---|---|---|---|
| Real-time / Suara ke teks | $0.00003529 | $0.00003529 | — |
Penggunaan & aktivitas
Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.
Penggunaan & ketersediaan
24 jam terakhir- Permintaan
- Tingkat keberhasilan
- Latensi P95
- Total token
Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.
Buka di Console
Buka Paraformer Realtime v2 di Console dengan prompt siap diedit atau dikirim.
Bantu saya mencoba paraformer-realtime-v2 dengan permintaan audio singkat di /v1/realtime. Tampilkan hasil dan biayanya.
Skenario penggunaan
Teks keterangan rapat
Menampilkan transkrip langsung selama rapat video agar peserta dapat mengikuti atau menangkap kata-kata yang terlewat.
Pengetikan suara
Mengonversi dikte menjadi teks dalam editor atau formulir saat pengguna berbicara.
Subtitel acara langsung
Menambahkan subtitel ke pembicaraan atau siaran, memperbarui setiap kalimat saat pembicara selesai.
Contoh prompt
Streaming audio rapat langsung ini dan tampilkan teks keterangan saat orang berbicara.
Diktekan tiket dukungan melalui suara dan isi kotak teks saat saya berbicara.
Streaming pidato konferensi dengan kata kunci untuk nama pembicara dan produk.
FAQ
Apakah Paraformer Realtime v2 untuk panggilan telepon?
Tidak terutama. Untuk audio telepon 8 kHz, Alibaba menawarkan Paraformer Realtime 8K v2. Model ini menargetkan audio langsung umum dari mikrofon, headset, dan perangkat lunak rapat.
Bagaimana perbandingannya dengan Fun-ASR Realtime?
Keduanya melakukan streaming. Fun-ASR Realtime adalah lini Fun-ASR yang lebih baru dengan dukungan dialek yang terdaftar, sementara Paraformer Realtime v2 adalah opsi Paraformer yang sudah mapan. Uji keduanya pada audio Anda dan gunakan yang paling sesuai.
Apa metode integrasinya?
Sesi WebSocket melalui SDK DashScope atau protokol mentah. Klien Anda mengirim audio dalam potongan, dan peristiwa pengenalan kembali secara terus-menerus selama sesi tetap terbuka.
Bisakah model ini mentranskripsikan file yang sudah selesai?
Model ini dirancang untuk streaming. Untuk rekaman yang sudah selesai, gunakan Paraformer v2, mitra berbasis file, yang memproses seluruh file dan mengembalikan stempel waktu dengan setiap hasil.
Berapa biaya Paraformer Realtime v2?
Di TokenLab, Paraformer Realtime v2 dikenakan $0.00003529 per detik. Tabel harga di atas menampilkan rincian lengkap. Tarif bergantung pada unit penagihan, spesifikasi, dan penggunaan. Bandingkan kondisi yang sama dalam harga detail model; satu tarif tidak menentukan total biaya.
Endpoint mana yang harus digunakan Paraformer Realtime v2?
Pakai https://api.tokenlab.sh/v1/realtime sebagai default untuk Paraformer Realtime v2. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.
Operasi apa saja yang didukung Paraformer Realtime v2?
Paraformer Realtime v2 mendukung Suara ke teks. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.
Bandingkan Paraformer Realtime v2
Sumber
- Model Studio: real-time speech recognition
- Model Studio: speech-to-text models for real-time and file transcription
Ditinjau 2 Okt 2026