Pilih Auto, TokenLab Verified, atau Official untuk setiap permintaan, dengan harga yang ditampilkan di awal.Lihat yang baru

Alibaba: Fun-ASR Realtime

Fun-ASR Realtime mengonsumsi audio yang masuk seiring berjalannya sesi. Model ini dirancang untuk pengalaman transkripsi langsung seperti teks keterangan dan input suara, di mana menunggu rekaman selesai akan mengganggu interaksi.
Bandingkan model
fun-asr-realtime
TersediaAlibabaUcapan ke TeksSinkronkan
Harga
Mulai dari $0.00009
Modalitas
Audio

Tentang Fun-ASR Realtime

Fun-ASR Realtime adalah model pengenalan ucapan streaming milik Alibaba: model ini menerima audio melalui sesi langsung dan mengembalikan teks saat orang berbicara. Ini adalah varian Fun-ASR untuk teks, input suara, dan bantuan dalam panggilan, di mana Fun-ASR audio rekaman akan memaksa pengguna menunggu hingga rekaman selesai. Alibaba mencantumkan kata kunci (hotwords), stempel waktu, dan bahasa Mandarin dengan dialek seperti Kanton dan Sichuan.

Kelebihan

  • Mengalirkan teks parsial saat pembicara masih berbicara, sehingga teks muncul tanpa menunggu rekaman selesai.
  • Mengenali bahasa Mandarin dengan akurasi tinggi dan beberapa dialek, termasuk Kanton dan Sichuan, menurut dokumentasi Alibaba.
  • Kata kunci khusus (hotwords) mengarahkan pengenalan langsung ke nama dan istilah yang spesifik untuk produk Anda.
  • Stempel waktu tingkat kata dan kalimat tiba bersama aliran, yang membantu menyelaraskan teks.

Kapan harus beralih

  • Model ini memerlukan sesi WebSocket, yang membutuhkan upaya integrasi lebih besar daripada mengunggah rekaman ke Fun-ASR.
  • Dekode langsung tidak dapat meninjau kembali audio sebelumnya, jadi untuk akurasi pengarsipan, Fun-ASR audio rekaman adalah pilihan yang lebih aman.

Memulai

  1. Buat API key

    Buat kunci di Console, gunakan untuk semua model di platform.

  2. Kirim permintaan pertama Anda

    Salin contoh untuk bahasa Anda dan jalankan terhadap endpoint tersebut.

    Suara ke teksWebSocket
    WS/v1/realtime
    // npm install ws
    import WebSocket from 'ws';
    
    const socket = new WebSocket("wss://api.tokenlab.sh/v1/realtime?model=fun-asr-realtime", {
      headers: { Authorization: "Bearer sk-xxx" }
    });
    
    socket.on('open', () => {
      // Send the input events supported by this model with socket.send(...).
      // https://tokenlab.sh/docs/en/api-reference/realtime/connect
    });
    socket.on('message', (data) => console.log(data.toString()));
    socket.on('error', (error) => console.error(error));
    socket.on('close', (code, reason) => console.log(code, reason.toString()));
    
    // Close the session when finished.
    process.on('SIGINT', () => socket.close());

Penetapan Harga

Harga Official adalah baseline publik pembuat model. Harga TokenLab adalah yang Anda bayar untuk model ini di TokenLab.

Real-time / Suara ke teks

per detik
Harga Official
$0.00009
Official
$0.00009
Diskon
—

Penggunaan & aktivitas

Tingkat keberhasilan adalah proporsi permintaan yang selesai. Latensi adalah berapa lama respons penuh berlangsung; P95 berarti 95% permintaan selesai dalam waktu tersebut.

Penggunaan & ketersediaan

24 jam terakhir
Permintaan
Tingkat keberhasilan
Latensi P95
Total token
Performa model
Metrik akan muncul setelah ambang batas privasi dan volume data terpenuhi.

Data didasarkan pada permintaan pengguna gabungan, tidak termasuk pemeriksaan status.

Buka di Console

Buka Fun-ASR Realtime di Console dengan prompt siap diedit atau dikirim.

Bantu saya mencoba fun-asr-realtime dengan permintaan audio singkat di /v1/realtime. Tampilkan hasil dan biayanya.

Skenario penggunaan

  • Teks langsung

    Tampilkan subtitle untuk webinar atau acara saat pembicara berbicara, memperbarui setiap kalimat saat sudah selesai.

  • Input suara

    Biarkan pengguna mendikte ke dalam formulir atau kotak obrolan dan melihat kata-kata mereka muncul saat mereka berbicara.

  • Asisten yang memahami dialek

    Tangani permintaan lisan dalam bahasa Mandarin dan dialek regional di aplikasi yang tidak dapat menunggu rekaman penuh.

Contoh prompt

Alirkan audio mikrofon untuk peluncuran produk bahasa Mandarin dan cetak teks saat setiap kalimat berakhir.

Transkripsikan panggilan pelanggan bahasa Kanton secara langsung dengan kata kunci 'pengembalian dana' dan 'nomor pesanan'.

Alirkan sesi pelatihan dan simpan stempel waktu kata untuk pemotongan nanti.

FAQ

Kapan saya harus memilih Fun-ASR Realtime dibandingkan Fun-ASR?

Pilih Realtime jika teks harus muncul saat audio masih diucapkan, seperti teks atau dikte. Pilih Fun-ASR audio rekaman jika Anda memiliki rekaman yang sudah selesai dan menginginkan diarisasi atau akurasi pengarsipan.

Bagaimana cara saya mengirim audio ke model ini?

Melalui sesi WebSocket streaming, baik melalui SDK DashScope Alibaba atau protokol mentah. Anda mendorong potongan audio dan menerima peristiwa teks yang dikenali kembali saat sesi berlanjut.

Apakah model ini mendukung dialek?

Ya. Dokumentasi waktu nyata Alibaba mencantumkan bahasa Mandarin ditambah Kanton, Sichuan, dan dialek lainnya, bersama dengan kata kunci khusus yang membantu dengan nama dan istilah produk. Ucapan dialek dikenali dalam sesi langsung yang sama dengan bahasa Mandarin standar.

Bisakah model ini menangani keheningan di antara kalimat?

Ya, model ini menyertakan deteksi aktivitas suara yang memfilter audio non-ucapan dan memutuskan di mana kalimat berakhir. Ambang batas keheningan dapat dikonfigurasi dalam pengaturan sesi, sehingga Anda dapat menyesuaikan seberapa cepat teks muncul.

Berapa biaya Fun-ASR Realtime?

Di TokenLab, Fun-ASR Realtime dikenakan $0.00009 per detik. Tabel harga di atas menampilkan rincian lengkap. Tarif bergantung pada unit penagihan, spesifikasi, dan penggunaan. Bandingkan kondisi yang sama dalam harga detail model; satu tarif tidak menentukan total biaya.

Endpoint mana yang harus digunakan Fun-ASR Realtime?

Pakai https://api.tokenlab.sh/v1/realtime sebagai default untuk Fun-ASR Realtime. Jika format native penyedia didukung, API workbench juga menampilkan endpoint tersebut.

Operasi apa saja yang didukung Fun-ASR Realtime?

Fun-ASR Realtime mendukung Suara ke teks. Pilih operasi di API workbench di atas untuk melihat endpoint dan contoh kode terkait.

Bandingkan Fun-ASR Realtime

Sumber

Ditinjau 2 Okt 2026

Lainnya dari Fun-ASR

Model terkait