TokenLab

Âm thanh & thời gian thực

Tạo Giọng nói

Tạo audio từ văn bản đầu vào

POST
/v1/audio/speech

Nội dung yêu cầu

Chế độ phản hồi phụ thuộc vào mô hình đã chọn và stream_format. Với đầu vào dài, đặt thời gian chờ HTTP ít nhất 120s.

Các trường tùy chọn, giọng nói, định dạng và hỗ trợ SSE phụ thuộc vào mô hình. Kiểm tra GET /v1/models/{model} trước khi gửi. Tham số không được hỗ trợ có thể trả về 400 unsupported_parameter.

modelstringmặc định: tts-1

ID mô hình TTS. Xem các lựa chọn hiện tại bằng GET /v1/models?recommended_for=tts.

inputstringbắt buộc

Văn bản dùng để tạo audio. Tối đa 4096 ký tự.

voicestring | object

Bộ chọn giọng nói. Truyền tên giọng dựng sẵn như nova, giọng Gemini như Kore, hoặc object như { "id": "voice-id" } cho giọng tuỳ chỉnh tương thích.

voice_idstring

ID giọng nói cho mô hình hỗ trợ tham số này, chẳng hạn mô hình giọng nói MiniMax tương thích.

instructionsstring

Chỉ dẫn style hoặc cách đọc tuỳ chọn cho các model TTS tương thích OpenAI có hỗ trợ.

promptstring

Prompt style nói tuỳ chọn cho model Gemini TTS.

language_codestring

Mã ngôn ngữ tuỳ chọn, ví dụ en-US, cho các route Gemini, xAI và TTS tương thích.

response_formatstring

Định dạng audio. Giá trị phổ biến gồm mp3, opus, aac, flac, wav, và pcm; giá trị được hỗ trợ khác nhau theo họ model.

stream_formatstringmặc định: audio

Định dạng trả về của TokenLab: audio hoặc sse. stream_format=sse không được hỗ trợ cho tts-1 hoặc tts-1-hd.

speednumber

Tốc độ nói cho các họ model có hỗ trợ (0.25 đến 4.0).

temperaturenumber

Sampling temperature cho các route TTS tương thích Gemini (0 đến 2).

Phản hồi

stream_format=audio trả về các byte âm thanh. Mô hình hỗ trợ stream_format=sse trả về text/event-stream; hãy phân tích các sự kiện thay vì lưu toàn bộ phản hồi thành tệp âm thanh.

Yêu cầu

curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
  -H "Authorization: Bearer sk-your-api-key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-1-hd",
    "voice": "nova",
    "input": "Hello, welcome to TokenLab!"
  }' \
  --output speech.mp3

Mẫu giọng nói

Giọng nói khả dụng tùy theo mô hình. Các tên dưới đây chỉ là ví dụ, không phải danh sách chung cho mọi mô hình TTS.

VoiceMô tả
alloyTrung tính, cân bằng
ashĐiềm tĩnh, chuẩn mực
balladDu dương, giàu biểu cảm
coralẤm áp, cuốn hút
echoẤm áp, mang tính hội thoại
fableGiàu biểu cảm, phù hợp kể chuyện
novaThân thiện, rõ ràng
onyxTrầm, uy quyền
sageUyên bác, sâu sắc
shimmerMềm mại, dịu dàng
verseNăng động, linh hoạt

Ví dụ phản hồi

Phản hồi

200 OK
<binary audio data>

Trường quan trọng

Content-Typestring

Loại nội dung HTTP: định dạng âm thanh hoặc text/event-stream khi dùng SSE.

bodybinary | SSE

Byte âm thanh với audio; luồng sự kiện với sse. Chọn cách xử lý theo Content-Type và chế độ yêu cầu.

MiniMax Speech 2.8 Turbo tổng hợp lời thoại từ kịch bản bằng giọng được chọn, với quy trình chú trọng tốc độ. Mô hình phù hợp cho giao diện giọng nói cần phản hồi nhanh và lời thuyết minh.

{
  "model": "speech-2.8-turbo",
  "input": "Welcome to TokenLab.",
  "voice_id": "male-qn-qingse",
  "speed": 1,
  "response_format": "mp3",
  "stream_format": "audio"
}

Xác thực

BearerAuth
AuthorizationBearer <token>

Xác thực bằng Khóa API. Tạo hoặc quản lý khóa API trong Dashboard > API > API Keys.

Vị trí: header

Header

X-TokenLab-Delivery-Policy?string

Chính sách phân phối theo yêu cầu. Ghi đè các mặc định của API key và Workspace. Tự động thử TokenLab Verified trước và có thể chuyển đổi một lần sang Official chỉ trước khi xuất, chấp nhận yêu cầu hoặc tạo tài nguyên cố định.

Giá trị hợp lệ

  • "auto"
  • "verified"
  • "official"

Nội dung yêu cầu

application/json

Phản hồi

application/json

application/json

application/json

application/json

application/json

application/json