Âm thanh & thời gian thực
Tạo Giọng nói
Tạo audio từ văn bản đầu vào
Nội dung yêu cầu
Chế độ phản hồi phụ thuộc vào mô hình đã chọn và stream_format. Với đầu vào dài, đặt thời gian chờ HTTP ít nhất 120s.
Các trường tùy chọn, giọng nói, định dạng và hỗ trợ SSE phụ thuộc vào mô hình. Kiểm tra GET /v1/models/{model} trước khi gửi. Tham số không được hỗ trợ có thể trả về 400 unsupported_parameter.
tts-1ID mô hình TTS. Xem các lựa chọn hiện tại bằng GET /v1/models?recommended_for=tts.
Văn bản dùng để tạo audio. Tối đa 4096 ký tự.
Bộ chọn giọng nói. Truyền tên giọng dựng sẵn như nova, giọng Gemini như Kore, hoặc object như { "id": "voice-id" } cho giọng tuỳ chỉnh tương thích.
ID giọng nói cho mô hình hỗ trợ tham số này, chẳng hạn mô hình giọng nói MiniMax tương thích.
Chỉ dẫn style hoặc cách đọc tuỳ chọn cho các model TTS tương thích OpenAI có hỗ trợ.
Prompt style nói tuỳ chọn cho model Gemini TTS.
Mã ngôn ngữ tuỳ chọn, ví dụ en-US, cho các route Gemini, xAI và TTS tương thích.
Định dạng audio. Giá trị phổ biến gồm mp3, opus, aac, flac, wav, và pcm; giá trị được hỗ trợ khác nhau theo họ model.
audioĐịnh dạng trả về của TokenLab: audio hoặc sse. stream_format=sse không được hỗ trợ cho tts-1 hoặc tts-1-hd.
Tốc độ nói cho các họ model có hỗ trợ (0.25 đến 4.0).
Sampling temperature cho các route TTS tương thích Gemini (0 đến 2).
Phản hồi
stream_format=audio trả về các byte âm thanh. Mô hình hỗ trợ stream_format=sse trả về text/event-stream; hãy phân tích các sự kiện thay vì lưu toàn bộ phản hồi thành tệp âm thanh.
Yêu cầu
curl -X POST "https://api.tokenlab.sh/v1/audio/speech" \
-H "Authorization: Bearer sk-your-api-key" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1-hd",
"voice": "nova",
"input": "Hello, welcome to TokenLab!"
}' \
--output speech.mp3Mẫu giọng nói
Giọng nói khả dụng tùy theo mô hình. Các tên dưới đây chỉ là ví dụ, không phải danh sách chung cho mọi mô hình TTS.
| Voice | Mô tả |
|---|---|
alloy | Trung tính, cân bằng |
ash | Điềm tĩnh, chuẩn mực |
ballad | Du dương, giàu biểu cảm |
coral | Ấm áp, cuốn hút |
echo | Ấm áp, mang tính hội thoại |
fable | Giàu biểu cảm, phù hợp kể chuyện |
nova | Thân thiện, rõ ràng |
onyx | Trầm, uy quyền |
sage | Uyên bác, sâu sắc |
shimmer | Mềm mại, dịu dàng |
verse | Năng động, linh hoạt |
Phản hồi
<binary audio data>Trường quan trọng
Loại nội dung HTTP: định dạng âm thanh hoặc text/event-stream khi dùng SSE.
Byte âm thanh với audio; luồng sự kiện với sse. Chọn cách xử lý theo Content-Type và chế độ yêu cầu.
MiniMax Speech 2.8 Turbo tổng hợp lời thoại từ kịch bản bằng giọng được chọn, với quy trình chú trọng tốc độ. Mô hình phù hợp cho giao diện giọng nói cần phản hồi nhanh và lời thuyết minh.
{
"model": "speech-2.8-turbo",
"input": "Welcome to TokenLab.",
"voice_id": "male-qn-qingse",
"speed": 1,
"response_format": "mp3",
"stream_format": "audio"
}Xác thực
BearerAuth Xác thực bằng Khóa API. Tạo hoặc quản lý khóa API trong Dashboard > API > API Keys.
Vị trí: header
Header
Chính sách phân phối theo yêu cầu. Ghi đè các mặc định của API key và Workspace. Tự động thử TokenLab Verified trước và có thể chuyển đổi một lần sang Official chỉ trước khi xuất, chấp nhận yêu cầu hoặc tạo tài nguyên cố định.
Giá trị hợp lệ
- "auto"
- "verified"
- "official"
Nội dung yêu cầu
application/json
Phản hồi
application/json
application/json
application/json
application/json
application/json
application/json