A maioria das equipes que busca uma alternativa ao Together AI não precisa de um cluster de GPU diferente; elas precisam de menos partes móveis. A própria documentação do Together descreve inferência serverless por token, além de produtos separados de fine-tuning, throughput provisionado e dedicado. O TokenLab documenta um saldo único, uma chave de API e quatro formatos de requisição. Lemos ambos os conjuntos de documentação em 03/10/2026 e reescrevemos este artigo com base no que eles realmente declaram. Vários números na versão anterior estavam incorretos, então nós os substituímos.
Principais conclusões
- Ambas as APIs aceitam Chat Completions no estilo OpenAI. O Together usa
https://api.together.ai/v1; o TokenLab usahttps://api.tokenlab.sh/v1(documentação observada em 03/10/2026). - O TokenLab documenta limites por chave de 1.000 requisições por minuto para o nível User. A página do Together que lemos não fornece um limite numérico e define o desempenho serverless como "best-effort" (melhor esforço).
- Nos três modelos que conseguimos comparar por nome, os preços são iguais para o
glm-5.2e menores no Together para oqwen3.7-plus. Odeepseek-v4-prodepende da hora do dia e de qual build do Together você compara. - O TokenLab documenta opções de entrega (
auto,verified,official) e regras de retry. Ele não documenta failover entre modelos, portanto, não prometemos essa funcionalidade. - Permaneça no Together se você precisar da API de fine-tuning, Batch API, endpoints dedicados ou throughput provisionado com SLA.
Alternativa ao Together AI: o que a documentação diz lado a lado
Comparamos apenas o que ambos os fornecedores publicam. Onde uma célula está sem números, a documentação que lemos não forneceu nenhum.
| Item | Together AI | TokenLab | Fonte e data observada |
|---|---|---|---|
| URL Base | https://api.together.ai/v1 |
https://api.tokenlab.sh/v1 (SDK da Anthropic e Gemini usam https://api.tokenlab.sh) |
Compatibilidade OpenAI do Together, Guias de migração do TokenLab; 03/10/2026 |
| Compatibilidade de API | Chamadas de SDK da OpenAI para chat, completions, embeddings, imagens, fala, transcrição; Assistants e batches no formato OpenAI não são suportados | Chat Completions, Responses, Anthropic Messages, Gemini generateContent; cada modelo lista seus accepted_request_formats |
Mesmas duas páginas mais Formatos de API; 03/10/2026 |
| Limites de taxa (Rate limits) | Sem limite numérico na página; 429 ou 503 sob alta demanda; throughput provisionado para garantias |
Por chave de API: User 1.000, Partner 10.000, VIP 10.000 requisições por minuto | Limites de taxa do Together, Limites de taxa do TokenLab; 03/10/2026 |
glm-5.2 por 1M de tokens |
Entrada $1.40, saída $4.40 (zai-org/GLM-5.2) |
Entrada $1.4, saída $4.4 | Modelos do Together, API de modelos do TokenLab; 03/10/2026 |
qwen3.7-plus por 1M de tokens |
Entrada $0.32, saída $1.28 (Qwen/Qwen3.7-Plus) |
Entrada $0.4, saída $1.6 até 256.000 tokens de entrada; $1.2 e $4.8 até 1.000.000 | Modelos do Together, API de modelos do TokenLab; 03/10/2026 |
deepseek-v4-pro por 1M de tokens |
Entrada $1.32, saída $3.96 (deepseek-ai/DeepSeek-V4-Pro-0813) |
Fora de pico $0.66 e $1.98; pico $1.32 e $3.96 | Modelos do Together, API de modelos do TokenLab; 03/10/2026 |
Três ressalvas se aplicam às linhas de preço:
- A janela de pico do TokenLab é das 09:00 às 12:00 e das 14:00 às 18:00 no horário de Pequim. A página do Together lista um preço para o DeepSeek e um build específico "0813", portanto, as duas linhas podem não descrever o modelo idêntico.
- Os preços de leitura de cache também são iguais no
glm-5.2: $0,26 por 1M de tokens em ambos os lados. glm-5.2,deepseek-v4-proeqwen3.7-plusmostramverified: false, official: trueno TokenLab. Isso é importante para a seção de entrega abaixo.
Aqui está uma estimativa calculada para 10M de tokens de entrada e 2M de saída do qwen3.7-plus, com cada prompt abaixo de 256.000 tokens:
- TokenLab: 10 × $0,4 + 2 × $1,6 = $7,20.
- Together: 10 × $0,32 + 2 × $1,28 = $5,76.
Ambos os valores são estimativas baseadas nos preços de lista. Eles excluem cache e impostos. A documentação do TokenLab diz que o menor preço por token nem sempre é o menor custo por tarefa concluída, portanto, compare o custo final em "Usage" com seus próprios prompts.
A versão anterior deste artigo também listava taxas do TokenLab para gpt-5.5, claude-sonnet-5 e deepseek-v4-pro que não correspondem à API de modelos ativa. Em 03/10/2026, a API mostrava estes preços:
| Modelo | Entrada por 1M | Saída por 1M | Máx tokens de entrada | Fonte |
|---|---|---|---|---|
gpt-5.5 |
$1.5 | $9 | 1.000.000 | API de modelos |
claude-sonnet-5 |
$0.9 | $4.5 | 1.000.000 | API de modelos |
A documentação diz para não codificar (hard-code) uma tabela de preços copiada, e concordamos. Removemos as linhas dos modelos cujos preços não conseguimos confirmar.
Opções de entrega e retries no TokenLab
O TokenLab documenta três opções de entrega, escolhidas por requisição com o header X-TokenLab-Delivery-Policy (auto, verified ou official). Um header de requisição substitui a configuração da chave de API, que substitui o padrão do Workspace (referência da API, observado em 03/10/2026).
TokenLab Verifiedé a entrega verificada pelo TokenLab, aos preços do TokenLab.Officialbaseia-se no preço público do criador do modelo.Autousa Verified quando disponível, depois Official se necessário. Você paga pela opção que conclui a requisição.
Cada requisição concluída é cobrada uma vez, pela opção que produziu o resultado (faturamento). Um header inválido retorna 400. Se a opção solicitada não estiver disponível, você recebe 503 delivery_tier_unavailable com um ID de requisição. Quando a operação não tem oferta, retryable é false, e você não deve repetir a requisição sem alterações.
A documentação descreve retries por código de status (tratamento de erros, limites de taxa):
| Status | Ação documentada |
|---|---|
400, 401, 402, 403, 404, 413 |
Não repetir; altere a requisição, chave, saldo, permissões ou entrada |
429 |
Tente novamente após o atraso Retry-After; use exponential backoff com jitter se estiver ausente |
500-504 |
Tente novamente apenas quando retryable for true; respeite retry_after e limite as tentativas |
Dois detalhes adicionais nos ajudaram. Os clientes de quickstart definem max_retries=0, portanto, a política de retry permanece no seu código. Requisições de criação assíncronas (vídeo, música, 3D) não devem ser repetidas antes de verificar se uma tarefa já existe. Não encontramos nenhum valor documentado de latência de gateway ou failover automático entre modelos, então removemos a antiga alegação de 15-40ms e a promessa de failover.
Snippet de migração: uma completion em cada API
Usamos o glm-5.2 porque ambos os fornecedores o listam. A string de modelo do Together segue <provider>/<model_name>; os IDs do TokenLab não possuem prefixo de provedor.
import os
from openai import OpenAI
together = OpenAI(
api_key=os.environ["TOGETHER_API_KEY"],
base_url="https://api.together.ai/v1",
)
tokenlab = OpenAI(
api_key=os.environ["TOKENLAB_API_KEY"],
base_url="https://api.tokenlab.sh/v1",
timeout=30.0,
max_retries=0,
)
messages = [{"role": "user", "content": "Reply only with OK."}]
a = together.chat.completions.create(model="zai-org/GLM-5.2", messages=messages)
b = tokenlab.chat.completions.create(model="glm-5.2", messages=messages)
print(a.choices[0].message.content)
print(b.choices[0].message.content)
Fontes: Compatibilidade OpenAI do Together e Quickstart do TokenLab, ambos observados em 03/10/2026. Confirme o ID do modelo com GET /v1/models antes de enviar tráfego. Se você vem do OpenRouter, o guia de migração diz para trocar a URL base e remover o prefixo do provedor dos IDs dos modelos.
Quem deve ficar e quem deve escolher uma alternativa ao Together AI
Permaneça no Together AI se você precisar do que a documentação dele lista e a do TokenLab não:
- A API de fine-tuning nativa do Together e a Batch API.
- Um catálogo dedicado de inferência de modelos.
- Throughput provisionado, que reserva capacidade sob um SLA definido.
A página de compatibilidade OpenAI do Together marca fine_tuning.jobs.* e batches.* como não suportados no formato OpenAI, portanto, essas cargas de trabalho usam as APIs próprias do Together. Não encontramos nada nas evidências sobre hospedar pesos personalizados no TokenLab. Verifique a página de modelos em tokenlab.sh/models ou pergunte a support@tokenlab.sh antes de planejar com base nisso.
O TokenLab se encaixa melhor quando suas necessidades correspondem a estas diferenças documentadas:
- Você quer um saldo único entre modelos, sem assinatura ou gasto mínimo.
- Você precisa de campos de Anthropic Messages (thinking, uso de ferramentas Claude) ou
contentsnativos do Gemini na mesma chave. - Você quer escolher a entrega Verified, Official ou Auto por requisição.
- Você quer a API de OpenAI Responses em modelos que listam
openai_responses.
Imagine uma equipe que já chama gpt-5.5 e claude-sonnet-5. Ambos os modelos listam openai_chat_completions como formato aceito, então um cliente OpenAI cobre ambos. O modelo de pesos abertos de um terceiro fornecedor, como o glm-5.2, utiliza o mesmo cliente e o mesmo saldo. Um modelo híbrido também funciona: o tráfego de fine-tuning permanece no Together, e todo o resto passa por uma única chave do TokenLab. Nossa página de comparação tem mais informações sobre roteamento e cobertura.
Além do texto: imagens, vídeo e código
O TokenLab documenta /v1/images/generations, /v1/videos/generations, /v1/music/generations e /v1/3d/generations. Jobs assíncronos retornam um task_id e poll_url, e o faturamento é reconciliado através de billing_transaction_id. O Together lista seus próprios modelos de imagem e diz que o vídeo é nativo do Together. Não comparamos preços de mídia porque as evidências não possuem taxas de mídia correspondentes no TokenLab. Para escolhas de modelos, veja nossos guias para a melhor API de modelos de imagem de IA 2026, a melhor API de modelos de vídeo de IA 2026 e os melhores modelos de IA para codificação 2026. A disponibilidade no catálogo, por exemplo kimi-k2.7-code, não é um resultado de benchmark. Teste em suas próprias tarefas.
FAQ
Posso manter meu código do SDK da OpenAI quando mudar do Together AI para o TokenLab?
Na maioria das vezes, sim. Altere a base_url para https://api.tokenlab.sh/v1, troque a chave e escolha um ID de modelo em GET /v1/models. O guia do TokenLab diz que o código existente de retry, timeout e streaming geralmente pode ser mantido. Campos exclusivos de outro formato de API não são garantidos em Chat Completions.
O TokenLab faz failover para outro provedor automaticamente?
A documentação que lemos descreve opções de entrega, não failover entre modelos. O Auto tenta o TokenLab Verified, depois o Official, e você paga pela opção que conclui a requisição. Se nenhum tiver oferta, você recebe 503 delivery_tier_unavailable, e retryable indica se você deve tentar novamente.
O TokenLab é mais barato que o Together AI para o mesmo modelo?
Nem sempre. Em 03/10/2026, o glm-5.2 custava $1,4 de entrada e $4,4 de saída em ambos. O qwen3.7-plus era mais barato no Together ($0,32 e $1,28 contra $0,4 e $1,6 no TokenLab). Compare o custo final na sua própria carga de trabalho.
Preciso mover todo o meu tráfego de uma vez?
Não. As duas APIs usam URLs base e chaves separadas, então você pode enviar uma carga de trabalho pelo TokenLab e deixar o resto no Together. Mova um único modelo primeiro e verifique seu custo em "Usage".
Compare sua carga de trabalho atual do Together AI com o TokenLab na página de comparação, ou leia nossa comparação com o OpenRouter e a lista de modelos.
Fontes
Preço observado em 2026-10-03
- TokenLab Docs: QuickstartObservado em 2026-10-03
- TokenLab Docs: API formatsObservado em 2026-10-03
- TokenLab Docs: Billing and pricingObservado em 2026-10-03
- TokenLab Docs: Rate limitsObservado em 2026-10-03
- TokenLab Docs: Migration GuidesObservado em 2026-10-03
- TokenLab Docs: Handle API errorsObservado em 2026-10-03
- TokenLab Docs: API ReferenceObservado em 2026-10-03
- TokenLab live model API: gpt-5.5Observado em 2026-10-03



