Escolha Auto, TokenLab Verified ou Official para cada solicitação, com preços exibidos antecipadamente.Veja as novidades

Moonshot: Kimi K3

Modelo Kimi multimodal com 1M de contexto e raciocínio de esforço máximo alternável para trabalho de agente de longo prazo
Comparar modelos
kimi-k3
DisponívelMoonshotChat
Entrada / Saída
$3.00 / $15.00
Contexto
1M
Saída máxima
128K
Modalidades
VisãoChat
Capacidades
Uso de ferramentasCache de promptsRaciocínio

Sobre o Kimi K3

O Kimi K3 é o carro-chefe de pesos abertos da Moonshot AI, lançado em julho de 2026: um modelo de mistura de especialistas (MoE) de 2,8 trilhões de parâmetros com entrada nativa de imagem e vídeo e um contexto de um milhão de tokens. O pensamento está sempre ativado com esforço baixo, alto ou máximo. Ele usa Kimi Delta Attention e ativa 16 de 896 especialistas por token. A Moonshot o construiu para agentes de longo prazo, grandes bases de código e trabalho intelectual.

Pontos fortes

  • O esforço de raciocínio pode ser definido como baixo, alto ou máximo, para que um único modelo cubra desde respostas rápidas até a resolução de problemas complexos.
  • Contexto de um milhão de tokens, voltado para grandes bases de código e longos históricos de agentes.
  • Entrada nativa de imagem e vídeo, para que gráficos, capturas de tela e gravações possam fazer parte da tarefa.
  • Suporta saída JSON, chamadas de ferramentas com carregamento dinâmico, continuação de prefixo e cache automático de contexto.

Quando usar outro modelo

  • O pensamento está sempre ativado, então turnos triviais custam mais tempo do que um modelo sem pensamento custaria.
  • Um modelo deste tamanho é pesado para auto-hospedagem, mesmo que os pesos sejam abertos.
  • Texto é a única saída; use um modelo separado para imagens ou fala.

Primeiros passos

  1. Criar chave de API

    Crie uma chave no Console e use com qualquer modelo da plataforma.

  2. Envie sua primeira requisição

    Copie o exemplo para sua linguagem e execute-o no endpoint.

    Texto para textoResponses API
    POST/v1/responses
    Formato da API:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "kimi-k3",
        "input": "Hello!"
      }'

Preço

O preço Verified vale para o Verified, que custa menos na maioria dos modelos. O preço Official é o preço publicado pelo fabricante do modelo e vale para a rota Official, mais confiável. O Auto cobra pela rota que conclui a solicitação.

Default

Por 1M Token
Preço Official
Entrada $3.00 / Saída $15.00 / Leitura de cache $0.30 / Escrita de cache $3.00 / Texto Entrada $3.00 / Texto Saída $15.00
Preço Verified
—
Desconto
—
Preços de cache de prompt

Leitura de cache

Preço Official
$0.30
Preço Verified
—
Desconto
—

Escrita de cache

Preço Official
$3.00
Preço Verified
—
Desconto
—

Uso e atividade

A taxa de sucesso é a proporção de requisições concluídas. A latência é quanto tempo uma resposta completa leva; P95 significa que 95% das requisições terminaram dentro desse tempo.

Uso e disponibilidade

Últimas 24 horas
Requisições
Taxa de sucesso
Latência P95
Total de tokens
Desempenho do modelo
Taxa de sucesso em 30 dias
99,2%
Requisições em 30 dias
100+
Última atividade
há 6 minutos

Os dados baseiam-se em solicitações agregadas de usuários, excluindo verificações de status.

Abrir no Console

Abra Kimi K3 no Console com um prompt pronto para editar ou enviar.

Ajude-me a testar kimi-k3 com uma mensagem em /v1/responses. Exiba a resposta, latência e custo.

Casos de uso

Indicado para
  • Raciocínio
  • Visão
  • Agentes de longo prazo

    Execute agentes de pesquisa ou engenharia que fazem centenas de chamadas de ferramentas e precisam lembrar de resultados anteriores ao longo de uma sessão muito longa.

  • Trabalho em grandes bases de código

    Navegue e altere um grande repositório carregando grande parte dele no contexto, em vez de confiar apenas na recuperação.

  • Análise de vídeo e gráficos

    Faça perguntas sobre uma demonstração gravada ou um gráfico denso e receba descobertas que citam o que está na tela.

  • Automação de trabalho intelectual

    Redija relatórios e análises a partir de grandes conjuntos de documentos, usando ferramentas para buscar dados e verificar números.

Exemplos de prompt

Revise o documento de 600 páginas anexado e liste todas as transações com partes relacionadas com seu número de página.

Leia este repositório e explique como uma solicitação flui do roteador para o banco de dados, nomeando cada arquivo.

Assista a este vídeo de demonstração do produto e escreva o relatório de bug para a etapa em que o formulário é redefinido.

Este modelo tem preço condicional. Totais mensais de tokens sozinhos não produzem uma estimativa confiável; use o preço detalhado para a especificação da requisição, cache e janela aplicável.

FAQ

O que é o Kimi K3?

O modelo carro-chefe de pesos abertos da Moonshot AI, com 2,8 trilhões de parâmetros em um design de mistura de especialistas. Ele lê texto, imagens e vídeo, possui um contexto de um milhão de tokens e pensa antes de responder com esforço ajustável.

Quais são os níveis de esforço de raciocínio?

Baixo, alto e máximo. O pensamento está sempre ativado, e o esforço define o quanto o modelo delibera. Use baixo para solicitações de rotina e máximo para depuração, planejamento ou análise complexos.

O Kimi K3 é código aberto?

A Moonshot publicou os pesos após o lançamento da API, então você pode auto-hospedar se tiver o hardware. Chamá-lo por meio de uma API evita esse custo e permite que você alterne modelos sem reimplantar.

Ele suporta entrada de vídeo?

Sim. A Moonshot descreve suporte nativo para imagens e vídeos, o que é adequado para gravações de tela, demonstrações e gráficos junto com instruções de texto. A saída permanece em texto, portanto, as descobertas retornam como respostas escritas.

Como ele é diferente do Kimi K2.6?

O K3 é o modelo mais novo e muito maior, com uma janela de um milhão de tokens, níveis de esforço configuráveis e um escalonamento mais eficiente, segundo a Moonshot. O K2.6 tem um contexto mais curto e nenhuma configuração de esforço.

Quanto custa o Kimi K3?

No TokenLab, Kimi K3 custa Entrada $3.00 / Saída $15.00 Por 1M Token. A tabela de preços acima mostra o detalhamento completo. As tarifas dependem da unidade de cobrança, da especificação e do uso. Compare condições iguais no preço detalhado do modelo; uma única tarifa não determina o custo total.

Qual a janela de contexto e o limite de saída do Kimi K3?

O Kimi K3 aceita até 1.048.576 tokens de contexto e gera até 131.072 tokens por resposta.

Qual endpoint o Kimi K3 deve usar?

Use https://api.tokenlab.sh/v1/responses para Kimi K3. O exemplo de requisição abaixo mostra o formato de código correspondente.

Quais operações o Kimi K3 suporta?

Kimi K3 suporta Texto para texto. Selecione uma operação acima para ver seu endpoint e exemplo de requisição.

Comparar Kimi K3

Fontes

Revisado em 2 de out. de 2026

Mais da série Kimi

Modelos relacionados