Choisissez Auto, TokenLab Verified ou Official pour chaque demande, avec les prix affichés à l'avance.Voir les nouveautés

Moonshot: Kimi K3

Modèle Kimi multimodal avec 1M de contexte et un raisonnement à effort maximal activable pour le travail d'agent à long terme
Comparer les modèles
kimi-k3
DisponibleMoonshotDiscussion
Entrée / Sortie
$3.00 / $15.00
Contexte
1M
Sortie maximale
128K
Modalités
VisionDiscussion
Capacités
Utilisation d'outilsCache de promptsRaisonnement

À propos de Kimi K3

Kimi K3 est le modèle phare à poids ouverts de Moonshot AI, publié en juillet 2026 : un modèle de mélange d'experts de 2,8 billions de paramètres avec entrée native d'images et de vidéos et un contexte d'un million de jetons. La réflexion est toujours active avec un effort faible, élevé ou maximal. Il utilise Kimi Delta Attention et active 16 des 896 experts par jeton. Moonshot l'a conçu pour les agents à long horizon, les grandes bases de code et le travail intellectuel.

Points forts

  • L'effort de raisonnement peut être réglé sur faible, élevé ou maximal, de sorte qu'un seul modèle couvre les réponses rapides et la résolution de problèmes complexes.
  • Contexte d'un million de jetons, destiné aux grandes bases de code et aux longs historiques d'agents.
  • Entrée native d'images et de vidéos, permettant d'inclure des graphiques, des captures d'écran et des enregistrements dans la tâche.
  • Prend en charge la sortie JSON, l'appel d'outils avec chargement dynamique, la continuation de préfixe et la mise en cache automatique du contexte.

Quand préférer un autre modèle

  • La réflexion est toujours active, donc les échanges triviaux prennent plus de temps qu'avec un modèle sans réflexion.
  • Un modèle de cette taille est lourd à auto-héberger, même si les poids sont ouverts.
  • Le texte est la seule sortie ; utilisez un modèle séparé pour les images ou la parole.

Pour commencer

  1. Créer une clé API

    Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.

  2. Envoyez votre première requête

    Copiez l'exemple pour votre langage et lancez-le.

    Texte vers texteResponses API
    POST/v1/responses
    Format d'API:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "kimi-k3",
        "input": "Hello!"
      }'

Tarification

Le prix Verified s’applique à Verified, moins cher sur la plupart des modèles. Le prix Official est le prix publié par le fabricant du modèle et s’applique à la route Official, plus fiable. Auto facture la route qui termine la requête.

Default

Par 1M Token
Prix Official
Entrée $3.00 / Sortie $15.00 / Lecture cache $0.30 / Jetons d'écriture cache $3.00 / Texte Entrée $3.00 / Texte Sortie $15.00
Prix Verified
—
Remise
—
Tarification du cache de prompt

Lecture cache

Prix Official
$0.30
Prix Verified
—
Remise
—

Jetons d'écriture cache

Prix Official
$3.00
Prix Verified
—
Remise
—

Utilisation et activité

Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.

Utilisation et disponibilité

Dernières 24 heures
Requêtes
Taux de succès
Latence P95
Total des jetons
Performance du modèle
Taux de réussite sur 30 jours
98,8%
Requêtes sur 30 jours
100+
Dernière activité
il y a 9 minutes

Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.

Ouvrir dans Console

Ouvrez Kimi K3 dans Console avec un prompt prêt à modifier ou envoyer.

Aide-moi à tester kimi-k3 avec un message sur /v1/responses. Affiche la réponse, la latence et le coût.

Cas d'usage

Idéal pour
  • Raisonnement
  • Vision
  • Agents à long horizon

    Exécutez des agents de recherche ou d'ingénierie qui effectuent des centaines d'appels d'outils et doivent se souvenir des résultats précédents sur une très longue session.

  • Travail sur de grandes bases de code

    Naviguez et modifiez un grand dépôt en chargeant une grande partie de celui-ci dans le contexte plutôt que de compter uniquement sur la récupération.

  • Analyse de vidéos et de graphiques

    Posez des questions sur une démo enregistrée ou un graphique dense et recevez des conclusions qui citent ce qui est à l'écran.

  • Automatisation du travail intellectuel

    Rédigez des rapports et des analyses à partir de grands ensembles de documents, en utilisant des outils pour récupérer des données et vérifier des chiffres.

Exemples de prompts

Examinez le dossier de 600 pages ci-joint et listez chaque transaction avec des parties liées ainsi que son numéro de page.

Lisez ce dépôt et expliquez comment une requête circule du routeur à la base de données, en nommant chaque fichier.

Regardez cette vidéo de démonstration de produit et rédigez le rapport de bug pour l'étape où le formulaire se réinitialise.

Ce modèle a une tarification conditionnelle. Les totaux mensuels de tokens ne suffisent pas pour une estimation fiable ; utilisez la tarification détaillée selon la spécification de la requête, le cache et la fenêtre applicable.

FAQ

Qu'est-ce que Kimi K3 ?

Le modèle phare à poids ouverts de Moonshot AI, avec 2,8 billions de paramètres dans une conception de mélange d'experts. Il lit le texte, les images et les vidéos, possède un contexte d'un million de jetons et réfléchit avant de répondre avec un effort ajustable.

Quels sont les niveaux d'effort de raisonnement ?

Faible, élevé et maximal. La réflexion est toujours active, et l'effort définit à quel point le modèle délibère. Utilisez le niveau faible pour les requêtes routinières et le niveau maximal pour le débogage, la planification ou l'analyse complexes.

Kimi K3 est-il open source ?

Moonshot a publié les poids après le lancement de l'API, vous pouvez donc l'auto-héberger si vous disposez du matériel nécessaire. L'appeler via une API évite ce coût et vous permet de changer de modèle sans redéployer.

Prend-il en charge l'entrée vidéo ?

Oui. Moonshot décrit une prise en charge native des images et des vidéos, ce qui convient aux enregistrements d'écran, aux démos et aux graphiques en plus des instructions textuelles. La sortie reste du texte, les conclusions reviennent donc sous forme de réponses écrites.

En quoi est-il différent de Kimi K2.6 ?

K3 est le modèle plus récent et beaucoup plus grand, avec une fenêtre d'un million de jetons, des niveaux d'effort configurables et une mise à l'échelle plus efficace selon Moonshot. K2.6 a un contexte plus court et aucun réglage d'effort.

Combien coûte Kimi K3 ?

Sur TokenLab, Kimi K3 coûte Entrée $3.00 / Sortie $15.00 Par 1M Token. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.

Quelles sont les limites de contexte et de sortie de Kimi K3 ?

Kimi K3 accepte jusqu'à 1 048 576 jetons de contexte et génère jusqu'à 131 072 jetons par réponse.

Quel endpoint Kimi K3 doit-il utiliser ?

Utilisez https://api.tokenlab.sh/v1/responses pour Kimi K3. L'exemple de requête ci-dessous montre la structure de code correspondante.

Quelles opérations Kimi K3 prend-il en charge ?

Kimi K3 prend en charge Texte vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.

Comparer Kimi K3

Sources

Mis à jour le 2 oct. 2026

Plus de la série Kimi

Modèles associés