MiniMax: MiniMax-M3
minimax-m3- Entrée / Sortie
- $0.30 / $1.20
- Contexte
- 1M
- Sortie maximale
- 512K
- Modalités
- Discussion
- Capacités
- Utilisation d'outilsCache de prompts
À propos de MiniMax-M3
MiniMax-M3 est le modèle à poids ouverts de MiniMax, sorti en juin 2026, destiné au codage, au travail agentique et aux tâches à long contexte. Il utilise l'attention creuse (Sparse Attention) de MiniMax pour rendre les entrées très longues abordables, raisonne avant de répondre, appelle des outils et met en cache les invites (prompts). Il s'agit du modèle de pointe de la série M de l'entreprise et du successeur du M2.7.
Points forts
- L'attention creuse (Sparse Attention) de MiniMax réduit le calcul par jeton sur les entrées très longues par rapport à la génération précédente.
- Cible la décomposition autonome des tâches, l'invocation d'outils et le raisonnement en plusieurs étapes pour les agents.
- Les poids ouverts sont publiés par MiniMax, ce qui permet de vérifier le comportement par rapport à une copie auto-hébergée.
- Le raisonnement, l'utilisation d'outils et la mise en cache des invites peuvent tous être activés pour les longues boucles d'agents.
Quand préférer un autre modèle
- Entrée texte uniquement ; les graphiques et les captures d'écran ne peuvent donc pas être lus directement.
- Le raisonnement et une entrée très longue rendent les requêtes plus lentes que les modèles M2.x à haute vitesse.
Pour commencer
Créer une clé API
Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.
Envoyez votre première requête
Copiez l'exemple pour votre langage et lancez-le.
Texte vers texteResponses APIPOST/v1/responsesFormat d'API:curl https://api.tokenlab.sh/v1/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "minimax-m3", "input": "Hello!" }'
Tarification
Le prix Verified s’applique à Verified, moins cher sur la plupart des modèles. Le prix Official est le prix publié par le fabricant du modèle et s’applique à la route Official, plus fiable. Auto facture la route qui termine la requête.
Entrée tokens <= 512K
Par 1M Token- Prix Official
- Entrée $0.30 / Sortie $1.20 / Lecture cache $0.06
- Prix Verified
- —
- Remise
- —
Entrée tokens > 512K
Par 1M Token- Prix Official
- Entrée $0.60 / Sortie $2.40 / Lecture cache $0.12
- Prix Verified
- —
- Remise
- —
Lecture cache
- Prix Official
- $0.06
- Prix Verified
- —
- Remise
- —
| Prix OfficialPar 1M Token | Prix VerifiedPar 1M Token | Remise | |
|---|---|---|---|
| Entrée tokens <= 512K | Entrée $0.30 / Sortie $1.20 / Lecture cache $0.06 | — | — |
| Entrée tokens > 512K | Entrée $0.60 / Sortie $2.40 / Lecture cache $0.12 | — | — |
| Tarification du cache de prompt | |||
| Lecture cache | $0.06 | — | — |
Utilisation et activité
Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.
Utilisation et disponibilité
Dernières 24 heures- Requêtes
- Taux de succès
- Latence P95
- Total des jetons
- Taux de réussite sur 30 jours
- 100,0%
- Requêtes sur 30 jours
- 100+
- Dernière activité
- avant-hier
Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.
Ouvrir dans Console
Ouvrez MiniMax-M3 dans Console avec un prompt prêt à modifier ou envoyer.
Aide-moi à tester minimax-m3 avec un message sur /v1/responses. Affiche la réponse, la latence et le coût.
Cas d'usage
Travail sur l'ensemble du dépôt
Chargez une base de code volumineuse et demandez au modèle de retracer un changement à travers les modules avant de procéder à l'édition.
Agents de planification
Donnez à un agent un ensemble d'outils et un objectif, et laissez-le décomposer la tâche et appeler les outils étape par étape.
Analyse de documents longs
Examinez des transcriptions, des spécifications ou des documents longs en une seule fois plutôt que de les découper.
Exemples de prompts
Voici le dépôt complet. Où la logique de nouvelle tentative (retry) est-elle implémentée, et qu'est-ce qui casse si je modifie son backoff ?
Voici la chronologie de l'incident et les journaux de service. Rédigez les étapes pour reproduire le bug et nommez le module probablement défectueux.
Planifiez la manière de diviser ce monolithe en trois services, et nommez le premier appel d'outil que vous feriez pour chacun.
Ce modèle a une tarification conditionnelle. Les totaux mensuels de tokens ne suffisent pas pour une estimation fiable ; utilisez la tarification détaillée selon la spécification de la requête, le cache et la fenêtre applicable.
FAQ
Qu'est-ce qui différencie MiniMax-M3 du M2.7 ?
MiniMax présente le M3 comme une nouvelle génération construite autour de l'attention creuse pour un contexte très long et destinée au codage et aux tâches agentiques, là où le M2.7 cible les harnais d'agents antérieurs.
Le MiniMax-M3 est-il à poids ouverts ?
MiniMax publie le M3 en tant que modèle à poids ouverts, vous pouvez donc l'auto-héberger si vos règles de données l'exigent. Lisez la licence sur la fiche du modèle avant de le faire.
Accepte-t-il les images et la vidéo ?
Non. Le MiniMax-M3 accepte uniquement les entrées texte ; utilisez donc un modèle avec entrée image lorsque vous avez besoin de lire directement des captures d'écran, des graphiques, des diagrammes ou des images vidéo.
Peut-il utiliser des outils ?
Oui. Il appelle des outils, et MiniMax le destine à la planification d'agents, où une tâche est décomposée en étapes et un outil est invoqué à chacune d'elles. Transmettez vos définitions d'outils avec la requête et laissez le modèle décider quand les appeler.
Quand dois-je utiliser le M3 plutôt qu'un modèle M2.x à haute vitesse ?
Choisissez le M3 pour les entrées très longues ou la planification d'agents plus complexe. Choisissez une variante M2.x à haute vitesse lorsque le délai de chaque tour compte plus que la profondeur du raisonnement.
Combien coûte MiniMax-M3 ?
Sur TokenLab, MiniMax-M3 coûte Entrée $0.30 / Sortie $1.20 Par 1M Token. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.
Quelles sont les limites de contexte et de sortie de MiniMax-M3 ?
MiniMax-M3 accepte jusqu'à 1 048 576 jetons de contexte et génère jusqu'à 524 288 jetons par réponse.
Quel endpoint MiniMax-M3 doit-il utiliser ?
Utilisez https://api.tokenlab.sh/v1/responses pour MiniMax-M3. L'exemple de requête ci-dessous montre la structure de code correspondante.
Quelles opérations MiniMax-M3 prend-il en charge ?
MiniMax-M3 prend en charge Texte vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.
Comparer MiniMax-M3
Sources
Mis à jour le 2 oct. 2026