Google: Gemma 4 31B
gemma-4-31b- Entrée / Sortie
- $0.102 / $0.297
- Modalités
- Discussion
À propos de Gemma 4 31B
Gemma 4 31B est le plus grand modèle dense de la famille Gemma 4 de Google, aux poids ouverts, lancée en mars 2026 avec des tailles allant de E2B à 31B. Google décrit cette famille comme étant conçue pour le raisonnement, les flux de travail agentiques, le codage et la compréhension multimodale. Contrairement aux modèles propriétaires Gemini, ses poids sont publiés, ce qui permet d'exécuter le même modèle sur votre propre matériel.
Points forts
- Les poids ouverts vous permettent de déplacer le même modèle entre des configurations hébergées et auto-hébergées.
- La taille dense 31B cible une qualité de raisonnement et de codage que les plus petites tailles de Gemma 4 ne permettent pas d'atteindre.
- La fiche technique de Google rapporte des résultats solides sur les benchmarks de raisonnement et de codage tels que MMLU Pro et LiveCodeBench v6.
- Couverture multilingue dans plus de 140 langues.
Quand préférer un autre modèle
- Il fonctionne uniquement avec du texte et ne dispose pas d'appel d'outils ; les flux de travail d'agents sont donc mieux servis par un modèle Gemini.
- Il est moins performant que les modèles Gemini 3.x Pro et Flash sur les tâches autonomes longues.
Pour commencer
Créer une clé API
Générez une clé dans Console et utilisez-la avec tous les modèles de la plateforme.
Envoyez votre première requête
Copiez l'exemple pour votre langage et lancez-le.
Texte vers texteChat Completions APIPOST/v1/chat/completionscurl https://api.tokenlab.sh/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer sk-xxx" \ -d '{ "model": "gemma-4-31b", "messages": [ {"role": "user", "content": "Hello!"} ] }'
Tarification
Le tarif officiel est la référence publique du créateur du modèle. Le tarif TokenLab est ce que vous payez pour ce modèle sur TokenLab.
Spécification par défaut
Par 1M Token- Tarif Official
- Entrée $0.102 / Sortie $0.297 / Lecture cache $0.012
- Official
- Entrée $0.102 / Sortie $0.297 / Lecture cache $0.012
- Remise
- —
Lecture cache
- Tarif Official
- $0.012
- Official
- $0.012
- Remise
- —
| Tarif OfficialPar 1M Token | OfficialPar 1M Token | Remise | |
|---|---|---|---|
| Spécification par défaut | Entrée $0.102 / Sortie $0.297 / Lecture cache $0.012 | Entrée $0.102 / Sortie $0.297 / Lecture cache $0.012 | — |
| Tarification du cache de prompt | |||
| Lecture cache | $0.012 | $0.012 | — |
Utilisation et activité
Le taux de réussite est la part de requêtes abouties. La latence est la durée d'une réponse complète ; P95 signifie que 95 % des requêtes ont fini dans ce délai.
Utilisation et disponibilité
Dernières 24 heures- Requêtes
- Taux de succès
- Latence P95
- Total des jetons
Les données sont basées sur les requêtes agrégées des utilisateurs, à l'exclusion des vérifications de statut.
Ouvrir dans Console
Ouvrez Gemma 4 31B dans Console avec un prompt prêt à modifier ou envoyer.
Aide-moi à tester gemma-4-31b avec un message sur /v1/chat/completions. Affiche la réponse, la latence et le coût.
Cas d'usage
Assistant auto-hébergeable
Prototypez avec le modèle hébergé, puis passez à vos propres GPU si les règles relatives aux données l'exigent.
Chat multilingue
Répondez aux utilisateurs dans de nombreuses langues à partir d'un seul modèle, ce qui simplifie les outils de support par rapport à l'utilisation de traducteurs séparés.
Explication de code
Examinez des extraits et écrivez des fonctions dans des environnements où un modèle à poids ouverts est requis pour des raisons de politique ou d'hébergement.
Base de réglage fin (fine-tuning)
Comparez une base de référence hébergée avant d'adapter les poids ouverts à votre domaine.
Exemples de prompts
Traduisez ce paragraphe en espagnol, allemand et japonais et notez toute expression idiomatique que vous avez dû reformuler.
Expliquez ce que fait cette requête SQL, puis réécrivez-la pour éviter la sous-requête corrélée.
Rédigez une réponse courte et polie déclinant cette demande de réunion et proposant la semaine prochaine.
Ce modèle a une tarification conditionnelle. Les totaux mensuels de tokens ne suffisent pas pour une estimation fiable ; utilisez la tarification détaillée selon la spécification de la requête, le cache et la fenêtre applicable.
FAQ
Gemma 4 31B est-il open source ?
Google publie les poids sous les conditions Gemma, ce qui en fait un modèle à poids ouverts. Lisez la licence sur la fiche du modèle avant toute utilisation commerciale, car il s'agit de la licence propre à Gemma.
En quoi Gemma est-il différent de Gemini ?
Les modèles Gemini sont la gamme propriétaire hébergée de Google. Les modèles Gemma sont des modèles plus petits à poids ouverts, issus de recherches connexes, que vous pouvez télécharger, affiner et exécuter vous-même.
Prend-il en charge l'appel d'outils ?
Non. Le modèle hébergé gère uniquement le chat textuel, avec une entrée et une sortie de texte, sans appel d'outils. Pour les agents qui appellent des fonctions, utilisez plutôt un modèle Gemini.
Quelle est la taille du modèle ?
Environ 31 milliards de paramètres, dense, le plus grand des cinq modèles Gemma 4 : E2B, E4B, 12B, 26B A4B et 31B. Les plus petites tailles ciblent les téléphones et les ordinateurs portables.
Combien coûte Gemma 4 31B ?
Sur TokenLab, Gemma 4 31B coûte Entrée $0.102 / Sortie $0.297 Par 1M Token. La table tarifaire ci-dessus en montre le détail complet. Les tarifs dépendent de l’unité de facturation, de la spécification et de l’usage. Comparez des conditions identiques dans la tarification détaillée du modèle ; un tarif seul ne détermine pas le coût total.
Quel endpoint Gemma 4 31B doit-il utiliser ?
Utilisez https://api.tokenlab.sh/v1/chat/completions pour Gemma 4 31B. L'exemple de requête ci-dessous montre la structure de code correspondante.
Quelles opérations Gemma 4 31B prend-il en charge ?
Gemma 4 31B prend en charge Texte vers texte. Sélectionnez une opération pour voir l'endpoint et un exemple.
Comparer Gemma 4 31B
Sources
Mis à jour le 2 oct. 2026