Elija Auto, TokenLab Verified o Official para cada solicitud, con los precios mostrados por adelantado.Ver las novedades

MiniMax: MiniMax-M3

Modelo multimodal MiniMax para codificación de contexto largo, percepción y planificación de agentes
Comparar modelos
minimax-m3
DisponibleMiniMaxChat
Entrada / Salida
$0.30 / $1.20
Contexto
1M
Salida máxima
512K
Modalidades
Chat
Capacidades
Uso de herramientasCaché de prompts

Sobre MiniMax-M3

MiniMax-M3 es el modelo de pesos abiertos de MiniMax de junio de 2026 para programación, trabajo con agentes y tareas de contexto largo. Utiliza MiniMax Sparse Attention para mantener asequibles las entradas muy largas, razona antes de responder, llama a herramientas y almacena prompts en caché. Es el modelo de frontera de la serie M de la compañía y el sucesor de M2.7.

Puntos fuertes

  • MiniMax Sparse Attention reduce el cómputo por token en entradas muy largas en comparación con la generación anterior.
  • Se centra en la descomposición autónoma de tareas, la invocación de herramientas y el razonamiento de varios pasos para agentes.
  • Los pesos abiertos son publicados por MiniMax, por lo que el comportamiento puede verificarse con una copia autohospedada.
  • El razonamiento, el uso de herramientas y el almacenamiento en caché de prompts pueden activarse para bucles de agentes largos.

Cuándo buscar otra opción

  • Solo entrada de texto, por lo que los gráficos y capturas de pantalla no se pueden leer directamente.
  • El razonamiento y una entrada muy larga hacen que las solicitudes sean más lentas que los modelos M2.x de alta velocidad.

Primeros pasos

  1. Crear clave API

    Genera una clave en Console y úsala con cualquier modelo de la plataforma.

  2. Envía tu primera solicitud

    Copia el ejemplo para tu lenguaje y ejecútalo contra el endpoint.

    Texto a textoResponses API
    POST/v1/responses
    Formato de API:
    curl https://api.tokenlab.sh/v1/responses \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer sk-xxx" \
      -d '{
        "model": "minimax-m3",
        "input": "Hello!"
      }'

Precios

El precio Verified se aplica a Verified, que cuesta menos en la mayoría de los modelos. El precio Official es el precio publicado por el fabricante del modelo y se aplica a la ruta Official, más fiable. Auto factura la ruta que completa la solicitud.

Entrada tokens <= 512K

Por 1M Token
Precio Official
Entrada $0.30 / Salida $1.20 / Lectura de caché $0.06
Precio Verified
—
Descuento
—

Entrada tokens > 512K

Por 1M Token
Precio Official
Entrada $0.60 / Salida $2.40 / Lectura de caché $0.12
Precio Verified
—
Descuento
—
Precios de caché de prompt

Lectura de caché

Precio Official
$0.06
Precio Verified
—
Descuento
—

Uso y actividad

La tasa de éxito es la proporción de solicitudes completadas. La latencia es cuánto tarda una respuesta completa; P95 significa que el 95 % de las solicitudes terminaron dentro de ese tiempo.

Uso y disponibilidad

Últimas 24 horas
Solicitudes
Tasa de éxito
Latencia P95
Total de tokens
Desempeño del modelo
Tasa de éxito 30 días
100,0%
Solicitudes 30 días
100+
Última actividad
anteayer

Los datos se basan en solicitudes de usuario agregadas, excluyendo las comprobaciones de estado.

Abrir en Console

Abre MiniMax-M3 en Console con un prompt listo para editar o enviar.

Ayúdame a probar minimax-m3 con un mensaje breve en /v1/responses. Muestra la respuesta, la latencia y el coste.

Casos de uso

  • Trabajo en todo el repositorio

    Cargue una base de código grande y haga que el modelo rastree un cambio a través de los módulos antes de editar.

  • Agentes de planificación

    Proporcione a un agente un conjunto de herramientas y un objetivo, y deje que descomponga la tarea y llame a las herramientas paso a paso.

  • Análisis de documentos largos

    Revise transcripciones, especificaciones o documentos extensos en una sola pasada en lugar de fragmentarlos.

Ejemplos de prompts

Aquí está el repositorio completo. ¿Dónde se implementa la lógica de reintento y qué se rompe si cambio su backoff?

Aquí está la cronología del incidente y los registros del servicio. Escriba los pasos para reproducir el error y nombre el módulo probablemente defectuoso.

Planifique cómo dividir este monolito en tres servicios y nombre la primera llamada a herramienta que haría para cada uno.

Este modelo tiene precio condicional. Los totales mensuales de tokens por sí solos no producen una estimación fiable; use el precio detallado según la especificación de la solicitud, la caché y la ventana aplicable.

FAQ

¿Qué hace que MiniMax-M3 sea diferente de M2.7?

MiniMax presenta M3 como una nueva generación construida en torno a la atención dispersa (sparse attention) para contextos muy largos y dirigida a tareas de programación y agentes, mientras que M2.7 se dirige a arneses de agentes anteriores.

¿Es MiniMax-M3 de pesos abiertos?

MiniMax publica M3 como un modelo de pesos abiertos, por lo que puede autohospedarlo si sus reglas de datos lo requieren. Lea la licencia en la tarjeta del modelo antes de hacerlo.

¿Acepta imágenes y video?

No. MiniMax-M3 solo acepta entrada de texto, así que utilice un modelo con entrada de imagen cuando necesite leer capturas de pantalla, gráficos, diagramas o fotogramas de video directamente.

¿Puede usar herramientas?

Sí. Llama a herramientas y MiniMax lo dirige a la planificación de agentes, donde una tarea se divide en pasos y se invoca una herramienta en cada uno. Pase sus definiciones de herramientas con la solicitud y deje que el modelo decida cuándo llamarlas.

¿Cuándo debería usar M3 en lugar de un modelo M2.x de alta velocidad?

Elija M3 para entradas muy largas o una planificación de agentes más compleja. Elija una variante M2.x de alta velocidad cuando el retraso de cada turno importe más que la profundidad del razonamiento.

¿Cuánto cuesta MiniMax-M3?

En TokenLab, MiniMax-M3 cuesta Entrada $0.30 / Salida $1.20 Por 1M Token. La tabla de precios arriba muestra el desglose completo. Las tarifas dependen de la unidad de facturación, la especificación y el uso. Compare condiciones iguales en el precio detallado del modelo; una sola tarifa no determina el coste total.

¿Cuál es la ventana de contexto y el límite de salida de MiniMax-M3?

MiniMax-M3 admite hasta 1.048.576 tokens de contexto y genera hasta 524.288 tokens por respuesta.

¿Qué endpoint debe usar MiniMax-M3?

Utiliza https://api.tokenlab.sh/v1/responses para MiniMax-M3. El ejemplo de solicitud a continuación muestra la estructura de código correspondiente.

¿Qué operaciones soporta MiniMax-M3?

MiniMax-M3 admite Texto a texto. Selecciona una operación arriba para ver su endpoint y ejemplo de solicitud.

Comparar MiniMax-M3

Fuentes

Revisado el 2 oct 2026

Más de MiniMax

Modelos relacionados