MiniMax API
Acesso à API de texto da MiniMax via RunAPI — modelos sparse MoE de 200K a 1M de contexto, até 80,5% SWE-bench Verified.
# Base URL
https://runapi.ai
# Endpoints
POST /v1/chat/completions
POST /v1/responses
POST /v1/messages
POST /v1beta/models/{model}:generateContent
POST /v1beta/models/{model}:streamGenerateContent
curl https://runapi.ai/v1/chat/completions \
-H "Authorization: Bearer $RUNAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "MiniMax-M3",
"messages": [
{
"role": "user",
"content": "Dada esta especificação de API, gere um client tipado, escreva testes de integração contra um mock server e itere até passarem."
}
]
}'
from openai import OpenAI
client = OpenAI(
base_url="https://runapi.ai/v1",
api_key="your-runapi-key"
)
response = client.chat.completions.create(
model="MiniMax-M3",
messages=[{"role": "user", "content": "Dada esta especificação de API, gere um client tipado, escreva testes de integração contra um mock server e itere até passarem."}]
)
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://runapi.ai/v1",
apiKey: "your-runapi-key"
});
const response = await client.chat.completions.create({
model: "MiniMax-M3",
messages: [{ role: "user", content: "Dada esta especificação de API, gere um client tipado, escreva testes de integração contra um mock server e itere até passarem." }]
});
A série M da MiniMax são modelos de texto sparse Mixture-of-Experts feitos para coding custo-eficiente. M2 a M2.7 (230B total / ~10B ativos, 256 especialistas) oferecem contexto 200K com capacidades agênticas progressivamente mais fortes — M2.7 chega a 56,2% no SWE-bench Pro. MiniMax-M3 usa uma arquitetura maior e diferente para restaurar contexto 1M com um novo design Sparse Attention, pontuando 80,5% no SWE-bench Verified e 59,0% no SWE-bench Pro. Variants Highspeed rodam os mesmos pesos a ~100 tokens/sec para trabalhos sensíveis a latência. Todos estão disponíveis pelo RunAPI com uma única key e cobrança por token.
- Variantes para diferentes metas de qualidade e latência
- API key unificada
- O model skill inclui documentação, schemas e notas de setup
- Gerações com falha não são cobradas
Variantes
| Variant | Billing | Pricing | |
|---|---|---|---|
| MiniMax-M2 | 1K tokens | Input $0.19 / 1M tokens | Output $0.73 / 1M tokens | Ver → |
| MiniMax-M2.1 | 1K tokens | Input $0.19 / 1M tokens | Output $0.73 / 1M tokens | Ver → |
| MiniMax-M2.5 | 1K tokens | Input $0.19 / 1M tokens | Output $0.73 / 1M tokens | Ver → |
| MiniMax-M2.5-highspeed | 1K tokens | Input $0.37 / 1M tokens | Output $1.46 / 1M tokens | Ver → |
| MiniMax-M2.7 | 1K tokens | Input $0.19 / 1M tokens | Output $0.73 / 1M tokens | Ver → |
| MiniMax-M2.7-highspeed | 1K tokens | Input $0.37 / 1M tokens | Output $1.46 / 1M tokens | Ver → |
| MiniMax-M3 | 1K tokens | Input $0.18-$0.36 / 1M tokens | Output $0.72-$1.44 / 1M tokens | Ver → |
Endpoints da API MiniMax
Use o SDK OpenAI ou Anthropic com sua chave RunAPI. Nenhum SDK extra necessário.
| Endpoint | Protocol |
|---|---|
| /v1/chat/completions | OpenAI compatible |
| /v1/responses | OpenAI Responses |
| /v1/messages | Anthropic compatible |
| /v1beta/models/{model}:generateContent | Gemini generateContent |
| /v1beta/models/{model}:streamGenerateContent | Gemini streamGenerateContent |
Como construir com este model skill
Escolha o modelo
Selecione o modelo e a variante que combinam com seu tipo de saída, meta de qualidade e latência.
Autentique uma vez
Use sua chave RunAPI para todos os modelos compatíveis.
Instale o skill
Adicione o model skill ao workspace de código antes de implementar a funcionalidade.
Receba a saída
Consulte por task ID ou trate o callback quando a geração terminar.
Onde MiniMax se encaixa
Modelos de texto MiniMax série M são LLMs sparse MoE com contexto 200K–1M, entregando scores frontier de coding por uma fração do custo de modelos densos. Pelo RunAPI, compartilham uma única API key com cobrança pay-as-you-go por token, chamáveis pelas superfícies OpenAI Chat Completions, OpenAI Responses e Anthropic Messages. Estes são os modelos de texto da MiniMax, distintos da geração de vídeo MiniMax Hailuo.
Por que usar MiniMax pela RunAPI
Uma API key
Use as mesmas credenciais entre modelos e provedores.
Pronto para skills
O model skill inclui schemas, notas de setup, contexto de preços e IDs de modelo.
Cobrança previsível
O preço por uso fica visível antes da chamada.
Perguntas frequentes
Eles são os mesmos modelos do MiniMax Hailuo video?
Não. Estes são os modelos de linguagem de texto da MiniMax para coding e chat; Hailuo é a linha separada de geração de vídeo da MiniMax.
Qual modelo de texto MiniMax devo escolher?
MiniMax-M3 é o mais forte — contexto 1M, 80,5% SWE-bench Verified e o primeiro modelo open-weight a combinar coding frontier com contexto de um milhão de tokens. M2.7 é a melhor opção com contexto 200K. Variants Highspeed (M2.5 e M2.7) rodam os mesmos pesos a ~100 tokens/sec para menor latência com custo de token mais alto.
Quais SDKs podem chamar MiniMax text pelo RunAPI?
Use o SDK da OpenAI (Chat Completions ou Responses) ou o SDK Anthropic Messages contra o RunAPI com o model id da MiniMax; o proxy adapta o protocolo.
Como MiniMax text é cobrado?
Por token nas taxas de entrada e saída publicadas pelo RunAPI para cada modelo, pay-as-you-go. Variants Highspeed custam cerca de 2× o standard para a mesma qualidade de saída com maior throughput.
Como chamo este modelo?
Instale o model skill e siga as notas de setup com sua chave RunAPI.
Gerações com falha custam dinheiro?
Gerações com falha não são cobradas
Posso chamar a partir da minha aplicação?
Sim. Instale o model skill no workspace de código e use durante a implementação da funcionalidade.