APIMart
MAI-Thinking-1: Guia de Especificações e Dados Essenciais

MAI-Thinking-1: Guia de Especificações e Dados Essenciais

Explore as especificações do MAI-Thinking-1, dados de treinamento, arquitetura MoE esparsa, contexto de 256K, resultados de benchmark, acesso em prévia privada, configuração de API e usos empresariais.

Insights de Modelos

O MAI-Thinking-1 é o modelo de IA avançado da Microsoft, projetado para tarefas como matemática, programação e aplicações empresariais. Ele apresenta uma arquitetura esparsa de Mixture-of-Experts (MoE) com 35 bilhões de parâmetros ativos e uma enorme janela de contexto de 256.000 tokens (cerca de 600 páginas). Treinado com 33,55 trilhões de tokens de dados limpos e licenciados, ele garante segurança e confiabilidade dos dados para setores como saúde, finanças e jurídico.

Principais recursos:

  • Arquitetura: MoE esparsa com 35B de parâmetros ativos (~1T no total).
  • Dados de treinamento: 33,55T tokens, todos licenciados comercialmente e gerados por humanos.
  • Janela de contexto: 256.000 tokens para lidar com fluxos de trabalho extensos.
  • Desempenho: Pontuações de destaque em matemática (97% no AIME 2025) e em benchmarks de programação.
  • Integração multimodal: Funciona com ferramentas como MAI-Image-2.5 (imagens) e MAI-Voice-2 (clonagem de voz).
  • Acesso à API: Compatível com OpenAI e com chamada de função avançada.

Atualmente em prévia privada, o MAI-Thinking-1 é otimizado para tarefas em escala empresarial, oferecendo poderosas capacidades de raciocínio enquanto mantém a conformidade regulatória. Sua integração com outras ferramentas MAI dá suporte a fluxos de trabalho complexos em diversos setores.

MAI-Thinking-1: Construindo uma máquina de escalada de morros (hill-climbing)

Especificações principais do MAI-Thinking-1

A base técnica do MAI-Thinking-1 fornece os recursos necessários para produzir resultados multimodais avançados, tornando-o uma ferramenta poderosa para geração de vídeo e fluxos de trabalho unificados de API de LLM.

Arquitetura do modelo e parâmetros

O MAI-Thinking-1 foi projetado usando uma arquitetura esparsa de Mixture-of-Experts (MoE) combinada com uma configuração Transformer somente decodificador (decoder-only). Sua configuração "LatentMoE" garante que apenas os especialistas necessários sejam ativados - tipicamente 8 de 512 por token - permitindo um processamento eficiente e escalável[2][6]. O modelo opera com 35 bilhões de parâmetros ativos e aproximadamente 1 trilhão de parâmetros no total. Sua janela de contexto abrange 256.000 tokens, o que equivale a cerca de 600 páginas de conteúdo, permitindo o manuseio extensivo de dados em uma única sessão[6].

A arquitetura incorpora atenção no estilo Gemma-3, apresentando cinco camadas locais por camada global, uma janela deslizante de 512 tokens e Grouped-Query Attention (GQA) com 8 cabeças KV. Seu tokenizador, o200k_base, suporta um vocabulário de cerca de 200.000 tokens, aprimorando ainda mais suas capacidades de processamento.

O MAI-Thinking-1 foi codesenvolvido com o silício Maia 200 da Microsoft, oferecendo um aumento de 1,4x no desempenho por watt em comparação com configurações de hardware padrão. O treinamento utilizou 8.000 GPUs NVIDIA GB200, garantindo o desempenho robusto do modelo por meio do acesso a recursos computacionais de alta qualidade[6].

Origem do treinamento e compatibilidade de dados

O modelo foi treinado com um total de 33,55 trilhões de tokens de conteúdo limpo, licenciado comercialmente e gerado por humanos. Isso inclui 30 trilhões de tokens durante a fase principal de pré-treinamento e 3,55 trilhões adicionais durante o treinamento intermediário (mid-training)[6]. O conjunto de dados abrange uma ampla variedade de fontes, como texto da web, código do GitHub disponível publicamente, livros, artigos acadêmicos, notícias, conteúdo multilíngue e materiais adaptados a domínios específicos.

"O MAI-Thinking-1 foi treinado do zero usando 33,55 trilhões de tokens de dados meticulosamente obtidos e licenciados comercialmente, garantindo um pipeline de treinamento totalmente auditável."

Essa obtenção transparente de dados torna o modelo uma escolha confiável para setores como saúde, finanças e jurídico, onde a segurança da propriedade intelectual e a conformidade regulatória são essenciais[4].

Recursos de API e integração

O MAI-Thinking-1 se integra perfeitamente à Chat Completions API, tornando-o compatível com fluxos de trabalho no estilo OpenAI. Ele também suporta recursos avançados como chamada de função e instruções de desenvolvedor em camadas, tornando-o bem adequado para tarefas multimodais complexas, incluindo geração de vídeo e aplicações em nível empresarial.

RecursoEspecificação
ArquiteturaMoE esparsa / Transformer somente decodificador
Parâmetros ativos35 bilhões
Parâmetros totais~1 trilhão
Janela de contexto256.000 tokens (~600 páginas)
Dados de treinamento33,55T tokens (limpos, gerados por humanos, licenciados)
Compatibilidade de APIChat Completions API, Function Calling, Developer Instructions
Tokenizadoro200k_base (~200k de vocabulário)
Silício principalMicrosoft Maia 200

Dados essenciais de desempenho e capacidade

MAI-Thinking-1: Especificações principais e desempenho de benchmark em um relance
MAI-Thinking-1: Especificações principais e desempenho de benchmark em um relance

O MAI-Thinking-1 entrega resultados mensuráveis em áreas críticas como matemática, programação e raciocínio científico. Essas métricas refletem seu desempenho em conjuntos de problemas padronizados que se alinham às necessidades empresariais.

Raciocínio e otimização de fluxo de trabalho

Com uma janela de contexto de 256.000 tokens, o MAI-Thinking-1 pode lidar com fluxos de trabalho complexos e de várias etapas. Isso inclui tarefas como analisar contratos extensos, processar rastros detalhados de agentes ou revisar documentos de pesquisa complexos - tudo em uma única passagem. Sua arquitetura esparsa de Mixture-of-Experts (MoE) garante escalabilidade sem um aumento proporcional na demanda computacional, o que significa custos mais baixos para tarefas de alto volume.

Por exemplo, em junho de 2026, a Microsoft demonstrou um modelo MAI ajustado (fine-tuned) para tarefas automatizadas do Excel. O modelo alcançou paridade de desempenho com o GPT-5.4 em benchmarks públicos e privados[6].

"O MAI-Thinking-1 foi desenvolvido especificamente para as cargas de trabalho que as empresas executam em escala... a um ponto de preço-desempenho que torna economicamente viáveis as cargas de trabalho de IA de alto volume e sempre ativas." - Naomi Moneypenny, Microsoft [3]

Essas capacidades de raciocínio o tornam um forte concorrente para tarefas que exigem desempenho avançado em código e matemática.

Desempenho em código e matemática

O MAI-Thinking-1 alcançou algumas das pontuações de benchmark mais altas em sua categoria. Os resultados notáveis incluem:

  • 97,0% no AIME 2025
  • 94,5% no AIME 2026
  • 52,8% no SWE-Bench Pro
  • 73,5% no SWE-Bench Verified
  • 84,2% no GPQA Diamond
  • 87,7% no LiveCodeBench v6 [6]

Essas pontuações refletem o foco da Microsoft em treinar o modelo em ambientes determinísticos, garantindo que seu desempenho seja confiável e direcionável (steerable). Essa consistência o torna ideal para aplicações empresariais exigentes.

Características de implantação empresarial

O MAI-Thinking-1 foi projetado com escalabilidade e segurança de dados em seu núcleo. Construído exclusivamente com dados proprietários de alta qualidade, ele garante auditabilidade e proteção da propriedade intelectual (PI) - especialmente crucial para setores regulados como saúde, finanças e jurídico. Em junho de 2026, a Microsoft fez parceria com a Mayo Clinic para desenvolver um modelo clínico especializado usando o framework MAI, adaptado para raciocínio clínico de alto risco[6].

CapacidadeEspecificaçãoBenefício empresarial
Parâmetros ativos35B (MoE)Alto desempenho com custos de inferência reduzidos
Janela de contexto256.000 tokensLida com documentos de mais de 600 páginas sem fragmentação
Pontuação AIME 202597,0%Raciocínio matemático excepcional
Pontuação SWE-Bench Pro52,8%Geração de código confiável e de nível de produção
Pontuação GPQA Diamond84,2%Raciocínio científico e técnico avançado
Padrões de dadosLimpos, licenciados comercialmenteGarante a segurança da PI para setores sensíveis
CustomizaçãoFrontier Tuning / RLEsPermite checkpoints e fluxos de trabalho de propriedade do usuário

Esse desempenho robusto, combinado com a integração multimodal, incluindo modelos multimodais avançados, dá suporte a aplicações como geração de vídeo e otimização de API.

As empresas podem personalizar ainda mais o MAI-Thinking-1 usando Reinforcement Learning Environments (RLEs). A Microsoft relatou em junho de 2026 que ajustar o modelo para as necessidades específicas da McKinsey resultou em qualidade melhor que o GPT-5.5, tudo isso operando a um custo 10x menor[6].

Pipeline de treinamento e requisitos de dados

Visão geral do pipeline de treinamento

O MAI-Thinking-1 foi construído para evoluir continuamente, graças a um pipeline cuidadosamente projetado em que cada elemento - dados, poder computacional e sinais de recompensa - pode ser refinado e otimizado ao longo do tempo[2][6].

"O objetivo é um sistema repetível que possa absorver dados melhores, recompensas mais fortes, ambientes mais capazes e mais poder computacional." - Microsoft AI [2]

O processo começa com o MAI-Base-1, que é criado por meio de uma abordagem de treinamento de tokens em múltiplas fases[6][7]. A partir daí, a Microsoft desenvolve três modelos especializados em paralelo. Eles se concentram em:

  • STEM e programação de nível de competição.
  • Programação agêntica e utilização de ferramentas.
  • Utilidade (helpfulness) e segurança.

Esses modelos são então mesclados usando aprendizado supervisionado. A etapa final envolve o aprendizado por reforço (RL) para ajustar o modelo combinado, resultando no MAI-Thinking-1. Todo o processo de treinamento foi alimentado por 8.000 GPUs NVIDIA GB200, executando em um cluster Azure operado pela Microsoft[6].

A Microsoft adota uma postura única sobre o desenvolvimento de modelos: a inteligência é construída por meio do aprendizado, não herdada. Em vez de destilar conhecimento de modelos de terceiros, o MAI-Thinking-1 é treinado para desenvolver capacidades de raciocínio de forma independente[2][7].

"As capacidades devem ser aprendidas, não herdadas. Embora seja mais rápida de adquirir, a inteligência herdada carece da direcionabilidade essencial para o uso no mundo real." - Microsoft AI [2]

Essa abordagem fundamental garante que o sistema seja não apenas capaz, mas também adaptável para aplicações no mundo real, preparando o terreno para uma governança e integração de dados rigorosas.

Qualidade de dados e padrões de governança

Os dados de treinamento são cuidadosamente selecionados, consistindo exclusivamente de conteúdo escrito por humanos e licenciado comercialmente[2][6]. Isso garante uma linhagem de dados limpa, o que é fundamental para setores como saúde e finanças, onde a conformidade regulatória depende de dados rastreáveis e auditáveis[2][5].

Para manter a integridade, a Microsoft evita usar benchmarks padrão de aprendizado de máquina durante o treinamento. Isso impede que o modelo memorize os dados de teste, garantindo que as pontuações de benchmark reflitam raciocínio genuíno em vez de aprendizado mecânico[6].

"Se não conseguimos explicar o que moldou um modelo, não podemos compreender plenamente seu comportamento nem aprimorá-lo de forma confiável." - Equipe de Superinteligência de IA da Microsoft [2]

Integração de dados multimodais

O processo de treinamento vai além dos dados de texto tradicionais, incorporando diversos formatos multimodais para aumentar sua relevância em cenários práticos. O corpus inclui texto da web, código público do GitHub, livros, artigos acadêmicos, artigos de notícias e conteúdo multilíngue[6]. Para tarefas de programação e agênticas, a Microsoft emprega ambientes determinísticos e executáveis para validar os dados[2][6].

Além de texto e código, os modelos MAI integram dados de áudio e visuais. Por exemplo:

  • MAI-Transcribe-1.5 usa reconhecimento avançado de entidades para lidar com vocabulário específico de domínio com precisão.
  • MAI-Voice-2 apresenta preservação de identidade para uma saída de voz consistente[3].
  • MAI-Image-2.5 permite edição precisa de imagem para imagem mantendo a consistência de marca e de personagem[3].

Essa integração multimodal equipa o MAI-Thinking-1 para uma ampla variedade de aplicações, desde geração de texto até tarefas complexas de imagem e áudio, garantindo que ele seja versátil o suficiente para necessidades do mundo real.

Requisitos de integração de API no APIMart

APIMart

Esta seção descreve as etapas para integrar-se à API do APIMart para acessar o MAI-Thinking-1, projetado para fluxos de trabalho multimodais avançados.

Configurando o acesso à API

Para acessar o MAI-Thinking-1, você usará o gateway compatível com OpenAI do APIMart. Comece configurando seu SDK da OpenAI (Python ou Node.js) para apontar para o endpoint:

https://api.apimart.ai/v1

Substitua sua chave de API da OpenAI pela sua chave de API do APIMart. Certifique-se de especificar "mai-thinking-1" como o identificador do modelo.

Para autenticação, use um token Bearer no cabeçalho da requisição:

Authorization: Bearer YOUR_API_KEY

É essencial armazenar sua chave de API com segurança, seja em uma variável de ambiente ou em um gerenciador de segredos. Observe que o acesso está atualmente limitado à prévia privada. O acesso de produção pode ser solicitado por meio do Microsoft Foundry [2][3].

Chamada de função e ferramentas para desenvolvedores

O MAI-Thinking-1 vai além das chat completions padrão, oferecendo ferramentas em tempo de execução que aprimoram a funcionalidade. O processo de integração é direto:

  1. O modelo processa sua entrada e identifica uma solicitação de chamada de ferramenta.
  2. Seu cliente executa a chamada de ferramenta e envia o resultado de volta ao modelo.
  3. O modelo usa o resultado para gerar uma resposta final[8].

Aqui está um detalhamento das ferramentas suportadas e seus casos de uso:

Tipo de ferramentaDescriçãoExemplo de caso de uso
Function CallingExecuta funções personalizadas via JSON SchemaDisparar consultas a bancos de dados ou lógica de negócios
Web SearchRecupera dados em tempo real da internetBuscar preços de ações ou documentação técnica
File SearchPesquisa dentro de documentos enviadosAnalisar manuais internos ou arquivos de conformidade
Remote MCPConecta-se a serviços do Model Context ProtocolAcessar dados protegidos ou modelos específicos de domínio

Essas ferramentas permitem que os desenvolvedores estendam as capacidades do modelo para uma ampla variedade de aplicações.

Pré-requisitos operacionais

Para otimizar sua integração com o MAI-Thinking-1, certifique-se de que os seguintes requisitos operacionais sejam atendidos:

  • Suporte para uma janela de contexto de 256.000 tokens, o que requer gerenciamento eficiente de memória e latência para lidar com grandes conjuntos de dados em contexto[2].
  • Tratamento adequado dos principais códigos de erro:
    • 401: Falha de autenticação
    • 402: Saldo insuficiente
    • 429: Limite de taxa excedido

Aqui está um resumo rápido dos requisitos técnicos:

RequisitoDetalhe
Identificador do modelomai-thinking-1
Método de autenticaçãoToken Bearer
Janela de contexto256.000 tokens
ArquiteturaMixture-of-Experts esparsa (35B ativos / 1T parâmetros totais)
Compatibilidade de APIOpenAI Chat Completions

Restrições práticas de implantação

Status atual de implantação

Em junho de 2026, o MAI-Thinking-1 está disponível exclusivamente por meio de uma prévia privada no Microsoft Foundry. O acesso requer o envio de uma solicitação por meio do portal Foundry. Espera-se uma prévia pública mais ampla no MAI Playground "em breve", com disponibilidade geral se expandindo gradualmente por várias regiões do Foundry em todo o mundo[1][2]. Essa implantação em fases destaca a importância do modelo no tratamento de fluxos de trabalho de IA complexos e multimodais.

Uma grande limitação nesta fase é a falta de divulgação do preço por token. Isso torna desafiador para as equipes orçar com precisão a integração. No entanto, para contexto, outros modelos da série MAI no Foundry têm preço de US$ 5 por 1M de tokens de entrada (MAI-Image-2.5) e US$ 0,36 por hora (MAI-Transcribe-1.5), oferecendo uma ideia geral da estrutura de preços[3].

Compensações de inferência e desempenho

O MAI-Thinking-1 emprega uma arquitetura esparsa de Mixture-of-Experts, que ativa apenas 35 bilhões de seus ~1 trilhão de parâmetros totais durante uma passagem de inferência. Esse design encontra um equilíbrio entre reduzir os custos computacionais e manter capacidades de raciocínio de alto nível:

"O MAI-Thinking-1 foi desenvolvido especificamente para as cargas de trabalho que as empresas executam em escala... a um ponto de preço-desempenho que torna economicamente viáveis as cargas de trabalho de IA de alto volume e sempre ativas." [3]

Dito isso, o modelo está limitado a tarefas de texto e raciocínio. Ele não suporta tarefas baseadas em visão ou compreensão de documentos multimodais. Para fluxos de trabalho que exigem análise de imagem ou análise de documentos visuais, modelos adicionais serão necessários. Essas limitações podem moldar significativamente as estratégias de implantação, dependendo do setor e dos casos de uso específicos.

Casos de uso específicos por setor

Essas restrições influenciam diretamente como o modelo é aplicado em diferentes setores. Por exemplo, a Mayo Clinic colaborou com a Microsoft para integrar o MAI-Thinking-1 em fluxos de trabalho clínicos e de pesquisa. Essa parceria demonstra como os controles de acesso e os requisitos de confiabilidade desempenham um papel crucial em setores regulados como o da saúde[6][9].

No geral, o MAI-Thinking-1 é mais adequado para tarefas de raciocínio de alto volume em áreas como análise jurídica, modelagem financeira, pesquisa médica e desenvolvimento de software empresarial. Esses setores exigem soluções de inteligência escaláveis e econômicas, e a arquitetura focada em texto do modelo, combinada com sua disponibilidade controlada, alinha-se bem às necessidades de conformidade e operacionais desses setores.

Conclusão e principais conclusões

O MAI-Thinking-1 se destaca por sua arquitetura poderosa e integração fluida, tornando-o uma escolha de destaque para aplicações multimodais. Seu desempenho em tarefas de raciocínio estabelece um padrão elevado, combinando eficiência com resultados impressionantes de benchmark. O uso de dados de treinamento limpos e licenciados comercialmente e uma abordagem sem destilação lhe dá uma clara vantagem, especialmente para setores como saúde, jurídico e finanças, onde a transparência e a linhagem dos dados são cruciais.

Os desenvolvedores podem acessar facilmente o MAI-Thinking-1 por meio do APIMart, que oferece um endpoint unificado para mais de 500 modelos de IA, incluindo MAI-Image-2.5, Sora 2 e Kling V3. Essa configuração simplifica a criação de pipelines multimodais - por exemplo, usando o MAI-Thinking-1 para raciocínio, o MAI-Image-2.5 para tarefas visuais e o Sora 2 ou o Kling V3 para saída de vídeo. Tudo isso é respaldado por um SLA confiável de 99,9% de tempo de atividade.

Para otimizar custos e desempenho, as empresas podem implementar roteamento em camadas atribuindo tarefas complexas de raciocínio ao MAI-Thinking-1 enquanto delegam tarefas mais simples a modelos mais leves. A integração antecipada é recomendada, dando às empresas tempo para testar, refinar e escalar seus sistemas antes que a demanda aumente. Ao adotar o MAI-Thinking-1, as organizações podem alcançar um desempenho técnico excepcional enquanto desbloqueiam eficiências operacionais em vários setores.

Perguntas frequentes

Para que devo usar a janela de contexto de 256.000 tokens?

A janela de contexto de 256.000 tokens é perfeita para lidar com tarefas que envolvem o processamento de grandes quantidades de dados. Por exemplo, ela pode revisar documentos enormes - de até 600 páginas - ou lidar com fluxos de trabalho de programação complexos com facilidade. Essa capacidade é particularmente útil para operações em nível empresarial, como analisar repositórios de código inteiros para identificar erros, resolver bugs ou executar instruções complexas e em camadas.

Ela também brilha em cenários assíncronos e de alto volume. Tarefas como avaliar a consistência arquitetural ou identificar padrões em conjuntos de dados extensos tornam-se muito mais gerenciáveis, especialmente quando respostas imediatas não são necessárias.

Como obtenho acesso se o MAI-Thinking-1 está em prévia privada?

Para experimentar o MAI-Thinking-1 durante sua prévia privada, você precisará enviar uma solicitação de acesso antecipado por meio do formulário de interesse oficial no Azure AI Foundry. Você também pode testar o modelo em plataformas como Baseten, Fireworks AI e Open Router. Procure por links de registro no model card ou no catálogo do Azure AI Foundry. Detalhes sobre disponibilidade pública e preços serão compartilhados após a fase de prévia.

O que preciso mudar para chamar o MAI-Thinking-1 a partir do meu SDK da OpenAI?

Para usar o MAI-Thinking-1 com o SDK da OpenAI, você precisará ajustar tanto a configuração do seu cliente quanto a estrutura da requisição. Veja o que fazer:

  • Use a URL base da API específica para o MAI-Thinking-1.
  • Defina o parâmetro do modelo como mai-thinking-1.
  • Inclua prompts de sistema projetados para orientar o raciocínio passo a passo.
  • Ajuste o parâmetro extra_body para controlar o esforço de raciocínio. Tenha em mente que isso influenciará tanto o tempo de computação quanto os custos associados.

Certifique-se de que sua integração esteja preparada para processar adequadamente as saídas no estilo de raciocínio para obter os melhores resultados.

Posts de blog relacionados

Pronto para testar?

Escolha o modelo que você quer no marketplace

Teste modelos de chat, imagem e vídeo no marketplace da APIMart e experimente rapidamente as capacidades dos modelos com uma API unificada.

Modelos de chatModelos de imagemModelos de vídeo
Explorar marketplace