
MAI-Thinking-1: Guía de especificaciones y datos clave
Explora las especificaciones de MAI-Thinking-1, sus datos de entrenamiento, la arquitectura MoE dispersa, el contexto de 256K, los resultados de benchmarks, el acceso en private preview, la configuración de la API y los usos empresariales.
MAI-Thinking-1 es el modelo de IA avanzado de Microsoft, diseñado para tareas como matemáticas, programación y aplicaciones empresariales. Cuenta con una arquitectura dispersa de Mixture-of-Experts (MoE) con 35 000 millones de parámetros activos y una enorme ventana de contexto de 256 000 tokens (unas 600 páginas). Entrenado con 33,55 billones de tokens de datos limpios y con licencia, garantiza la seguridad y fiabilidad de los datos para sectores como la salud, las finanzas y el ámbito jurídico.
Características clave:
- Arquitectura: MoE dispersa con 35B de parámetros activos (~1T en total).
- Datos de entrenamiento: 33,55T de tokens, todos con licencia comercial y generados por humanos.
- Ventana de contexto: 256 000 tokens para gestionar flujos de trabajo extensos.
- Rendimiento: Puntuaciones máximas en matemáticas (97% en AIME 2025) y en benchmarks de programación.
- Integración multimodal: Funciona con herramientas como MAI-Image-2.5 (imágenes) y MAI-Voice-2 (clonación de voz).
- Acceso vía API: Compatible con OpenAI, con llamadas a funciones avanzadas.
Actualmente en private preview, MAI-Thinking-1 está optimizado para tareas a escala empresarial, ofreciendo potentes capacidades de razonamiento sin dejar de cumplir con la normativa. Su integración con otras herramientas MAI da soporte a flujos de trabajo complejos en todos los sectores.
MAI-Thinking-1: Construyendo una máquina de escalada gradual
Especificaciones principales de MAI-Thinking-1
La base técnica de MAI-Thinking-1 aporta las capacidades necesarias para producir resultados multimodales avanzados, lo que lo convierte en una potente herramienta para la generación de vídeo y los flujos de trabajo de API LLM unificada.
Arquitectura del modelo y parámetros
MAI-Thinking-1 está diseñado con una arquitectura dispersa de Mixture-of-Experts (MoE) combinada con una configuración de Transformer de solo decodificador. Su configuración "LatentMoE" garantiza que solo se activen los expertos necesarios —normalmente 8 de 512 por token—, lo que permite un procesamiento eficiente y escalable[2][6]. El modelo opera con 35 000 millones de parámetros activos y aproximadamente 1 billón de parámetros en total. Su ventana de contexto abarca 256 000 tokens, lo que equivale a unas 600 páginas de contenido, permitiendo un manejo extenso de datos en una sola sesión[6].
La arquitectura incorpora atención al estilo Gemma-3, con cinco capas locales por capa global, una ventana deslizante de 512 tokens y Grouped-Query Attention (GQA) con 8 cabezas KV. Su tokenizador, o200k_base, admite un vocabulario de unos 200 000 tokens, lo que potencia aún más sus capacidades de procesamiento.
MAI-Thinking-1 se desarrolló conjuntamente con el silicio Maia 200 de Microsoft, ofreciendo una mejora de 1,4x en rendimiento por vatio en comparación con configuraciones de hardware estándar. El entrenamiento utilizó 8000 GPU NVIDIA GB200, garantizando el sólido rendimiento del modelo gracias al acceso a recursos computacionales de alta calidad[6].
Fuente de entrenamiento y compatibilidad de datos
El modelo se entrenó con un total de 33,55 billones de tokens de contenido limpio, con licencia comercial y generado por humanos. Esto incluye 30 billones de tokens durante la fase principal de preentrenamiento y otros 3,55 billones durante el entrenamiento intermedio[6]. El conjunto de datos abarca una amplia variedad de fuentes, como texto web, código de GitHub disponible públicamente, libros, artículos académicos, noticias, contenido multilingüe y materiales adaptados a dominios específicos.
"MAI-Thinking-1 se entrenó desde cero con 33,55 billones de tokens de datos meticulosamente obtenidos y con licencia comercial, garantizando una canalización de entrenamiento totalmente auditable."
Esta obtención transparente de datos convierte al modelo en una opción fiable para sectores como la salud, las finanzas y el ámbito jurídico, donde la seguridad de la propiedad intelectual y el cumplimiento normativo son fundamentales[4].
Características de API e integración
MAI-Thinking-1 se integra a la perfección con la API de Chat Completions, lo que lo hace compatible con flujos de trabajo de estilo OpenAI. También admite funciones avanzadas como las llamadas a funciones y las instrucciones de desarrollador por capas, lo que lo hace muy adecuado para tareas multimodales complejas, incluidas la generación de vídeo y las aplicaciones de nivel empresarial.
| Característica | Especificación |
|---|---|
| Arquitectura | MoE dispersa / Transformer de solo decodificador |
| Parámetros activos | 35 000 millones |
| Parámetros totales | ~1 billón |
| Ventana de contexto | 256 000 tokens (~600 páginas) |
| Datos de entrenamiento | 33,55T de tokens (limpios, generados por humanos, con licencia) |
| Compatibilidad de API | Chat Completions API, Function Calling, Developer Instructions |
| Tokenizador | o200k_base (~200k de vocabulario) |
| Silicio principal | Microsoft Maia 200 |
Datos clave de rendimiento y capacidad

MAI-Thinking-1 ofrece resultados medibles en áreas críticas como las matemáticas, la programación y el razonamiento científico. Estas métricas reflejan su rendimiento en conjuntos de problemas estandarizados que se alinean con las necesidades empresariales.
Razonamiento y optimización de flujos de trabajo
Con una ventana de contexto de 256 000 tokens, MAI-Thinking-1 puede gestionar flujos de trabajo complejos de varios pasos. Esto incluye tareas como analizar contratos extensos, procesar trazas detalladas de agentes o revisar documentos de investigación complejos, todo en una sola pasada. Su arquitectura dispersa de Mixture-of-Experts (MoE) garantiza la escalabilidad sin un aumento proporcional de la demanda de cómputo, lo que significa menores costes para las tareas de alto volumen.
Por ejemplo, en junio de 2026, Microsoft mostró un modelo MAI ajustado para tareas automatizadas de Excel. El modelo alcanzó la paridad de rendimiento con GPT-5.4 tanto en benchmarks públicos como privados [6].
"MAI-Thinking-1 está diseñado específicamente para las cargas de trabajo que las empresas ejecutan a gran escala... a un punto de relación precio-rendimiento que hace económicamente viables las cargas de trabajo de IA de alto volumen y siempre activas." - Naomi Moneypenny, Microsoft [3]
Estas capacidades de razonamiento lo convierten en un fuerte candidato para tareas que requieren un rendimiento avanzado en código y matemáticas.
Rendimiento en código y matemáticas
MAI-Thinking-1 ha logrado algunas de las puntuaciones más altas en benchmarks de su categoría. Entre los resultados destacados se incluyen:
- 97,0% en AIME 2025
- 94,5% en AIME 2026
- 52,8% en SWE-Bench Pro
- 73,5% en SWE-Bench Verified
- 84,2% en GPQA Diamond
- 87,7% en LiveCodeBench v6 [6]
Estas puntuaciones reflejan el enfoque de Microsoft en entrenar el modelo en entornos deterministas, garantizando que su rendimiento sea fiable y controlable. Tal consistencia lo hace ideal para aplicaciones empresariales exigentes.
Características de despliegue empresarial
MAI-Thinking-1 está diseñado con la escalabilidad y la seguridad de los datos como pilares fundamentales. Construido exclusivamente sobre datos propietarios de alta calidad, garantiza la auditabilidad y la protección de la propiedad intelectual (PI), algo especialmente crucial para sectores regulados como la salud, las finanzas y el ámbito jurídico. En junio de 2026, Microsoft se asoció con la Mayo Clinic para desarrollar un modelo clínico especializado utilizando el framework MAI, adaptado al razonamiento clínico de alto riesgo [6].
| Capacidad | Especificación | Beneficio empresarial |
|---|---|---|
| Parámetros activos | 35B (MoE) | Alto rendimiento con costes de inferencia reducidos |
| Ventana de contexto | 256 000 tokens | Gestiona documentos de más de 600 páginas sin fragmentación |
| Puntuación AIME 2025 | 97,0% | Razonamiento matemático excepcional |
| Puntuación SWE-Bench Pro | 52,8% | Generación de código fiable y de nivel productivo |
| Puntuación GPQA Diamond | 84,2% | Razonamiento científico y técnico avanzado |
| Estándares de datos | Limpios, con licencia comercial | Garantiza la seguridad de la PI para sectores sensibles |
| Personalización | Frontier Tuning / RLEs | Permite checkpoints y flujos de trabajo propiedad del usuario |
Este sólido rendimiento, combinado con la integración multimodal, incluyendo modelos multimodales avanzados, da soporte a aplicaciones como la generación de vídeo y la optimización de API.
Las empresas pueden personalizar aún más MAI-Thinking-1 utilizando Reinforcement Learning Environments (RLEs). Microsoft informó en junio de 2026 que ajustar el modelo para las necesidades específicas de McKinsey dio como resultado una calidad superior a la de GPT-5.5, todo ello operando a un coste 10 veces menor [6].
Canalización de entrenamiento y requisitos de datos
Visión general de la canalización de entrenamiento
MAI-Thinking-1 está construido para evolucionar de forma continua, gracias a una canalización cuidadosamente diseñada en la que cada elemento —datos, potencia de cómputo y señales de recompensa— puede refinarse y optimizarse con el tiempo [2][6].
"El objetivo es un sistema repetible que pueda absorber mejores datos, recompensas más fuertes, entornos más capaces y más cómputo." - Microsoft AI [2]
El proceso comienza con MAI-Base-1, que se crea mediante un enfoque de entrenamiento de tokens en múltiples fases [6][7]. A partir de ahí, Microsoft desarrolla tres modelos especializados en paralelo. Estos se centran en:
- STEM y programación de nivel de competición.
- Programación agéntica y uso de herramientas.
- Utilidad y seguridad.
Estos modelos se fusionan luego mediante aprendizaje supervisado. El paso final consiste en el aprendizaje por refuerzo (RL) para ajustar con precisión el modelo combinado, dando como resultado MAI-Thinking-1. Todo el proceso de entrenamiento estuvo impulsado por 8000 GPU NVIDIA GB200, ejecutándose en un clúster de Azure operado por Microsoft [6].
Microsoft adopta una postura única respecto al desarrollo de modelos: la inteligencia se construye mediante el aprendizaje, no se hereda. En lugar de destilar conocimiento de modelos de terceros, MAI-Thinking-1 se entrena para desarrollar capacidades de razonamiento de forma independiente [2][7].
"Las capacidades deben aprenderse, no heredarse. Aunque es más rápida de adquirir, la inteligencia heredada carece de la controlabilidad esencial para su uso en el mundo real." - Microsoft AI [2]
Este enfoque fundamental garantiza que el sistema no solo sea capaz, sino también adaptable para aplicaciones del mundo real, sentando las bases para una rigurosa gobernanza e integración de datos.
Estándares de calidad y gobernanza de datos
Los datos de entrenamiento se seleccionan cuidadosamente y consisten exclusivamente en contenido escrito por humanos y con licencia comercial [2][6]. Esto garantiza un linaje de datos limpio, algo fundamental para sectores como la salud y las finanzas, donde el cumplimiento normativo depende de datos rastreables y auditables [2][5].
Para mantener la integridad, Microsoft evita utilizar benchmarks estándar de aprendizaje automático durante el entrenamiento. Esto evita que el modelo memorice los datos de prueba, garantizando que las puntuaciones de los benchmarks reflejen un razonamiento genuino en lugar de un aprendizaje memorístico [6].
"Si no podemos dar cuenta de lo que dio forma a un modelo, no podemos comprender plenamente su comportamiento ni mejorarlo de forma creíble." - Microsoft AI Superintelligence Team [2]
Integración de datos multimodales
El proceso de entrenamiento va más allá de los datos de texto tradicionales, incorporando diversos formatos multimodales para mejorar su relevancia en escenarios prácticos. El corpus incluye texto web, código público de GitHub, libros, artículos académicos, artículos de noticias y contenido multilingüe [6]. Para las tareas de programación y agénticas, Microsoft emplea entornos deterministas y ejecutables para validar los datos [2][6].
Además del texto y el código, los modelos MAI integran datos de audio y visuales. Por ejemplo:
- MAI-Transcribe-1.5 utiliza un reconocimiento avanzado de entidades para manejar con precisión el vocabulario específico de cada dominio.
- MAI-Voice-2 incorpora la preservación de identidad para una salida de voz consistente [3].
- MAI-Image-2.5 permite la edición precisa de imagen a imagen manteniendo la coherencia de marca y de personajes [3].
Esta integración multimodal equipa a MAI-Thinking-1 para una amplia gama de aplicaciones, desde la generación de texto hasta complejas tareas visuales y de audio, garantizando que sea lo suficientemente versátil para las necesidades del mundo real.
Requisitos de integración de la API en APIMart

Esta sección describe los pasos para integrarse con la API de APIMart y acceder a MAI-Thinking-1, diseñado para flujos de trabajo multimodales avanzados.
Configuración del acceso a la API
Para acceder a MAI-Thinking-1, utilizarás la pasarela compatible con OpenAI de APIMart. Comienza configurando tu SDK de OpenAI (Python o Node.js) para que apunte al endpoint:
https://api.apimart.ai/v1
Sustituye tu clave de API de OpenAI por tu clave de API de APIMart. Asegúrate de especificar "mai-thinking-1" como identificador del modelo.
Para la autenticación, utiliza un token Bearer en el encabezado de la solicitud:
Authorization: Bearer YOUR_API_KEY
Es esencial almacenar tu clave de API de forma segura, ya sea en una variable de entorno o en un gestor de secretos. Ten en cuenta que el acceso está actualmente limitado al private preview. El acceso a producción puede solicitarse a través de Microsoft Foundry [2][3].
Llamadas a funciones y herramientas para desarrolladores
MAI-Thinking-1 va más allá de las chat completions estándar al ofrecer herramientas en tiempo de ejecución que mejoran su funcionalidad. El proceso de integración es sencillo:
- El modelo procesa tu entrada e identifica una solicitud de llamada a una herramienta.
- Tu cliente ejecuta la llamada a la herramienta y devuelve el resultado al modelo.
- El modelo utiliza el resultado para generar una respuesta final [8].
A continuación se presenta un desglose de las herramientas compatibles y sus casos de uso:
| Tipo de herramienta | Descripción | Caso de uso de ejemplo |
|---|---|---|
| Function Calling | Ejecuta funciones personalizadas mediante JSON Schema | Activar consultas a bases de datos o lógica de negocio |
| Web Search | Recupera datos en tiempo real de internet | Obtener cotizaciones de acciones o documentación técnica |
| File Search | Busca dentro de documentos subidos | Analizar manuales internos o archivos de cumplimiento |
| Remote MCP | Se conecta a servicios de Model Context Protocol | Acceder a datos protegidos o modelos específicos de dominio |
Estas herramientas permiten a los desarrolladores ampliar las capacidades del modelo para una amplia gama de aplicaciones.
Requisitos operativos previos
Para optimizar tu integración con MAI-Thinking-1, asegúrate de cumplir los siguientes requisitos operativos:
- Soporte para una ventana de contexto de 256 000 tokens, que requiere una gestión eficiente de la memoria y la latencia para manejar grandes conjuntos de datos en contexto [2].
- Gestión adecuada de los códigos de error clave:
401: Fallo de autenticación402: Saldo insuficiente429: Límite de tasa superado
A continuación, un breve resumen de los requisitos técnicos:
| Requisito | Detalle |
|---|---|
| Identificador del modelo | mai-thinking-1 |
| Método de autenticación | Bearer Token |
| Ventana de contexto | 256 000 tokens |
| Arquitectura | Mixture-of-Experts dispersa (35B activos / 1T de parámetros totales) |
| Compatibilidad de API | OpenAI Chat Completions |
Restricciones prácticas de despliegue
Estado actual del despliegue
A partir de junio de 2026, MAI-Thinking-1 está disponible exclusivamente a través de un private preview en Microsoft Foundry. El acceso requiere enviar una solicitud a través del portal de Foundry. Se espera una public preview más amplia en el MAI Playground "próximamente", con una disponibilidad general que se ampliará gradualmente a través de múltiples regiones de Foundry en todo el mundo [1][2]. Este despliegue por fases pone de relieve la importancia del modelo en el manejo de flujos de trabajo de IA complejos y multimodales.
Una limitación importante en esta etapa es la falta de precios por token divulgados. Esto dificulta que los equipos presupuesten con precisión la integración. Sin embargo, a modo de contexto, otros modelos de la serie MAI en Foundry tienen un precio de 5 $ por cada 1M de tokens de entrada (MAI-Image-2.5) y 0,36 $ por hora (MAI-Transcribe-1.5), lo que ofrece una idea general de la estructura de precios [3].
Compromisos entre inferencia y rendimiento
MAI-Thinking-1 emplea una arquitectura dispersa de Mixture-of-Experts, que activa solo 35 000 millones de sus ~1 billón de parámetros totales durante una pasada de inferencia. Este diseño logra un equilibrio entre la reducción de los costes de cómputo y el mantenimiento de capacidades de razonamiento de alto nivel:
"MAI-Thinking-1 está diseñado específicamente para las cargas de trabajo que las empresas ejecutan a gran escala... a un punto de relación precio-rendimiento que hace económicamente viables las cargas de trabajo de IA de alto volumen y siempre activas." [3]
Dicho esto, el modelo se limita a tareas de texto y razonamiento. No admite tareas basadas en visión ni la comprensión de documentos multimodales. Para flujos de trabajo que requieran análisis de imágenes o procesamiento visual de documentos, serán necesarios modelos adicionales. Estas limitaciones pueden condicionar de forma significativa las estrategias de despliegue, según el sector y los casos de uso específicos.
Casos de uso por sector
Estas restricciones influyen directamente en cómo se aplica el modelo en distintos sectores. Por ejemplo, la Mayo Clinic ha colaborado con Microsoft para integrar MAI-Thinking-1 en flujos de trabajo clínicos y de investigación. Esta colaboración demuestra cómo los controles de acceso y los requisitos de fiabilidad desempeñan un papel crucial en sectores regulados como la salud [6][9].
En general, MAI-Thinking-1 es más adecuado para tareas de razonamiento de alto volumen en áreas como el análisis jurídico, el modelado financiero, la investigación médica y el desarrollo de software empresarial. Estos sectores demandan soluciones de inteligencia escalables y rentables, y la arquitectura centrada en el texto del modelo, combinada con su disponibilidad controlada, se alinea bien con las necesidades de cumplimiento y operativas de estas industrias.
Conclusión y puntos clave
MAI-Thinking-1 destaca por su potente arquitectura y su integración fluida, lo que lo convierte en una opción de primer nivel para aplicaciones multimodales. Su rendimiento en tareas de razonamiento establece un listón muy alto, combinando eficiencia con impresionantes resultados en benchmarks. El uso de datos de entrenamiento limpios y con licencia comercial, junto con un enfoque sin destilación, le otorgan una clara ventaja, especialmente para sectores como la salud, el ámbito jurídico y las finanzas, donde la transparencia y el linaje de los datos son cruciales.
Los desarrolladores pueden acceder fácilmente a MAI-Thinking-1 a través de APIMart, que ofrece un endpoint unificado para más de 500 modelos de IA, incluidos MAI-Image-2.5, Sora 2 y Kling V3. Esta configuración simplifica la creación de canalizaciones multimodales; por ejemplo, usando MAI-Thinking-1 para el razonamiento, MAI-Image-2.5 para tareas visuales y Sora 2 o Kling V3 para la salida de vídeo. Todo ello respaldado por un fiable SLA de disponibilidad del 99,9%.
Para optimizar costes y rendimiento, las empresas pueden implementar un enrutamiento por niveles, asignando las tareas de razonamiento complejas a MAI-Thinking-1 mientras delegan las tareas más sencillas a modelos más ligeros. Se recomienda una integración temprana, lo que da a las empresas tiempo para probar, refinar y escalar sus sistemas antes de que aumente la demanda. Al adoptar MAI-Thinking-1, las organizaciones pueden alcanzar un rendimiento técnico excepcional al tiempo que desbloquean eficiencias operativas en diversos sectores.
Preguntas frecuentes
¿Para qué debería usar la ventana de contexto de 256 000 tokens?
La ventana de contexto de 256 000 tokens es perfecta para gestionar tareas que implican procesar grandes cantidades de datos. Por ejemplo, puede revisar documentos enormes —de hasta 600 páginas— o manejar con facilidad complejos flujos de trabajo de programación. Esta capacidad es especialmente útil para operaciones a nivel empresarial, como analizar repositorios de código completos para detectar errores, resolver bugs o ejecutar instrucciones complejas y por capas.
También brilla en escenarios asíncronos y de alto volumen. Tareas como evaluar la coherencia arquitectónica o identificar patrones en conjuntos de datos extensos resultan mucho más manejables, especialmente cuando no se necesitan respuestas inmediatas.
¿Cómo obtengo acceso si MAI-Thinking-1 está en private preview?
Para probar MAI-Thinking-1 durante su private preview, deberás enviar una solicitud de acceso anticipado a través del formulario de interés oficial en Azure AI Foundry. También puedes probar el modelo en plataformas como Baseten, Fireworks AI y Open Router. Busca los enlaces de registro en la ficha del modelo o en el catálogo de Azure AI Foundry. Los detalles sobre la disponibilidad pública y los precios se compartirán después de la fase de preview.
¿Qué necesito cambiar para llamar a MAI-Thinking-1 desde mi SDK de OpenAI?
Para usar MAI-Thinking-1 con el SDK de OpenAI, deberás ajustar tanto la configuración de tu cliente como la estructura de la solicitud. Esto es lo que debes hacer:
- Utiliza la URL base de la API específica para MAI-Thinking-1.
- Establece el parámetro del modelo en
mai-thinking-1. - Incluye system prompts diseñados para guiar el razonamiento paso a paso.
- Ajusta el parámetro
extra_bodypara controlar el esfuerzo de razonamiento. Ten en cuenta que esto influirá tanto en el tiempo de cómputo como en los costes asociados.
Asegúrate de que tu integración esté preparada para procesar correctamente las salidas de tipo razonamiento para obtener los mejores resultados.
Artículos de blog relacionados
Elige el modelo que quieres en el marketplace
Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.