APIMart
MAI-Thinking-1: ключевые характеристики и руководство по данным

MAI-Thinking-1: ключевые характеристики и руководство по данным

Изучите характеристики MAI-Thinking-1, обучающие данные, разреженную архитектуру MoE, контекст 256K, результаты бенчмарков, доступ к private preview, настройку API и корпоративное применение.

Обзор модели

MAI-Thinking-1 — это продвинутая модель ИИ от Microsoft, разработанная для таких задач, как математика, программирование и корпоративные приложения. Она построена на разреженной архитектуре Mixture-of-Experts (MoE) с 35 миллиардами активных параметров и огромным контекстным окном на 256 000 токенов (около 600 страниц). Обученная на 33,55 триллиона токенов чистых лицензированных данных, она обеспечивает безопасность данных и надёжность для таких отраслей, как здравоохранение, финансы и юриспруденция.

Ключевые особенности:

  • Архитектура: разреженная MoE с 35 млрд активных параметров (~1 трлн всего).
  • Обучающие данные: 33,55 трлн токенов, все коммерчески лицензированные и созданные человеком.
  • Контекстное окно: 256 000 токенов для обработки масштабных рабочих процессов.
  • Производительность: лучшие результаты по математике (97% на AIME 2025) и бенчмаркам по программированию.
  • Мультимодальная интеграция: работает с инструментами вроде MAI-Image-2.5 (изображения) и MAI-Voice-2 (клонирование голоса).
  • Доступ через API: совместимость с OpenAI и продвинутый вызов функций.

В настоящее время MAI-Thinking-1 находится в режиме private preview и оптимизирована для задач корпоративного масштаба, предлагая мощные возможности рассуждения при сохранении соответствия нормативным требованиям. Её интеграция с другими инструментами MAI поддерживает сложные рабочие процессы в разных отраслях.

MAI-Thinking-1: создание машины восхождения на холм

Основные характеристики MAI-Thinking-1

Техническая основа MAI-Thinking-1 обеспечивает возможности, необходимые для создания продвинутых мультимодальных результатов, что делает её мощным инструментом для генерации видео и унифицированных рабочих процессов LLM API.

Архитектура модели и параметры

MAI-Thinking-1 спроектирована с использованием разреженной архитектуры Mixture-of-Experts (MoE) в сочетании с трансформером типа decoder-only. Её конфигурация «LatentMoE» обеспечивает активацию только необходимых экспертов — обычно 8 из 512 на токен — что позволяет вести эффективную и масштабируемую обработку[2][6]. Модель работает с 35 миллиардами активных параметров и приблизительно 1 триллионом общих параметров. Её контекстное окно охватывает 256 000 токенов, что эквивалентно примерно 600 страницам контента, обеспечивая обработку больших объёмов данных в рамках одной сессии[6].

Архитектура включает внимание в стиле Gemma-3, с пятью локальными слоями на каждый глобальный слой, скользящим окном на 512 токенов и Grouped-Query Attention (GQA) с 8 KV-головами. Её токенизатор o200k_base поддерживает словарь примерно на 200 000 токенов, что дополнительно расширяет её возможности обработки.

MAI-Thinking-1 была разработана совместно с кремниевыми чипами Microsoft Maia 200, обеспечивающими прирост производительности на ватт в 1,4 раза по сравнению со стандартными аппаратными конфигурациями. В обучении использовались 8000 GPU NVIDIA GB200, что гарантировало высокую производительность модели за счёт доступа к высококачественным вычислительным ресурсам[6].

Источник обучения и совместимость данных

Модель была обучена в общей сложности на 33,55 триллиона токенов чистого, коммерчески лицензированного, созданного человеком контента. Это включает 30 триллионов токенов на основном этапе предварительного обучения и дополнительные 3,55 триллиона на промежуточном этапе обучения[6]. Набор данных охватывает широкий спектр источников, таких как веб-тексты, общедоступный код с GitHub, книги, научные статьи, новости, многоязычный контент и материалы, адаптированные под конкретные предметные области.

«MAI-Thinking-1 была обучена с нуля на 33,55 триллиона токенов тщательно отобранных, коммерчески лицензированных данных, что обеспечивает полностью проверяемый конвейер обучения».

Такой прозрачный подход к источникам данных делает модель надёжным выбором для таких отраслей, как здравоохранение, финансы и юриспруденция, где безопасность интеллектуальной собственности и соответствие нормативным требованиям критически важны[4].

Возможности API и интеграции

MAI-Thinking-1 без труда интегрируется с Chat Completions API, что делает её совместимой с рабочими процессами в стиле OpenAI. Она также поддерживает продвинутые функции, такие как вызов функций и многоуровневые инструкции для разработчиков, что делает её хорошо подходящей для сложных мультимодальных задач, включая генерацию видео и приложения корпоративного уровня.

ХарактеристикаСпецификация
АрхитектураРазреженная MoE / трансформер decoder-only
Активные параметры35 миллиардов
Всего параметров~1 триллион
Контекстное окно256 000 токенов (~600 страниц)
Обучающие данные33,55 трлн токенов (чистые, созданные человеком, лицензированные)
Совместимость APIChat Completions API, вызов функций, инструкции для разработчиков
Токенизаторo200k_base (~200 тыс. словарь)
Основной чипMicrosoft Maia 200

Ключевые данные о производительности и возможностях

MAI-Thinking-1: ключевые характеристики и производительность в бенчмарках с первого взгляда
MAI-Thinking-1: ключевые характеристики и производительность в бенчмарках с первого взгляда

MAI-Thinking-1 показывает измеримые результаты в таких критически важных областях, как математика, программирование и научные рассуждения. Эти показатели отражают её производительность на стандартизированных наборах задач, соответствующих корпоративным потребностям.

Рассуждения и оптимизация рабочих процессов

С контекстным окном в 256 000 токенов MAI-Thinking-1 способна обрабатывать сложные, многоэтапные рабочие процессы. Это включает такие задачи, как анализ длинных контрактов, обработка подробных трасс агентов или проверка сложных исследовательских документов — всё за один проход. Её разреженная архитектура Mixture-of-Experts (MoE) обеспечивает масштабируемость без пропорционального роста вычислительных потребностей, что означает более низкие затраты для задач большого объёма.

Например, в июне 2026 года Microsoft продемонстрировала модель MAI, дообученную для автоматизированных задач в Excel. Модель достигла паритета по производительности с GPT-5.4 как на публичных, так и на закрытых бенчмарках[6].

«MAI-Thinking-1 специально создана для рабочих нагрузок, которые предприятия выполняют в масштабе... по такому соотношению цены и производительности, которое делает экономически целесообразными большие, постоянно работающие рабочие нагрузки ИИ». — Наоми Манипенни, Microsoft[3]

Эти возможности рассуждения делают её сильным претендентом для задач, требующих продвинутой производительности в области кода и математики.

Производительность в коде и математике

MAI-Thinking-1 достигла одних из самых высоких показателей в бенчмарках своей категории. Среди заметных результатов:

  • 97,0% на AIME 2025
  • 94,5% на AIME 2026
  • 52,8% на SWE-Bench Pro
  • 73,5% на SWE-Bench Verified
  • 84,2% на GPQA Diamond
  • 87,7% на LiveCodeBench v6[6]

Эти результаты отражают сосредоточенность Microsoft на обучении модели в детерминированных средах, что обеспечивает надёжность и управляемость её работы. Такая стабильность делает её идеальной для требовательных корпоративных приложений.

Характеристики корпоративного развёртывания

MAI-Thinking-1 спроектирована с упором на масштабируемость и безопасность данных. Построенная исключительно на проприетарных, высококачественных данных, она обеспечивает проверяемость и защиту интеллектуальной собственности (ИС) — что особенно важно для регулируемых отраслей, таких как здравоохранение, финансы и юриспруденция. В июне 2026 года Microsoft объединилась с Mayo Clinic для разработки специализированной клинической модели на базе фреймворка MAI, адаптированной для клинических рассуждений с высокими ставками[6].

ВозможностьСпецификацияПреимущество для предприятий
Активные параметры35 млрд (MoE)Высокая производительность при сниженных затратах на вывод
Контекстное окно256 000 токеновОбрабатывает документы на 600+ страниц без разбивки на части
Результат AIME 202597,0%Исключительные математические рассуждения
Результат SWE-Bench Pro52,8%Надёжная генерация кода производственного уровня
Результат GPQA Diamond84,2%Продвинутые научные и технические рассуждения
Стандарты данныхЧистые, коммерчески лицензированныеОбеспечивает безопасность ИС для чувствительных отраслей
КастомизацияFrontier Tuning / RLEПозволяет создавать принадлежащие пользователю контрольные точки и рабочие процессы

Эта высокая производительность в сочетании с мультимодальной интеграцией, включая продвинутые мультимодальные модели, поддерживает такие приложения, как генерация видео и оптимизация API.

Предприятия могут дополнительно адаптировать MAI-Thinking-1 с помощью сред обучения с подкреплением (Reinforcement Learning Environments, RLE). В июне 2026 года Microsoft сообщила, что дообучение модели под конкретные потребности McKinsey дало более высокое качество, чем GPT-5.5, при этом работая с в 10 раз меньшими затратами[6].

Конвейер обучения и требования к данным

Обзор конвейера обучения

MAI-Thinking-1 создана для непрерывного развития благодаря тщательно спроектированному конвейеру, в котором каждый элемент — данные, вычислительная мощность и сигналы вознаграждения — может со временем уточняться и оптимизироваться[2][6].

«Цель — повторяемая система, способная вбирать в себя лучшие данные, более сильные вознаграждения, более способные среды и больше вычислительной мощности». — Microsoft AI[2]

Процесс начинается с MAI-Base-1, которая создаётся посредством многоэтапного подхода к обучению на токенах[6][7]. Затем Microsoft параллельно разрабатывает три специализированные модели. Они сосредоточены на:

  • STEM и программировании уровня соревнований.
  • Агентном программировании и использовании инструментов.
  • Полезности и безопасности.

Затем эти модели объединяются с помощью обучения с учителем. Заключительный этап включает обучение с подкреплением (RL) для тонкой настройки объединённой модели, в результате чего получается MAI-Thinking-1. Весь процесс обучения обеспечивался 8000 GPU NVIDIA GB200, работающими в управляемом Microsoft кластере Azure[6].

Microsoft занимает уникальную позицию в отношении разработки моделей: интеллект строится через обучение, а не наследуется. Вместо дистилляции знаний из сторонних моделей MAI-Thinking-1 обучается развивать способности к рассуждению самостоятельно[2][7].

«Способности следует приобретать через обучение, а не наследовать. Хотя унаследованный интеллект приобретается быстрее, ему не хватает управляемости, необходимой для использования в реальном мире». — Microsoft AI[2]

Этот фундаментальный подход гарантирует, что система не только способна, но и адаптируема для реальных приложений, создавая основу для строгого управления данными и их интеграции.

Стандарты качества данных и управления ими

Обучающие данные тщательно отбираются и состоят исключительно из написанного человеком, коммерчески лицензированного контента[2][6]. Это обеспечивает чистое происхождение данных, что критически важно для таких отраслей, как здравоохранение и финансы, где соответствие нормативным требованиям опирается на отслеживаемые и проверяемые данные[2][5].

Для сохранения целостности Microsoft избегает использования стандартных бенчмарков машинного обучения во время обучения. Это предотвращает запоминание моделью тестовых данных, гарантируя, что результаты бенчмарков отражают подлинное рассуждение, а не зубрёжку[6].

«Если мы не можем учесть то, что сформировало модель, мы не можем полностью понять её поведение или достоверно её улучшить». — Команда Microsoft AI Superintelligence[2]

Интеграция мультимодальных данных

Процесс обучения выходит за рамки традиционных текстовых данных, включая разнообразные мультимодальные форматы для повышения её актуальности в практических сценариях. Корпус включает веб-тексты, общедоступный код с GitHub, книги, научные статьи, новостные статьи и многоязычный контент[6]. Для задач программирования и агентных задач Microsoft использует детерминированные, исполняемые среды для проверки данных[2][6].

Помимо текста и кода, модели MAI интегрируют аудио- и визуальные данные. Например:

  • MAI-Transcribe-1.5 использует продвинутое распознавание сущностей для точной обработки специфической для предметной области лексики.
  • MAI-Voice-2 обладает сохранением идентичности для согласованного голосового вывода[3].
  • MAI-Image-2.5 обеспечивает точное редактирование изображения в изображение при сохранении согласованности бренда и персонажей[3].

Эта мультимодальная интеграция оснащает MAI-Thinking-1 для широкого спектра приложений — от генерации текста до сложных визуальных и аудиозадач, обеспечивая её достаточную универсальность для потребностей реального мира.

Требования к интеграции API в APIMart

APIMart

В этом разделе описаны шаги по интеграции с API APIMart для доступа к MAI-Thinking-1, предназначенной для продвинутых мультимодальных рабочих процессов.

Настройка доступа к API

Для доступа к MAI-Thinking-1 вы будете использовать совместимый с OpenAI шлюз APIMart. Начните с настройки вашего OpenAI SDK (Python или Node.js) так, чтобы он указывал на эндпоинт:

https://api.apimart.ai/v1

Замените свой ключ API OpenAI на ключ API APIMart. Убедитесь, что в качестве идентификатора модели указано "mai-thinking-1".

Для аутентификации используйте токен Bearer в заголовке запроса:

Authorization: Bearer YOUR_API_KEY

Крайне важно хранить ваш ключ API в безопасности — либо в переменной окружения, либо в менеджере секретов. Обратите внимание, что доступ в настоящее время ограничен режимом private preview. Доступ для продакшена можно запросить через Microsoft Foundry[2][3].

Вызов функций и инструменты для разработчиков

MAI-Thinking-1 выходит за рамки стандартных чат-завершений, предлагая инструменты времени выполнения, которые расширяют функциональность. Процесс интеграции прост:

  1. Модель обрабатывает ваш ввод и определяет запрос на вызов инструмента.
  2. Ваш клиент выполняет вызов инструмента и отправляет результат обратно модели.
  3. Модель использует результат для генерации окончательного ответа[8].

Вот разбор поддерживаемых инструментов и их вариантов использования:

Тип инструментаОписаниеПример использования
Вызов функцийВыполняет пользовательские функции через JSON SchemaЗапуск запросов к базе данных или бизнес-логики
Веб-поискИзвлекает данные из интернета в реальном времениПолучение цен акций или технической документации
Поиск по файламВыполняет поиск в загруженных документахАнализ внутренних руководств или файлов соответствия
Удалённый MCPПодключается к сервисам Model Context ProtocolДоступ к защищённым данным или специализированным моделям предметной области

Эти инструменты позволяют разработчикам расширять возможности модели для широкого спектра приложений.

Операционные предпосылки

Чтобы оптимизировать вашу интеграцию с MAI-Thinking-1, убедитесь, что выполнены следующие операционные требования:

  • Поддержка контекстного окна на 256 000 токенов, что требует эффективного управления памятью и задержками для обработки больших наборов данных в контексте[2].
  • Надлежащая обработка ключевых кодов ошибок:
    • 401: ошибка аутентификации
    • 402: недостаточный баланс
    • 429: превышен лимит запросов

Вот краткое изложение технических требований:

ТребованиеДеталь
Идентификатор моделиmai-thinking-1
Метод аутентификацииBearer Token
Контекстное окно256 000 токенов
АрхитектураРазреженная Mixture-of-Experts (35 млрд активных / 1 трлн всего параметров)
Совместимость APIOpenAI Chat Completions

Практические ограничения развёртывания

Текущий статус развёртывания

По состоянию на июнь 2026 года MAI-Thinking-1 доступна исключительно через private preview на Microsoft Foundry. Для доступа требуется подать запрос через портал Foundry. Более широкий public preview ожидается на MAI Playground «вскоре», а общая доступность будет постепенно расширяться по нескольким регионам Foundry по всему миру[1][2]. Этот поэтапный выпуск подчёркивает важность модели для обработки сложных, мультимодальных рабочих процессов ИИ.

Одним из главных ограничений на данном этапе является отсутствие раскрытой стоимости за токен. Это затрудняет точное планирование бюджета на интеграцию для команд. Однако для контекста: другие модели серии MAI на Foundry оцениваются в $5 за 1 млн входных токенов (MAI-Image-2.5) и $0,36 в час (MAI-Transcribe-1.5), что даёт общее представление о структуре цен[3].

Компромиссы вывода и производительности

MAI-Thinking-1 использует архитектуру разреженной Mixture-of-Experts, которая активирует только 35 миллиардов из своих ~1 триллиона общих параметров во время прохода вывода. Этот дизайн обеспечивает баланс между снижением вычислительных затрат и сохранением высокого уровня способностей к рассуждению:

«MAI-Thinking-1 специально создана для рабочих нагрузок, которые предприятия выполняют в масштабе... по такому соотношению цены и производительности, которое делает экономически целесообразными большие, постоянно работающие рабочие нагрузки ИИ».[3]

При этом модель ограничена текстовыми задачами и задачами рассуждения. Она не поддерживает задачи на основе зрения или мультимодальное понимание документов. Для рабочих процессов, требующих анализа изображений или визуального разбора документов, потребуются дополнительные модели. Эти ограничения могут существенно влиять на стратегии развёртывания в зависимости от отрасли и конкретных вариантов использования.

Отраслевые варианты использования

Эти ограничения напрямую влияют на то, как модель применяется в различных отраслях. Например, Mayo Clinic сотрудничала с Microsoft для интеграции MAI-Thinking-1 в клинические и исследовательские рабочие процессы. Это партнёрство демонстрирует, как контроль доступа и требования к надёжности играют решающую роль в регулируемых секторах, таких как здравоохранение[6][9].

В целом MAI-Thinking-1 лучше всего подходит для задач рассуждения большого объёма в таких областях, как юридический анализ, финансовое моделирование, медицинские исследования и разработка корпоративного программного обеспечения. Эти секторы требуют масштабируемых, экономически эффективных интеллектуальных решений, и ориентированная на текст архитектура модели в сочетании с её контролируемой доступностью хорошо соответствует потребностям этих отраслей в соответствии нормативным требованиям и операционным нуждам.

Заключение и ключевые выводы

MAI-Thinking-1 выделяется своей мощной архитектурой и плавной интеграцией, что делает её лучшим выбором для мультимодальных приложений. Её производительность в задачах рассуждения задаёт высокую планку, сочетая эффективность с впечатляющими результатами бенчмарков. Использование чистых, коммерчески лицензированных обучающих данных и подход без дистилляции дают ей явное преимущество, особенно для таких отраслей, как здравоохранение, юриспруденция и финансы, где прозрачность и происхождение данных имеют решающее значение.

Разработчики могут легко получить доступ к MAI-Thinking-1 через APIMart, который предлагает унифицированный эндпоинт для более чем 500 моделей ИИ, включая MAI-Image-2.5, Sora 2 и Kling V3. Эта настройка упрощает создание мультимодальных конвейеров — например, использование MAI-Thinking-1 для рассуждений, MAI-Image-2.5 для визуальных задач и Sora 2 или Kling V3 для вывода видео. Всё это подкреплено надёжным SLA с аптаймом 99,9%.

Для оптимизации затрат и производительности предприятия могут реализовать многоуровневую маршрутизацию, назначая сложные задачи рассуждения MAI-Thinking-1, делегируя более простые задачи более лёгким моделям. Рекомендуется ранняя интеграция, дающая компаниям время на тестирование, доработку и масштабирование своих систем до роста спроса. Внедряя MAI-Thinking-1, организации могут добиться исключительной технической производительности, раскрывая при этом операционную эффективность в различных секторах.

Часто задаваемые вопросы

Для чего мне использовать контекстное окно на 256 000 токенов?

Контекстное окно на 256 000 токенов идеально подходит для обработки задач, связанных с большими объёмами данных. Например, оно может с лёгкостью просматривать огромные документы — до 600 страниц — или обрабатывать сложные рабочие процессы программирования. Эта возможность особенно полезна для операций корпоративного уровня, таких как анализ целых репозиториев кода для выявления ошибок, устранения багов или выполнения сложных, многоуровневых инструкций.

Оно также проявляет себя в асинхронных сценариях большого объёма. Такие задачи, как оценка архитектурной согласованности или выявление закономерностей в обширных наборах данных, становятся гораздо более управляемыми, особенно когда немедленные ответы не требуются.

Как получить доступ, если MAI-Thinking-1 находится в private preview?

Чтобы опробовать MAI-Thinking-1 во время её private preview, вам нужно подать запрос на ранний доступ через официальную форму интереса на Azure AI Foundry. Вы также можете протестировать модель на таких платформах, как Baseten, Fireworks AI и Open Router. Ищите ссылки для регистрации в карточке модели или каталоге на Azure AI Foundry. Подробности о публичной доступности и ценах будут раскрыты после этапа preview.

Что мне нужно изменить, чтобы вызвать MAI-Thinking-1 из моего OpenAI SDK?

Чтобы использовать MAI-Thinking-1 с OpenAI SDK, вам потребуется скорректировать как конфигурацию клиента, так и структуру запроса. Вот что нужно сделать:

  • Используйте базовый URL API, специально предназначенный для MAI-Thinking-1.
  • Установите параметр модели в mai-thinking-1.
  • Включите системные промпты, разработанные для направления пошагового рассуждения.
  • Настройте параметр extra_body для управления усилием рассуждения. Имейте в виду, что это повлияет как на время вычислений, так и на связанные с ними затраты.

Убедитесь, что ваша интеграция способна правильно обрабатывать выводы в стиле рассуждений для наилучших результатов.

Связанные публикации в блоге

Готовы попробовать?

Выберите нужную модель в маркетплейсе моделей

Попробуйте чат, изображения и видео в маркетплейсе APIMart и быстро оцените возможности моделей через единый API.

Чат-моделиМодели изображенийВидео-модели
Открыть маркетплейс моделей