
MAI-Thinking-1 核心规格与数据指南
深入了解 MAI-Thinking-1 的规格、训练数据、稀疏 MoE 架构、256K 上下文、基准测试结果、私有预览访问、API 配置以及企业级应用场景。
MAI-Thinking-1 是微软为数学、编程和企业级应用等任务打造的先进 AI 模型。它采用稀疏 专家混合(MoE)架构,拥有 350 亿个激活参数和高达 256,000 个 token 的超大上下文窗口(约合 600 页内容)。该模型在 33.55 万亿 token 的纯净、授权数据上训练而成,为医疗、金融和法律等行业提供了数据安全性与可靠性保障。
核心特性:
- 架构:稀疏 MoE,350 亿激活参数(总计约 1 万亿)。
- 训练数据:33.55 万亿 token,全部为商业授权且由人类生成。
- 上下文窗口:256,000 token,可处理大型工作流。
- 性能:在数学(AIME 2025 达 97%)和编程基准测试中名列前茅。
- 多模态集成:可与 MAI-Image-2.5(图像)和 MAI-Voice-2(语音克隆)等工具协同工作。
- API 访问:兼容 OpenAI,支持高级函数调用。
MAI-Thinking-1 目前处于私有预览阶段,专为企业级规模任务优化,在提供强大推理能力的同时确保监管合规性。它与其他 MAI 工具的集成可支持跨行业的复杂工作流。
MAI-Thinking-1:打造一台"爬坡"机器
MAI-Thinking-1 核心规格
MAI-Thinking-1 的技术基础为生成先进的多模态输出提供了所需能力,使其成为视频生成和统一 LLM API 工作流的强大工具。
模型架构与参数
MAI-Thinking-1 采用稀疏专家混合(MoE)架构,并结合仅解码器(decoder-only)Transformer 设计。其"LatentMoE"配置确保只激活必要的专家——通常为每个 token 从 512 个专家中激活 8 个——从而实现高效且可扩展的处理[2][6]。该模型拥有 350 亿激活参数,总参数量约 1 万亿。其上下文窗口跨度为 256,000 token,约合 600 页内容,使其能够在单次会话中处理海量数据[6]。
该架构融合了 Gemma-3 风格的注意力机制,每个全局层配有五个局部层,采用 512-token 滑动窗口,以及具有 8 个 KV 头的分组查询注意力(GQA)。其分词器 o200k_base 支持约 200,000 个 token 的词表,进一步增强了处理能力。
MAI-Thinking-1 与微软的 Maia 200 芯片协同开发,相比标准硬件配置实现了 1.4 倍的每瓦性能提升。训练使用了 8,000 块 NVIDIA GB200 GPU,通过获取高质量计算资源确保了模型的强劲性能[6]。
训练来源与数据合规性
该模型在总计 33.55 万亿 token 的纯净、商业授权、由人类生成的内容上训练而成。其中包括主预训练阶段的 30 万亿 token,以及中期训练阶段额外的 3.55 万亿 token[6]。数据集涵盖广泛的来源,例如网页文本、公开可用的 GitHub 代码、书籍、学术论文、新闻、多语言内容以及面向特定领域定制的资料。
"MAI-Thinking-1 从零开始训练,使用了 33.55 万亿 token 经过精心采集、具有商业授权的数据,确保了训练流程完全可审计。"
这种透明的数据采集方式使该模型成为医疗、金融和法律等行业的可靠之选——在这些行业中,知识产权安全与监管合规至关重要[4]。
API 与集成特性
MAI-Thinking-1 可与 Chat Completions API 无缝集成,从而兼容 OpenAI 风格的工作流。它还支持函数调用和分层开发者指令等高级功能,非常适合包括视频生成和企业级应用在内的复杂多模态任务。
| 特性 | 规格 |
|---|---|
| 架构 | 稀疏 MoE / 仅解码器 Transformer |
| 激活参数 | 350 亿 |
| 总参数 | 约 1 万亿 |
| 上下文窗口 | 256,000 token(约 600 页) |
| 训练数据 | 33.55 万亿 token(纯净、人类生成、授权) |
| API 兼容性 | Chat Completions API、函数调用、开发者指令 |
| 分词器 | o200k_base(约 20 万词表) |
| 主要芯片 | Microsoft Maia 200 |
关键性能与能力数据

MAI-Thinking-1 在数学、编程和科学推理等关键领域取得了可量化的成果。这些指标反映了它在符合企业需求的标准化问题集上的表现。
推理与工作流优化
凭借 256,000-token 的上下文窗口,MAI-Thinking-1 能够处理复杂的多步骤工作流。这包括分析冗长的合同、处理详尽的智能体轨迹(agent traces)或审阅错综复杂的研究文档等任务——全部可在单次处理中完成。其稀疏专家混合(MoE)架构确保了可扩展性,而不会带来算力需求的等比例增长,这意味着高频任务的成本更低。
例如,2026 年 6 月,微软展示了一款针对 Excel 自动化任务微调的 MAI 模型。该模型在公开和私有基准测试中均达到了与 GPT-5.4 持平的性能[6]。
"MAI-Thinking-1 专为企业大规模运行的工作负载量身打造……其性价比定位使得高频、始终在线的 AI 工作负载在经济上变得可行。" —— Naomi Moneypenny,微软 [3]
这些推理能力使其成为需要高级代码与数学性能任务的有力竞争者。
代码与数学性能
MAI-Thinking-1 在其同类中取得了一些最高的基准测试分数。值得关注的成绩包括:
- AIME 2025 达 97.0%
- AIME 2026 达 94.5%
- SWE-Bench Pro 达 52.8%
- SWE-Bench Verified 达 73.5%
- GPQA Diamond 达 84.2%
- LiveCodeBench v6 达 87.7% [6]
这些分数反映了微软专注于在确定性环境中训练模型,确保其性能既可靠又可控。这种一致性使其非常适合要求严苛的企业级应用。
企业部署特性
MAI-Thinking-1 以可扩展性和数据安全为核心理念进行设计。它完全基于专有的高质量数据构建,确保了可审计性和知识产权(IP)保护——这对医疗、金融和法律等受监管行业尤为关键。2026 年 6 月,微软与 Mayo Clinic 合作,使用 MAI 框架开发了一款专门用于高风险临床推理的临床模型[6]。
| 能力 | 规格 | 企业收益 |
|---|---|---|
| 激活参数 | 350 亿(MoE) | 在降低推理成本的同时实现高性能 |
| 上下文窗口 | 256,000 token | 无需分块即可处理 600 页以上的文档 |
| AIME 2025 分数 | 97.0% | 卓越的数学推理能力 |
| SWE-Bench Pro 分数 | 52.8% | 可靠的生产级代码生成 |
| GPQA Diamond 分数 | 84.2% | 高级科学与技术推理 |
| 数据标准 | 纯净、商业授权 | 为敏感行业确保 IP 安全 |
| 定制化 | Frontier Tuning / RLEs | 支持用户自有的检查点和工作流 |
这种强劲的性能加上多模态集成(包括先进的多模态模型),可支持视频生成和 API 优化等应用。
企业还可以使用强化学习环境(RLEs)进一步定制 MAI-Thinking-1。微软在 2026 年 6 月报告称,针对 McKinsey 的特定需求对模型进行微调后,其质量优于 GPT-5.5,同时运营成本降低了 10 倍[6]。
训练流程与数据要求
训练流程概览
MAI-Thinking-1 旨在持续演进,这得益于其精心设计的流程——其中每个要素(数据、算力和奖励信号)都可随时间不断优化和精炼[2][6]。
"目标是构建一个可重复的系统,能够吸纳更优质的数据、更强的奖励、更强大的环境以及更多的算力。" —— 微软 AI [2]
整个流程从 MAI-Base-1 开始,它通过多阶段 token 训练方法创建而成[6][7]。在此基础上,微软并行开发三个专门模型,分别专注于:
- STEM 和竞赛级别的编程。
- 智能体编程与工具使用。
- 有用性与安全性。
随后,这些模型通过监督学习进行合并。最后一步涉及强化学习(RL),用于微调合并后的模型,最终得到 MAI-Thinking-1。整个训练过程由 8,000 块 NVIDIA GB200 GPU 驱动,运行在由微软运营的 Azure 集群上[6]。
微软在模型开发上持有独特立场:智能是通过学习构建的,而非继承而来。MAI-Thinking-1 并非从第三方模型蒸馏知识,而是经过训练独立发展出推理能力[2][7]。
"能力应当被学习,而非继承。继承而来的智能虽然获取更快,却缺乏实际应用中至关重要的可控性。" —— 微软 AI [2]
这一基础性方法确保了系统不仅能力强大,而且能够适应现实世界的应用,为严格的数据治理与集成奠定了基础。
数据质量与治理标准
训练数据经过精心筛选,完全由人类撰写、具有商业授权的内容组成[2][6]。这确保了数据来源清晰可追溯,对于医疗和金融等依赖可追溯、可审计数据来满足监管合规的行业至关重要[2][5]。
为了保持完整性,微软在训练过程中避免使用标准的机器学习基准测试。这防止了模型记忆测试数据,确保基准测试分数反映的是真正的推理能力而非死记硬背[6]。
"如果我们无法说明是什么塑造了一个模型,我们就无法完全理解其行为,也无法可信地改进它。" —— 微软 AI 超级智能团队 [2]
多模态数据集成
训练过程超越了传统的文本数据,融入了多样化的多模态格式,以增强其在实际场景中的相关性。语料库包括网页文本、公开的 GitHub 代码、书籍、学术论文、新闻文章和多语言内容[6]。对于编程和智能体任务,微软采用确定性、可执行的环境来验证数据[2][6]。
除文本和代码外,MAI 系列模型还集成了音频和视觉数据。例如:
- MAI-Transcribe-1.5 使用先进的实体识别技术,精准处理特定领域词汇。
- MAI-Voice-2 具备身份保持功能,可实现一致的语音输出[3]。
- MAI-Image-2.5 支持精确的图生图编辑,同时保持品牌和角色的一致性[3]。
这种多模态集成使 MAI-Thinking-1 能够胜任从文本生成到复杂视觉和音频任务的广泛应用,确保它足够多功能以满足现实世界的需求。
在 APIMart 中的 API 集成要求

本节概述了通过 APIMart 的 API 集成以访问 MAI-Thinking-1 的步骤,该模型专为先进的多模态工作流而设计。
配置 API 访问
要访问 MAI-Thinking-1,你将使用 APIMart 兼容 OpenAI 的网关。首先配置你的 OpenAI SDK(Python 或 Node.js),使其指向以下端点:
https://api.apimart.ai/v1
将你的 OpenAI API 密钥替换为 APIMart API 密钥。确保将 "mai-thinking-1" 指定为模型标识符。
对于身份验证,请在请求头中使用 Bearer token:
Authorization: Bearer YOUR_API_KEY
务必将你的 API 密钥安全存储,可放在环境变量或密钥管理器中。请注意,目前访问权限仅限于私有预览。生产环境访问可通过 Microsoft Foundry 申请[2][3]。
函数调用与开发者工具
MAI-Thinking-1 超越了标准的聊天补全功能,提供了增强功能的运行时工具。集成过程非常简单:
- 模型处理你的输入并识别出工具调用请求。
- 你的客户端执行该工具调用,并将结果发送回模型。
- 模型使用该结果生成最终响应[8]。
以下是支持的工具及其使用场景的详细说明:
| 工具类型 | 描述 | 示例使用场景 |
|---|---|---|
| 函数调用 | 通过 JSON Schema 执行自定义函数 | 触发数据库查询或业务逻辑 |
| 网页搜索 | 从互联网检索实时数据 | 获取股票价格或技术文档 |
| 文件搜索 | 在上传的文档中搜索 | 分析内部手册或合规文件 |
| 远程 MCP | 连接到模型上下文协议(Model Context Protocol)服务 | 访问受保护的数据或特定领域的模型 |
这些工具使开发者能够扩展模型的能力,以适应广泛的应用场景。
运行前提条件
为了优化你与 MAI-Thinking-1 的集成,请确保满足以下运行要求:
- 支持 256,000-token 上下文窗口,这需要高效的内存和延迟管理,以处理大型的上下文数据集[2]。
- 正确处理关键错误码:
401:身份验证失败402:余额不足429:超出速率限制
以下是技术要求的快速摘要:
| 要求 | 详情 |
|---|---|
| 模型标识符 | mai-thinking-1 |
| 认证方式 | Bearer Token |
| 上下文窗口 | 256,000 token |
| 架构 | 稀疏专家混合(350 亿激活 / 1 万亿总参数) |
| API 兼容性 | OpenAI Chat Completions |
实际部署限制
当前部署状态
截至 2026 年 6 月,MAI-Thinking-1 仅通过 Microsoft Foundry 上的_私有预览_提供。访问需通过 Foundry 门户提交申请。更广泛的公开预览预计将"很快"在 MAI Playground 推出,并将在全球多个 Foundry 区域逐步扩大正式可用性[1][2]。这种分阶段的推出凸显了该模型在处理复杂多模态 AI 工作流中的重要性。
现阶段的一大限制是尚未公布按 token 计费的价格。这使得团队难以准确预估集成预算。不过,作为参考,Foundry 上 MAI 系列的其他模型定价为每 100 万输入 token 5 美元(MAI-Image-2.5)和每小时 0.36 美元(MAI-Transcribe-1.5),可大致反映其定价结构[3]。
推理与性能权衡
MAI-Thinking-1 采用_稀疏专家混合_架构,在一次推理过程中仅激活其约 1 万亿总参数中的 350 亿个。这种设计在降低算力成本与保持高水平推理能力之间取得了平衡:
"MAI-Thinking-1 专为企业大规模运行的工作负载量身打造……其性价比定位使得高频、始终在线的 AI 工作负载在经济上变得可行。" [3]
话虽如此,该模型仅限于文本和推理任务。它不支持基于视觉的任务或多模态文档理解。对于需要图像分析或视觉文档解析的工作流,将需要额外的模型。这些限制可能会根据行业和具体用例显著影响部署策略。
行业特定用例
这些限制直接影响了模型在不同行业中的应用方式。例如,Mayo Clinic 已与微软合作,将 MAI-Thinking-1 集成到临床和研究工作流中。这一合作展示了访问控制和可靠性要求在医疗等受监管行业中所发挥的关键作用[6][9]。
总体而言,MAI-Thinking-1 最适合法律分析、金融建模、医学研究和企业软件开发等领域的高频推理任务。这些行业需要可扩展、成本高效的智能解决方案,而该模型以文本为核心的架构,加上其受控的可用性,与这些行业的合规和运营需求高度契合。
结论与关键要点
MAI-Thinking-1 凭借其强大的架构和顺畅的集成脱颖而出,成为多模态应用的首选。它在推理任务中的表现树立了高标准,将高效率与令人印象深刻的基准测试成绩相结合。采用纯净、商业授权的训练数据以及无蒸馏(no-distillation)方法,使其拥有明显优势,尤其适用于医疗、法律和金融等对数据透明度和来源可追溯性至关重要的行业。
开发者可以通过 APIMart 轻松访问 MAI-Thinking-1,APIMart 为超过 500 个 AI 模型提供统一端点,包括 MAI-Image-2.5、Sora 2 和 Kling V3。这种配置简化了多模态流程的构建——例如,使用 MAI-Thinking-1 进行推理,使用 MAI-Image-2.5 处理视觉任务,使用 Sora 2 或 Kling V3 输出视频。所有这一切都由可靠的 99.9% 正常运行时间 SLA 保障。
为了优化成本和性能,企业可以实施分级路由,将复杂的推理任务分配给 MAI-Thinking-1,同时将较简单的任务委托给更轻量的模型。建议尽早集成,让企业有时间在需求增长之前测试、优化和扩展其系统。通过采用 MAI-Thinking-1,组织能够实现卓越的技术性能,同时在各个领域释放运营效率。
常见问题
我应该把 256,000-token 的上下文窗口用于什么?
256,000-token 上下文窗口非常适合处理涉及大量数据的任务。例如,它可以审阅多达 600 页的海量文档,或轻松处理错综复杂的编程工作流。这种能力对企业级操作尤为有用,比如分析整个代码仓库以发现错误、修复 bug 或执行复杂的多层指令。
它在异步、高频场景中同样表现出色。诸如评估架构一致性或在大型数据集中识别模式等任务变得更加易于管理,尤其是在无需即时响应的情况下。
如果 MAI-Thinking-1 处于私有预览阶段,我该如何获取访问权限?
要在私有预览期间试用 MAI-Thinking-1,你需要通过 Azure AI Foundry 上的官方意向表单提交早期访问申请。你也可以在 Baseten、Fireworks AI 和 Open Router 等平台上测试该模型。请在 Azure AI Foundry 的模型卡片或目录中查找注册链接。有关公开可用性和定价的详情将在预览阶段结束后公布。
要从我的 OpenAI SDK 调用 MAI-Thinking-1,我需要做哪些更改?
要在 OpenAI SDK 中使用 MAI-Thinking-1,你需要调整客户端配置和请求结构。具体操作如下:
- 使用专门针对 MAI-Thinking-1 的 API 基础 URL。
- 将模型参数设置为
mai-thinking-1。 - 包含旨在引导分步推理的系统提示词。
- 调整
extra_body参数以控制推理强度。请记住,这将同时影响计算时间和相关成本。
确保你的集成能够正确处理推理风格的输出,以获得最佳效果。
相关博客文章
去模型市场挑选你想要的模型
在 APIMart 模型市场尝试聊天、图像和视频模型,用统一 API 快速体验模型能力。