
Entenda o modelo de IA aberto Inkling-Small
Conheça o Inkling-Small, MoE multimodal de 276B da Thinking Machines com 12B de parâmetros ativos, contexto de 1M tokens, pesos abertos e implantação flexível.
Se você procura um modelo aberto capaz de lidar com entradas longas por um custo menor que o de muitos sistemas de ponta, o Inkling-Small merece atenção. Em 30 de julho de 2026, a Thinking Machines lançou um modelo MoE multimodal com 276 bilhões de parâmetros, mas apenas 12 bilhões de parâmetros ativos por solicitação, além de uma janela de contexto de 1 milhão de tokens e licença Apache 2.0.
Veja o resumo:
- Posso usá-lo com texto, imagens e áudio
- Recebo saídas em texto, código e JSON
- Posso ajustar o esforço de raciocínio de 0.2 a 0.99 para equilibrar custo e profundidade de raciocínio
- Posso hospedá-lo por conta própria para usar a janela de contexto completa de 1,000,000 tokens
- Posso usar o Tinker para acesso hospedado, com limite de contexto de 256,000 tokens
- Posso baixar os pesos abertos no Hugging Face
- Posso usar uma versão 4-bit NVFP4 em GPUs da NVIDIA
- Posso fazer fine-tuning com dados privados e executar o modelo em meu próprio ambiente
Alguns números chamam atenção. O Inkling-Small alcançou 77.6% no SWE-bench Verified, igualou o Nemotron 3 Ultra no Terminal Bench 2.1 com cerca de um terço do custo de tokens e registrou 98.6% no StrongREJECT. Portanto, embora o nome inclua Small, o modelo foi criado para programação avançada, trabalho com documentos, fluxos de suporte e tarefas de agentes.
O Inkling-Small não é nada pequeno: teste do modelo 276B
Comparação rápida
| Área | Inkling-Small | Acesso pelo Tinker |
|---|---|---|
| Tipo de acesso | Pesos abertos com hospedagem própria | API hospedada |
| Licença | Apache 2.0 | Serviço gerenciado |
| Contexto máximo | 1,000,000 tokens | 256,000 tokens |
| Entradas | Texto, imagens, áudio | Texto, imagens, áudio |
| Saídas | Texto, código, JSON | Texto, código, JSON |
| Controle | Controle completo da infraestrutura e do modelo | Menos trabalho de configuração |
| Fine-tuning | Sim | Sim |
Minha conclusão: este lançamento oferece às equipes dos EUA uma opção clara para implantação de menor custo, ambiente privado e trabalho multimodal com contexto longo sem dependência de uma API fechada.
Visão geral do Inkling-Small: arquitetura, tamanho e recursos
O Inkling-Small é um transformer Mixture-of-Experts (MoE) somente decodificador, com 276 bilhões de parâmetros totais e cerca de 12 bilhões de parâmetros ativos por token. Em comparação, o modelo principal tem 975 bilhões de parâmetros totais e 41 bilhões de parâmetros ativos por token [2][1][3]. Essa diferença é importante. Ela ajuda a explicar por que o Inkling-Small parece mais leve de usar e, ainda assim, lida com tarefas exigentes. Isso fica mais evidente no suporte a entradas multimodais e na janela de contexto longa.
Entradas multimodais, saídas de texto e suporte a contexto longo
O Inkling-Small recebe texto, imagens e áudio como entradas e retorna saídas de texto, incluindo linguagem natural, código e JSON [2][1]. Ele foi pré-treinado com 45 trilhões de tokens de dados multimodais em texto, imagem, áudio e vídeo [1][3].
O modelo também aceita uma janela de contexto de até 1 milhão de tokens [1]. Isso faz grande diferença para equipes que trabalham com grandes bases de código, documentos extensos ou transcrições longas. Em vez de dividir o material em pequenos fragmentos e torcer para que nada se perca, elas podem fornecer ao modelo uma parcela muito maior do contexto completo de uma só vez. Esse recurso costuma ser importante ao avaliar hospedagem própria, fine-tuning ou uso do modelo por meio de ferramentas.
Desempenho em benchmarks e o verdadeiro significado de “Small”
Os resultados dos benchmarks ajudam a colocar o nome Small em perspectiva.
No SWE-bench Verified, o Inkling-Small alcançou 77.6%, superando os 71.9% do Nvidia Nemotron 3 [2]. No Terminal Bench 2.1, ele igualou o Nemotron 3 Ultra com cerca de um terço do custo de tokens [1][3]. Também obteve 98.6% no StrongREJECT, o que aponta para um tratamento robusto de recusas [2].
Em resumo, Small não significa fraco. Na prática, a arquitetura MoE e o contexto longo fazem diferença em atividades importantes para as equipes: revisão de código, análise de documentos e fluxos de agentes.
Como acessar o Inkling-Small: pesos, ferramentas e opções de integração

Pesos abertos, cartão do modelo e arquivos disponíveis
Os pesos do Inkling-Small estão disponíveis publicamente no Hugging Face, dentro da organização thinkingmachines [2][6].
O lançamento inclui os arquivos centrais que a maioria das equipes espera: pesos, cartão do modelo, tokenizer, arquivos de configuração e codificadores de modalidade [4][2]. Assim, você não precisa começar do zero nem montar tudo manualmente.
Para implantação em GPUs NVIDIA, também há uma versão quantizada em 4-bit chamada Inkling-Small-NVFP4, que oferece desempenho melhor nessa configuração [4][5]. Se sua equipe quiser testar o modelo antes de assumir a hospedagem própria, o Tinker é o caminho mais rápido.
Hospedagem própria, APIs hospedadas e fine-tuning: uma comparação
A Thinking Machines oferece o Tinker, uma API de testes e fine-tuning que permite aos desenvolvedores experimentar o modelo, limitar o tamanho das respostas, ativar a pesquisa na web e realizar fine-tuning de nível empresarial [2][1].
O Tinker também oferece, desde o primeiro dia, integrações com as principais ferramentas de inferência e implantação [6][1]. Isso importa porque o modelo em si é apenas parte do trabalho. Você também precisa de um caminho para inseri-lo em uma estrutura ativa sem acumular tarefas de configuração.
A escolha é bastante simples:
- Hospedagem própria oferece controle total e acesso à janela de contexto de 1 milhão de tokens [6][1].
- Tinker reduz o trabalho operacional, mas limita o contexto a 256,000 tokens [6][1].
Portanto, a decisão depende de velocidade ou controle. Se você quer acesso gerenciado e menos trabalho de infraestrutura, o Tinker é o caminho mais fácil. Se precisa da janela de contexto completa e de um controle mais rígido sobre a implantação, a hospedagem própria faz mais sentido.
Como a APIMart se encaixa nos fluxos multimodais de produção

Depois que uma equipe escolhe a forma de acesso, ainda resta o lado prático da produção: fazer solicitações multimodais passarem por um fluxo de trabalho simples e organizado.
Para equipes que precisam de análise e geração no mesmo fluxo, a APIMart oferece uma camada única de integração para APIs multimodais.
Casos de uso e implantação econômica para equipes dos EUA
Assistentes de programação, agentes, suporte e análise de documentos
Com o acesso esclarecido, o próximo passo é simples: onde o Inkling-Small mostra seu valor? A arquitetura MoE ajuda a manter a inferência eficiente em trabalhos de produção com grande volume [1].
Para equipes de software, isso torna o modelo adequado para correções de bugs no nível do repositório, revisões de PR e agentes de programação com várias etapas que precisam percorrer grandes bases de código [2].
A mesma configuração funciona bem em tarefas que exigem classificação rápida e leitura de contexto longo. Pense em copilotos de suporte que fazem a triagem de chamados, respondem a perguntas sobre políticas e encaminham os casos para o lugar certo. Em escala, pequenas melhorias de latência e computação acumulam resultados rapidamente.
O modelo também atende à análise de documentos extensos, incluindo contratos, arquivos de políticas e manuais técnicos [1]. Se sua equipe lida com documentos densos durante todo o dia, esse é o tipo de carga em que a leitura de contexto longo começa a fazer diferença.
Em plataformas educacionais, o Inkling-Small pode oferecer tutoria de matemática e lógica com esforço de raciocínio ajustável [2]. Isso permite alinhar o esforço do modelo à tarefa, em vez de pagar o mesmo custo computacional em todas as solicitações.
Casos comuns incluem:
- Agentes de programação
- Copilotos de suporte
- Análise de documentos
- Tutoria
- Marcação multimodal
Custo, latência e planejamento de orçamento para equipes dos EUA
O principal fator de custo é a arquitetura MoE. Ela ajuda a manter mais baixos o custo da inferência e a latência em solicitações repetidas [1].
Os desenvolvedores também podem ajustar o esforço de raciocínio no código, de 0.2 para tarefas mais simples até 0.99 para raciocínios mais difíceis [2]. Em outras palavras, as equipes podem usar menos computação em atividades de alto volume e baixa complexidade, reservando mais tempo de raciocínio para os casos que realmente precisam dele.
Esse controle é importante ao planejar os gastos de uma equipe dos EUA. Um fluxo de suporte que processa milhares de solicitações rotineiras por dia não precisa da mesma configuração de um agente de programação que enfrenta casos-limite complexos. Um modelo, diferentes níveis de esforço e uma forma mais clara de controlar o orçamento.
Como o modelo é lançado sob licença Apache 2.0, as equipes dos EUA também podem executá-lo localmente ou dentro de VPCs quando o controle de dados for prioridade [2][1].
Essas opções de implantação conduzem às conclusões de pesquisa da próxima seção.
Conclusões de pesquisa e resumo final
Por que pesos abertos importam para testes e personalização
Depois de abordar acesso e implantação, a principal questão de pesquisa é o que os pesos abertos permitem às equipes na prática.
Como os pesos são abertos, pesquisadores podem inspecionar diretamente a arquitetura e os controles de raciocínio. Também podem testar o modelo com dados internos sem enviá-los por uma API externa. Esse nível de visibilidade ajuda nos testes de segurança. Em vez de aceitar as afirmações publicadas, as organizações podem verificar os resultados na própria infraestrutura.
A adaptação a domínios é outra grande vantagem. Equipes de áreas como análise financeira ou engenharia de software podem fazer fine-tuning com dados proprietários, em vez de depender de um sistema generalista [2]. A mesma abertura também favorece implantação local e adaptação específica a um domínio, permitindo auditorias independentes de acordo com as necessidades da equipe.
Principais pontos
Alguns pontos merecem destaque:
- Pesos abertos permitem que as equipes testem, façam fine-tuning e avaliem o modelo em sua própria infraestrutura.
- Os pesos estão disponíveis no Hugging Face, e o Tinker oferece uma forma de testar intensamente as configurações antes da produção [2][1].
- O Inkling-Small foi criado para implantações controladas e sensíveis a custos, com pesos abertos que apoiam testes, fine-tuning e benchmarks independentes.
Para equipes que precisam de controle, personalização e validação independente, essa configuração torna o Inkling-Small uma opção prática.
Perguntas frequentes
De qual hardware preciso para hospedar o Inkling-Small?
O Inkling-Small usa uma arquitetura de 276 bilhões de parâmetros e checkpoints nativos quantizados em NVFP4 para sistemas NVIDIA Blackwell.
Sua configuração também deve aceitar bibliotecas de inferência de código aberto, como SGLang, vLLM, TokenSpeed ou llama.cpp. Embora a Thinking Machines tenha usado sistemas GB300 NVL72 durante o desenvolvimento, a variante Small foi projetada como uma opção mais econômica e de menor latência para implantação local.
Quando devo escolher hospedagem própria em vez do Tinker?
Use hospedagem própria quando sua organização precisar de controle total sobre cargas de IA com agentes. Isso pode significar executar modelos localmente ou em uma nuvem virtual privada, com sua equipe responsável pela configuração e pelas operações diárias.
Também é uma boa opção para equipes que desejam gerenciar a própria infraestrutura, reduzir custos contínuos de tokens ou atender a requisitos específicos de privacidade de dados.
O Tinker é a melhor escolha se você quer uma configuração conveniente e simples para pesquisa e fine-tuning. A hospedagem própria oferece mais espaço para ajustar desempenho e custo ao seu hardware.
Como o esforço de raciocínio afeta o custo e a qualidade da resposta?
O esforço de raciocínio controlável do Inkling oferece aos desenvolvedores uma forma simples de ajustar o orçamento de raciocínio do modelo de 0.2 a 0.99. Configurações mais altas usam mais computação para raciocínios complexos e com várias etapas. Configurações mais baixas reduzem o uso de tokens e a latência em tarefas simples.
Como o Inkling condensa o raciocínio da cadeia de pensamento, muitas vezes consegue resultados precisos com menos tokens. Isso dá aos usuários mais controle sobre custo e desempenho de acordo com as necessidades da implantação.
Escolha o modelo que você quer no marketplace
Teste modelos de chat, imagem e vídeo no marketplace da APIMart e experimente rapidamente as capacidades dos modelos com uma API unificada.