Publicado: Julho de 2025 | Última atualização: Julho de 2025
A Moonshot AI lançou o Kimi K3, o seu modelo de linguagem de raciocínio de ponta, entrando em competição direta com o GPT-4o, Claude 3.7 Sonnet, DeepSeek V3 e Qwen3 no cenário de IA de vanguarda de 2025. O modelo baseia-se no legado de contexto longo da Moonshot AI, ao mesmo tempo que adota um design focado em raciocínio que visa matemática complexa, engenharia de software e resolução de problemas científicos. Este guia aborda a arquitetura e as especificações técnicas do K3, o desempenho em benchmarks em cinco grandes conjuntos de avaliação, comparações diretas com concorrentes e como aceder ao K3 através da aplicação Kimi ou da Interface de programação de aplicativos (API) Kimi.
TL;DR: O Kimi K3 num relance
- Desenvolvedor: Moonshot AI (月之暗面), Pequim, China
- Data de lançamento: Julho de 2025
- Arquitetura: Transformer de Mistura de Especialistas (MoE)
- Parâmetros: 671 mil milhões no total, 32 mil milhões ativos por passagem (segundo o relatório técnico da Moonshot AI)
- Janela de contexto: 128K tokens
- Melhor benchmark (AIME 2025): 96.2 (pass@1, segundo o relatório técnico da Moonshot AI)
- Pesos abertos: Não. Acesso apenas via API e aplicação para o consumidor.
- Acesso: Assistente Kimi AI em kimi.ai / Plataforma de programadores da Moonshot AI
O que é o Kimi K3?
O Kimi K3 é um modelo de linguagem de grande escala (LLM) desenvolvido pela Moonshot AI (月之暗面) e lançado em julho de 2025, concebido como um modelo emblemático focado no raciocínio que utiliza o processamento de cadeia de pensamento (chain-of-thought) alargado para abordar problemas complexos de vários passos em matemática, engenharia de software e tarefas profissionais intensivas em conhecimento. Um modelo de linguagem de grande escala é um modelo de aprendizagem profunda treinado em vastos corpora de texto para gerar, traduzir, resumir e raciocinar sobre linguagem natural; o K3 pertence ao nível de fronteira desta classe, caracterizado por contagens de parâmetros na ordem das centenas de milhares de milhões.
Um modelo de raciocínio, tal como o Kimi K3 é posicionado, gera etapas de pensamento intermédias explícitas antes de produzir uma resposta final. Esta abordagem melhora a precisão em problemas complexos, mas aumenta o tempo de resposta em comparação com os modelos padrão de seguimento de instruções. O Kimi K3 insere-se na mesma classe de capacidade que o OpenAI o3 e o DeepSeek R1, modelos que estabeleceram o paradigma de raciocínio em 2024 e 2025.
O K3 sucede ao Kimi K2, o anterior modelo de referência da Moonshot AI, que estava posicionado como um modelo agêntico focado na utilização de ferramentas e no processamento de documentos de contexto Long. A transição do K2 para o K3 representa uma mudança deliberada da capacidade agêntica para o raciocínio de uso geral. De acordo com o blogue oficial da Moonshot AI, o K3 ficou disponível na aplicação Kimi e via API simultaneamente aquando do seu lançamento em julho de 2025.
Moonshot AI: a empresa por trás do Kimi K3
Moonshot AI (月之暗面, Yuèzhī Ànmiàn) é uma empresa de inteligência artificial sediada em Pequim, fundada em 2023, mais conhecida por desenvolver a família de modelos de linguagem Kimi e a aplicação de assistente de IA Kimi em kimi.ai. A empresa foi fundada por Yang Zhilin, um antigo investigador da Universidade de Tsinghua e da Universidade Carnegie Mellon e coautor do XLNet, um modelo de linguagem precoce baseado em Transformer que competiu diretamente com o BERT. A Moonshot AI terá arrecadado mais de mil milhões de dólares em financiamento, com uma avaliação de aproximadamente 3,3 mil milhões de dólares a meio de 2025, segundo reportagens da Bloomberg e Crunchbase, tornando-a uma das startups de IA mais bem avaliadas da China.
A tese técnica fundadora da Moonshot AI foi a especialização em contexto longo. Os primeiros modelos Kimi ofereciam janelas de contexto de 1 milhão de tokens numa altura em que a maioria dos concorrentes atingia no máximo 32K ou 128K tokens, o que deu à Moonshot AI uma identidade de produto distinta. A progressão dos modelos da empresa decorre: Kimi (2023, primeiro modelo de contexto longo) para Kimi K2 (meados de 2025, um modelo MoE agentivo com uso de ferramentas) para Kimi K3 (julho de 2025, o modelo de raciocínio principal coberto neste guia).
Com o K3, a Moonshot AI ampliou o seu posicionamento para além da especialização em contexto longo, para incluir desempenho de referência em raciocínio de topo, colocando-a em concorrência direta com a OpenAI, Anthropic, Google DeepMind, DeepSeek e Alibaba Cloud.
Para uma visão completa do conjunto de produtos e do histórico da empresa Moonshot AI, consulte Moonshot AI: Visão Geral da Empresa e Guia do Produto Kimi.)
Arquitetura e especificações técnicas do Kimi K3
O Kimi K3 é construído com um design de Mistura de Especialistas (MoE) com 671 mil milhões de parâmetros totais, uma janela de contexto de 128 mil tokens e capacidades de raciocínio expandidas, produzidas por pós-treino baseado em aprendizagem por reforço (RL). A arquitetura é confirmada no relatório técnico Kimi K3 da Moonshot AI.
Tamanho do modelo e contagem de parâmetros
De acordo com o relatório técnico da Moonshot AI, o Kimi K3 contém 671 mil milhões de parâmetros totais, com 32 mil milhões ativos por passagem direta. Numa arquitetura Mixture of Experts (MoE) (o design fundamental que sustenta todos os modelos de linguagem grandes modernos desde 2017, aplicado aqui na sua forma de ativação esparsa), os parâmetros totais refletem a capacidade total do modelo em todas as sub-redes de especialistas, enquanto os parâmetros ativos refletem apenas o subconjunto envolvido em cada passagem de inferência. Esta distinção torna contagens totais de parâmetros elevadas computacionalmente viáveis em tempo de inferência: 671 mil milhões de parâmetros totais ativam-se como apenas 32 mil milhões por passagem, mantendo os custos de inferência comparáveis aos de um modelo denso muito menor.
O Kimi K2, modelo anterior da Moonshot AI, utilizou um design MoE com aproximadamente 1 trilião de parâmetros totais e 32 mil milhões ativos. O K3 reduz a contagem total de parâmetros, mantendo a mesma contagem de parâmetros ativos, uma configuração que o relatório técnico da Moonshot AI atribui a uma maior eficiência no encaminhamento de especialistas. A proporção ativo-total no K3 (32 mil milhões / 671 mil milhões) é superior à do K2 (32 mil milhões / 1 trilião), indicando uma utilização mais densa dos especialistas por passo de processamento (forward pass).
Janela de contexto
O Kimi K3 suporta uma janela de contexto de 128 mil tokens, o que significa que pode processar aproximadamente 96.000 palavras de texto em inglês ou cerca de 5.000 a 10.000 linhas de código numa única interação. A janela de contexto é a quantidade máxima de texto que um modelo pode processar de uma só vez; janelas maiores permitem a análise de livros inteiros, bases de código ou conjuntos de pesquisa com múltiplos documentos sem perder informação.
Para comparação: o GPT-4o suporta 128K tokens, o Claude 3.7 Sonnet suporta 200K tokens e o Gemini 2.5 Pro suporta até 1M tokens. O K3 iguala o GPT-4o em comprimento de contexto e fica atrás tanto do Claude 3.7 Sonnet como do Gemini 2.5 Pro. O K2 também utilizava uma janela de contexto de 128K, igualando o K3; os modelos Kimi anteriores ao K2 ofereciam janelas de 1M tokens, que foi o principal diferencial de produto fundacional da Moonshot AI. Essa vantagem de contexto longo não foi mantida nos K2 ou K3, um compromisso que a Moonshot AI não explicou publicamente. Aplicações práticas dentro da janela de 128K incluem revisão jurídica de documentos completos, análise completa de bases de código para repositórios de médio porte e síntese de pesquisa de múltiplas fontes sem fragmentação de documentos.
Metodologia de treino
O relatório técnico da Moonshot AI descreve uma fase padrão de pré-treino em larga escala, seguida de um pós-treino baseado em RL (aprendizagem por reforço) para apurar o desempenho de raciocínio. No seu relatório técnico público, a Moonshot AI não revelou a escala total dos dados de pré-treino (em tokens) para o Kimi K3. A variante específica de RL utilizada (GRPO, PPO ou outro método) também não foi confirmada na documentação pública.
O raciocínio de cadeia de pensamento (CoT) é uma técnica na qual um modelo gera passos de raciocínio intermédios explícitos antes de chegar a uma resposta final, melhorando a precisão em problemas complexos de várias etapas. Esta metodologia de pós-treino foi estabelecida como o principal impulsionador das melhorias de desempenho dos modelos de raciocínio pelo DeepSeek R1 e pelos modelos da série o da OpenAI. Em julho de 2025, a Moonshot AI não confirmou publicamente a data limite do conhecimento dos dados de treino do K3; os leitores que necessitem desta informação devem consultar diretamente a documentação oficial da Moonshot AI.
Kimi K3 vs. Kimi K2: o que mudou
O Kimi K3 representa uma mudança estratégica do posicionamento do Kimi K2, focado prioritariamente em agentes, para um design emblemático de propósito geral e focado no raciocínio.
| Atributo | Kimi K2 | Kimi K3 |
|---|---|---|
| Arquitetura | MoE | MoE |
| Parâmetros totais | ~1T | 671B |
| Parâmetros ativos | ~32B | 32B |
| Janela de contexto | 128K tokens | 128K tokens |
| Posicionamento principal | Agente / uso de ferramentas | Raciocínio / carro-chefe |
| AIME 2025 (pass@1) | Não reportado | 96.2 (por Moonshot AI) |
| MMLU Pro | Não reportado | 80.5% (por Moonshot AI) |
| LiveCodeBench | Não reportado | 65.8% (por Moonshot AI) |
| Data de lançamento | Meados de 2025 | Julho de 2025 |
| Estado do modelo aberto | Não | Não |
A mudança mais significativa da K2 para a K3 é a alteração de posicionamento: da utilização de ferramentas agênticas para o raciocínio de uso geral, apoiada por pontuações de benchmark substancialmente mais elevadas. A contagem total de parâmetros baixou de ~1T para 671B, enquanto os parâmetros ativos se mantiveram nos 32B. Para os atuais utilizadores da K2, a K3 traz um desempenho mensuravelmente superior em tarefas de raciocínio de várias etapas, mantendo a mesma janela de contexto e modelo de acesso.
Para uma análise completa da arquitetura do Kimi K2, do modelo de acesso com pesos abertos e das capacidades de agente, consulte O que é o Kimi K2? O Modelo de Pensamento 'Open-Weight' da Moonshot AI.)
Principais características do Kimi K3
- Capacidade de raciocínio alargada: O Kimi K3 aplica raciocínio de cadeia de pensamento (CoT), gerando passos intermédios explícitos que melhoram a precisão em problemas complexos de matemática, programação e lógica, colocando-o na mesma classe de modelos de raciocínio que o OpenAI o3 e o DeepSeek R1.
- Janela de contexto de 128K tokens: Suporta o processamento de contratos legais extensos, bases de código completas de dimensão média ou conjuntos de investigação multidocumento num único prompt, sem necessidade de segmentação.
- Arquitetura MoE: Construído sobre um design de Transformador de Mistura de Especialistas (Mixture of Experts) com 671 mil milhões de parâmetros totais e 32 mil milhões ativos por cada passagem de inferência, equilibrando a grande capacidade do modelo com custos de computação de inferência geríveis.
- Forte desempenho em benchmarks: Pontua 96,2 no AIME 2025 e 80,5% no MMLU Pro, de acordo com o relatório técnico da Moonshot AI, colocando-o no nível superior dos modelos de fronteira avaliados publicamente em raciocínio matemático.
- Suporte multilingue: Suporta oficialmente chinês e inglês. O suporte para idiomas adicionais não foi confirmado na documentação oficial.
- Acesso via API e aplicação de consumo: Disponível através da API Kimi na Plataforma de programadores da Moonshot AI e através da aplicação de consumo em kimi.ai.
- Capacidades multimodais: Até ao lançamento, a Moonshot AI não confirmou capacidades multimodais nativas (visão/imagem) para o Kimi K3. A interface da aplicação Kimi suporta o carregamento de documentos (PDFs), mas a compreensão de imagens como uma capacidade base do modelo não foi confirmada oficialmente para o K3.
O K3 entra num campo competitivo onde os benchmarks de raciocínio se tornaram o principal diferenciador entre modelos de ponta. A combinação de um forte desempenho em AIME e uma arquitetura MoE que mantém os custos de inferência mais baixos do que modelos densos de tamanho equivalente torna o K3 um candidato tanto para tarefas de raciocínio de nível de investigação como para implementações de API de produção sensíveis ao custo.
Desempenho de benchmark do Kimi K3
De acordo com o relatório técnico da Moonshot AI, o Kimi K3 obtém uma pontuação de 96,2 no AIME 2025 (pass@1), 80,5% no MMLU Pro e 65,8% no LiveCodeBench, colocando-o acima do GPT-4o em benchmarks de raciocínio matemático e em posição competitiva face ao DeepSeek V3 e ao Qwen3 em todo o conjunto principal de avaliação de modelos de fronteira.
(Todas as pontuações de benchmark citadas nesta secção são provenientes do relatório técnico oficial da Moonshot AI e/ou da tabela de classificação AIME 2025 do Papers With Code em julho de 2025. As classificações dos benchmarks mudam frequentemente. Os leitores devem verificar as classificações atuais no Papers With Code e no LMSYS Chatbot Arena para obter comparações atualizadas.)
Matemática e raciocínio: AIME e MATH-500
O Kimi K3 obteve uma pontuação de 96,2 no AIME 2025 (pass@1) de acordo com o relatório técnico da Moonshot AI, em comparação com a pontuação reportada do GPT-4o de aproximadamente 62% sob condições de avaliação sem raciocínio. O AIME (American Invitational Mathematics Examination) é um rigoroso exame de competição de matemática do ensino secundário composto por 15 problemas; as pontuações de IA acima de 80% indicam uma capacidade avançada de raciocínio matemático, enquanto os concorrentes humanos costumam pontuar no intervalo de 20–47% (3–7/15). No MATH-500, um benchmark de 500 problemas de nível de competição em vários níveis de dificuldade, o Kimi K3 alcança 97,4% de acordo com o relatório técnico da Moonshot AI, comparado com os aproximadamente 76,6% do GPT-4o e os 90,2% reportados do DeepSeek V3.
Enquanto um modelo padrão pode adivinhar ou truncar num problema de álgebra de várias etapas, um modelo de raciocínio como o K3 gera etapas intermédias, reduzindo a propagação de erros em cada fase. Estas pontuações indicam que o K3 resolve corretamente problemas de cálculo de várias etapas, combinatória e álgebra a taxas superiores a 95%, superando substancialmente os modelos sem raciocínio em tais tarefas. Isto torna o K3 uma excelente opção para assistência em computação científica, apoio à investigação quantitativa e aplicações de tutoria que exijam explicações matemáticas passo a passo.
Conhecimentos gerais: MMLU Pro
O Kimi K3 atinge 80,5% no MMLU Pro, acima do GPT-4o (aproximadamente 72,6%) e em paridade com o Qwen3-235B (aproximadamente 79,8%), de acordo com os respetivos relatórios técnicos oficiais. O MMLU Pro (Massive Multitask Language Understanding Pro) é uma versão melhorada do benchmark MMLU que testa conhecimentos e raciocínio de várias etapas em 57 domínios académicos e profissionais, concebida para distinguir entre modelos de fronteira onde as pontuações originais do MMLU convergiram para perto da saturação. Pontuações elevadas no MMLU Pro correlacionam-se com um desempenho fiável em tarefas intensivas de conhecimento, tais como investigação jurídica, resposta a perguntas médicas e revisão de literatura científica.
Programação: LiveCodeBench e SWE-bench Verified
No LiveCodeBench, o Kimi K3 obteve uma pontuação de 65,8% de acordo com o relatório técnico da Moonshot AI, em comparação com os aproximadamente 39,3% do GPT-4o e os aproximadamente 59,4% do DeepSeek V3. O LiveCodeBench avalia modelos em problemas de programação competitiva recolhidos continuamente de plataformas como LeetCode e Codeforces após as datas de corte do treino dos modelos, reduzindo o risco de contaminação dos dados de treino e tornando-o um indicador mais fiável da verdadeira capacidade de programação do que os referenciais estáticos.
No SWE-bench Verified, Kimi K3 atinge 63,9% de acordo com o relatório técnico da Moonshot AI, abaixo dos 70,3% reportados pelo Claude 3.7 Sonnet (com raciocínio estendido), mas acima dos aproximadamente 38,7% do GPT-4o. O SWE-bench Verified testa a resolução automática de problemas reais de engenharia de software do GitHub, exigindo compreensão do código-fonte, identificação de bugs e geração de patches. Estas capacidades são essenciais para o desenvolvimento de software assistido por IA. Uma pontuação de 63,9% significa que o K3 consegue resolver autonomamente aproximadamente 64 em cada 100 problemas reais do GitHub, uma capacidade aplicável a fluxos de trabalho de revisão de código e correção de bugs automatizados.
Tabela de comparação de benchmarks mestres
A tabela abaixo compara o Kimi K3 com cinco modelos de ponta nas principais categorias de benchmark (todas as pontuações retiradas de relatórios técnicos oficiais dos modelos ou de rankings verificados a partir de julho de 2025).
[{"AIME 2025":"AIME 2025","Context Window":"Janela de Contexto","LiveCodeBench":"LiveCodeBench","MATH-500":"MATH-500","MMLU Pro":"MMLU Pro","Model":"Modelo","SWE-bench Verified":"SWE-bench Verified"},{"AIME 2025":"96.2","Context Window":"128K","LiveCodeBench":"65.8%","MATH-500":"97.4%","MMLU Pro":"80.5%","Model":"Kimi K3","SWE-bench Verified":"63.9%"},{"AIME 2025":"~62.0","Context Window":"128K","LiveCodeBench":"~39.3%","MATH-500":"~76.6%","MMLU Pro":"~72.6%","Model":"GPT-4o","SWE-bench Verified":"~38.7%"},{"AIME 2025":"~86.7","Context Window":"200K","LiveCodeBench":"~56.0%","MATH-500":"~92.3%","MMLU Pro":"~78.0%","Model":"Claude 3.7 Sonnet","SWE-bench Verified":"~70.3%*"},{"AIME 2025":"~90.6","Context Window":"128K","LiveCodeBench":"~59.4%","MATH-500":"~90.2%","MMLU Pro":"~75.9%","Model":"DeepSeek V3","SWE-bench Verified":"~49.2%"},{"AIME 2025":"~92.8","Context Window":"128K","LiveCodeBench":"~66.2%","MATH-500":"~94.0%","MMLU Pro":"~79.8%","Model":"Qwen3-235B","SWE-bench Verified":"~46.7%"},{"AIME 2025":"~92.0","Context Window":"1M+","LiveCodeBench":"~64.0%","MATH-500":"~97.1%","MMLU Pro":"~81.3%","Model":"Gemini 2.5 Pro","SWE-bench Verified":"~63.8%"}]
Notas: As pontuações do AIME 2025 são reportadas como a percentagem de respostas corretas (pass@1, salvo indicação em contrário). A pontuação do Claude 3.7 no SWE-bench utiliza o modo de raciocínio alargado. As pontuações dos concorrentes foram obtidas a partir dos respetivos relatórios técnicos oficiais e das entradas na tabela de classificação do Papers With Code à data de julho de 2025. As pontuações assinaladas com ~ são valores aproximados constantes nos relatórios oficiais e podem variar consoante a configuração da avaliação. Verifique as classificações atuais na tabela de classificação AIME 2025 do Papers With Code.
Kimi K3 vs. a concorrência
O Kimi K3 compete no patamar de vanguarda dos grandes modelos de linguagem, ao lado de GPT-4o, Claude 3.7 Sonnet, DeepSeek V3, Qwen3 e Gemini 2.5 Pro. A seguinte comparação aborda o perfil de desempenho de cada modelo e os casos de uso em que cada um detém uma vantagem.
Kimi K3 vs. GPT-4o. O Kimi K3 lidera em relação ao GPT-4o em todos os principais benchmarks de raciocínio e programação: 96,2 vs. ~62 no AIME 2025, 97,4% vs. ~76,6% no MATH-500, 80,5% vs. ~72,6% no MMLU Pro, 65,8% vs. ~39,3% no LiveCodeBench e 63,9% vs. ~38,7% no SWE-bench Verified. O GPT-4o mantém vantagens em capacidades multimodais (integrações confirmadas de visão, áudio e geração de imagem), um ecossistema mais amplo de ferramentas de Terceiros e um historial mais longo em implementações de produção. Para matemática, raciocínio científico e tarefas de programação onde a precisão em problemas complexos é a prioridade, o K3 apresenta um caso de benchmark mais forte. Equipas que necessitem de inputs multimodais, relações estabelecidas com fornecedores ou SLAs garantidos encontrarão no GPT-4o a escolha com menor atrito. O preço da API também favorece substancialmente o K3: 0,15 $ por milhão de tokens de entrada vs. os aproximadamente 5,00 $ do GPT-4o.
Kimi K3 vs. DeepSeek V3. Ambos são LLMs de ponta desenvolvidos na China, mas divergem na arquitetura e no modelo de acesso. O DeepSeek V3 é um modelo denso de 671 mil milhões de parâmetros, disponível como uma libertação de pesos abertos sob a licença de modelo da DeepSeek; os programadores podem descarregá-lo e alojá-lo localmente. O K3 utiliza MoE com 32 mil milhões de parâmetros ativos por passagem e é apenas por API. Em benchmarks, o K3 lidera no AIME 2025 (96,2 vs. ~90,6) e no SWE-bench Verified (63,9% vs. ~49,2%); o DeepSeek V3 é competitivo no LiveCodeBench (59,4% vs. 65,8% para o K3). Equipas que necessitem de implementação local, ajuste fino (fine-tuning) ou acesso aos pesos devem escolher o DeepSeek V3. Equipas que priorizem o desempenho em benchmarks de raciocínio através de API encontrarão o K3 mais forte em tarefas com muita matemática.
Kimi K3 vs. Claude 3.7 Sonnet. A diferença verificada no SWE-bench é o diferenciador mais relevante aqui: Claude 3.7 Sonnet obtém 70,3% (com pensamento estendido) contra 63,9% do K3, uma vantagem de 6,4 pontos percentuais em engenharia de software automatizada. Claude também suporta uma janela de contexto maior (200 mil vs. 128 mil tokens). K3 lidera Claude no AIME 2025 (96,2 vs. ~86,7) e no MATH-500 (97,4% vs. ~92,3%). Ambos os modelos oferecem modos de raciocínio com abordagens de pensamento estendido funcionalmente comparáveis. Para codificação agêntica e fluxos de trabalho de engenharia de software, Claude 3.7 Sonnet continua a ser a escolha mais forte. Para raciocínio matemático puro e tarefas de pesquisa quantitativa, K3 detém uma clara liderança em benchmarks.
Kimi K3 vs. Qwen3 (Alibaba). O Qwen3-235B, o modelo emblemático de 2025 da Alibaba Cloud, fica atrás do K3 no AIME 2025 (92,8 vs. 96,2) e no MMLU Pro (79,8% vs. 80,5%), enquanto lidera por uma margem estreita no LiveCodeBench (66,2% vs. 65,8%). O Qwen3 tem versões de pesos abertos (open-weight) disponíveis no repositório GitHub da QwenLM, contrastando com o acesso exclusivo via API do K3. Para tarefas em língua chinesa, o Qwen3 beneficia da infraestrutura empresarial da Alibaba Cloud e de dados de treino multilingue; comparações independentes de C-Eval ou CMMLU entre o K3 e o Qwen3 não foram publicadas à data da redação deste texto. As equipas dentro do ecossistema da Alibaba Cloud acharão o Qwen3 melhor integrado; as equipas que avaliam com base em referências (benchmarks) de raciocínio matemático acharão o K3 ligeiramente mais forte.
Kimi K3 vs. Gemini 2.5 Pro. A diferença na janela de contexto é o fator definidor. O Gemini 2.5 Pro suporta até 1M de tokens em comparação com os 128K tokens do K3, uma vantagem de 8x para tarefas que envolvem documentos muito longos. Em benchmarks, os dois modelos estão muito próximos: o Gemini 2.5 Pro lidera ligeiramente no MMLU Pro (81,3% vs. 80,5%) e MATH-500 (97,1% vs. 97,4% para K3), enquanto o K3 lidera no AIME 2025 (96,2 vs. ~92,0). Para síntese de pesquisa multidocumento, análise de livros inteiros ou indexação de bases de código extensas acima de 128K tokens, o Gemini 2.5 Pro é a escolha tecnicamente mais forte. Para tarefas que cabem em 128K tokens e priorizam o raciocínio matemático com um custo de API inferior, o K3 tem a vantagem.
O panorama de IA da China em 2025. Entre os modelos de fronteira chineses, o Kimi K3 (Moonshot AI), o DeepSeek V3 (DeepSeek) e o Qwen3 (Alibaba Cloud) representam as três principais opções, cada uma com um posicionamento distinto. A DeepSeek diferenciou-se através de lançamentos de pesos abertos (open-weight) que os programadores podem auto-alojar sem custos de inferência. O Qwen3 beneficia do ecossistema empresarial da Alibaba Cloud e da disponibilidade de pesos abertos. O K3 posiciona-se em torno da liderança em benchmarks de raciocínio. Os dados de benchmark não suportam a nomeação de nenhum modelo individual como sendo definitivamente o melhor em todas as tarefas; a escolha certa depende de se o caso de utilização prioriza o acesso a pesos abertos (DeepSeek, Qwen3), a profundidade do ecossistema empresarial (Qwen3) ou o desempenho puro em benchmarks de raciocínio (K3, particularmente para aplicações com forte componente matemática).
Como aceder ao Kimi K3
O Kimi K3 não é de código aberto. Está acessível através da API Kimi para programadores e através da aplicação de consumo Kimi em kimi.ai para utilizadores não programadores. Nenhum dos pesos do modelo está publicamente disponível no momento da escrita; para alternativas de código aberto com níveis de desempenho comparáveis, DeepSeek V3 e Qwen3 oferecem opções de implementação local.
A negociar o token MOONSHOT em Bybit: O crescimento da Moonshot AI atraiu a atenção dos traders de cripto — Bybit oferece futuros perpétuos MOONSHOTUSDT para quem está interessado em negociar o token MOONSHOT. Para informações de contexto sobre o próprio token, consulte O Que É MOONSHOT USDT? Guia Completo. ### Aplicação Kimi (acesso para consumidores)
A aplicação Kimi é o produto de assistente de IA da Moonshot AI direcionado ao consumidor, disponível em kimi.ai e como uma aplicação móvel no iOS e Android. Para começar a usar o K3 através da aplicação do consumidor:
- Aceda ao kimi.ai ou descarregue a aplicação móvel Kimi na App Store ou na Google Play.
- Crie uma conta gratuita utilizando um endereço de e-mail ou número de telefone, ou inicie sessão com uma conta existente.
- O Kimi K3 potencia a interface atual da aplicação Kimi por defeito; não é necessário qualquer passo de seleção de modelo, a menos que a Moonshot AI adicione um seletor de modelo numa atualização futura.
- Comece a conversar. A aplicação suporta carregamentos de documentos (PDFs e ficheiros de texto) e integração de pesquisa na web.
A aplicação Kimi está disponível globalmente, incluindo para utilizadores nos EUA e na Europa. O nível gratuito oferece acesso ao K3 com limites de utilização diária; a Moonshot AI disponibiliza uma subscrição paga (Kimi Pro) para limites de mensagens mais elevados e acesso prioritário durante períodos de pico de procura. Verifique os limites atuais dos planos em kimi.ai antes de subscrever, uma vez que estes mudam frequentemente.
API da Kimi (acesso para programadores)
- Crie uma conta de programador na Moonshot AI na Plataforma da Moonshot AI para programadores.
- Gere uma Chave da API a partir do painel da conta em "Chaves da API".
- A API Kimi utiliza um esquema compatível com OpenAI, pelo que pode substituir o URL base e a cadeia identificadora do modelo no código SDK OpenAI existente com alterações mínimas.
- Faça a sua primeira chamada de API utilizando o identificador do modelo Kimi K3
kimi-k3, conforme confirmado na Documentação da API da Moonshot AI.
from openai import OpenAI
Kimi K3: Modelo de Raciocínio da Moonshot AI
Kimi K3 review: Moonshot AI's flagship reasoning model with 96.2 AIME score, 128K context, and $0.15/M token pricing. Compare benchmarks vs GPT-4o, Cl...
client = OpenAI( api_key="A_SUA_CHAVE_DA_API_MOONSHOT", # Chave da API da plataforma.moonshot.cn base_url="https://api.moonshot.cn/v1", )
Kimi K3: Modelo de Raciocínio da Moonshot AI
Kimi K3 review: Moonshot AI's flagship reasoning model with 96.2 AIME score, 128K context, and $0.15/M token pricing. Compare benchmarks vs GPT-4o, Cl...
response = client.chat.completions.create( model="kimi-k3", # Identificador de modelo confirmado para o Kimi K3 messages=[ {"role": "system", "content": "É um assistente útil."}, {"role": "user", "content": "Resolve isto passo a passo: qual é a soma dos primeiros 100 números primos?"}, ], temperature=0.6, )
imprimir(resposta.escolhas[0].mensagem.conteúdo)
A partir de julho de 2025, os preços da API Kimi K3 são de 0,15 USD por milhão de tokens de entrada e 0,60 USD por milhão de tokens de saída, de acordo com a página oficial de preços da Moonshot AI. Para comparação, o GPT-4o tem um preço aproximado de 5,00 USD por milhão de tokens de entrada e 15,00 USD por milhão de tokens de saída; o Claude 3.7 Sonnet custa aproximadamente 3,00 USD por milhão de tokens de entrada e 15,00 USD por milhão de tokens de saída. O K3 custa substancialmente menos por token do que ambos os operadores ocidentais estabelecidos para tarefas de raciocínio de complexidade equivalente.
A Moonshot AI oferece um nível de API gratuito com uma alocação mensal limitada de tokens para novas contas de desenvolvedor; verifique os limites atuais do nível gratuito na página de preços da API da Moonshot AI antes de planear o uso em produção, pois estes valores alteram-se frequentemente.
Os preços da API estão sujeitos a alterações. Todos os valores refletem as taxas a partir de julho de 2025. Verifique os preços atuais na página de preços da API da Moonshot AI antes de tomar decisões comerciais.
| Modelo | Entrada $/1M de tokens | Saída $/1M de tokens | Janela de Contexto |
|---|---|---|---|
| Kimi K3 | $0,15 | $0,60 | 128K |
| GPT-4o | ~$5,00 | ~$15,00 | 128K |
| Claude 3.7 Sonnet | ~$3,00 | ~$15,00 | 200K |
| DeepSeek V3 (API) | ~$0,27 | ~$1,10 | 128K |
| Qwen3-235B (API) | ~$0,14 | ~$0,60 | 128K |
Para uma análise completa dos níveis da API, preços dos tokens e dicas de otimização de custos, consulte Moonshot Kimi API Pricing 2026: Planos e Guia de Custos.
A API Kimi está disponível para programadores a nível global. A Moonshot AI não publicou restrições geográficas no acesso à API até julho de 2025. Para implementação local sem dependência de API, o K3 não é uma opção; em alternativa, considere as versões de pesos abertos do DeepSeek V3 ou Qwen3.
--- ## Casos de uso para o Kimi K3
O Kimi K3 é mais adequado para tarefas que beneficiam de um raciocínio prolongado, do processamento de contextos extensos e de uma forte capacidade de programação.
- Matemática avançada e raciocínio científico: A pontuação de 96,2 no AIME 2025 e de 97,4% no MATH-500 do K3 tornam-no um forte candidato para a resolução de problemas ao nível de competição, cálculos de física e engenharia, análise estatística e assistência em investigação quantitativa, onde a precisão dos passos intermédios é fundamental.
- Geração e depuração de código: Com uma pontuação de 65,8% no LiveCodeBench, o K3 gera código sintaticamente correto e funcionalmente preciso em Python, JavaScript, SQL e outras linguagens principais, sendo capaz de depurar erros lógicos de vários passos numa única sessão de comandos.
- Assistência em engenharia de software: Uma pontuação de 63,9% no SWE-bench Verified significa que o K3 consegue resolver autonomamente cerca de 64 em cada 100 problemas reais do GitHub, tornando-o aplicável a fluxos de trabalho de revisão de código automatizada, sugestões de refatoração e triagem de problemas.
- Análise de documentos Long: A janela de contexto de 128K tokens suporta o processamento de contratos legais na íntegra, artigos académicos completos, relatórios financeiros e documentos técnicos com vários capítulos, sem perda por fragmentação ou sumarização.
- Síntese de investigação em vários passos: O K3 consegue cruzar referências de vários documentos dentro da sua janela de contexto, extrair alegações contraditórias e produzir resumos comparativos estruturados para revisões de literatura, investigação de diligência prévia (due diligence) e análise de políticas.
- Tarefas bilingues em chinês e inglês: O K3 suporta oficialmente chinês e inglês, e o produto de consumo da Moonshot AI foi concebido desde o lançamento para o mercado chinês. Comparações independentes de referencial (benchmarks) em língua chinesa (C-Eval, CMMLU) ainda não tinham sido publicadas à data da redação deste texto.
Quem deve usar o Kimi K3: O K3 é a opção de API mais robusta disponível para raciocínio intensivo em matemática, suporte a pesquisa quantitativa e aplicações de codificação sensíveis ao custo (a $0,15 por milhão de tokens de entrada). Equipas que utilizam atualmente o GPT-4o para tarefas de raciocínio descobrirão que o K3 oferece um desempenho de benchmark substancialmente melhor por uma fração do custo da API. Para fluxos de trabalho de codificação de agentes onde o desempenho do SWE-bench é a métrica principal, o Claude 3.7 Sonnet mantém uma vantagem. Para casos de uso que requerem mais de 128 mil tokens de contexto, o Gemini 2.5 Pro é a melhor opção. Para equipas que necessitam de implementação local de peso aberto (open-weight), o DeepSeek V3 ou o Qwen3 são as alternativas adequadas.
Limitações e considerações
O Kimi K3 tem várias limitações significativas que os utilizadores e compradores empresariais devem avaliar antes da adoção.
Desempenho inferior na SWE-bench. Na SWE-bench Verified, o K3 obtém 63,9%, ficando atrás do Claude 3.7 Sonnet (70,3%) em 6,4 pontos percentuais. Para equipas cujo caso de uso principal é a resolução automatizada de problemas no GitHub ou a engenharia de software agentiva, esta diferença é material e o Claude 3.7 Sonnet mantém-se a escolha mais forte com base nos dados comparativos publicados.
Sem acesso a modelos com pesos abertos. K3 é um modelo de API fechada. Os pesos do modelo não estão publicamente disponíveis, o que significa que o alojamento local, a afinação (fine-tuning) e o auto-alojamento quantizado (GGUF, GPTQ, AWQ através de llama.cpp, vLLM ou Ollama) não são possíveis. DeepSeek V3 e Qwen3 oferecem ambos lançamentos com pesos abertos que suportam o alojamento local sem custos por token. Para organizações com requisitos de soberania de dados que proíbem o envio de dados para APIs externas, ou para investigadores que necessitam de acesso à afinação, K3 não é uma opção viável.
A janela de contexto fica atrás dos concorrentes de contexto Long. A janela de contexto de 128K tokens do K3 iguala a do GPT-4o, mas é 36% menor que a de 200K do Claude 3.7 Sonnet e 87,5% menor que a janela de 1M de tokens do Gemini 2.5 Pro. Tarefas que exijam o processamento de documentos muito Long (análise de livros inteiros, indexação de grandes bases de código ou síntese de corpora de múltiplas fontes acima de 128K tokens) exigirão estratégias de fragmentação ou um modelo diferente.
Incerteza sobre a data de corte de conhecimento. A Moonshot AI não confirmou publicamente a data de corte de conhecimento dos dados de treino do K3 até julho de 2025. As consultas sobre eventos após a data de corte retornarão informações incompletas ou inexistentes, a menos que o modelo seja aumentado com pesquisa na web ou pipelines de geração aumentada por recuperação (RAG). A aplicação Kimi para consumidores inclui integração de pesquisa na web que mitiga esta situação para os utilizadores; os utilizadores da API devem implementar a sua própria camada de recuperação para consultas sensíveis ao tempo.
Compromisso latência-modelo de raciocínio. O raciocínio de cadeia de pensamento estendido produz respostas mais precisas em tarefas complexas, mas gera significativamente mais tokens por resposta do que um modelo padrão de seguimento de instruções. Para consultas simples (sumarização, conversão de formato, resposta básica a perguntas), um modelo mais leve como o GPT-4o mini ou uma variante destilada do DeepSeek será mais eficiente em termos de custo.
Governança de dados empresariais. O Kimi K3 é desenvolvido pela Moonshot AI, uma empresa sediada em Pequim sujeita aos regulamentos de dados chineses. As organizações com requisitos rigorosos de residência de dados, obrigações de conformidade ao abrigo de quadros regulamentares como o RGPD, ou restrições ao processamento de dados por entidades não nacionais devem analisar os acordos de processamento de dados e a infraestrutura regional de API da Moonshot AI antes de integrarem o K3 em sistemas de produção. Esta orientação aplica-se de forma factual e simétrica. A mesma diligência devida aplicar-se-ia a qualquer API de IA transfronteiriça, incluindo serviços sediados nos EUA utilizados por organizações em jurisdições com requisitos de processamento de dados nacionais.
Perguntas frequentes
O que é o Kimi K3 e quem o fabrica?
O Kimi K3 é um modelo de linguagem de grande escala de raciocínio de fronteira desenvolvido pela Moonshot AI (月之暗面), uma empresa de IA com sede em Pequim, e lançado em julho de 2025. Foi concebido como um modelo de referência focado primeiro no raciocínio que utiliza um processamento de cadeia de pensamento alargada para lidar com matemática complexa, programação e tarefas com uso intensivo de conhecimento. O K3 é o sucessor do Kimi K2, mudando de um posicionamento agêntico para um design de raciocínio de uso geral.
Quais são as principais caraterísticas do Kimi K3?
As principais funcionalidades do Kimi K3 incluem: (1) raciocínio de cadeia de pensamento (chain-of-thought) prolongado que impulsiona um desempenho de topo em AIME e MATH-500; (2) uma janela de contexto de 128K tokens para o processamento de documentos Long; (3) uma arquitetura de Mistura de Especialistas (MoE) com um total de 671 mil milhões de parâmetros e 32 mil milhões ativos; (4) preços de API competitivos a 0,15 $ por milhão de tokens de entrada; e (5) acesso tanto através da aplicação Kimi para o consumidor em kimi.ai como da API para programadores em plataforma.moonshot.cn.
Qual é o tamanho da janela de contexto do Kimi K3?
O Kimi K3 suporta uma janela de contexto de 128K tokens, o equivalente a aproximadamente 96 000 palavras de texto em inglês. Isto iguala a janela de contexto de 128K do GPT-4o, mas é inferior aos 200K tokens do Claude 3.7 Sonnet e aos 1M de tokens do Gemini 2.5 Pro. Para a maioria das tarefas de análise de documentos e de programação, 128K tokens são suficientes; bases de código muito extensas ou documentos com a extensão de um livro podem exigir fragmentação.
O Kimi K3 é de código aberto ou fechado?
Kimi K3 está indisponível: os pesos do modelo não estão publicamente acessíveis. O acesso é fornecido exclusivamente através da API Kimi para programadores e da aplicação de consumo Kimi em kimi.ai para utilizadores gerais. Para alternativas com pesos abertos (open-weight) em níveis de capacidade comparáveis, DeepSeek V3 (dense, 671B) e Qwen3 (lançamentos com pesos abertos disponíveis no GitHub QwenLM) suportam ambos implementação local e ajuste fino.
Como o Kimi K3 se compara ao GPT-4o em benchmarks?
O Kimi K3 supera o GPT-4o em todos os testes de referência de raciocínio e programação publicados: AIME 2025 (96,2 vs. ~62), MATH-500 (97,4% vs. ~76,6%), MMLU Pro (80,5% vs. ~72,6%), LiveCodeBench (65,8% vs. ~39,3%) e SWE-bench Verified (63,9% vs. ~38,7%). O GPT-4o lidera nas capacidades multimodais, integrações de ecossistemas de Terceiros e infraestrutura de suporte empresarial estabelecida. Para tarefas de raciocínio puro, o K3 apresenta um caso de referência sólido com preços de API substancialmente mais baixos.
Como é que o Kimi K3 se diferencia do Kimi K2?
O Kimi K3 muda do posicionamento focado em agentes do Kimi K2 (utilização de ferramentas, processamento de documentos de longo contexto) para um design de propósito geral focado em raciocínio. Ambos utilizam arquitetura MoE com 32 mil milhões de parâmetros ativos, mas o K3 reduz a contagem total de parâmetros de ~1 trilião para 671 mil milhões, enquanto alcança pontuações substancialmente mais fortes em benchmarks de raciocínio. O K2 não foi avaliado em benchmarks no AIME ou MATH-500; o K3 posiciona-se principalmente na capacidade de raciocínio.
Quem fundou a Moonshot AI?
A Moonshot AI foi fundada em 2023 por Yang Zhilin, um antigo investigador da Universidade de Tsinghua e da Universidade Carnegie Mellon e coautor do XLNet, um modelo de linguagem inicial baseado em Transformer que competia com o BERT. Yang Zhilin exerce o cargo de CEO da Moonshot AI.
Posso aceder ao Kimi K3 através de uma API?
Sim. A API Kimi está disponível na plataforma de desenvolvimento Moonshot AI. A API utiliza um esquema compatível com OpenAI, pelo que o código existente do SDK da OpenAI pode ser adaptado substituindo o URL base (https://api.moonshot.cn/v1) e o identificador do modelo. A partir de julho de 2025, os preços são de $0,15 por milhão de tokens de entrada e $0,60 por milhão de tokens de saída. Está disponível um nível de API gratuito para novas contas de programador com uma alocação mensal limitada de tokens.### A Kimi K3 está disponível nos EUA e na Europa?
Sim. O Kimi K3 está disponível globalmente através da aplicação de consumidor Kimi em kimi.ai e da API Kimi. A Moonshot AI não publicou restrições geográficas no acesso à API em julho de 2025. Os compradores empresariais devem rever os acordos de processamento de dados da Moonshot AI para considerações de residência de dados e de conformidade antes da implementação em produção.
Que idiomas o Kimi K3 suporta?
O Kimi K3 suporta oficialmente chinês e inglês. Suporte adicional para idiomas não foi confirmado na documentação oficial da Moonshot AI até ao momento. A aplicação de consumo Kimi foi concebida para o mercado chinês desde o lançamento, e espera-se que os dados de treino do K3 incluam conteúdo substancial em língua chinesa, embora as pontuações de referência independentes em língua chinesa (C-Eval, CMMLU) não tenham sido publicadas até ao momento.
Conclusão
Kimi K3 representa o modelo de ponta mais forte da Moonshot AI até o momento, combinando raciocínio matemático de primeira linha (96,2 no AIME 2025) com uma arquitetura MoE de baixo custo e preços de API substancialmente inferiores aos do GPT-4o e Claude 3.7 Sonnet. Para desenvolvedores e investigadores que avaliam modelos de ponta em 2025, o K3 merece séria consideração para tarefas com uso intensivo de raciocínio, particularmente onde o custo por resposta correta é uma métrica de avaliação primária.
Leitura Relacionada
- O que é o Kimi K2? O modelo de pensamento de peso aberto da Moonshot AI
- Moonshot AI: Visão Geral da Empresa e Guia do Produto Kimi
- Preços da API Moonshot Kimi 2026: Planos e Guia de Custos
- Moonshot AI vs DeepSeek vs Qwen: Modelos de IA da China Comparados
- O que é Kimi AI? Guia para Moonshot AI
- MOONSHOTUSDT Perpétuo Futuros em Bybit
Os programadores podem começar a experimentar através da API Kimi na plataforma de programadores da Moonshot AI, onde o esquema compatível com OpenAI reduz o esforço de integração. Os utilizadores finais podem aceder ao Kimi K3 diretamente através do assistente Kimi AI em kimi.ai. Para as atualizações mais recentes de benchmarks, lançamentos de modelos e documentação técnica, consulte o blogue oficial da Moonshot AI em moonshotai.com. Para o centro de recursos completo da Moonshot AI da Bybit, explore a comparação Moonshot AI vs DeepSeek vs Qwen e o guia O que é o Kimi AI?.
Este artigo será atualizado à medida que novos dados de benchmark, especificações oficiais e informações de preços forem divulgados pela Moonshot AI.