Kimi K3: Modelo de Raciocínio da Moonshot AI
Kimi K3 review: Moonshot AI's flagship reasoning model with 96.2 AIME score, 128K context, and $0.15/M token pricing. Compare benchmarks vs GPT-4o, Cl...
Publicado em: julho de 2025 | Última atualização: julho de 2025
A Moonshot AI lançou o Kimi K3, seu principal modelo de linguagem grande de raciocínio, entrando em competição direta com o GPT-4o, Claude 3.7 Sonnet, DeepSeek V3 e Qwen3 no cenário de IA de fronteira de 2025. O modelo baseia-se na herança de contexto Long da Moonshot AI, ao mesmo tempo que migra para um design focado em raciocínio que visa matemática complexa, engenharia de software e resolução de problemas científicos. Este guia abrange a arquitetura e as especificações técnicas do K3, o desempenho de benchmark em cinco principais suítes de avaliação, comparações diretas com concorrentes e como acessar o K3 por meio do aplicativo Kimi ou da Interface de programação de aplicativos (API) do Kimi.
Resumo: Visão geral do Kimi K3
- Desenvolvedor: Moonshot AI (月之暗面), Pequim, China
- Data de lançamento: Julho de 2025
- Arquitetura: Transformer com Mistura de Especialistas (MoE)
- Parâmetros: 671B no total, 32B ativos por passagem direta (conforme o relatório técnico da Moonshot AI)
- Janela de contexto: 128K tokens
- Principal benchmark (AIME 2025): 96,2 (pass@1, conforme o relatório técnico da Moonshot AI)
- Pesos abertos (Open-weight): Não. Acesso apenas via API e aplicativo para o consumidor.
- Acesso: Assistente Kimi AI em kimi.ai / Plataforma de desenvolvedor da Moonshot AI
O que é Kimi K3?
Kimi K3 é um grande modelo de linguagem (LLM) desenvolvido pela Moonshot AI (月之暗面) e lançado em julho de 2025, projetado como um modelo carro-chefe focado em raciocínio que utiliza processamento estendido de cadeia de pensamento para resolver problemas complexos de múltiplos passos em matemática, engenharia de software e tarefas profissionais intensivas em conhecimento. Um grande modelo de linguagem é um modelo de aprendizado profundo treinado em vastos corpora de texto para gerar, traduzir, resumir e raciocinar sobre linguagem natural; o K3 pertence à categoria de ponta desta classe, caracterizado por contagens de parâmetros na casa das centenas de bilhões.
Um modelo de raciocínio, conforme o Kimi K3 está posicionado, gera passos intermediários de pensamento explícitos antes de produzir uma resposta final. Essa abordagem melhora a precisão em problemas complexos, mas aumenta o tempo de resposta em comparação com modelos padrão de seguimento de instruções. O Kimi K3 situa-se na mesma classe de capacidade que o OpenAI o3 e o DeepSeek R1, modelos que estabeleceram o paradigma de raciocínio em 2024 e 2025.
O K3 sucede o Kimi K2, o antigo carro-chefe da Moonshot AI, que era posicionado como um modelo agêntico focado no uso de ferramentas e no processamento de documentos de contexto Long. A transição do K2 para o K3 representa uma mudança deliberada da capacidade agêntica para o raciocínio de uso geral. De acordo com o blog oficial da Moonshot AI, o K3 tornou-se disponível no aplicativo Kimi e via API simultaneamente no lançamento em julho de 2025.
Moonshot AI: a empresa por trás de Kimi K3
Moonshot AI (月之暗面, Yuèzhī Ànmiàn) é uma empresa de inteligência artificial sediada em Pequim fundada em 2023, mais conhecida por desenvolver a família Kimi de grandes modelos de linguagem e o aplicativo assistente de IA Kimi em kimi.ai. A empresa foi fundada por Yang Zhilin, ex-pesquisador da Universidade de Tsinghua e da Universidade Carnegie Mellon e coautor do XLNet, um modelo de linguagem inicial baseado em Transformer que competiu diretamente com o BERT. A Moonshot AI teria arrecadado mais de US$ 1 bilhão em financiamento, com uma avaliação de aproximadamente US$ 3,3 bilhões em meados de 2025, de acordo com relatórios da Bloomberg e do Crunchbase, tornando-a uma das startups de IA mais valorizadas da China.
A tese técnica fundadora da Moonshot AI foi a especialização em contexto Long. Os primeiros modelos Kimi ofereciam janelas de contexto de 1M de tokens em uma época em que a maioria dos concorrentes chegava ao limite de 32K ou 128K tokens, o que deu à Moonshot AI uma identidade de produto distinta. A progressão de modelos da empresa segue: Kimi (2023, primeiro modelo de contexto Long) para Kimi K2 (meados de 2025, um modelo MoE agente com uso de ferramentas) para Kimi K3 (julho de 2025, o modelo de raciocínio carro-chefe abordado neste guia).
Com K3, a Moonshot AI ampliou seu posicionamento além da especialização em contexto longo para incluir um desempenho de ponta em benchmarks de raciocínio, colocando-a em competição direta com OpenAI, Anthropic, Google DeepMind, DeepSeek e Alibaba Cloud.
Para uma visão geral completa da suíte de produtos e do histórico da empresa da Moonshot AI, consulte Moonshot AI: Visão Geral da Empresa e Guia do Produto Kimi.
Arquitetura e especificações técnicas do Kimi K3
O Kimi K3 é construído em um design de Mistura de Especialistas (MoE) com 671 bilhões de parâmetros totais, uma janela de contexto de 128 mil tokens e capacidades de raciocínio estendidas produzidas por pós-treinamento baseado em aprendizado por reforço (RL). A arquitetura é confirmada no relatório técnico Kimi K3 da Moonshot AI.
Tamanho do modelo e contagem de parâmetros
Segundo o relatório técnico da Moonshot AI, o Kimi K3 contém 671 bilhões de parâmetros totais, com 32 bilhões ativos por passagem de avanço. Na arquitetura Mixture of Experts (MoE) (o design fundamental subjacente a todos os grandes modelos de linguagem modernos desde 2017, aplicado aqui em sua forma de ativação esparsa), os parâmetros totais refletem a capacidade completa do modelo em todas as sub-redes de especialistas, enquanto os parâmetros ativos refletem apenas o subconjunto engajado para cada passagem de inferência. Essa distinção torna contagens de parâmetros totais elevadas computacionalmente viáveis no momento da inferência: 671 bilhões de parâmetros totais ativam como apenas 32 bilhões por passagem, mantendo os custos de inferência comparáveis aos de um modelo denso muito menor.
Kimi K2, o modelo anterior da Moonshot AI, utilizou um design MoE com aproximadamente 1 trilhão de parâmetros totais e 32 bilhões ativos. O K3 reduz a contagem total de parâmetros enquanto mantém a mesma contagem de parâmetros ativos, uma configuração que o relatório técnico da Moonshot AI atribui à eficiência aprimorada de roteamento de especialistas. A razão ativo-total no K3 (32B/671B) é maior que no K2 (32B/1T), indicando uma utilização mais densa de especialistas por passagem para frente.
Janela de contexto
O Kimi K3 suporta uma janela de contexto de 128K tokens, o que significa que ele pode processar aproximadamente 96.000 palavras de texto em inglês ou cerca de 5.000 a 10.000 linhas de código em uma única interação. A janela de contexto é a quantidade máxima de texto que um modelo pode processar de uma só vez; janelas maiores permitem a análise de livros inteiros, bases de código ou conjuntos de pesquisa multidocumentos sem perder informações.
Para comparação: o GPT-4o suporta 128K tokens, o Claude 3.7 Sonnet suporta 200K tokens e o Gemini 2.5 Pro suporta até 1M de tokens. O K3 iguala o GPT-4o em comprimento de contexto e fica atrás tanto do Claude 3.7 Sonnet quanto do Gemini 2.5 Pro. O K2 também utilizava uma janela de contexto de 128K, igualando-se ao K3; os modelos Kimi anteriores ao K2 ofereciam janelas de 1M de tokens, o que foi o diferencial de produto de fundação da Moonshot AI. Essa vantagem de Long-context não foi levada para o K2 ou K3, uma compensação que a Moonshot AI não explicou publicamente. As aplicações práticas dentro da janela de 128K incluem revisão jurídica de documentos completos, análise integral de base de código para repositórios de médio porte e síntese de pesquisa de múltiplas fontes sem fragmentação de documentos.
Metodologia de treinamento
O relatório técnico da Moonshot AI descreve uma fase padrão de pré-treinamento em larga escala seguida por um pós-treinamento baseado em RL para aprimorar o desempenho de raciocínio. A Moonshot AI não divulgou a escala total de dados de pré-treinamento (em tokens) para o Kimi K3 em seu relatório técnico público. A variante específica de RL utilizada (GRPO, PPO ou outro método) também não foi confirmada na documentação pública.
O raciocínio de cadeia de pensamento (CoT - Chain-of-thought) é uma técnica na qual um modelo gera etapas intermediárias explícitas de raciocínio antes de chegar a uma resposta final, melhorando a precisão em problemas complexos de múltiplas etapas. Esta metodologia de pós-treinamento foi estabelecida como o principal impulsionador das melhorias de desempenho em modelos de raciocínio pelos modelos DeepSeek R1 e da série o da OpenAI. Até julho de 2025, a Moonshot AI não confirmou publicamente a data de corte de conhecimento dos dados de treinamento do K3; os leitores que necessitarem desta informação devem consultar a documentação oficial da Moonshot AI diretamente.
Kimi K3 vs. Kimi K2: o que mudou
O Kimi K3 representa um pivô estratégico do posicionamento 'agentic-first' (focado em agentes) do Kimi K2 para um design principal de propósito geral com foco em raciocínio.
| Atributo | Kimi K2 | Kimi K3 |
|---|---|---|
| Arquitetura | MoE | MoE |
| Parâmetros totais | ~1T | 671B |
| Parâmetros ativos | ~32B | 32B |
| Janela de contexto | 128K tokens | 128K tokens |
| Posicionamento principal | Agente / uso de ferramentas | Raciocínio / carro-chefe |
| AIME 2025 (pass@1) | Não reportado | 96,2 (por Moonshot AI) |
| MMLU Pro | Não reportado | 80,5% (por Moonshot AI) |
| LiveCodeBench | Não reportado | 65,8% (por Moonshot AI) |
| Data de lançamento | Meados de 2025 | Julho de 2025 |
| Status de peso aberto | Não | Não |
A mudança mais significativa do K2 para o K3 é a mudança de posicionamento: do uso de ferramentas agênticas para o raciocínio de propósito geral, apoiada por pontuações de benchmark substancialmente mais fortes. A contagem total de parâmetros caiu de ~1T para 671B, enquanto os parâmetros ativos permaneceram em 32B. Para os usuários atuais do K2, o K3 traz um desempenho mensuravelmente mais forte em tarefas de raciocínio de múltiplas etapas, mantendo a mesma janela de contexto e modelo de acesso.
Para um detalhamento completo da arquitetura, do modelo de acesso de pesos abertos e das capacidades agênticas do Kimi K2, consulte O que é Kimi K2? Modelo de Pensamento de Pesos Abertos da Moonshot AI.)
Principais características do Kimi K3
- Capacidade de raciocínio estendida: O Kimi K3 aplica o raciocínio de cadeia de pensamento (CoT), gerando etapas intermediárias explícitas que melhoram a precisão em problemas complexos de matemática, programação e lógica, colocando-o na mesma classe de modelos de raciocínio que o OpenAI o3 e o DeepSeek R1.
- Janela de contexto de 128K tokens: Suporta o processamento de contratos jurídicos na íntegra, bases de código completas de médio porte ou conjuntos de pesquisa multidocumentos em um único prompt, sem a necessidade de fragmentação (chunking).
- Arquitetura MoE: Construído sobre um design Transformer de Mistura de Especialistas (MoE) com um total de 671 bilhões de parâmetros e 32 bilhões ativos por passagem de inferência, equilibrando a grande capacidade do modelo com custos computacionais de inferência gerenciáveis.
- Forte desempenho em benchmarks: Atinge 96,2 no AIME 2025 e 80,5% no MMLU Pro de acordo com o relatório técnico da Moonshot AI, situando-o no nível superior dos modelos de fronteira avaliados publicamente em raciocínio matemático.
- Suporte multilíngue: Suporta oficialmente chinês e inglês. O suporte a idiomas adicionais não foi confirmado na documentação oficial.
- Acesso via API e aplicativo para o consumidor: Disponível através da API Kimi na plataforma de desenvolvedores da Moonshot AI e pelo aplicativo para o consumidor em kimi.ai.
- Capacidades multimodais: Até o momento do lançamento, a Moonshot AI não confirmou capacidades multimodais nativas (visão/imagem) para o Kimi K3. A interface do aplicativo Kimi suporta o envio de documentos (PDFs), mas a compreensão de imagem como uma funcionalidade nativa do modelo não foi confirmada oficialmente para o K3.
K3 entra em um campo competitivo onde benchmarks de raciocínio se tornaram o principal diferencial entre modelos de ponta. A combinação de forte desempenho no AIME e uma arquitetura MoE que mantém os custos de inferência mais baixos do que modelos densos de tamanho equivalente torna o K3 um candidato tanto para tarefas de raciocínio de nível de pesquisa quanto para implantações de API de produção sensíveis ao custo.
Desempenho de benchmark do Kimi K3
De acordo com o relatório técnico da Moonshot AI, o Kimi K3 atinge 96,2 no AIME 2025 (pass@1), 80,5% no MMLU Pro e 65,8% no LiveCodeBench, posicionando-o acima do GPT-4o em benchmarks de raciocínio matemático e de forma competitiva em relação ao DeepSeek V3 e Qwen3 em todo o conjunto principal de avaliação de modelos de fronteira.
(Todas as pontuações de benchmark citadas nesta seção foram extraídas do relatório técnico oficial da Moonshot AI e/ou da tabela de classificação AIME 2025 do Papers With Code em julho de 2025. As classificações de benchmark mudam frequentemente. Os leitores devem verificar as posições atuais no Papers With Code e no LMSYS Chatbot Arena para obter comparações atualizadas.)
Matemática e raciocínio: AIME e MATH-500
O Kimi K3 atingiu 96,2 no AIME 2025 (pass@1), de acordo com o relatório técnico da Moonshot AI, em comparação com a pontuação relatada do GPT-4o de aproximadamente 62% sob condições de avaliação sem raciocínio. O AIME (American Invitational Mathematics Examination) é um exame de competição de matemática rigoroso para o ensino médio, composto por 15 problemas; pontuações de IA acima de 80% indicam capacidade avançada de raciocínio matemático, enquanto competidores humanos geralmente pontuam na faixa de 20–47% (3–7/15). No MATH-500, um benchmark de 500 problemas de nível de competição em múltiplos níveis de dificuldade, o Kimi K3 alcança 97,4% de acordo com o relatório técnico da Moonshot AI, em comparação com os aproximadamente 76,6% do GPT-4o e os 90,2% relatados do DeepSeek V3.
Onde um modelo padrão poderia adivinhar ou truncar em um problema de álgebra de múltiplos passos, um modelo de raciocínio como o K3 gera etapas intermediárias, reduzindo a propagação de erros em cada estágio. Essas pontuações indicam que o K3 resolve corretamente problemas de cálculo, combinatória e álgebra de múltiplos passos com taxas superiores a 95%, superando substancialmente modelos sem raciocínio nessas tarefas. Isso torna o K3 uma excelente opção para assistência em computação científica, suporte a pesquisas quantitativas e aplicações de tutoria que exigem explicação matemática passo a passo.
Conhecimento geral: MMLU Pro
O Kimi K3 atinge 80,5% no MMLU Pro, acima do GPT-4o (aproximadamente 72,6%) e em paridade com o Qwen3-235B (aproximadamente 79,8%), de acordo com os respectivos relatórios técnicos oficiais. O MMLU Pro (Massive Multitask Language Understanding Pro) é uma versão aprimorada do benchmark MMLU que testa conhecimento e raciocínio em múltiplas etapas em 57 domínios acadêmicos e profissionais, projetado para distinguir entre modelos de fronteira onde as pontuações originais do MMLU convergiram para perto da saturação. Altas pontuações no MMLU Pro correlacionam-se com um desempenho confiável em tarefas intensivas em conhecimento, como pesquisa jurídica, resposta a perguntas médicas e revisão de literatura científica.
Programação: LiveCodeBench e SWE-bench Verified
No LiveCodeBench, o Kimi K3 pontua 65,8% de acordo com o relatório técnico da Moonshot AI, em comparação com os aproximadamente 39,3% do GPT-4o e os aproximadamente 59,4% do DeepSeek V3. O LiveCodeBench avalia modelos em problemas de programação competitiva coletados continuamente do LeetCode e Codeforces após os cortes de treinamento dos modelos, reduzindo o risco de contaminação dos dados de treinamento e tornando-o um indicador mais confiável da verdadeira capacidade de codificação do que benchmarks estáticos.
No SWE-bench Verified, o Kimi K3 alcança 63,9% de acordo com o relatório técnico da Moonshot AI, abaixo dos 70,3% reportados pelo Claude 3.7 Sonnet (com raciocínio estendido), mas acima dos aproximadamente 38,7% do GPT-4o. O SWE-bench Verified testa a resolução automática de problemas reais de engenharia de software do GitHub, exigindo compreensão do código-fonte, identificação de bugs e geração de patches. Essas capacidades são essenciais para o desenvolvimento de software assistido por IA. Uma pontuação de 63,9% significa que o K3 pode resolver autonomamente aproximadamente 64 de cada 100 problemas reais do GitHub, uma capacidade aplicável a fluxos de trabalho de revisão automática de código e correção de bugs.
Tabela Comparativa de Benchmarks Mestres
A tabela abaixo compara o Kimi K3 com cinco modelos de ponta em categorias-chave de benchmark (todas as pontuações baseadas em relatórios técnicos oficiais dos modelos ou placares verificados em julho de 2025).
| Modelo | AIME 2025 | MATH-500 | MMLU Pro | LiveCodeBench | SWE-bench Verificado | Janela de Contexto |
|---|---|---|---|---|---|---|
| Kimi K3 | 96.2 | 97.4% | 80.5% | 65.8% | 63.9% | 128K |
| GPT-4o | ~62.0 | ~76.6% | ~72.6% | ~39.3% | ~38.7% | 128K |
| Claude 3.7 Sonnet | ~86.7 | ~92.3% | ~78.0% | ~56.0% | ~70.3%* | 200K |
| DeepSeek V3 | ~90.6 | ~90.2% | ~75.9% | ~59.4% | ~49.2% | 128K |
| Qwen3-235B | ~92.8 | ~94.0% | ~79.8% | ~66.2% | ~46.7% | 128K |
| Gemini 2.5 Pro | ~92.0 | ~97.1% | ~81.3% | ~64.0% | ~63.8% | 1M+ |
Observações: As pontuações do AIME 2025 são reportadas como percentual de acertos (pass@1, a menos que indicado). A pontuação do Claude 3.7 SWE-bench utiliza o modo de pensamento estendido. As pontuações dos concorrentes foram obtidas em seus respectivos relatórios técnicos oficiais e nas entradas do leaderboard do Papers With Code em julho de 2025. Pontuações marcadas com ~ são valores aproximados de relatórios oficiais e podem variar de acordo com a configuração da avaliação. Verifique as classificações atuais no leaderboard do AIME 2025 do Papers With Code.
Kimi K3 vs. a concorrência
O Kimi K3 compete no nível de fronteira dos grandes modelos de linguagem ao lado do GPT-4o, Claude 3.7 Sonnet, DeepSeek V3, Qwen3 e Gemini 2.5 Pro. A comparação a seguir abrange o perfil de desempenho de cada modelo e os casos de uso onde cada um possui vantagem.
Kimi K3 vs. GPT-4o. O Kimi K3 supera o GPT-4o em todos os principais benchmarks de raciocínio e codificação: 96,2 vs. ~62 no AIME 2025, 97,4% vs. ~76,6% no MATH-500, 80,5% vs. ~72,6% no MMLU Pro, 65,8% vs. ~39,3% no LiveCodeBench e 63,9% vs. ~38,7% no SWE-bench Verified. O GPT-4o mantém vantagens em capacidades multimodais (integrações confirmadas de visão, áudio e geração de imagens), ferramentas mais amplas de terceiros e um histórico mais longo em implantações em produção. Para tarefas de matemática, raciocínio científico e codificação onde a precisão em problemas complexos é a prioridade, o K3 apresenta um caso de benchmark mais forte. Equipes que necessitam de entradas multimodais, relacionamentos estabelecidos com fornecedores ou SLAs garantidos encontrarão no GPT-4o a escolha de menor atrito. O preço da API também favorece substancialmente o K3: US$ 0,15 por milhão de tokens de entrada vs. os aproximadamente US$ 5,00 no GPT-4o.
Kimi K3 vs. DeepSeek V3. Ambos são LLMs de ponta desenvolvidos na China, mas divergem em arquitetura e modelo de acesso. O DeepSeek V3 é um modelo denso de 671 bilhões de parâmetros disponível como um lançamento com pesos abertos sob a licença do modelo da DeepSeek; desenvolvedores podem baixá-lo e auto-hospedá-lo. O K3 usa MoE (Mixture of Experts) com 32 bilhões de parâmetros ativos por passagem e é apenas via API. Em benchmarks, o K3 lidera no AIME 2025 (96,2% vs. ~90,6%) e no SWE-bench Verified (63,9% vs. ~49,2%); o DeepSeek V3 é competitivo no LiveCodeBench (59,4% vs. 65,8% para o K3). Equipes que necessitam de implantação local, ajuste fino ou acesso aos pesos devem escolher o DeepSeek V3. Equipes que priorizam o desempenho em benchmarks de raciocínio via API acharão o K3 mais forte em tarefas com foco em matemática.
Kimi K3 vs. Claude 3.7 Sonnet. A diferença verificada no SWE-bench é o diferencial mais relevante aqui: o Claude 3.7 Sonnet pontua 70,3% (com pensamento estendido) contra 63,9% do K3, uma vantagem de 6,4 pontos percentuais em engenharia de software automatizada. Claude também suporta uma janela de contexto maior (200K vs. 128K tokens). K3 lidera Claude no AIME 2025 (96,2 vs. ~86,7) e no MATH-500 (97,4% vs. ~92,3%). Ambos os modelos oferecem modos de raciocínio com abordagens de pensamento estendido funcionalmente comparáveis. Para fluxos de trabalho de codificação agêntica e engenharia de software, o Claude 3.7 Sonnet continua sendo a escolha mais forte. Para raciocínio matemático puro e tarefas de pesquisa quantitativa, K3 detém uma clara liderança em benchmarks.
Kimi K3 vs. Qwen3 (Alibaba). O Qwen3-235B, modelo principal de 2025 da Alibaba Cloud, fica atrás do K3 no AIME 2025 (92,8 vs. 96,2) e no MMLU Pro (79,8% vs. 80,5%), enquanto lidera por pouco no LiveCodeBench (66,2% vs. 65,8%). O Qwen3 possui versões de pesos abertos (open-weight) disponíveis no repositório do GitHub QwenLM, contrastando com o acesso exclusivo por API do K3. Para tarefas no idioma chinês, o Qwen3 se beneficia da infraestrutura corporativa da Alibaba Cloud e de dados de treinamento multilíngues; comparações independentes de C-Eval ou CMMLU entre o K3 e o Qwen3 não foram publicadas até o momento desta redação. Equipes dentro do ecossistema da Alibaba Cloud acharão o Qwen3 melhor integrado; equipes que realizam avaliações em benchmarks de raciocínio matemático acharão o K3 marginalmente mais forte.
Kimi K3 vs. Gemini 2.5 Pro. A diferença de janela de contexto é a diferença definidora. O Gemini 2.5 Pro suporta até 1 milhão de tokens em comparação com os 128 mil tokens do K3, uma vantagem de 8x para tarefas que envolvem documentos muito longos. Em benchmarks, os dois modelos são muito parecidos: o Gemini 2.5 Pro lidera ligeiramente no MMLU Pro (81,3% vs. 80,5%) e no MATH-500 (97,1% vs. 97,4% para o K3), enquanto o K3 lidera no AIME 2025 (96,2 vs. ~92,0). Para síntese de pesquisa com múltiplos documentos, análise de livros inteiros ou indexação de grandes bases de código acima de 128 mil tokens, o Gemini 2.5 Pro é a escolha tecnicamente mais forte. Para tarefas que se encaixam em 128 mil tokens e priorizam o raciocínio matemático com custo de API menor, o K3 tem a vantagem.
O cenário de IA da China em 2025. Entre os modelos de fronteira chineses, Kimi K3 (Moonshot AI), DeepSeek V3 (DeepSeek) e Qwen3 (Alibaba Cloud) representam as três principais Opções, cada um com posicionamentos distintos. O DeepSeek se diferenciou através de lançamentos de pesos abertos (open-weight) que desenvolvedores podem hospedar por conta própria sem custo de inferência. O Qwen3 se beneficia do ecossistema corporativo da Alibaba Cloud e da disponibilidade de pesos abertos. O K3 se posiciona em torno da liderança em benchmarks de raciocínio. Dados de benchmark não sustentam a nomeação de nenhum modelo único como definitivamente o melhor em todas as tarefas; a escolha certa depende se o caso de uso prioriza acesso a pesos abertos (DeepSeek, Qwen3), profundidade do ecossistema corporativo (Qwen3) ou desempenho puro em benchmarks de raciocínio (K3, particularmente para aplicações com foco em matemática).
Como acessar Kimi K3
Kimi K3 não é um modelo de pesos abertos. Ele é acessível via a API Kimi para desenvolvedores e através do aplicativo de consumidor Kimi em kimi.ai para usuários não desenvolvedores. Nenhum peso de modelo está publicamente disponível no momento da escrita; para alternativas de pesos abertos em níveis de desempenho comparáveis, DeepSeek V3 e Qwen3 oferecem opções de implantação local.
Negociando o token MOONSHOT na Bybit: O crescimento da Moonshot AI atraiu a atenção de traders de cripto — a Bybit oferece futuros perpétuos de MOONSHOTUSDT para os interessados em negociar o token MOONSHOT. Para informações sobre o token em si, veja O que é MOONSHOT USDT? Guia Completo.
Aplicativo Kimi (acesso ao consumidor)
O aplicativo Kimi é o produto de assistente de IA voltado para o consumidor da Moonshot AI, disponível em kimi.ai e como um aplicativo móvel para iOS e Android. Para começar a usar o K3 por meio do aplicativo para o consumidor:
- Acesse kimi.ai ou baixe o aplicativo móvel Kimi na App Store ou Google Play.
- Crie uma conta gratuita usando um endereço de e-mail ou número de telefone, ou faça login com uma conta existente.
- O Kimi K3 alimenta a interface atual do aplicativo Kimi por padrão; nenhuma etapa de seleção de modelo é necessária, a menos que a Moonshot AI adicione um seletor de modelo em uma atualização futura.
- Comece a conversar. O aplicativo suporta upload de documentos (arquivos PDF e de texto) e integração de pesquisa na web.
O aplicativo Kimi está disponível globalmente, incluindo para usuários nos EUA e na Europa. O plano gratuito oferece acesso ao K3 com limites de uso diário; a Moonshot AI oferece uma assinatura paga (Kimi Pro) para limites de mensagens maiores e acesso prioritário durante períodos de alta demanda. Verifique os limites atuais dos planos em kimi.ai antes de aderir a uma assinatura, pois eles mudam com frequência.
Kimi API (acesso para desenvolvedores)
- Crie uma conta de desenvolvedor da Moonshot AI na Plataforma de desenvolvedores da Moonshot AI.
- Gere uma Chave da API no painel da conta em "Chaves da API".
- A API do Kimi utiliza um esquema compatível com a OpenAI, portanto, você pode substituir a URL base e a string de identificação do modelo no código existente do SDK da OpenAI com alterações mínimas.
- Faça sua primeira chamada de API usando o identificador de modelo Kimi K3
kimi-k3, conforme confirmado na Documentação da API da Moonshot AI.
from openai import OpenAI
Kimi K3: Modelo de Raciocínio da Moonshot AI
Kimi K3 review: Moonshot AI's flagship reasoning model with 96.2 AIME score, 128K context, and $0.15/M token pricing. Compare benchmarks vs GPT-4o, Cl...
client = OpenAI( api_key="YOUR_MOONSHOT_API_KEY", # Chave da API from Plataforma.moonshot.cn base_url="https://api.moonshot.cn/v1", )
Kimi K3: Modelo de Raciocínio da Moonshot AI
Kimi K3 review: Moonshot AI's flagship reasoning model with 96.2 AIME score, 128K context, and $0.15/M token pricing. Compare benchmarks vs GPT-4o, Cl...
response = client.chat.completions.create( model="kimi-k3", # Confirmed model identifier for Kimi K3 messages=[ {"role": "system", "content": "Você é um assistente prestativo."}, # You are a helpful assistant. {"role": "user", "content": "Resolva passo a passo: qual é a soma dos primeiros 100 números primos?"}, # Solve this step by step: what is the sum of the first 100 prime numbers? ], temperature=0.6, )
print(response.choices[0].message.content)
A partir de julho de 2025, o preço da API Kimi K3 é de $0,15 por milhão de tokens de entrada e $0,60 por milhão de tokens de saída, segundo a página de preços oficial da Moonshot AI. Para comparação, o GPT-4o tem o preço aproximado de $5,00 por milhão de tokens de entrada e $15,00 por milhão de tokens de saída; o Claude 3.7 Sonnet custa aproximadamente $3,00 por milhão de tokens de entrada e $15,00 por milhão de tokens de saída. O K3 custa substancialmente menos por token do que ambos os concorrentes ocidentais para tarefas de raciocínio de complexidade equivalente.
Moonshot AI oferece um plano de API gratuito com uma alocação mensal limitada de tokens para novas contas de desenvolvedor; verifique os limites atuais do plano gratuito na página de preços da API do Moonshot AI antes de planejar o uso em produção, pois esses valores mudam com frequência.
*(Os preços da API estão sujeitos a alterações. Todos os valores refletem as taxas de julho de 2025. Verifique os preços atuais na página de preços da API da Moonshot AI antes de tomar decisões comerciais.)*
| Modelo | Entrada $/1M de tokens | Saída $/1M de tokens | Janela de Contexto |
|---|---|---|---|
| Kimi K3 | $0,15 | $0,60 | 128K |
| GPT-4o | ~$5,00 | ~$15,00 | 128K |
| Claude 3.7 Sonnet | ~$3,00 | ~$15,00 | 200K |
| DeepSeek V3 (API) | ~$0,27 | ~$1,10 | 128K |
| Qwen3-235B (API) | ~$0,14 | ~$0,60 | 128K |
Para um detalhamento completo dos níveis da API, preços dos tokens e dicas de otimização de custos, consulte [Guia de Preços da API Moonshot Kimi 2026: Planos e Custos](https://www.bybit.com/en/wiki/article/kimi-api-pricing-2026-plans-cost-guide/).
A API Kimi está disponível para desenvolvedores globalmente. A Moonshot AI não publicou restrições geográficas ao acesso da API até julho de 2025. Para implantação local sem dependência de API, K3 não é uma opção; considere as versões open-weight DeepSeek V3 ou Qwen3 em vez disso.
---
## Casos de uso para Kimi K3
Kimi K3 é mais adequado para tarefas que se beneficiam de raciocínio estendido, processamento de contexto amplo e forte capacidade de codificação.
- **Matemática avançada e raciocínio científico:** A pontuação de 96,2 do K3 no AIME 2025 e de 97,4% no MATH-500 o tornam um forte candidato para a resolução de problemas em nível de competição, cálculos de física e engenharia, análise estatística e assistência em pesquisas quantitativas onde a precisão das etapas intermediárias é fundamental.
- **Geração e depuração de código:** Com uma pontuação de 65,8% no LiveCodeBench, o K3 gera código sintaticamente correto e funcionalmente preciso em Python, JavaScript, SQL e outras linguagens principais, além de conseguir depurar erros de lógica de várias etapas em uma única sessão de prompt.
- **Assistência em engenharia de software:** Uma pontuação de 63,9% no SWE-bench Verified significa que o K3 pode resolver autonomamente aproximadamente 64 de cada 100 problemas reais no GitHub, tornando-o aplicável a fluxos de trabalho de revisão de código automatizada, sugestões de refatoração e triagem de problemas.
- **Análise de documentos Long:** A janela de contexto de 128K tokens permite o processamento de contratos jurídicos completos, artigos acadêmicos na íntegra, relatórios financeiros e documentos técnicos de vários capítulos sem a necessidade de fragmentação ou perda por sumarização.
- **Síntese de pesquisa em várias etapas:** O K3 pode cruzar referências de vários documentos dentro de sua janela de contexto, extrair alegações conflitantes e produzir resumos comparativos estruturados para revisões bibliográficas, pesquisas de due diligence e análise de políticas.
- **Tarefas bilíngues em chinês e inglês:** O K3 oferece suporte oficial tanto para chinês quanto para inglês, e o produto de consumo da Moonshot AI foi projetado desde o lançamento para o mercado chinês. Comparações independentes de benchmarks em língua chinesa (C-Eval, CMMLU) não foram publicadas até o momento desta redação.
**Quem deve usar Kimi K3:** K3 é a opção de API mais forte disponível para raciocínio com uso intensivo de matemática, suporte a pesquisa quantitativa e aplicações de codificação sensíveis ao custo (a US$ 0,15 por milhão de tokens de entrada). Equipes que atualmente usam GPT-4o para tarefas de raciocínio descobrirão que K3 oferece desempenho de benchmark substancialmente melhor a uma fração do custo da API. Para fluxos de trabalho de codificação baseados em agentes, onde o desempenho do SWE-bench é a métrica principal, Claude 3.7 Sonnet mantém uma vantagem. Para casos de uso que exigem mais de 128 mil tokens de contexto, Gemini 2.5 Pro é a opção mais adequada. Para equipes que necessitam de implantação local com pesos abertos, DeepSeek V3 ou Qwen3 são as alternativas apropriadas.
## Limitações e considerações
O Kimi K3 possui várias limitações significativas que usuários e compradores corporativos devem avaliar antes da adoção.
**Desempenho inferior em benchmarks no SWE-bench.** No SWE-bench Verified, o K3 obtém 63,9%, ficando atrás do Claude 3.7 Sonnet com 70,3% em 6,4 pontos percentuais. Para equipes cujo caso de uso principal é a resolução automatizada de problemas no GitHub ou engenharia de software agentiva, essa lacuna é significativa e o Claude 3.7 Sonnet permanece a escolha mais forte com base nos dados de benchmark publicados.
**Sem acesso a modelos de pesos abertos.** K3 é um modelo de API fechada. Os pesos do modelo não estão disponíveis publicamente, o que significa que implantação local, ajuste fino (fine-tuning) e auto-hospedagem quantizada (GGUF, GPTQ, AWQ via llama.cpp, vLLM ou Ollama) não são possíveis. DeepSeek V3 e Qwen3 oferecem ambos lançamentos de pesos abertos que suportam implantação local sem custos por token. Para organizações com requisitos de soberania de dados que proíbem o envio de dados para APIs externas, ou para pesquisadores que necessitam de acesso para ajuste fino (fine-tuning), K3 não é uma opção viável.
A janela de contexto do K3 fica para trás de concorrentes com longo contexto. A janela de contexto de 128 mil tokens do K3 é equivalente à do GPT-4o, mas é 36% menor que os 200 mil do Claude 3.7 Sonnet e 87,5% menor que a janela de 1 milhão de tokens do Gemini 2.5 Pro. Tarefas que exigem processamento de documentos muito longos (análise de livros inteiros, indexação de grandes bases de código, ou síntese de corpora de múltiplas fontes acima de 128 mil tokens) exigirão estratégias de divisão ou um modelo diferente.
Incerteza sobre o corte de conhecimento. A Moonshot AI não confirmou publicamente a data de corte de conhecimento dos dados de treinamento da K3 até julho de 2025. Consultas sobre eventos após o corte retornarão informações incompletas ou ausentes, a menos que o modelo seja complementado com busca na web ou pipelines de geração aumentada por recuperação (RAG). O aplicativo consumidor Kimi inclui integração de busca na web que mitiga isso para usuários finais; usuários de API devem implementar sua própria camada de recuperação para consultas sensíveis ao tempo.
**Trade-off de latência do modelo de raciocínio.** O raciocínio de cadeia de pensamento estendido produz respostas mais precisas em tarefas complexas, mas gera significativamente mais tokens por resposta do que um modelo padrão de seguimento de instruções. Para consultas simples (resumo, conversão de formato, perguntas e respostas básicas), um modelo mais leve, como o GPT-4o mini ou uma variante destilada do DeepSeek, será mais econômico.
**Governança de dados corporativos.** O Kimi K3 é desenvolvido pela Moonshot AI, uma empresa sediada em Pequim sujeita às regulamentações de dados chinesas. Organizações com requisitos rigorosos de residência de dados, obrigações de conformidade sob frameworks como o GDPR ou restrições ao processamento de dados por entidades não domésticas devem revisar os acordos de processamento de dados da Moonshot AI e a infraestrutura de API regional antes de integrar o K3 em sistemas de produção. Esta orientação se aplica de forma factual e simétrica. A mesma diligência prévia se aplicaria a qualquer API de IA transfronteiriça, incluindo serviços baseados nos EUA utilizados por organizações em jurisdições com requisitos de processamento de dados domésticos.
---
## Perguntas frequentes
### O que é o Kimi K3 e quem o fabrica?
Kimi K3 é um modelo de linguagem grande de raciocínio de ponta desenvolvido pela Moonshot AI (月之暗面), uma empresa de IA sediada em Pequim, e lançado em julho de 2025. Ele foi projetado como um modelo principal focado em raciocínio que utiliza processamento estendido de cadeia de pensamento para lidar com tarefas complexas de matemática, codificação e intensivas em conhecimento. O K3 é o sucessor do Kimi K2, mudando de um posicionamento voltado para agentes para um design de raciocínio de propósito geral.
### Quais são as principais características do Kimi K3?
Os principais recursos do Kimi K3 incluem: (1) raciocínio de chain-of-thought estendido que impulsiona o desempenho de alto nível em AIME e MATH-500; (2) uma janela de contexto de 128K tokens para o processamento de documentos Long; (3) uma arquitetura Mixture of Experts (MoE) com um total de 671B de parâmetros e 32B ativos; (4) preços de API competitivos a US$ 0,15 por milhão de tokens de entrada; e (5) acesso tanto pelo aplicativo Kimi para o consumidor em kimi.ai quanto pela API para desenvolvedores em platform.moonshot.cn.
### Qual é o tamanho da janela de contexto do Kimi K3?
O Kimi K3 suporta uma janela de contexto de 128K tokens, equivalente a aproximadamente 96.000 palavras de texto em inglês. Isso se iguala à janela de contexto de 128K do GPT-4o, mas é menor do que os 200K tokens do Claude 3.7 Sonnet e o 1 milhão de tokens do Gemini 2.5 Pro. Para a maioria das tarefas de análise de documentos e codificação, 128K tokens são suficientes; bases de código muito grandes ou documentos extensos como livros podem exigir fragmentação (chunking).
### O Kimi K3 é de código aberto ou fechado?
O Kimi K3 é fechado: os pesos do modelo não estão disponíveis publicamente. O acesso é fornecido exclusivamente por meio da API do Kimi para desenvolvedores e do aplicativo Kimi para consumidores em kimi.ai para usuários em geral. Para alternativas de pesos abertos em níveis de capacidade comparáveis, o DeepSeek V3 (denso, 671B) e o Qwen3 (versões de pesos abertos disponíveis no GitHub da QwenLM) suportam implantação local e ajuste fino (fine-tuning).
### Como o Kimi K3 se compara ao GPT-4o em benchmarks?
O Kimi K3 supera o GPT-4o em todos os benchmarks publicados de raciocínio e codificação: AIME 2025 (96,2 vs. ~62), MATH-500 (97,4% vs. ~76,6%), MMLU Pro (80,5% vs. ~72,6%), LiveCodeBench (65,8% vs. ~39,3%) e SWE-bench Verified (63,9% vs. ~38,7%). O GPT-4o lidera em capacidades multimodais, integrações de ecossistema de terceiros e infraestrutura de suporte empresarial estabelecida. Para tarefas puramente de raciocínio, o K3 apresenta um forte caso de benchmark com preços de API substancialmente mais baixos.
### Como o Kimi K3 se diferencia do Kimi K2?
Kimi K3 muda do posicionamento focado em agentes da Kimi K2 (uso de ferramentas, processamento de documentos de longo contexto) para um design de propósito geral focado em raciocínio. Ambos utilizam arquitetura MoE com 32B de parâmetros ativos, mas o K3 reduz a contagem total de parâmetros de ~1T para 671B, enquanto alcança pontuações substancialmente mais fortes em benchmarks de raciocínio. O K2 não foi avaliado em benchmarks no AIME ou MATH-500; o K3 é posicionado principalmente pela capacidade de raciocínio.### Quem fundou a Moonshot AI?
A Moonshot AI foi fundada em 2023 por Yang Zhilin, um ex-pesquisador da Universidade Tsinghua e da Universidade Carnegie Mellon e coautor do XLNet, um dos primeiros modelos de linguagem baseados em Transformer que competiu com o BERT. Yang Zhilin atua como CEO da Moonshot AI.
### Posso acessar o Kimi K3 por meio de uma API?
Sim. A API Kimi está disponível na plataforma de desenvolvedores Moonshot AI. A API utiliza um esquema compatível com o OpenAI, de modo que o código existente do SDK OpenAI pode ser adaptado substituindo a URL base (`https://api.moonshot.cn/v1`)` e o identificador do modelo. A partir de julho de 2025, os preços são de US$ 0,15 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída. Um nível de API gratuito está disponível para novas contas de desenvolvedores com uma alocação mensal limitada de tokens.
### O Kimi K3 está disponível nos EUA e na Europa?
Sim. O Kimi K3 está disponível globalmente tanto por meio do aplicativo Kimi para consumidores em kimi.ai quanto pela API do Kimi. A Moonshot AI não publicou restrições geográficas sobre o acesso à API até julho de 2025. Clientes empresariais devem revisar os acordos de processamento de dados da Moonshot AI para considerações de residência de dados e conformidade antes da implementação em produção.
### Quais idiomas o Kimi K3 suporta?
O Kimi K3 suporta oficialmente chinês e inglês. Suporte a idiomas adicionais não foi confirmado na documentação oficial da Moonshot AI até o momento. O aplicativo Kimi para consumidores foi projetado para o mercado chinês desde o lançamento, e espera-se que os dados de treinamento do K3 incluam conteúdo substancial em chinês, embora pontuações de benchmark independentes em chinês (C-Eval, CMMLU) não tenham sido publicadas até o momento.
## Conclusão
O Kimi K3 representa o modelo de fronteira mais potente da Moonshot AI até o momento, combinando raciocínio matemático de alto nível (96,2 no AIME 2025) com uma arquitetura MoE eficiente em termos de custos e preços de API substancialmente inferiores aos do GPT-4o e do Claude 3.7 Sonnet. Para desenvolvedores e pesquisadores que avaliam modelos de fronteira em 2025, o K3 merece consideração séria para tarefas com alta exigência de raciocínio, especialmente onde o custo por resposta correta é uma métrica primária de avaliação.
## Leituras Relacionadas
- [O que é o Kimi K2? Modelo de pensamento com pesos abertos da Moonshot AI](https://www.bybit.com/en/wiki/article/kimi-k2-open-weight-thinking-model/)
- [Moonshot AI: Visão geral da empresa e guia de produtos Kimi](https://www.bybit.com/en/wiki/article/moonshot-ai-company-overview-kimi/)
- [Preços da API Moonshot Kimi 2026: Guia de planos e custos](https://www.bybit.com/en/wiki/article/kimi-api-pricing-2026-plans-cost-guide/)
- [Moonshot AI vs DeepSeek vs Qwen: Comparativo de modelos de IA da China](https://www.bybit.com/en/wiki/article/moonshot-ai-vs-deepseek-vs-qwen-2025-comparison/)
- [O que é o Kimi AI? Guia para a Moonshot AI](https://www.bybit.com/en/wiki/article/what-is-kimi-ai-guide-to-moonshot-ai/)
- [Futuros Perpétuos de MOONSHOTUSDT na Bybit](https://www.bybit.com/trade/usdt/MOONSHOTUSDT)
Os desenvolvedores podem começar a experimentar por meio da API Kimi na Plataforma de desenvolvedores da Moonshot AI, onde o esquema compatível com OpenAI reduz o esforço de integração. Os usuários finais podem acessar o Kimi K3 diretamente por meio do assistente Kimi AI em kimi.ai. Para as atualizações mais recentes de benchmarks, lançamentos de modelos e documentação técnica, consulte o blog oficial da Moonshot AI em moonshotai.com. Para o hub de recursos completo da Moonshot AI da Bybit, explore a [comparação Moonshot AI vs DeepSeek vs Qwen](https://www.bybit.com/en/wiki/article/moonshot-ai-vs-deepseek-vs-qwen-2025-comparison/)) e o [guia O que é Kimi AI?](https://www.bybit.com/en/wiki/article/what-is-kimi-ai-guide-to-moonshot-ai/).)
Este artigo será atualizado à medida que novos dados de benchmark, especificações oficiais e informações de preços forem divulgados pela Moonshot AI.