- Kimi K3 é um modelo agente multimodal nativo de pesos abertos com 2,8 trilhões de parâmetros e contexto de 1.048.576 tokens, com suporte a sessões longas de programação, trabalho de conhecimento e raciocínio
- Combina Kimi Delta Attention (KDA), Attention Residuals e Stable LatentMoE, ativando 16 especialistas por token entre 896 no total, com eficiência geral de escalonamento cerca de 2,5 vezes maior que a do Kimi K2
- Em avaliações públicas, registrou 93,5 no GPQA Diamond, 88,3 no Terminal-Bench 2.1, 91,2 no BrowseComp e 91,1 no OmniDocBench, mas é preciso considerar também diferenças de harness, configuração de inferência e hardware entre modelos
- Foi treinado com reconhecimento de quantização usando pesos MXFP4 e ativações MXFP8 e pode ser executado com Transformers, vLLM, SGLang, Docker e APIs compatíveis com OpenAI e Anthropic
- Em conversas de múltiplos turnos e chamadas de ferramentas, é necessário reenviar integralmente a mensagem do assistant retornada pela API, incluindo
reasoning_contentetool_calls; o código e os pesos foram publicados sob a Kimi K3 License
Arquitetura e escala do modelo
- Kimi K3 é um modelo agente multimodal nativo de pesos abertos projetado para programação de longa duração, trabalho de conhecimento e raciocínio
- Tem 2.8T parâmetros no total, 104B parâmetros ativos e é composto por 93 camadas
- Usa 1 camada Dense, 69 camadas KDA e 24 camadas Gated MLA
- A dimensão oculta de attention é 7.168, com 96 cabeças de attention
- O Stable LatentMoE seleciona 16 especialistas por token entre 896 e usa 2 especialistas compartilhados
- A dimensão do Latent MoE é 3.584, e a dimensão oculta de MoE por especialista é 3.072
- Em comparação com o Kimi K2, a eficiência geral de escalonamento melhora em cerca de 2,5 vezes
- O vocabulário tem 160K, o comprimento de contexto é de 1.048.576 tokens e a função de ativação é SiTU-GLU
- Usa o MoonViT-V2 de 401M parâmetros como encoder de visão
- Os principais recursos incluem compreensão de texto, imagem e vídeo, mas na tabela-resumo do modelo o campo modality lista apenas Text e Image
Programação de longa duração e trabalho de conhecimento
- Mantém longas sessões de engenharia com supervisão humana mínima, explorando grandes repositórios e coordenando ferramentas de terminal
- Dá suporte à otimização de kernels de GPU e ao desenvolvimento de compiladores
- Também inclui desenvolvimento de jogos com uso de visão, CAD e projeto de chips
- Em trabalho de conhecimento orientado por agentes, gera visualizações interativas, widgets e dashboards junto com pesquisa aprofundada
- Motion design e edição de vídeo também entram no escopo de suporte
- O framework de agente de programação recomendado é o Kimi Code CLI, no qual é possível selecionar o Kimi K3 com o comando
/modelno terminal
Resultados de avaliação
- Todos os resultados do Kimi K3 foram medidos com
reasoning_effort="max"e temperature 1.0- Em tarefas de etapa única, como GPQA Diamond, HLE-Full e avaliações visuais sem ferramentas, foi usado top-p 0.95
- Em tarefas agentivas, foi aplicado top-p 1.0
- Em avaliações de raciocínio e conhecimento, registrou 93,5 no GPQA Diamond, 23,4 no CritPt e 74,7 no AA-LCR
- No HLE-Full, obteve 43,5 sem ferramentas e 56,0 com uso de ferramentas
- Em avaliações de programação, registrou 77,8 no ProgramBench, 88,3 no Terminal-Bench 2.1 e 81,2 no FrontierSWE
- No DeepSWE, obteve 67,5 no harness do Kimi Code e 67,3 no harness do mini-SWE-agent
- Registrou 42,0 no SWE-Marathon, 36,6 no PostTrainBench, 48,3 no MLS-Bench-Lite, 58,7 no SciCode e 72,9 no Kimi Code Bench 2.0
- Em avaliações de agentes, registrou 91,2 no BrowseComp, F1 95,0 no DeepSearchQA e 76,2 no ResearchRubrics
- Obteve 94,5 no MCPMark-Verified, 30,8 no AutomationBench, 34,8 no SpreadsheetBench 2 e 84,8 no OSWorld-Verified
- Foi medido com 94,6 no Harvey Lab-AA, 71,6 no CorpFin v2, 54,4 no Finance Agent v2 e 44,2 no Legal Research Bench
- Em avaliações visuais, registrou 91,1 no OmniDocBench, 90,0 no Video-MME e 82,1 no MMVU
- No MMMU-Pro, obteve 81,6 sem ferramentas e 83,4 com uso de ferramentas
- No MathVision, subiu de 94,3 para 97,8 ao usar Python
- O ZeroBench pass@5 subiu de 23,0 para 41,0 com uso de ferramentas
Condições de avaliação e limitações de comparação
- Os modelos comparados incluem Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5 e GLM-5.2, mas o harness de avaliação pode variar entre os modelos
- O Kimi K3 usa principalmente Kimi Code ou Claude Code
- A família GPT usa principalmente Codex, enquanto outros modelos Claude e GLM usam Claude Code, Terminus 2 e afins
- O SWE-Marathon foi avaliado em um branch ajustado para H20 com base nas tarefas até 9 de julho de 2026, antes da versão final v1.1
- A imagem Docker, os critérios de desempenho de GPU e o oráculo de referência foram recalibrados para H20, mas os validadores de exatidão e prevenção de trapaça não foram alterados
- O Claude Fable 5 teve fallback em 35% das tarefas, o que pode ter impactado negativamente o desempenho medido
- O PostTrainBench é a média de 3 execuções em GPU H20, com esforço máximo de inferência, em vez do H100 do ambiente oficial
- O Kimi Code Bench 2.0 inclui tarefas de cibersegurança e segurança
- O Claude Fable 5 teve 13 fallbacks e 1 recusa em 80 tarefas
- O GPT-5.6 Sol recusou 10 tarefas, e o GPT-5.5 recusou 3
- O resultado 91,2 no BrowseComp foi obtido com uma estratégia de compressão de contexto operando em 300K tokens
- Usando a janela completa de 1M tokens sem gerenciamento de contexto separado, registrou 90,4
- As avaliações multimodais usam a média de 3 execuções, exceto o ZeroBench
- O ZeroBench é executado 5 vezes conforme a configuração oficial
- O PerceptionBench é um benchmark próprio que mede capacidade de percepção visual atômica
Quantização nativa
- A aprendizagem com reconhecimento de quantização foi aplicada desde a etapa de SFT
- Os pesos usam MXFP4 e as ativações usam MXFP8, visando ampla compatibilidade de hardware
Implantação e formas de execução
- É possível acessar a Kimi API selecionando
kimi-k3, com API compatível com OpenAI e Anthropic - No Hugging Face Transformers, pode ser carregado com
pipeline("image-text-to-text", ...)ouAutoModel.from_pretrained(...)- Para usar código de modelo personalizado, é necessário
trust_remote_code=True
- Para usar código de modelo personalizado, é necessário
- Há suporte a serving local com vLLM e SGLang
- Ambos os motores podem processar requisições de texto e imagem no endpoint compatível com OpenAI
/v1/chat/completions
- Ambos os motores podem processar requisições de texto e imagem no endpoint compatível com OpenAI
- No Docker Model Runner, execute com
docker model run hf.co/moonshotai/Kimi-K3 - O modelo também pode ser usado no HuggingChat, Google Colab e Kaggle
Como usar a API preservando o estado de raciocínio
- O Kimi K3 mantém o modo de pensamento sempre ativado e retorna
reasoning_content - O campo de requisição de nível superior
reasoning_effortsuporta"low","high"e"max", com padrão"max" - Conversas de múltiplos turnos e chamadas de ferramentas devem seguir o método de histórico de raciocínio preservado
- A mensagem do assistant retornada pela API deve ser reenviada integralmente em
messages - Além de
content, também é preciso incluirreasoning_contentetool_calls
- A mensagem do assistant retornada pela API deve ser reenviada integralmente em
- Entrada visual, saída estruturada, partial mode, seleção de ferramentas, carregamento dinâmico de ferramentas e cache de contexto podem ser consultados em Kimi K3 Quickstart e Thinking Effort
Licença
- Tanto o repositório de código quanto os pesos do modelo foram publicados sob a Kimi K3 License
2 comentários
Seria bom se surgisse uma empresa oferecendo isso no Brasil.
Comentários do Hacker News
Quando houver um preço intermediário de terceiros para o modelo de 3 trilhões de parâmetros, será possível estimar o custo real de serving e se o laboratório está subsidiando tokens de API
Como é nativo em MXFP4, requer cerca de 1,5TB de VRAM, ficando no limite de 8×B200, e considerando também comprimento de contexto e otimização de throughput, na prática parecem ser necessárias 16 placas
No benchmark de cibersegurança AISI, ele fica acima do GLM 5.2, mas ainda há uma grande diferença para os modelos fechados de ponta, então pode ser necessário fine-tuning. Também fico curioso se o Cursor vai treinar novamente para comparar diretamente com a linha Composer, que é um fine-tuning do Kimi 2.6/2.7, e com o Grok 4.5
Também há expectativa de criar modelos menores com uma destilação de conhecimento adequada, aprendendo a distribuição de probabilidade completa. Em especial, o DSV4-Kimi parece promissor por ter baixo custo de serving
Com um servidor 4U usado e 32 DIMMs ECC de 64GB, dá para montar 3TB de RAM por menos de 30 mil dólares, então a diferença de preço para equipamento real com GPU é grande. Ainda não há pesos em precisão total nem versões quantizadas Q8/Q8-XL da Unsloth, mas para usar contexto folgado parece que será preciso passar de 1.536GB para 2TB, idealmente 2,5~3TB
Q4 e Q6 provavelmente serão o pior tipo de compromisso: perdem conhecimento e precisão, continuam lentos e pouco confiáveis; então, para rodar um modelo inteligente porém lento em hardware de baixo orçamento, eu diria que Q8 é necessário
Em https://github.com/woct0rdho/transformers5-qwen3.5-recipe foi criada uma prova de conceito, e sem CPU offloading é possível fazer fine-tuning do Qwen3.5-35B-A3B com 16GiB de VRAM e do DeepSeek-V4-Flash 284B-A13B com 90GiB de VRAM. Também funciona bem em sistemas de memória unificada como o Strix Halo
Ainda assim, um modelo do porte do Kimi-K3 exige várias GPUs e nós, então há muito mais coisas para resolver do que no treinamento em uma única GPU
Nesta abertura, o aspecto muito mais interessante do que o preço é a customização. Startups podem baixar os pesos, modificar e fazer fine-tuning, e a verdadeira vantagem está menos no custo e mais no desempenho com seus próprios dados e na soberania da propriedade intelectual. Uma grande conquista da equipe Kimi
Tenho a impressão de que o hardware para indivíduos rodarem LLMs está montado de um jeito inadequado para o uso. Ou é preciso aguentar 5~10 tokens por segundo em memória unificada, ou partir para placas de datacenter com centenas de GB de VRAM e mais de 1kW de consumo
Não existe uma GPU semiprofissional com TDP de 180~250W e 128GB ou 256GB de VRAM, e só duas dessas placas com uma conexão comum no nível de NVLink já seriam bastante úteis. Rodar o Kimi K3 localmente exigiria um homelab gigantesco e muito gasto, mas seria ótimo conseguir rodar o GLM 5.2 a cerca de 100 tokens por segundo em uma sessão única, ou cerca de 60 tokens ao usar vários subagentes
Medições rodando o
llama-servermais recente com--no-mmapsugerem DeepSeek-V4-Flash Q4_K_XL 178,175MiB, Q8_K_XL 184,636MiB, Laguna-S-2.1 Q8_K_X 172,860MiB e Qwen3.5-122B-A10B Q8_K_XL 170,038MiBIsso contrasta com o trabalho em desktop, que também é intermitente, mas cujo desempenho computacional necessário ficou barato o suficiente para permitir colocar sobre a mesa um equipamento exagerado para os períodos ociosos
gpt-osscomo exceção, e tornam difícil rodar modelos abertos enquanto falam em democratização, o que parece especialmente injustoSe eu pudesse comprar uma GPU de alguns milhares de dólares, compraria como um entusiasta rico de tecnologia, mas seria preciso admitir que é um luxo extremamente ineficiente, como um carro esportivo. A verdadeira infelicidade é não termos tecnologia de computação nem instituições políticas e sociais para operar hardware compartilhado de maneira confiável
Pela licença, se o detentor da licença ou uma afiliada operar um negócio de modelo como serviço e a receita acumulada em 12 meses consecutivos ultrapassar 20 milhões de dólares, será necessário firmar um contrato separado com a Moonshot AI antes de usar comercialmente o software ou derivados
Disponível em https://app.fireworks.ai/models/fireworks/kimi-k3, com preço de 3 dólares por 1 milhão de tokens de entrada sem cache, 0,30 dólar para entrada com cache e 15 dólares para saída
No momento a latência é muito menor que a da Moonshot, mas o uso também é bem menor, então ainda resta ver se isso vai se manter. Ainda assim, a disponibilização no mesmo dia é impressionante
Por causa da concorrência, o preço do GLM 5.2 caiu cerca de 45% em aproximadamente 1,5 mês desde o lançamento em 16 de junho, e novos provedores ainda estão competindo em preço: https://openrouter.ai/z-ai/glm-5.2#providers
Em termos econômicos, o preço não precisa ficar acima do custo total, mas não deve ficar abaixo do custo marginal, que num datacenter com baixa utilização de GPU equivale aproximadamente ao custo de eletricidade. Por causa do excesso de capacidade e da concorrência em datacenters menores, imagino que em breve também apareçam lugares vendendo tokens abaixo do nível que soma conta de luz e depreciação de GPU
No Hugging Face, ao perguntar “Tell me about yourself”, achei interessante que o Kimi K3 respondeu que era o Claude feito pela Anthropic
Recomendo baixar os modelos de ponta para preservação. Mesmo que sejam 1,5 TB, colocá-los em um disco barato e semear via torrent é mais útil
Assim como no passado tentaram controlar algoritmos criptográficos, modelos também podem ser bloqueados por regulação, e software aberto só sobrevive se for amplamente distribuído. Com o tempo, a enorme quantidade de investimento em técnicas e na fabricação de hardware deve tornar sua execução prática viável; seria uma pena se, quando esse momento chegar, distribuir isso se tornasse ilegal e fosse preciso pagar o custo da captura regulatória
O endereço magnet é
magnet:?xt=urn:btih:1e63a865fbf9b58decc8b71091db54d673c5da6f&dn=Kimi-K3&tr=udp%3A%2F%2Ftracker.opentrackr.org%3A1337%2Fannounce&tr=udp%3A%2F%2Ftracker.openbittorrent.com%3A6969%2Fannounce&tr=udp%3A%2F%2Fopen.stealth.si%3A80%2Fannounce&tr=udp%3A%2F%2Fexplodie.org%3A6969%2Fannounce&tr=udp%3A%2F%2Ftracker.torrent.eu.org%3A451%2Fannounce&tr=udp%3A%2F%2Fexodus.desync.com%3A6969%2FannounceDepois de revisar a licença e testar em hardware real, parece difícil para provedores oferecerem isso por 60% a 70% menos que o preço da Moonshot. Dá para baixar um pouco, mas sem sacrificar muito a velocidade de processamento parece difícil chegar a descontos no nível do GLM
A margem do Kimi é estimada em cerca de 40% a 50%, mesmo assumindo que as GPUs sejam obtidas a preços altos de aluguel; com equipamento próprio, pode ser maior. Ainda assim, fica abaixo da margem de mais de 90% que alguns estimam para a Anthropic, e até a margem de 80% da API da Anthropic parece duvidosa
Se o custo fosse só eletricidade, 80% a 90% seria possível, mas olhando o número atual de tokens por segundo isso não parece fácil. Testei apenas em B200 e não consegui B300; como já é um modelo quantizado e nem usa contexto de 1 milhão de tokens, também não parece haver muito espaço para otimização imediata de memória. Seria bom se alguém com acesso ao R100 pudesse verificar o custo
Como grandes provedores precisam fechar contrato com a Kimi, enquanto o Kimi for o melhor modelo aberto de ponta, parece difícil esperar grandes descontos
O link original está retornando 404; fico me perguntando se foi bloqueado ou autocensurado
Parece haver demanda para arquivar isso em preparação para a possibilidade de desaparecer de repente por controle governamental. A China também começou recentemente a discutir controles de exportação de modelos e, agora que passou a lançar modelos de ponta em vez de modelos defasados, a situação mudou