1 pontos por GN⁺ 3 시간 전 | 2 comentários | Compartilhar no WhatsApp
  • Kimi K3 é um modelo agente multimodal nativo de pesos abertos com 2,8 trilhões de parâmetros e contexto de 1.048.576 tokens, com suporte a sessões longas de programação, trabalho de conhecimento e raciocínio
  • Combina Kimi Delta Attention (KDA), Attention Residuals e Stable LatentMoE, ativando 16 especialistas por token entre 896 no total, com eficiência geral de escalonamento cerca de 2,5 vezes maior que a do Kimi K2
  • Em avaliações públicas, registrou 93,5 no GPQA Diamond, 88,3 no Terminal-Bench 2.1, 91,2 no BrowseComp e 91,1 no OmniDocBench, mas é preciso considerar também diferenças de harness, configuração de inferência e hardware entre modelos
  • Foi treinado com reconhecimento de quantização usando pesos MXFP4 e ativações MXFP8 e pode ser executado com Transformers, vLLM, SGLang, Docker e APIs compatíveis com OpenAI e Anthropic
  • Em conversas de múltiplos turnos e chamadas de ferramentas, é necessário reenviar integralmente a mensagem do assistant retornada pela API, incluindo reasoning_content e tool_calls; o código e os pesos foram publicados sob a Kimi K3 License

Arquitetura e escala do modelo

  • Kimi K3 é um modelo agente multimodal nativo de pesos abertos projetado para programação de longa duração, trabalho de conhecimento e raciocínio
  • Tem 2.8T parâmetros no total, 104B parâmetros ativos e é composto por 93 camadas
    • Usa 1 camada Dense, 69 camadas KDA e 24 camadas Gated MLA
    • A dimensão oculta de attention é 7.168, com 96 cabeças de attention
  • O Stable LatentMoE seleciona 16 especialistas por token entre 896 e usa 2 especialistas compartilhados
    • A dimensão do Latent MoE é 3.584, e a dimensão oculta de MoE por especialista é 3.072
    • Em comparação com o Kimi K2, a eficiência geral de escalonamento melhora em cerca de 2,5 vezes
  • O vocabulário tem 160K, o comprimento de contexto é de 1.048.576 tokens e a função de ativação é SiTU-GLU
  • Usa o MoonViT-V2 de 401M parâmetros como encoder de visão
  • Os principais recursos incluem compreensão de texto, imagem e vídeo, mas na tabela-resumo do modelo o campo modality lista apenas Text e Image

Programação de longa duração e trabalho de conhecimento

  • Mantém longas sessões de engenharia com supervisão humana mínima, explorando grandes repositórios e coordenando ferramentas de terminal
    • Dá suporte à otimização de kernels de GPU e ao desenvolvimento de compiladores
    • Também inclui desenvolvimento de jogos com uso de visão, CAD e projeto de chips
  • Em trabalho de conhecimento orientado por agentes, gera visualizações interativas, widgets e dashboards junto com pesquisa aprofundada
    • Motion design e edição de vídeo também entram no escopo de suporte
  • O framework de agente de programação recomendado é o Kimi Code CLI, no qual é possível selecionar o Kimi K3 com o comando /model no terminal

Resultados de avaliação

  • Todos os resultados do Kimi K3 foram medidos com reasoning_effort="max" e temperature 1.0
    • Em tarefas de etapa única, como GPQA Diamond, HLE-Full e avaliações visuais sem ferramentas, foi usado top-p 0.95
    • Em tarefas agentivas, foi aplicado top-p 1.0
  • Em avaliações de raciocínio e conhecimento, registrou 93,5 no GPQA Diamond, 23,4 no CritPt e 74,7 no AA-LCR
    • No HLE-Full, obteve 43,5 sem ferramentas e 56,0 com uso de ferramentas
  • Em avaliações de programação, registrou 77,8 no ProgramBench, 88,3 no Terminal-Bench 2.1 e 81,2 no FrontierSWE
    • No DeepSWE, obteve 67,5 no harness do Kimi Code e 67,3 no harness do mini-SWE-agent
    • Registrou 42,0 no SWE-Marathon, 36,6 no PostTrainBench, 48,3 no MLS-Bench-Lite, 58,7 no SciCode e 72,9 no Kimi Code Bench 2.0
  • Em avaliações de agentes, registrou 91,2 no BrowseComp, F1 95,0 no DeepSearchQA e 76,2 no ResearchRubrics
    • Obteve 94,5 no MCPMark-Verified, 30,8 no AutomationBench, 34,8 no SpreadsheetBench 2 e 84,8 no OSWorld-Verified
    • Foi medido com 94,6 no Harvey Lab-AA, 71,6 no CorpFin v2, 54,4 no Finance Agent v2 e 44,2 no Legal Research Bench
  • Em avaliações visuais, registrou 91,1 no OmniDocBench, 90,0 no Video-MME e 82,1 no MMVU
    • No MMMU-Pro, obteve 81,6 sem ferramentas e 83,4 com uso de ferramentas
    • No MathVision, subiu de 94,3 para 97,8 ao usar Python
    • O ZeroBench pass@5 subiu de 23,0 para 41,0 com uso de ferramentas

Condições de avaliação e limitações de comparação

  • Os modelos comparados incluem Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5 e GLM-5.2, mas o harness de avaliação pode variar entre os modelos
    • O Kimi K3 usa principalmente Kimi Code ou Claude Code
    • A família GPT usa principalmente Codex, enquanto outros modelos Claude e GLM usam Claude Code, Terminus 2 e afins
  • O SWE-Marathon foi avaliado em um branch ajustado para H20 com base nas tarefas até 9 de julho de 2026, antes da versão final v1.1
    • A imagem Docker, os critérios de desempenho de GPU e o oráculo de referência foram recalibrados para H20, mas os validadores de exatidão e prevenção de trapaça não foram alterados
    • O Claude Fable 5 teve fallback em 35% das tarefas, o que pode ter impactado negativamente o desempenho medido
  • O PostTrainBench é a média de 3 execuções em GPU H20, com esforço máximo de inferência, em vez do H100 do ambiente oficial
  • O Kimi Code Bench 2.0 inclui tarefas de cibersegurança e segurança
    • O Claude Fable 5 teve 13 fallbacks e 1 recusa em 80 tarefas
    • O GPT-5.6 Sol recusou 10 tarefas, e o GPT-5.5 recusou 3
  • O resultado 91,2 no BrowseComp foi obtido com uma estratégia de compressão de contexto operando em 300K tokens
    • Usando a janela completa de 1M tokens sem gerenciamento de contexto separado, registrou 90,4
  • As avaliações multimodais usam a média de 3 execuções, exceto o ZeroBench
    • O ZeroBench é executado 5 vezes conforme a configuração oficial
    • O PerceptionBench é um benchmark próprio que mede capacidade de percepção visual atômica

Quantização nativa

  • A aprendizagem com reconhecimento de quantização foi aplicada desde a etapa de SFT
  • Os pesos usam MXFP4 e as ativações usam MXFP8, visando ampla compatibilidade de hardware

Implantação e formas de execução

  • É possível acessar a Kimi API selecionando kimi-k3, com API compatível com OpenAI e Anthropic
  • No Hugging Face Transformers, pode ser carregado com pipeline("image-text-to-text", ...) ou AutoModel.from_pretrained(...)
    • Para usar código de modelo personalizado, é necessário trust_remote_code=True
  • Há suporte a serving local com vLLM e SGLang
    • Ambos os motores podem processar requisições de texto e imagem no endpoint compatível com OpenAI /v1/chat/completions
  • No Docker Model Runner, execute com docker model run hf.co/moonshotai/Kimi-K3
  • O modelo também pode ser usado no HuggingChat, Google Colab e Kaggle

Como usar a API preservando o estado de raciocínio

  • O Kimi K3 mantém o modo de pensamento sempre ativado e retorna reasoning_content
  • O campo de requisição de nível superior reasoning_effort suporta "low", "high" e "max", com padrão "max"
  • Conversas de múltiplos turnos e chamadas de ferramentas devem seguir o método de histórico de raciocínio preservado
    • A mensagem do assistant retornada pela API deve ser reenviada integralmente em messages
    • Além de content, também é preciso incluir reasoning_content e tool_calls
  • Entrada visual, saída estruturada, partial mode, seleção de ferramentas, carregamento dinâmico de ferramentas e cache de contexto podem ser consultados em Kimi K3 Quickstart e Thinking Effort

Licença

  • Tanto o repositório de código quanto os pesos do modelo foram publicados sob a Kimi K3 License

2 comentários

 
treestae 1 시간 전

Seria bom se surgisse uma empresa oferecendo isso no Brasil.

 
GN⁺ 3 시간 전
Comentários do Hacker News
  • Quando houver um preço intermediário de terceiros para o modelo de 3 trilhões de parâmetros, será possível estimar o custo real de serving e se o laboratório está subsidiando tokens de API
    Como é nativo em MXFP4, requer cerca de 1,5TB de VRAM, ficando no limite de 8×B200, e considerando também comprimento de contexto e otimização de throughput, na prática parecem ser necessárias 16 placas
    No benchmark de cibersegurança AISI, ele fica acima do GLM 5.2, mas ainda há uma grande diferença para os modelos fechados de ponta, então pode ser necessário fine-tuning. Também fico curioso se o Cursor vai treinar novamente para comparar diretamente com a linha Composer, que é um fine-tuning do Kimi 2.6/2.7, e com o Grok 4.5
    Também há expectativa de criar modelos menores com uma destilação de conhecimento adequada, aprendendo a distribuição de probabilidade completa. Em especial, o DSV4-Kimi parece promissor por ter baixo custo de serving

    • Fico curioso sobre o desempenho lento de inferência que seria possível obter em servidores Xeon dual- ou quad-socket com 1,5~3TB de RAM e sem GPU. Para tarefas longas de 4~6 horas, até 5~6 tokens por segundo podem ser úteis dependendo do uso
      Com um servidor 4U usado e 32 DIMMs ECC de 64GB, dá para montar 3TB de RAM por menos de 30 mil dólares, então a diferença de preço para equipamento real com GPU é grande. Ainda não há pesos em precisão total nem versões quantizadas Q8/Q8-XL da Unsloth, mas para usar contexto folgado parece que será preciso passar de 1.536GB para 2TB, idealmente 2,5~3TB
      Q4 e Q6 provavelmente serão o pior tipo de compromisso: perdem conhecimento e precisão, continuam lentos e pouco confiáveis; então, para rodar um modelo inteligente porém lento em hardware de baixo orçamento, eu diria que Q8 é necessário
    • Hoje o fine-tuning normalmente aplica LoRA sobre modelos baseados em bnb 4 bits, mas acho que já é hora de mudar o formato base para GGUF. O GGUF dá suporte ativo a novas arquiteturas de modelo e quantizações mais agressivas
      Em https://github.com/woct0rdho/transformers5-qwen3.5-recipe foi criada uma prova de conceito, e sem CPU offloading é possível fazer fine-tuning do Qwen3.5-35B-A3B com 16GiB de VRAM e do DeepSeek-V4-Flash 284B-A13B com 90GiB de VRAM. Também funciona bem em sistemas de memória unificada como o Strix Halo
      Ainda assim, um modelo do porte do Kimi-K3 exige várias GPUs e nós, então há muito mais coisas para resolver do que no treinamento em uma única GPU
    • Anthropic e OpenAI têm inovações de otimização que os laboratórios chineses não têm, então esse preço mostra o limite superior do custo, mas não o inferior
    • Como é um modelo nativo em MXFP4, também é interessante do ponto de vista de hardware. Cabe com folga em um nó com 8×AMD MI355X, o que pode reduzir ainda mais o preço por token
    • Sem saber o custo de treinamento, só dá para inferir o custo marginal de servir esse tipo de modelo; não dá para saber se o laboratório está subsidiando tokens de API. Também não sabemos o tamanho real dos modelos fechados, nem se o Fable tem 10 trilhões ou 1 trilhão de parâmetros
  • Nesta abertura, o aspecto muito mais interessante do que o preço é a customização. Startups podem baixar os pesos, modificar e fazer fine-tuning, e a verdadeira vantagem está menos no custo e mais no desempenho com seus próprios dados e na soberania da propriedade intelectual. Uma grande conquista da equipe Kimi

  • Tenho a impressão de que o hardware para indivíduos rodarem LLMs está montado de um jeito inadequado para o uso. Ou é preciso aguentar 5~10 tokens por segundo em memória unificada, ou partir para placas de datacenter com centenas de GB de VRAM e mais de 1kW de consumo
    Não existe uma GPU semiprofissional com TDP de 180~250W e 128GB ou 256GB de VRAM, e só duas dessas placas com uma conexão comum no nível de NVLink já seriam bastante úteis. Rodar o Kimi K3 localmente exigiria um homelab gigantesco e muito gasto, mas seria ótimo conseguir rodar o GLM 5.2 a cerca de 100 tokens por segundo em uma sessão única, ou cerca de 60 tokens ao usar vários subagentes

    • O modelo grande em Q8 desejado não cabe em um sistema de 3.995 dólares com no máximo 128GB de RAM, nem permite reservar espaço de contexto prático. Qwen 3.5 122B Q8, DeepSeek V4 Flash Q8 e Laguna S 2.1 Q8 precisam de 170~190GB de RAM incluindo o contexto completo, então cabem em uma workstation ou servidor dual-socket de 256GB sem GPU
      Medições rodando o llama-server mais recente com --no-mmap sugerem DeepSeek-V4-Flash Q4_K_XL 178,175MiB, Q8_K_XL 184,636MiB, Laguna-S-2.1 Q8_K_X 172,860MiB e Qwen3.5-122B-A10B Q8_K_XL 170,038MiB
    • A inferência de LLM para um único usuário é especialmente inadequada para hardware comum de consumo. A carga é intermitente, mas os pesos precisam ficar sempre na memória, então um servidor multiusuário com os pesos residentes e adicionando apenas o cache KV por usuário é muito mais eficiente, além de evitar que os caros núcleos de GPU fiquem ociosos na maior parte do tempo
      Isso contrasta com o trabalho em desktop, que também é intermitente, mas cujo desempenho computacional necessário ficou barato o suficiente para permitir colocar sobre a mesa um equipamento exagerado para os períodos ociosos
    • Depois do boom das criptomoedas, os fabricantes de GPU passaram a segmentar o mercado pela VRAM para discriminar preços. A Nvidia limitou a memória das placas de consumo para impedir que provedores de nuvem as comprassem em massa e pôde vender hardware essencialmente igual para os mercados de PC e datacenter com preços muito diferentes, capturando o lucro dos dois lados
    • Tenho a sensação de que, à medida que os modelos continuam crescendo, estamos indo na direção oposta da revolução do PC. Os laboratórios de ponta soltam apenas modelos fechados, deixando gpt-oss como exceção, e tornam difícil rodar modelos abertos enquanto falam em democratização, o que parece especialmente injusto
    • Rodar esse tipo de LLM em casa dificilmente será prático sem algum avanço de design. A única forma racional de execução é processar grandes lotes em hardware compartilhado
      Se eu pudesse comprar uma GPU de alguns milhares de dólares, compraria como um entusiasta rico de tecnologia, mas seria preciso admitir que é um luxo extremamente ineficiente, como um carro esportivo. A verdadeira infelicidade é não termos tecnologia de computação nem instituições políticas e sociais para operar hardware compartilhado de maneira confiável
  • Pela licença, se o detentor da licença ou uma afiliada operar um negócio de modelo como serviço e a receita acumulada em 12 meses consecutivos ultrapassar 20 milhões de dólares, será necessário firmar um contrato separado com a Moonshot AI antes de usar comercialmente o software ou derivados

    • Parece semelhante à abordagem que a Meta aplicou nos primeiros modelos Llama. Também é um marketing esperto a cláusula de que, se o software ou derivados forem usados em produtos ou serviços comerciais com mais de 100 milhões de usuários ativos mensais ou mais de 20 milhões de dólares de receita mensal, é preciso exibir Kimi K3 de forma visível na interface do usuário
  • Disponível em https://app.fireworks.ai/models/fireworks/kimi-k3, com preço de 3 dólares por 1 milhão de tokens de entrada sem cache, 0,30 dólar para entrada com cache e 15 dólares para saída

    • O plano de prioridade Kimi da Fireworks também é oferecido no OpenRouter por 3,75 dólares por 1 milhão de tokens: https://openrouter.ai/moonshotai/kimi-k3#providers
      No momento a latência é muito menor que a da Moonshot, mas o uso também é bem menor, então ainda resta ver se isso vai se manter. Ainda assim, a disponibilização no mesmo dia é impressionante
    • Claude Opus 5 custa 5 dólares para entrada sem cache, 0,50 dólar para entrada com cache e 25 dólares para saída, além de custo extra de 25% para escrita de cache em 5 minutos e 100% em 1 hora
    • Poucas horas após o lançamento na Fireworks, já foi possível oferecê-lo aos usuários da nossa plataforma. Porém, como os modelos Flux sob demanda foram descontinuados, agora fica a frustração de onde fazer geração de imagens
    • Também está disponível na Together.ai pelo mesmo preço de venda, e Fireworks e Together foram os dois primeiros lugares que verifiquei
  • Por causa da concorrência, o preço do GLM 5.2 caiu cerca de 45% em aproximadamente 1,5 mês desde o lançamento em 16 de junho, e novos provedores ainda estão competindo em preço: https://openrouter.ai/z-ai/glm-5.2#providers
    Em termos econômicos, o preço não precisa ficar acima do custo total, mas não deve ficar abaixo do custo marginal, que num datacenter com baixa utilização de GPU equivale aproximadamente ao custo de eletricidade. Por causa do excesso de capacidade e da concorrência em datacenters menores, imagino que em breve também apareçam lugares vendendo tokens abaixo do nível que soma conta de luz e depreciação de GPU

    • Também pode ser uma estrutura em que vendem tokens baratos e depois revendem os dados de tokens dos usuários para outro lugar
    • O número de 45% de queda parece duvidoso. O provedor barato no OpenRouter usa FP4, ao contrário do FP8 oficial da Z.ai. Há provedores FP8 baratos como a Novita, mas na UI isso parece desconto temporário, e o preço normal é quase igual ao da Z.ai oficial
    • A SemiAnalysis estima o custo de um modelo com cerca de 2 trilhões de parâmetros em menos de 1 dólar por 1 milhão de tokens. Isso varia conforme throughput e quantização, mas se o custo dos grandes provedores for baixo o bastante, até o preço mínimo atual de 2,42 dólares do GLM 5.2 pode ainda deixar uma boa margem de lucro
  • No Hugging Face, ao perguntar “Tell me about yourself”, achei interessante que o Kimi K3 respondeu que era o Claude feito pela Anthropic

    • À mesma pergunta, também respondeu normalmente que era o “Kimi desenvolvido pela Moonshot AI”
    • Esse tipo de resposta não significa muita coisa. Se você fizer a mesma pergunta em chinês ao Opus, ele às vezes responde que é o DeepSeek, porque os dados de treinamento se misturam e o modelo alucina
    • Não é algo surpreendente. Destilação de conhecimento é comum, e todos os laboratórios a usam, intencionalmente ou não. Isso porque os corpora de treinamento após o ChatGPT sempre incluem conteúdo gerado por IA
  • Recomendo baixar os modelos de ponta para preservação. Mesmo que sejam 1,5 TB, colocá-los em um disco barato e semear via torrent é mais útil
    Assim como no passado tentaram controlar algoritmos criptográficos, modelos também podem ser bloqueados por regulação, e software aberto só sobrevive se for amplamente distribuído. Com o tempo, a enorme quantidade de investimento em técnicas e na fabricação de hardware deve tornar sua execução prática viável; seria uma pena se, quando esse momento chegar, distribuir isso se tornasse ilegal e fosse preciso pagar o custo da captura regulatória

    • O arquivo torrent está em https://terminalbytes.com/kimi-k3-torrent/Kimi-K3.torrent
      O endereço magnet é magnet:?xt=urn:btih:1e63a865fbf9b58decc8b71091db54d673c5da6f&dn=Kimi-K3&tr=udp%3A%2F%2Ftracker.opentrackr.org%3A1337%2Fannounce&tr=udp%3A%2F%2Ftracker.openbittorrent.com%3A6969%2Fannounce&tr=udp%3A%2F%2Fopen.stealth.si%3A80%2Fannounce&tr=udp%3A%2F%2Fexplodie.org%3A6969%2Fannounce&tr=udp%3A%2F%2Ftracker.torrent.eu.org%3A451%2Fannounce&tr=udp%3A%2F%2Fexodus.desync.com%3A6969%2Fannounce
    • No fim, as autoridades vão restringir isso começando pela compra de hardware para rodar esses modelos
    • Agora já nem há discos baratos, e eu não gostaria de gastar centenas de dólares por uma preocupação regulatória vaga
  • Depois de revisar a licença e testar em hardware real, parece difícil para provedores oferecerem isso por 60% a 70% menos que o preço da Moonshot. Dá para baixar um pouco, mas sem sacrificar muito a velocidade de processamento parece difícil chegar a descontos no nível do GLM
    A margem do Kimi é estimada em cerca de 40% a 50%, mesmo assumindo que as GPUs sejam obtidas a preços altos de aluguel; com equipamento próprio, pode ser maior. Ainda assim, fica abaixo da margem de mais de 90% que alguns estimam para a Anthropic, e até a margem de 80% da API da Anthropic parece duvidosa
    Se o custo fosse só eletricidade, 80% a 90% seria possível, mas olhando o número atual de tokens por segundo isso não parece fácil. Testei apenas em B200 e não consegui B300; como já é um modelo quantizado e nem usa contexto de 1 milhão de tokens, também não parece haver muito espaço para otimização imediata de memória. Seria bom se alguém com acesso ao R100 pudesse verificar o custo
    Como grandes provedores precisam fechar contrato com a Kimi, enquanto o Kimi for o melhor modelo aberto de ponta, parece difícil esperar grandes descontos

  • O link original está retornando 404; fico me perguntando se foi bloqueado ou autocensurado

    • Até alguns minutos atrás havia uma página de contagem regressiva para a divulgação dos pesos, com 19 minutos restantes até o fim, e de repente apareceu um 404
    • É bem provável que seja um problema técnico no processo de transição. Mesmo que quase ninguém consiga executar, também é interessante imaginar o que aconteceria com o Hugging Face se inúmeros usuários baixassem um modelo de vários TB
      Parece haver demanda para arquivar isso em preparação para a possibilidade de desaparecer de repente por controle governamental. A China também começou recentemente a discutir controles de exportação de modelos e, agora que passou a lançar modelos de ponta em vez de modelos defasados, a situação mudou
    • Pode soar como teoria da conspiração, mas é uma boa oportunidade para os EUA ou a China exibirem sua influência, e os EUA parecem mais prováveis