- Kimi K3-256k é um modelo para codificação do dia a dia que mantém a qualidade dos resultados do K3 em um contexto de 256k, consumindo cerca de metade da cota em comparação com o
k3de contexto de 1M - O Kimi Code oferece o K3 e o K2.7 Code em 4 IDs de modelo; o
k3tem 2,8T parâmetros e suporta até 1M de contexto, enquanto okimi-for-coding-highspeedusa 3 vezes mais cota em troca de uma saída cerca de 5 a 6 vezes mais rápida - Ao mudar de
k3parak3-256k, se o contexto existente exceder 256k ou incluir vídeo, é preciso executar primeiro compact para preservar as informações essenciais e manter a compatibilidade - Alterar o modelo ou o
reasoning_effortinvalida o cache de contexto existente, exigindo um novo prefill, o que pode aumentar o uso; recomenda-se fazer a troca em uma nova sessão - Os modelos e contextos disponíveis variam conforme o plano, e um
401é retornado ao exceder as permissões. Em ferramentas de terceiros, é necessário configurar diretamente o ID exato do modelo, o tamanho do contexto e a intensidade de raciocínio
Configuração de modelos do Kimi Code
- O Kimi Code oferece Kimi K3 e Kimi K2.7 Code em 4 IDs de modelo
k3: modelo flagship de codificação com 2,8T parâmetros, com suporte a até 1M de contexto nos planos superioresk3-256k: versão do Kimi K3 com contexto de 256k, focada em reduzir o consumokimi-for-coding: Kimi K2.7 Code adequado para conclusão de código e tarefas rotineiras de desenvolvimentokimi-for-coding-highspeed: K2.7 Code HighSpeed, que oferece saída cerca de 5 a 6 vezes mais rápida com a mesma capacidade de codificação
- As especificações e condições de uso por modelo são as seguintes
k3- Opera em velocidade normal e oferece até 1M de contexto para assinantes de planos superiores
reasoning_effortsuportalow,highemax, comhighcomo padrão- Disponível a partir do Moderato; o contexto de 1M é oferecido a partir do Allegretto
- Aceita entrada de imagens e vídeos
k3-256k- Opera em velocidade normal e o contexto é fixo em 256k
reasoning_effortsuportalow,highemax, comhighcomo padrão- Disponível para assinantes Moderato ou superior
- Aceita apenas imagens; vídeos não são suportados
kimi-for-coding- Oferece velocidade normal e contexto de 256k, disponível para todos os assinantes
- Opera com
Thinking:ONe suporta imagens e vídeos
kimi-for-coding-highspeed- Gera saída cerca de 6 vezes mais rápido em contexto de 256k, mas usa 3 vezes mais cota
- Disponível a partir do Allegretto e oferece suporte a
Thinking:ON, além de entrada de imagens e vídeos
Uso do K3-256k e troca de modelo
- O
k3-256koferece os mesmos resultados que ok3dentro de uma janela de contexto de 256k, consumindo cerca de metade da cota em comparação com a versão de 1M - É adequado para perguntas e respostas do dia a dia, conclusão de código, desenvolvimento de funcionalidades comuns e edição de um único arquivo ou de arquivos pequenos, mas não suporta entrada de vídeo
-
Trocar de K3 para K3-256k
- Se o contexto da sessão atual exceder 256k, algumas ferramentas, como o Kimi Code CLI e o Claude Code, executam compact por conta própria
- Como cada ferramenta de agente trata isso de uma forma, recomenda-se executar manualmente compact uma vez antes da troca para comprimir o contexto para dentro de 256k
- Isso permite manter a sessão preservando o conteúdo essencial do trabalho
- Após a troca, é possível usar a cota por mais tempo
- Se houver arquivos de vídeo no histórico da conversa, não é possível mudar diretamente para
k3-256k; é preciso executar compact primeiro
-
Trocar de K3-256k para K3
- Se o
k3-256kestiver próximo do limite de 256k e você quiser evitar perda de informações causada por compact, é possível mudar diretamente para ok31M - Na versão atual, mudar de 256k para 1M não afeta o cache
- Se o
Gerenciamento de cache e uso
- Ao trocar de modelo, o cache de contexto criado no modelo anterior não acerta, então é preciso fazer prefill desse contexto novamente
- Por isso, logo após a troca, o uso pode parecer maior. Ao usar um novo modelo, iniciar uma nova sessão tende a favorecer melhores resultados e menor consumo
-
Custo de trocar a intensidade de raciocínio
- Alterar o
reasoning_efforttambém invalida o cache de contexto existente, exigindo novo prefill - Recomenda-se escolher a intensidade de raciocínio adequada para a tarefa e mantê-la de forma consistente dentro de uma sessão
- Se outra intensidade de raciocínio for realmente necessária, é melhor iniciar uma nova sessão em vez de alternar repetidamente em uma sessão longa
- Alterar o
Permissões de plano e erro 401
- Mesmo usando o ID de modelo correto, se o recurso solicitado exceder as permissões do plano, o servidor retorna
401- Sem permissão de acesso ao K3: em planos abaixo do Moderato, não é possível chamar
k3nemk3-256k - Sem permissão de acesso a 1M: no Moderato, o
k3suporta no máximo 256k; até 1M fica disponível a partir do Allegretto - O limite de contexto do
k3-256ké fixo em 256k, independentemente do plano - Sem permissão de acesso ao HighSpeed:
kimi-for-coding-highspeedexige Allegretto ou superior
- Sem permissão de acesso ao K3: em planos abaixo do Moderato, não é possível chamar
- A mensagem de erro completa e as formas de tratamento podem ser consultadas em Error Reference
Por que o HighSpeed pode não parecer rápido
- O ID do modelo HighSpeed deve ser exatamente
kimi-for-coding-highspeed- Se for digitado incorretamente, ele é substituído pelo
kimi-for-codingpadrão sem erro, e o ganho de velocidade não aparece
- Se for digitado incorretamente, ele é substituído pelo
- O HighSpeed acelera apenas a saída do modelo
- Leitura e escrita de arquivos, chamadas de comandos e execução de scripts não ficam mais rápidas
- Se, em uma rodada de trabalho, ferramentas ou scripts representarem uma grande parte do tempo, o ganho geral de velocidade pode parecer pequeno
Trocar de modelo no cliente
- Alterar o ID do modelo invalida o cache de contexto. Para evitar consumo adicional de tokens e obter a melhor experiência de uso, recomenda-se iniciar uma nova sessão
- Ao chamar, é preciso inserir um dos seguintes IDs de modelo, não o nome da versão do modelo
k3k3-256kkimi-for-codingkimi-for-coding-highspeed
- Inserir nomes de versão como
Kimi K3ouK2.7 Codefaz a chamada falhar - Se o Thinking for desativado no K3 ou K2.7, a solicitação será roteada para o K2.6; portanto, para usar K3 ou K2.7 Code, é preciso deixar o Thinking ativado
-
Clientes oficiais
- No Kimi Code CLI, digite
/modelpara trocar de modelo sem alterar configurações - Se o modelo mais recente não aparecer na lista, faça
/logoute depois/loginpara entrar novamente - No Kimi Code for VS Code, selecione o modelo no menu suspenso da caixa de entrada
- Se o modelo não aparecer, reinicie o VS Code ou reinstale a extensão
- No Kimi Code CLI, digite
Configuração de ferramentas de terceiros
- Depois de criar uma API Key no Kimi Code Console, insira a Base URL e o ID do modelo na ferramenta
- A Kimi Code API oferece suporte tanto ao protocolo compatível com OpenAI quanto ao protocolo compatível com Anthropic
- Base URL compatível com OpenAI:
https://api.kimi.com/coding/v1 - Base URL compatível com Anthropic:
https://api.kimi.com/coding/
- Base URL compatível com OpenAI:
- O método de configuração por ferramenta pode ser consultado nos documentos abaixo
- Claude Code: assistente de codificação em linha de comando da Anthropic
- OpenCode: agente de codificação baseado em terminal
- Codex: agente de codificação da OpenAI
-
Configuração de contexto do K3
- O contexto padrão de algumas ferramentas de terceiros é menor que o máximo do K3, que é 1M
- Para usar até 1M de contexto, é preciso definir diretamente o campo
context-windowcomo1048576
-
Mapeamento da intensidade de raciocínio do K3
- O K3 suporta
low,highemax, e os valores enviados pela ferramenta são mapeados da seguinte forma nullouundefined: padrãohigh- Outros valores desconhecidos: erro HTTP
400 ultra,max,xhigh:maxhigh,medium: nível recomendadohighlow,minimum,light:lownone:thinking.typeé desativado
- O K3 suporta
1 comentários
Comentários do Hacker News
O Codex aproveita muito bem 256k de contexto. 1M é folgado, mas ainda caro e parece desnecessário como padrão
LLMs estão rapidamente se tornando uma commodity, e o fosso competitivo de laboratórios de IA dos EUA como a OpenAI está enfraquecendo. No fim, quem provavelmente vence são os hiperescaladores e donos de datacenter que conseguem vender tokens baratos
k3-256kfoi lançado e oferece os mesmos resultados dentro de 256k de contexto. Ok3 (1M)consome cerca de duas vezes mais cota do que ok3-256kÉ uma boa mudança. Normalmente tento manter o contexto abaixo de 200k
https://www.reddit.com/r/kimi/s/BFa1TR9vNg
Então fico pensando se todos os usuários passarão a usar o Kimi por metade do preço até o contexto chegar a 256k. Se for verdade, é uma mudança enorme
k3-256ke depois trocar para o modelo de 1M ao chegar em 256k invalidaria o cache, fazendo você pagar de novo pelos 256k tokens anteriores no preço do modelo de 1MMas isso está errado, e é possível mudar para o modelo de 1M sem invalidar o cache ao se aproximar do limite de contexto. Na versão atual, trocar de
k3-256kparak3 (1M)não afeta o cacheEste post foi publicado há 38 minutos, e há 20 minutos vários serviços da Anthropic estão marcados como em grande indisponibilidade. Provavelmente não tem relação, mas achei meio engraçado
Parece que o modelo em si é o mesmo, e isso é só uma mudança no nível da API
Funcionalmente, é parecido com a forma como a OpenAI muda a faixa de preço ao passar de certo tamanho de contexto. O limite também fica em torno de 272k, ou seja, perto de
2^18ou 256kÀ medida que o contexto ativo cresce, aumentam a computação necessária por token de saída e o volume de bytes que precisam ser lidos, então faz sentido repassar esse custo ao usuário. Ainda assim, surpreende não usarem uma curva de preço mais suave em vez de um limite em degraus
A configuração de contexto curto pode ter menos nós dedicados a prefill por instância, não precisa suportar um cache KV tão grande e também pode reduzir o número total de nós. Se usam inferência desagregada, também dá para ajustar separadamente a proporção de computação alocada para prefill e decoding
Espero que essa mudança reduza a carga na infraestrutura. Todos os modelos ficaram visivelmente mais lentos recentemente, e a equipe de suporte não está respondendo. Suspeito que estejam processando boa parte das requisições com modelos quantizados
Fico me perguntando se não é um modelo quantizado, mas apenas com a janela de contexto reduzida para 256k