1 pontos por GN⁺ 2 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • Kimi K3-256k é um modelo para codificação do dia a dia que mantém a qualidade dos resultados do K3 em um contexto de 256k, consumindo cerca de metade da cota em comparação com o k3 de contexto de 1M
  • O Kimi Code oferece o K3 e o K2.7 Code em 4 IDs de modelo; o k3 tem 2,8T parâmetros e suporta até 1M de contexto, enquanto o kimi-for-coding-highspeed usa 3 vezes mais cota em troca de uma saída cerca de 5 a 6 vezes mais rápida
  • Ao mudar de k3 para k3-256k, se o contexto existente exceder 256k ou incluir vídeo, é preciso executar primeiro compact para preservar as informações essenciais e manter a compatibilidade
  • Alterar o modelo ou o reasoning_effort invalida o cache de contexto existente, exigindo um novo prefill, o que pode aumentar o uso; recomenda-se fazer a troca em uma nova sessão
  • Os modelos e contextos disponíveis variam conforme o plano, e um 401 é retornado ao exceder as permissões. Em ferramentas de terceiros, é necessário configurar diretamente o ID exato do modelo, o tamanho do contexto e a intensidade de raciocínio

Configuração de modelos do Kimi Code

  • O Kimi Code oferece Kimi K3 e Kimi K2.7 Code em 4 IDs de modelo
    • k3: modelo flagship de codificação com 2,8T parâmetros, com suporte a até 1M de contexto nos planos superiores
    • k3-256k: versão do Kimi K3 com contexto de 256k, focada em reduzir o consumo
    • kimi-for-coding: Kimi K2.7 Code adequado para conclusão de código e tarefas rotineiras de desenvolvimento
    • kimi-for-coding-highspeed: K2.7 Code HighSpeed, que oferece saída cerca de 5 a 6 vezes mais rápida com a mesma capacidade de codificação
  • As especificações e condições de uso por modelo são as seguintes
    • k3
      • Opera em velocidade normal e oferece até 1M de contexto para assinantes de planos superiores
      • reasoning_effort suporta low, high e max, com high como padrão
      • Disponível a partir do Moderato; o contexto de 1M é oferecido a partir do Allegretto
      • Aceita entrada de imagens e vídeos
    • k3-256k
      • Opera em velocidade normal e o contexto é fixo em 256k
      • reasoning_effort suporta low, high e max, com high como padrão
      • Disponível para assinantes Moderato ou superior
      • Aceita apenas imagens; vídeos não são suportados
    • kimi-for-coding
      • Oferece velocidade normal e contexto de 256k, disponível para todos os assinantes
      • Opera com Thinking:ON e suporta imagens e vídeos
    • kimi-for-coding-highspeed
      • Gera saída cerca de 6 vezes mais rápido em contexto de 256k, mas usa 3 vezes mais cota
      • Disponível a partir do Allegretto e oferece suporte a Thinking:ON, além de entrada de imagens e vídeos

Uso do K3-256k e troca de modelo

  • O k3-256k oferece os mesmos resultados que o k3 dentro de uma janela de contexto de 256k, consumindo cerca de metade da cota em comparação com a versão de 1M
  • É adequado para perguntas e respostas do dia a dia, conclusão de código, desenvolvimento de funcionalidades comuns e edição de um único arquivo ou de arquivos pequenos, mas não suporta entrada de vídeo
  • Trocar de K3 para K3-256k

    • Se o contexto da sessão atual exceder 256k, algumas ferramentas, como o Kimi Code CLI e o Claude Code, executam compact por conta própria
    • Como cada ferramenta de agente trata isso de uma forma, recomenda-se executar manualmente compact uma vez antes da troca para comprimir o contexto para dentro de 256k
    • Isso permite manter a sessão preservando o conteúdo essencial do trabalho
    • Após a troca, é possível usar a cota por mais tempo
    • Se houver arquivos de vídeo no histórico da conversa, não é possível mudar diretamente para k3-256k; é preciso executar compact primeiro
  • Trocar de K3-256k para K3

    • Se o k3-256k estiver próximo do limite de 256k e você quiser evitar perda de informações causada por compact, é possível mudar diretamente para o k3 1M
    • Na versão atual, mudar de 256k para 1M não afeta o cache

Gerenciamento de cache e uso

  • Ao trocar de modelo, o cache de contexto criado no modelo anterior não acerta, então é preciso fazer prefill desse contexto novamente
  • Por isso, logo após a troca, o uso pode parecer maior. Ao usar um novo modelo, iniciar uma nova sessão tende a favorecer melhores resultados e menor consumo
  • Custo de trocar a intensidade de raciocínio

    • Alterar o reasoning_effort também invalida o cache de contexto existente, exigindo novo prefill
    • Recomenda-se escolher a intensidade de raciocínio adequada para a tarefa e mantê-la de forma consistente dentro de uma sessão
    • Se outra intensidade de raciocínio for realmente necessária, é melhor iniciar uma nova sessão em vez de alternar repetidamente em uma sessão longa

Permissões de plano e erro 401

  • Mesmo usando o ID de modelo correto, se o recurso solicitado exceder as permissões do plano, o servidor retorna 401
    • Sem permissão de acesso ao K3: em planos abaixo do Moderato, não é possível chamar k3 nem k3-256k
    • Sem permissão de acesso a 1M: no Moderato, o k3 suporta no máximo 256k; até 1M fica disponível a partir do Allegretto
    • O limite de contexto do k3-256k é fixo em 256k, independentemente do plano
    • Sem permissão de acesso ao HighSpeed: kimi-for-coding-highspeed exige Allegretto ou superior
  • A mensagem de erro completa e as formas de tratamento podem ser consultadas em Error Reference

Por que o HighSpeed pode não parecer rápido

  • O ID do modelo HighSpeed deve ser exatamente kimi-for-coding-highspeed
    • Se for digitado incorretamente, ele é substituído pelo kimi-for-coding padrão sem erro, e o ganho de velocidade não aparece
  • O HighSpeed acelera apenas a saída do modelo
    • Leitura e escrita de arquivos, chamadas de comandos e execução de scripts não ficam mais rápidas
    • Se, em uma rodada de trabalho, ferramentas ou scripts representarem uma grande parte do tempo, o ganho geral de velocidade pode parecer pequeno

Trocar de modelo no cliente

  • Alterar o ID do modelo invalida o cache de contexto. Para evitar consumo adicional de tokens e obter a melhor experiência de uso, recomenda-se iniciar uma nova sessão
  • Ao chamar, é preciso inserir um dos seguintes IDs de modelo, não o nome da versão do modelo
    • k3
    • k3-256k
    • kimi-for-coding
    • kimi-for-coding-highspeed
  • Inserir nomes de versão como Kimi K3 ou K2.7 Code faz a chamada falhar
  • Se o Thinking for desativado no K3 ou K2.7, a solicitação será roteada para o K2.6; portanto, para usar K3 ou K2.7 Code, é preciso deixar o Thinking ativado
  • Clientes oficiais

    • No Kimi Code CLI, digite /model para trocar de modelo sem alterar configurações
    • Se o modelo mais recente não aparecer na lista, faça /logout e depois /login para entrar novamente
    • No Kimi Code for VS Code, selecione o modelo no menu suspenso da caixa de entrada
    • Se o modelo não aparecer, reinicie o VS Code ou reinstale a extensão

Configuração de ferramentas de terceiros

  • Depois de criar uma API Key no Kimi Code Console, insira a Base URL e o ID do modelo na ferramenta
  • A Kimi Code API oferece suporte tanto ao protocolo compatível com OpenAI quanto ao protocolo compatível com Anthropic
  • O método de configuração por ferramenta pode ser consultado nos documentos abaixo
    • Claude Code: assistente de codificação em linha de comando da Anthropic
    • OpenCode: agente de codificação baseado em terminal
    • Codex: agente de codificação da OpenAI
  • Configuração de contexto do K3

    • O contexto padrão de algumas ferramentas de terceiros é menor que o máximo do K3, que é 1M
    • Para usar até 1M de contexto, é preciso definir diretamente o campo context-window como 1048576
  • Mapeamento da intensidade de raciocínio do K3

    • O K3 suporta low, high e max, e os valores enviados pela ferramenta são mapeados da seguinte forma
    • null ou undefined: padrão high
    • Outros valores desconhecidos: erro HTTP 400
    • ultra, max, xhigh: max
    • high, medium: nível recomendado high
    • low, minimum, light: low
    • none: thinking.type é desativado

1 comentários

 
GN⁺ 2 시간 전
Comentários do Hacker News
  • O Codex aproveita muito bem 256k de contexto. 1M é folgado, mas ainda caro e parece desnecessário como padrão

  • LLMs estão rapidamente se tornando uma commodity, e o fosso competitivo de laboratórios de IA dos EUA como a OpenAI está enfraquecendo. No fim, quem provavelmente vence são os hiperescaladores e donos de datacenter que conseguem vender tokens baratos

    • Não usei muitos outros produtos, mas o harness do Codex é atraente a ponto de ser difícil trocar. Fico curioso se existe outro lugar oferecendo um harness dessa qualidade
    • Sou profundamente grato às empresas de IA de fronteira que investiram capital enorme e P&D complexo em cada modelo. Já está fácil esquecer quanto custou chegar até este ponto
  • k3-256k foi lançado e oferece os mesmos resultados dentro de 256k de contexto. O k3 (1M) consome cerca de duas vezes mais cota do que o k3-256k

  • É uma boa mudança. Normalmente tento manter o contexto abaixo de 200k

    • No tópico do Reddit sobre essa notícia, a frase exata também é o comentário mais votado
      https://www.reddit.com/r/kimi/s/BFa1TR9vNg
    • Depende do escopo do trabalho, mas eu diria que o ponto ideal é abaixo de 500k. No Claude, com 500 mil tokens, dá para construir um projeto considerável mantendo todo o contexto do início até o momento atual
    • 256k deveria ser suficiente para qualquer um
  • Então fico pensando se todos os usuários passarão a usar o Kimi por metade do preço até o contexto chegar a 256k. Se for verdade, é uma mudança enorme

    • Como é um modelo separado, achei que usar k3-256k e depois trocar para o modelo de 1M ao chegar em 256k invalidaria o cache, fazendo você pagar de novo pelos 256k tokens anteriores no preço do modelo de 1M
      Mas isso está errado, e é possível mudar para o modelo de 1M sem invalidar o cache ao se aproximar do limite de contexto. Na versão atual, trocar de k3-256k para k3 (1M) não afeta o cache
    • Pelo que entendi, não é isso. Parece significar que, com uma janela de contexto menor, há menos tokens de entrada acumulados ao longo do tempo, então no geral fica mais barato
  • Este post foi publicado há 38 minutos, e há 20 minutos vários serviços da Anthropic estão marcados como em grande indisponibilidade. Provavelmente não tem relação, mas achei meio engraçado

  • Parece que o modelo em si é o mesmo, e isso é só uma mudança no nível da API

  • Funcionalmente, é parecido com a forma como a OpenAI muda a faixa de preço ao passar de certo tamanho de contexto. O limite também fica em torno de 272k, ou seja, perto de 2^18 ou 256k
    À medida que o contexto ativo cresce, aumentam a computação necessária por token de saída e o volume de bytes que precisam ser lidos, então faz sentido repassar esse custo ao usuário. Ainda assim, surpreende não usarem uma curva de preço mais suave em vez de um limite em degraus

    • É bem provável que operem duas configurações de infraestrutura conforme o comprimento máximo da sequência, então um limite em degraus não é surpreendente
      A configuração de contexto curto pode ter menos nós dedicados a prefill por instância, não precisa suportar um cache KV tão grande e também pode reduzir o número total de nós. Se usam inferência desagregada, também dá para ajustar separadamente a proporção de computação alocada para prefill e decoding
  • Espero que essa mudança reduza a carga na infraestrutura. Todos os modelos ficaram visivelmente mais lentos recentemente, e a equipe de suporte não está respondendo. Suspeito que estejam processando boa parte das requisições com modelos quantizados

    • Teoria da conspiração sem evidência pode até combinar com o Reddit, mas não com o HN
  • Fico me perguntando se não é um modelo quantizado, mas apenas com a janela de contexto reduzida para 256k

    • A janela de contexto de 256k e ser quantizado ou não são coisas separadas. Como é difícil verificar isso diretamente de fora, também não dá para descartar a possibilidade de de fato estar quantizado