- A demanda pelo Kimi K3 cresceu muito mais do que o esperado, e o uso de GPUs nas últimas 48 horas se aproximou do limite da capacidade atual
- Para proteger a experiência dos assinantes existentes, a empresa suspendeu temporariamente novas assinaturas e está priorizando a alocação de recursos de computação para os membros atuais
- Assinantes pagos existentes não serão afetados, e a Moonshot AI está acelerando a expansão da capacidade de infraestrutura
- Assim que capacidade adicional for garantida, as novas assinaturas serão retomadas em lotes
- Além disso, a empresa pretende dividir a assinatura em dois planos dedicados, de acordo com a finalidade de uso
- Kimi Membership: para Kimi Web, App e Work
- Kimi Code Membership: para fluxos de trabalho de codificação
- A medida busca alocar recursos de computação com mais precisão conforme a demanda de cada serviço e manter uma experiência de uso estável
1 comentários
Opiniões no Hacker News
A frase dizendo que, como a demanda nas últimas 48 horas se aproximou do limite da capacidade atual, eles pausaram temporariamente novas assinaturas para preservar a experiência dos assinantes existentes e priorizaram recursos de computação para membros atuais é realmente muito boa de ver
É uma empresa que prioriza a satisfação dos clientes existentes em vez do crescimento rápido
Ontem esgotei meu uso do Claude e paguei pelo plano de 20 dólares para testar o Kimi. No Kimi Code, escolhi o K3 e pedi que encontrasse todas as configurações relacionadas a hardware, entrada/saída, controle de threads e rede no repositório e escrevesse um relatório; depois de pensar por 12 minutos, ele respondeu que eu tinha usado toda a cota diária
No dia seguinte, o Fable terminou a mesma tarefa em 3 minutos, então, se for usar o K3, é melhor não comprar o plano de 20 dólares
Na interface web, também usei 23% da cota semanal, enquanto no Cursor de 20 dólares por mês já fiz muito mais trabalho sem sequer receber um alerta. No começo achei que fosse problema do OpenCode, mas, se aconteceu igual no Kimi Code, parece que não
O que é especialmente interessante no Kimi é que ele tem 3 vezes mais camadas de RNN/atenção linear do que camadas de atenção completa. Ainda não usei, mas parece uma arquitetura muito razoável para tarefas com contexto longo
O motivo de ter muitos parâmetros parece o mesmo de o xLSTM otimizado para computação ter muitos parâmetros, e, vendo o sucesso deste modelo, é uma pena que não tenham desenvolvido na Europa um modelo gigantesco da família xLSTM. Como é uma equipe pragmática que escolhe o que funciona bem nas avaliações internas, eles também mantiveram camadas de atenção comuns, e não dá para garantir que até a implementação seja ideal, mas o Kimi mostra o que poderia ter sido possível se um supercomputador para treinar LLMs em larga escala tivesse sido entregue aos pesquisadores certos. No fim, em grande parte é RNN, área do Hochreiter
Tenho usado o Kimi para tarefas de programação há cerca de 6 meses e fiquei satisfeito, então não voltei para outros modelos. De vez em quando testo a mesma tarefa no Claude para ver se não estou perdendo nada
Uso o OpenRouter e, como meu escopo de uso de LLMs é estreito, a diferença de custo é desprezível em qualquer direção
É revigorante que tenham suspendido novas assinaturas em vez de simplesmente reduzir limites em silêncio, como o Google, torcendo para que os usuários não percebam que o valor da assinatura caiu
O Gemini Apps declara que pode alterar limites sem aviso para manter a qualidade em caso de restrições de capacidade ou picos de atividade: https://support.google.com/gemini/answer/16275805
Em avaliações de programação de jogos multiagente, modelos chineses geralmente são fracos em inferência de tiro único, mas compensam isso com uso de ferramentas e melhorias iterativas. O Kimi K3 também ficou em 19º em programação de tiro único, mas, em programação agêntica com ambiente de execução, ferramentas e várias chamadas, ficou em 3º; considerando submissões médias, apenas Sol e Fable ficaram à frente
Para engenheiros de software, programação agêntica é o mais relevante, mas velocidade também importa, e no momento isso se torna um problema real de usabilidade para o Kimi. Provedores externos de inferência como a Fireworks já reduziram essa lacuna em modelos anteriores. É interessante ver a tendência de modelos de fronteira com pesos abertos se consolidando como padrão, e competir apenas por ter um modelo de fronteira ficará cada vez mais difícil
Dados: https://gertlabs.com/rankings?mode=agentic_coding
A qualidade deste modelo supera as expectativas e ele é especialmente bom em revisão de código e revisão de PRs. Porém, por causa da demanda excessiva e do grande tamanho do modelo, agora está lento demais e demora muito até para revisões de código relativamente simples
Fico curioso se essa febre do Kimi é um aumento líquido pelo paradoxo de Jevons, em que oferta abundante leva a mais consumo, ou se é simplesmente uma migração para um modelo mais barato
Também gostaria de saber se existe uma boa fonte para verificar o consumo total de tokens abrangendo vários laboratórios e o OpenRouter
Fico curioso se Anthropic e OpenAI continuarão competitivas simplesmente por serem, por enquanto, as únicas capazes de lidar com esse nível de demanda. Se interrupções desperdiçam o tempo dos funcionários quando os custos já são altos, clientes corporativos não vão gostar
Parece que suspenderam as assinaturas por julgarem que talvez não conseguissem garantir aos clientes uma qualidade mínima de serviço