1 pontos por GN⁺ 19 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • A demanda pelo Kimi K3 cresceu muito mais do que o esperado, e o uso de GPUs nas últimas 48 horas se aproximou do limite da capacidade atual
  • Para proteger a experiência dos assinantes existentes, a empresa suspendeu temporariamente novas assinaturas e está priorizando a alocação de recursos de computação para os membros atuais
  • Assinantes pagos existentes não serão afetados, e a Moonshot AI está acelerando a expansão da capacidade de infraestrutura
  • Assim que capacidade adicional for garantida, as novas assinaturas serão retomadas em lotes
  • Além disso, a empresa pretende dividir a assinatura em dois planos dedicados, de acordo com a finalidade de uso
    • Kimi Membership: para Kimi Web, App e Work
    • Kimi Code Membership: para fluxos de trabalho de codificação
  • A medida busca alocar recursos de computação com mais precisão conforme a demanda de cada serviço e manter uma experiência de uso estável

1 comentários

 
Opiniões no Hacker News
  • A frase dizendo que, como a demanda nas últimas 48 horas se aproximou do limite da capacidade atual, eles pausaram temporariamente novas assinaturas para preservar a experiência dos assinantes existentes e priorizaram recursos de computação para membros atuais é realmente muito boa de ver
    É uma empresa que prioriza a satisfação dos clientes existentes em vez do crescimento rápido

    • Quando o GitHub fez exatamente a mesma coisa no passado, muita gente ficou brava, mas foi uma decisão correta tanto naquela época quanto agora
    • Sempre detestei que, em qualquer site, o botão “Login” fosse menor que o “Sign Up”
    • Então a Hetzner também deveria ter suspendido novas inscrições em vez de aumentar preços para ajustar oferta e demanda?
    • Não precisa se empolgar demais. Como as VCs estão despejando enormes quantias em IA, talvez OpenAI ou Anthropic estejam financiando dispositivos de consumo de tokens para destilar datasets
  • Ontem esgotei meu uso do Claude e paguei pelo plano de 20 dólares para testar o Kimi. No Kimi Code, escolhi o K3 e pedi que encontrasse todas as configurações relacionadas a hardware, entrada/saída, controle de threads e rede no repositório e escrevesse um relatório; depois de pensar por 12 minutos, ele respondeu que eu tinha usado toda a cota diária
    No dia seguinte, o Fable terminou a mesma tarefa em 3 minutos, então, se for usar o K3, é melhor não comprar o plano de 20 dólares

    • O Codex, mesmo ao atingir o limite, continua raciocinando e depois responde à solicitação
    • Talvez meu ambiente seja diferente porque uso apenas modelos totalmente auto-hospedados, mas fico curioso se esperar 12 minutos sem nenhum feedback é comum em fluxos de trabalho reais. Eu fico acompanhando o caminho que o modelo está tomando e, se ele vai para um beco sem saída, interrompo ou corrijo a direção
    • Passei exatamente pela mesma coisa. Paguei anualmente pelo plano de 20 dólares por mês do Kimi.com e enviei uma solicitação simples ao Kimi K2.7 via API no OpenCode, mas isso consumiu toda a cota de 5 horas, enquanto o Cursor concluiu a mesma solicitação em poucos minutos
      Na interface web, também usei 23% da cota semanal, enquanto no Cursor de 20 dólares por mês já fiz muito mais trabalho sem sequer receber um alerta. No começo achei que fosse problema do OpenCode, mas, se aconteceu igual no Kimi Code, parece que não
    • Alguns dias atrás, no Claude, uma tarefa relativamente simples também consumiu toda a cota de 5 horas sem produzir uma resposta, dando a sensação de tempo totalmente desperdiçado
    • Fico curioso sobre o tamanho da aplicação-alvo. Depende se é um app de tarefas em Node.js que usa arquivos de texto como banco de dados ou 1 milhão de linhas de código espaguete em COBOL criado em 1971
  • O que é especialmente interessante no Kimi é que ele tem 3 vezes mais camadas de RNN/atenção linear do que camadas de atenção completa. Ainda não usei, mas parece uma arquitetura muito razoável para tarefas com contexto longo
    O motivo de ter muitos parâmetros parece o mesmo de o xLSTM otimizado para computação ter muitos parâmetros, e, vendo o sucesso deste modelo, é uma pena que não tenham desenvolvido na Europa um modelo gigantesco da família xLSTM. Como é uma equipe pragmática que escolhe o que funciona bem nas avaliações internas, eles também mantiveram camadas de atenção comuns, e não dá para garantir que até a implementação seja ideal, mas o Kimi mostra o que poderia ter sido possível se um supercomputador para treinar LLMs em larga escala tivesse sido entregue aos pesquisadores certos. No fim, em grande parte é RNN, área do Hochreiter

    • Um dos objetivos originais da arquitetura Transformer não era eliminar RNNs, que não podem ser paralelizadas? Não sou especialista, só li alguns artigos alguns anos atrás
    • Cerca de um ano e meio atrás eu disse ao Hochreiter que ele não deveria ficar em experimentos com bilhões de parâmetros e precisava escalar o xLSTM para o tamanho de LLM, mas ele parecia achar que era tarde demais para conseguir investimento e atenção. É uma pena que a ambição da Europa seja desse tamanho
    • Eu estava curioso se era RNN, um modelo de espaço de estados como Qwen ou Mamba, ou algo mais próximo de RWKV; ao verificar, vi que é semelhante ao Linear DeltaNet usado pelo Qwen
  • Tenho usado o Kimi para tarefas de programação há cerca de 6 meses e fiquei satisfeito, então não voltei para outros modelos. De vez em quando testo a mesma tarefa no Claude para ver se não estou perdendo nada
    Uso o OpenRouter e, como meu escopo de uso de LLMs é estreito, a diferença de custo é desprezível em qualquer direção

    • Fico curioso sobre qual plano é. Pela minha experiência, tanto o plano de 20 dólares por mês do Kimi quanto o plano de 30 dólares por mês do Qwen foram muito insuficientes para usar como ferramenta principal, mas por causa do K3 estou com vontade de testar os planos de 49 ou 99 dólares por mês
  • É revigorante que tenham suspendido novas assinaturas em vez de simplesmente reduzir limites em silêncio, como o Google, torcendo para que os usuários não percebam que o valor da assinatura caiu
    O Gemini Apps declara que pode alterar limites sem aviso para manter a qualidade em caso de restrições de capacidade ou picos de atividade: https://support.google.com/gemini/answer/16275805

  • Em avaliações de programação de jogos multiagente, modelos chineses geralmente são fracos em inferência de tiro único, mas compensam isso com uso de ferramentas e melhorias iterativas. O Kimi K3 também ficou em 19º em programação de tiro único, mas, em programação agêntica com ambiente de execução, ferramentas e várias chamadas, ficou em 3º; considerando submissões médias, apenas Sol e Fable ficaram à frente
    Para engenheiros de software, programação agêntica é o mais relevante, mas velocidade também importa, e no momento isso se torna um problema real de usabilidade para o Kimi. Provedores externos de inferência como a Fireworks já reduziram essa lacuna em modelos anteriores. É interessante ver a tendência de modelos de fronteira com pesos abertos se consolidando como padrão, e competir apenas por ter um modelo de fronteira ficará cada vez mais difícil
    Dados: https://gertlabs.com/rankings?mode=agentic_coding

  • A qualidade deste modelo supera as expectativas e ele é especialmente bom em revisão de código e revisão de PRs. Porém, por causa da demanda excessiva e do grande tamanho do modelo, agora está lento demais e demora muito até para revisões de código relativamente simples

    • O Kimi K3 agora apareceu na tabela de preços do opencode-go, então parece significar que já dá para usá-lo, mas ainda não confirmei. No Zen não tem
    • Vale a pena experimentar a rota via OpenRouter: https://openrouter.ai/moonshotai/kimi-k3
  • Fico curioso se essa febre do Kimi é um aumento líquido pelo paradoxo de Jevons, em que oferta abundante leva a mais consumo, ou se é simplesmente uma migração para um modelo mais barato
    Também gostaria de saber se existe uma boa fonte para verificar o consumo total de tokens abrangendo vários laboratórios e o OpenRouter

    • Se fosse uma migração para modelos baratos, teria ido para o DeepSeek v4 Flash. O Kimi mais recente é mais caro do que a maioria dos outros modelos chineses, então parece mais um efeito de seguir a moda do tipo “o novo modelo é realmente bom, experimente”. A questão é quanto ele vai resistir a uma validação cuidadosa, e os laboratórios dos EUA devem estar bem tensos
  • Fico curioso se Anthropic e OpenAI continuarão competitivas simplesmente por serem, por enquanto, as únicas capazes de lidar com esse nível de demanda. Se interrupções desperdiçam o tempo dos funcionários quando os custos já são altos, clientes corporativos não vão gostar

    • No trabalho vejo a mesma tendência. O software em si é barato, mas, por causa da especialização em hospedagem e da responsabilidade pelo uptime, as implantações reais ainda se concentram em alguns poucos provedores. Dito isso, também estão surgindo muitas ferramentas de produtividade de vibe coding que rodam em notebooks pessoais
    • A Anthropic também, há apenas alguns meses, incomodou usuários por causa de problemas de demanda, separando uso em horários de pico e fora de pico, e tinha quedas frequentes. Depois de fechar contrato com a xAI, ficou em geral estável, e a Moonshot também está negociando contratos de recursos de computação agora
    • Uma parte considerável dos recursos de computação da OpenAI e da Anthropic na verdade pertence a hyperscalers. Elas podem adicionar margem ao acesso aos recursos garantidos por contratos de longo prazo, mas isso provavelmente não vai durar, já que hyperscalers podem oferecer preços mais baixos
    • Como o Kimi é um modelo de pesos abertos, provedores de hospedagem além da Moonshot devem surgir rapidamente, e esse problema não deve ser um grande obstáculo à adoção de pesos abertos
    • Uso a Synthetic e entendo que eles planejam hospedar o Kimi3. Modelos abertos permitem distribuir a inferência
  • Parece que suspenderam as assinaturas por julgarem que talvez não conseguissem garantir aos clientes uma qualidade mínima de serviço

    • Mais exatamente, eles pausaram temporariamente apenas novas assinaturas e priorizaram recursos de computação para membros existentes