2 pontos por GN⁺ 1 일 전 | 1 comentários | Compartilhar no WhatsApp
  • Ao usar Kimi K3 e Claude em paralelo em tarefas cotidianas de programação, foi difícil distinguir diferenças reais na qualidade da saída e na quantidade de tokens necessária para as respostas
  • A API do Kimi K3 custa US$ 3 por 1 milhão de tokens de entrada e US$ 15 por 1 milhão de tokens de saída, bem mais barato que os modelos topo de linha do Claude, que custam US$ 10 e US$ 50, respectivamente
  • O Kimi começa em US$ 19 por mês, e o plano de codificação de US$ 39/mês também é generoso, enquanto no Claude o limite de uso se esgota rapidamente durante trabalhos com agentes, e o plano de US$ 20/mês nem manteve o acesso ao Fable
  • No benchmark de cibersegurança da Semgrep, enquanto o Claude limitado recusou algumas tarefas, o GLM 5.2 as executou e ficou à frente; ele foi lançado sob licença MIT e é mais barato que o Opus mais recente
  • Restrições aplicadas apenas a modelos dos EUA apenas reduzem as opções dos clientes americanos, sem impedir a concorrência de modelos abertos estrangeiros; com qualidade semelhante e preço menor, há cada vez menos motivos para continuar pagando pelo Claude em vez do Kimi K3

Comparação de qualidade e preço entre Kimi K3 e Claude

  • Ao usar o Kimi K3 junto com o Claude em tarefas comuns de programação, ele apresentou as mesmas tarefas e qualidade de saída, com uso de tokens quase idêntico
    • Isso contrariou a expectativa de que modelos abertos produziriam resultados mais desleixados ou usariam mais tokens para chegar à mesma resposta
  • O preço da API do Kimi K3 é de US$ 3 por 1 milhão de tokens de entrada e US$ 15 por 1 milhão de tokens de saída
    • Os modelos topo de linha do Claude custam US$ 10 e US$ 50 nas mesmas unidades, respectivamente
  • Os planos pagos do Kimi começam em US$ 19 por mês, e o plano de codificação de US$ 39/mês oferece mais uso que produtos do Claude em faixa de preço semelhante
    • Os planos do Claude têm limites de uso rígidos, e em um dia comum de trabalho com agentes é possível esgotar a cota antes do almoço
    • O Claude não conseguiu manter o acesso ao Fable no plano de US$ 20/mês, então ele foi desligado e substituído pelo Opus, mas os planos do Kimi não têm a mesma condição

Política de IA dos EUA e concorrência de modelos abertos

  • Enquanto o governo dos EUA atrasou o lançamento do Fable e o modelo final recebeu restrições que recusam várias categorias de tarefas, modelos abertos de nível frontier de laboratórios chineses podem ser baixados e ficam fora do alcance regulatório do governo americano
  • No benchmark de cibersegurança da Semgrep, o GLM 5.2 superou o Claude
    • O modelo limitado recusou tarefas, enquanto o modelo aberto as executou, e essa diferença afetou os resultados
  • O GLM 5.2 foi lançado sob licença MIT e, embora não se apresente como um modelo frontier, entrega resultados melhores que o Opus mais recente em trabalhos reais e custa muito menos
  • O GPT-5.6 da OpenAI também passou pelo processo de restrições governamentais, mas a OpenAI tem mais margem que a Anthropic por conseguir oferecer seu modelo principal no plano de US$ 20/mês
  • No futuro, o governo dos EUA pode aplicar à IA e ao open source a abordagem de subsídios, resgates e tarifas protecionistas que usou na indústria automobilística
    • Uma parceria público-privada poderia apoiar modelos nacionais usados apenas dentro dos EUA e incapazes de competir internacionalmente
    • Como resultado, usuários americanos podem ser obrigados a comprar modelos nacionais em vez dos de melhor qualidade ou menor preço, sem acesso ao melhor modelo pelo melhor preço

1 comentários

 
GN⁺ 1 일 전
Opiniões no Hacker News
  • Quer tenham chegado a desempenho equivalente por destilação ou desenvolvido tudo de forma independente desde o início, o desfecho dos laboratórios de ponta dos EUA já estava definido desde o começo. Destilação não é um ataque, e os laboratórios de ponta também destilaram nos modelos o conhecimento escrito pela humanidade, então é um caminho natural que laboratórios que vieram depois comprimam isso em modelos mais baratos
    Como também não há, na prática, uma forma de impedir que conversas sejam armazenadas e usadas para treinar modelos próprios, parece melhor investir em empresas de hardware do que em empresas de modelos

    • Dizer que isso era tão óbvio é quase uma revisão histórica retrospectiva. Destilação ainda é uma área de pesquisa ativa, e o fato de hoje ser possível destilar modelos com tanta facilidade é um resultado interessante, não algo tido como certo há 12 meses
      Até apenas 6 meses atrás, havia muitas previsões de que usar saídas de modelos como dados de treinamento levaria todos os modelos ao fracasso por uma catástrofe de treinamento recursivo; portanto, não dá para falar como se isso fosse evidente desde o início
    • Concordo fortemente com a premissa de que destilação não é um ataque, mas o K3 não é uma versão destilada do Fable ou do Sol. O Fable foi aberto há pouco tempo e o Sol acabou de ser lançado; nas avaliações de usuários da Arena, o K3 supera os dois em algumas áreas
      A destilação via API é útil mais para superar rapidamente o cold start em aprendizado por reforço em novos domínios; na prática, o que importa mais é a qualidade e a diversidade dos ambientes de aprendizado por reforço nos quais o modelo aprende
    • O impacto dos ataques de destilação parece um tanto exagerado. Hoje, a maior parte dos dados de fine-tuning é sintética, e, como não dá para simplesmente repetir o mesmo conteúdo, isso se parece mais com fazer outro LLM escrever um material didático que explique um tema em detalhes, sem deixar lacunas
    • Quase todos os mercados dependem de algum tipo de regulação, indo de “só proibir roubo e liberar o resto” até exigir uma regulação enorme para todas as aquisições
      Os EUA ainda não adotaram um controle ao estilo chinês sobre terras raras, mas, se a destilação se disseminar, há grande chance de que até quem não faça isso acabe arcando com custos regulatórios, como bloqueio de acesso ou controles excessivos. Assim como houve tolerância com a cópia de música e indignação nas artes visuais, decidir se isso é roubo ou uma prática comercial normal dependerá, no fim, de consenso social; sem um grande avanço, a distância deve diminuir
    • A Anthropic dificulta até rolar para conversas antigas ou verificar tokens de raciocínio e subagentes. É como se quisesse que todos continuassem voltando ao seu próprio serviço, sem aprender a cavar o próprio poço
  • Chegamos a este ponto muito mais rápido do que eu esperava. Fico imaginando como seria um mundo em que governos ocidentais classificassem o acesso a modelos de ponta com pesos abertos como risco à segurança nacional e o uso deles como ato terrorista
    O Kimi K3 poderia virar algo como o Napster, que todo mundo usava sabendo que era ilegal, ou poderia surgir um mercado clandestino ao estilo da maconha, com alguém do bairro alugando por medição um equipamento 8×5090 no porão montado com peças do eBay. Por outro lado, se o controle der certo, as opções abertas seriam apenas Cohere e Mistral enfraquecidos, e talvez fosse preciso pagar caro pelos modelos “American Frontier” da Anthropic e da OpenAI, que ficam atrás da China
    Como o Kindle Fire subsidiado por anúncios, também poderia surgir uma Kindle AI vendendo influência ao maior lance, com propaganda de empresas de tabaco entrando no pipeline de treinamento e o LLM dizendo que fumar faz bem à saúde

    • Seria como uma nova cortina de ferro, com o mundo dividido em blocos digitais. Quanto mais tempo durar a interrupção do intercâmbio, maior a chance de a internet aberta e a ciência se separarem em ecossistemas incompatíveis
      O governo dos EUA recentemente anunciou restrições semelhantes à Wolf Amendment para cooperação científica da NSF e transferiu a jurisdição para o lado militar; ao mesmo tempo, tenta atrair vários países para uma Pax Silica destinada a excluir a China e impor aos aliados produtos nacionais com funcionalidade limitada. Talvez ainda restem zonas neutras, como Suíça ou Singapura, onde usuários dos EUA e da UE possam usar o que está além da cortina sem consequências legais
      https://nitter.net/RnaudBertrand/status/2069574934972797089
    • O desaparecimento das máquinas Mac Studio com muita RAM provavelmente foi coincidência
    • Tornar modelos open source ilegais só prejudicaria empresas americanas. O resto do mundo continuaria usando open source e ganharia oportunidades de arbitragem contra empresas dos EUA
    • Fico curioso se “governos ocidentais” quer dizer especificamente os EUA. Não está claro por que outros países, que não se preocupam com a China tanto quanto os EUA, teriam motivo para se preocupar da mesma forma com essa questão
    • Mesmo 8×RTX Pro 6000 têm apenas 768 GB de VRAM, então não sei como rodariam o K3
  • Entreguei ao Kimi K3 uma tarefa que costumo testar com todos os modelos, e ele ficou pensando por muito mais tempo, consumindo quase todo o uso de 5 horas do plano de US$ 19. Ao executar a mesma tarefa no plano de US$ 20 da OpenAI, levou apenas alguns minutos e o uso quase não diminuiu
    Como limites de assinatura não oferecem um número comparável como tokens, é difícil medir, mas foi a primeira assinatura na faixa de US$ 20 que vi ser tão apertada a ponto de uma tarefa trivial acabar com o uso disponível para trabalho real. Parecia lento e caro por tarefa, mas encontrou o bug que o Gemini 3.5 Flash inventou por conta própria

    • O Kimi tende a duvidar continuamente de si mesmo e pensar por tempo demais. Ele consome muitos tokens repetindo parágrafos do tipo “espere, na verdade...” por causa de um pequeno detalhe
      Quando pedi ao GLM 5.2 para portar cerca de 50 linhas de JavaScript para Python, ele também repetiu buscas na web e revisões, gastando US$ 0,25 em custos de API; a primeira execução falhou, mas na segunda funcionou. Claude Code/Fable foi muito mais rápido, mas cometeu o mesmo erro, e espero que a autorrevisão excessiva dos modelos abertos diminua ou que a forma de fazer prompts melhore
    • É preciso parar de usar o preço por milhão de tokens como referência. Como a quantidade real de tokens usados tem impacto maior no custo do que o preço anunciado por token, o que importa é a curva de custo por tarefa em relação à inteligência
      Os modelos chineses ainda não chegam a esse critério e parecem focados em maximizar pontuações em benchmarks, mais do que em eficiência
    • Atualmente, o Kimi K3 só oferece intensidade de raciocínio em max, mas outros níveis devem ser disponibilizados em breve. Nos registros de rastreamento dos benchmarks, havia muitos retornos e incertezas como “espere, mas...”, e algo parecido também aparecia no xhigh e no max do GPT 5.6 e do Fable, embora em menor grau
      Quando intensidades de raciocínio mais baixas forem suportadas, há chance de melhorar a ineficiência de tokens
      https://platform.kimi.ai/docs/guide/use-thinking-effort
    • Ao encarregar o Claude Code/Fable de implementar um recurso, ele usou cerca de 30% de uma sessão de 5 horas da assinatura de 100 euros em aproximadamente 60 minutos. Depois, em uma sessão limpa em outro terminal, executei apenas /code-review, sem alterações no código, e o uso disparou para 99%; com o 1% restante, ele nem conseguiu escrever o review.md
      Normalmente a revisão usa 10% a 20%, mas às vezes 65% a 69% desaparecem em 15 minutos, então a variação de uso é enorme
    • O preço das assinaturas de IA é esquisito. O uso varia de modelo para modelo, é medido por tokens opacos que a interface do provedor ou o modelo consome arbitrariamente, e ainda por cima há limites opacos de janelas de tempo
  • No plano pago do Kimi, o comprimento de contexto de 1 milhão de tokens só é oferecido a partir de US$ 79 por mês; abaixo disso, o limite é de 256 mil tokens. No plano mais barato, de US$ 15 por mês com desconto de pagamento anual, o K3 em si não é suportado no momento
    https://www.kimi.com/code/docs/en/kimi-code/models.html

    • Eu queria usar só a API, mas no DeepSeek a combinação das ferramentas Reasonix/whale com uma alta taxa de acerto de cache deixa tudo praticamente de graça, então não parece fácil migrar para outro serviço
  • Vejo justamente o contrário. O Kimi K3 tem 2,8 trilhões de parâmetros; o tamanho do ChatGPT 5.6 e do Opus 4.8 não foi divulgado, mas é provável que seja parecido, e há rumores de que Fable e Mythos tenham cerca de 10 trilhões
    Os preços de entrada e saída por milhão de tokens são US$ 3 e US$ 15 no K3, US$ 5 e US$ 30 no ChatGPT 5.6 Sol, e US$ 5 e US$ 25 no Opus 4.8, então a diferença não é grande. Em vez de um ponto de virada histórico, parece mais que os concorrentes estão convergindo para o mesmo desempenho e vendendo um pouco mais barato. Os pesos atuais do K3 também são fechados, então não parece que a situação vá mudar

    • Segundo o anúncio oficial, os pesos completos do modelo devem ser divulgados até 27 de julho de 2026
    • Considerando ainda que a OpenAI removeu o limite de 5 horas e reiniciou com frequência os limites semanais, fica a dúvida se o Kimi é realmente mais barato também no preço efetivo
  • Mesmo nesta thread, a utilidade real do Kimi divide opiniões. Pessoalmente, acho que fica abaixo do Fable e do 5.6 Sol, mas o centro da discussão parece estar mais na reação às medidas regulatórias do governo dos EUA do que no desempenho
    A raiva e a frustração com a situação atual também parecem alimentar uma vontade de que o Kimi seja melhor

    • O K3 é bastante bom e eu o colocaria entre o Sol e o Fable. A capacidade de design de UI do Sol não impressiona, mas o K3 é forte nessa área, enquanto o Fable entrega o desempenho mais rápido e consistente no geral
      Depende muito do tipo de tarefa e da forma de uso, mas a avaliação de que o K3 não está no mesmo nível dos modelos de ponta dos EUA não bate com minha experiência de uso
    • Parece uma repetição do DeepSeek. Quando o v3 saiu, choveram avaliações dizendo que as empresas americanas tinham acabado, mas no fim tudo continuou como antes
    • Ouvi inúmeras vezes que os modelos de fronteira estavam mais de 6 meses à frente dos modelos de pesos abertos, mas isso agora deixou de ser verdade. Portanto, os critérios de avaliação estão mudando
    • Como é difícil aceitar o que o governo dos EUA fez este ano em relação à IA, dá para entender esse tipo de reação
  • Aqui é preciso esclarecer se “Claude” se refere ao Opus ou ao Fable, e em que nível estava a intensidade de raciocínio

    • Quando alguém diz que não percebe diferença em “tarefas rotineiras de programação”, isso soa como se tivesse delegado tarefas que não entende bem o suficiente para distinguir os resultados
    • A comparação foi entre Fable High e K3 High, e o principal uso foi desenvolvimento de jogos. Foram delegadas correções de bugs visuais ambíguos, mudanças na aparência de cenas ou modelos, adição de recursos grandes etc.
      A formulação original foi imprecisa; não uso Fable nem K3 na maior parte do tempo e normalmente faço tarefas de escopo pequeno, depois reviso pessoalmente
  • A política de privacidade também não é um problema pequeno. Ao usar uma assinatura do Kimi, eles dizem que usam as interações para treinar o modelo, e que só não fazem isso quando você usa diretamente a API com preços de API. Se dá para confiar nisso é outra questão
    Pretendo esperar até que outros provedores apareçam no OpenRouter e então avaliar a confiabilidade. Mesmo que eu não confie muito neles, se forem provedores que não treinam modelos diretamente, a chance de os dados serem usados em treinamento é menor

    • Esse tipo de preocupação parece cada vez mais ridícula. A maior parte das entradas é apenas saída gerada anteriormente pelo mesmo modelo e instruções humanas escritas de qualquer jeito, como “corrija sem erros”, então, se os modelos futuros melhorarem, não vejo problema em usar isso para treinamento
      99% dos usuários não lidam com propriedade intelectual especial que valha a preocupação
    • Mesmo que todos os usuários hobby usem modelos de pesos abertos, o mercado corporativo de retenção zero de dados ainda dará oportunidades de negócio suficientes para empresas americanas
    • Essa política é motivo para não usar o serviço. Pretendo esperar até surgirem serviços de provedores independentes, viabilizados pelos pesos abertos
  • Até agora, no fim, tudo também era destilação. Como Suhail disse, é preciso levar o lucro dos modelos de IA a quase zero
    Como foram treinados com dados da humanidade, deveriam ser um presente para a própria humanidade, pois só assim se pode impedir que uma minoria controle a humanidade

    • É ridículo ainda ver os grandes modelos chineses apenas como “versões destiladas”. Muita gente ainda não percebeu a onda que vai atingir os laboratórios de fronteira dos EUA, que usavam uma quantidade enorme de dados enquanto tentavam prender usuários a modelos censurados e com desempenho limitado
  • Modelos open source já chegaram ao nível dos melhores modelos comerciais. O último gargalo é o hardware, mas essa barreira também está caindo rapidamente
    Rodar o Kimi K3 em casa ainda é muito caro, mas já há muitos modelos gratuitos competentes que rodam em hardware razoável, e essa tendência vai continuar