- Ao usar Kimi K3 e Claude em paralelo em tarefas cotidianas de programação, foi difícil distinguir diferenças reais na qualidade da saída e na quantidade de tokens necessária para as respostas
- A API do Kimi K3 custa US$ 3 por 1 milhão de tokens de entrada e US$ 15 por 1 milhão de tokens de saída, bem mais barato que os modelos topo de linha do Claude, que custam US$ 10 e US$ 50, respectivamente
- O Kimi começa em US$ 19 por mês, e o plano de codificação de US$ 39/mês também é generoso, enquanto no Claude o limite de uso se esgota rapidamente durante trabalhos com agentes, e o plano de US$ 20/mês nem manteve o acesso ao Fable
- No benchmark de cibersegurança da Semgrep, enquanto o Claude limitado recusou algumas tarefas, o GLM 5.2 as executou e ficou à frente; ele foi lançado sob licença MIT e é mais barato que o Opus mais recente
- Restrições aplicadas apenas a modelos dos EUA apenas reduzem as opções dos clientes americanos, sem impedir a concorrência de modelos abertos estrangeiros; com qualidade semelhante e preço menor, há cada vez menos motivos para continuar pagando pelo Claude em vez do Kimi K3
Comparação de qualidade e preço entre Kimi K3 e Claude
- Ao usar o Kimi K3 junto com o Claude em tarefas comuns de programação, ele apresentou as mesmas tarefas e qualidade de saída, com uso de tokens quase idêntico
- Isso contrariou a expectativa de que modelos abertos produziriam resultados mais desleixados ou usariam mais tokens para chegar à mesma resposta
- O preço da API do Kimi K3 é de US$ 3 por 1 milhão de tokens de entrada e US$ 15 por 1 milhão de tokens de saída
- Os modelos topo de linha do Claude custam US$ 10 e US$ 50 nas mesmas unidades, respectivamente
- Os planos pagos do Kimi começam em US$ 19 por mês, e o plano de codificação de US$ 39/mês oferece mais uso que produtos do Claude em faixa de preço semelhante
- Os planos do Claude têm limites de uso rígidos, e em um dia comum de trabalho com agentes é possível esgotar a cota antes do almoço
- O Claude não conseguiu manter o acesso ao Fable no plano de US$ 20/mês, então ele foi desligado e substituído pelo Opus, mas os planos do Kimi não têm a mesma condição
Política de IA dos EUA e concorrência de modelos abertos
- Enquanto o governo dos EUA atrasou o lançamento do Fable e o modelo final recebeu restrições que recusam várias categorias de tarefas, modelos abertos de nível frontier de laboratórios chineses podem ser baixados e ficam fora do alcance regulatório do governo americano
- No benchmark de cibersegurança da Semgrep, o GLM 5.2 superou o Claude
- O modelo limitado recusou tarefas, enquanto o modelo aberto as executou, e essa diferença afetou os resultados
- O GLM 5.2 foi lançado sob licença MIT e, embora não se apresente como um modelo frontier, entrega resultados melhores que o Opus mais recente em trabalhos reais e custa muito menos
- O GPT-5.6 da OpenAI também passou pelo processo de restrições governamentais, mas a OpenAI tem mais margem que a Anthropic por conseguir oferecer seu modelo principal no plano de US$ 20/mês
- No futuro, o governo dos EUA pode aplicar à IA e ao open source a abordagem de subsídios, resgates e tarifas protecionistas que usou na indústria automobilística
- Uma parceria público-privada poderia apoiar modelos nacionais usados apenas dentro dos EUA e incapazes de competir internacionalmente
- Como resultado, usuários americanos podem ser obrigados a comprar modelos nacionais em vez dos de melhor qualidade ou menor preço, sem acesso ao melhor modelo pelo melhor preço
1 comentários
Opiniões no Hacker News
Quer tenham chegado a desempenho equivalente por destilação ou desenvolvido tudo de forma independente desde o início, o desfecho dos laboratórios de ponta dos EUA já estava definido desde o começo. Destilação não é um ataque, e os laboratórios de ponta também destilaram nos modelos o conhecimento escrito pela humanidade, então é um caminho natural que laboratórios que vieram depois comprimam isso em modelos mais baratos
Como também não há, na prática, uma forma de impedir que conversas sejam armazenadas e usadas para treinar modelos próprios, parece melhor investir em empresas de hardware do que em empresas de modelos
Até apenas 6 meses atrás, havia muitas previsões de que usar saídas de modelos como dados de treinamento levaria todos os modelos ao fracasso por uma catástrofe de treinamento recursivo; portanto, não dá para falar como se isso fosse evidente desde o início
A destilação via API é útil mais para superar rapidamente o cold start em aprendizado por reforço em novos domínios; na prática, o que importa mais é a qualidade e a diversidade dos ambientes de aprendizado por reforço nos quais o modelo aprende
Os EUA ainda não adotaram um controle ao estilo chinês sobre terras raras, mas, se a destilação se disseminar, há grande chance de que até quem não faça isso acabe arcando com custos regulatórios, como bloqueio de acesso ou controles excessivos. Assim como houve tolerância com a cópia de música e indignação nas artes visuais, decidir se isso é roubo ou uma prática comercial normal dependerá, no fim, de consenso social; sem um grande avanço, a distância deve diminuir
Chegamos a este ponto muito mais rápido do que eu esperava. Fico imaginando como seria um mundo em que governos ocidentais classificassem o acesso a modelos de ponta com pesos abertos como risco à segurança nacional e o uso deles como ato terrorista
O Kimi K3 poderia virar algo como o Napster, que todo mundo usava sabendo que era ilegal, ou poderia surgir um mercado clandestino ao estilo da maconha, com alguém do bairro alugando por medição um equipamento 8×5090 no porão montado com peças do eBay. Por outro lado, se o controle der certo, as opções abertas seriam apenas Cohere e Mistral enfraquecidos, e talvez fosse preciso pagar caro pelos modelos “American Frontier” da Anthropic e da OpenAI, que ficam atrás da China
Como o Kindle Fire subsidiado por anúncios, também poderia surgir uma Kindle AI vendendo influência ao maior lance, com propaganda de empresas de tabaco entrando no pipeline de treinamento e o LLM dizendo que fumar faz bem à saúde
O governo dos EUA recentemente anunciou restrições semelhantes à Wolf Amendment para cooperação científica da NSF e transferiu a jurisdição para o lado militar; ao mesmo tempo, tenta atrair vários países para uma Pax Silica destinada a excluir a China e impor aos aliados produtos nacionais com funcionalidade limitada. Talvez ainda restem zonas neutras, como Suíça ou Singapura, onde usuários dos EUA e da UE possam usar o que está além da cortina sem consequências legais
https://nitter.net/RnaudBertrand/status/2069574934972797089
Entreguei ao Kimi K3 uma tarefa que costumo testar com todos os modelos, e ele ficou pensando por muito mais tempo, consumindo quase todo o uso de 5 horas do plano de US$ 19. Ao executar a mesma tarefa no plano de US$ 20 da OpenAI, levou apenas alguns minutos e o uso quase não diminuiu
Como limites de assinatura não oferecem um número comparável como tokens, é difícil medir, mas foi a primeira assinatura na faixa de US$ 20 que vi ser tão apertada a ponto de uma tarefa trivial acabar com o uso disponível para trabalho real. Parecia lento e caro por tarefa, mas encontrou o bug que o Gemini 3.5 Flash inventou por conta própria
Quando pedi ao GLM 5.2 para portar cerca de 50 linhas de JavaScript para Python, ele também repetiu buscas na web e revisões, gastando US$ 0,25 em custos de API; a primeira execução falhou, mas na segunda funcionou. Claude Code/Fable foi muito mais rápido, mas cometeu o mesmo erro, e espero que a autorrevisão excessiva dos modelos abertos diminua ou que a forma de fazer prompts melhore
Os modelos chineses ainda não chegam a esse critério e parecem focados em maximizar pontuações em benchmarks, mais do que em eficiência
max, mas outros níveis devem ser disponibilizados em breve. Nos registros de rastreamento dos benchmarks, havia muitos retornos e incertezas como “espere, mas...”, e algo parecido também aparecia noxhighe nomaxdo GPT 5.6 e do Fable, embora em menor grauQuando intensidades de raciocínio mais baixas forem suportadas, há chance de melhorar a ineficiência de tokens
https://platform.kimi.ai/docs/guide/use-thinking-effort
/code-review, sem alterações no código, e o uso disparou para 99%; com o 1% restante, ele nem conseguiu escrever oreview.mdNormalmente a revisão usa 10% a 20%, mas às vezes 65% a 69% desaparecem em 15 minutos, então a variação de uso é enorme
No plano pago do Kimi, o comprimento de contexto de 1 milhão de tokens só é oferecido a partir de US$ 79 por mês; abaixo disso, o limite é de 256 mil tokens. No plano mais barato, de US$ 15 por mês com desconto de pagamento anual, o K3 em si não é suportado no momento
https://www.kimi.com/code/docs/en/kimi-code/models.html
Vejo justamente o contrário. O Kimi K3 tem 2,8 trilhões de parâmetros; o tamanho do ChatGPT 5.6 e do Opus 4.8 não foi divulgado, mas é provável que seja parecido, e há rumores de que Fable e Mythos tenham cerca de 10 trilhões
Os preços de entrada e saída por milhão de tokens são US$ 3 e US$ 15 no K3, US$ 5 e US$ 30 no ChatGPT 5.6 Sol, e US$ 5 e US$ 25 no Opus 4.8, então a diferença não é grande. Em vez de um ponto de virada histórico, parece mais que os concorrentes estão convergindo para o mesmo desempenho e vendendo um pouco mais barato. Os pesos atuais do K3 também são fechados, então não parece que a situação vá mudar
Mesmo nesta thread, a utilidade real do Kimi divide opiniões. Pessoalmente, acho que fica abaixo do Fable e do 5.6 Sol, mas o centro da discussão parece estar mais na reação às medidas regulatórias do governo dos EUA do que no desempenho
A raiva e a frustração com a situação atual também parecem alimentar uma vontade de que o Kimi seja melhor
Depende muito do tipo de tarefa e da forma de uso, mas a avaliação de que o K3 não está no mesmo nível dos modelos de ponta dos EUA não bate com minha experiência de uso
Aqui é preciso esclarecer se “Claude” se refere ao Opus ou ao Fable, e em que nível estava a intensidade de raciocínio
A formulação original foi imprecisa; não uso Fable nem K3 na maior parte do tempo e normalmente faço tarefas de escopo pequeno, depois reviso pessoalmente
A política de privacidade também não é um problema pequeno. Ao usar uma assinatura do Kimi, eles dizem que usam as interações para treinar o modelo, e que só não fazem isso quando você usa diretamente a API com preços de API. Se dá para confiar nisso é outra questão
Pretendo esperar até que outros provedores apareçam no OpenRouter e então avaliar a confiabilidade. Mesmo que eu não confie muito neles, se forem provedores que não treinam modelos diretamente, a chance de os dados serem usados em treinamento é menor
99% dos usuários não lidam com propriedade intelectual especial que valha a preocupação
Até agora, no fim, tudo também era destilação. Como Suhail disse, é preciso levar o lucro dos modelos de IA a quase zero
Como foram treinados com dados da humanidade, deveriam ser um presente para a própria humanidade, pois só assim se pode impedir que uma minoria controle a humanidade
Modelos open source já chegaram ao nível dos melhores modelos comerciais. O último gargalo é o hardware, mas essa barreira também está caindo rapidamente
Rodar o Kimi K3 em casa ainda é muito caro, mas já há muitos modelos gratuitos competentes que rodam em hardware razoável, e essa tendência vai continuar