3 pontos por GN⁺ 12 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • O Kimi K3, da Moonshot Labs, e o Qwen 3.8, da Alibaba, supostamente entregam desempenho próximo ao Fable 5 da Anthropic, e seus pesos devem ser divulgados nas próximas semanas, ampliando a disputa por modelos de ponta para modelos abertos
  • O desenvolvimento de modelos exige pesquisadores, computação e energia, mas, após a implantação, o custo marginal de inferência vem principalmente de computação e energia. Ao possuir data centers e instalações de geração de energia, é possível transformar isso em custo fixo e ampliar margens conforme o uso cresce
  • Empresas focadas apenas em modelos e sem infraestrutura precisam depender de desempenho máximo ou de qualidade suficiente a baixo custo. As saídas se estreitam para autoaperfeiçoamento recursivo, fechamento do mercado por meio de regulação ou construção de produtos difíceis de copiar
  • O Fable 5 da Anthropic tem custo por tarefa concluída cerca de 3 vezes maior, e harnesses como Claude Code e Cowork também competem com OpenCode, OpenClaw e Hermes. Como modelo, produto e estrutura de custos são desafiados ao mesmo tempo, cresce o risco de desagregação
  • Com a chegada sucessiva do GLM 5.2, Kimi K3 e Qwen 3.8 em junho e julho de 2026, confirmou-se a possibilidade de vários laboratórios alcançarem os líderes. Isso enfraquece as defesas de empresas centradas em modelos, como Anthropic, Moonshot Labs e Knowledge Atlas

A competição de ponta se expande para modelos abertos

  • O Kimi K3 foi lançado em 16 de julho de 2026, e o Qwen 3.8 foi anunciado em 19 de julho
    • Ambos os modelos supostamente entregam desempenho próximo ao Fable 5 da Anthropic
    • Os pesos dos modelos devem ser divulgados nas próximas semanas
  • O GLM 5.2, da Knowledge Atlas, também é um modelo aberto de ponta lançado em meados de junho
  • Essa tendência tem escopo maior do que o único “momento DeepSeek” de 2025
    • Mostra que vários laboratórios podem alcançar não só empresas com grande capital, como Anthropic e OpenAI, mas também a Meta e o Grok da SpaceX
    • A dinâmica é de competição e perseguição contínuas e, considerando também os custos, uma inversão futura de desempenho é possível

A estrutura de custos dos modelos de fundação

  • Construir um modelo exige pesquisadores, recursos computacionais como chips e data centers, e a energia necessária para operá-los
  • Em um modelo finalizado, o maior custo surge na inferência, que permite aos usuários utilizar o modelo
    • A etapa de inferência também envolve pessoal, computação e energia
    • Como o modelo não é atualizado continuamente, a participação de custos trabalhistas é menor do que no treinamento, e a maior parte do custo marginal se concentra em computação e energia
  • O negócio de inferência precisa otimizar custos de energia e data centers, e quanto maior a parcela da cadeia de valor sob controle próprio, mais custos variáveis podem ser convertidos em custos fixos

Margens determinadas pelo grau de propriedade da infraestrutura

  • Anthropic, Knowledge Atlas e Moonshot Labs compram data centers e energia de terceiros, sem data centers ou usinas próprias
  • Meta e Alibaba constroem seus próprios data centers, mas compram energia de outros fornecedores
  • A SpaceX opta por possuir tanto instalações de geração de energia quanto data centers
  • Empresas que dependem de data centers e energia externos lucram adicionando margem aos custos de inferência dos clientes
    • Como os custos aumentam junto com a receita, é difícil ampliar margens mesmo com crescimento de uso
  • Ao possuir usinas ou data centers, uma parte significativa do custo de inferência se torna custo fixo, permitindo ampliar margens conforme o uso dos clientes cresce

A infraestrutura amplia as opções estratégicas

  • Quanto mais partes da stack de infraestrutura uma empresa possui, mais ela pode monetizar a própria infraestrutura
    • Mesmo que seu próprio modelo não seja o melhor, ela pode hospedar modelos open source de bom desempenho
    • Também é possível alugar o hardware disponível para outras empresas
  • A Meta estaria discutindo um contrato de US$ 10 bilhões para fornecer capacidade de servidores à Anthropic
  • A SpaceX fechou um contrato de nuvem com o Google e também discute oferecer capacidade computacional ao Departamento de Defesa dos EUA
  • Sem data centers ou instalações de geração de energia, o sucesso depende da demanda pelo modelo
    • O modelo precisa ter o melhor desempenho, ou ser barato e bom o suficiente
    • A empresa fica presa a uma competição em que precisa continuar reduzindo preços de inferência ou manter a posição de melhor fornecedora de modelos

Três caminhos de sobrevivência para empresas focadas apenas em modelos

  • Anthropic, OpenAI, DeepSeek, Moonshot Labs e Knowledge Atlas terão dificuldade para sobreviver no mercado hipercompetitivo de modelos de fundação se não conseguirem manter a liderança
  • Há três caminhos pelos quais empresas focadas em modelos podem vencer
    1. Alcançar primeiro o autoaperfeiçoamento recursivo com recursos computacionais suficientes e abrir grande vantagem sobre concorrentes
    2. Fechar o mercado por meio de regulação
    3. Construir produtos tão únicos ou tão capazes de reter usuários que não possam ser copiados

Custos e estratégia regulatória da Anthropic

  • Entre os laboratórios de modelos de ponta, a Anthropic é a que mais depende de estratégia regulatória e de autoaperfeiçoamento recursivo
  • A abordagem centrada em ética, revelada pela autocensura do Fable e do Mythos, está ligada à estratégia regulatória
    • Posteriormente, medidas do governo dos EUA também limitaram novos lançamentos
  • Em desempenho de modelo, a empresa mantém a liderança, mas seus preços são muito mais altos do que os da OpenAI e de modelos abertos
    • Na comparação da Artificial Analysis, o custo por tarefa concluída do Fable 5 chega a quase 3 vezes mais
    • Ainda não está claro se usuários pagarão esse preço por um modelo melhor
  • Alguns pesquisadores e fundadores esperam uma guerra de preços, diante da expansão da concorrência e da saturação de benchmarks de IA que não refletem preço

Concorrência entre harnesses e pressão de desagregação

  • A Anthropic investiu em produtos como Claude Code e Cowork, mas uma estratégia centrada em harnesses de agentes traz riscos
  • OpenCode, OpenClaw, Hermes e várias startups de harnesses estão inovando na mesma área
  • A barreira de entrada para construir modelos de fundação é muito alta, mas a barreira para lançar um harness de IA próprio é quase inexistente
  • A Anthropic sofre pressão de desagregação em três direções
    • O modelo se torna o padrão que concorrentes precisam superar
    • O produto enfrenta desafios cada vez mais fortes de concorrentes fechados e open source
    • O modelo econômico sem propriedade de infraestrutura é desfavorável em custos
  • Sem intervenção regulatória ou a invenção real da AGI, pode ser difícil para a Anthropic manter a posição de fornecedora número 1 de modelos de fundação

A estratégia defensiva diferente escolhida pela OpenAI

  • Nos últimos meses, os modelos da OpenAI ficaram atrás dos da Anthropic, mas a empresa investiu em produto, experiência do consumidor, publicação no site, voz e hardware
  • Nessas áreas, há uma base defensável mais clara do que nos produtos da Anthropic centrados em harnesses
  • A empresa também está mais aberta à posse de data centers e a investimentos em geração de energia
  • Há quem veja essa estratégia como algo que reduz o foco, mas, no longo prazo, ela pode aumentar a resiliência
    • Há flexibilidade e disposição para assumir riscos ao tentar criar produtos com efeitos de rede e defesas competitivas
    • É possível otimizar margens de longo prazo

O enfraquecimento das defesas de empresas centradas em modelos

  • Kimi K3 e Qwen 3.8 mostram que modelos abertos também podem alcançar a faixa de desempenho de ponta
  • Pelo critério de um negócio sustentável no longo prazo, empresas que apenas fornecem modelos estão especialmente em risco
  • Knowledge Atlas, Moonshot Labs e Anthropic têm mais dificuldade para construir defesas competitivas do que OpenAI, Alibaba, SpaceX, Meta e Google, que possuem infraestrutura e outros ativos de produto

1 comentários

 
Comentários no Hacker News
  • Vendo a enxurrada recente de modelos com pesos abertos e arquitetura aberta, parece cada vez mais provável que no fim vença quem conseguir gravar o modelo em ASIC mais rápido
    Como ficou claro no anúncio do K3, o próprio LLM já consegue realizar parte do projeto de chips, e os modelos de ponta já são suficientemente bons para uma ampla gama de tarefas, devendo em breve atingir esse nível também em boa parte do desenvolvimento de software
    Se o Fable 5 rodar em ASIC a 9.000 tokens por segundo em vez de 150 tokens por segundo em uma GPU da Nvidia, isso pode atender à maior parte da demanda
    As empresas também poderão lidar com vários usos com mais segurança usando um pequeno número de ASICs on-premises, em vez de entregar seus dados à OpenAI ou Anthropic

    • ASICs para criptomoedas tinham algoritmos que mudavam devagar e eram bem conhecidos, mas a arquitetura de LLM muda muito mais rápido
      Eu não gostaria de correr o risco de surgir um novo artigo ou abordagem várias vezes mais rápida enquanto ainda estou acertando os detalhes de lançamento do chip
      Desenvolvedores têm fidelidade de marca muito baixa e migram direto para o melhor modelo, então enquanto os melhores modelos rodarem em GPUs programáveis, as GPUs continuarão dominando
    • Parece o tipo de avaliação de “640KB devem ser suficientes para qualquer pessoa”
    • Os modelos mais recentes da OpenAI e da Anthropic também executam planejamento de roteiros de viagem muito mal
      Eu uso com frequência, mas eles violam totalmente as condições pedidas, e cerca de metade das paradas recomendadas não atende aos filtros
    • Fable e Mythos parecem enormes Xeons, enquanto modelos pequenos e leves parecem vários chips ARM de baixo consumo, dando a sensação de uma reedição de Intel vs ARM
      Seguir clientes que pedem modelos cada vez maiores como se os recursos fossem ilimitados rende muito dinheiro no curto prazo, mas há o risco de ser ultrapassado por algo como o Apple Silicon, que cresceu com eficiência e melhoria contínua
    • Já existem hardwares personalizados como os da Cerebras
      Um laboratório conseguiu gerar um modelo de 8 bilhões de parâmetros em cerca de 3.000 tokens por segundo em uma única MI300X, contra cerca de 100 tokens por segundo em uma stack de software comum
      Também estão sendo desenvolvidos flashes de alta largura de banda em escala de vários TB, capazes de ler mais de 1TB por segundo, então em alguns anos talvez seja possível rodar localmente um modelo de 3 trilhões de parâmetros por algo em torno de 10 mil a 20 mil dólares com uma placa equipada com 40–90GB de HBM e 4TB de HBF
  • Isso continua me lembrando o caso da Figma
    Mike Krieger, CPO da Anthropic e cofundador do Instagram, era diretor da Figma, mas renunciou pouco antes da apresentação do Claude Design, e a Figma, embora dependesse de uma integração conjunta “Code to Canvas” com modelos da Anthropic, supostamente não sabia de antemão o escopo do Claude Design
    Logo após o anúncio, as ações da Figma caíram 7%, tornando real o apocalipse do SaaS em que empresas de modelos-base invadem a camada de aplicação de parceiros SaaS
    É preciso ter cuidado ao fornecer dados ou depender de empresas de LLM, porque se a ideia de uma startup de IA der certo, elas podem passar a competir diretamente ou influenciar o preço da API

    • Isso lembra desenvolvedores que perderam a base sob seus pés depois de criar apps sobre FB·Twitter e depois sobre a API do Reddit, até que um dia isso lhes foi tirado
    • A receita com ferramentas de programação é importante agora, mas não é o objetivo final, e empresas de IA precisam virar um super app para consumidores para justificar avaliações tão altas
      A OpenAI está apostando pesado até no próprio hardware para consumidores, tentando se livrar da dependência de Apple e Android, e também em um superdispositivo para o público final
      A disputa de longo prazo não é IA vs SaaS, mas sim contra grandes marcas de consumo como Apple, Google, Meta e Amazon, e se alguém concluir primeiro o assistente digital definitivo que recebe qualquer tarefa e cria na hora código e interface, até a Apple pode parecer ultrapassada
    • O capitalismo atual gira em torno de comportamentos monopolistas, então, se empresas de LLM chegarem ao ponto de substituir funcionários, espero que, em vez de vender pás, elas passem a cavar ouro por conta própria
      Produtos construídos sobre outros serviços são facilmente adquiridos ou absorvidos pelo serviço-base, e a Apple também vem incorporando silenciosamente ao iOS recursos de inúmeros apps populares
    • Na época do lançamento do GPT 5, fiz um app para personalização de currículos, mas quando o GPT 5.5 saiu já era possível gerar diretamente currículos perfeitos em PDF e Word, preservando a formatação original
      É arriscado criar wrappers superficiais competindo com os laboratórios, mas também é uma nova era de software em que não há motivo para preocupação se você construir um produto valioso que um chatbot não possa simplesmente copiar de imediato
    • A pressão competitiva sobre Anthropic e OpenAI é tão grande que elas não conseguem perseguir toda ideia de produto imprudente com capital e desenvolvedores, então acredito que acabou a era em que grandes empresas copiavam startups na base do dinheiro
  • Acho que o risco está sendo exagerado
    Existe demanda para pagar mais por modelos melhores, e o valor que obtenho no meu fluxo de trabalho é muito maior que os US$ 200 por mês pagos a um laboratório de ponta, então não penso em cortar um pouco esse custo
    O valor oferecido pelo ambiente de execução do Claude Code ou do Codex é maior que o do LLM em si, e implementações open source como o OpenCode ainda ficam bem aquém
    O Excel também tem o Google Sheets, que é quase equivalente e oferece mais de 90% das funções, mas o valor gerado por planilhas é muito maior que US$ 100 por ano, então o forte fosso competitivo da Microsoft se mantém

    • O dinheiro da Claude e da OpenAI vem de clientes corporativos, e empresas são sensíveis a custos a ponto de terem cargos dedicados a otimizar gasto com infraestrutura
      Nenhuma das duas empresas é avaliada em US$ 1 trilhão por causa do ambiente de execução
      O Excel empresarial custa cerca de US$ 50 por mês, mas laboratórios fechados cobram várias vezes mais por usuário, e eu mesmo, sem programar tanto assim, gasto no mínimo uns US$ 50 por dia
    • Empresas não podem usar assinaturas gerais fortemente subsidiadas, e conheço organizações com cerca de 100 desenvolvedores usando IA ativamente que gastam US$ 500 mil por mês
    • Tratar US$ 200 por mês como algo trivial é uma perspectiva de países desenvolvidos e ricos
      Onde eu moro, salários de US$ 200 por mês não são raros, e até desenvolvedores ganham cerca de US$ 1.000, então, por maior que seja o valor, não dá para usar se isso não paga aluguel e comida
      Mesmo em países desenvolvidos, US$ 200 por mês é difícil de bancar para estudantes ou fundadores sem dinheiro
    • O próprio Codex também está disponível como open source: https://github.com/openai/codex
    • A diferença de desempenho que justificaria pagar mais por modelos melhores está diminuindo rapidamente
      Até uma semana atrás valia a pena pagar pelo Fable, mas com a chegada do K3 a diferença encolheu a ponto de, para mim, o custo não se justificar mais
      Se o resultado real fosse 10% melhor, tudo bem pagar 5x mais, mas bem menos gente vai pagar 5x mais por uma melhora de 2%
      Além disso, ser forçado a usar o Claude Code em vez do ambiente de execução que você prefere não é uma vantagem da Anthropic, e sim uma desvantagem
  • Impressiona a velocidade com que o Fable passou de “modelo revolucionário que deveria ser proibido” para “é bom, mas a OpenAI tem algo parecido e há alternativas de pesos abertos”
    O ciclo de hype ficou mais curto, e talvez desta vez tenhamos realmente chegado a um período de estagnação

    • O Fable continua sendo o mesmo ótimo modelo, e textos tentando adivinhar o futuro da indústria de LLMs não costumam ser muito perspicazes nem interessantes, então é melhor não ligar muito para isso
    • No começo do ano, modelos de pesos abertos estavam 4 meses atrás da OpenAI e da Anthropic, mas agora a diferença é de só 4 a 6 semanas
    • Métodos gananciosos de treinamento, viáveis apenas quando não há proteções, acabam tendo limites
      A informação continua mudando e os modelos precisam ser atualizados, mas os dados disponíveis gratuitamente vão ficar cada vez mais escassos
  • A OpenAI, assim como a Anthropic, é na prática quase só uma fornecedora de modelos, então fica a dúvida de por que não seria vulnerável do mesmo jeito

    • O ChatGPT virou sinônimo de LLM para uso não técnico e não profissional, e está acumulando um enorme histórico de uso
      Esse histórico fornece contexto pessoal, melhora o produto e também pode ser usado para treinar modelos e para publicidade
      Num futuro em que você digita “planeje minhas férias” e ele coordena o processo inteiro, os usuários não vão migrar facilmente para outro modelo 10% mais barato ou melhor
    • A OpenAI está se diversificando em hardware de consumo e também possui mais datacenters próprios
      Se os produtos realmente forem lançados e tiverem algum sucesso, ela pode ocupar uma posição única que a diferencie de outros laboratórios de ponta
    • O texto distingue investimentos em produto, experiência do consumidor, publicação em site, voz e hardware como fossos competitivos mais claros
      Mas essas diferenças hoje ou estão aquém do esperado ou, como no caso do hardware, ainda não foram comprovadas
    • Além de wearables para consumidores, mais importante ainda, ela também está desenvolvendo chips para inferência
      Fazer um bom modelo é uma coisa; entregá-lo rapidamente e dar conta da demanda é outra
      A Anthropic passou por esse problema há uns 6 meses, e a Moonshot também já suspendeu assinaturas do plano de coding por não conseguir atender à demanda
  • Se o teto do avanço da IA for a autoaperfeiçoamento recursivo, então a IA fará modelos melhores e os donos de datacenters vencerão, o que encerraria Anthropic e OpenAI
    Se o piso for a estagnação, a disputa vira oferecer um nível fixo de desempenho máximo pelo menor preço possível
    A notícia de que o Google está fazendo chips Gemini com os pesos gravados no silício significa, considerando a vida útil de 2 a 3 anos dos chips, que a empresa espera não haver avanço relevante nos próximos 3 anos; no fim, seria uma competição de margem mínima, o que novamente deixa as duas empresas em desvantagem
    Para sobreviver, o avanço da IA precisa ficar entre esses dois extremos

    • Precisamos agora mesmo de computação distribuída estilo SETI@home para modelos de pesos abertos
    • Gravar os pesos no chip melhora a velocidade de inferência e a eficiência energética, e ainda tem o efeito colateral de colocar o usuário final em um ciclo contínuo de troca de hardware
  • A OpenAI parece muito mais frágil que a Anthropic
    O fato de um lado estar buscando um IPO e o outro evitar divulgar seus livros diz muita coisa

  • O ponto central é se outros laboratórios conseguem criar modelos superiores aos da Anthropic e da OpenAI
    Também importa o quanto dependem das APIs das duas empresas, inclusive via destilação; se forem modelos derivados, espera-se uma faixa de desempenho mais estreita e progresso mais limitado

    • Não é preciso superá-las em desempenho puro; o importante é o valor pelo custo
      Em empresas que compram tokens, já está ficando claro que ganhos de inteligência não se traduzem em aumento de receita, então no fim as finanças vão mandar nas decisões
      Se eu fosse OpenAI ou Anthropic, estaria extremamente preocupado
  • O Dario pode inverter a maré se voltar aos podcasts ameaçando que, por causa da IA dele, 75% dos empregos vão desaparecer
    Se não funcionar, é só subir para 85%; se ainda não funcionar, vai até 100%

  • Em novembro de 2025, Anthropic Opus 4.5 e Claude Code eram claramente os únicos sistemas que implementavam corretamente, de uma vez só, funcionalidades bem definidas, mas agora estou quase igualmente satisfeito com Claude e Codex
    Se as duas empresas pressionarem os preços ou endurecerem demais as políticas de segurança, parece que haverá cada vez mais opções para migrar para modelos competentes com pesos abertos e ambientes de execução realmente open source
    Gemini 3.1 Pro parece forte, mas o último Antigravity que usei era incompetente
    É bom que a Anthropic sobreviva como uma das concorrentes fortes, mas, por causa de sua filosofia de segurança em primeiro lugar, está aumentando as recusas e a ignorância deliberada nos modelos mais recentes
    No longo prazo, ela pode acabar sendo lembrada como a empresa que acelerou o desenvolvimento de software para que outros criassem ferramentas menos tímidas

    • Preferiria que a Anthropic entrasse em declínio e outra empresa ocupasse seu lugar