- Modelos de pesos abertos com desempenho e portabilidade suficientes podem se tornar uma base que desenvolvedores, nuvens e empresas ampliam em conjunto, criando um ecossistema de inovação difícil para um único fornecedor acompanhar
- Assim como o Kubernetes atraiu ferramentas de rede, armazenamento e observabilidade para uma interface comum, em IA cresce uma stack de produção que vai de serving de modelos, ajuste fino, runtimes de agentes e avaliação
- Os modelos públicos do Hugging Face passaram de 2 milhões, o GLM-5.2 superou o GPT-5.5 na avaliação própria SWE-bench Pro, com 62,1% contra 58,6%, e o Kimi K3 também obteve, em avaliação independente, pontuação semelhante à do Opus 4.8 e do GPT-5.5
- Se modelos chineses de pesos abertos forem amplamente proibidos, o desenvolvimento global continuará enquanto apenas pesquisadores e empresas dos EUA ficarão excluídos do ecossistema, e a inovação poderá se acumular em torno de modelos chineses, que responderam por 41% dos downloads do Hugging Face no último ano
- Os EUA devem competir não por meio de proibições, mas com a publicação de modelos de fronteira comercialmente utilizáveis, compras governamentais que valorizem portabilidade e interoperabilidade, construção de toda a camada de ferramentas e operações, e testes e padrões independentes de segurança
A força das plataformas abertas demonstrada pelo Kubernetes
- A Mesosphere desenvolveu software cloud native de código aberto com base no Apache Mesos e construiu em torno dele o DC/OS, comercializando-o como uma distribuição empresarial com suporte e recursos proprietários
- Depois, o Kubernetes, um projeto de código aberto mais novo e completo, reuniu a comunidade cloud native e abalou a Mesosphere
- Engenheiros de sistemas distribuídos e infraestrutura de nível mundial apostaram suas carreiras no Kubernetes, e parte dos membros fiéis da comunidade da Mesosphere também migrou
- À medida que o centro da inovação se deslocou para o Kubernetes, componentes que faltavam — rede, armazenamento, observabilidade, ferramentas de implantação, mecanismos de política e outros — foram desenvolvidos rapidamente
- Com a participação de muitas startups e fornecedores estabelecidos, quase todos os componentes necessários para operar Kubernetes em produção passaram a ser oferecidos como código aberto
- Provedores de nuvem e empresas como Mesosphere/D2iQ, Rancher, Red Hat e Nutanix construíram negócios centrados em integração, recursos empresariais, suporte e operação
- O sucesso do Kubernetes não foi apenas resultado de abrir um repositório
- Ele se consolidou como uma base neutra que engenheiros, provedores de nuvem e fornecedores empresariais podiam ampliar conforme as necessidades dos clientes
- Interfaces comuns e governança neutra em relação a fornecedores deram aos participantes a confiança de que poderiam construir produtos no longo prazo
- Quando uma plataforma aberta e personalizável se torna o centro de uma indústria, fica difícil para um único fornecedor acompanhar a velocidade combinada de inovação de todo o ecossistema
A diferença entre pesos abertos e IA de código aberto
- A maioria dos modelos comumente chamados de código aberto é, mais precisamente, de pesos abertos
- Os parâmetros treinados podem ser baixados e modificados, mas os dados de treinamento e todo o processo de treinamento geralmente não são divulgados
- Portanto, eles não chegam à definição de IA de código aberto da Open Source Initiative
- Mesmo que não sejam totalmente de código aberto, um ecossistema pode se formar em torno de artefatos que os usuários conseguem executar e modificar
- Também há diferenças importantes entre as estruturas do Kubernetes e da IA
- Colaboradores do Kubernetes podiam examinar e alterar o código-fonte real e incorporar melhorias ao projeto upstream compartilhado
- Resultados de ajuste fino de modelos normalmente não são compartilhados da mesma forma
- Mesmo quando é possível baixar os pesos de um modelo de fronteira, executá-lo pode exigir hardware caro
- Em IA não há uma organização como a CNCF que forneça governança neutra e interfaces comuns
- O ponto em comum entre os dois ecossistemas é que uma base com desempenho e portabilidade suficientes atrai inovação complementar além do que o criador original conseguiria construir sozinho
De self-hosting a plataformas de modelos
- O primeiro motivo para adotar modelos de pesos abertos foi o self-hosting
- Empresas queriam executar modelos em sua própria nuvem ou datacenter mantendo controle direto sobre os dados
- Com o aumento do uso e dos custos de inferência, também cresceu a demanda por controlar diretamente os custos
- Com base nessa demanda, formou-se uma stack de serving de modelos de código aberto com vLLM, SGLang, llama.cpp, Ollama, MLX e outros
- Pesos abertos vão além do self-hosting e permitem que desenvolvedores modifiquem e redistribuam o próprio modelo
- O Hugging Face tem mais de 2 milhões de modelos públicos registrados
- Em torno de famílias populares de modelos, como Qwen e Gemma, surgem diversos artefatos derivados
- Pesos quantizados e convertidos para diferentes arquiteturas de semicondutores e tamanhos
- Modelos ajustados e adaptadores LoRA para codificação, medicina, direito, matemática e workflows de agentes
- Mesclas de modelos que combinam diferentes resultados de ajuste fino
- Variações de modelos adaptadas a vários runtimes, como TensorRT-LLM, vLLM e MLX
A fronteira e a lacuna de desempenho que se estreita
- No passado, o desempenho-base dos modelos abertos era insuficiente para as tarefas mais difíceis de codificação e agentes, o que tornava fácil excluí-los da competição de fronteira, mas essa lacuna está diminuindo rapidamente
- A Z.ai lançou o GLM-5.2, que oferece pesos públicos sob licença MIT
- Na avaliação própria, sua pontuação no SWE-bench Pro foi de 62,1%, acima dos 58,6% do GPT-5.5
- Ainda assim, os resultados podem variar conforme o benchmark e o harness de agentes
- A Moonshot afirma que o Kimi K3 se aproxima dos modelos fechados de fronteira em tarefas longas de codificação e prometeu publicar os pesos em 27 de julho
- Em uma avaliação independente da Artificial Analysis, o Kimi K3 também obteve pontuação semelhante à do Opus 4.8 e do GPT-5.5
- Quando o desempenho dos modelos-base se torna suficiente, runtimes de agentes, harnesses de codificação, sandboxes, avaliações, observabilidade e projetos especializados de ajuste fino podem crescer em cadeia
- Esses componentes formam uma stack aberta de nível de produção que pode ser ajustada à carga de trabalho, ao hardware e à estrutura de custos de uma equipe
- É uma arquitetura em que modelos de pesos abertos rodam sobre software de código aberto
- Não há garantia de vencer todos os modelos fechados em todos os benchmarks
- IA de fronteira é uma disputa por talentos, e ecossistemas abertos dão a talentos de todo o mundo motivos para desenvolver sobre a mesma base
Impacto de uma proibição de modelos chineses sobre os EUA
- Após o surgimento de modelos chineses fortes, incluindo o Kimi K3, foi informado que o governo Trump está avaliando restrições a modelos chineses de pesos abertos
- Ainda não está claro que forma uma possível proibição teria
- Uma proibição ampla do uso de modelos chineses de pesos abertos poderia separar pesquisadores e empresas dos EUA de um ecossistema que reúne pesquisadores e engenheiros de IA do mundo todo
- Muitos pesquisadores chineses também participam desse ecossistema
- A atividade de desenvolvimento global continuaria, mas apenas desenvolvedores dos EUA ficariam sem acesso
- Em torno do Qwen, essa tendência já aparece
- Segundo o Hugging Face, no último ano modelos chineses responderam por 41% de todos os downloads de modelos
- Se os melhores modelos-base de pesos abertos continuarem vindo da China, ferramentas e inovação poderão se acumular em torno deles, como aconteceu na época do Kubernetes
Quatro formas de os EUA competirem
-
Publicar modelos americanos de nível de fronteira
- Laboratórios dos EUA devem publicar modelos de pesos abertos de nível de fronteira com licenças que permitam a startups construir produtos reais
- Alguns avanços já aparecem
- O NVIDIA Nemotron pode ser usado comercialmente sob a licença permissiva da NVIDIA
- Inkling, da Thinking Machines, gpt-oss, da OpenAI, e Gemma 4, do Google, foram publicados sob Apache 2.0
- No entanto, os modelos mais fortes da maioria dos laboratórios americanos de fronteira, incluindo os modelos de melhor desempenho da OpenAI e do Google, continuam fechados
-
Criar um mercado aberto por meio de compras governamentais
- Compras governamentais devem criar demanda por sistemas com portabilidade e interoperabilidade, em vez de sistemas que dependam permanentemente de um único fornecedor de API
- O Departamento de Defesa dos EUA já usa uma abordagem semelhante
- O Platform One oferece ferramentas de código aberto e produtos empresariais que podem servir de base para diversos programas militares
- O mesmo modelo de compras pode acelerar a inovação em torno de modelos de pesos abertos
-
Construir toda a stack além do modelo
- Empresas americanas também precisam construir as demais camadas ao redor dos modelos
- Startups podem personalizar e ampliar modelos e incorporá-los a produtos
- Serving, ferramentas, suporte e camadas operacionais também são oportunidades de negócio
- As principais empresas americanas de semicondutores podem continuar melhorando o hardware, enquanto hyperscalers e neoclouds podem servir modelos e ecossistemas
-
Adotar testes e padrões em vez de proibições
- Segurança é o argumento mais forte a favor de restrições, mas uma proibição total é ampla demais e sacrifica até o acesso a todo o ecossistema
- Uma resposta melhor é criar testes e padrões independentes para modelos de fronteira
- O teste de conformidade do Kubernetes verifica compatibilidade, não segurança, portanto não é um paralelo exato para IA
- Ainda assim, critérios independentes e modelos de governança podem servir de referência
- Demis Hassabis propôs uma organização independente de padrões liderada pelos EUA semelhante
Estratégia de competição em um ecossistema aberto de IA
- Em vez de erguer barreiras em torno de seus desenvolvedores, os EUA devem executar diretamente modelos chineses, analisar seu interior, testá-los em benchmarks e melhorá-los
- Ao mesmo tempo, devem construir alternativas americanas melhores e tornar a stack de IA dos EUA a opção mais fácil de adotar no mundo
- Por décadas, os EUA atraíram os melhores talentos técnicos do mundo e ofereceram espaço para que eles se desenvolvessem
- Se transformarem essa vantagem competitiva em um ecossistema fechado enquanto outros países adotam stacks mais abertas como padrão, os EUA estarão abrindo mão por conta própria da posição de líder em IA
1 comentários
Comentários no Hacker News
Banir modelos chineses parece tecnicamente impossível. Os pesos são apenas números, então não dá para distinguir os dos EUA dos da China, e uma proibição baseada na origem seria facilmente contornada.
No fim, seria preciso regular todos os modelos com pesos abertos; de fato, a Axios noticiou que grandes laboratórios de IA e pessoas ligadas a eles propuseram ao governo, a cada 3 a 5 meses, proibir modelos open source.
Seria possível impor um sistema de licenciamento parecido com DRM para permitir que apenas modelos americanos certificados rodem em servidores próprios, mas isso daria monopólio aos grandes laboratórios e também impediria a distribuição de modelos derivados. Seria difícil aplicar isso no exterior, então é bem provável que, no fim, apenas os americanos fiquem restringidos.
Em vez disso, seria possível proibir pagamentos por inferência e serviços de IA a empresas chinesas ou a operadores pertencentes a empresas chinesas.
Uma das coisas mais estranhas no setor de IA é o sistema de preços por token. Não está claro por que o GPT-4 era muito caro no início de 2023 e, seis meses depois, passou a permitir uma quantidade considerável de inferência por US$ 20; os preços de vários laboratórios e fornecedores subiram e desceram por anos sem uma justificativa evidente.
Modelos com pesos abertos pelo menos fornecem uma linha de base para o custo de inferência, tornando os preços mais racionais e previsíveis. Mesmo que o Kimi K3 seja lançado, você pode continuar usando o K2 se quiser; portanto, a pressão competitiva e a continuidade dos modelos abertos são úteis para os usuários.
Pode parecer confuso para quem está acostumado a mercados maduros e estáveis, mas flutuações de preço em mercados nascentes são uma característica comum.
O fato de todos terem
gpt-4no nome não significa que o modelo interno seja o mesmo; ele pode ter sido bastante alterado para reduzir o custo do serviço.Para chegar a uma posição semelhante à do Kubernetes, várias empresas teriam que desenvolver em conjunto modelos de IA com dados de treinamento abertos. Assim como empresas contribuem juntas para o Linux, pode fazer sentido usar modelos abertos e contribuir com os recursos necessários, já que modelos de IA são necessários para os negócios, mas desenvolvê-los internamente é caro demais.
A OpenAI também lançou dois modelos open source muito bons para os padrões da época. O modelo de 20B é excelente para revisar textos ou rascunhar scripts Bash em casa, mas o de 120B é difícil de rodar em hardware de consumidor com uma velocidade realista de tokens por segundo.
Ainda assim, seria bom se a OpenAI atualizasse esses modelos com mais frequência.
gpt-oss-120broda a mais de 30 tokens por segundo no Strix Halo e a mais de 75 tokens por segundo em um MacBook Pro M5 Max de 128 GB.O sucessor espiritual parece ser a família Nemotron 3, mas ela também já está um pouco antiga: https://research.nvidia.com/labs/nemotron/Nemotron-3/
Há também o Gemma 4, mais recente: https://huggingface.co/collections/google/gemma-4
Ou você pode escolher o Qwen3.6: https://huggingface.co/collections/Qwen/qwen36
A China lança modelos abertos para elevar seu nível tecnológico, enquanto a diferença é que a OpenAI e Sam os lançam com o objetivo de sufocar concorrentes.
Para startups que querem modelos de fronteira de laboratórios americanos, o ciclo de lançamentos atual é insustentável. Se os EUA não quiserem entregar completamente esse mercado, a OpenAI e outras precisam acelerar rapidamente.
Até que a China amplie a produção de hardware, rodar por conta própria não é econômico, mas é positivo que modelos abertos pressionem os laboratórios. No fim, quando os celulares conseguirem executar modelos bons o suficiente para a maioria das tarefas, é provável que a Apple vença
Também não exige processos de semicondutores de ponta, o que pode reduzir drasticamente os custos
Calculando com base em 7 meses de assinatura do Claude Code por nó, o investimento se paga em 28 meses; com depreciação em 5 anos, dá para montar quase no ponto de equilíbrio dois clusters e atender dois fluxos de solicitações simultâneos
A próxima geração de hardware já foi anunciada e deve sair após mais ou menos dois ciclos da Lei de Moore; o preço estabilizado provavelmente ficará abaixo de US$ 1.400 em valores de 2024, com desempenho maior
Quando a bolha financeira estourar e os laboratórios pararem de comprar hardware de datacenter, a inferência local ficará mais barata que assinaturas e muito prática. Fico curioso se a UNIX Surplus vai vender servidores de inferência a preço de banana como depois do estouro da bolha pontocom, ou se a demanda de energia será específica demais para uso doméstico
Há valor na ideia de governos criarem demanda comprando sistemas portáteis e interoperáveis, em vez de ficarem permanentemente presos a um provedor específico de API. Isso pode ser feito não só pelo governo federal, mas também por estados como Califórnia, Colorado, Illinois e Nova York
Tenho curiosidade sobre configurações reais para fazer programação agentiva com modelos de pesos abertos. Quero saber quais ferramentas de execução e modelos as pessoas usam, quanto custa por mês e como isso se compara a planos subsidiados como Claude Code e Pro
Quero verificar se a afirmação de que modelos abertos são baratos e eficientes se confirma na prática
Uso três modelos locais no Zed: Qwen 3.6 27B com contexto de 128K em
llama.cppnuma RTX 3090, a cerca de 50 tokens por segundo; Qwen 3.6 35B-A3B com contexto completo emllama.cppnuma Titan V e duas GTX 1080 Ti, a cerca de 30 tokens por segundo; e GPT-OSS 120B rodando lentamente na CPUUso agentes paralelos do Zed para alternar entre tarefas e, quando o modelo trava, interrompo e corrijo o código. Com esse método, chego a cerca de 80% do objetivo mantendo o foco e produzindo código sustentável
Tenho 30 anos de experiência e faço questão de entender como o código funciona, então obtenho a maior parte dos benefícios de curto prazo sem depender de terceiros para avançar o código. Com duas GTX 5060 Ti de 16 GB, que são placas amplamente disponíveis, deve ser possível obter cerca de 100 tokens por segundo no Qwen 3.6 35B-A3B
Os modelos de nuvem mais recentes são excelentes para programação comum usando draft tokens e afins, mas perdem desempenho em trabalhos específicos de domínio. Como o tamanho do modelo de rascunho é apenas 10% a 20% do modelo-base, e até GPUs Blackwell topo de linha ficam limitadas a cerca de 250 tokens por segundo, escalar desempenho no nível do modelo-base exige MoE ou modelos de rascunho
Mas, no meu caso, são problemas fora da distribuição (OOD) ou com poucos exemplos no corpus de treinamento, então essas otimizações jogam contra. É mais uma situação em que preciso de uma minivan, não de uma Lamborghini
qwen 3.6 35B unsloth 4 bitEm contexto de 10K, obtenho cerca de 40 tokens por segundo na geração e cerca de 500 tokens no prefill; em contexto de 100K, cerca de 25 tokens na geração e 400 tokens no prefill
Muitas vezes primeiro crio um plano detalhado passo a passo com GPT ou Claude e faço o Qwen segui-lo. Não tenho certeza se é econômico, mas já tenho o hardware e, graças à energia solar no telhado, eletricidade não é um grande problema
A maior vantagem é saber com certeza que todo o processamento acontece totalmente localmente e que a ferramenta de execução não faz uploads nem telemetria remota
Não comparei com assinaturas porque não gosto dos limites dos planos nem do modo como operam. É visivelmente mais lento que Fable, Opus e Gemini, mas muito mais barato que as APIs deles
No trabalho, a empresa fornece Claude, e recebi um relatório de que o uso do Opus custa US$ 75 por hora de trabalho
GLM 5.2 awq4no OpenCode; ele foi melhor que o Sonnet 4.8 preferido pela empresa e um pouco inferior ao Opus 4.8, sendo suficiente para a maioria das tarefas de que a equipe de desenvolvimento precisava. É pior que o Sonnet 5, mas os tokens não acabamPor outro lado, são necessárias quatro H200 para rodá-lo, e com essa configuração apenas cerca de três usuários conseguem manter o contexto em cache
Espero que as máquinas Blackwell cheguem e que os pesos do Kimi 3 sejam de fato liberados. No ponto em que desenvolvedores gastam uma parcela considerável do salário em tokens, fica mais barato comprar servidores DGX absurdamente caros, instalá-los no rack e operá-los por conta própria
É difícil acreditar na interpretação de que o governo chinês estaria apoiando o treinamento e a abertura dos melhores modelos para impor pressão competitiva aberta à OpenAI e à Anthropic. Parece mais um meio de aplicar aprendizado por reforço a modelos de ponta para que se alinhem à forma de disseminação de informações aprovada pelo governo chinês
Se eu tiver de confiar em um sistema opaco que responde a perguntas, escolheria o modelo de uma empresa americana com fins lucrativos e de capital aberto, sujeita à pressão do mercado, em vez de um modelo aprovado e fortemente subsidiado pelo governo chinês
No dumping de bens físicos, a demanda é finita e o custo ambiental é alto, mas a demanda por software é praticamente infinita e o custo ambiental em relação ao custo de produção também é menor, então pode ser possível usar o dumping de IA contra quem o pratica
Aceita-se como se fosse uma lei natural a premissa de que a China continuará colocando os pesos dos modelos de fronteira no Hugging Face. Mas o momento Mythos da China está a poucos meses de distância e, a julgar por várias reportagens, é bem provável que a China também reaja de forma parecida
É difícil acreditar que a China vá colocar a sequência do Mythos no Hugging Face e permitir que todos removam as salvaguardas. A situação não se desenrolou como a OpenAI e a Anthropic esperavam, nem como a China esperava