1 pontos por GN⁺ 3 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • Após o lançamento do Kimi K3, aumentaram as vozes que veem a IA open source como uma ameaça perigosa, mas o software proprietário também é construído sobre bases open source, e modelos de IA também são produtos de software
  • Empresas comerciais desenvolvem em conjunto componentes inferiores que não geram diferenciação e competem nos produtos de nível superior; por isso, modelos de IA também podem se tornar uma commoditie, embora laboratórios de fronteira tenham incentivos para não querer isso
  • Como nos casos de PGP e SSL, é muito difícil suprimir software open source; mesmo que se tente regular modelos chineses, a destilação e o fine-tuning tornam ambíguo o critério de nacionalidade, de modo que apenas usuários americanos podem acabar limitados
  • Nvidia, startups americanas, usuários corporativos de IA e empresas como Google e Meta têm, cada um por seus próprios motivos de negócios, incentivos para desenvolver modelos open source; modelos gratuitos podem se tornar um recurso da transição para a IA para que países absorvam novas tecnologias e façam a economia crescer
  • Os argumentos que temem dumping, propaganda e backdoors da China ignoram a possibilidade de copiar, modificar e inspecionar software; a IA open source é poderosa e difícil de controlar, então há grande chance de continuar se espalhando apesar de tentativas de contenção política

Como o open source sustenta o software comercial

  • Dean Ball, da OpenAI, afirmou em post no X que, se modelos de pesos abertos passarem a dominar, pode surgir um “comunismo da IA”, em que a IA deixa de ser um bem de mercado e se torna um bem público
  • A lógica dos laboratórios de fronteira é que modelos open source são perigosos, portanto só gatekeepers responsáveis e usuários confiáveis deveriam ter acesso a eles; porém, na prática, todo o software proprietário é construído sobre open source
  • Produtos de software têm uma estrutura em camadas, formada por vários programas empilhados
    • Para criar um serviço como o Uber, são necessários muitos componentes: frameworks de linguagem de programação, software para envio e recebimento de tráfego web, ferramentas de análise de dados etc.
    • A maioria desses componentes inferiores não diferencia uma empresa, então faz mais sentido desenvolvê-los em conjunto e competir na camada superior, onde a diferenciação de fato acontece
  • Laboratórios de fronteira não querem que modelos de IA virem componentes genéricos e comuns demais para justificar competição, mas ainda não está definido se isso de fato vai acontecer
  • Aqui, modelo open source significa modelo de pesos abertos

Por que é difícil suprimir o open source

  • É extremamente difícil suprimir software open source, e tentativas de contenção podem enfraquecer empresas nacionais diante de concorrentes internacionais
  • Quando Phil Zimmermann criou o PGP em 1991, o governo dos EUA tratava criptografia como tecnologia militar e iniciou uma investigação criminal contra Zimmermann
  • Quando a Netscape desenvolveu o SSL, o governo dos EUA só permitiu que versões enfraquecidas fossem distribuídas no exterior
    • Essa versão internacional enfraquecida circulou com mais facilidade, e muitos americanos também passaram a usá-la
    • Os controles de exportação não impediram a disseminação da criptografia e ainda acabaram prejudicando os próprios americanos
  • Ferramentas de criptografia como SSL e PGP continuaram sendo usadas no mundo todo, e tribunais entenderam que a publicação de código-fonte de criptografia era uma forma de expressão protegida
  • Depois disso, o governo dos EUA afrouxou os controles de exportação de criptografia

Por que é difícil regular apenas modelos chineses

  • O próprio critério para determinar a nacionalidade de um modelo é ambíguo
    • Não está claro se um modelo destilado de um modelo americano deveria ser considerado um modelo chinês
    • Também não é claro de que país seria um modelo chinês ajustado por fine-tuning por um americano
  • No máximo, esse tipo de regulação pode impor aos americanos custos administrativos temporários e acesso limitado à IA, deixando-os em desvantagem em relação a outros países

Incentivos para criar IA open source fora da China

  • IA open source não é uma tecnologia que só o governo chinês teria incentivo para desenvolver; vários atores comerciais podem participar por seus próprios motivos de negócio
  • Fabricantes de chips

    • Jensen Huang, CEO da Nvidia, chama o que a Nvidia produz de “fábricas de tokens”
    • Para a Nvidia, tanto faz se a demanda por tokens vier de modelos de fronteira ou de modelos open source baratos, desde que o máximo possível de tokens rode em seus chips
    • A empresa também lançou sua própria família de modelos open source Nemotron
    • O enorme capital investido no treinamento de modelos de fronteira também beneficia a Nvidia, mas, no longo prazo, ela continua ganhando mesmo que a demanda por tokens comerciais seja substituída por demanda por tokens open source
  • Startups americanas

    • A Thinking Machines Lab lançou o poderoso modelo open source Inkling
    • A avaliação é que, se o modelo virar commoditie, ainda dá para construir uma vantagem competitiva defensável em serviços complementares ou customizações
  • Usuários corporativos de IA

    • Hoje eles ainda não são muito ativos no desenvolvimento de IA open source, mas tendem a querer modelos mais baratos para tarefas menos complexas
    • Também precisam de controle mais detalhado sobre recursos voltados ao cliente
  • Grandes empresas de tecnologia

    • Google e Meta não podem deixar de observar o novo produto de anúncios da OpenAI
    • Se o negócio de publicidade de modelos de fronteira crescer, elas passam a ter incentivo para transformar modelos open source sem anúncios em commoditie e, assim, conter a concorrência em anúncios

O objetivo ambíguo da “competição em IA”

  • As preocupações com modelos chineses costumam se concentrar na ideia de perder a competição em IA, mas não está claro sequer se o objetivo é desenvolver o melhor modelo ou vender a maior quantidade de tokens
  • Diferentemente de mandar um foguete à Lua primeiro, a competição em IA é o processo de responder a uma nova tecnologia transformadora, então a expressão é tão ambígua quanto “competição pela internet”
  • Se existe competição entre países, o ponto central é absorver a transição tecnológica e fazer a economia crescer; por esse critério, modelos de IA gratuitos não são uma ameaça, mas uma vantagem

O argumento do dumping de IA pela China

  • Scott Galloway argumenta que a China dominou mercados ao igualar a qualidade ocidental em painéis solares, aço, veículos elétricos e baterias, reduzindo os preços a um terço, e que poderia aplicar a mesma estratégia à IA gratuita
  • Mas, tirando os chips, a IA não é um bem físico
    • Painéis solares e aço dependem de cadeias de suprimento físicas em que cada etapa dificilmente se sustenta de forma isolada
    • Se um país não fabrica painéis solares, também fica mais difícil desenvolver um setor de wafers de silício para energia solar
  • Em software, o surgimento de modelos open source na China não impede negócios americanos de fine-tuning; pelo contrário, pode servir de base para eles

Viés de propaganda e modificação de modelos

  • Não é irracional supor que modelos chineses possam incluir viés pró-China, mas é difícil usar isso como justificativa para suprimi-los
  • Se o problema forem os vieses políticos de um modelo open source, usuários americanos podem modificá-lo e redistribuí-lo como um modelo “americanizado”
  • No mercado americano, um modelo distorcido com viés pró-China dificilmente superaria um modelo com viés pró-EUA de desempenho semelhante

A relação entre backdoors e inspeção pública

  • A IA não muda a estrutura básica do mercado de vulnerabilidades: atores responsáveis corrigem falhas, e atacantes as exploram
  • Limitar as ferramentas de atores responsáveis só favorece os atacantes
  • Em teoria, é possível que agentes maliciosos insiram comportamentos adversariais ocultos em um modelo
  • Atores responsáveis precisam encontrar esse tipo de comportamento o mais rápido possível, e a forma mais eficaz de fazer isso é permitir que qualquer pessoa inspecione o modelo

A competitividade de modelos de fronteira e agentes de código

  • Não há garantia de que provedores de fronteira também dominarão os mercados fora da fronteira
    • No desenvolvimento de modelos pequenos, o acesso a capital massivo é menos importante
    • Provedores de fronteira podem preferir direcionar usuários para modelos mais caros, então têm menos incentivo para desenvolver agressivamente modelos pequenos
  • O lock-in de Claude Code e Codex se parece mais com Coca-Cola e Pepsi: depois de escolher um, há pouco motivo para trocar, desde que custo e qualidade sejam parecidos
  • Agentes de código não têm vantagem competitiva defensável; basta um pequeno incômodo — diferença de preço, qualidade do modelo ou problemas de confiabilidade — para que usuários migrem para outro agente

A disseminação da IA open source

  • A IA open source é poderosa e difícil de controlar, o que dificulta barrá-la apenas com a preferência de formuladores de políticas ou líderes empresariais
  • Tentativas de conter sua disseminação criam apenas ruído temporário, mas não impedem a chegada da IA open source

1 comentários

 
GN⁺ 3 시간 전
Opiniões no Hacker News
  • Isso não é IA open source. Para ser open source, seria preciso ter o código-fonte do Photoshop e uma licença OSI; se apenas o binário for divulgado, isso corresponde a pesos abertos, e um app web SaaS é um modelo fechado, como GPT ou Opus/Fable
    O modelo chinês em questão apenas permite executar o binário no próprio ambiente, em vez de usar uma API. Se você quer open source de verdade, deve olhar para projetos como o OLMo 3: https://allenai.org/

    • É verdade que, entre os modelos chineses atuais, não há nenhuma família no nível de OLMo/Nemotron que forneça uma documentação reproduzível com modelo, dados, checkpoints, avaliações, código e todo o processo de base/inferência/instrução/RLVR
      Ainda assim, componentes como MAP-Neo·YuLan-Mini, para pré-treinamento transparente, e DAPO/verl·Open-Reasoner-Zero, para aprendizado por reforço de raciocínio, existem distribuídos em vários projetos. Uma versão chinesa do OLMo é questão de tempo e, considerando também esforços do setor público ao redor do mundo, como o Apertus da Suíça e o LLM-jp-4 do Japão, parece provável que até 2027 surja uma documentação totalmente open source que permita até indivíduos reproduzirem modelos de ponta pelo menos no nível de 2023–2024
    • Tratar modelos de pesos abertos como se fossem o mesmo que binários fechados é absurdo. Pesos abertos podem ser ajustados por fine-tuning, enquanto modificar um binário fechado para um propósito específico é muito mais difícil
    • IA open source é difícil de fazer. Mesmo modelos pequenos exigem recursos enormes, então o modo tradicional do software open source, em que indivíduos podiam criar no tempo livre partes centrais da infraestrutura mundial, não se aplica diretamente
      Está mais perto de pesquisa científica, exigindo financiamento público e instituições confiáveis para administrá-lo. Espero que o Allen AI cumpra esse papel, mas é duvidoso que os EUA estejam caminhando para o investimento necessário em IA de interesse público. Além disso, Photoshop é uma comparação inadequada com modelos de pesos abertos. Uma cópia do Photoshop não pode ser distribuída legalmente, mas o GLM 5.2 pode; se for comparar, seria melhor usar um aplicativo proprietário gratuito
    • O custo central de produzir código-fonte são os milhões de dólares pagos a engenheiros de software, e o software open source permite que outras pessoas se beneficiem desse investimento. O custo central de um modelo de IA é o treinamento na casa dos milhões de dólares, e modelos abertos também permitem que outros aproveitem o resultado desse investimento
      Mesmo que você receba todos os dados de treinamento e a arquitetura, não vai retreinar do zero para modificar o modelo; vai ajustar o comportamento desejado por fine-tuning. Assim como chamamos de open source um software quando ele pode ser modificado, um modelo pode ser visto como aberto se puder passar por fine-tuning
    • Como parte da lógica do texto depende de “basta corrigir o treinamento”, é válido apontar as limitações dos pesos abertos. Ainda que treinamento adicional seja possível, não dá para remover o treinamento existente, então é difícil afirmar de forma justa que “basta treinar de novo de acordo com aquela nacionalidade”
      Na prática, para treinar um modelo equivalente do zero, é preciso open source de verdade
  • A ansiedade em torno dos modelos chineses se concentra em “ficar para trás na corrida da IA”, mas o objetivo que alguns mencionam é alcançar uma espécie de singularidade. Mesmo sem acreditar na interpretação de ficção científica, há um argumento realista de que certos avanços no desenvolvimento de IA possam se tornar, na prática, armas extremamente poderosas
    Altman também já declarou publicamente que isso acabará acontecendo e que ele quer ser quem vai criá-lo. Mesmo que não seja superinteligência, se máquinas puderem explorar vulnerabilidades de cibersegurança, isso já é preocupante o suficiente para governos; recentemente, o governo dos EUA também usou essa justificativa ao proibir modelos americanos. Mesmo sem acreditar na singularidade, é fácil entender que alguns a vejam como o objetivo da corrida da IA

    • Se a IA se tornar uma arma extremamente poderosa, por que deveríamos confiar sua posse a empresas privadas? Se ela puder ser baixada publicamente, também não há motivo para proibir apenas o acesso de cidadãos americanos
    • Se eles querem sacrificar vidas reais por uma remota possibilidade de iluminação e deificação, parecem precisar de ajuda profissional
    • O caso OpenAI/Hugging Face comprova a necessidade de modelos abertos. Em sua análise pós-incidente, a Hugging Face disse que identificou rapidamente que a ameaça tinha origem em IA avançada e tentou analisar dados de telemetria suspeitos com modelos de ponta, mas falhou por causa das salvaguardas dos modelos
      Em vez disso, executaram o GLM, que não tinha essas salvaguardas, analisaram os dados e encontraram a causa raiz. Para que empresas avaliem ameaças corretamente, também precisam de modelos com salvaguardas minimizadas. Se não houver IA de pesos abertos para inspecionar IAs de ponta fora de controle, desaparece também o meio de resposta
    • Essas pessoas não aprenderam pensamento sistêmico, ou não conseguem aplicá-lo ao fato de que a IA não é um sistema fechado
    • Concordo com a tese geral, mas, se o Ocidente criar a “IA definitiva”, é bem provável que ela seja desenvolvida com dinheiro de vários investidores privados. Até a China dependerá de investidores que esperam retorno, e eles querem lucros distribuíveis, não uma única singularidade indivisível
      Investidores esperam receita contínua antes da singularidade, então as empresas precisam vender modelos. Se bloquearem a geração atual, não conseguirão obter dinheiro para criar a próxima, o que vira um equilíbrio difícil
  • É engraçado que, apenas 4 dias depois de um executivo da OpenAI espalhar pânico dizendo que “um agente sem vida, invisível, perigoso e infinitamente autorreplicante escapou de um laboratório chinês”, tenha saído isto: https://news.ycombinator.com/item?id=48997548

  • Pode haver discordância razoável sobre o nível das preocupações de segurança da IA no curto a médio prazo. Mas o fato de o texto não tratar desses argumentos reduz muito seu valor

    • Ele tentou abordar segurança, ainda que brevemente, nas partes sobre backdoors e propaganda. Fico curioso sobre o que você gostaria de ter visto
      A perspectiva do texto é comparar IA aberta e fechada, e ele não dedicou muito espaço ao tema porque não vê grande diferença nas preocupações de segurança entre os dois modelos
  • O motivo para se oporem à IA que roda livremente em local é que as empresas querem controlar o público em geral. Os EUA são um inferno centrado em empresas

    • Se, depois de ler o texto original, alguém concluir categoricamente que não há nenhuma preocupação legítima de segurança que pessoas razoáveis possam ter, então o texto teve o efeito oposto ao de fazer o leitor entender: [1] https://news.ycombinator.com/item?id=49029303
  • LLMs são treinados não apenas com dados públicos, mas também com dados obtidos ilegalmente. O acordo de US$ 1,5 bilhão da Anthropic é um exemplo disso, e LLMs não são nada sem enormes volumes de dados humanos
    Pode-se argumentar que esse tipo de pesquisa deveria ficar restrito ao governo e a universidades regulamentadas, em vez de empresas de capital aberto opacas e com incentivos conflitantes, ou ser gerido por uma comunidade verdadeiramente sem fins lucrativos, com uma estrutura de governança democrática, como padrões da internet e telecomunicações. Por mais que exibam virtude, é difícil acreditar que empresas privadas vão se autorregular de forma eficaz e informar de maneira transparente o público e a comunidade científica sobre os riscos; os conflitos de interesse contínuos minam sua credibilidade

  • Dizer “não dá para impedir X” é um argumento preguiçoso e péssimo para sustentar a conclusão de que “X não é ruim”. Não tenho mais nada a dizer sobre o restante do texto

    • Por outro lado, para defender que “X deve ser impedido”, também é preciso apresentar um método realista
      Minha posição é que não é possível impedir a IA de código aberto, e que tentativas de fazê-lo inevitavelmente darão mais poder a atores mal-intencionados do que a atores bem-intencionados
  • O dinheiro de lobby não liga para esse tipo de discussão

    • No fim, o ponto é que o dinheiro consegue o resultado que quer
  • Backdoors continuam sendo encontrados em roteadores e equipamentos de rede chineses. Tenho dúvidas de que venha a existir uma forma de auditar completamente modelos chineses

    • Existe alguma forma de auditar completamente modelos americanos? Pelo menos os modelos chineses abrem os pesos, então há ao menos uma possibilidade real de auditoria
    • Modelos chineses fornecem os pesos, então você pode executar por conta própria as verificações que quiser. Já os modelos americanos bloqueiam o acesso dizendo que são poderosos demais para pessoas comuns como nós usarem, mas pedem que acreditemos que tudo é pelo interesse dos cidadãos
    • Primeiro é preciso deixar claro exatamente o que se quer auditar. Backdoors em hardware são fáceis de entender, porque permitem o acesso de pessoas não autorizadas pelo cliente
      Um modelo com pesos abertos não está preso a uma camada de execução específica, então a área de segurança realmente preocupante se limita aos próprios pesos. É preciso especificar se a preocupação é injeção adversarial de instruções, distorção histórica e injeção de propaganda, ou algum outro caminho pelo qual um modelo não soberano se torne especialmente mais perigoso que um modelo soberano
  • Este texto não aborda de forma alguma as questões de segurança. O que impede um agente mal-intencionado de ajustar pesos abertos e executar golpes totalmente automatizados e de nível genial mirando praticamente qualquer indivíduo?

    • Você quer dizer algo como o ChatGPT hackear o Hugging Face? Também não há como impedir um provedor de pesos fechados de aplicar golpes de nível genial, e nem sequer dá para saber que método e que modelo foram usados
      No fim, para impedir o uso indevido de pesos fechados, sejam eles ajustados ou pré-treinados, o lado do bem também precisa de pesos abertos
    • O que impede alguém de fazer a mesma coisa agora, sem LLM, só um pouco mais devagar?
    • O que impede alguém de carregar milhares de litros de gasolina em um caminhão alugado num posto e avançar contra um hospital? A maioria das pessoas não é terrorista, e não dá para declarar algo perigoso só porque esse objeto pode ser um componente de um plano criminoso sofisticado
    • Como fechar de novo a caixa de Pandora que já foi aberta? Segurança não é permitir acesso apenas às pessoas preferidas pelo governo
      A ganância dos executivos de IA abriu a caixa, e agora eles procuram desesperadamente uma forma de ficar só com os lucros, sem assumir responsabilidade pelas consequências
    • Confiar no governo e nas big techs também não é solução. Mesmo com pesos abertos, no fim eles rodam no hardware de outra pessoa
      Se você tem dinheiro para rodar localmente, também consegue fazer coisas muito piores do que golpes. Basta perguntar a um lobista