4 pontos por GN⁺ 2024-01-21 | 1 comentários | Compartilhar no WhatsApp
  • Nightshade é uma ferramenta que, em resposta ao uso de imagens online no treinamento de IA generativa sem consentimento, transforma obras em amostras de poison inadequadas para o treinamento de modelos
  • Listas de opt-out e do-not-scrape/robots.txt são difíceis de verificar e impor, e também é difícil identificar infratores com alto grau de confiança, deixando os criadores com poucos meios reais de controle
  • As imagens transformadas não parecem muito diferentes do original para os olhos humanos, mas fazem modelos de IA aprenderem composições diferentes, induzindo resultados difíceis de prever
  • Se o Glaze é uma ferramenta defensiva para impedir a imitação do estilo de artistas individuais, o Nightshade é uma ferramenta ofensiva seletiva que aumenta o custo de treinamento de modelos que fazem scraping sem consentimento
  • Atualmente, o Nightshade v1.0 é uma ferramenta independente e não oferece proteção contra imitação como o Glaze, portanto deve-se evitar usá-lo sozinho em obras cujo estilo possa ser imitado

Resposta à coleta de dados de treinamento sem consentimento

  • Modelos de IA generativa e seus responsáveis já demonstraram a capacidade de baixar conteúdo online para treinamento de modelos
  • Proprietários de conteúdo e criadores quase não têm ferramentas para impedir que suas obras entrem em modelos de IA generativa contra sua vontade
  • Listas de opt-out já foram ignoradas no passado por responsáveis por treinamento de modelos e podem ser facilmente desconsideradas sem grandes consequências
  • Instruções de do-not-scrape também são difíceis de verificar e aplicar, e é difícil identificar infratores com alto grau de confiança

Como o Nightshade funciona

  • O Nightshade transforma imagens em amostras de poison inadequadas para o treinamento de modelos
  • Modelos treinados nessas imagens sem consentimento podem aprender comportamentos imprevisíveis que se desviam do funcionamento esperado
    • Por exemplo, ao pedir uma imagem de uma “vaca voando no espaço”, o modelo pode gerar a imagem de uma bolsa flutuando no espaço
  • O objetivo não é simplesmente quebrar o modelo, mas aumentar o custo de treinar com dados não autorizados, de modo que licenciar imagens dos criadores se torne uma alternativa realista

Imagens vistas de forma diferente por humanos e modelos

  • O Nightshade funciona de forma semelhante ao Glaze, mas em vez de defesa contra imitação de estilo, é uma ferramenta ofensiva que distorce a representação de características dentro de modelos generativos de imagem por IA
  • A transformação é calculada por uma otimização multiobjetivo que minimiza mudanças visíveis na imagem original
  • Para olhos humanos, a imagem com shade parece em grande parte semelhante ao original, mas modelos de IA podem ver nela uma composição dramaticamente diferente
    • Uma pessoa ainda verá praticamente a mesma imagem de uma vaca em um campo verde
    • Um modelo de IA pode enxergar uma grande carteira de couro colocada sobre a grama
    • Se aprender imagens com shade contendo vacas em quantidade suficiente, o modelo pode passar a ter cada vez mais certeza de que vacas têm alças marrons de couro, bolsos laterais lisos, zíperes e logotipos de marca

Efeito que persiste mesmo após transformações comuns de imagem

  • O efeito do Nightshade é robusto mesmo diante de alterações comuns feitas em imagens
  • O efeito de poison permanece após corte, reamostragem, compressão, smoothing de pixels e adição de ruído
  • Mesmo que a imagem exibida em um monitor seja capturada por screenshot ou fotografada, o efeito de shade se mantém
  • Isso ocorre porque não se trata de marca d’água nem de uma mensagem oculta de esteganografia, e portanto não é um método que se quebra facilmente

Diferença de papel entre Nightshade e Glaze

  • O Glaze é uma ferramenta defensiva para proteger artistas individuais contra ataques de imitação de estilo
  • O Nightshade é uma ferramenta ofensiva para que artistas, de forma coletiva, atrapalhem modelos que fazem scraping de imagens sem consentimento
  • Recomenda-se aplicar Glaze a todas as obras publicadas online para proteger o próprio artista
  • O Nightshade é um recurso seletivo para dissuadir responsáveis por treinamento de modelos sem escrúpulos
  • Idealmente, artistas que publicam suas obras online deveriam aplicar tanto Glaze quanto Nightshade
  • Uma versão integrada das duas ferramentas está em desenvolvimento

Cuidados ao usar

  • As mudanças feitas pelo Nightshade podem ficar mais visíveis em obras com cores chapadas e fundos suaves
  • Como o objetivo do Nightshade é atrapalhar modelos, usar baixa intensidade ou baixo nível de poison não gera resultados negativos para o dono da imagem
  • Há uma configuração de baixa intensidade para usuários que querem priorizar a qualidade visual da imagem original
  • Assim como ataques e defesas de segurança, não se pode assumir que o Nightshade continuará eficaz no longo prazo
  • Como ferramenta ofensiva, o Nightshade pode evoluir facilmente para acompanhar possíveis contramedidas ou defesas

Forma de distribuição e processamento de dados

  • O objetivo do Nightshade é descobrir e aprender coisas novas por meio de pesquisa e causar um impacto positivo no mundo
  • O Nightshade foi projetado, como o Glaze, para funcionar sem rede
  • Nenhum dado ou obra é enviado para a equipe do Nightshade nem para qualquer outro lugar
  • O Nightshade v1.0 foi projetado como uma ferramenta independente
  • A versão atual não oferece proteção contra imitação como o Glaze, portanto é preciso cuidado na forma de uso
    • Se houver qualquer preocupação com imitação de estilo, não se deve publicar imagens de obras às quais apenas o Nightshade foi aplicado
  • Está sendo testada uma forma de fazer Nightshade e Glaze funcionarem juntos
  • Quando estiver pronto, o Nightshade será lançado como um add-on do WebGlaze para que usuários do WebGlaze possam aplicar Nightshade e Glaze de uma vez só em uma única imagem

Artigo técnico e materiais de referência

  • Instruções de instalação, execução, configuração e remoção do Nightshade podem ser consultadas no User guide
  • O título do artigo técnico é Nightshade: Prompt-Specific Poisoning Attacks on Text-to-Image Generative Models
  • Os autores são Shawn Shan, Wenxin Ding, Josephine Passananti, Haitao Zheng e Ben Y. Zhao
  • O artigo está previsto para ser publicado no 45th IEEE Symposium on Security and Privacy, que será realizado em San Francisco em maio de 2024
  • O preprint é arxiv/2310.13828, divulgado em fevereiro de 2024

1 comentários

 
GN⁺ 2024-01-21
Opiniões no Hacker News
  • O artigo está aqui: https://arxiv.org/abs/2310.13828

  • Esse método parece criar artefatos em um grau que muitos artistas teriam dificuldade em aceitar: https://twitter.com/sini4ka111/status/1748378223291912567
    Pelo que ouvi, a) ele mal funciona em procedimentos de treinamento de gerações anteriores, b) não pega de jeito nenhum em procedimentos mais recentes como GPT-4V, LLaVA ou até rotulagem com BLIP2, e c) mesmo que o efeito cresça e se torne amplamente usado, não seria muito difícil de contornar
    O trabalho anterior dos autores, Glaze, também não parece ser muito eficaz apesar das alegações exageradas, então isto pode ser um caso academicamente interessante, mas com resultados de baixa utilidade prática no mundo real sendo supervalorizados
    [1]: fornecido por /u/b3sn0w no Reddit: https://imgur.com/cI7RLAq https://imgur.com/eqe3Dyn https://imgur.com/1BMASL4

    • As capturas de tela em [1] são de inferência, não de treinamento. Para ter efeito, imagens tratadas com Nightshade precisariam entrar no conjunto de dados de treinamento do gerador de imagens
      Colocar uma imagem no GPT-4V, no img2img do Stable Diffusion etc. não é treinar a IA; o modelo fica completamente fixo e não muda em nada[0]
      Ainda não sei se há lugares raspando imagens novas para colocá-las no treinamento de geradores. Ouvi dizer que a OpenAI parou de fazer scraping por volta de 2021 por receio de voltar a treinar com saídas dos próprios modelos[1], e a Adobe Firefly afirma ter sido treinada com imagens do Adobe Stock, mas não sei qual é a data de corte interna da Adobe[2]
      Se você quiser fazer o GPT-4V ou o Stable Diffusion travarem na etapa de inferência, o que precisa são imagens adversariais. Não sei se é possível fazer treinamento adversarial contra um modelo sem pesos, mas ouvi dizer que, se generalizar contra vários modelos independentes, dá para quebrar bastante coisa[3]
      [0] A capacidade que parece aprendizado em geradores de texto vem da janela de contexto, mas isso é apenas uma memória de curto prazo de cerca de 2048 tokens, sem qualquer outra capacidade de memória
      [1] Um cenário em que isso acontece é chamado, de brincadeira, de IA Habsburgo. O modelo aprende com os próprios vieses e os reforça como vieses ainda mais fortes, enquanto esquece o resto
      [2] Seria especialmente irônico se o único gerador de IA prejudicado pelo Nightshade fosse justamente o que tentou ser um pouco ético
      [3] Em casos extremos, imagens adversariais também enganam pessoas. Só que esses estudos mostravam as imagens por pouco tempo, com a ideia de que uma exposição curta se parece com uma rede neural feed-forward sem caminhos de computação recorrente. Se você olhar por mais tempo, fica claro que é uma foto de um objeto editada para parecer outra coisa
    • Mesmo no pior caso, parece que isso seria mitigado com uma simples etapa de difusão img2img e, olhando os exemplos, até um removedor de ruído tradicional provavelmente bastaria
      Remoção de ruído provavelmente já é uma boa etapa de pré-processamento de qualquer forma
    • No celular, quase não consigo notar diferença nas imagens de exemplo do Twitter
    • Talvez seja mais para “proteger” imagens que o artista quer compartilhar publicamente para divulgar o trabalho, mas que seriam inadequadas como mídia digital final
    • É óbvio que quem está roubando vai continuar ajustando o processo para neutralizar essas contramedidas. Não parece que os artistas vão vencer essa corrida armamentista
      O pessoal de LLM não parece ter intenção real de pagar de forma justa, e o resumo do plano de negócios basicamente inclui “roubar tudo que estiver ao alcance”
  • Há um mercado enorme aqui para produtos fraudulentos. Enquanto a arte tiver a condição de precisar ser vista por olhos humanos, não há como uma ferramenta dessas vencer; e, mesmo que funcione, por princípio ela será contornada imediatamente
    A única forma realista de artistas, ou qualquer pessoa, impedirem que modelos sejam treinados com produção humana é a lei, isto é, usar coerção respaldada pelo Estado para desencorajar aquilo que não se quer. Isso também não é perfeito e pode, na verdade, aumentar o incentivo para desenvolver redes de treinamento distribuído que “lavem” infrações de copyright puníveis
    No fim, é no mínimo uma luta perdida e, no pior caso, uma luta tola. Não dá para impedir um computador de observar uma imagem postada para que pessoas a vejam livremente; portanto, esses modelos podem ser criados com facilidade e acabarão sendo criados

    • Só pelo nível das alegações, acompanhadas pelo entusiasmo de um público com baixo letramento técnico, já parece e soa como produto fraudulento sem precisar investigar a fundo
      Além da lei, há outros caminhos. Dá para disponibilizar a obra apenas para visualização privada e impedir que o público presente leve dispositivos de gravação. Pode parecer absurdo, mas é uma prática comum em atividades como sexo
    • Ao contrário de “se a arte precisa ser visível à percepção humana, não há como uma ferramenta dessas vencer”, é interessante pensar que um ambiente adversarial também pode empurrar os modelos para um aprendizado de representações mais alinhado à percepção humana
    • É o velho problema do buraco analógico: https://en.m.wikipedia.org/wiki/Analog_hole
    • A ferramenta é gratuita e, pelo que parece, roda localmente. Se não está vendendo nada e não há motivo de lucro, é difícil chamá-la razoavelmente de produto fraudulento
      No pior caso, é só perda de tempo; não é uma situação em que alguém é enganado a comprar algo
    • Essa é a realidade dura. Não dá para colocar o gênio que já saiu de volta na garrafa
      Agora, a única forma de sobreviver como artista é ter um estilo próprio e único e nunca colocá-lo online
  • Alguns meses atrás, fiz uma prova de conceito mostrando que, ao fazer ajuste fino do Stable Diffusion XL com imagens incorretas ou inconsistentes, era possível obter imagens “melhores” ao usar essas imagens como prompts negativos: https://news.ycombinator.com/item?id=37211519
    Ou seja, é como especificar uma região de alta dimensão do espaço latente que a geração do modelo deve evitar. Incentivar a criação em massa de conjuntos de dados manipulados, paradoxalmente, não tem chance zero de melhorar modelos de arte de IA generativa. Isso porque o modelo pode reconhecer os dados manipulados e fazer o processo de treinamento contorná-los

  • Isso parece uma corrida armamentista bastante sem sentido, ou um jogo de gato e rato. Se alguém que quer treinar um modelo generativo de imagens não se importa nem um pouco com o que os artistas pensam, basta fazer um pós-processamento básico o suficiente para quebrar as alterações ajustadas com muita delicadeza pelo algoritmo do Nightshade.
    Por exemplo, se reamostrar em uma resolução um pouco mais baixa e depois aumentar de novo com outro modelo de super-resolução, parece que daria para destruir esses ajustes finos sem grande diferença aos olhos humanos.
    Daqui para a frente, acho provável que, por pressão social, os tribunais em geral fiquem do lado dos artistas. O artista poderá contestar imagens encontradas, e outro modelo de machine learning poderá determinar rapidamente se a imagem gerada é “parecida demais” com o estilo daquele artista. Claro, esse estilo precisa ser suficientemente diferente do de outras pessoas para que haja uma reivindicação legal razoável.
    Ou talvez os artistas desistam de monetizar a imagem em si e passem a se concentrar na produção de resultados físicos. Algo parecido com músicos independentes hoje, que ganham a maior parte do dinheiro com turnês, venda de merch em casas de show e Patreon. Quando uma mudança fundamental tão grande acontece rapidamente, é muito difícil prever o futuro.

    • A arte já não é uma profissão sustentável para a maioria das pessoas que não conseguem empregos na indústria. A forma mais comum de monetização são comissões, ou esconder conteúdo adicional atrás de um paywall.
      Num futuro cínico, acho que poderíamos ver mais dos chamados “artistas furry”. Assim como acontece com outras big techs, é provável que a área 18+ seja fortemente bloqueada por vários atores poderosos. Então o trabalho NSFW ficaria protegido até certo ponto do avanço, e as pessoas teriam de procurar modelos de treinamento clandestinos ou voltar a recorrer aos artistas.
    • Se há algum “sentido” nisso, é o de pressionar os modelos de IA a capturar melhor a forma como as pessoas veem as coisas.
    • O modelo em que músicos hoje ganham a maior parte do dinheiro com turnês e venda de merch em shows era, e sempre foi, o padrão na linhagem que passou a ser chamada de música “tradicional”, “Americana” e “Appalachian”.
      The Grateful Dead implementou esse modelo de forma muito sofisticada e, às vezes, evitava deliberadamente fazer reivindicações de propriedade intelectual sobre seu trabalho. Eles acreditavam que essas reivindicações atrapalhariam seu sucesso e, no fim, formalizaram essa defesa dando a ela o nome de “The Electronic Frontier Foundation”. Não é por acaso que a EFF veio da cultura deadhead.
    • De um ponto de vista estranho, é bem engraçado ver artistas irritados por perderem o monopólio de roubar e copiar componentes de outros artistas e recombiná-los em algo parecido, mas novo.
      Também é curioso que não exista um OpenArt equivalente ao OpenSource. Claro, sei que há a diferença de que código-fonte não é feito para o público geral e pode ser escondido se alguém quiser, enquanto arte não é assim. É só um subproduto do pensamento generativo.
    • O ponto principal é que, mesmo que um Nightshade isolado possa ser contornado, enquanto o jogo de gato e rato continuar, mais contramedidas poderão surgir.
  • Se treinarem com essas imagens, acho que o modelo de IA vai ficar, na verdade, melhor em vez de pior. É como se os artistas estivessem criando gratuitamente dados de treinamento que informam que tipo de ruído não altera o significado pretendido da imagem.

  • Num futuro próximo, um número inacreditavelmente grande de pessoas será capaz de criar arte de alta qualidade usando apenas ferramentas prontas.
    Isso é bem empolgante. Dar a bilhões de pessoas o poder de misturar estilos de que gostam, aplicá-los a novos temas e criar obras próprias, únicas e personalizadas, é uma capacidade incrivelmente incrível.

    • Na arte, o público tende a valorizar a origem e o processo mais do que o resultado. Daqui a alguns anos, quando conteúdos gerados por IA forem comuns, as pessoas vão desprezar a arte feita por IA.
    • Nesse processo, ferramentas como o Nightshade se tornarão desnecessárias.
      Só de modelos de IA consumirem conteúdo gerado por IA, eles entram em colapso por conta própria. Basta olhar para o colapso de modelo relacionado à IA generativa.
    • Será uma ferramenta tão incrível quanto a capacidade de acessar a internet. Ou seja, será comoditizada, transacional e entediante.
    • Para isso, milhões de pessoas tiveram de ser alienadas do próprio trabalho.
    • Não necessariamente. Há um motivo para acharmos a pintura realista mais interessante do que a fotografia, e para ainda haver gente que continua pintando. O esforço investido por outro artista influencia nossa apreciação.
  • Quero taxas progressivas pelo uso de copyright, propriedade intelectual e patentes, e quero cooperação e legislação de governos do mundo todo. Talvez até exista uma forma de permitir o uso de obras no mundo inteiro sem autorização inicial, mas acho melhor não entrar nesse tipo de ideia maluca.
    Seria bom se fossem aplicadas taxas de licenciamento escaláveis, como uma porcentagem vinculada à receita. Há o problema indireto de que margens de lucro variam por setor, mas ainda assim parece o mais justo.
    Gostaria que direitos autorais pertencentes a indivíduos fossem reduzidos para até 0 anos após a morte do autor, e os pertencentes a empresas para no máximo 20 a 30 anos, no mundo todo ou começando pela UE e reduzindo aos poucos.
    As punições para empresas que não declararem o uso ou não pagarem as taxas deveriam ser muito altas. Algo como 50% do lucro bruto anual ou 50% do lucro líquido: não uma simples palmada no pulso, mas algo de que não se possa escapar facilmente e que crie incentivo para nem roubar em primeiro lugar.
    [*] Ou pelo período que a sociedade considerar adequado.
    [**] Até que a detecção automática, para o bem ou para o mal, fique boa o suficiente.
    Acho que isso permitiria o uso pessoal, incentivaria novos entrantes, estimularia a inovação e induziria lugares como a OpenAI a se comportarem melhor.

    • Não sei por que seria preciso tomar o momento da morte como referência.
      É desconfortável que os direitos expirem pouco depois da morte; também é ruim que a duração do copyright varie muito conforme a idade do autor; e também não é bom que muitas obras continuem com copyright por tempo excessivamente longo.
      Não há problema nenhum em o copyright expirar durante a vida do autor. 20 a 30 anos para tudo já basta.
    • Achar que algo assim pode ser aplicado em nível suficiente é extremamente ingênuo. O copyright está fundamentalmente quebrado, e colocar um band-aid com décadas de atraso provavelmente não terá muito efeito.
  • Ao ver essa “solução”, parece que o mundo da arte também está entrando no jogo de gato e rato que os bloqueadores de anúncios travam há 10 ou 20 anos.

    • Acabei de testar com a classificação de imagens do Azure AI e funcionou. Portanto, este gato ainda não se adaptou à ideia mais recente do rato.
      Ainda sinto que é claramente errado sair raspando imagens pela internet sem consentimento para usá-las em uma IA voltada à própria monetização. Espero que mais formas de proteger obras de arte, inclusive áudio e outros formatos, se tornem mais acessíveis.
    • Posso estar deixando passar algo porque não conheço bem a estrutura do Nightshade nem dos geradores de arte por IA, mas fico me perguntando se não daria para usar uma estrutura tipo GAN na parte que rotula imagens para o gerador.
      Seria um modo de fazer um modelo adicional tentar enganar o modelo principal, aumentando sua resistência a filtros do tipo Nightshade.
  • O texto não mostra que esse método estraga os detalhes da imagem. Basta olhar a miniatura do artigo de referência: https://arxiv.org/pdf/2310.13828.pdf
    E talvez eu esteja sendo ingênuo, mas parece bastante fácil contornar isso com um filtro rápido de pré-processamento. Não sei se uma remoção de ruído tradicional seria suficiente, mas, no pior caso, basta rodar uma difusão img2img

    • Imagens contaminadas não são para apreciação; elas existem para serem raspadas e passarem por uma verificação humana básica. Como seria necessário remover o ruído do conjunto de dados inteiro, fazer isso não é realista; o ponto principal é que essas imagens são quase indistinguíveis de exemplos comuns de conjuntos de treinamento e, ainda assim, com apenas poucas amostras contaminadas, conseguem deslocar arbitrariamente a frequência de prompts