Nightshade: uma ferramenta ofensiva para artistas contra geradores de arte por IA
(nightshade.cs.uchicago.edu)- Nightshade é uma ferramenta que, em resposta ao uso de imagens online no treinamento de IA generativa sem consentimento, transforma obras em amostras de poison inadequadas para o treinamento de modelos
- Listas de opt-out e do-not-scrape/robots.txt são difíceis de verificar e impor, e também é difícil identificar infratores com alto grau de confiança, deixando os criadores com poucos meios reais de controle
- As imagens transformadas não parecem muito diferentes do original para os olhos humanos, mas fazem modelos de IA aprenderem composições diferentes, induzindo resultados difíceis de prever
- Se o Glaze é uma ferramenta defensiva para impedir a imitação do estilo de artistas individuais, o Nightshade é uma ferramenta ofensiva seletiva que aumenta o custo de treinamento de modelos que fazem scraping sem consentimento
- Atualmente, o Nightshade v1.0 é uma ferramenta independente e não oferece proteção contra imitação como o Glaze, portanto deve-se evitar usá-lo sozinho em obras cujo estilo possa ser imitado
Resposta à coleta de dados de treinamento sem consentimento
- Modelos de IA generativa e seus responsáveis já demonstraram a capacidade de baixar conteúdo online para treinamento de modelos
- Proprietários de conteúdo e criadores quase não têm ferramentas para impedir que suas obras entrem em modelos de IA generativa contra sua vontade
- Listas de opt-out já foram ignoradas no passado por responsáveis por treinamento de modelos e podem ser facilmente desconsideradas sem grandes consequências
- Instruções de do-not-scrape também são difíceis de verificar e aplicar, e é difícil identificar infratores com alto grau de confiança
Como o Nightshade funciona
- O Nightshade transforma imagens em amostras de poison inadequadas para o treinamento de modelos
- Modelos treinados nessas imagens sem consentimento podem aprender comportamentos imprevisíveis que se desviam do funcionamento esperado
- Por exemplo, ao pedir uma imagem de uma “vaca voando no espaço”, o modelo pode gerar a imagem de uma bolsa flutuando no espaço
- O objetivo não é simplesmente quebrar o modelo, mas aumentar o custo de treinar com dados não autorizados, de modo que licenciar imagens dos criadores se torne uma alternativa realista
Imagens vistas de forma diferente por humanos e modelos
- O Nightshade funciona de forma semelhante ao Glaze, mas em vez de defesa contra imitação de estilo, é uma ferramenta ofensiva que distorce a representação de características dentro de modelos generativos de imagem por IA
- A transformação é calculada por uma otimização multiobjetivo que minimiza mudanças visíveis na imagem original
- Para olhos humanos, a imagem com shade parece em grande parte semelhante ao original, mas modelos de IA podem ver nela uma composição dramaticamente diferente
- Uma pessoa ainda verá praticamente a mesma imagem de uma vaca em um campo verde
- Um modelo de IA pode enxergar uma grande carteira de couro colocada sobre a grama
- Se aprender imagens com shade contendo vacas em quantidade suficiente, o modelo pode passar a ter cada vez mais certeza de que vacas têm alças marrons de couro, bolsos laterais lisos, zíperes e logotipos de marca
Efeito que persiste mesmo após transformações comuns de imagem
- O efeito do Nightshade é robusto mesmo diante de alterações comuns feitas em imagens
- O efeito de poison permanece após corte, reamostragem, compressão, smoothing de pixels e adição de ruído
- Mesmo que a imagem exibida em um monitor seja capturada por screenshot ou fotografada, o efeito de shade se mantém
- Isso ocorre porque não se trata de marca d’água nem de uma mensagem oculta de esteganografia, e portanto não é um método que se quebra facilmente
Diferença de papel entre Nightshade e Glaze
- O Glaze é uma ferramenta defensiva para proteger artistas individuais contra ataques de imitação de estilo
- O Nightshade é uma ferramenta ofensiva para que artistas, de forma coletiva, atrapalhem modelos que fazem scraping de imagens sem consentimento
- Recomenda-se aplicar Glaze a todas as obras publicadas online para proteger o próprio artista
- O Nightshade é um recurso seletivo para dissuadir responsáveis por treinamento de modelos sem escrúpulos
- Idealmente, artistas que publicam suas obras online deveriam aplicar tanto Glaze quanto Nightshade
- Uma versão integrada das duas ferramentas está em desenvolvimento
Cuidados ao usar
- As mudanças feitas pelo Nightshade podem ficar mais visíveis em obras com cores chapadas e fundos suaves
- Como o objetivo do Nightshade é atrapalhar modelos, usar baixa intensidade ou baixo nível de poison não gera resultados negativos para o dono da imagem
- Há uma configuração de baixa intensidade para usuários que querem priorizar a qualidade visual da imagem original
- Assim como ataques e defesas de segurança, não se pode assumir que o Nightshade continuará eficaz no longo prazo
- Como ferramenta ofensiva, o Nightshade pode evoluir facilmente para acompanhar possíveis contramedidas ou defesas
Forma de distribuição e processamento de dados
- O objetivo do Nightshade é descobrir e aprender coisas novas por meio de pesquisa e causar um impacto positivo no mundo
- O Nightshade foi projetado, como o Glaze, para funcionar sem rede
- Nenhum dado ou obra é enviado para a equipe do Nightshade nem para qualquer outro lugar
- O Nightshade v1.0 foi projetado como uma ferramenta independente
- A versão atual não oferece proteção contra imitação como o Glaze, portanto é preciso cuidado na forma de uso
- Se houver qualquer preocupação com imitação de estilo, não se deve publicar imagens de obras às quais apenas o Nightshade foi aplicado
- Está sendo testada uma forma de fazer Nightshade e Glaze funcionarem juntos
- Quando estiver pronto, o Nightshade será lançado como um add-on do WebGlaze para que usuários do WebGlaze possam aplicar Nightshade e Glaze de uma vez só em uma única imagem
Artigo técnico e materiais de referência
- Instruções de instalação, execução, configuração e remoção do Nightshade podem ser consultadas no User guide
- O título do artigo técnico é Nightshade: Prompt-Specific Poisoning Attacks on Text-to-Image Generative Models
- Os autores são Shawn Shan, Wenxin Ding, Josephine Passananti, Haitao Zheng e Ben Y. Zhao
- O artigo está previsto para ser publicado no 45th IEEE Symposium on Security and Privacy, que será realizado em San Francisco em maio de 2024
- O preprint é arxiv/2310.13828, divulgado em fevereiro de 2024
1 comentários
Opiniões no Hacker News
O artigo está aqui: https://arxiv.org/abs/2310.13828
Esse método parece criar artefatos em um grau que muitos artistas teriam dificuldade em aceitar: https://twitter.com/sini4ka111/status/1748378223291912567
Pelo que ouvi, a) ele mal funciona em procedimentos de treinamento de gerações anteriores, b) não pega de jeito nenhum em procedimentos mais recentes como GPT-4V, LLaVA ou até rotulagem com BLIP2, e c) mesmo que o efeito cresça e se torne amplamente usado, não seria muito difícil de contornar
O trabalho anterior dos autores, Glaze, também não parece ser muito eficaz apesar das alegações exageradas, então isto pode ser um caso academicamente interessante, mas com resultados de baixa utilidade prática no mundo real sendo supervalorizados
[1]: fornecido por /u/b3sn0w no Reddit: https://imgur.com/cI7RLAq https://imgur.com/eqe3Dyn https://imgur.com/1BMASL4
Colocar uma imagem no GPT-4V, no img2img do Stable Diffusion etc. não é treinar a IA; o modelo fica completamente fixo e não muda em nada[0]
Ainda não sei se há lugares raspando imagens novas para colocá-las no treinamento de geradores. Ouvi dizer que a OpenAI parou de fazer scraping por volta de 2021 por receio de voltar a treinar com saídas dos próprios modelos[1], e a Adobe Firefly afirma ter sido treinada com imagens do Adobe Stock, mas não sei qual é a data de corte interna da Adobe[2]
Se você quiser fazer o GPT-4V ou o Stable Diffusion travarem na etapa de inferência, o que precisa são imagens adversariais. Não sei se é possível fazer treinamento adversarial contra um modelo sem pesos, mas ouvi dizer que, se generalizar contra vários modelos independentes, dá para quebrar bastante coisa[3]
[0] A capacidade que parece aprendizado em geradores de texto vem da janela de contexto, mas isso é apenas uma memória de curto prazo de cerca de 2048 tokens, sem qualquer outra capacidade de memória
[1] Um cenário em que isso acontece é chamado, de brincadeira, de IA Habsburgo. O modelo aprende com os próprios vieses e os reforça como vieses ainda mais fortes, enquanto esquece o resto
[2] Seria especialmente irônico se o único gerador de IA prejudicado pelo Nightshade fosse justamente o que tentou ser um pouco ético
[3] Em casos extremos, imagens adversariais também enganam pessoas. Só que esses estudos mostravam as imagens por pouco tempo, com a ideia de que uma exposição curta se parece com uma rede neural feed-forward sem caminhos de computação recorrente. Se você olhar por mais tempo, fica claro que é uma foto de um objeto editada para parecer outra coisa
Remoção de ruído provavelmente já é uma boa etapa de pré-processamento de qualquer forma
O pessoal de LLM não parece ter intenção real de pagar de forma justa, e o resumo do plano de negócios basicamente inclui “roubar tudo que estiver ao alcance”
Há um mercado enorme aqui para produtos fraudulentos. Enquanto a arte tiver a condição de precisar ser vista por olhos humanos, não há como uma ferramenta dessas vencer; e, mesmo que funcione, por princípio ela será contornada imediatamente
A única forma realista de artistas, ou qualquer pessoa, impedirem que modelos sejam treinados com produção humana é a lei, isto é, usar coerção respaldada pelo Estado para desencorajar aquilo que não se quer. Isso também não é perfeito e pode, na verdade, aumentar o incentivo para desenvolver redes de treinamento distribuído que “lavem” infrações de copyright puníveis
No fim, é no mínimo uma luta perdida e, no pior caso, uma luta tola. Não dá para impedir um computador de observar uma imagem postada para que pessoas a vejam livremente; portanto, esses modelos podem ser criados com facilidade e acabarão sendo criados
Além da lei, há outros caminhos. Dá para disponibilizar a obra apenas para visualização privada e impedir que o público presente leve dispositivos de gravação. Pode parecer absurdo, mas é uma prática comum em atividades como sexo
No pior caso, é só perda de tempo; não é uma situação em que alguém é enganado a comprar algo
Agora, a única forma de sobreviver como artista é ter um estilo próprio e único e nunca colocá-lo online
Alguns meses atrás, fiz uma prova de conceito mostrando que, ao fazer ajuste fino do Stable Diffusion XL com imagens incorretas ou inconsistentes, era possível obter imagens “melhores” ao usar essas imagens como prompts negativos: https://news.ycombinator.com/item?id=37211519
Ou seja, é como especificar uma região de alta dimensão do espaço latente que a geração do modelo deve evitar. Incentivar a criação em massa de conjuntos de dados manipulados, paradoxalmente, não tem chance zero de melhorar modelos de arte de IA generativa. Isso porque o modelo pode reconhecer os dados manipulados e fazer o processo de treinamento contorná-los
Isso parece uma corrida armamentista bastante sem sentido, ou um jogo de gato e rato. Se alguém que quer treinar um modelo generativo de imagens não se importa nem um pouco com o que os artistas pensam, basta fazer um pós-processamento básico o suficiente para quebrar as alterações ajustadas com muita delicadeza pelo algoritmo do Nightshade.
Por exemplo, se reamostrar em uma resolução um pouco mais baixa e depois aumentar de novo com outro modelo de super-resolução, parece que daria para destruir esses ajustes finos sem grande diferença aos olhos humanos.
Daqui para a frente, acho provável que, por pressão social, os tribunais em geral fiquem do lado dos artistas. O artista poderá contestar imagens encontradas, e outro modelo de machine learning poderá determinar rapidamente se a imagem gerada é “parecida demais” com o estilo daquele artista. Claro, esse estilo precisa ser suficientemente diferente do de outras pessoas para que haja uma reivindicação legal razoável.
Ou talvez os artistas desistam de monetizar a imagem em si e passem a se concentrar na produção de resultados físicos. Algo parecido com músicos independentes hoje, que ganham a maior parte do dinheiro com turnês, venda de merch em casas de show e Patreon. Quando uma mudança fundamental tão grande acontece rapidamente, é muito difícil prever o futuro.
Num futuro cínico, acho que poderíamos ver mais dos chamados “artistas furry”. Assim como acontece com outras big techs, é provável que a área 18+ seja fortemente bloqueada por vários atores poderosos. Então o trabalho NSFW ficaria protegido até certo ponto do avanço, e as pessoas teriam de procurar modelos de treinamento clandestinos ou voltar a recorrer aos artistas.
The Grateful Dead implementou esse modelo de forma muito sofisticada e, às vezes, evitava deliberadamente fazer reivindicações de propriedade intelectual sobre seu trabalho. Eles acreditavam que essas reivindicações atrapalhariam seu sucesso e, no fim, formalizaram essa defesa dando a ela o nome de “The Electronic Frontier Foundation”. Não é por acaso que a EFF veio da cultura deadhead.
Também é curioso que não exista um OpenArt equivalente ao OpenSource. Claro, sei que há a diferença de que código-fonte não é feito para o público geral e pode ser escondido se alguém quiser, enquanto arte não é assim. É só um subproduto do pensamento generativo.
Se treinarem com essas imagens, acho que o modelo de IA vai ficar, na verdade, melhor em vez de pior. É como se os artistas estivessem criando gratuitamente dados de treinamento que informam que tipo de ruído não altera o significado pretendido da imagem.
Num futuro próximo, um número inacreditavelmente grande de pessoas será capaz de criar arte de alta qualidade usando apenas ferramentas prontas.
Isso é bem empolgante. Dar a bilhões de pessoas o poder de misturar estilos de que gostam, aplicá-los a novos temas e criar obras próprias, únicas e personalizadas, é uma capacidade incrivelmente incrível.
Só de modelos de IA consumirem conteúdo gerado por IA, eles entram em colapso por conta própria. Basta olhar para o colapso de modelo relacionado à IA generativa.
Quero taxas progressivas pelo uso de copyright, propriedade intelectual e patentes, e quero cooperação e legislação de governos do mundo todo. Talvez até exista uma forma de permitir o uso de obras no mundo inteiro sem autorização inicial, mas acho melhor não entrar nesse tipo de ideia maluca.
Seria bom se fossem aplicadas taxas de licenciamento escaláveis, como uma porcentagem vinculada à receita. Há o problema indireto de que margens de lucro variam por setor, mas ainda assim parece o mais justo.
Gostaria que direitos autorais pertencentes a indivíduos fossem reduzidos para até 0 anos após a morte do autor, e os pertencentes a empresas para no máximo 20 a 30 anos, no mundo todo ou começando pela UE e reduzindo aos poucos.
As punições para empresas que não declararem o uso ou não pagarem as taxas deveriam ser muito altas. Algo como 50% do lucro bruto anual ou 50% do lucro líquido: não uma simples palmada no pulso, mas algo de que não se possa escapar facilmente e que crie incentivo para nem roubar em primeiro lugar.
[*] Ou pelo período que a sociedade considerar adequado.
[**] Até que a detecção automática, para o bem ou para o mal, fique boa o suficiente.
Acho que isso permitiria o uso pessoal, incentivaria novos entrantes, estimularia a inovação e induziria lugares como a OpenAI a se comportarem melhor.
É desconfortável que os direitos expirem pouco depois da morte; também é ruim que a duração do copyright varie muito conforme a idade do autor; e também não é bom que muitas obras continuem com copyright por tempo excessivamente longo.
Não há problema nenhum em o copyright expirar durante a vida do autor. 20 a 30 anos para tudo já basta.
Ao ver essa “solução”, parece que o mundo da arte também está entrando no jogo de gato e rato que os bloqueadores de anúncios travam há 10 ou 20 anos.
Ainda sinto que é claramente errado sair raspando imagens pela internet sem consentimento para usá-las em uma IA voltada à própria monetização. Espero que mais formas de proteger obras de arte, inclusive áudio e outros formatos, se tornem mais acessíveis.
Seria um modo de fazer um modelo adicional tentar enganar o modelo principal, aumentando sua resistência a filtros do tipo Nightshade.
O texto não mostra que esse método estraga os detalhes da imagem. Basta olhar a miniatura do artigo de referência: https://arxiv.org/pdf/2310.13828.pdf
E talvez eu esteja sendo ingênuo, mas parece bastante fácil contornar isso com um filtro rápido de pré-processamento. Não sei se uma remoção de ruído tradicional seria suficiente, mas, no pior caso, basta rodar uma difusão img2img