1 pontos por GN⁺ 2023-10-04 | 1 comentários | Compartilhar no WhatsApp
  • Um experimento para reverter as paródias de Weird Al Yankovic para a voz dos cantores originais mostra que a clonagem de voz não é uma tecnologia que muda apenas a voz, mas também revela pronúncia, entonação e hábitos de canto
  • A comunidade de covers com A.I. distribui modelos, ferramentas e dicas principalmente pelo A.I. Hub Discord e pelo Hugging Face, crescendo rapidamente na interseção entre experimentos não comerciais e uma zona cinzenta de direitos autorais
  • Mesmo usando modelos de Michael Jackson, Madonna, Kurt Cobain, Lady Gaga e Lorde, a tessitura do vocal de entrada e a interpretação exagerada característica de Weird Al permanecem, deixando o resultado mais perto de uma sombra de Weird Al do que do cantor original
  • Google Colab e AICoverGen permitem que usuários sem GPU também criem covers com A.I., enquanto apps como Kits AI, Voicify AI, Voiceflip, voicemy.ai e covers.ai reduzem a barreira de uso
  • A pressão da RIAA sobre direitos autorais e o banimento permanente do A.I. Hub pelo Discord mostram que a clonagem de voz deixou de ser apenas um experimento divertido da internet e passou a se espalhar para conflitos legais entre a operação de comunidades e a indústria musical

Experimento para devolver músicas de Weird Al aos cantores originais

  • Partindo da premissa do filme Weird: The Al Yankovic Story, o experimento usou clonagem de voz por A.I. para imaginar como soariam as paródias de Weird Al Yankovic se elas fossem as músicas originais e os cantores originais as estivessem fazendo cover
  • O primeiro alvo foi Michael Jackson cantando “Eat It”, de Weird Al
    • A música original de Michael Jackson é afinada mais baixo que a paródia de Weird Al, enquanto o vocal é cantado mais alto; a tentativa foi subir o vocal em uma oitava e baixar a faixa inteira em meia oitava para ajustar
    • Mesmo ignorando os artefatos, o resultado soava mais como Michael Jackson imitando Weird Al do que como Michael Jackson, e a pronúncia exagerada para destacar as piadas permaneceu intacta
  • Foram testados seis modelos de voz de A.I. de Michael Jackson, mas as diferenças nos resultados não foram grandes
    • Um modelo foi treinado por 300 epochs com 7 horas de vocais, mas em geral considera-se que bons modelos não precisam de mais de 15 minutos de áudio limpo
    • No experimento com “Fat”, foi usado um modelo treinado com faixas de Destiny, Off The Wall e Thriller
  • A voz e a pronúncia peculiares de Weird Al não desaparecem facilmente mesmo quando cobertas por outras vozes geradas por A.I., deixando uma ressonância estranha ao longo de todo o experimento

Comunidade de covers com A.I. e estrutura de distribuição de modelos

  • No centro da comunidade de covers com A.I. havia o Discord A.I. Hub, com mais de 500 mil pessoas, onde os membros trocavam dicas, ferramentas, técnicas e links para músicas originais e covers
  • A comunidade adicionava diariamente centenas de novos modelos de voz a um banco de dados em threads do Discord
    • As categorias populares iam além de músicos, incluindo personagens virtuais, personagens de anime, YouTubers, streamers e celebridades
    • Exemplos recentes de modelos incluíam Francoise Hardy, Donald Duck, todos os membros do VCHA, Markiplier, Tom Waits, LeBron James, Knuckles e Adolf Hitler
  • Discussões e links de modelos circulavam no Discord, mas os arquivos em si eram quase todos hospedados no Hugging Face
    • Em agosto de 2023, o Hugging Face levantou US$ 235 milhões em uma Series D com participação de Google, Amazon, Nvidia, Salesforce, AMD, Intel, IBM, Qualcomm e outras, chegando a uma avaliação de US$ 4,5 bilhões
    • O A.I. Hub exigia links do Hugging Face para registrar modelos, e o AICoverGen também recomendava, na interface e nos exemplos, o uso de links diretos para modelos no Hugging Face
  • Alguns usuários reuniam centenas ou milhares de modelos criados por outras pessoas em enormes repositórios
    • Uma conta mantinha quase 4.000 modelos de voz de celebridades, músicos, personagens de desenho animado, personalidades do YouTube e outros

Pressão por direitos autorais e banimento do A.I. Hub

  • A RIAA tinha conhecimento do A.I. Hub e questionava o upload de datasets com músicas originais protegidas por direitos autorais usadas para treinar modelos de voz
  • Em junho de 2023, a RIAA exigiu que o Discord fechasse o A.I. Hub, removesse links para arquivos infratores e revelasse a identidade dos uploaders
  • Depois disso, o A.I. Hub passou a impor regras rígidas para links de datasets protegidos por direitos autorais, especialmente links para arquivos de vocais separados por processamento de A.I. usados no treinamento de novos modelos de voz
  • Na época da publicação do texto, não havia casos confirmados de medidas da RIAA contra modelos de A.I. em si ou contra criadores de modelos
  • Dois dias após a publicação do texto, o Discord baniu permanentemente o A.I. Hub
    • Ernesto Van der Sar, do TorrentFreak, foi o primeiro a noticiar o caso
    • Segundo relatos não verificados em um novo servidor, alguém editou uma postagem para adicionar links a conteúdo protegido por direitos autorais, e por isso o Discord não teria tido escolha além de processar a DMCA

Resultados de covers de Weird Al feitos com modelos de vários cantores

  • No experimento com Madonna cantando “Like A Surgeon”, foi usado um modelo treinado por 500 epochs com 13 minutos de acapellas limpas em qualidade de estúdio do álbum Like a Virgin, de 1984
    • Como a tessitura vocal de Madonna é muito mais alta que a de Weird Al, foi aplicado um pitch shift de uma oitava
    • O resultado soa como um vocal feminino, mas lembra apenas vagamente a Madonna dos anos 1980
  • No experimento com Kurt Cobain cantando “Smells Like Nirvana”, vários modelos foram testados, e o melhor modelo foi criado pelo YouTuber @Cleberslk
    • O criador escreveu que “fez o modelo às pressas pelo celular”
    • O resultado trazia um sotaque europeu difícil de explicar
  • No experimento com Lady Gaga cantando “Perform This Way”, foi usado um modelo RVC criado por @udrivemecrazy
    • Esse modelo usava apenas 5 minutos de “acapellas muito limpas”
  • Também foi feito um experimento com Lorde cantando “Foil
    • A música faz parte de Mandatory Fun, 14º e último álbum de estúdio de Weird Al
    • O resultado foi um dos raros no experimento de que o autor chegou a gostar, embora considere que talvez seu julgamento estivesse turvo

Ferramentas de produção e queda da barreira de uso

  • Para fazer inferência de modelos localmente, normalmente é necessário um PC com uma GPU adequada, mas o Google Colab permite que usuários sem GPU compatível, ou que se sentem intimidados pelo terminal, executem workflows de A.I. generativa em servidores
  • Como Macs não têm a GPU Nvidia necessária para inferência desses modelos, foi usado o notebook Colab do AICoverGen
    • O AICoverGen é um pacote que cuida das etapas para gerar covers com A.I. a partir de modelos existentes e oferece uma interface web
    • A inicialização levou alguns minutos, e a geração de cada música levou menos de 1 minuto
  • Como Colab e WebUI podem ser intimidadores para usuários não técnicos, várias startups oferecem geração de covers vocais com A.I. e treinamento de modelos em formato de apps simples
  • Dustin Ballard, músico de Dallas por trás do canal There I Ruined It, tem 3,1 milhões de seguidores no TikTok e 700 mil inscritos no YouTube, e vinha experimentando clonagem de voz nos últimos 4 meses
    • Entre os exemplos estão um vídeo de The Beach Boys cantando “Hurt”, do Nine Inch Nails, na melodia de “Surfin’ USA”; “Straight Outta Compton” ao estilo de Hank Williams; e uma recriação de “Snow (Hey Oh)”, do Red Hot Chili Peppers
    • Ballard grava pessoalmente novas faixas vocais, imitando em certa medida a tessitura e o estilo de cada cantor, e depois aplica clonagem de voz por A.I.
    • Esse método é mais adequado para trabalhos que alteram significativamente a letra, a melodia, o ritmo e a entonação em relação à música original
  • Com a tecnologia atual, para tornar o projeto Weird Al convincente, seria melhor que alguém cantasse primeiro as letras de Weird Al na tessitura e no estilo do cantor parodiado e só então aplicasse a clonagem de voz por cima
  • Singing Voice Synthesis e Singing Voice Conversion são áreas de pesquisa em rápida evolução
    • O so-vits-svc, usado por Ghostwriter em abril de 2023 para imitar Drake e The Weeknd em “Heart on My Sleeve”, já foi arquivado pelo dono do repositório, enquanto o RVC se tornou uma ferramenta amplamente usada
    • Pesquisadores têm mostrado a possibilidade de “beautify” timbres vocais e entonações, sintetizar naturalmente novos vocais a partir de texto e transferi-los para o estilo de outros artistas

Paródias de estilo e modelos ausentes

  • Weird Al Yankovic é conhecido como cantor de paródias e acordeonista, mas também é um compositor original
  • Muitas de suas músicas favoritas não parodiam diretamente uma faixa específica, mas fazem um riff em forma de paródia de estilo de outros artistas
  • Também seria interessante ouvir versões sintéticas de Mark Mothersbaugh, do Devo, cantando “Dare to Be Stupid”; David Byrne cantando “Dog Eat Dog”; e James Taylor cantando “Good Old Days”, mas os modelos de A.I. desses cantores não estavam no A.I. Hub
  • Depois de passar algum tempo ativo no A.I. Hub, a impressão foi de que a comunidade tende a ser mais jovem, e alguns artistas mais antigos aparecem pouco em modelos, covers e pedidos
  • A maior parte da atividade no A.I. Hub é não comercial
    • Os modelos são distribuídos gratuitamente
    • As pessoas continuam compartilhando covers com A.I. publicados no YouTube
    • Ainda assim, no canal #request-a-model, há pessoas que aceitam encomendas pagas para treinar modelos de voz

Ética e conflitos legais em torno da clonagem de voz

  • Assim como nas discussões sobre A.I. generativa, ferramentas de clonagem de voz dificilmente conseguem evitar questões de ética e legalidade
  • As posições variam de artista para artista
    • Holly Herndon vê de forma positiva o uso de sua voz desse modo
    • Grimes permite até uso comercial se houver divisão de receita
    • Alguns artistas não querem isso, independentemente de ser gratuito ou não
  • Em abril de 2020, Jay-Z pediu que o YouTube removesse várias paródias de áudio deepfake usando sua voz
    • Na época, eram paródias explícitas, mas fazer Jay-Z, sem autorização, participar de um novo single ou recomendar um produto em um anúncio poderia violar direitos autorais ou direito de publicidade
  • Criadores anônimos como Ghostwriter usam nomes e vozes de artistas famosos para impulsionar a popularidade de músicas e criam música sem conhecimento, consentimento ou compensação dos artistas
    • Sobre “Heart on My Sleeve”, a indústria musical solicitou takedowns em todas as plataformas de streaming
    • Depois, Ghostwriter publicou no X e no TikTok outra música usando versões de A.I. de Travis Scott e 21 Savage; o TikTok removeu rapidamente, mas ela permaneceu no X
  • A indústria fonográfica provavelmente continuará reprimindo o uso comercial de vocais de A.I., mas parece difícil impedir a criação de vocais com A.I. em si

1 comentários

 
GN⁺ 2023-10-04
Comentários do Hacker News
  • É bem surpreendente que essas ferramentas, toda vez que são executadas, transfiram uma cópia do modelo. Seja em um notebook do Google Colab ou em uma máquina local, imagino que os custos de banda da Hugging Face sejam enormes; fico me perguntando se estou deixando passar alguma coisa
    Talvez eles tenham acordos de peering ou usem cache de forma bem agressiva

    • O módulo Python faz cache dos downloads e verifica antes de baixar de novo. Ainda assim, é bem provável que os custos de banda sejam enormes. Mesmo no clima atual, parece que eles receberam bastante dinheiro de VC
    • Há mais de 10 anos, quando eu fazia cotações de CDN sob medida, links ilimitados de 10 gigabits ou mais já custavam no atacado algo em torno de US$ 1/mbit/mês
      Com o custo de transferir 100 TB para fora da AWS, você consegue manter 10 Gbit/s 24 horas por dia; com 100% de utilização, passa de 3 PB por mês. Banda sempre foi absurdamente barata
    • A Hugging Face tem uma parceria estratégica com a AWS
      1. A AWS está muito atrás da Azure e do GCP em AI, então precisa de parceiros para ganhar credibilidade
      2. A Hugging Face provavelmente tem custos enormes em comparação com o GitHub. Ainda assim, com a AWS eles talvez consigam criar otimizações para reduzir custos de banda, e certamente devem estar desenvolvendo algo como um armazenamento diferencial genérico para modelos de AI
    • Imagino que a Hugging Face seja simplesmente um repositório de modelos, assim como o GitHub é um repositório de código. Parece que também dá para alugar recursos de computação em CPU e GPU, embora a maioria dos modelos aparentemente rode em outros lugares
    • Seria bom poder configurar essas coisas para ficarem em cache em algum lugar que não seja a unidade C:
      Melhor ainda seria se perguntassem antes onde armazenar os modelos
  • Este texto trata apenas do aspecto musical da clonagem de voz por AI, mas uma área mais complexa é a substituição geral de dubladores/atores de voz em filmes, jogos e animação. Ex.: https://www.axios.com/2023/07/24/ai-voice-actors-victoria-at...
    Para substituir cantores, é necessário bastante pós-processamento, e eles também têm dinheiro e poder jurídico suficientes para não serem tão afetados pela concorrência; com atores de voz é diferente. Mesmo as configurações padrão de alternativas open source como ElevenLabs, Bark ou VALL-E X já conseguem fazer uma cópia razoável; eles já são mal pagos; e, por trabalharem como contratados, não têm propriedade legal sobre a própria voz. O material gravado por atores de voz normalmente pertence ao cliente, e esse cliente pode ter pouco incentivo para proteger a voz deles
    Tenho vontade de escrever um post de blog sobre a influência da cultura de atores de voz de Persona 5 e Genshin Impact, mas acho que a maioria dos leitores do Hacker News não teria muito interesse

    • No fim, acho que as empresas vão contratar universitários que precisem de alguns milhares de dólares e uma pizza, fazê-los ler um roteiro qualquer e assinar um contrato cedendo todos os direitos, para então poderem usar aquela voz para sempre
      De forma mais discreta, poderiam oferecer um assistente de voz e colocar nos termos de uso que “podem usar uma cópia da sua voz para qualquer finalidade”. Os atores de voz atuais perderiam o emprego, e só restaria um pequeno grupo que realmente quer vozes humanas de verdade. Em alguns projetos isso não vai importar, então acho que vai virar uma bagunça considerável
    • HN não é o único lugar onde se pode escrever. Por aqui parece haver pouca empatia por esse tipo de questão profissional, mas textos de nicho também chegam à primeira página de vez em quando
      De todo modo, eu gostaria de ler
    • A voz não é protegida por copyright, mas isso não significa que imitá-la seja legal. Há o caso famoso Midler v. Ford, então não dá para dizer que a situação esteja completamente clara
    • O interessante é que muitos Vocaloids, especialmente a Hatsune Miku, vieram de amostras de atores de voz, não de cantores
      Cantores não queriam ser replicados por software, mas vozes de atores de voz foram tratadas como algo que podia ser usado à vontade
    • Voz por AI é mais barata, mas ao mesmo tempo a atuação é mais entediante e genérica. Não parece haver nenhum avanço rumo a uma AI criativa capaz de produzir trabalhos bons e únicos
      Esse mercado provavelmente vai se abrir para pequenos negócios que não têm condições de contratar atores de voz profissionais. A AI está abrindo um novo mercado, não matando os empregos de pessoas realmente talentosas, na minha opinião
  • Uau, agora percebi que qualquer pessoa pode pegar as letras do Weird Al e recriá-las com a voz do cantor original. Lá pela hora do almoço talvez já dê para ouvir Michael Jackson cantando Just Eat It
    É sempre surpreendente ver como novas tecnologias de AI podem ser usadas. Claro, isso provavelmente seria ilegal pela lei de direitos autorais na maioria dos países

    • Também existe I Think I'm a Clone Now, do Weird Al, que parece se encaixar perfeitamente em uma apresentação com voz clonada por AI. A original é I Think We're Alone Now, de Tommy James and the Shondells, mas o Weird Al parece ter parodiado o cover da Tiffany dos anos 1980
      O próprio Weird Al pede autorização, mas já está bem estabelecido que paródia não é violação de copyright. Se um bom advogado defendesse o caso, deveria haver espaço também para apresentações paródicas com vozes de AI
    • Não entendo por que isso seria surpreendente. Só parece bobo e uma perda de tempo
  • De todos os usos dessa tecnologia que vi até agora, meu favorito é The Beach Boys cantando Hurt. Pela primeira vez, quase não percebi artefatos de forma séria, e, embora seja uma combinação que originalmente não faria sentido, encaixa bem demais
    Vale conferir: https://youtu.be/gmNSFqyg_Z8

    • Não sei o que eu esperava, mas isso não é Hurt; está mais para Surfin' USA com a letra de Hurt, e o som parece extremamente trêmulo e áspero
      Ainda assim, fico curioso para ver se em breve alguma IA conseguirá sintetizar o estilo dos Beach Boys sobre os acordes e a melodia reais da versão original do NIN, e ainda acrescentar um pouco da solenidade à la Johnny Cash
    • Where Is My Mind cantada por Sinatra: https://youtu.be/BO4cKQ8DxYU?si=uzF_TdrQoZOAOlEc
    • Essa conta está no topo entre as pessoas que fazem mixes musicais estranhos. Os trabalhos recentes de música deepfake foram chocantemente bons
      Se todos os direitos dos artistas, compositores etc. forem resolvidos, dá para ver isso como um uso “aceitável” de IA. Pessoas talentosas brincando elas mesmas é sempre mais divertido, mas eu certamente ouviria um álbum de mashups esquisitos assim
    • A textura áspera da gravação mascara muitos problemas potenciais. Ainda assim, considerando que essa tentativa preserva o andamento e a pronúncia dos Beach Boys, acho que uma versão feita com a mesma técnica de Michael Jackson fazendo um cover de Eat It seria bem mais convincente
  • A voz de exemplo não soa nem como Michael Jackson nem como Weird Al. É uma boa tentativa, mas um imitador vocal profissional provavelmente teria feito melhor qualquer um dos dois lados

    • Parece Weird Al fingindo ser Michael Jackson, e esse Michael Jackson fingindo ser Weird Al de novo
    • Até o melhor imitador de Michael Jackson de uma cidade de 50 mil habitantes faria melhor que isso. Isso é… ruim
    • Entendo o que você quer dizer. Fica mais evidente no lado do Michael, mas definitivamente tem essa sensação. As partes que soam estranhas parecem, em certa medida, culpa da correção de pitch
  • Covers de músicas por IA são incríveis. Vai de Goku cantando Don't Stop Me Now ao elenco de SpongeBob cantando Ocean Man

  • Eu não sabia disso. “O centro da comunidade de covers por IA é um Discord com mais de 500 mil pessoas chamado A.I. Hub, onde os membros trocam novas dicas, ferramentas, técnicas e links para músicas originais e covers”

    • Eu também não sabia. É nisso que a internet é estranha
      Se você imaginar 500 mil pessoas juntas na rua, com certeza perceberia, mas online pode existir uma comunidade gigantesca dessas e você não fazer a menor ideia até topar com ela por acaso ou alguém te contar
    • Acho que estou aos poucos aceitando que os entusiastas de tecnologia da geração atual, especialmente quem tem tempo para ajustar modelos por horas e compartilhar os resultados, preferem muito mais o Discord a essas comunidades em formato de fórum da Web 2.0
      Até o Reddit já fica atrás do Discord ou do TikTok em popularidade entre a Gen Z, e, lendo /r/LocalLLMs, dá para perceber rapidamente que uma boa parte dessa comunidade é menor de idade. Para deixar claro, acho isso uma coisa boa
      Houve uma geração que preferia listas de e-mail, houve uma geração que preferia IRC e BBS, e a minha geração gosta de fóruns e longas threads de comentários. É ingenuidade achar que a forma que usamos agora vai durar para sempre
      As críticas ao Discord, especialmente sobre busca e possibilidade de descoberta, são muito reais, mas a esta altura parece que os dados já foram lançados. Os jovens já fizeram sua escolha
    • Dei uma olhada por um tempo e, no geral, tive a impressão de que o nível é baixo, então pensei que talvez seja por isso que seja relativamente menos conhecido
      Mas não sei se isso é uma limitação da tecnologia ou apenas porque “o material de origem é sem graça demais”. Há muito material do tipo “música clássica cantada por rapper popular de hoje”, e, falando como um fã antigo de hip-hop, acho que há muito pouco de interessante nos vocais dos artistas populares de hip-hop atuais
  • Um artigo relacionado, de um ano atrás, dizendo que a voz de Darth Vader passaria a ser gerada por IA
    https://arstechnica.com/information-technology/2022/09/james...

  • Para “imitação de voz de celebridade”, basta ouvir Light My Fire no YouTube Music
    https://music.youtube.com/watch?v=lN3v3EfA6_A&si=_hcG3Wjakxd...