- Empresas de IA estão comprando livros em massa, cortando a lombada de obras raras para escaneamento em alta velocidade e depois destruindo os originais
- A ISBNdb aceita pedidos de até 1 milhão de livros, oferece anonimato aos compradores e NDA, e orienta os clientes a chamarem esse processo de “preservação digital”
- Publicações anteriores a 2022 são altamente valorizadas por serem dados sem texto gerado por IA, e a Anthropic também busca garantir um grande volume de livros
- Um juiz federal considerou uso justo a prática de eliminar o original para deixar apenas uma cópia por vez, mas até livros com pouquíssimos exemplares sobreviventes entram no processo
- O último exemplar existente de um livro do século 18 não pode ser substituído depois de destruído, e uma decisão legal pode acelerar um dano irreversível
Como livros raros viram dados de treinamento
- Empresas de IA compram livros em massa, cortam a lombada e fazem escaneamento em alta velocidade, destruindo depois os originais
- A ISBNdb intermedeia pedidos de até 1 milhão de livros enquanto oculta a identidade do comprador
- Oferece NDA como funcionalidade do serviço
- Orienta os clientes a chamar esse trabalho de “preservação digital”
- Em seu próprio site, afirma que “uma manchete dizendo ‘empresa de IA destrói 2 milhões de livros’ não é algo que desperte simpatia”
- Publicações anteriores a 2022 são tratadas como dados premium por não incluírem texto gerado por IA
- A Anthropic contratou o ex-responsável por parcerias do Google Books para garantir “todos os livros do mundo”
A irreversibilidade deixada pela decisão de uso justo
- Um juiz federal considerou essa prática uso justo com a lógica de que, ao eliminar o original, existe apenas uma cópia em cada momento
- Um funcionário de livraria disse à 404 Media que até livros raros com pouquíssimos exemplares restantes entram no processo
- Sites podem ser republicados e best-sellers podem ser reimpressos, mas um livro de botânica do século 18 do qual restam apenas os três últimos exemplares não pode ser substituído depois de destruído
- Diferentemente de scraping da internet, torrents de bibliotecas ou obtenção não autorizada de música, destruir o original é irreversível, e após a decisão legal esse tipo de negócio pode acelerar ainda mais
1 comentários
Opiniões no Hacker News
Não sinto muita simpatia pelas editoras. Elas mantêm livros fora de catálogo até o copyright expirar, transformando livros perfeitamente bons em raridades, e mesmo livros à venda muitas vezes só existem em papel que ondula com umidade e em brochuras coladas que se desfazem em folhas soltas em poucos anos.
Livros que a editora tirou de catálogo deveriam poder ser publicados por outra editora sem compensar a editora original, mas com renegociação de royalties com o autor. Também deveríamos mudar a lei de copyright para permitir que outra editora faça uma edição premium quando a editora não oferece uma capa dura com papel durável e encadernação costurada.
Pequenos streamers também não têm recursos para brigar na Justiça. O canal em questão é https://www.youtube.com/@diggingthegreats/videos.
Na época, livros eram artigos de luxo que a maioria não podia comprar, e a disseminação da encadernação barata em massa aumentou o acesso. Ainda hoje existe um mercado artesanal que desmonta livros comerciais para criar encadernações e capas personalizadas de alta qualidade.
Em vez de presumir que as editoras ignoram deliberadamente uma demanda oculta por edições premium, é mais simples supor que elas sabem, pelos dados de vendas, que não venderiam. Se o objetivo é preservação, não deveríamos obrigar o uso de um papel um pouco melhor, mas criar arquivos digitais robustos, não depósitos de estoque ou estantes de colecionadores.
Estamos republicando livros antigos depois de verificar o copyright. Todos os livros são edições publicadas antes de 1930 e, dependendo de os detentores dos direitos terem renovado ou não, muitos livros até 1964 ou 1973 também podem ser usados.
Cortamos a lombada com uma guilhotina especial, colocamos as folhas soltas em plástico selado para preservação permanente e também guardamos os arquivos originais sem compressão em discos magnéticos para eventuais redigitalizações. Também procuramos com antecedência livros raros posteriores a 1931 para poder publicá-los assim que o copyright expirar, mas nenhuma empresa de AI jamais nos pediu para treinar com os scans completos.
Documentos antigos em si são interessantes e muito dignos de preservação, mas são menos úteis para serem misturados a enormes conjuntos de dados de treinamento.
Se os alvos de digitalização são apenas livros ainda sob copyright, por que livros de botânica do século 18 estão incluídos? Digitalizar um livro que você possui deveria ser legal do ponto de vista de copyright, e não deveria exigir destruição.
Para obras publicadas há mais de 50 anos e em risco de serem esquecidas, poderiam ser aplicadas regras para obras órfãs, obrigando os detentores de direitos a provar que elas estão preservadas em várias bibliotecas etc., ou a permitir cópias adicionais, ou a abrir mão do copyright.
O motivo de a OpenAI não poder simplesmente comprar na Amazon a edição digital de um livro de 2018 e usá-la diretamente é que isso envolveria, além de violação de licença, também o DMCA, que proíbe contornar DRM.
Se a Archive.org não tivesse sido processada por emprestar livros físicos que possuía, talvez esse resultado tivesse sido evitado. As editoras deveriam ter pensado com mais cuidado no resultado que desejavam.
As editoras esperavam processar empresas de AI que treinaram com materiais de bibliotecas-sombra e conseguir grandes contratos de conteúdo, mas as empresas de AI usaram uma brecha analógica. Comprar um livro usado por US$ 5 e gastar US$ 25 em digitalização destrutiva é muito mais barato do que pagar royalties.
Dito isso, o alvo não são textos antigos, mas livros ainda sob copyright, e nem tudo que é antigo tem valor. Como bibliotecas descartam livros sem demanda que só geram custo de armazenamento, empresas de digitalização conseguem obtê-los por pouco dinheiro.
Parece mais com a fábrica de “triturar e escanear” de 《Rainbows End》, de Vernor Vinge, do que com 《Fahrenheit 451》, de Bradbury
Ao digitalizar livros raros, também seria possível desfazer os danos de Authors Guild v. Google. Poderiam permitir os escaneamentos das empresas de IA, mas exigir a publicação das cópias digitais, com um período de carência de alguns anos para preservar a vantagem da empresa que fez o primeiro escaneamento: https://en.wikipedia.org/wiki/Authors_Guild,_Inc._v._Google,...
Por outro lado, seria muito mais razoável regulamentar para que ele seja digitalizado em alta qualidade, publicado permanentemente de forma gratuita, acessível por meio de um LLM público gratuito em bibliotecas e online, e, se não houver cópias físicas restantes, preservado em um arquivo público de obras raras após verificação suficiente
Se, por causa de leis de direitos autorais tolas, esse é o método legal disponível para empresas de IA, é difícil atribuir toda a culpa a elas. É possível apoiar bibliotecas-sombra locais: https://annas-archive.pk/donate
Olhando apenas para os materiais citados, faltam evidências de que livros raros estejam de fato sendo destruídos. Foi acrescentado o exemplo de um livro de botânica insubstituível do século XVIII, mas isso não exclui a possibilidade de que os alvos reais sejam livros à venda ou comuns
Aqui, “livros raros” parecem ser não manuscritos medievais historicamente importantes, mas livros relativamente recentes, ainda protegidos por direitos autorais, com poucas cópias físicas à venda. Destruir um exemplar desse tipo para preservar digitalmente o conteúdo não é necessariamente algo ruim; em livros ainda protegidos, o valor geralmente está mais no conteúdo do que no suporte físico