Visualização de todos os ISBNs
(annas-archive.org)-
Visualização de ISBNs
- O Anna's Archive oferece o maior catálogo aberto de livros da história da humanidade.
- Cada pixel representa 2.500 ISBNs, e o pixel aparece em verde quando há um arquivo disponível.
- Apenas 16% de todos os livros têm backup, e ainda há muito trabalho a ser feito.
-
Contexto
- O Anna's Archive cria um catálogo de livros usando números ISBN para fazer backup do conhecimento da humanidade.
- O ISBN é atribuído a livros publicados na maioria dos países desde a década de 1970.
- Ele opera como um sistema distribuído sem autoridade central, com números atribuídos na ordem de países, grandes editoras e pequenas editoras.
- O Anna's Archive reúne metadados de várias fontes, como ISBNdb, Worldcat e Google Books, e possui o maior conjunto aberto de metadados de livros.
- É importante identificar e preservar livros raros e ameaçados.
-
Visualização
- É possível ver diferentes conjuntos de dados individualmente e alternar entre eles usando o menu suspenso e os botões.
- Os conjuntos de dados incluem Anna's Archive, Google Books, Goodreads, Internet Archive e outros.
- Na visualização, é possível observar padrões como linhas e blocos regulares, além de áreas vazias.
-
Recompensa de $10.000
- Há uma recompensa para melhorar a visualização, e é preciso enviar código open source até 31 de janeiro de 2025.
- A melhor submissão receberá $6.000, a segunda $3.000 e a terceira $1.000, pagos em Monero (XMR).
- Parte da recompensa pode ser paga mesmo que os critérios mínimos não sejam atendidos.
- As submissões devem melhorar a visualização modificando o HTML, e precisam funcionar bem em desktop e mobile.
- Pontos extras serão concedidos com base na usabilidade e no apelo visual.
-
Código
- O código de geração das imagens e os exemplos estão em diretórios específicos.
- Um formato de dados compactado de 75 MB é usado para fornecer as informações de ISBN.
- Não é necessário usar esse formato para participar da recompensa, mas ele é o mais prático para começar.
- Todo o código deve ser disponibilizado como open source.
1 comentários
Comentários no Hacker News
Como vejo uma recompensa ali embaixo, estou abrindo mão das minhas chances de ganhar, mas essa visualização parece perfeita para mapear numa curva de Hilbert [0]
Se você transformar os dados em “listras” como agora, até pontos próximos na ordenação podem ficar bem distantes entre si. A distância de descer uma linha no eixo Y atravessa uma linha inteira de dados, enquanto a distância no eixo X corresponde 1:1 aos dados originais
Ao mapear para uma curva de Hilbert, os eixos X e Y em si deixam de ter significado, mas pontos próximos na lista ordenada também ficam visualmente próximos na imagem gerada
Como o ISBN tem no começo o país, depois a editora, depois o título e no fim um checksum, eu provavelmente removeria o checksum e ordenaria cada parte como números grandes, sem hífens
Aí as grandes áreas ocupadas pelos principais países de publicação pareceriam “ilhas”, e dentro dessas ilhas os códigos das editoras apareceriam como pontos brilhantes. Ganho pontos extras se ainda colocar rótulos nessas regiões
Eu já tinha feito algo assim com dados meteorológicos para entrevistas [1]. Os dados de cada estação ficam agrupados, então a sazonalidade aparece com muita clareza
[0] https://en.wikipedia.org/wiki/Hilbert_curve
[1] https://graypegg.com/hilbert (https://github.com/graypegg/hilbertcurveplayground se você quiser tentar a recompensa com esse código, pode usar como referência. Se reutilizar, eu gostaria que ao menos mencionasse meu nome, mas não tenho como impedir)
[0] https://github.com/jakubcerveny/gilbert
[1] https://jakubcerveny.github.io/gilbert/demo/
A curva de Hilbert, na prática, é apenas um produto da estrutura da curva, mas me preocupa que o resultado faça parecer que há divisões “quadradas” bem definidas nos dados [0]. Nesse sentido, a visualização atual é mais útil, porque facilita identificar de imediato a posição de cada país
[0] https://raw.githubusercontent.com/jakubcerveny/gilbert/maste...
O problema é que ISBN não é hierárquico. Você pode comprar ISBNs em blocos ou, pagando um custo adicional absurdo, comprá-los individualmente também. Falo isso como alguém que já comprou um para relançar um único livro
Então essa visualização não mostra nada particularmente interessante ou útil
Uma visualização usando a Classificação da Biblioteca do Congresso ou a Classificação Decimal de Dewey seria muito mais útil, especialmente se ligasse a repositórios e catálogos de domínio público e de obras livres de direitos autorais. Algo como uma versão interativa e visual do material do John Mark Ockerbloom
https://onlinebooks.library.upenn.edu/
A imagem tem 1000×800 pixels e 2500 ISBNs por pixel, então visualiza 2 bilhões de ISBNs. O ISBN-13 é composto por 12 dígitos mais 1 dígito de controle, então em princípio você esperaria algo 500 vezes maior ou mais denso do que a imagem atual
O tamanho atual parece significar que só estão incluídos ISBNs com os prefixos 978 e 979, e como a metade de baixo está mais esparsa, provavelmente corresponde ao novo intervalo 979
Pela explicação, eu deveria distinguir pixels vermelhos e verdes, mas achei que não estava conseguindo por causa de daltonismo. Só vejo vermelho e preto
Mas mesmo usando uma extensão de navegador para correção de daltonismo, não consigo distinguir mais cores. Queria saber se é só comigo ou se o gráfico está estranho
Role para baixo até encontrar a ferramenta de visualização interativa e mude para “Files in Anna's Archive [md5]”; aí as posições dos pixels verdes ficam destacadas em cinza
Clique com o botão direito na imagem, selecione “Inspect” e depois adicione um novo filtro CSS
hue-rotateao elementoelement { max-width: 100%; margin: 0 auto; filter: hue-rotate(-90deg); }Normalmente eu usaria
filter: saturate(100);, mas não funcionou bem para esta imagem. Talvez você precise ajustar o ângulo de rotação; para mim, -90 graus foi o melhorAnna's Archive é uma das maravilhas do mundo. Mesmo se a humanidade quase se autodestruísse, se a Anna's Archive sobrevivesse ainda haveria esperança de uma reconstrução relativamente rápida
Parece que o IP do servidor está bloqueado na UE. Esta mensagem aparece na internet da Ziggo, na Holanda
“Este site foi bloqueado
Sanções europeias
O Conselho da União Europeia decidiu que os sites da RT (antiga Russia Today) e da Sputnik News não devem mais ser transmitidos. O site que você está tentando acessar se enquadra nessas sanções europeias
A VodafoneZiggo é obrigada a aplicar as sanções e, por isso, bloqueou o site”
https://web.archive.org/web/20250106112552/https://annas-arc...
Mais alguém está vendo esta mensagem?
“Este servidor não conseguiu provar que é annas-archive.org. Seu certificado de segurança foi emitido para *.hs.llnwd.net. Isso pode ser causado por erro de configuração ou por um invasor interceptando sua conexão”
Em qualquer site, se você ignorar o aviso e entrar, acaba em erro HTTP 400
Segundo a Wikipedia, www.ukispcourtorders.co.uk era um site que listava domínios bloqueados no passado e as ordens judiciais relacionadas
https://en.wikipedia.org/wiki/List_of_websites_blocked_in_th...
Neste gráfico é bem difícil entender o que corresponde a quê. Se alguém marcasse onde fica o Bookland, ou seja, o 978, ficaria bem mais fácil se orientar
É ilegal baixar e usar o arquivo de ISBN deles? Não vejo qual seria o problema de ter esse tipo de informação
Foi dito que “cada pixel representa 2.500 ISBNs. Se houver um arquivo para aquele ISBN, esse pixel fica mais verde”, mas não entendi o que significa mais verde. Não estou vendo verde em tons diferentes
E os pixels pretos seriam ISBNs não registrados?
Está aparecendo esta mensagem
“Sanções europeias
O Conselho da União Europeia decidiu que os sites da RT (antiga Russia Today) e da Sputnik News não devem mais ser transmitidos. O site que você está tentando acessar se enquadra nessas sanções europeias”
Na Itália, simplesmente falha com NS_ERROR_CONNECTION_REFUSED