2 pontos por GN⁺ 2025-01-11 | 1 comentários | Compartilhar no WhatsApp
  • Visualização de ISBNs

    • O Anna's Archive oferece o maior catálogo aberto de livros da história da humanidade.
    • Cada pixel representa 2.500 ISBNs, e o pixel aparece em verde quando há um arquivo disponível.
    • Apenas 16% de todos os livros têm backup, e ainda há muito trabalho a ser feito.
  • Contexto

    • O Anna's Archive cria um catálogo de livros usando números ISBN para fazer backup do conhecimento da humanidade.
    • O ISBN é atribuído a livros publicados na maioria dos países desde a década de 1970.
    • Ele opera como um sistema distribuído sem autoridade central, com números atribuídos na ordem de países, grandes editoras e pequenas editoras.
    • O Anna's Archive reúne metadados de várias fontes, como ISBNdb, Worldcat e Google Books, e possui o maior conjunto aberto de metadados de livros.
    • É importante identificar e preservar livros raros e ameaçados.
  • Visualização

    • É possível ver diferentes conjuntos de dados individualmente e alternar entre eles usando o menu suspenso e os botões.
    • Os conjuntos de dados incluem Anna's Archive, Google Books, Goodreads, Internet Archive e outros.
    • Na visualização, é possível observar padrões como linhas e blocos regulares, além de áreas vazias.
  • Recompensa de $10.000

    • Há uma recompensa para melhorar a visualização, e é preciso enviar código open source até 31 de janeiro de 2025.
    • A melhor submissão receberá $6.000, a segunda $3.000 e a terceira $1.000, pagos em Monero (XMR).
    • Parte da recompensa pode ser paga mesmo que os critérios mínimos não sejam atendidos.
    • As submissões devem melhorar a visualização modificando o HTML, e precisam funcionar bem em desktop e mobile.
    • Pontos extras serão concedidos com base na usabilidade e no apelo visual.
  • Código

    • O código de geração das imagens e os exemplos estão em diretórios específicos.
    • Um formato de dados compactado de 75 MB é usado para fornecer as informações de ISBN.
    • Não é necessário usar esse formato para participar da recompensa, mas ele é o mais prático para começar.
    • Todo o código deve ser disponibilizado como open source.

1 comentários

 
GN⁺ 2025-01-11
Comentários no Hacker News
  • Como vejo uma recompensa ali embaixo, estou abrindo mão das minhas chances de ganhar, mas essa visualização parece perfeita para mapear numa curva de Hilbert [0]
    Se você transformar os dados em “listras” como agora, até pontos próximos na ordenação podem ficar bem distantes entre si. A distância de descer uma linha no eixo Y atravessa uma linha inteira de dados, enquanto a distância no eixo X corresponde 1:1 aos dados originais
    Ao mapear para uma curva de Hilbert, os eixos X e Y em si deixam de ter significado, mas pontos próximos na lista ordenada também ficam visualmente próximos na imagem gerada
    Como o ISBN tem no começo o país, depois a editora, depois o título e no fim um checksum, eu provavelmente removeria o checksum e ordenaria cada parte como números grandes, sem hífens
    Aí as grandes áreas ocupadas pelos principais países de publicação pareceriam “ilhas”, e dentro dessas ilhas os códigos das editoras apareceriam como pontos brilhantes. Ganho pontos extras se ainda colocar rótulos nessas regiões
    Eu já tinha feito algo assim com dados meteorológicos para entrevistas [1]. Os dados de cada estação ficam agrupados, então a sazonalidade aparece com muita clareza
    [0] https://en.wikipedia.org/wiki/Hilbert_curve
    [1] https://graypegg.com/hilbert (https://github.com/graypegg/hilbertcurveplayground se você quiser tentar a recompensa com esse código, pode usar como referência. Se reutilizar, eu gostaria que ao menos mencionasse meu nome, mas não tenho como impedir)

    • Também existe a curva de Gilbert, uma curva de Hilbert generalizada para áreas retangulares que não são potências de 2 [0], e há até uma demo online [1]
      [0] https://github.com/jakubcerveny/gilbert
      [1] https://jakubcerveny.github.io/gilbert/demo/
    • Tenho curiosidade sobre qual propriedade faz da curva de Hilbert algo preferível, por exemplo, a um padrão em serpentina. Num padrão em serpentina, ISBNs adjacentes também ficam vizinhos na visualização
      A curva de Hilbert, na prática, é apenas um produto da estrutura da curva, mas me preocupa que o resultado faça parecer que há divisões “quadradas” bem definidas nos dados [0]. Nesse sentido, a visualização atual é mais útil, porque facilita identificar de imediato a posição de cada país
      [0] https://raw.githubusercontent.com/jakubcerveny/gilbert/maste...
  • O problema é que ISBN não é hierárquico. Você pode comprar ISBNs em blocos ou, pagando um custo adicional absurdo, comprá-los individualmente também. Falo isso como alguém que já comprou um para relançar um único livro
    Então essa visualização não mostra nada particularmente interessante ou útil
    Uma visualização usando a Classificação da Biblioteca do Congresso ou a Classificação Decimal de Dewey seria muito mais útil, especialmente se ligasse a repositórios e catálogos de domínio público e de obras livres de direitos autorais. Algo como uma versão interativa e visual do material do John Mark Ockerbloom
    https://onlinebooks.library.upenn.edu/

    • ISBN é hierárquico. Não entendi o que você quer dizer. Assim como a Gália, o ISBN também é dividido em várias partes: uma corresponde ao idioma, outra à editora, e a última ao título. A parte final é o checksum https://en.wikipedia.org/wiki/ISBN#Overview
    • Essa visualização mostra o que ela quer mostrar: principalmente quanto dos livros do mundo eles têm. Hierarquia não tem nada a ver com isso
    • Pela quantidade de pixels pretos, também dá para ver que os ISBNs são atribuídos muito mais rápido do que realmente usados
      A imagem tem 1000×800 pixels e 2500 ISBNs por pixel, então visualiza 2 bilhões de ISBNs. O ISBN-13 é composto por 12 dígitos mais 1 dígito de controle, então em princípio você esperaria algo 500 vezes maior ou mais denso do que a imagem atual
      O tamanho atual parece significar que só estão incluídos ISBNs com os prefixos 978 e 979, e como a metade de baixo está mais esparsa, provavelmente corresponde ao novo intervalo 979
  • Pela explicação, eu deveria distinguir pixels vermelhos e verdes, mas achei que não estava conseguindo por causa de daltonismo. Só vejo vermelho e preto
    Mas mesmo usando uma extensão de navegador para correção de daltonismo, não consigo distinguir mais cores. Queria saber se é só comigo ou se o gráfico está estranho

    • Para referência, eu não sou daltônico, e vejo pixels vermelhos, verdes e pretos. A olho nu, o gráfico não parece estranho
      Role para baixo até encontrar a ferramenta de visualização interativa e mude para “Files in Anna's Archive [md5]”; aí as posições dos pixels verdes ficam destacadas em cinza
    • Se você tiver daltonismo vermelho-verde como eu, tente isto
      Clique com o botão direito na imagem, selecione “Inspect” e depois adicione um novo filtro CSS hue-rotate ao elemento
      element { max-width: 100%; margin: 0 auto; filter: hue-rotate(-90deg); }
      Normalmente eu usaria filter: saturate(100);, mas não funcionou bem para esta imagem. Talvez você precise ajustar o ângulo de rotação; para mim, -90 graus foi o melhor
    • O gráfico em si parece normal, e realmente há pixels vermelhos e alguns verdes. Infelizmente, parece mais um problema da extensão
    • Eu também tenho daltonismo, e este gráfico não é bom
    • Há pontos verdes e algumas linhas feitas de pontos verdes. Você tentou ampliar?
  • Anna's Archive é uma das maravilhas do mundo. Mesmo se a humanidade quase se autodestruísse, se a Anna's Archive sobrevivesse ainda haveria esperança de uma reconstrução relativamente rápida

    • Você disse “reconstrução relativamente rápida”, mas se isso pressupõe autodestruição, será mesmo uma coisa tão boa assim?
  • Parece que o IP do servidor está bloqueado na UE. Esta mensagem aparece na internet da Ziggo, na Holanda
    “Este site foi bloqueado
    Sanções europeias
    O Conselho da União Europeia decidiu que os sites da RT (antiga Russia Today) e da Sputnik News não devem mais ser transmitidos. O site que você está tentando acessar se enquadra nessas sanções europeias
    A VodafoneZiggo é obrigada a aplicar as sanções e, por isso, bloqueou o site”

    • Na Polônia abre normalmente. Em vez disso, dá para usar este link
      https://web.archive.org/web/20250106112552/https://annas-arc...
    • Atualização: resolvi mudando a configuração do servidor DNS para que o servidor que já opero diretamente use o DNS raiz em vez de encaminhar para o ISP
    • Na França não há problema
    • Há algumas vantagens em operar seu próprio resolvedor recursivo
    • Na Finlândia não há problema
  • Mais alguém está vendo esta mensagem?
    “Este servidor não conseguiu provar que é annas-archive.org. Seu certificado de segurança foi emitido para *.hs.llnwd.net. Isso pode ser causado por erro de configuração ou por um invasor interceptando sua conexão”

    • Aqui também. Ao fazer consulta DNS para annas-archive.org na internet da EE no Reino Unido, é retornado o endereço www.ukispcourtorders.co.uk, e lá também aparece um aviso de segurança
      Em qualquer site, se você ignorar o aviso e entrar, acaba em erro HTTP 400
      Segundo a Wikipedia, www.ukispcourtorders.co.uk era um site que listava domínios bloqueados no passado e as ordens judiciais relacionadas
      https://en.wikipedia.org/wiki/List_of_websites_blocked_in_th...
    • Não, isso parece mais um ataque do tipo homem-no-meio do lado deles. Ainda assim, o domínio em si parece um CDN legítimo
    • No DNS de um ISP finlandês aparece um certificado aparentemente normal emitido pelo Google Trust Services
    • Aqui também acontece
  • Neste gráfico é bem difícil entender o que corresponde a quê. Se alguém marcasse onde fica o Bookland, ou seja, o 978, ficaria bem mais fácil se orientar

    • O objetivo da recompensa anunciada neste post é justamente criar uma visualização mais fácil
  • É ilegal baixar e usar o arquivo de ISBN deles? Não vejo qual seria o problema de ter esse tipo de informação

    • Se é uma página com links para o libgen e o sci-hub, imagino que eles não se preocupem tanto assim com direitos autorais
  • Foi dito que “cada pixel representa 2.500 ISBNs. Se houver um arquivo para aquele ISBN, esse pixel fica mais verde”, mas não entendi o que significa mais verde. Não estou vendo verde em tons diferentes
    E os pixels pretos seriam ISBNs não registrados?

    • Recomendo fazer um teste de daltonismo. O verde é bem evidente, especialmente por volta de 40% da imagem total para baixo
    • Olhando com atenção, realmente há alguns pixels amarronzados e alguns pixels verde-escuros
  • Está aparecendo esta mensagem
    “Sanções europeias
    O Conselho da União Europeia decidiu que os sites da RT (antiga Russia Today) e da Sputnik News não devem mais ser transmitidos. O site que você está tentando acessar se enquadra nessas sanções europeias”

    • Este site está sendo censurado em nível de DNS, mas parece que escolheram a página de erro errada
      Na Itália, simplesmente falha com NS_ERROR_CONNECTION_REFUSED
    • Aqui abre normalmente mesmo com IP europeu
    • Basta trocar o DNS para 1.1.1.1 (Cloudflare) ou 8.8.8.8 (Google)