2 pontos por GN⁺ 2023-09-18 | 1 comentários | Compartilhar no WhatsApp
  • Linear Book Scanner é um scanner de livros open source de baixo custo que automatiza a virada de páginas e a digitalização
  • Enquanto o livro se move para frente e para trás sobre o dispositivo, a virada de páginas e a digitalização acontecem em sequência
  • A cada movimento, uma sucção a vácuo vira uma página de um lado para o outro
  • As páginas são digitalizadas ao passar por dois sensores de imagem
  • Um software dedicado transforma os resultados da digitalização em PDF pesquisável, aumentando sua utilidade

Estrutura que digitaliza enquanto vira as páginas

  • O Linear Book Scanner foi projetado como um scanner de livros com virada de páginas de baixo custo
  • O projeto foi disponibilizado como open source, permitindo que qualquer pessoa o construa por conta própria
  • O livro se move para frente e para trás sobre a máquina e, a cada passagem, o vácuo suga a página de um lado para o outro para virá-la

Resultado da digitalização

  • As páginas são digitalizadas enquanto passam por dois sensores de imagem
  • O software gera o livro digitalizado como um PDF pesquisável

1 comentários

 
GN⁺ 2023-09-18
Opiniões no Hacker News
  • Há uma comunidade sobre esse tema em https://diybookscanner.org/
    Alguns anos atrás, criei em Java uma pequena ferramenta chamada bookbuilder, que permitia virar as páginas manualmente e tirar fotos; depois ela processava automaticamente todas as imagens para gerar um PDF pesquisável
    Usei uma biblioteca de visão computacional em Java puro chamada https://boofcv.org/, que ainda existe e é bem rápida
    Ela conseguia detectar o contorno da página, corrigir inclinação, achatar a imagem e até remover o contorno dos dedos por correspondência de tons de pele, para então criar um PDF com uma camada de OCR invisível sem intervenção do usuário
    Lembro também de ter trabalhado na detecção da inclinação das linhas com uma espécie de algoritmo watershed para melhorar o achatamento
    Foi um projeto divertido, e fico curioso para saber se o código-fonte ainda existe em algum lugar. A página de download também já desapareceu, e na época eu ainda não tinha aberto o código, porque não imaginava que um projetinho paralelo desses seria interessante para outras pessoas

    • O fórum real de scanners de livros em https://diybookscanner.org/ está fora do ar há algumas semanas, e estão trabalhando para restaurá-lo
    • Sempre tive interesse em digitalização de livros, e acho que me lembro de ter visto esse software
      Criei uma das primeiras versões que vi no site e, alguns anos atrás, por acaso conheci Jonathon Duerig e também fiz alguns trabalhos de corte com jato d'água para ele
      Quando vi o Linear Book Scanner pela primeira vez, achei que ele estava de cabeça para baixo. Se fosse uma estrutura suspensa capaz de se mover sozinha, daria para evitar problemas como não saber a massa do livro ou ter de lidar com atrito
      Com um contrapeso, a força poderia ser mantida constante, e seria preciso mover apenas uma massa conhecida, qualquer que fosse o livro escaneado
    • BoofCV é realmente incrível
      É uma pena eu não ter conhecido antes de hoje; se tivesse conhecido, acho que teria dedicado tempo para aprender e contribuir. Ainda pode ser possível, mas, olhando agora, parece que ela já cobre praticamente todos os recursos de que já ouvi falar, e mais alguns
      Passei 30 minutos clicando nos exemplos um por um
    • Seria ótimo se você pudesse publicar no GitHub, se possível
  • Existem scanners comerciais semelhantes [1] [2], também com projeto em V, mas invertidos para escanear por cima
    Como quem se move é o scanner, não o livro, eles operam de forma muito mais delicada sobre o livro
    Fico muito feliz em ver uma alternativa open source desse tipo sendo desenvolvida
    [1] https://www.treventus.com
    [2] https://youtu.be/SdipuAuWsEs?si=dFWRtva5gO2oM91o

    • Alugar, locar ou usar um serviço de digitalização provavelmente também deve ser caro
      Porque nenhuma das duas opções divulga informações de preço; elas apenas fazem você preencher um formulário de contato
    • Este dispositivo também é abordado em uma apresentação do Google relacionada ao projeto original
      https://youtu.be/4JuoOaL11bw?si=do1qet5Kq_WErQgz&t=162
    • Há uma versão DIY da mesma ideia aqui: https://www.diybookscanner.org
    • Não sei se esse scanner é uma ótima alternativa, já que o método dele é cortar uma página a cada digitalização
      Depois disso, o quanto ele manuseia o livro com delicadeza parece ter pouca importância
      Talvez faça sentido se a ideia for reencadernar as páginas restantes e transformá-las em um livro novo
  • Gosto da ideia, mas, para fins de preservação ou para livros valiosos, fico um pouco preocupado com o risco de rasgar páginas
    Nesses casos, eu provavelmente preferiria escanear manualmente de qualquer forma, mas muitas vezes quis ter um dispositivo desses para digitalizar uma quantidade grande demais de livros
    Sobre a frequência de páginas rasgadas, o FAQ diz:

    Prototype 1 could scan the majority of books without damage, but may tear one or two pages in some books. Out of 50 books tested, 45% had one or two of their pages either torn or folded. This is a very early prototype and there are many areas for improvement in the design.
    Para mim, pessoalmente, isso é aceitável em geral. Especialmente se versões posteriores reduzirem esses 45% para algo em torno de 10% a 20%, eu pensaria em construir um desses se tivesse espaço para o aparelho

    • Por um tempo, o Internet Archive criou um scanner de livros em que o livro fica sobre um suporte em formato de V
      Um voluntário vira as páginas manualmente, abaixa e levanta duas placas de vidro para pressionar suavemente as páginas, e duas câmeras DSLR em suportes inclinados fazem as fotos
      O equipamento inteiro não é automático, mas é fácil de operar manualmente
      https://blog.archive.org/2021/02/09/meet-eliza-zhang-book-sc...
    • Se você ainda não viu, vale a pena visitar este site
      https://www.diybookscanner.org/en/intro.html
    • Para livros insubstituíveis, por exemplo livros antigos e esgotados, isso não é aceitável de forma alguma
      Tem que haver 0 página rasgada
      Antes dos computadores, também não havia cópia eletrônica
  • Esta área ainda não alcançou o nível que o software já poderia possibilitar, então as pessoas estão resolvendo com hardware coisas que poderiam ser feitas por software
    Com duas ou mais fotos, ou imagens estéreo — por exemplo, de um iPhone novo — como entrada, é possível estimar por triangulação uma página achatada e criar uma imagem que pareça uma página recortada de um scanner de mesa
    Depois, basta pagar o suficiente a alguém na Etiópia para virar as páginas com cuidado, sem danificar o livro
    Como qualquer pesquisador sabe, as bibliotecas digitais atuais acumulam um século de digitalizações de qualidade duvidosa
    A IA consegue estimar uma digitalização difícil de distinguir do formato original de fonte vetorial em um monitor 8K
    Antigamente, em relação às guerras de fontes dos anos 1980, prestei consultoria sobre transformar formatos antigos e digitalizações em fontes PostScript e TrueType
    Na época era difícil, mas, quando o software alcançar isso, será entendido como a maneira correta de digitalizar texto
    Na literatura científica, precisamos de algo como o ChatGPT que recupere o código-fonte LaTeX capaz de reproduzir cada página. Na verdade, precisamos mesmo é de um sucessor do LaTeX, menos obtuso e capaz de produzir texto fixo e texto fluido com a mesma facilidade

    • Este é um problema muito físico, e não há muitos atalhos utilizáveis
      Participei de um projeto de preservação e escaneei uma quantidade enorme de revistas; em geral, não importava muito se elas ficavam ou não sobre uma mesa plana. De todo modo, virar as páginas à mão leva tempo
      Já existe um método conhecido para escanear revistas e livros muito rapidamente: cortar a lombada da encadernação e colocar as páginas em um scanner automático
      Claro, se você quiser preservar o objeto depois da digitalização, isso não se aplica, pois a cópia é destruída
      No fim das contas, a melhor forma de automatizar a digitalização sem danificar o objeto precisa combinar uma câmera superior com uma máquina de virar páginas. Imagino que o projeto de digitalização em larga escala do Google tenha sido algo assim
      Talvez seja possível “escanear” alguns livros com raios X, sem virar as páginas, mas acho que isso também traria novos problemas
    • Não sei exatamente como construir infraestrutura para explorar mão de obra do terceiro mundo é um problema de software
      O problema não é tanto o software ser ruim em corrigir distorções, mas sim que, depois de fazer toda a preparação para escanear livros, é melhor usar um dispositivo que não exija correção de distorção
    • O software já era capaz disso em 2017. Fizemos basicamente esse trabalho em um dispositivo para pessoas cegas, e nem precisávamos de imagens estéreo
      Dá para ver aqui como funciona o achatamento. Essa parte era tratada pela biblioteca, então não foi necessário escrever código separado
      https://youtu.be/DPu0iJtK2sI?t=1542
      Também havia recursos para avisar que era hora de virar a página, detectar se ela tinha sido virada e tirar a foto. Em segundo plano, ele achatava a foto, separava as páginas e fazia OCR
      Depois de pegar um pouco de prática, era possível escanear e fazer OCR de um livro a uma velocidade de 1 a 5 segundos por página
      https://youtu.be/DPu0iJtK2sI?t=1909
      Depois disso, o livro com OCR ficava salvo e podia ser lido em voz alta quando você quisesse
    • Como sucessor do LaTeX, https://typst.app/ está se firmando muito bem
    • IA, de jeito nenhum. A coisa que mais se deve evitar no processo de digitalização é o texto mudar sutilmente
      https://news.ycombinator.com/item?id=29223815
      O risco de resultados plausíveis, mas errados já era uma preocupação antes da IA
  • Isto aqui parece muito mais seguro
    https://www.inforum.com/newsmd/ndsu-students-book-scanner-in...
    http://diybookscanner.org

    • Esse método certamente é mais seguro, mas não é automático; alguém precisa virar as páginas
      Este projeto tenta resolver esse problema, mas precisa fazer isso de uma forma muito mais suave para não danificar os livros
  • Depois de escaneado, todo o conteúdo está em formato digital; então fico curioso por que desencadernar o livro em folhas soltas antes da digitalização não é um modelo escalável
    A ideia é evitar o trabalho extra de desmontagem?

    • Arquivistas normalmente não gostam de destruir as obras que estão tentando preservar
      Mesmo ao escanear um livro, o que se obtém são apenas imagens ópticas. No caso de manuscritos medievais, por exemplo, uma página pode ter sido apagada e reescrita
      Se você simplesmente escanear o livro e destruir a cópia física, perde esse tipo de evidência
      Dito isso, no caso de um livro barato de mercado de massa, acho que a maioria dos arquivistas não se importaria muito em destruir um exemplar entre milhões para preservar a obra
      Isso só se torna um problema real em obras muito antigas e muito raras
    • Se o livro não for extremamente valioso, geralmente é mais fácil cortar completamente a parte da encadernação com uma guilhotina e colocar as folhas em um scanner com alimentador
  • Parece que qualquer livro minimamente danificado vai acabar todo rasgado

    • Eu também estremeci ao ver isso
      Tenho vários livros antigos que gostaria de digitalizar, e a maioria dos scanners de livros comuns que vejo exige pelo menos abrir o livro totalmente; isso, como você disse, pode rasgá-lo
      Além disso, esses aparelhos não incluem vácuo, movimento passando por bordas afiadas e motores de passo
      Pela segunda pergunta em https://linearbookscanner.org/faq/:

      Out of 50 books tested, 45% had one or two of their pages either torn or folded
      Eu não usaria isso nem nos meus livros menos valiosos

    • Com certeza isso vai acontecer. Se algo enroscar, ou se as condições ambientais mudarem e reagirem com o papel, até livros que não estavam danificados podem acabar assim
      Ainda assim, se houver uma montanha de livros a escanear e uma máquina dessas puder dar conta da maioria, deixando apenas os casos especiais para serem tratados com mais cuidado, isso já é um ganho
  • O Google, grosso modo, já escaneou todos os livros. O problema eram os direitos autorais e os titulares desses direitos.
    Para virar as páginas, usaram mão de obra mal remunerada. Se ninguém postar o link antes, envio o link depois.
    Quando voltei para casa, vi que era este artigo: https://www.theatlantic.com/technology/archive/2017/04/the-t...

  • Parece realmente incrível. Além de poder digitalizar livros, ele ainda os tritura de graça.
    É uma oferta 2 em 1 bem interessante.

  • Tenho alergia a ácaros; se um livro fica uns seis meses na estante, só de tocá-lo já tenho uma reação alérgica.
    Sacudir a parte externa ou passar aspirador não adianta.
    Acho que este dispositivo poderia ser usado para remover ácaros dos livros e torná-los legíveis.