Linear Book Scanner: scanner automático de livros open source (2014)
(linearbookscanner.org)- Linear Book Scanner é um scanner de livros open source de baixo custo que automatiza a virada de páginas e a digitalização
- Enquanto o livro se move para frente e para trás sobre o dispositivo, a virada de páginas e a digitalização acontecem em sequência
- A cada movimento, uma sucção a vácuo vira uma página de um lado para o outro
- As páginas são digitalizadas ao passar por dois sensores de imagem
- Um software dedicado transforma os resultados da digitalização em PDF pesquisável, aumentando sua utilidade
Estrutura que digitaliza enquanto vira as páginas
- O Linear Book Scanner foi projetado como um scanner de livros com virada de páginas de baixo custo
- O projeto foi disponibilizado como open source, permitindo que qualquer pessoa o construa por conta própria
- O livro se move para frente e para trás sobre a máquina e, a cada passagem, o vácuo suga a página de um lado para o outro para virá-la
Resultado da digitalização
- As páginas são digitalizadas enquanto passam por dois sensores de imagem
- O software gera o livro digitalizado como um PDF pesquisável
1 comentários
Opiniões no Hacker News
Há uma comunidade sobre esse tema em https://diybookscanner.org/
Alguns anos atrás, criei em Java uma pequena ferramenta chamada bookbuilder, que permitia virar as páginas manualmente e tirar fotos; depois ela processava automaticamente todas as imagens para gerar um PDF pesquisável
Usei uma biblioteca de visão computacional em Java puro chamada https://boofcv.org/, que ainda existe e é bem rápida
Ela conseguia detectar o contorno da página, corrigir inclinação, achatar a imagem e até remover o contorno dos dedos por correspondência de tons de pele, para então criar um PDF com uma camada de OCR invisível sem intervenção do usuário
Lembro também de ter trabalhado na detecção da inclinação das linhas com uma espécie de algoritmo watershed para melhorar o achatamento
Foi um projeto divertido, e fico curioso para saber se o código-fonte ainda existe em algum lugar. A página de download também já desapareceu, e na época eu ainda não tinha aberto o código, porque não imaginava que um projetinho paralelo desses seria interessante para outras pessoas
Criei uma das primeiras versões que vi no site e, alguns anos atrás, por acaso conheci Jonathon Duerig e também fiz alguns trabalhos de corte com jato d'água para ele
Quando vi o Linear Book Scanner pela primeira vez, achei que ele estava de cabeça para baixo. Se fosse uma estrutura suspensa capaz de se mover sozinha, daria para evitar problemas como não saber a massa do livro ou ter de lidar com atrito
Com um contrapeso, a força poderia ser mantida constante, e seria preciso mover apenas uma massa conhecida, qualquer que fosse o livro escaneado
É uma pena eu não ter conhecido antes de hoje; se tivesse conhecido, acho que teria dedicado tempo para aprender e contribuir. Ainda pode ser possível, mas, olhando agora, parece que ela já cobre praticamente todos os recursos de que já ouvi falar, e mais alguns
Passei 30 minutos clicando nos exemplos um por um
Existem scanners comerciais semelhantes [1] [2], também com projeto em V, mas invertidos para escanear por cima
Como quem se move é o scanner, não o livro, eles operam de forma muito mais delicada sobre o livro
Fico muito feliz em ver uma alternativa open source desse tipo sendo desenvolvida
[1] https://www.treventus.com
[2] https://youtu.be/SdipuAuWsEs?si=dFWRtva5gO2oM91o
Porque nenhuma das duas opções divulga informações de preço; elas apenas fazem você preencher um formulário de contato
https://youtu.be/4JuoOaL11bw?si=do1qet5Kq_WErQgz&t=162
Depois disso, o quanto ele manuseia o livro com delicadeza parece ter pouca importância
Talvez faça sentido se a ideia for reencadernar as páginas restantes e transformá-las em um livro novo
Gosto da ideia, mas, para fins de preservação ou para livros valiosos, fico um pouco preocupado com o risco de rasgar páginas
Nesses casos, eu provavelmente preferiria escanear manualmente de qualquer forma, mas muitas vezes quis ter um dispositivo desses para digitalizar uma quantidade grande demais de livros
Sobre a frequência de páginas rasgadas, o FAQ diz:
Um voluntário vira as páginas manualmente, abaixa e levanta duas placas de vidro para pressionar suavemente as páginas, e duas câmeras DSLR em suportes inclinados fazem as fotos
O equipamento inteiro não é automático, mas é fácil de operar manualmente
https://blog.archive.org/2021/02/09/meet-eliza-zhang-book-sc...
https://www.diybookscanner.org/en/intro.html
Tem que haver 0 página rasgada
Antes dos computadores, também não havia cópia eletrônica
Esta área ainda não alcançou o nível que o software já poderia possibilitar, então as pessoas estão resolvendo com hardware coisas que poderiam ser feitas por software
Com duas ou mais fotos, ou imagens estéreo — por exemplo, de um iPhone novo — como entrada, é possível estimar por triangulação uma página achatada e criar uma imagem que pareça uma página recortada de um scanner de mesa
Depois, basta pagar o suficiente a alguém na Etiópia para virar as páginas com cuidado, sem danificar o livro
Como qualquer pesquisador sabe, as bibliotecas digitais atuais acumulam um século de digitalizações de qualidade duvidosa
A IA consegue estimar uma digitalização difícil de distinguir do formato original de fonte vetorial em um monitor 8K
Antigamente, em relação às guerras de fontes dos anos 1980, prestei consultoria sobre transformar formatos antigos e digitalizações em fontes PostScript e TrueType
Na época era difícil, mas, quando o software alcançar isso, será entendido como a maneira correta de digitalizar texto
Na literatura científica, precisamos de algo como o ChatGPT que recupere o código-fonte LaTeX capaz de reproduzir cada página. Na verdade, precisamos mesmo é de um sucessor do LaTeX, menos obtuso e capaz de produzir texto fixo e texto fluido com a mesma facilidade
Participei de um projeto de preservação e escaneei uma quantidade enorme de revistas; em geral, não importava muito se elas ficavam ou não sobre uma mesa plana. De todo modo, virar as páginas à mão leva tempo
Já existe um método conhecido para escanear revistas e livros muito rapidamente: cortar a lombada da encadernação e colocar as páginas em um scanner automático
Claro, se você quiser preservar o objeto depois da digitalização, isso não se aplica, pois a cópia é destruída
No fim das contas, a melhor forma de automatizar a digitalização sem danificar o objeto precisa combinar uma câmera superior com uma máquina de virar páginas. Imagino que o projeto de digitalização em larga escala do Google tenha sido algo assim
Talvez seja possível “escanear” alguns livros com raios X, sem virar as páginas, mas acho que isso também traria novos problemas
O problema não é tanto o software ser ruim em corrigir distorções, mas sim que, depois de fazer toda a preparação para escanear livros, é melhor usar um dispositivo que não exija correção de distorção
Dá para ver aqui como funciona o achatamento. Essa parte era tratada pela biblioteca, então não foi necessário escrever código separado
https://youtu.be/DPu0iJtK2sI?t=1542
Também havia recursos para avisar que era hora de virar a página, detectar se ela tinha sido virada e tirar a foto. Em segundo plano, ele achatava a foto, separava as páginas e fazia OCR
Depois de pegar um pouco de prática, era possível escanear e fazer OCR de um livro a uma velocidade de 1 a 5 segundos por página
https://youtu.be/DPu0iJtK2sI?t=1909
Depois disso, o livro com OCR ficava salvo e podia ser lido em voz alta quando você quisesse
https://news.ycombinator.com/item?id=29223815
O risco de resultados plausíveis, mas errados já era uma preocupação antes da IA
Isto aqui parece muito mais seguro
https://www.inforum.com/newsmd/ndsu-students-book-scanner-in...
http://diybookscanner.org
Este projeto tenta resolver esse problema, mas precisa fazer isso de uma forma muito mais suave para não danificar os livros
Depois de escaneado, todo o conteúdo está em formato digital; então fico curioso por que desencadernar o livro em folhas soltas antes da digitalização não é um modelo escalável
A ideia é evitar o trabalho extra de desmontagem?
Mesmo ao escanear um livro, o que se obtém são apenas imagens ópticas. No caso de manuscritos medievais, por exemplo, uma página pode ter sido apagada e reescrita
Se você simplesmente escanear o livro e destruir a cópia física, perde esse tipo de evidência
Dito isso, no caso de um livro barato de mercado de massa, acho que a maioria dos arquivistas não se importaria muito em destruir um exemplar entre milhões para preservar a obra
Isso só se torna um problema real em obras muito antigas e muito raras
Parece que qualquer livro minimamente danificado vai acabar todo rasgado
Tenho vários livros antigos que gostaria de digitalizar, e a maioria dos scanners de livros comuns que vejo exige pelo menos abrir o livro totalmente; isso, como você disse, pode rasgá-lo
Além disso, esses aparelhos não incluem vácuo, movimento passando por bordas afiadas e motores de passo
Pela segunda pergunta em https://linearbookscanner.org/faq/:
Ainda assim, se houver uma montanha de livros a escanear e uma máquina dessas puder dar conta da maioria, deixando apenas os casos especiais para serem tratados com mais cuidado, isso já é um ganho
O Google, grosso modo, já escaneou todos os livros. O problema eram os direitos autorais e os titulares desses direitos.
Para virar as páginas, usaram mão de obra mal remunerada. Se ninguém postar o link antes, envio o link depois.
Quando voltei para casa, vi que era este artigo: https://www.theatlantic.com/technology/archive/2017/04/the-t...
Parece realmente incrível. Além de poder digitalizar livros, ele ainda os tritura de graça.
É uma oferta 2 em 1 bem interessante.
Tenho alergia a ácaros; se um livro fica uns seis meses na estante, só de tocá-lo já tenho uma reação alérgica.
Sacudir a parte externa ou passar aspirador não adianta.
Acho que este dispositivo poderia ser usado para remover ácaros dos livros e torná-los legíveis.