1 pontos por GN⁺ 2024-10-15 | 2 comentários | Compartilhar no WhatsApp
  • A literatura tibetana não se encaixa na suposição de parágrafos curtos dos processadores de texto comuns, e por isso enfrentou por muito tempo limitações práticas em ferramentas digitais de edição e publicação
  • A BDRC vem promovendo melhorias técnicas para que o tibetano seja tratado adequadamente em ambientes digitais, e desta vez o suporte do LibreOffice a parágrafos muito longos representa um avanço central
  • O fluxo de texto longo sem quebras de linha forçadas e com poucos espaços difere da forma de processamento de documentos do mundo anglófono, o que facilitava o surgimento de problemas de desempenho ao abrir ou converter longos textos tibetanos
  • Com a correção de Jonathan Clark, agora é possível abrir e editar rapidamente até mesmo um texto de 153 páginas composto por um único “parágrafo”, como o Yishindzö de Longchenpa, e a conversão de RDF para PDF, que antes travava por mais de 45 minutos, passou a terminar em 13 segundos
  • O suporte a parágrafos extremamente longos foi integrado ao LibreOffice 24.8.2, lançado em 27 de setembro de 2024, permitindo que usuários do tibetano usem de forma mais viável ferramentas gratuitas e de código aberto para publicação

Por que o suporte digital ao tibetano é importante

  • Uma das missões importantes da BDRC é a inovação tecnológica para tornar o tibetano um cidadão de primeira classe no mundo digital
  • Desde a introdução do budismo no século VIII, os tibetanos vêm investindo grande energia e recursos em escrita, inovação e tecnologia
    • A escrita tibetana e a língua clássica foram criadas para traduzir textos budistas em sânscrito e chinês para um idioma que os tibetanos pudessem compreender
    • No século XIV, a impressão em blocos de madeira foi amplamente adotada para produzir em grande escala traduções de escrituras e milhares de obras budistas tibetanas de autores do Himalaia
    • O surgimento de fontes tibetanas para computador e sua inclusão no Unicode Standard foram um grande salto no processo de integração do tibetano ao mundo digital

A estrutura dos textos tibetanos não combina com processadores de texto comuns

  • Os textos tibetanos têm características que ainda não são plenamente suportadas por todas as ferramentas e aplicações
  • Em especial, o conceito europeu de parágrafo não se aplica da mesma forma
    • Muitas vezes, os textos tibetanos precisam ser tratados como um fluxo longo e contínuo, sem quebras de linha forçadas
    • Esse fluxo às vezes pode chegar a centenas ou milhares de páginas
  • Os processadores de texto comuns foram originalmente projetados tendo o inglês em mente
    • Partem da premissa de parágrafos relativamente curtos
    • Assumem que há espaços entre palavras e que a largura desses espaços pode ser ajustada com flexibilidade
  • Nos textos tibetanos, o comprimento dos parágrafos é praticamente ilimitado e há muito poucos espaços, o que entra em conflito com essas premissas
  • Como resultado, ao abrir textos tibetanos longos, o processador de texto podia ficar extremamente lento ou até deixar de funcionar, dificultando seu uso em projetos sérios de publicação

Correção no LibreOffice e mudança real de desempenho

  • O LibreOffice é um dos processadores de texto de código aberto mais maduros e estáveis, inspirado no MS Word, e pode ser usado gratuitamente em várias plataformas, incluindo Linux
  • Softwares comerciais como Word ou InDesign conseguem lidar com textos tibetanos longos, mas têm custo alto e, em várias regiões da Ásia, muitas vezes acabam sendo usados em versões pirateadas
  • Enquanto o LibreOffice não conseguia lidar com parágrafos longos, não havia na prática uma ferramenta gratuita para publicação em tibetano
  • Elie Roux, CTO da BDRC, relatou esse problema ao LibreOffice em 2015
    • Intervir no código do LibreOffice era um grande projeto que exigia várias semanas de pesquisa e desenvolvimento, e por muito tempo não houve avanço
  • Algumas semanas atrás, Jonathan Clark assumiu esse problema e fez a correção
    • O Yishindzö de Longchenpa é um texto longo composto por um único “parágrafo” de 153 páginas
    • Agora ele pode ser aberto e editado rapidamente no LibreOffice
    • Esse texto pode ser visto no arquivo da BDRC em yid bzhin mdzod
  • A conversão do arquivo RDF desse texto específico para PDF antes permanecia travada mesmo após 45 minutos, mas agora é concluída em 13 segundos
  • O suporte a parágrafos extremamente longos foi integrado ao LibreOffice 24.8.2, lançado em 27 de setembro de 2024
  • A BDRC pede feedback sobre limitações e experiência de uso em softwares de edição tibetana e pretende continuar melhorando as ferramentas digitais para o tibetano por meio de colaboração com a comunidade

2 comentários

 
GN⁺ 2024-10-15
Comentários do Hacker News
  • Jim Woolsey, um hippie de New Hope, Pensilvânia, e hacker de computadores dos primórdios, foi uma das figuras iniciais importantes na digitalização do tibetano
    A entrevista de 1993 https://www.mcall.com/1993/10/08/new-hope-man-computer-guru-... é uma cápsula do tempo interessante e vale a leitura por si só
    Eu o conhecia por meio de amigos da família e sempre admirei sua dedicação singular a esse trabalho importante, porém subestimado

    • Infelizmente, esse link só mostra “This content is not available in your region
  • Acho que “documentos têm parágrafos razoavelmente curtos” também deveria entrar na lista de proposições falsas em que programadores acreditam sobre texto

    • Em alguns países, documentos legais não devem incluir quebras de parágrafo, então um único parágrafo pode se estender por centenas de páginas
      O OpenOffice tinha um limite rígido de 65534 caracteres por parágrafo, e foi preciso bastante trabalho para o LibreOffice remover isso: https://bugs.documentfoundation.org/show_bug.cgi?id=30668
    • Eu nunca tinha pensado nesse tipo de elemento na estrutura entre línguas
      Direção do texto, diacríticos e pontuação me vinham naturalmente à cabeça, mas eu achava que a divisão em blocos era universal
      Mas não é: “O conceito tipográfico de parágrafo nas línguas europeias não existe de fato da mesma forma nos textos tibetanos. Como resultado, textos tibetanos muitas vezes precisam ser tratados como longos fluxos contínuos de texto sem quebras de linha forçadas, às vezes chegando a centenas ou milhares de páginas”
    • Imagino algum programador por aí criando um buffer de 4096 caracteres e procurando o próximo '\n', só para ser derrotado pelo tibetano
  • Com todo respeito, a inventividade tibetana já é reconhecida até em The Nine Billion Names of God: https://en.wikipedia.org/wiki/The_Nine_Billion_Names_of_God

    • Unsong também se inspirou nisso: https://unsongbook.com/
    • Não sei como isso foi retratado no livro, mas não há deus no budismo tibetano
      E a inventividade deles vai muito além do que aparece nesse livro, ou pelo menos no resumo do enredo na Wikipedia
  • Gosto de expressões como “parágrafos relativamente curtos, talvez com algumas páginas”, porque mostram o quanto vejo o mundo a partir de uma perspectiva específica
    Acho que nunca escrevi um parágrafo de uma página
    Esqueci o nome, mas lembro de um escritor que escreveu várias páginas de fluxo de consciência sem parágrafos e sem pontuação, e esse é o exemplo mais próximo que me vem à mente

    • Escritores modernistas e pós-modernistas são famosos por fazer isso
      Por exemplo, James Joyce e David Foster Wallace
  • Esse trabalho já vem acontecendo há bastante tempo
    Há até uma antiga pilha do HyperCard para ensinar pronúncia tibetana, com áudio de 16 bits: https://hcsimulator.com/Learn-Tibetan

    • Existe só uma vogal, AH?
  • Vários tipos de escrita em fluxo de consciência ou estilos relacionados evitam parágrafos e, às vezes, até outras estruturas tradicionais, então é um pouco surpreendente que processadores de texto sofram com parágrafos longos
    Não é algo muito comum, mas também não é inexistente, e eu imaginava que escritores e editoras davam um jeito
    Exemplo aleatório recente: https://en.wikipedia.org/wiki/Ducks,_Newburyport

    • Pelo que entendi, nem espaços em branco há
  • Tenho curiosidade sobre os detalhes de como resolveram, ou deixaram de resolver, a questão do suporte a parágrafos extremamente longos
    Alguém sabe?

    • https://gerrit.libreoffice.org/c/core/+/172801
      É uma mudança bem curta que reduz o impacto O(n^2) com cache
      Essa mudança inclui melhorias de escalabilidade para documentos com parágrafos extremamente grandes
      Ela reduz o tamanho do contexto de layout para levar em conta caracteres de controle LF e, devido ao padrão típico de acesso durante a composição do parágrafo, faz com que o VCL use o cache LRU global existente em vez de chamar vcl::ScriptRun::next() em O(n^2), evitando assim uma sobrecarga considerável
  • Pelo que eu sabia, bengali e assamês usam a escrita tibetana; alguém sabe o quanto isso se parece com a escrita que os tibetanos usam para sua própria língua?

    • As escritas bengali/assamês e tibetana evoluíram ambas da escrita Gupta, mas as línguas em si são muito diferentes
      Bengali e assamês são do ramo indo-ariano, enquanto o tibetano pertence ao ramo sino-tibetano, uma família completamente diferente
      Como falante de bengali, quando fui ao Butão, onde se fala uma língua com 50% de inteligibilidade mútua com o tibetano, não consegui entender nada
      Eu esperava encontrar bastante vocabulário emprestado do budismo, mas fiquei surpreso que até palavras como dharma e karma soam completamente diferentes em tibetano
    • Links de referência: https://en.wikipedia.org/wiki/Bengali%E2%80%93Assamese_scrip...
      https://en.wikipedia.org/wiki/Tibetan_script
  • Idiomas são algo realmente interessante
    Podem ser fáceis de aprender e servir de meio de comunicação em uma região ampla, ou difíceis de dominar, mas capazes de criar estruturas e pensamentos muito complexos e transmiti-los entre falantes
    Em que ponto desse espectro estará o tibetano?

    • Não sei se essas duas coisas são mutuamente exclusivas
      Tópicos altamente técnicos inevitavelmente vêm com terminologia altamente técnica
      Mas não tenho certeza de que a quantidade de nuances sutis que uma língua possui esteja relacionada à complexidade dos pensamentos que podem ser expressos nela
  • Sou Eyal, voluntário do projeto LibreOffice, e faço bastante garantia de qualidade relacionada a escritas da direita para a esquerda e scripts de layout complexo de texto
    Obrigado ao thunderbong3 por postar o link desse texto, e meu sincero agradecimento a Jonathan Clark, o novo desenvolvedor responsável por RTL-CTL-CJK na The Document Foundation, que implementou melhorias no desempenho do tibetano
    A maioria dos bugs que encontro e reporto no LibreOffice são problemas gerais que não se limitam a um sistema de escrita específico
    Por exemplo, código que esquece que o conteúdo pode ser da direita para a esquerda acaba funcionando errado nesses casos
    Uma parte considerável dos bugs específicos de sistemas de escrita está relacionada à escrita árabe, a mais usada, que também é usada para farsi, urdu, javanês etc.
    Ainda assim, também há problemas relacionados a sistemas de escrita menos difundidos, como tibetano ou mongol: https://bugs.documentfoundation.org/show_bug.cgi?id=115607
    Esse meta-bug acompanha problemas de mongol, tibetano, uigur, zhuang, cazaque, xibo, dai, yi, miao, jingpo, lisu, lahu, wa e outros
    Não sei se realmente há poucos problemas específicos dessas línguas, ou se elas simplesmente não são muito usadas e os usuários não têm motivação suficiente para registrar bugs
    Ainda assim, como mostram as correções recentes do Jonathan, claramente existe interesse em resolver isso quando há tempo de desenvolvimento disponível
    Se você se interessa por esses sistemas de escrita e pela equidade na edição de documentos entre países e culturas, experimente usar o LibreOffice em um idioma que você conheça e, se encontrar bugs, publique-os no BugZilla: https://bugs.documentfoundation.org/
    Considere também apoiar financeiramente a The Document Foundation, que administra o projeto LibreOffice: https://www.libreoffice.org/donate/
    Somos um dos grandes projetos de software livre e de código aberto do mundo, com dezenas de milhões de usuários regulares, talvez mais de 100 milhões, e até um conselho com membros de dezenas de países
    Mas não há grandes empresas investindo quantias significativas de dinheiro ou tempo no projeto
    Algumas empresas comerciais, como Collabora e Allotropia, contribuem, mas muitos problemas fundamentais não estão próximos o bastante das demandas de seus clientes
    Por isso decidimos contratar Jonathan diretamente para reforçar o suporte a RTL-CTL-CJK, e esse tipo de trabalho é viabilizado por doações de usuários individuais

    • Eu também ficaria muito grato se dessem suporte ao dzonga
 
kayws426 2024-10-15

Ainda bem que o coreano tem espaços; sem isso, teria sido complicado.