1 pontos por GN⁺ 2023-10-21 | 1 comentários | Compartilhar no WhatsApp
  • A Wikipédia abriga tanto páginas populares que recebem milhões de visualizações por semana quanto artigos extremamente impopulares que, entre mais de 6 milhões de páginas, são lidos apenas um número de vezes de um dígito por ano
  • Em uma amostra de cerca de 32.000 artigos de 2021, o grupo com menos visualizações tinha muitos artigos de desambiguação; excluindo-os, sobravam stubs curtos sobre espécies de mariposas e moscas, vilarejos do Irã e sobrenomes, com apenas 7 a 9 visualizações no ano
  • O botão “Random article” altera a probabilidade de seleção conforme o random gap entre o valor page_random de cada página e o valor anterior, fazendo com que alguns artigos apareçam muito menos do que a média
  • Ao restringir a busca às 600 mil páginas com gap de cerca de 1/10 da média ou menos, os artigos com menos visualizações em 2021 foram Trichromia phaeocrota e Opharus corticea, com 3 visualizações humanas estimadas cada
  • Entre os 500 últimos colocados havia muitos táxons de insetos, alguns gastrópodes e fungos, acidentes geográficos e páginas do tipo set index; artigos sobre espécies e localidades muitas vezes permanecem no ar mesmo com fontes fracas por causa de critérios de inclusão mais brandos

Características dos artigos impopulares reveladas pela amostra

  • A Wikipédia tem mais de 6 milhões de artigos, e os populares recebem milhões de visualizações por semana
  • No extremo oposto, há páginas que mal recebem algumas visitas por dia; exemplos:
  • Entre os artigos criados pelo autor, o menos popular é Sunday reading periodical, uma página sobre um gênero de revista da era vitoriana, com média de cerca de 12 visualizações por mês
  • Os dados de visualização da Wikipédia são públicos via dumps brutos e API, mas não existe uma forma simples de ordenar diretamente os artigos menos vistos

Análise de uma amostra aleatória de 32.000 artigos

  • Foram coletados dados de visualizações de 2021 para uma amostra de cerca de 32.000 artigos da Wikipédia
  • A mediana anual de visualizações da amostra ficou um pouco abaixo de 1.000, e a média foi de cerca de 13.000 por causa da cauda longa
  • Havia quase 100 artigos na amostra com total anual de visualizações de apenas um dígito em 2021
  • Porém, os 50 últimos colocados eram todos artigos de desambiguação, que na análise não foram considerados “artigos reais”
  • Excluindo os artigos de desambiguação, os artigos com visualizações anuais de um dígito se resumiam a poucos stubs na faixa de 7 a 9 visualizações por ano

O botão “Random article” e o random gap

  • Essas contagens extremamente baixas podem ser resultado de visitas geradas quando usuários clicam no botão Random article
  • Desde 2015, o botão Random article foi implementado para ignorar páginas de desambiguação, o que pode explicar por que elas se concentraram entre as menores contagens da amostra
  • Quando um artigo da Wikipédia é criado, ele recebe um valor aleatório entre 0 e 1 chamado page_random
  • Quando chega uma solicitação de Random article, o servidor gera um número aleatório entre 0 e 1 e retorna o artigo com o menor page_random maior que esse valor
  • Esse método não é totalmente justo
    • A probabilidade de um artigo ser escolhido é igual ao tamanho do random gap, isto é, à diferença entre o valor page_random daquele artigo e o valor do artigo imediatamente anterior
    • Artigos com gap pequeno também têm menor chance de serem escolhidos em Random article

Relação entre o piso de visualizações e o random gap

  • Se a Wikipédia tem cerca de 6 milhões de artigos, o random gap médio é cerca de 1/6,000,000, ou 1.67e-7
  • Na amostra, o artigo menos visto, Erygia sigillata, tem page_random de 0.500764585777, e o artigo imediatamente anterior, Katherine Hanley, tem 0.500764582314
  • A diferença entre os dois valores é de cerca de 3e-9, 98% menor que o random gap médio, o que faz esse artigo ter 50 vezes menos chance de ser escolhido em Random article do que um artigo médio
  • Os random gaps de outros 5 artigos com visualizações anuais de um dígito também foram 3e-9, 9e-9, 8e-9, 4e-9, 8e-9, 2e-8, todos cerca de uma ordem de grandeza abaixo da média
  • Em toda a amostra de 32.000 artigos, a relação entre random gap e visualizações não é tão clara
    • Mas ela aparece de forma mais nítida em conjuntos que já parecem ter pouco interesse intrínseco, como artigos com menos de 200 visualizações por ano ou os cerca de 1.500 artigos de Category:Phaegopterina stubs

Os artigos menos vistos de 2021

  • Para estar entre os menos vistos, um artigo não precisa apenas tratar de um tema com pouco interesse público; ele também precisa ter um random gap muito pequeno
  • A análise foi restringida às 600 mil páginas “mais azaradas”, com gap de 1.7e-8 ou menos, cerca de 1/10 da média
  • Mesmo essas 600 mil páginas tiveram pelo menos algumas visualizações em 2021
  • O posto de artigo menos visto de 2021 ficou empatado entre duas páginas, com 3 visualizações estimadas como humanas
  • Ambos são artigos sobre espécies de mariposa

Padrões recorrentes entre os 500 últimos colocados

  • A lista dos 500 últimos colocados pode ser vista em Least viewed articles in 2021
  • A distribuição temática é muito consistente
    • Muitos são artigos sobre espécies de insetos ou outros táxons de insetos
    • Também há 17 gastrópodes e 1 fungo chamado Harknessiella
    • A categoria seguinte mais comum é a de acidentes geográficos, especialmente vilarejos do Irã e do Sri Lanka
    • Também há artigos geográficos curtos como Kälberbuckel
  • Outra categoria recorrente é a de páginas do tipo set index
  • Um set index article parece e funciona de forma parecida com uma página de desambiguação, mas na classificação da Wikipédia não é uma página de desambiguação
  • Há também alguns casos como DMZ//38 e EuroNanoForum 2009, que lembram os critérios de inclusão mais frouxos da Wikipédia antiga

Por que há tantas mariposas

  • A Wikipédia aplica exigências rígidas de fontes para temas como pessoas vivas, empresas e bandas
  • Esses temas podem ser explorados para autopromoção, interesses próprios ou disputas editoriais, então não basta confirmar o assunto com uma fonte primária simples; é preciso haver cobertura significativa em várias fontes secundárias independentes
  • Por isso, temas que cumprem essas exigências provavelmente também interessam a alguém além dos usuários do Random article, e quase não aparecem entre os 500 últimos colocados
  • Em contrapartida, artigos sobre espécies e artigos sobre localidades habitadas em geral não são apagados
    • Muitas vezes permanecem mesmo quando o tema tem fontes fracas
    • Muitos dos artigos do fim da lista dependem de uma única fonte, como bancos de dados, gazetteers ou menções breves em livros e periódicos acadêmicos
  • Por causa desse padrão mais brando, alguns artigos parecem stubs gerados de forma mecânica
    • Pottallinda é um stub de 12 palavras que recebeu 5 visualizações em 2021
    • Foi criado em 18 de janeiro de 2011 por User:Ser Amantio di Nicolao, que em menos de 60 segundos também criou várias páginas parecidas, como Polmalagama, Polommana, Polpitiya e Polwatta
  • Esses artigos minúsculos e impopulares podem decepcionar usuários do Random article, mas também podem servir como trabalho de base para que outros editores os expandam depois

Dados e código

  • Os dados de visualização e o código de scraping e análise estão disponíveis no repositório GitHub wiki-pageview-floor

1 comentários

 
GN⁺ 2023-10-21
Comentários do Hacker News
  • O motivo de isso acontecer na Wikipedia não é monetização nem pontos de vista controversos; é que o critério de notoriedade, derivado da natureza e da qualidade das fontes citadas, é o que mais frequentemente é usado nas decisões de eliminação.
    Antigamente, havia uma diretriz segundo a qual pessoas que competiam em esportes em nível internacional eram, em geral, notórias, então até um jogador de futebol que tivesse feito só uma partida pela seleção podia evitar a eliminação com fontes fracas.
    Mas, com o fim dessa diretriz e o retorno à diretriz geral de notoriedade (GNG), passou a ser necessário, para biografias, uma cobertura biográfica substancial feita por veículos tradicionais confiáveis de alcance nacional, enquanto relatos de jogos, entrevistas locais e mídia de fãs geralmente ficam de fora.
    Como resultado, centenas de esboços e dezenas de artigos completos sobre jogadoras internacionais de futebol, mesmo campeãs da Copa do Mundo, não conseguiram atender à GNG por terem relativamente pouca cobertura na mídia tradicional; quando um editor, depois do início da Copa do Mundo Feminina deste verão, indicou em massa esses artigos para eliminação, quase todos foram eliminados.
    Portanto, o motivo de artigos sobre mariposas ou lugares permanecerem não é monetização nem caráter controverso, mas o fato de que se aplicam critérios de notoriedade completamente diferentes a objetos e lugares, que não podem processar editores da Wikipedia por difamação.

    • Ainda hoje de manhã eu estava lendo o artigo sobre a Interstate 94 e acabei chegando ao WikiProject que o mantém, o US Roads; vi que, um mês atrás, eles escreveram uma carta aberta dizendo que deixariam a Wikipedia e criariam sua própria wiki por causa do sofrimento causado por artigos serem eliminados com base em diretrizes arbitrárias de notoriedade.
      https://en.wikipedia.org/wiki/Wikipedia:WikiProject_U.S._Roads/Newsletter/Issues/Volume10/Issue01
    • Escrevi o artigo sobre The Mexican Runner, uma figura bem de nicho, e tive que brigar um pouco para convencer outros editores de que ele era notório.
      Como havia cobertura da Polygon e do Kotaku, achei que era suficiente, mas no começo foi uma tarefa difícil.
      Alguém que aperta botões muito rápido é, afinal, uma pessoa notória?
    • Alguém acredita que o critério de “fontes tradicionais confiáveis de alcance nacional” seja realmente aplicado de forma consistente?
      Imagino que existam inúmeros artigos da Wikipedia sobre pessoas com vários papéis e cargos em tecnologia, academia, política local etc. que não atenderiam a esse critério.
    • A Wikipedia não é uma entidade única; aqui provavelmente estão falando da English Wikipedia, mas, pelo que sei, Wikipedias em outros idiomas têm seus próprios requisitos de notoriedade, às vezes bastante diferentes.
    • As diretrizes de notoriedade da Wikipedia são rígidas demais há muito tempo.
      Lembro de ter ficado perplexo ao ver que até um webcomic bastante popular não podia ter um artigo na wiki.
  • Acho que um dos melhores recursos pouco conhecidos da Wikipedia são as caixas de navegação recolhidas no fim de cada artigo.
    São ótimas para ter uma visão geral de temas complexos e ver onde um item se encaixa dentro de uma hierarquia complicada.
    Algumas parecem pequenas obras de arte que eu gostaria de pendurar na parede um dia.
    https://imgur.com/gallery/ILp6TtA
    Entendo por que elas precisam ficar recolhidas por padrão, mas uso userjs para movê-las para o topo da página, deixá-las abertas e usá-las na navegação.
    Para que não ocupem espaço demais, deixei o zoom do CSS em 0.3.

    • É interessante você achar isso atraente como “arte”, mas eu não vejo assim de jeito nenhum.
  • O modo de escolher um artigo aleatório é chocante
    Isso inevitavelmente cria um viés permanente na aleatorização, e a probabilidade de cada artigo ser escolhido pode acabar mudando ao longo do tempo de uma forma muito dependente do caminho percorrido
    Sortear um inteiro aleatório de 1 a N não é ciência de foguetes
    Fico até me perguntando se não há algum peso intencional, como deixar espaço vazio antes de certos artigos preferidos para que apareçam com mais frequência

    • É chocante mesmo, mas o mais chocante é que fazer isso direito chega bem perto de ser ciência de foguetes
      MySQL não foi feito para escolher uma linha realmente aleatória com boa performance
      Uma abordagem ingênua como ORDER BY RAND() LIMIT 1 tem performance terrível, e LIMIT 0 OFFSET RAND() * row_count é igualmente ruim
      Se você usa uma abordagem performática como WHERE id >= RAND() * max_id ORDER BY id LIMIT 1, cai no mesmo problema: os buracos nos IDs causados por artigos excluídos fazem certos artigos serem sorteados com mais frequência
      Só há duas soluções corretas: sortear um ID aleatório e tentar de novo se ele não for válido, ou manter uma coluna/tabela separada com todos os artigos válidos em uma sequência de inteiros
      A primeira tem performance difícil de prever, porque pode precisar tentar de novo 20 vezes dependendo de quão esparsos os IDs são; a segunda exige recalcular e reescrever, em média, metade da coluna de inteiros sempre que um artigo é excluído
      No fim, considerando que é quase um recurso de brinquedo, o método da Wikipedia é “bom o suficiente”, e seus pontos fracos poderiam ser reduzidos recalculando números aleatórios em jobs diários/semanais ou a cada edição de artigo
      Também daria para melhorar bastante escolhendo não só o artigo mais próximo no método atual, mas cerca de 50 antes e 50 depois, e então sorteando de novo entre esses 100
      É um hack completo, mas na prática ainda seria muito rápido
    • O que você faria se não pudesse saber de antemão quais artigos foram excluídos?
      Se escolher um inteiro aleatório de 1 a N, existe uma chance de cair em um resultado ruim
      Pensando em spam, a possibilidade de haver mais páginas ruins do que boas não é pequena; nesse caso seria preciso sortear de novo várias vezes
      Acho o novo sorteio uma estratégia aceitável, mas é difícil imaginar que todo mundo simplesmente confie nessa probabilidade
      Na prática, se você criar uma wiki com 99 páginas ruins e 1 página boa, o botão de artigo aleatório quase nunca vai funcionar
      Também dá para sortear de 1 a M, usando M como o número de artigos válidos, mas continua o mesmo problema de como mapear esse número para um ID real de artigo
      Esse método pode ter viés, mas tem performance em tempo constante
      Pessoalmente, eu preferiria manter todos os artigos válidos em memória e escolher um deles
      Em outubro eram só 7 milhões e, mesmo incluindo artigos excluídos, provavelmente algo como 70 milhões, uma escala parecida com o número total de itens do HN
      Até criar um arquivo por artigo válido no disco, fazer uma busca aleatória com find . -type f | shuf -n 1 e cachear o resultado a cada poucos segundos não me pareceria tão ruim, embora isso também tenha seu próprio viés
    • Se chegaram a fazer tudo isso, é bem provável que selecionar uma linha aleatória no banco de dados seja de fato uma operação lenta
      Como é um recurso puramente recreativo, não importa muito se os pesos não forem iguais, e dizem que no MariaDB ORDER BY RAND() LIMIT 1 faz um scan da tabela inteira
    • Se houver um banco de dados de artigos com IDs, independentemente de terem sido excluídos ou não, e cada servidor de aplicação souber o intervalo de IDs, e você quiser sortear um artigo não excluído, eu faria algo assim
      1. manteria um cache remoto para artigos excluídos e 2) toda vez que o servidor de aplicação sorteasse um artigo excluído, ele o adicionaria ao cache remoto
        O cache remoto ficaria local ao datacenter, seria apoiado por armazenamento persistente e poderia ter um TTL longo
        Durante o TTL do cache, talvez um artigo restaurado não pudesse ser sorteado, mas tudo bem
        A localidade por datacenter garante certa tolerância a falhas e baixa latência, e o armazenamento persistente reduz o problema de cache frio em reinicializações
        A marca d'água máxima do intervalo de IDs poderia ser atualizada de forma assíncrona, e tudo bem se artigos novos não aparecerem por um tempo
    • Cheguei a pensar que pesos diferentes poderiam ser intencionais, porque isso me lembrou codificação aritmética
      No fim, era só coincidência
      A implementação atual faz sentido: à medida que o número de artigos cresce, os pesos ficam aproximadamente parecidos, e o usuário individual provavelmente não se importa muito com justiça desde que receba um artigo aleatório
  • É realmente incrível poder encontrar em um só lugar informações sobre uma mariposa comum do Peru, algum vilarejo minúsculo no Irã ou leituras dominicais da Inglaterra vitoriana
    Antes da internet, esse tipo de conteúdo nem valeria o custo do papel em que seria impresso; agora, como o custo de armazenamento em nuvem é praticamente próximo de zero, ganhamos uma longa cauda de informação extremamente valiosa
    Sou grato às pessoas que contribuem e mantêm esse conteúdo
    Além disso, seria muito legal poder deixar em alguma página uma nota como “visitei esta página e gostaria de me conectar com outra pessoa interessada na mariposa peruana Foovius Barivius”

    • Eu gosto muito da Wikipedia atual, mas anseio pela volta da antiga política de inclusionismo
      https://gwern.net/inclusionism
    • Sobre esse último adendo, sempre achei que seria um projeto pessoal interessante aplicar à Wikipedia os mecanismos de altíssimo engajamento usados por apps de redes sociais
      Por exemplo, poderia haver um feed vertical no estilo TikTok que encontra os artigos que o usuário provavelmente passaria mais tempo lendo, e o WikiScroll já está indo um pouco nessa direção
      Também seria possível anexar uma sala de chat a cada artigo para as pessoas conversarem, ou ter DMs, mas permitindo enviar apenas links da Wikipedia
      A ideia da Wikipedia como catalisador social é muito interessante
      https://wikiscroll.blankenship.io/
    • Um jabá bem descarado sobre o último “Edit”: uma extensão web que eu criei tem exatamente essa funcionalidade: https://webcursors.click/
      Se você deixar uma nota em uma página, outras pessoas com a mesma extensão instalada poderão vê-la e, com sorte, talvez entrem em contato
    • Sou realmente grato à Wikipedia
      Na minha opinião, é a melhor parte da internet
  • É possível provar matematicamente que não há nenhum artigo desinteressante na Wikipedia
    Basta provar por redução ao absurdo
    Depois de classificar todos os artigos por ordem de interesse e ordená-los, ao olhar para o menor valor, necessariamente existe o artigo mais sem graça
    Mas o próprio fato de esse artigo ser o mais sem graça de toda a Wikipedia o torna interessante
    Da mesma forma, acho que os artigos com menor número de visualizações mencionados neste post do blog provavelmente já perderam esse status a esta altura

    • Claro que também existe um artigo da Wikipedia sobre isso: https://en.wikipedia.org/wiki/Interesting_number_paradox
    • Tenho dúvidas se essa prova é válida
      Parece partir do pressuposto de que existe exatamente um artigo mais sem graça
      Mas pode haver centenas de artigos com o mesmo nível mínimo de interesse e, nesse caso, essas centenas teriam de ser consideradas artigos sem graça
    • A rigor, o post está olhando para os documentos menos visualizados em 2021
    • O interesse gerado por ser o artigo mais sem graça precisa ser grande o bastante para preencher a lacuna entre o artigo mais sem graça e o segundo mais sem graça
      E também é preciso levar em conta o interesse de ser o segundo artigo mais sem graça
      Provavelmente é verdade, então QED
    • É preciso de fato encontrá-lo
      Até alguém encontrar o artigo mais sem graça e pensar nele, ele não é interessante
      Propriedades matemáticas são eternas e existem quer alguém as observe ou não
  • Isso me lembrou a série do Geoff Marshall sobre as Least Used Stations da Network Rail no Reino Unido
    https://www.youtube.com/playlist?list=PLt4q5oaptyI9U2zddss8dm8srzuJj6nRz
    https://www.youtube.com/@geofftech2

    • Canal e vídeos realmente divertidos; obrigado pelo link
  • Administradores da Wikipedia são ativos em apagar artigos que alegam não ser importantes, então acho que o artigo com menor número de visualizações deve mudar com bastante frequência

    • O artigo Carrier_IQ que eu escrevi foi apagado por não ser notório, por motivos políticos óbvios, e depois recriado alguns anos mais tarde, quando a batalha de opinião pública sobre a empresa já tinha sido resolvida
      Pode ter havido também alguma brincadeira por parte de agências de inteligência
      É uma ótima maneira de apagar fatos históricos inconvenientes
      Agora virou apenas uma historinha engraçada sobre um rootkit, sem nenhuma conspiração política específica
    • Sim, mas, pela minha experiência, isso se aplica mais a pessoas do que a alguns dos temas tratados no artigo
      Por exemplo, acho que seria difícil encontrar uma cidade, vila, povoado ou pequeno assentamento dos EUA que não tenha artigo na Wikipedia
      Jack Wade, Alaska aparece no Google Maps com algo como 8 casas, mas mesmo assim está na Wikipedia
      Também não acho provável que um artigo sobre uma espécie rara de mariposa seja removido
      Ainda assim, se quisermos impedir que toda pessoa do planeta tenha um artigo na Wikipedia, alguma política é necessária
      Google Maps: https://www.google.com/maps/place/Jack+Wade,+AK+99732/@64.1519419,-141.4630071,448a,35y,3.16t/data=!3m1!1e3!4m6!3m5!1s0x5149e998873be075:0x2f1a9ca47f03bf1b!8m2!3d64.1526072!4d-141.4604683!16s%2Fm%2F0480bm5?entry=ttu
      Wikipedia: https://en.wikipedia.org/wiki/Jack_Wade,_Alaska
    • O autor também trata justamente desse ponto, e esses artigos parecem pouco propensos a serem apagados
      A exceção talvez seja vandalismo decorrente da revelação desse status peculiar
      Só para dar uma dica a quem tiver interesse: pode ser um subproduto do conjunto de dados usado pelo autor, mas uma característica comum dos artigos com menor número de visualizações é que seus temas pertencem a categorias que, pelas diretrizes de conteúdo da Wikipedia, normalmente não são alvo de remoção
  • O autor disse que seria pouco provável que um artigo sobre mariposas oferecesse oportunidade para empurrar um ponto de vista controverso, mas o histórico de edição mostra que no começo deste ano houve uma divergência sobre a envergadura de Scrobipalpula crustaria
    11–13 mm ou 10–13 mm?
    As pessoas têm sentimentos fortes sobre esse tipo de coisa

  • Se você descobrir e divulgar o nome do artigo da Wikipedia com menos visualizações, as visualizações desse artigo sobem, eliminando o motivo de tê-lo encontrado em primeiro lugar

    • Parece o efeito do observador
      https://en.m.wikipedia.org/wiki/Observer_effect_(physics)
    • Não entendo bem qual seria o motivo original, então
      Há algum problema?
      Para ser justo, a análise foi feita sobre o conjunto de dados de 2021, então obviamente não é afetada
    • A busca por um hapax legomenon na internet sofre de um problema parecido, e ainda pior
      Mesmo que você encontre um, ele é destruído no momento em que você anuncia sua existência
      Veja quizzaciously
  • Mesmo com mais de 6 milhões de artigos, 6,0e6 já era um número viável para força bruta havia décadas
    Uma busca linear talvez levasse menos tempo do que ler o artigo, e quase certamente menos tempo do que escrevê-lo
    Claro, se tivessem feito isso, não teria sido tão divertido nem tão engenhoso, mas boa engenharia quase sempre é assim