Em busca do artigo menos visto da Wikipédia (2022)
(colinmorris.github.io)- A Wikipédia abriga tanto páginas populares que recebem milhões de visualizações por semana quanto artigos extremamente impopulares que, entre mais de 6 milhões de páginas, são lidos apenas um número de vezes de um dígito por ano
- Em uma amostra de cerca de 32.000 artigos de 2021, o grupo com menos visualizações tinha muitos artigos de desambiguação; excluindo-os, sobravam stubs curtos sobre espécies de mariposas e moscas, vilarejos do Irã e sobrenomes, com apenas 7 a 9 visualizações no ano
- O botão “Random article” altera a probabilidade de seleção conforme o random gap entre o valor
page_randomde cada página e o valor anterior, fazendo com que alguns artigos apareçam muito menos do que a média - Ao restringir a busca às 600 mil páginas com gap de cerca de 1/10 da média ou menos, os artigos com menos visualizações em 2021 foram Trichromia phaeocrota e Opharus corticea, com 3 visualizações humanas estimadas cada
- Entre os 500 últimos colocados havia muitos táxons de insetos, alguns gastrópodes e fungos, acidentes geográficos e páginas do tipo set index; artigos sobre espécies e localidades muitas vezes permanecem no ar mesmo com fontes fracas por causa de critérios de inclusão mais brandos
Características dos artigos impopulares reveladas pela amostra
- A Wikipédia tem mais de 6 milhões de artigos, e os populares recebem milhões de visualizações por semana
- No extremo oposto, há páginas que mal recebem algumas visitas por dia; exemplos:
- Entre os artigos criados pelo autor, o menos popular é Sunday reading periodical, uma página sobre um gênero de revista da era vitoriana, com média de cerca de 12 visualizações por mês
- Os dados de visualização da Wikipédia são públicos via dumps brutos e API, mas não existe uma forma simples de ordenar diretamente os artigos menos vistos
Análise de uma amostra aleatória de 32.000 artigos
- Foram coletados dados de visualizações de 2021 para uma amostra de cerca de 32.000 artigos da Wikipédia
- A mediana anual de visualizações da amostra ficou um pouco abaixo de 1.000, e a média foi de cerca de 13.000 por causa da cauda longa
- Havia quase 100 artigos na amostra com total anual de visualizações de apenas um dígito em 2021
- Porém, os 50 últimos colocados eram todos artigos de desambiguação, que na análise não foram considerados “artigos reais”
- Excluindo os artigos de desambiguação, os artigos com visualizações anuais de um dígito se resumiam a poucos stubs na faixa de 7 a 9 visualizações por ano
- Erygia sigillata: espécie de mariposa
- Hilarigona obscurata: espécie de mosca
- Loxocrambus hospition: mariposa
- Makhoshin: vilarejo no Irã
- Bojerud: sobrenome
- Scrobipalpula crustaria: mariposa
O botão “Random article” e o random gap
- Essas contagens extremamente baixas podem ser resultado de visitas geradas quando usuários clicam no botão Random article
- Desde 2015, o botão Random article foi implementado para ignorar páginas de desambiguação, o que pode explicar por que elas se concentraram entre as menores contagens da amostra
- Quando um artigo da Wikipédia é criado, ele recebe um valor aleatório entre 0 e 1 chamado
page_random - Quando chega uma solicitação de Random article, o servidor gera um número aleatório entre 0 e 1 e retorna o artigo com o menor
page_randommaior que esse valor - Esse método não é totalmente justo
- A probabilidade de um artigo ser escolhido é igual ao tamanho do random gap, isto é, à diferença entre o valor
page_randomdaquele artigo e o valor do artigo imediatamente anterior - Artigos com gap pequeno também têm menor chance de serem escolhidos em Random article
- A probabilidade de um artigo ser escolhido é igual ao tamanho do random gap, isto é, à diferença entre o valor
Relação entre o piso de visualizações e o random gap
- Se a Wikipédia tem cerca de 6 milhões de artigos, o random gap médio é cerca de
1/6,000,000, ou1.67e-7 - Na amostra, o artigo menos visto, Erygia sigillata, tem
page_randomde0.500764585777, e o artigo imediatamente anterior, Katherine Hanley, tem0.500764582314 - A diferença entre os dois valores é de cerca de
3e-9, 98% menor que o random gap médio, o que faz esse artigo ter 50 vezes menos chance de ser escolhido em Random article do que um artigo médio - Os random gaps de outros 5 artigos com visualizações anuais de um dígito também foram
3e-9,9e-9,8e-9,4e-9,8e-9,2e-8, todos cerca de uma ordem de grandeza abaixo da média - Em toda a amostra de 32.000 artigos, a relação entre random gap e visualizações não é tão clara
- Mas ela aparece de forma mais nítida em conjuntos que já parecem ter pouco interesse intrínseco, como artigos com menos de 200 visualizações por ano ou os cerca de 1.500 artigos de Category:Phaegopterina stubs
Os artigos menos vistos de 2021
- Para estar entre os menos vistos, um artigo não precisa apenas tratar de um tema com pouco interesse público; ele também precisa ter um random gap muito pequeno
- A análise foi restringida às 600 mil páginas “mais azaradas”, com gap de
1.7e-8ou menos, cerca de 1/10 da média - Mesmo essas 600 mil páginas tiveram pelo menos algumas visualizações em 2021
- O posto de artigo menos visto de 2021 ficou empatado entre duas páginas, com 3 visualizações estimadas como humanas
- Trichromia phaeocrota: random gap
4e-9 - Opharus corticea: random gap
1e-9
- Trichromia phaeocrota: random gap
- Ambos são artigos sobre espécies de mariposa
Padrões recorrentes entre os 500 últimos colocados
- A lista dos 500 últimos colocados pode ser vista em Least viewed articles in 2021
- A distribuição temática é muito consistente
- Muitos são artigos sobre espécies de insetos ou outros táxons de insetos
- Também há 17 gastrópodes e 1 fungo chamado Harknessiella
- A categoria seguinte mais comum é a de acidentes geográficos, especialmente vilarejos do Irã e do Sri Lanka
- Também há artigos geográficos curtos como Kälberbuckel
- Outra categoria recorrente é a de páginas do tipo set index
- Um set index article parece e funciona de forma parecida com uma página de desambiguação, mas na classificação da Wikipédia não é uma página de desambiguação
- Há também alguns casos como DMZ//38 e EuroNanoForum 2009, que lembram os critérios de inclusão mais frouxos da Wikipédia antiga
Por que há tantas mariposas
- A Wikipédia aplica exigências rígidas de fontes para temas como pessoas vivas, empresas e bandas
- Esses temas podem ser explorados para autopromoção, interesses próprios ou disputas editoriais, então não basta confirmar o assunto com uma fonte primária simples; é preciso haver cobertura significativa em várias fontes secundárias independentes
- Por isso, temas que cumprem essas exigências provavelmente também interessam a alguém além dos usuários do Random article, e quase não aparecem entre os 500 últimos colocados
- Em contrapartida, artigos sobre espécies e artigos sobre localidades habitadas em geral não são apagados
- Muitas vezes permanecem mesmo quando o tema tem fontes fracas
- Muitos dos artigos do fim da lista dependem de uma única fonte, como bancos de dados, gazetteers ou menções breves em livros e periódicos acadêmicos
- Por causa desse padrão mais brando, alguns artigos parecem stubs gerados de forma mecânica
- Pottallinda é um stub de 12 palavras que recebeu 5 visualizações em 2021
- Foi criado em 18 de janeiro de 2011 por User:Ser Amantio di Nicolao, que em menos de 60 segundos também criou várias páginas parecidas, como Polmalagama, Polommana, Polpitiya e Polwatta
- Esses artigos minúsculos e impopulares podem decepcionar usuários do Random article, mas também podem servir como trabalho de base para que outros editores os expandam depois
Dados e código
- Os dados de visualização e o código de scraping e análise estão disponíveis no repositório GitHub wiki-pageview-floor
1 comentários
Comentários do Hacker News
O motivo de isso acontecer na Wikipedia não é monetização nem pontos de vista controversos; é que o critério de notoriedade, derivado da natureza e da qualidade das fontes citadas, é o que mais frequentemente é usado nas decisões de eliminação.
Antigamente, havia uma diretriz segundo a qual pessoas que competiam em esportes em nível internacional eram, em geral, notórias, então até um jogador de futebol que tivesse feito só uma partida pela seleção podia evitar a eliminação com fontes fracas.
Mas, com o fim dessa diretriz e o retorno à diretriz geral de notoriedade (GNG), passou a ser necessário, para biografias, uma cobertura biográfica substancial feita por veículos tradicionais confiáveis de alcance nacional, enquanto relatos de jogos, entrevistas locais e mídia de fãs geralmente ficam de fora.
Como resultado, centenas de esboços e dezenas de artigos completos sobre jogadoras internacionais de futebol, mesmo campeãs da Copa do Mundo, não conseguiram atender à GNG por terem relativamente pouca cobertura na mídia tradicional; quando um editor, depois do início da Copa do Mundo Feminina deste verão, indicou em massa esses artigos para eliminação, quase todos foram eliminados.
Portanto, o motivo de artigos sobre mariposas ou lugares permanecerem não é monetização nem caráter controverso, mas o fato de que se aplicam critérios de notoriedade completamente diferentes a objetos e lugares, que não podem processar editores da Wikipedia por difamação.
https://en.wikipedia.org/wiki/Wikipedia:WikiProject_U.S._Roads/Newsletter/Issues/Volume10/Issue01
Como havia cobertura da Polygon e do Kotaku, achei que era suficiente, mas no começo foi uma tarefa difícil.
Alguém que aperta botões muito rápido é, afinal, uma pessoa notória?
Imagino que existam inúmeros artigos da Wikipedia sobre pessoas com vários papéis e cargos em tecnologia, academia, política local etc. que não atenderiam a esse critério.
Lembro de ter ficado perplexo ao ver que até um webcomic bastante popular não podia ter um artigo na wiki.
Acho que um dos melhores recursos pouco conhecidos da Wikipedia são as caixas de navegação recolhidas no fim de cada artigo.
São ótimas para ter uma visão geral de temas complexos e ver onde um item se encaixa dentro de uma hierarquia complicada.
Algumas parecem pequenas obras de arte que eu gostaria de pendurar na parede um dia.
https://imgur.com/gallery/ILp6TtA
Entendo por que elas precisam ficar recolhidas por padrão, mas uso userjs para movê-las para o topo da página, deixá-las abertas e usá-las na navegação.
Para que não ocupem espaço demais, deixei o
zoomdo CSS em 0.3.O modo de escolher um artigo aleatório é chocante
Isso inevitavelmente cria um viés permanente na aleatorização, e a probabilidade de cada artigo ser escolhido pode acabar mudando ao longo do tempo de uma forma muito dependente do caminho percorrido
Sortear um inteiro aleatório de 1 a N não é ciência de foguetes
Fico até me perguntando se não há algum peso intencional, como deixar espaço vazio antes de certos artigos preferidos para que apareçam com mais frequência
MySQL não foi feito para escolher uma linha realmente aleatória com boa performance
Uma abordagem ingênua como
ORDER BY RAND() LIMIT 1tem performance terrível, eLIMIT 0 OFFSET RAND() * row_counté igualmente ruimSe você usa uma abordagem performática como
WHERE id >= RAND() * max_id ORDER BY id LIMIT 1, cai no mesmo problema: os buracos nos IDs causados por artigos excluídos fazem certos artigos serem sorteados com mais frequênciaSó há duas soluções corretas: sortear um ID aleatório e tentar de novo se ele não for válido, ou manter uma coluna/tabela separada com todos os artigos válidos em uma sequência de inteiros
A primeira tem performance difícil de prever, porque pode precisar tentar de novo 20 vezes dependendo de quão esparsos os IDs são; a segunda exige recalcular e reescrever, em média, metade da coluna de inteiros sempre que um artigo é excluído
No fim, considerando que é quase um recurso de brinquedo, o método da Wikipedia é “bom o suficiente”, e seus pontos fracos poderiam ser reduzidos recalculando números aleatórios em jobs diários/semanais ou a cada edição de artigo
Também daria para melhorar bastante escolhendo não só o artigo mais próximo no método atual, mas cerca de 50 antes e 50 depois, e então sorteando de novo entre esses 100
É um hack completo, mas na prática ainda seria muito rápido
Se escolher um inteiro aleatório de 1 a N, existe uma chance de cair em um resultado ruim
Pensando em spam, a possibilidade de haver mais páginas ruins do que boas não é pequena; nesse caso seria preciso sortear de novo várias vezes
Acho o novo sorteio uma estratégia aceitável, mas é difícil imaginar que todo mundo simplesmente confie nessa probabilidade
Na prática, se você criar uma wiki com 99 páginas ruins e 1 página boa, o botão de artigo aleatório quase nunca vai funcionar
Também dá para sortear de 1 a M, usando M como o número de artigos válidos, mas continua o mesmo problema de como mapear esse número para um ID real de artigo
Esse método pode ter viés, mas tem performance em tempo constante
Pessoalmente, eu preferiria manter todos os artigos válidos em memória e escolher um deles
Em outubro eram só 7 milhões e, mesmo incluindo artigos excluídos, provavelmente algo como 70 milhões, uma escala parecida com o número total de itens do HN
Até criar um arquivo por artigo válido no disco, fazer uma busca aleatória com
find . -type f | shuf -n 1e cachear o resultado a cada poucos segundos não me pareceria tão ruim, embora isso também tenha seu próprio viésComo é um recurso puramente recreativo, não importa muito se os pesos não forem iguais, e dizem que no MariaDB
ORDER BY RAND() LIMIT 1faz um scan da tabela inteiraO cache remoto ficaria local ao datacenter, seria apoiado por armazenamento persistente e poderia ter um TTL longo
Durante o TTL do cache, talvez um artigo restaurado não pudesse ser sorteado, mas tudo bem
A localidade por datacenter garante certa tolerância a falhas e baixa latência, e o armazenamento persistente reduz o problema de cache frio em reinicializações
A marca d'água máxima do intervalo de IDs poderia ser atualizada de forma assíncrona, e tudo bem se artigos novos não aparecerem por um tempo
No fim, era só coincidência
A implementação atual faz sentido: à medida que o número de artigos cresce, os pesos ficam aproximadamente parecidos, e o usuário individual provavelmente não se importa muito com justiça desde que receba um artigo aleatório
É realmente incrível poder encontrar em um só lugar informações sobre uma mariposa comum do Peru, algum vilarejo minúsculo no Irã ou leituras dominicais da Inglaterra vitoriana
Antes da internet, esse tipo de conteúdo nem valeria o custo do papel em que seria impresso; agora, como o custo de armazenamento em nuvem é praticamente próximo de zero, ganhamos uma longa cauda de informação extremamente valiosa
Sou grato às pessoas que contribuem e mantêm esse conteúdo
Além disso, seria muito legal poder deixar em alguma página uma nota como “visitei esta página e gostaria de me conectar com outra pessoa interessada na mariposa peruana Foovius Barivius”
https://gwern.net/inclusionism
Por exemplo, poderia haver um feed vertical no estilo TikTok que encontra os artigos que o usuário provavelmente passaria mais tempo lendo, e o WikiScroll já está indo um pouco nessa direção
Também seria possível anexar uma sala de chat a cada artigo para as pessoas conversarem, ou ter DMs, mas permitindo enviar apenas links da Wikipedia
A ideia da Wikipedia como catalisador social é muito interessante
https://wikiscroll.blankenship.io/
Se você deixar uma nota em uma página, outras pessoas com a mesma extensão instalada poderão vê-la e, com sorte, talvez entrem em contato
Na minha opinião, é a melhor parte da internet
É possível provar matematicamente que não há nenhum artigo desinteressante na Wikipedia
Basta provar por redução ao absurdo
Depois de classificar todos os artigos por ordem de interesse e ordená-los, ao olhar para o menor valor, necessariamente existe o artigo mais sem graça
Mas o próprio fato de esse artigo ser o mais sem graça de toda a Wikipedia o torna interessante
Da mesma forma, acho que os artigos com menor número de visualizações mencionados neste post do blog provavelmente já perderam esse status a esta altura
Parece partir do pressuposto de que existe exatamente um artigo mais sem graça
Mas pode haver centenas de artigos com o mesmo nível mínimo de interesse e, nesse caso, essas centenas teriam de ser consideradas artigos sem graça
E também é preciso levar em conta o interesse de ser o segundo artigo mais sem graça
Provavelmente é verdade, então QED
Até alguém encontrar o artigo mais sem graça e pensar nele, ele não é interessante
Propriedades matemáticas são eternas e existem quer alguém as observe ou não
Isso me lembrou a série do Geoff Marshall sobre as Least Used Stations da Network Rail no Reino Unido
https://www.youtube.com/playlist?list=PLt4q5oaptyI9U2zddss8dm8srzuJj6nRz
https://www.youtube.com/@geofftech2
Administradores da Wikipedia são ativos em apagar artigos que alegam não ser importantes, então acho que o artigo com menor número de visualizações deve mudar com bastante frequência
Pode ter havido também alguma brincadeira por parte de agências de inteligência
É uma ótima maneira de apagar fatos históricos inconvenientes
Agora virou apenas uma historinha engraçada sobre um rootkit, sem nenhuma conspiração política específica
Por exemplo, acho que seria difícil encontrar uma cidade, vila, povoado ou pequeno assentamento dos EUA que não tenha artigo na Wikipedia
Jack Wade, Alaska aparece no Google Maps com algo como 8 casas, mas mesmo assim está na Wikipedia
Também não acho provável que um artigo sobre uma espécie rara de mariposa seja removido
Ainda assim, se quisermos impedir que toda pessoa do planeta tenha um artigo na Wikipedia, alguma política é necessária
Google Maps: https://www.google.com/maps/place/Jack+Wade,+AK+99732/@64.1519419,-141.4630071,448a,35y,3.16t/data=!3m1!1e3!4m6!3m5!1s0x5149e998873be075:0x2f1a9ca47f03bf1b!8m2!3d64.1526072!4d-141.4604683!16s%2Fm%2F0480bm5?entry=ttu
Wikipedia: https://en.wikipedia.org/wiki/Jack_Wade,_Alaska
A exceção talvez seja vandalismo decorrente da revelação desse status peculiar
Só para dar uma dica a quem tiver interesse: pode ser um subproduto do conjunto de dados usado pelo autor, mas uma característica comum dos artigos com menor número de visualizações é que seus temas pertencem a categorias que, pelas diretrizes de conteúdo da Wikipedia, normalmente não são alvo de remoção
O autor disse que seria pouco provável que um artigo sobre mariposas oferecesse oportunidade para empurrar um ponto de vista controverso, mas o histórico de edição mostra que no começo deste ano houve uma divergência sobre a envergadura de Scrobipalpula crustaria
11–13 mm ou 10–13 mm?
As pessoas têm sentimentos fortes sobre esse tipo de coisa
Se você descobrir e divulgar o nome do artigo da Wikipedia com menos visualizações, as visualizações desse artigo sobem, eliminando o motivo de tê-lo encontrado em primeiro lugar
https://en.m.wikipedia.org/wiki/Observer_effect_(physics)
Há algum problema?
Para ser justo, a análise foi feita sobre o conjunto de dados de 2021, então obviamente não é afetada
Mesmo que você encontre um, ele é destruído no momento em que você anuncia sua existência
Veja
quizzaciouslyMesmo com mais de 6 milhões de artigos, 6,0e6 já era um número viável para força bruta havia décadas
Uma busca linear talvez levasse menos tempo do que ler o artigo, e quase certamente menos tempo do que escrevê-lo
Claro, se tivessem feito isso, não teria sido tão divertido nem tão engenhoso, mas boa engenharia quase sempre é assim