4 pontos por GN⁺ 2023-07-23 | 1 comentários | Compartilhar no WhatsApp
  • A comunidade de World of Warcraft inventou de propósito a inexistente atualização Glorbo, e o zleague.gg, que reprocessava automaticamente posts do Reddit, publicou isso como se fosse notícia real
  • O zleague.gg operava resumindo threads do Reddit com IA, criando textos longos com “key takeaways” e parágrafos padronizados, mirando exposição na busca do Google
  • Usuários do r/WoW misturaram invenções e distorções, como uma alusão ao Hearthstone desde 1994, Klikclac, Halfhill Market e os Klaxxi como raça jogável, para fazer o bot cair na armadilha
  • O artigo gerado automaticamente foi publicado com o título “World of Warcraft Players Excited For Glorbo’s Introduction” e depois removido; hoje resta um espelho arquivado
  • Mesmo quando se inclui a fonte do Reddit, o caso expõe que há pouquíssima supervisão e mecanismos de contenção em uma estrutura que coloca posts de comunidades em uma IA e os transforma diretamente em conteúdo

Site de scraping com IA cai em atualização falsa do Glorbo

  • Usuários do subreddit r/WoW de World of Warcraft perceberam que o zleague.gg coletava posts do Reddit, resumia-os com IA e os publicava como artigos de blog
  • O zleague.gg tinha como atividade principal um app de games e, em um blog anexo, produzia textos baseados em threads do Reddit
  • Para enganar o bot, os usuários escreveram uma longa thread dizendo que Glorbo seria introduzido no jogo
    • Glorbo não é um recurso real de World of Warcraft
    • O texto incluía contexto falso, como a ideia de que “isso era sugerido em Hearthstone desde 1994”
    • Nomes reais relacionados ao jogo, como Dragonflight, Chen Stormstout e Karazhan, foram misturados para dar aparência de plausibilidade

Invenções incluídas no artigo automático e problemas de operação

  • O zleague.gg publicou automaticamente, com base na thread falsa, um texto chamado “World of Warcraft Players Excited For Glorbo’s Introduction”
  • O resumo publicado incluía itens que não correspondiam à realidade
    • Que jogadores estavam ansiosos pela introdução de Glorbo e por seu impacto no jogo
    • Que o item obrigatório Klikclac poderia afetar jogadores casuais
    • Um rumor de que Stormsong Valley se tornaria o novo local de Halfhill Market e de um minigame de simulação de fazenda
    • Reações positivas a mudanças anteriores, como se os Klaxxi tivessem sido adicionados como raça jogável
  • O artigo permaneceu online por algum tempo e depois foi removido, mas pode ser visto em um espelho arquivado
  • Todos os nomes de autores do site parecem ser falsos, e a operação como um todo parece ter quase nenhuma supervisão
  • Mesmo citando posts do Reddit e exibindo o autor, o método de inserir automaticamente textos de comunidades em uma IA e publicar o resultado sem alterações cria um problema à parte
  • Esses sites miram tráfego da busca do Google, e será difícil contê-los enquanto o Google não rebaixar ou proibir sites baseados em IA

1 comentários

 
GN⁺ 2023-07-23
Opiniões do Hacker News
  • Quase não jogo, e o único aparelho que tenho é um Nintendo Switch, mas quando fico travado no novo Zelda acabo pesquisando
    Vi que uns 10 dos primeiros resultados traziam textos quase no mesmo formato, compartilhando até os mesmos erros nas respostas
    A maioria dos sites de dicas ou FAQ de Zelda parece não ter conteúdo original, mas sim um anel de lixo na web regurgitado por IA uns dos outros
    Pelo menos uso bloqueador de anúncios e bloqueio de JavaScript, então não dou receita de publicidade para eles

    • Wikis de jogos e sites de guia já eram há algum tempo um lixão de otimização para mecanismos de busca
      Imagino que seja por causa da receita com anúncios
      Não é como se fosse impossível para o Google ter dados para decidir a quais sites deve dar autoridade de domínio, mas entendo que isso é uma luta contínua e adversarial entre spam de SEO e mecanismos de busca
    • Também acho engraçado como o ChatGPT responde perguntas sobre jogos de um jeito estranhamente prolixo, colocando um parágrafo introdutório absurdamente longo antes de responder algo simples
      É muito parecido com esses sites cheios de anúncios que colocam um bloco esquisito de introdução antes de finalmente chegar à resposta
    • Meio fora do assunto, mas relacionado. ToTK é realmente ruim em acessibilidade, especialmente no lado cognitivo e sensorial
      Acabo usando o mapa de ZD TotK com frequência, sem querer: https://www.zeldadungeon.net/tears-of-the-kingdom-interactiv...
      Não tem graça nenhuma tentar lembrar onde fica um inimigo específico. Será que alguém realmente acha isso divertido? A enciclopédia não registra a localização dos inimigos que você já enfrentou, mesmo eles reaparecendo a cada lua de sangue
      Preciso de mais um Savage Lynel Bow, mas não lembro onde vi um Silver Lynel. Não quero vasculhar o mapa inteiro confiando só no sinal vago do sensor do Purah Pad, que só toca quando eu já estou praticamente em cima dele. Dá até vontade de fazer anotações por fora
      A ideia das funções de registro é boa, mas faltam muitas coisas. As descrições das missões muitas vezes são insuficientes, e os marcadores com frequência indicam a posição de quem deu a missão, então ajudam pouco
      Agradeço as legendas, mas não entendo por que tantas partes ainda acontecem sem voz
      No meu caso não faz diferença porque jogo no PC, mas também me pergunto por que não há remapeamento de botões
      Mesmo desligando o FSR interno e o AA para evitar que a imagem às vezes vire um borrão de baixa qualidade, ainda pode ser difícil encontrar objetos, mesmo com boa visão, se não estiver claro para onde olhar. O brilho do Ultrahand ajuda, mas é uma solução bem ruim
      Também não há configurações para daltonismo. O que exatamente eles estão fazendo?
      Perderam muitas oportunidades de tornar esse jogo excelente muito mais acessível. A Nintendo deixou bem claro que não se importa com acessibilidade, e isso é realmente lamentável, porque acessibilidade melhora a experiência para todo mundo
    • No Kagi, esses sites lixo são relativamente óbvios, então eu simplesmente os bloqueio
      Os únicos lugares minimamente confiáveis nessa área eram o GameFAQs, a IGN e algumas revistas de jogos
    • É realmente trágico. Quando eu era criança, o GameFAQs era praticamente a única fonte, então eu acessava direto, e os guias apareciam bem no Google
      O site ainda existe, mas agora o Google primeiro mostra 20 sites infestados de anúncios onde você precisa ficar clicando em páginas novas, como se fossem listas, para ver um guia de uma seção de 5 minutos
  • Haha, fiz https://meat-gpt.sonnet.io. É um site feito para zoar startups ruins de IA, mas não vou dar spoiler de como ele faz isso
    Hoje em dia uma das minhas principais fontes de tráfego, às vezes até 70~80%, são esses catálogos vagabundos de apps de IA. Eles não só incluem o meu MeatGPT como ainda alucinam uma descrição lindamente idiota do que o serviço faz
    Sinceramente, acho que não tem como funcionar melhor que isso. É como se pegassem os pedaços de carne suculenta do meu site e ficassem batendo na própria cara enquanto gritam “mais, por favor”
    Gosto de arte generativa e já fiz uma fazenda de conteúdo medieval autoeditada[1], mas aqui o texto simplesmente se escreve sozinho atravessando vários sites
    [1] https://tidings.potato.horse

    • Agora fiquei totalmente convencido de que existe um problema de alinhamento
  • O ponto principal é esta frase:

    But again, there’s nothing to stop this. These subreddits can’t only fill themselves with joke articles to screw up a site like this, even if this one specific example is good for a laugh.
    A maior parte das threads vai ser uma conversa normal, e sites de discussão como o Reddit podem se tornar uma fonte simples para resumir e gerar notícias “de graça”
    Acho que o HN também poderia ser usado como fonte de notícias de tecnologia. Bastaria resumir o post em questão e acrescentar um resumo dos comentários mais votados da thread e o clima geral
    Não estou dizendo que eu faria isso, mas se eu pensei nisso, é bem provável que alguém já tenha tentado de forma muito mais avançada

    • Ouço esse tipo de coisa o tempo todo no HN e na vida real, mas do ponto de vista de um jornalista isso erra um pouco o alvo por deixar de fora o valor da apuração
      Algumas notícias talvez possam ser feitas apenas raspando coisas como threads do Reddit, mas a maior parte do bom jornalismo envolve apuração que produz informação nova a partir de fontes confiáveis
      Mesmo sem apuração, se você não consegue escrever algo que acrescente ao repositório de conhecimento do mundo, isso não tem valor para consumidores nem para anunciantes. Isso também vale no mundo do spam de SEO. É preciso haver algum esforço para se diferenciar dos concorrentes para ocupar os primeiros resultados
      Threads do Reddit muitas vezes estão cheias de reações emocionais a notícias já produzidas dessa forma. Em algum momento, um ser humano sai, conversa com outros seres humanos, cria novos ângulos ou argumentos, segue perguntas e conecta pontos que ninguém ainda conseguiu ligar. Isso é notícia, não um resumo de atitudes já existentes
    • Eu criei um site que funciona assim: seleciona posts do HN com mais de 400 votos, reúne uma lista de títulos, pede para a IA filtrar itens não relacionados a tecnologia (temas da Bay Area, política etc.), depois raspa os posts selecionados, escreve resumos e publica tudo em um site estático
      Outras fontes usadas são subreddits do Reddit, feeds RSS, blogs oficiais de linguagens e páginas de releases no GitHub
      A IA é enganada com bastante facilidade. Dá para evitar isso fornecendo mais contexto e adicionando uma etapa de revisão para verificar se as regras editoriais estão sendo seguidas
      Outra ideia em que estou pensando é fazer um modelo mais barato (gpt-turbo-3.5) escrever os textos e um modelo mais sofisticado (gpt4) revisá-los
    • Mesmo que você não queira simplesmente resumir comentários, a seção de comentários da maioria dos artigos pode ser vista como uma pesquisa terceirizada pela multidão sobre o tema
      Depois de ler uma discussão interessante ali, muitas vezes é fácil sair com uma pequena lista de artigos relacionados, livros e coisas do tipo, além de comentários vivos que às vezes vêm diretamente das pessoas envolvidas
    • Escrevendo anonimamente. Startups que fazem esse tipo de coisa realmente existem, e não posso entrar em detalhes
      A informação quer ser livre. No momento é um plugin de navegador que consegue ler o DOM e adicionar tags, e esse trabalho humano entra no sistema de treinamento
      A ideia começou como uma versão independente, em plugin de navegador, do Community Notes do Twitter, e depois se expandiu para o treinamento de modelos que parecem usuários navegando pela web e lendo o DOM
      Como não está chamando APIs, também não haveria taxas, certo? É o usuário quem escolhe as interações
      Parece que a única defesa capaz de barrar uma IA treinada para parecer doom scrolling seria limitar a velocidade
    • Talvez não dê para publicar só textos assim, mas dá para envergonhar pessoas que empacotam autores de IA como se fossem humanos
      No mínimo, deveria haver algum tipo de sinalização de que aquele texto foi escrito por IA. Caso contrário, esse truque pode ser usado para expor ao ridículo alguém que era visto como autor humano
  • Isso está acontecendo muito além deste site, em vários sites de notícias sobre games
    Vejo regularmente no feed do Google News textos que resumem threads do Reddit; a precisão da cobertura é duvidosa e são textos claramente gerados por IA
    Ainda assim, quando funciona direito, é bastante útil e oportuno
    Já faz cerca de um ano que vimos surgir uma IA de texto generativa razoável, então fico imaginando o dia em que, em vez de acessar a internet por um aparelho, eu ligue para uma voz de IA e ouça apenas se há e-mails urgentes ou um resumo das notícias com que eu realmente deveria me importar
    A web deixou de ser algo que eu amava de verdade e virou um relacionamento abusivo tão entranhado no cotidiano que não dá mais para romper
    Dou boas-vindas a um intermediário de IA que leia por mim o spam de SEO, os títulos caça-cliques e os comentários sem sentido, passe por esse sofrimento e depois sintetize de forma útil apenas o que importa para mim

    • Ficar online sem um agente de IA vai acabar sendo como andar sem máscara na época da COVID
  • Interessante. Isso parece muito com a experiência contracultural que vivi como hacker nos anos 80
    A sensação de lutar contra “The Man” agora pode continuar contra “The AI”. Mandaram bem, nerds de games

    • No fim, acho que esse tipo de coisa revela o quanto os criadores da tecnologia em questão — desta vez, os criadores de IA — não respeitaram a possibilidade de abuso pelo público
      O público não se importa com como os desenvolvedores querem que aquilo seja usado. O público quer saber o que consegue fazer com aquilo
      Basta olhar para hot rods, overclocking e inúmeros outros exemplos
    • Parece que isso se repete sempre que surge uma ferramenta nova e poderosa o bastante
      Pessoas menos presas a hierarquias conseguem se mover rápido, e de fato se movem. Quando chega uma grande mudança, elas encontram brechas e conseguem causar um estrago considerável, e as grandes organizações vêm atrás depois, direcionando recursos para reforçar o que consideram falhas — geralmente qualquer coisa que reduza seu controle sobre algum sistema ou componente de conexão
      Espero que daqui para frente isso fique mais rápido e mais caótico. Os melhores resultados surgem quando pessoas empoderadas entram com tudo por paixão, não por dinheiro
  • É uma atitude meio estranha um site de spam que deve estar desesperado por tráfego agora apagar um post que viralizou

    • Sim. Mas, por outro lado, isso é conteúdo para anúncios (MFA)
      O pior aqui não é a má fama, e sim entrar na blacklist do Google ou do mercado de publicidade programática. O primeiro acaba com o tráfego, o segundo acaba com a capacidade de monetização
      Ironicamente, a guerra contra conteúdo lixo feito por IA parece que vai ser travada por empresas de ad tech que precisam defender de forma minimamente plausível que seus clientes não estão desperdiçando dinheiro em inventário publicitário sem valor
    • Independentemente de como esses sites ganham dinheiro, pessoas que chegam ali nesse contexto têm baixa chance de conversão
      Tirar o artigo do ar ao menos reduz um pouco o dano à reputação
  • Ontem, enquanto procurava a opção de estabilização de vídeo no Linux, fiquei surpreso ao ver um texto explicando com muita confiança uma ferramenta que supostamente era mantida pelos “autores” do ffmpeg
    Então fui pesquisar, mas não encontrei nada; quando busquei o nome entre aspas, ele só era mencionado em 3 textos escritos pela mesma empresa

    • Já começou a acontecer de verdade. Conteúdo gerado por LLM e cheio de alucinações está cobrindo a web
      Se a relação sinal-ruído despencar a ponto de ficar praticamente impossível separar o joio do trigo, a internet logo vai se tornar completamente inútil
      Aquele artigo dos transformers de IA realmente foi uma caixa de Pandora
  • Espero que os desenvolvedores de Warcraft agora deem o nome de Glorbo a um dos próximos recursos reais

    • Se a Blizzard ainda faz piadas de 1º de abril, o tema do ano que vem já está pronto
  • Faço a previsão agora. Glorbo vai entrar no próximo patch

  • Este post também é o mesmo lixo, literalmente igual aos posts de IA reclamando disso
    Não passa de uma matéria de jornal feita a partir de uma thread do Reddit