Os resultados de busca por “produto X vs Y” agora viraram quase todos bobagem de IA
Ver a internet morta crescer me dá vontade de assinar o Kagi. Acho que algum dia vamos precisar de certificação de conteúdo criado por humanos
Infelizmente, o Kagi também não é uma panaceia. Pago e uso todos os dias para apoiar uma alternativa ao Google, mas o problema de resultados cheios de lixo de IA, tanto na busca de imagens quanto na de texto, continua grave
Comparações de produtos são um exemplo típico, mas o que me preocupa mais são as buscas relacionadas à saúde. Nesta semana tentei encontrar estudos sobre um remédio que estou tomando, e resultados que já eram contaminados por otimização para mecanismos de busca há 5 anos agora ficaram muito piores, com centenas de páginas de spam geradas por GPT tentando induzir cliques
No fim, desisti totalmente da busca e tive de encontrar um artigo minimamente relevante em nih.gov, depois seguir manualmente a lista de citações para achar informações
Lembrar da internet que eu usava quando era criança e na casa dos 20 anos, e saber que aquela internet nunca vai voltar, é uma sensação muito estranha
Ver a internet morta crescer é bem surreal
Acho que a comercialização da internet por causa da publicidade e a centralização em plataformas hostis ao usuário claramente atearam fogo nisso. A internet antiga ainda parece muito melhor hoje, mas perdeu a maior parte dos usuários nos últimos 15 anos
Acrescentar “Reddit” ao fim de todas as buscas ajuda, mas parece questão de tempo até a maior parte do conteúdo do Reddit também virar algo gerado por IA
Mesmo pesquisando “baby peacock” no Kagi, aparecem resultados quase iguais aos do Google, e a maioria são imagens de IA
É de enlouquecer. A internet morreu
Comprei uma casa recentemente e pesquisei tarefas de reparo doméstico, como preparar molduras/guarnições antes de pintar. Quase todos os resultados eram fazendas de conteúdo gerado por IA, com anúncios entre cada parágrafo, vídeos de reprodução automática sem relação com o conteúdo seguindo a página, modal de consentimento de cookies e, logo em seguida, outro modal pedindo para “virar amigo” assinando uma newsletter
Quer a gente goste ou não, parece que agora o Reddit é praticamente o único lugar onde dá para encontrar informação de verdade
Para esse tipo de busca, YouTube e TikTok são os melhores. Vídeo ainda não foi completamente inundado por IA, e dá para encontrar praticamente qualquer coisa sobre trabalhos manuais
Prefiro muito mais conteúdo em texto do que em vídeo, mas conteúdo de texto real escrito por pessoas está quase morto. O Reddit talvez seja uma rara exceção por enquanto. Ainda existem fóruns antigos vivos em áreas específicas, mas eles tendem a ser extremamente difíceis de encontrar
É melhor comprar um livro geral de manutenção residencial
Por exemplo, https://archive.org/details/stanleyhomerepai0000fine/page/14... leva ao capítulo “Painting Trim the Right Way” do livro Stanley Home Repairs, de 2014
Sebos também valem a pena. Reparos domésticos não mudaram tanto assim
Você também pode abrir o Wine e experimentar o CD-ROM “Black & Decker Everyday Home Repairs”, da Broderbund: https://archive.org/details/BlackDeckerEverydayHomeRepairsBr.... Segundo https://www.goodreads.com/book/show/3424503-everyday-home-re..., ele guia passo a passo por mais de 100 problemas domésticos comuns, de consertar uma torneira pingando a reparar piso de madeira maciça, além de oferecer animações e narração, e inclui tempo e custo estimados, materiais necessários e listas de ferramentas
Na prática, parece bem bom
Como alguém que possui e conserta por conta própria uma casa construída em 1939, só montei uma biblioteca de referências sobre casas depois de já ter avançado em alguns reparos, mas acho que deveria ter feito isso antes de pegar na chave de fenda
Renovations, da Taunton Press (https://www.bookfinder.com/search_s/?title=Renovation%205th%...), é a primeira referência que consulto ao começar um projeto de reparo doméstico. O capítulo 18 é inteiro sobre pintura. Os outros livros da Taunton também são excelentes, mas o escopo de Renovations é incomparável
As molduras/guarnições planas de MDF branco que se compram hoje em dia já vêm com primer, então estão prontas para pintar diretamente
Tenho um carro antigo e um carro novo; como o antigo existia na época da internet de antes, dá para encontrar instruções para qualquer reparo. Naquela época, as pessoas deixavam relatos de todos os tipos de trabalho
Quase não há informações de manutenção sobre o carro novo, e a maior parte é só vídeo no YouTube de alguém que não sabe nada filmando um conserto caseiro péssimo
Para reparos domésticos, acho que o YouTube é a melhor fonte. Claro, entendo se você queria texto e fotos
Na economia da internet que gira em torno da produção e monetização de “conteúdo”, provavelmente havia uma grande chance de que fosse assim desde o início
Começou com a colocação de anúncios em conteúdo existente e depois passou para redes sociais e mídias sociais, que, no fim, eram mecanismos para fazer crowdsourcing de mais produção de conteúdo e exibir anúncios ao lado dela. Como há dinheiro envolvido, a produção de conteúdo virou um negócio importante, e a tecnologia está atendendo a essa demanda criando conteúdo por menos do que o dinheiro que se pode ganhar com ele
O problema de moderar conteúdo indesejável criado por humanos já vinha começando a corroer esse modelo de negócios, e agora as ferramentas generativas produzem conteúdo indesejado mais rápido do que é possível moderá-lo. Quando houver um certo nível de saturação, as pessoas perderão o interesse, e as ferramentas que antes separavam bom conteúdo de conteúdo ruim por heurísticas algorítmicas também se tornarão inúteis. A única saída visível é conteúdo feito por humanos com curadoria humana, mas não sei se existe um modelo de negócios assim na escala que a indústria exige
Muita gente olha para os blogs com nostalgia, mas os blogs foram um dos primeiros exemplos de a internet deixar de ser baseada em conteúdo duradouro e passar para a produção em massa de artigos no estilo fazenda de conteúdo
A internet inicial parecia mais como passear por uma biblioteca. Não se esperava que a maioria dos sites fosse atualizada todos os dias, nem mesmo todos os meses, e os textos quase sempre eram organizados por assunto, não em ordem cronológica inversa
O foco excessivo dos blogs no que era novo mudou muita coisa, e vários sites pioraram visivelmente ao passar de construir bibliotecas de materiais duradouros para extrair novas visualizações. As discussões online passaram por um processo parecido ao migrar de fóruns para estruturas de recomendação no estilo Reddit/HN. Em fóruns antigos, ainda existem discussões que duraram mais de 10 anos, enquanto no Reddit ou no HN, depois de algumas horas, o post sai da página e a discussão morre
A confiança humana mal consegue passar de 100 pessoas; na escala da internet inteira, é ainda mais impossível, então acho que não há esse modelo de negócios. Acho que os humanos vão voltar ao tamanho tribal, para o qual foram originalmente feitos para entender e pertencer
Chats privados em grupo são muito mais populares e comuns do que admitimos, e esse movimento vai se acelerar nesse ambiente
Em sistemas abertos, a curadoria humana é possível, mas, quando existem alguns silos gigantes, a eficiência algorítmica opera dentro deles e produz os resultados que vemos hoje
Torço para que as pessoas percam o interesse e parem de consumir conteúdo lixo, mas a aposta do outro lado é que as pessoas se acostumem a conteúdos algorítmicos de qualidade cada vez menor e que a indústria extraia lucro sem parar por qualquer meio. Olhando para a história da TV a cabo, parece haver um ponto de ruptura
Conteúdo feito por humanos com curadoria humana é, na prática, um retuíte
Pequenos grupos de monocultura, como uma minoria de universitários entediados, sempre vão entender o algoritmo, tomar a plataforma com pornografia e spam e corroer recursos. Ferramentas melhores criadas para ajudar grupos fracos, ligadas a incentivos financeiros, acabam aumentando a desigualdade. Isso vira um problema porque influenciadores financeiros não pagam para serem humilhados por um pequeno número de influenciadores do mercado de conteúdo, mas para receber reconhecimento do público
Mas por que isso é um problema? Os produtores de “conteúdo indesejável” apenas otimizam para aquilo que o mercado mais valoriza. Se isso é um problema, então a própria existência do mercado é o problema. Nesse caso, o que fazer? Simplesmente destruí-lo também pode fazer sentido
Desde Gutenberg, a publicação talvez tenha continuado a caminhar para a monetização de conteúdo. Pela história da Igreja Católica, é possível que isso já acontecesse antes disso
Não são só imagens. Quando se pesquisa no Google algo que poderia ser uma pergunta comum, frequentemente aparecem, entre os 3 a 5 primeiros resultados, saladas de palavras de IA generativa
Quando começo a ler, não percebo de imediato. Depois passo a suspeitar até de coisas que claramente não são IA generativa. As pessoas têm uma noção de como alguém pode estar errado, de que maneira erra quando está errado, que tom adota quando erra, qual a probabilidade de estar errado, em quais formatos e plataformas os erros existem, com que frequência erra e como outras pessoas reagem. A IA é uma coisa completamente diferente. Nenhuma intuição ou experiência permite saber quando uma IA que soa plausível está errada
Ter todo o conjunto de heurísticas com que avaliávamos inconscientemente a qualidade das informações transmitidas neutralizado da noite para o dia pode ser uma receita para loucura e infelicidade. Raramente fiquei tão sinceramente triste por causa de uma tecnologia em toda a minha vida
Sinceramente, acho que isso é o fim da internet pública. O que falhou não foi o Google, mas a realidade da internet pública
Quando preciso de ajuda com algo ou tenho uma pergunta, não uso o Google nem posto em fóruns públicos. Pergunto em chats privados em grupo, onde todo mundo é uma pessoa real, ninguém está ganhando dinheiro e ninguém copia e cola ChatGPT para acumular pontos de internet pensando em vender a conta depois
Só há um caminho para isso mudar, e as pessoas não vão gostar. Todo conteúdo da internet teria de estar vinculado a um documento de identidade legal. Todas as postagens e todos os comentários no Facebook precisariam poder ser atribuídos a uma pessoa real
Não acho que as heurísticas sejam tão diferentes assim. Spam de otimização para mecanismos de busca e conteúdo besteirol já existiam antes, e tanto o Google quanto o YouTube estavam cheios de “criadores de conteúdo” humanos que otimizavam para cliques e manipulavam o sistema de recomendações do YouTube
Conteúdo de IA não é tão diferente. Só que agora ficou 100 vezes mais fácil produzir esse tipo de conteúdo, então ele aparece muito mais. Fundamentalmente, não é um problema de IA, mas de incentivos e modelos de negócios baseados em publicidade. A IA tornou o problema da piora dos serviços muito mais visível, mas ele já existia
Não sei qual é a solução. Meu palpite é que, à medida que conteúdos de baixa qualidade inundarem tudo, a internet pública se tornará menos importante com o tempo, e boa parte da comunicação migrará para comunidades menores que dependem muito da verificação de identidade e credenciais das pessoas
Não quero jogar um balde de água fria, mas ainda assim a perda de privacidade é muito mais triste
É difícil explicar por quê, mas talvez por eu não saber como é um filhote de pavão, esse caso me fez sentir com muita força o lado sombrio da IA
Eu estava acostumado a confiar, em certa medida, nos resultados de busca. Havia resultados estranhos ou quase sem sentido, mas eram esporádicos em meio a um mar de imagens relevantes. Agora posso ficar completamente cego sobre algo que não conheço. Como alguém que cresceu com o Google como algo que “simplesmente existe”, isso é realmente assustador
Se o Google quiser continuar relevante, não precisa resolver esse problema de algum jeito? Se buscar imagens e gerar imagens levam ao mesmo resultado, qual é mais o sentido de busca de imagens?
Dá para dizer exatamente o mesmo da busca comum. Seja o que você procurar, aparece uma página de anúncios, depois algumas páginas de fazendas de conteúdo, e depois páginas que “soam como especialistas, mas no fim são fazendas de conteúdo”
Financiar a internet com anúncios tornou realmente difícil encontrar conteúdo de boa qualidade. Se você não é criador de conteúdo nem o Google, os incentivos estão totalmente desalinhados
O objetivo parece ser marca-d'água, mas acho que ninguém consegue considerar a web como estando em qualquer estado que não seja declínio administrado. A estrutura de IA alimentando IA acabará encerrando tudo. Acho que a Platformer explicou melhor: https://www.platformer.news/google-io-ai-search-sundar-picha...
A questão é o que vem depois, e parece que ninguém tem a resposta
Não sei o que “resolver” significa. Isto já está resolvendo o problema. Se as pessoas acham bom o suficiente, acabou
A evidência é todo o restante das notícias e mídias sociais do planeta
É mais provável que o Google resolva isso fazendo com que as pessoas não percebam que os filhotes de pavão são gerados por IA
Acho que esse é um dos motivos pelos quais as grandes empresas de tecnologia fazem lobby por regulamentações de IA mais rígidas. Elas não têm medo de a IA dominá-las, mas de a IA destruir seus negócios
O pior é o resultado que copiou o título da Snopes, “Video Genuinely Shows White ‘Baby Peacock’?”, cortando só o ponto de interrogação. Essa página diz que a foto em questão não é de um filhote de pavão real
Se você pesquisar pelo termo mais preciso, peachick, parece que aparecem 100% imagens reais. Só que metade das páginas ainda os chama de “baby peacocks”
O primeiro resultado é o Adobe Stock. Você poderia imaginar que um lugar desses teria padrões mais altos que Pinterest ou TikTok, mas a realidade é essa
Em um futuro próximo, é bem provável que uma parcela significativa dos vídeos do YouTube e dos podcasts seja gerada por IA. Por exemplo, por meio de ferramentas como o Notebook LM.
Mas não tenho certeza de que o público vá realmente gostar desse conteúdo gerado por IA. Pessoalmente, prefiro conteúdo feito por pessoas. Parece mais autêntico e envolvente.
Ferramentas de IA precisam, necessariamente, de mecanismos fortes de detecção, como marcas-d'água confiáveis, para que outras plataformas consigam identificar conteúdo gerado por IA. Infelizmente, as ferramentas atuais de detecção de áudio gerado por IA ainda são insuficientes: https://www.npr.org/2024/04/05/1241446778/deepfake-audio-det...
Acabei de organizar também uma lista de “podcasts” gerados pelo Notebook LM: https://github.com/ListenNotes/notebooklm-generated-fake-pod...
Precisamos pensar se queremos ouvir podcasts feitos por IA. As pessoas talvez aceitem bem programas que elas próprias criaram, mas acho que vão gostar menos de “podcasts” gerados por IA por outras pessoas.
Eu gostaria de acreditar que conteúdo feito por pessoas parece mais autêntico e envolvente, mas me pergunto por quanto tempo isso continuará sendo verdade.
Eu “quero” gostar mais de conteúdo produzido por humanos, mas acho que a IA conseguirá otimizar melhor o engajamento humano. Isso pode ser ainda mais verdadeiro em conteúdos simples de estímulo de dopamina, como vídeos do TikTok. Somos menos complexos do que imaginamos.
Infelizmente, mecanismos de detecção em ferramentas de IA nunca vão funcionar de fato. Não há como excluir agentes mal-intencionados, e há muito dinheiro envolvido em fazer a IA se passar por humana. Talvez, pelo contrário, seja o conteúdo feito por pessoas que precise de marca-d'água ou assinatura.
Dividir isso aqui em uma dicotomia não ajuda muito.
Por exemplo, 10 anos atrás eu já assistia a vídeos no YouTube em que toda a narração era TTS. O criador não queria usar a própria voz, então escrevia um roteiro e o colocava em um sistema de TTS. Pelo nível da tecnologia na época, o som era horrível, mas as pessoas gostavam dos vídeos e eles tinham muitas visualizações. Você chamaria isso de gerado por IA?
Hoje, mesmo sem IA generativa, existe TTS muito melhor. Esses vídeos provavelmente ficaram mais agradáveis de assistir. Talvez dê para perceber que não é uma pessoa por haver pouca variação de tom, mas provavelmente seria preciso ouvir por mais de um minuto para distinguir. Isso é gerado por IA?
Agora, com IA generativa, é possível criar vozes que talvez você não consiga identificar como IA. Ainda assim, se uma pessoa escreveu o roteiro, tudo bem? Isso é gerado por IA?
Por fim, imagine que, no mesmo vídeo, o criador escreva o roteiro por conta própria, mas sinta que não escreve bem, ou que o inglês não é sua língua materna e há muitos erros gramaticais. Então ele entrega o roteiro ao GPT e pede não só para corrigir a gramática, mas para melhorá-lo com um objetivo como “virar o roteiro de um vídeo popular”. Depois, revisa se a mensagem principal que queria transmitir foi preservada e segue para a geração de voz. Isso é gerado por IA?
Para mim, todos esses casos são aceitáveis e não são inferiores a algo feito em um fluxo de trabalho totalmente humano. Se o criador é humano e sente que está transmitindo o que precisava transmitir, isso é suficiente.
Eu gostaria de mandar rascunhos de posts de blog para o GPT e pedir que ele escrevesse por mim. Ainda não faço isso porque o resultado não tem a minha “voz”. Ele até pode conter o que eu queria dizer, mas o estilo é completamente diferente. Se o GPT/Claude conseguisse imitar melhor o meu estilo, eu usaria imediatamente. Quase ninguém gosta de edição interminável, e isso vale especialmente para escritores.
A questão é quanto tempo vai levar até não conseguirmos mais distinguir a diferença.
No Listen Notes, só no último fim de semana, removemos mais de 500 podcasts falsos gerados com o Notebook LM.
É decepcionante ver golpistas e praticantes de SEO black hat já usando o Notebook LM para produzir podcasts falsos em massa e distribuí-los em várias plataformas.
Pessoalmente, sou contra uma máquina ilimitada de conteúdo de baixa qualidade.
Como o Google continua tornando cada vez mais difícil, na busca de imagens, acessar ou baixar a imagem real, criei uma ferramenta de busca de imagens que permite pesquisar no repositório do Google Imagens por meio de um atalho do sistema operacional e copiar rapidamente para a área de transferência. Ela usa um ID personalizado do Google Search Engine.
Há cerca de um ano, percebi que 90% dos resultados eram gerados por IA, então adicionei uma flag “No AI”. Basicamente, é um filtro rápido e tosco que limita os resultados aos anteriores a 2022. Não é perfeito, mas funciona como solução provisória. https://github.com/scpedicini/truman-show
1 comentários
Comentários do Hacker News
Os resultados de busca por “produto X vs Y” agora viraram quase todos bobagem de IA
Ver a internet morta crescer me dá vontade de assinar o Kagi. Acho que algum dia vamos precisar de certificação de conteúdo criado por humanos
Comparações de produtos são um exemplo típico, mas o que me preocupa mais são as buscas relacionadas à saúde. Nesta semana tentei encontrar estudos sobre um remédio que estou tomando, e resultados que já eram contaminados por otimização para mecanismos de busca há 5 anos agora ficaram muito piores, com centenas de páginas de spam geradas por GPT tentando induzir cliques
No fim, desisti totalmente da busca e tive de encontrar um artigo minimamente relevante em nih.gov, depois seguir manualmente a lista de citações para achar informações
Acho que a comercialização da internet por causa da publicidade e a centralização em plataformas hostis ao usuário claramente atearam fogo nisso. A internet antiga ainda parece muito melhor hoje, mas perdeu a maior parte dos usuários nos últimos 15 anos
É de enlouquecer. A internet morreu
Comprei uma casa recentemente e pesquisei tarefas de reparo doméstico, como preparar molduras/guarnições antes de pintar. Quase todos os resultados eram fazendas de conteúdo gerado por IA, com anúncios entre cada parágrafo, vídeos de reprodução automática sem relação com o conteúdo seguindo a página, modal de consentimento de cookies e, logo em seguida, outro modal pedindo para “virar amigo” assinando uma newsletter
Quer a gente goste ou não, parece que agora o Reddit é praticamente o único lugar onde dá para encontrar informação de verdade
Prefiro muito mais conteúdo em texto do que em vídeo, mas conteúdo de texto real escrito por pessoas está quase morto. O Reddit talvez seja uma rara exceção por enquanto. Ainda existem fóruns antigos vivos em áreas específicas, mas eles tendem a ser extremamente difíceis de encontrar
Por exemplo, https://archive.org/details/stanleyhomerepai0000fine/page/14... leva ao capítulo “Painting Trim the Right Way” do livro Stanley Home Repairs, de 2014
Sebos também valem a pena. Reparos domésticos não mudaram tanto assim
Você também pode abrir o Wine e experimentar o CD-ROM “Black & Decker Everyday Home Repairs”, da Broderbund: https://archive.org/details/BlackDeckerEverydayHomeRepairsBr.... Segundo https://www.goodreads.com/book/show/3424503-everyday-home-re..., ele guia passo a passo por mais de 100 problemas domésticos comuns, de consertar uma torneira pingando a reparar piso de madeira maciça, além de oferecer animações e narração, e inclui tempo e custo estimados, materiais necessários e listas de ferramentas
Na prática, parece bem bom
Renovations, da Taunton Press (https://www.bookfinder.com/search_s/?title=Renovation%205th%...), é a primeira referência que consulto ao começar um projeto de reparo doméstico. O capítulo 18 é inteiro sobre pintura. Os outros livros da Taunton também são excelentes, mas o escopo de Renovations é incomparável
As molduras/guarnições planas de MDF branco que se compram hoje em dia já vêm com primer, então estão prontas para pintar diretamente
Quase não há informações de manutenção sobre o carro novo, e a maior parte é só vídeo no YouTube de alguém que não sabe nada filmando um conserto caseiro péssimo
Na economia da internet que gira em torno da produção e monetização de “conteúdo”, provavelmente havia uma grande chance de que fosse assim desde o início
Começou com a colocação de anúncios em conteúdo existente e depois passou para redes sociais e mídias sociais, que, no fim, eram mecanismos para fazer crowdsourcing de mais produção de conteúdo e exibir anúncios ao lado dela. Como há dinheiro envolvido, a produção de conteúdo virou um negócio importante, e a tecnologia está atendendo a essa demanda criando conteúdo por menos do que o dinheiro que se pode ganhar com ele
O problema de moderar conteúdo indesejável criado por humanos já vinha começando a corroer esse modelo de negócios, e agora as ferramentas generativas produzem conteúdo indesejado mais rápido do que é possível moderá-lo. Quando houver um certo nível de saturação, as pessoas perderão o interesse, e as ferramentas que antes separavam bom conteúdo de conteúdo ruim por heurísticas algorítmicas também se tornarão inúteis. A única saída visível é conteúdo feito por humanos com curadoria humana, mas não sei se existe um modelo de negócios assim na escala que a indústria exige
A internet inicial parecia mais como passear por uma biblioteca. Não se esperava que a maioria dos sites fosse atualizada todos os dias, nem mesmo todos os meses, e os textos quase sempre eram organizados por assunto, não em ordem cronológica inversa
O foco excessivo dos blogs no que era novo mudou muita coisa, e vários sites pioraram visivelmente ao passar de construir bibliotecas de materiais duradouros para extrair novas visualizações. As discussões online passaram por um processo parecido ao migrar de fóruns para estruturas de recomendação no estilo Reddit/HN. Em fóruns antigos, ainda existem discussões que duraram mais de 10 anos, enquanto no Reddit ou no HN, depois de algumas horas, o post sai da página e a discussão morre
Chats privados em grupo são muito mais populares e comuns do que admitimos, e esse movimento vai se acelerar nesse ambiente
Torço para que as pessoas percam o interesse e parem de consumir conteúdo lixo, mas a aposta do outro lado é que as pessoas se acostumem a conteúdos algorítmicos de qualidade cada vez menor e que a indústria extraia lucro sem parar por qualquer meio. Olhando para a história da TV a cabo, parece haver um ponto de ruptura
Pequenos grupos de monocultura, como uma minoria de universitários entediados, sempre vão entender o algoritmo, tomar a plataforma com pornografia e spam e corroer recursos. Ferramentas melhores criadas para ajudar grupos fracos, ligadas a incentivos financeiros, acabam aumentando a desigualdade. Isso vira um problema porque influenciadores financeiros não pagam para serem humilhados por um pequeno número de influenciadores do mercado de conteúdo, mas para receber reconhecimento do público
Mas por que isso é um problema? Os produtores de “conteúdo indesejável” apenas otimizam para aquilo que o mercado mais valoriza. Se isso é um problema, então a própria existência do mercado é o problema. Nesse caso, o que fazer? Simplesmente destruí-lo também pode fazer sentido
Não são só imagens. Quando se pesquisa no Google algo que poderia ser uma pergunta comum, frequentemente aparecem, entre os 3 a 5 primeiros resultados, saladas de palavras de IA generativa
Quando começo a ler, não percebo de imediato. Depois passo a suspeitar até de coisas que claramente não são IA generativa. As pessoas têm uma noção de como alguém pode estar errado, de que maneira erra quando está errado, que tom adota quando erra, qual a probabilidade de estar errado, em quais formatos e plataformas os erros existem, com que frequência erra e como outras pessoas reagem. A IA é uma coisa completamente diferente. Nenhuma intuição ou experiência permite saber quando uma IA que soa plausível está errada
Ter todo o conjunto de heurísticas com que avaliávamos inconscientemente a qualidade das informações transmitidas neutralizado da noite para o dia pode ser uma receita para loucura e infelicidade. Raramente fiquei tão sinceramente triste por causa de uma tecnologia em toda a minha vida
Quando preciso de ajuda com algo ou tenho uma pergunta, não uso o Google nem posto em fóruns públicos. Pergunto em chats privados em grupo, onde todo mundo é uma pessoa real, ninguém está ganhando dinheiro e ninguém copia e cola ChatGPT para acumular pontos de internet pensando em vender a conta depois
Só há um caminho para isso mudar, e as pessoas não vão gostar. Todo conteúdo da internet teria de estar vinculado a um documento de identidade legal. Todas as postagens e todos os comentários no Facebook precisariam poder ser atribuídos a uma pessoa real
Conteúdo de IA não é tão diferente. Só que agora ficou 100 vezes mais fácil produzir esse tipo de conteúdo, então ele aparece muito mais. Fundamentalmente, não é um problema de IA, mas de incentivos e modelos de negócios baseados em publicidade. A IA tornou o problema da piora dos serviços muito mais visível, mas ele já existia
Não sei qual é a solução. Meu palpite é que, à medida que conteúdos de baixa qualidade inundarem tudo, a internet pública se tornará menos importante com o tempo, e boa parte da comunicação migrará para comunidades menores que dependem muito da verificação de identidade e credenciais das pessoas
É difícil explicar por quê, mas talvez por eu não saber como é um filhote de pavão, esse caso me fez sentir com muita força o lado sombrio da IA
Eu estava acostumado a confiar, em certa medida, nos resultados de busca. Havia resultados estranhos ou quase sem sentido, mas eram esporádicos em meio a um mar de imagens relevantes. Agora posso ficar completamente cego sobre algo que não conheço. Como alguém que cresceu com o Google como algo que “simplesmente existe”, isso é realmente assustador
Se você não tem conta no Twitter e quer ver mais do que uma única publicação, dá para ver aqui: https://xcancel.com/notengoprisa/status/1842550658102079556
Se o Google quiser continuar relevante, não precisa resolver esse problema de algum jeito? Se buscar imagens e gerar imagens levam ao mesmo resultado, qual é mais o sentido de busca de imagens?
Financiar a internet com anúncios tornou realmente difícil encontrar conteúdo de boa qualidade. Se você não é criador de conteúdo nem o Google, os incentivos estão totalmente desalinhados
A questão é o que vem depois, e parece que ninguém tem a resposta
A evidência é todo o restante das notícias e mídias sociais do planeta
O pior é o resultado que copiou o título da Snopes, “Video Genuinely Shows White ‘Baby Peacock’?”, cortando só o ponto de interrogação. Essa página diz que a foto em questão não é de um filhote de pavão real
Se você pesquisar pelo termo mais preciso, peachick, parece que aparecem 100% imagens reais. Só que metade das páginas ainda os chama de “baby peacocks”
Em um futuro próximo, é bem provável que uma parcela significativa dos vídeos do YouTube e dos podcasts seja gerada por IA. Por exemplo, por meio de ferramentas como o Notebook LM.
Mas não tenho certeza de que o público vá realmente gostar desse conteúdo gerado por IA. Pessoalmente, prefiro conteúdo feito por pessoas. Parece mais autêntico e envolvente.
Ferramentas de IA precisam, necessariamente, de mecanismos fortes de detecção, como marcas-d'água confiáveis, para que outras plataformas consigam identificar conteúdo gerado por IA. Infelizmente, as ferramentas atuais de detecção de áudio gerado por IA ainda são insuficientes: https://www.npr.org/2024/04/05/1241446778/deepfake-audio-det...
Acabei de organizar também uma lista de “podcasts” gerados pelo Notebook LM: https://github.com/ListenNotes/notebooklm-generated-fake-pod...
Precisamos pensar se queremos ouvir podcasts feitos por IA. As pessoas talvez aceitem bem programas que elas próprias criaram, mas acho que vão gostar menos de “podcasts” gerados por IA por outras pessoas.
Eu “quero” gostar mais de conteúdo produzido por humanos, mas acho que a IA conseguirá otimizar melhor o engajamento humano. Isso pode ser ainda mais verdadeiro em conteúdos simples de estímulo de dopamina, como vídeos do TikTok. Somos menos complexos do que imaginamos.
Infelizmente, mecanismos de detecção em ferramentas de IA nunca vão funcionar de fato. Não há como excluir agentes mal-intencionados, e há muito dinheiro envolvido em fazer a IA se passar por humana. Talvez, pelo contrário, seja o conteúdo feito por pessoas que precise de marca-d'água ou assinatura.
Por exemplo, 10 anos atrás eu já assistia a vídeos no YouTube em que toda a narração era TTS. O criador não queria usar a própria voz, então escrevia um roteiro e o colocava em um sistema de TTS. Pelo nível da tecnologia na época, o som era horrível, mas as pessoas gostavam dos vídeos e eles tinham muitas visualizações. Você chamaria isso de gerado por IA?
Hoje, mesmo sem IA generativa, existe TTS muito melhor. Esses vídeos provavelmente ficaram mais agradáveis de assistir. Talvez dê para perceber que não é uma pessoa por haver pouca variação de tom, mas provavelmente seria preciso ouvir por mais de um minuto para distinguir. Isso é gerado por IA?
Agora, com IA generativa, é possível criar vozes que talvez você não consiga identificar como IA. Ainda assim, se uma pessoa escreveu o roteiro, tudo bem? Isso é gerado por IA?
Por fim, imagine que, no mesmo vídeo, o criador escreva o roteiro por conta própria, mas sinta que não escreve bem, ou que o inglês não é sua língua materna e há muitos erros gramaticais. Então ele entrega o roteiro ao GPT e pede não só para corrigir a gramática, mas para melhorá-lo com um objetivo como “virar o roteiro de um vídeo popular”. Depois, revisa se a mensagem principal que queria transmitir foi preservada e segue para a geração de voz. Isso é gerado por IA?
Para mim, todos esses casos são aceitáveis e não são inferiores a algo feito em um fluxo de trabalho totalmente humano. Se o criador é humano e sente que está transmitindo o que precisava transmitir, isso é suficiente.
Eu gostaria de mandar rascunhos de posts de blog para o GPT e pedir que ele escrevesse por mim. Ainda não faço isso porque o resultado não tem a minha “voz”. Ele até pode conter o que eu queria dizer, mas o estilo é completamente diferente. Se o GPT/Claude conseguisse imitar melhor o meu estilo, eu usaria imediatamente. Quase ninguém gosta de edição interminável, e isso vale especialmente para escritores.
É decepcionante ver golpistas e praticantes de SEO black hat já usando o Notebook LM para produzir podcasts falsos em massa e distribuí-los em várias plataformas.
Como o Google continua tornando cada vez mais difícil, na busca de imagens, acessar ou baixar a imagem real, criei uma ferramenta de busca de imagens que permite pesquisar no repositório do Google Imagens por meio de um atalho do sistema operacional e copiar rapidamente para a área de transferência. Ela usa um ID personalizado do Google Search Engine.
Há cerca de um ano, percebi que 90% dos resultados eram gerados por IA, então adicionei uma flag “No AI”. Basicamente, é um filtro rápido e tosco que limita os resultados aos anteriores a 2022. Não é perfeito, mas funciona como solução provisória.
https://github.com/scpedicini/truman-show