2 pontos por GN⁺ 1 일 전 | 1 comentários | Compartilhar no WhatsApp
  • Participantes que usaram conselhos de IA tiveram uma queda brusca na taxa de respostas “não sei”, de 44% para 3%, e a precisão caiu de 27% para 9%, enquanto a confiança subiu de 30% para 76%
  • Para diferenciar isso de uma delegação racional a uma ferramenta, os pesquisadores usaram perguntas em que a IA costuma errar, como detalhes visuais de filmes, e o Step 3.5 Flash, que em geral também responde errado
  • Alguns participantes teriam acertado sozinhos, mas depois de consultar a IA escolheram a resposta errada, confirmando que conselhos errados de IA podem prejudicar até julgamentos já existentes
  • Com recompensa financeira, as respostas “não sei” melhoraram para 8% e a precisão para 16%, mas ainda ficaram bem abaixo dos referenciais sem uso de IA, de 44% e 27%
  • Só o fato de poder usar IA já pode enfraquecer o hábito de reconhecer os limites do próprio conhecimento, o que é especialmente preocupante para crianças e estudantes cujo pensamento crítico ainda está em desenvolvimento

Impacto dos conselhos de IA no julgamento e na confiança

  • Um estudo de três universidades da França e da Itália mediu como mudam a suspensão do julgamento, a precisão e a confiança quando há acesso a conselhos de IA
    • A taxa de respostas “não sei” caiu de 44% para 3%
    • A precisão caiu de 27% para 9%
    • A confiança subiu de 30% para 76%
  • Participaram do estudo Valerio Capraro, da University of Milano-Bicocca, Chiara Marcoccia, da École Normale Supérieure, e Walter Quattrociocchi, da Sapienza University of Rome
  • As perguntas foram compostas por detalhes visuais de filmes em que modelos de IA geralmente falham, como a cor do uniforme do time em Bend It Like Beckham
  • Foi usado intencionalmente o Step 3.5 Flash, que costuma errar esse tipo de pergunta, para distinguir a queda de julgamento de uma delegação racional a uma ferramenta confiável
  • Alguns participantes escolheram a resposta errada após consultar a IA, mesmo em questões que teriam acertado por conta própria
  • A recompensa financeira melhorou parcialmente os resultados, mas não alcançou o referencial da condição sem IA
    • As respostas “não sei” subiram de 3% para 8%, mas ficaram abaixo do referencial de 44%
    • A precisão subiu de 9% para 16%, mas não chegou ao referencial de 27%

Rendição cognitiva e preocupações na educação

  • Pesquisadores da Wharton chamaram de cognitive surrender a situação em que as pessoas aceitam respostas erradas da IA em 80% dos casos e ainda demonstram mais confiança do que quem trabalhou sem IA
  • Neste resultado, não se trata apenas de confiar em respostas erradas da IA: a própria disponibilidade da IA inibe o hábito de reconhecer o que a pessoa não sabe
  • Capraro enfatiza que a capacidade de dizer “não sei” é importante para os humanos porque envolve reconhecer os limites do próprio conhecimento
  • Crianças que crescem com sistemas de IA antes de desenvolver plenamente a capacidade de pensamento crítico são um grupo especialmente preocupante
  • A reformulação da busca com IA do Google substituiu links por resumos gerados por IA com tom confiante, e a Common Sense Media avaliou esse design como um “risco inaceitável” para estudantes
  • Se as pessoas continuarem usando produtos de IA projetados para sempre responder e nunca dizer “não sei”, os humanos também podem aprender esse mesmo comportamento

1 comentários

 
GN⁺ 1 일 전
Comentários do Hacker News
  • Este estudo é bastante fraco. Como este comentário no PDF apontou bem, não há absolutamente nenhum elemento exclusivo de sistemas de IA no que foi testado
    Os pesquisadores deram aos participantes um LLM que eles sabiam que fornecia respostas erradas para certas perguntas e, sob a condição de que eles podiam deixar de responder se não tivessem certeza, fizeram exatamente essas perguntas
    Isso é como dar um livro didático de uma área desconhecida com alguns fatos errados e depois cobrar justamente esses erros na prova. Naturalmente, os participantes ficam mais propensos tanto a responder quanto a errar
    Tenho muito interesse em como aspectos dos LLMs modernos, como tendência à bajulação ou impotência cognitiva, afetam aprendizado e confiança, mas este estudo não testou nenhum desses fatores, e o desenho experimental quase não mudaria se o LLM fosse trocado por um livro didático com erros

    • O título é “Conselho de IA reduziu em 3x a precisão das pessoas”, mas para julgar a precisão das pessoas é preciso primeiro conhecer a precisão da própria IA usada. Se foi usada uma IA limitada para ser muito pior do que a expectativa razoável, não dá para culpar nem as pessoas nem a IA; é como mandar um especialista mentir e depois concluir que “ouvir especialistas reduz a precisão”
      Um título melhor seria “Uma IA muito imprecisa tornou as pessoas menos precisas”, mas aí surge naturalmente a pergunta: “e uma IA moderadamente precisa?”
    • Não sei se obter o mesmo resultado com um livro didático tornaria a conclusão do estudo sem sentido. O ponto central é que, ao fornecer uma ferramenta que parece autoritativa, mas está errada em áreas fora da especialidade, a capacidade de dizer “não sei” enfraquece, mesmo quando a resposta está errada
      Se você não quer respostas erradas, não deveria comprar livros didáticos ruins para os funcionários; da mesma forma, talvez também deva evitar fornecer IA em áreas que eles não conhecem bem
      Além disso, procurar respostas em um livro didático é muito mais trabalhoso do que perguntar a um LLM, então o efeito provavelmente seria menor. Se não houver obrigação de responder, pouca gente vai querer fuçar o livro, e ainda menos se na capa estiver escrito “pode conter respostas erradas”
    • Pode até não ser diferente de um livro didático, mas, na prática, poucas pessoas usam livros didáticos dessa forma, enquanto LLMs de fato são usados assim com muita frequência
    • O assustador é que, nessas áreas, muitas vezes não dá para determinar se o conselho da IA é ruim, então a chance de simplesmente aceitar conselhos confiantes e absurdos é grande
      Fico pensando com que frequência gerentes repetem conselhos da IA sem consultar especialistas, ou passam a desconfiar do especialista porque a IA disse outra coisa. A IA pode acertar às vezes, mas quando erra é muito difícil corrigir
    • O estudo em si é ok. O artigo e o título original, que tiram conclusões que não estão na pesquisa, é que são fracos, e é irônico que o artigo da TNW pareça 100% gerado por IA
  • Subreddits de conselhos e informação pioraram gravemente de qualidade com o uso de IA. Quem pergunta quer respostas de pessoas que realmente saibam, mas muita gente manda a pergunta para o ChatGPT e depois posta o resultado como se fosse conhecimento e insight próprios
    Não sei qual é a qualidade da pesquisa, mas num espaço meio real como o Reddit o fenômeno é evidente. Vai além de simplesmente não dizer “não sei”; as pessoas procuram ativamente chances de bancar que sabem

    • Posts e vídeos anteriores a 2022 são recursos de informação equivalentes ao aço de baixa radiação produzido antes da era da bomba atômica. Nem tudo é valioso, mas agora a influência da IA se infiltrou de forma tão ampla até em posts informativos de especialistas que isso se tornou importante
      Minha solução é verificar constantemente as fontes originais e as evidências, mas isso exige muito tempo e esforço, e também é difícil decidir o que verificar primeiro
    • Se você responde “se você nem se deu ao trabalho de escrever isso, eu também não vou me dar ao trabalho de ler”, as pessoas ficam furiosas, e às vezes até mandam uma resposta escrita por IA explicando por que isso estaria errado
      É melhor simplesmente dizer “coloque xyz no ChatGPT” ou compartilhar um link para um documento estruturado. Copiar e colar o resultado sem alterações significa que nenhum valor foi agregado nesse processo
    • Já não mantenho amizade com pessoas que não entendem a proposta de uma conversa e logo encerram tudo com “por que você não pesquisa isso?”
      Dá para obter informação no IMDB ou em vídeos de DIY, mas o que eu quero é explicação com contexto e conselho adaptado à realidade local. Quem me conhece também sabe o que é fácil ou difícil para mim, então pode até dizer que certo filme ou dica não combina comigo, ou a qual loja eu devo ir
    • A maioria dos subreddits de conselho e informação que eu acompanhava já tinha afundado em posts ruins antes mesmo da IA, e alguns poucos que ainda assino estão surpreendentemente bons
      O fator decisivo sempre foram moderadores ativos que dedicam muito interesse e um enorme tempo. Quando os usuários que postam conteúdo de baixa qualidade passam de certo limite, os bons usuários vão embora e não há recuperação
    • Também já vi várias vezes no HN respostas do tipo “não sei, mas joguei no CrapGPT e ele respondeu isso”. Antes de postar algo assim, a pessoa deveria se perguntar que valor ela acrescentou em comparação com o próprio autor da pergunta usar IA diretamente
  • Pela ótica do pessimismo em relação à IA, mesmo que a IA fique mais inteligente, ela continuará bajulando os usuários, e as pessoas a usarão para reforçar com mais convicção ideias tolas, especialmente em áreas que conhecem mal
    Mesmo que isso possa ser resolvido tecnicamente, as pessoas provavelmente não vão querer um modelo que diga que elas estão erradas, preferindo mentiras convincentes que reforcem suas crenças
    A liberdade de expressão faz a pessoa pensar que pode estar errada, mas a liberdade de associação permite evitar isso. A IA ampliará as câmaras de eco reconfortantes da internet em uma escala difícil de imaginar

    • Henry Petroski explica em 《To Engineer is Human》 que, quando as calculadoras surgiram na era das réguas de cálculo, elas enfraqueceram o senso numérico dos engenheiros estruturais, levaram-nos a tentar trabalhos próximos do limite de sua capacidade e até reduziram sua habilidade de verificar cálculos feitos por computador
      Era uma época em que os computadores começaram a calcular várias ordens de grandeza mais rápido que os humanos, e ele trata o colapso do Hartford Civic Center como um fracasso causado pela confiança cega na saída do computador. Felizmente, não houve mortes
      Pode parecer um caso um tanto selecionado, mas esse acidente veio à mente por causa da combinação “baixa precisão e alta confiança”. Fico preocupado se será preciso haver mortes de civis ou responsabilidade legal para que o uso correto de uma nova tecnologia se estabeleça; no mínimo, podemos começar por 1) não usá-la em sistemas críticos de segurança e 2) não substituir especialistas por algoritmos
      https://www.engr.psu.edu/ae/thesis/failures/MKP/failures/fai...
    • Recentemente, a IA tem mostrado menos tendência à conformidade, e a tendência à bajulação é um problema amplamente conhecido, que as empresas de IA também estão tentando corrigir. Como ficou claro quando a OpenAI encerrou o GPT-4o, certamente há pessoas que não gostam disso
      Mas quem paga muito dinheiro para usar IA em trabalho real prefere ouvir da IA que está errado do que estar errado diante do cliente
      Como ela precisa dar a resposta certa e ainda seguir instruções, isso não é fácil de resolver e exige equilíbrio. Modelos mais inteligentes têm mais chance de saber o que está certo e, por isso, em geral são melhores do que modelos pequenos que assumem que o usuário está certo e continuam alucinando
    • O comportamento da IA que interage com humanos acaba sendo determinado com base em geração de receita. Em geral, incomodar o usuário ou contrariá-lo não é uma estratégia de negócios preferida
      Ainda assim, seria interessante se o usuário pudesse escolher facilmente o quanto a IA deve contestar sua personalidade ou as ideias inseridas
    • Quase não uso LLMs porque não preciso deles e eles também não ajudam muito em trabalhos originais; então, se as pessoas ao meu redor ficarem significativamente mais burras por causa da IA, isso até seria bem-vindo. Porque ficaria mais fácil ter sucesso na minha vida
    • Muitas pessoas já preferem há muito tempo mentiras confortáveis a verdades incômodas
  • Sem um pipeline de geração aumentada por recuperação (RAG) adequado ou busca na web, só resta alucinar com o máximo de confiança possível
    Teria sido mais interessante se tivessem experimentado com um modelo de ponta devidamente alinhado para recusar responder quando a probabilidade dos tokens fosse baixa. O experimento atual apenas demonstra a tendência das pessoas a confiar em um texto bem escrito exibido numa UI de chat

  • Para quem ainda valoriza a verdade, esta frase de Richard Feynman pode servir de referência: “Tenho a vantagem de ter descoberto como é difícil realmente saber alguma coisa, como é preciso verificar os experimentos com cuidado, e como é fácil cometer erros e enganar a si mesmo…”
    https://www.youtube.com/watch?v=tWr39Q9vBgo

    • Pelo menos uma, talvez várias contas do YouTube estão produzindo vídeos ruins de Feynman gerados por IA, então é preciso tomar cuidado. Não se deve confiar automaticamente em materiais anteriores a esta era deplorável de hoje
  • A estrutura de recompensa do estudo era pagamento de US$ 0,10 por resposta correta, desconto de US$ 0,10 por resposta errada e nenhuma variação em caso de recusa de resposta
    Não estava escrito se os participantes realmente recebiam dinheiro, nem se precisavam pagar perdas caso o saldo final fosse negativo
    Acredito que o efeito em si seja real, mas provavelmente não tão grande quanto os dados sugerem. Se quantias muito maiores estivessem em jogo, o bom senso teria atuado com mais força

  • Foi bom divulgarem o estudo, mas nenhum dos links de origem leva diretamente ao estudo citado; eles apontam para domínio próprio ou Business Insider

    • O original é https://osf.io/preprints/psyarxiv/5y6m4_v1
      Marcoccia, C. et al., 《AI Advice Suppresses People’s Willingness to Say “I Don’t Know”, Even When the Advice Is Wrong and Accuracy Is Incentivized》, PsyArXiv, 15 de julho de 2026
  • Quero saber se a IA realmente faz alguma diferença concreta em comparação com um ambiente que simplesmente permite acesso a respostas erradas
    É preciso verificar se o mesmo resultado aparece quando resultados de busca fornecem respostas erradas à pergunta, quanto características próprias da IA — como tendência à bajulação ou interação conversacional — influenciam, ou se isso não passa de as pessoas acreditarem facilmente no que leem

    • O estudo pode ser lido em https://osf.io/preprints/psyarxiv/5y6m4_v1
      Em resumo, o estudo examinou tanto uma interface de chat com LLM dando respostas erradas quanto uma condição com acesso a respostas erradas pré-geradas, e ambos os experimentos tiveram resultados semelhantes
  • Alguns professores fazem os alunos escreverem tarefas com o ChatGPT e depois criticarem as partes erradas
    Em situações em que normalmente se copiaria a resposta da IA e se entregaria assim mesmo, também pode ser interessante primeiro apresentar a resposta da IA e depois fazer a comunidade discutir o que ela deixou passar

    • Na educação, devemos continuar exigindo abordagens com base científica e não desperdiçar a educação das crianças com experimentos pedagógicos improvisados por alguém. Já passamos por tentativas parecidas com Bill Gates