1 pontos por GN⁺ 2023-12-18 | 1 comentários | Compartilhar no WhatsApp
  • O CAPTCHA ainda é amplamente usado como defesa contra bots, mas, ao considerar casos reais de implantação e a experiência do usuário, o equilíbrio entre segurança e usabilidade está bastante instável
  • Em uma análise de 200 sites populares e um estudo com usuários no MTurk, o reCAPTCHA baseado em clique foi o mais rápido, com mediana de 3,7 segundos, enquanto os tipos baseados em jogos, sliders e hCAPTCHA difícil tenderam a levar mais tempo
  • CAPTCHAs rápidos nem sempre são os mais preferidos: alguns tipos, como os baseados em jogos e sliders, receberam avaliações relativamente boas mesmo levando mais tempo para serem resolvidos
  • Em uma configuração contextualizada que inseria o CAPTCHA no fluxo de criação de conta, o tempo médio de resolução aumentou até 57,5% em relação à resolução direta, e a taxa de abandono também subiu
  • Quanto maior a idade, maior foi o tempo de resolução da maioria dos CAPTCHAs; em comparação com estudos anteriores sobre desempenho de bots, foram confirmados vários casos em que bots eram mais rápidos e precisos que humanos

Por que CAPTCHAs voltaram a ser objeto de avaliação

  • CAPTCHAs vêm sendo amplamente usados há cerca de 20 anos como defesa contra bots, mas técnicas para contorná-los ou resolvê-los automaticamente também continuam evoluindo
  • Os primeiros CAPTCHAs consistiam em ler e digitar textos distorcidos em imagens, mas, com os avanços em visão computacional e machine learning, em 2014 houve casos em que ferramentas automatizadas alcançaram mais de 99% de precisão
  • Hoje, CAPTCHAs se diversificaram em vários formatos
    • Reconhecimento de objetos: “selecionar os quadrados que contêm determinado objeto”
    • Texto distorcido
    • Quebra-cabeça: “arrastar o bloco”
    • Métodos baseados em análise do comportamento do usuário
  • Este estudo examina CAPTCHAs não modificados usados na Web real
    • Análise manual de 200 sites populares
    • Estudo principal com 1.000 pessoas via MTurk
    • Estudo adicional via MTurk para observar separadamente a taxa de abandono
    • Dataset anonimizado completo e código de análise publicados: captcha-study

Distribuição de CAPTCHAs em 200 sites populares

  • Foi feita uma análise manual dos 200 principais sites segundo a lista Alexa Top
    • 185 sites tinham processo de criação de conta
    • Em 142 sites, era possível criar uma conta de fato
    • Cada site foi visitado tanto no modo anônimo do Chrome quanto pelo navegador Tor
  • Entre os tipos de CAPTCHA observados, a concentração em reCAPTCHA foi a mais marcante
    • reCAPTCHA: 68 sites, 34% da amostra
    • CAPTCHA baseado em slider: 14 sites, 7%
    • CAPTCHA de texto distorcido: 14 sites, 7%
    • CAPTCHA baseado em jogos: 9 sites, 4,5%
    • hCAPTCHA: 1 site
    • CAPTCHA invisível: 12 sites, 6%
    • Outros: CAPTCHA semelhante a raspadinha, CAPTCHA para encontrar caracteres chineses em uma imagem, NuCaptcha etc.
  • O escopo da análise tem limitações claras
    • Por ter sido uma análise manual, incluiu apenas os 200 sites principais
    • Como nem todas as funcionalidades foram executadas, o número real de implantações de CAPTCHA pode ser maior
    • Depende do ranking dos sites e do estado dos CAPTCHAs em um momento específico
    • Não inclui CAPTCHAs de sites com propósitos especiais, como a dark web
  • No dataset da BuiltWith com 673 milhões de sites, entre 15,2 milhões de sites que usam CAPTCHA, reCAPTCHA representa 97,3% e hCAPTCHA, 1,4%
    • Os tipos de CAPTCHA usados no estudo cobrem mais de 98% segundo esse dataset em larga escala

Desenho do estudo com usuários

  • O estudo principal com usuários foi conduzido no MTurk com 1.000 pessoas, e os participantes resolveram 10 CAPTCHAs em ordem aleatória
  • O procedimento foi composto por quatro etapas
    • Introdução ao estudo
    • Perguntas prévias: coleta de informações demográficas
    • Tarefa de resolução de CAPTCHA
    • Perguntas posteriores: questões como preferência pelos CAPTCHAs recém-resolvidos
  • Foram usados 10 tipos de CAPTCHA no total
    • 2 tipos de reCAPTCHA v2: configuração mais fácil para o usuário e configuração mais segura
    • 2 tipos de jogos da Arkose Labs: rotação de objeto e seleção do objeto na orientação correta
    • 2 tipos de hCAPTCHA: configuração fácil e configuração difícil
    • 1 CAPTCHA de slider da Geetest
    • 3 tipos de CAPTCHA de texto distorcido: simples, com mascaramento e com texto em movimento
  • Para comparar o contexto experimental, foram usadas duas configurações
    • Configuração direta: os participantes eram informados de que se tratava de um estudo para resolver CAPTCHAs, e 10 CAPTCHAs eram apresentados diretamente
    • Configuração contextualizada: os participantes eram informados de que se tratava de um estudo sobre criação de contas, e um CAPTCHA aparecia após o envio de cada formulário de criação de conta
  • Na configuração contextualizada, foram fornecidas informações sintéticas para evitar a coleta de dados pessoais, e o objetivo real foi revelado após a conclusão da tarefa
    • Esse método recebeu aprovação do IRB, e também foram aprovados documentos relacionados à divulgação incompleta e à alteração do consentimento
    • Após a revelação do objetivo, não foram coletados dados de participantes que não consentiram com o uso dos dados
  • A remuneração dos participantes foi inicialmente de US$ 0,30 na configuração direta e US$ 0,75 na contextualizada
    • Após verificar que as medianas de tempo de conclusão eram, respectivamente, 4,4 minutos e 11,5 minutos, os valores foram aumentados retroativamente para US$ 0,60 e US$ 1,50

Diferenças em tempo de resolução e preferência

  • O tempo de resolução variou bastante conforme o tipo de CAPTCHA
    • O reCAPTCHA baseado em clique foi o mais rápido, com mediana de 3,7 segundos
    • A diferença entre a configuração fácil e a difícil não foi grande
    • O CAPTCHA simples de texto distorcido foi o mais rápido entre os de texto distorcido
    • Os tempos de resolução dos tipos com mascaramento e com texto em movimento foram semelhantes
    • No hCAPTCHA, a diferença entre a configuração fácil e a difícil foi clara, e a configuração difícil apresentava tarefas de imagem mais difíceis ou mais rodadas
    • CAPTCHAs baseados em jogos e sliders em geral tiveram medianas de tempo de resolução mais altas, mas alguns participantes os resolveram em menos de 10 segundos
  • A preferência dos usuários não acompanha perfeitamente o tempo de resolução
    • O reCAPTCHA baseado em clique foi o mais rápido e também o mais preferido
    • Os tipos baseados em jogos e sliders levaram mais tempo, mas tenderam a receber pontuações altas de preferência
    • Mesmo o CAPTCHA mais preferido, o reCAPTCHA baseado em clique, recebeu nota 1 ou 2 de 18,9% dos participantes
    • Mesmo o hCAPTCHA, com a menor preferência geral, recebeu nota 4 ou 5 de mais de 31,0% dos participantes

Diferenças causadas pelo contexto experimental

  • Ao comparar a configuração direta com a contextualizada, na maioria dos CAPTCHAs o tempo médio de resolução na configuração contextualizada foi maior
    • No reCAPTCHA fácil baseado em clique, o tempo médio de resolução aumentou 1,8 segundo, uma alta de 57,5%
    • No Arkose de rotação, aumentou 10 segundos, uma alta de 56,1%
    • Na média de todos os tipos de CAPTCHA, a configuração contextualizada teve aumento de 26,7% em relação à direta
    • O hCAPTCHA difícil teve a maior mediana geral de tempo de resolução, mas a diferença média de tempo entre as duas configurações não foi significativa
  • No teste de Kruskal-Wallis, a diferença média de tempo de resolução foi estatisticamente significativa em todos os tipos de CAPTCHA, exceto Geetest, reCAPTCHA baseado em imagem e hCAPTCHA difícil
  • Entre as duas configurações, permanecem vários potenciais fatores de confusão
    • Participantes da configuração contextualizada realizaram mais tarefas
    • Diferenças na remuneração e na percepção sobre a conclusão da tarefa podem ter afetado a motivação ou a probabilidade de abandono

Demografia, precisão e taxa de abandono

  • A idade esteve relacionada ao tempo de resolução dos CAPTCHAs
    • Em todos os tipos, exceto o reCAPTCHA fácil baseado em imagem, os participantes mais jovens tenderam a ter menor tempo médio de resolução
    • Estudos anteriores relataram aumento de 0,03 segundo por ano de idade em CAPTCHAs baseados em texto, mas este estudo mostrou aumento de 0,09 segundo por ano em média considerando todos os tipos de CAPTCHA
  • Não foram observadas grandes diferenças de tempo de resolução por nível de escolaridade ou gênero
    • Estudos anteriores afirmavam que participantes com PhD resolviam mais rápido do que outros grupos educacionais, mas neste estudo o nível de escolaridade autorrelatado não se correlacionou com o tempo de resolução
  • Houve algumas diferenças por dispositivo e método de entrada
    • Usuários de computador tiveram menor tempo médio de resolução do que usuários de celular em CAPTCHAs de texto distorcido e no reCAPTCHA difícil baseado em clique
    • Entre teclado físico e toque, houve diferenças estatisticamente significativas no texto distorcido simples e com mascaramento, no reCAPTCHA baseado em clique e no Arkose de seleção
  • Na comparação de precisão, houve grande variação por tipo
    • A precisão de classificação de imagens do reCAPTCHA foi de 81% na configuração fácil e 81,7% na difícil
    • A precisão do hCAPTCHA foi de 81,4% na configuração fácil e 70,6% na difícil
    • Nos textos distorcidos, ao ignorar maiúsculas e minúsculas, a concordância entre participantes aumentou em média 20%
      • Simples: de 84% para 93%
      • Com mascaramento: de 50% para 73%
      • Com texto em movimento: de 62% para 90%
  • Em comparação com o desempenho de bots na literatura existente, em vários tipos de CAPTCHA bots produziram resultados mais rápidos e precisos que humanos
    • reCAPTCHA baseado em clique: humanos em 3,1 a 4,9 segundos; caso de bot com 1,4 segundo e 100% de precisão
    • Geetest: humanos em 28 a 30 segundos; caso de bot com 5,3 segundos e 96% de precisão
    • Texto distorcido: humanos em 9 a 15,3 segundos e 50% a 84% de precisão; caso de bot em menos de 1 segundo e 99,8% de precisão
    • reCAPTCHA baseado em imagem: humanos em 15 a 26 segundos e 81% de precisão; caso de bot com 17,5 segundos e 85% de precisão
    • hCAPTCHA: humanos em 18 a 32 segundos e 71% a 81% de precisão; caso de bot com 14,9 segundos e 98% de precisão
  • Em um estudo separado sobre taxa de abandono, 18% a 45% dos participantes abandonaram o estudo após a apresentação do primeiro CAPTCHA
    • Participantes da configuração contextualizada tinham probabilidade de abandono 120% maior do que os da configuração direta
    • Se usuários abandonam uma tarefa por causa de um CAPTCHA, isso pode levar à perda de atividades no site, como compras ou criação de contas

1 comentários

 
GN⁺ 2023-12-18
Opiniões do Hacker News
  • Acho que o CAPTCHA do Google foi projetado e implantado como um mecanismo para treinamento de IA, e por isso acabou assumindo a forma que tem hoje.
    O teatro de segurança ao redor é quase algo secundário, e também não surpreende que a IA agora consiga resolvê-lo bem. Nós a treinamos assim por anos.

    • Em geral está certo, mas, embora para o usuário pareça um dispositivo de segurança doloroso, em muitos casos há um objetivo real: limitar a velocidade de ataques de força bruta.
      No mínimo, tem o efeito de gerar custo para o atacante.
    • Essa explicação não se encaixa bem. O reCAPTCHA de fato cumpre a função indicada pelo nome, mas a forma como faz isso tem pouca relação com o quebra-cabeça que o usuário vê.
      O ponto central é a análise comportamental, incluindo o fato de o Google julgar a probabilidade de ser um bot com dados coletados antes mesmo de o usuário carregar a página.
      Não nego que o reCAPTCHA seja uma fonte de dados de treinamento para o Google. Não deve ser por acaso que os desafios do reCAPTCHA V2 continuam sendo de identificação de objetos de trânsito, e não é como se o Google estivesse desenvolvendo IA para direção autônoma.
      Mas isso é o modelo de negócio, não a função principal, e esses dados de treinamento tampouco são entregues diretamente aos desenvolvedores de bots que resolvem CAPTCHA.
    • Eu achava que, para verificar se era uma pessoa, usavam mais timing e movimentos do mouse do que se a resposta estava correta.
    • Quando estiver totalmente treinado, não sei como um site vai conseguir distinguir bots inteligentes de pessoas reais.
      Hoje deixamos a filtragem a cargo de serviços como a Cloudflare, mas, se esse tipo de treinamento continuar, fico me perguntando como até a Cloudflare vai diferenciar bots de humanos.
    • Curiosamente, a IA talvez consiga resolver CAPTCHA melhor do que humanos.
      Já vi muitos casos em que o CAPTCHA do Google rejeita respostas corretas, o que pode ser resultado de ter treinado bots para aceitar respostas erradas.
      Ainda bem que agora não são mais placas de pare. Seria bem constrangedor se o Google, por um lado, vendesse carros “autônomos” e, ao mesmo tempo, mostrasse que robôs não conseguem reconhecer placas de pare.
  • Este estudo parece tratar de vários aspectos de como pessoas resolvem CAPTCHA, e não encontrei nada dizendo que a IA supera humanos. Alguém sabe em qual seção está isso?
    Resolver reCAPTCHA v2/v3 exige mais do que clicar numa caixa de seleção e resolver quebra-cabeças de imagem. Se fosse só isso, o caos já teria se instalado.
    Dizer que CAPTCHA serve para treinar IA está correto em sentido amplo, mas, no modo como os CAPTCHAs modernos funcionam, eu diria que é mais um efeito colateral.
    Coisas como reCaptcha V2+ monitoram análise comportamental, como histórico de navegação ou movimentos do mouse sobre a página. Por isso a maioria das pessoas só precisa clicar na caixa de seleção.
    Nem sei se existem grandes modelos multimodais que incluam movimentos do mouse como modalidade de entrada.
    Uma IA projetada para quebrar CAPTCHA também não pode usar os dados do Google etc. para treinamento. Se a preocupação é que o Google treine seus próprios bots para contornar CAPTCHA, não é impossível, mas...

    • Exato. Na verdade, este estudo não é sobre IA resolvendo CAPTCHA, mas sobre como pessoas os resolvem.
      O título é bem caça-cliques e, infelizmente, esse tipo de título funciona bem no HN.
    • Está na Table 3.
  • Acho que, no futuro, verificação por cartão de pagamento será o próximo passo quando alguém for se cadastrar em algo.
    Deve começar bloqueando BINs pré-pagos. Seria bem horrível, mas hoje sinto que é melhor pagar US$ 0,01 do que resolver CAPTCHA, então alguma coisa é necessária.
    Especialmente “selecione todas as bicicletas” é um desperdício de vida.

    • Já existe tanto atrito desse tipo que está me empurrando para simplesmente não fazer essas coisas.
      Acabo comprando menos coisas e usando menos redes sociais. Caminhadas na natureza e livros de papel não têm CAPTCHA.
    • O próximo passo será atestação de dispositivo (device attestation). Se me lembro bem, o Safari já faz isso, então, em lugares que oferecem suporte, você não deveria ver CAPTCHA.
      Para funcionar em qualquer navegador, poderia ser algo assim: escanear um QR code com um iPhone ou Android que suporte atestação, perguntar se aprova o login, e o dispositivo faz a atestação em seu lugar.
      Se ele se revelar um agente malicioso, o site pode bloquear aquele dispositivo, então também fica difícil lançar ataques em massa a partir de um único aparelho.
    • Vale a pena pesquisar sobre o UPI da Índia. Coisas que parecem sofisticadas, como “verificação por cartão de pagamento”, são cheias de erros, antigas, ultrapassadas e também caras para os comerciantes.
      No UPI, você recebe um QR code ou digita um ID UPI, toca para pagar e pronto.
      Se a preocupação é “prevenção de fraude”, acho que isso deveria ser resolvido com bancos, vendedores e tribunais, em vez de depender de intermediários como eBay ou operadoras de cartão.
    • Por favor. Na última vez em que resolvi um CAPTCHA, perdi 15 minutos clicando sem parar em bicicletas, motos, ônibus e semáforos como punição por usar VPN. Não é exagero.
    • É horrível pensar que isso possa se tornar o padrão.
      Lembro que, quando morava em {Country}, eu não tinha acesso algum a cartões aceitos para pagamentos internacionais.
  • O HN já exigiu CAPTCHA alguma vez? Parece se manter muito bem apenas com ferramentas operacionais e antispam básicas, mas comprovadas, e limites de taxa que seguram quase tudo, exceto DDoS muito persistente.
    Também não parece haver restrições absurdas para scraping ou clientes de terceiros.
    Mesmo assim, atende 5 milhões de visitantes únicos por mês e 10 milhões de visualizações por dia[0].
    [0] https://news.ycombinator.com/item?id=33454140

    • O HN, na verdade, não é um alvo tão atraente.
      O que dá para fazer é postar spam, mas isso tem baixo valor financeiro real para o atacante, e ferramentas para lidar com esse tipo de coisa existem há décadas, como você disse.
      É muito diferente de outros sites em que a possibilidade de ganhar dinheiro é muito mais clara e direta.
    • Quando aparece um post mais popular que o normal, ele sofre bastante.
    • Se me lembro bem, a página de cadastro às vezes mostra reCAPTCHA.
    • Em uma única máquina, né :)
    • O HN cai com certa frequência. Acho que a disponibilidade era algo como four nines.
      Não sei por que insistem em operar com apenas algumas poucas máquinas. Dinheiro eles devem ter de sobra, e o efeito de divulgação para a YC provavelmente compensaria a diferença.
  • O CAPTCHA é sofrido demais por causa da ambiguidade e do problema de as imagens não carregarem por completo
    Mesmo esperando 1 minuto, algumas imagens simplesmente nunca aparecem. E, quando aparecem, há fotos demais de bicicletas, motos e faixas de pedestres
    Sempre fico na dúvida se devo clicar quando um pedacinho minúsculo invade de leve outro quadrado. Não dá para recarregar só a imagem que não carregou e, ao atualizar, parece que na maioria das vezes é preciso começar tudo de novo
    Como outras pessoas já disseram, ao usar Tor é comum o CAPTCHA nem carregar. Ele não mostra as fotos e simplesmente fica parado. Sites comuns geralmente funcionam bem no Tor, então parece ser um problema do CAPTCHA

    • Sempre acabo me perguntando se devo clicar quando um pedacinho invade de leve outro quadrado
  • Há 7 anos, isso já tinha sido previsto assim: “Como as máquinas vão assumir o controle? Quando os CAPTCHAs ficarem tão difíceis que só a IA consiga resolvê-los, os humanos ficarão completamente trancados para fora da internet.” https://twitter.com/lapcatsoftware/status/771857826130034688

    • Acho que isso já vinha acontecendo havia uns 7 anos
      Os CAPTCHAs do tipo “quais são as letras nesta imagem” diminuíram bastante por um tempo, e parte do motivo provavelmente foi isso
  • O título do envio era “AI bots are now outperforming humans in solving CAPTCHAs”, o que violava a regra de títulos do HN: “use o título original, e não o edite, a menos que ele seja enganoso ou caça-cliques”
    Se quem submeteu o texto quiser dizer o que considera importante na matéria, pode deixar isso como comentário na thread. Assim, essa opinião fica no mesmo ponto de partida que a de todo mundo: https://hn.algolia.com/?dateRange=all&page=0&prefix=false&sort=byDate&type=comment&query=%22level%20playing%20field%22%20by:dang

  • O título foi editado de uma forma enganosa. O título e o resumo reais não dizem que a IA “agora” supera humanos
    O título real é An Empirical Study & Evaluation of Modern CAPTCHAs
    Por quase 20 anos, CAPTCHAs foram amplamente usados como uma proteção para barrar bots e, à medida que seu uso aumentou, as técnicas para quebrá-los ou contorná-los também continuaram evoluindo
    Ao mesmo tempo, os CAPTCHAs também evoluíram em sofisticação e diversidade, tornando-se cada vez mais difíceis de resolver não só para bots, mas também para pessoas
    Como essa antiga corrida armamentista continua, é importante investigar quanto tempo usuários legítimos levam para resolver CAPTCHAs modernos e como os percebem
    Este estudo avaliou CAPTCHAs realmente em uso, sem modificá-los, por meio de uma investigação manual de sites populares e de um estudo com usuários
    1.400 participantes resolveram, ao todo, 14.000 CAPTCHAs, e houve grandes diferenças entre os tipos mais populares
    Curiosamente, o tempo de resolução e a percepção dos usuários nem sempre apresentaram correlação
    Também foram comparadas as diferenças entre resolver CAPTCHAs diretamente e resolvê-los como parte de uma tarefa mais natural, como criar uma conta; embora houvesse vários fatores de confusão, o contexto experimental pode influenciar os resultados e deve ser considerado em pesquisas futuras
    Por fim, ao analisar participantes que iniciaram a tarefa mas não a concluíram, o estudo também examinou o fenômeno de usuários abandonarem uma tarefa por causa de CAPTCHAs

  • Esses artigos deixam passar que CAPTCHAs têm vários níveis de dificuldade
    Pessoas que usam contas enterprise ou trabalham em estreita colaboração com provedores de CAPTCHA veem resultados muito diferentes
    Hoje, muitos provedores de CAPTCHA decidem quais CAPTCHAs servir no modo difícil com base no que grandes modelos de linguagem não conseguem resolver
    O motivo de os CAPTCHAs não serem feitos propositalmente difíceis demais é que lugares como pex.com precisam conseguir contorná-los para fins de aplicação de direitos autorais
    Como fui fundador da hcaptcha, deixo claro que tenho viés

  • Acho que métodos como os CAPTCHAs recentes, em que você gira um objeto para encaixar um quebra-cabeça ou encontra itens iguais, são melhores
    O método antigo de ler letras distorcidas, especialmente quando era preciso adivinhar se era i, 1 ou l, era mais irritante