1 pontos por GN⁺ 2023-12-18 | 1 comentários | Compartilhar no WhatsApp
  • Pesquisadores da University of Technology Sydney apresentaram uma tecnologia não invasiva de brain-to-text que converte em texto na tela frases lidas silenciosamente usando apenas ondas cerebrais de EEG
  • O modelo de IA DeWave funciona sem implantes cerebrais ou MRI, e o usuário usa um capacete de EEG para registrar a atividade cerebral
  • O EEG tem mais ruído do que sinais baseados em implantes, mas registrou cerca de 0,4 na métrica BLEU e mostrou resultados melhores na correspondência de verbos do que de substantivos
  • Surgem erros como trocar “the author” por “the man”, mostrando a limitação de escolher palavras semanticamente próximas em vez da palavra exata
  • Os pesquisadores acreditam que podem elevar a precisão para 0,9; os resultados foram apresentados na NeurIPS, mas o preprint no ArXiV ainda não passou por revisão por pares

Experimento que lê frases usando apenas EEG

  • Pesquisadores do GrapheneX-UTS Human-centric Artificial Intelligence Centre, da University of Technology Sydney, testaram uma abordagem que converte diretamente formas de onda brutas de EEG em linguagem
  • Ching-Ten Lin afirmou que este é o primeiro caso a integrar a técnica de codificação discreta (discrete encoding) ao processo de tradução brain-to-text
  • Os participantes leram trechos de texto em silêncio, e o modelo de IA DeWave recebeu apenas as ondas cerebrais como entrada para exibir palavras na tela
  • O resultado foi selecionado como artigo spotlight na NeurIPS conference, encontro anual de pesquisadores de IA e machine learning

Vantagens do método não invasivo e limitações atuais

  • Diferentemente das tecnologias anteriores de conversão de sinais cerebrais em linguagem, este método não exige implantes cerebrais nem equipamentos de MRI
    • Pode ser usado sem entradas adicionais, como software de eye-tracking
    • Os pesquisadores também consideram possível usá-lo em conjunto com outros equipamentos
  • O usuário precisa apenas vestir um capacete que registra a atividade cerebral por EEG
    • Os sinais de EEG têm mais ruído do que as informações obtidas por implantes
    • A pontuação pela métrica BLEU ficou em cerca de 0,4
  • Yiqun Duan explicou que o modelo é mais competente em correspondência de verbos do que de substantivos
    • Nos substantivos, havia tendência de aparecerem sinônimos ou palavras semanticamente próximas, como “the man” em vez de “the author”, em vez de uma tradução exata
    • Os pesquisadores acreditam que, quando o cérebro processa palavras, termos com significado semelhante podem gerar padrões de ondas cerebrais parecidos
  • A meta futura de precisão é 0,9
    • 0,9 é um nível comparável ao de programas tradicionais de tradução de idiomas
    • O experimento teve 29 participantes, número avaliado como mais de uma ordem de grandeza acima de vários testes com outras técnicas de decodificação
  • Os resultados foram apresentados na NeurIPS, e o preprint está disponível no ArXiV
    • Ele ainda não passou por revisão por pares

1 comentários

 
GN⁺ 2023-12-18
Opiniões do Hacker News
  • Fiz doutorado em interface cérebro-computador e trabalhei com EEG e eletrodos implantados
    Grande parte da pesquisa em BCI se concentra em ajudar pacientes paralisados a se comunicarem novamente
    Infelizmente, fora de condições como um laboratório com gaiola de Faraday, dias ou semanas de remoção de ruído e remoção de artefatos de movimento ocular, o EEG não oferece uma relação sinal-ruído suficiente para atingir uma boa velocidade de comunicação
    Isso é uma limitação física difícil de superar, pois o campo elétrico do cérebro enfraquece ao sair do crânio. Por exemplo, brinquedos comerciais de “leitura da mente” na verdade funcionam com base em sinais dos músculos da cabeça e dos olhos
    Eletrodos implantados oferecem sinais melhores, mas ainda precisam de várias iterações para se tornarem comercialmente viáveis. Depois de alguns meses, o cérebro forma tecido cicatricial ao redor dos eletrodos, degradando o sinal, e a cirurgia cerebral em si obviamente também é bastante arriscada
    Testes em humanos exigem aprovação governamental, então os ciclos de iteração também são muito lentos. Se eu tivesse um amigo paralisado que só conseguisse mover os olhos, eu definitivamente focaria em tecnologia de rastreamento ocular. Ela supera de longe todas as BCIs de que já ouvi falar

    • Fico curioso para saber o que você acha da Neuralink do Elon
      Também gostaria de saber se você acha que bons algoritmos de IA, como no artigo, podem ajudar a filtrar ou interpretar muito ruído
    • Recentemente fiz um exame móvel de EEG de dois dias e anotei cada vez que fazia algo que pudesse gerar ruído elétrico
      Por exemplo, passar por um detector de metais ou mexer no celular
      Como esperado, uma das maiores fontes de ruído foi mexer no celular conectado à tomada
      Acho que algo como um gorro de Faraday para EEG poderia realmente funcionar e, acrescentando vídeo auxiliar em primeira pessoa, os médicos poderiam filtrar bastante ruído
    • Isto soa muito como descartar com confiança demais uma nova tecnologia como impossível. Claro que este fórum gosta disso; também foi assim com o GPT
      Este artigo, na verdade, parece uma evidência bastante forte de que, à medida que os algoritmos melhoram, o problema da relação sinal-ruído do EEG pode melhorar
    • Recentemente, uma equipe suíço-francesa possibilitou a comunicação entre o cérebro e as pernas, e o dispositivo parecia bastante maduro
      Acho que o paciente tinha danos nos nervos na região da coluna. Parecia um avanço promissor, e estou curioso para saber o que você acha
      https://actu.epfl.ch/news/thought-controlled-walking-again-a...
    • Acredito que a relação sinal-ruído seja péssima, mas tenho uma forte suspeita de que, com dados suficientes, ainda podem surgir avanços surpreendentes
      Assim como reconstruir o que foi digitado a partir do áudio de uma sala com teclado, não devemos subestimar a capacidade do deep learning de extrair novamente sinais em meio ao ruído
      O maior desafio pode ser que o custo de gerar dados de EEG correlacionados com o sinal seja relativamente alto. Por isso, é difícil imaginar alimentar um modelo com milhões de horas de dados de pessoas vendo ou processando objetos conhecidos
      Por outro lado, dados de rastreamento ocular logo vão crescer enormemente à medida que se tornarem um componente central de novos hardwares de consumo
  • Resposta correta: Bob attended the University of Texas at Austin where he graduated, Phi Beta Kappa with a Bachelor’s degree in Latin American Studies in 1973, taking only two and a half years to complete his work, and obtaining generally excel- lent grades
    Previsão: was the University of California at Austin in where he studied in Beta Kappa in a degree of degree in history American Studies in 1975. and a one classes a half years to complete the degree. and was a excellent grades
    Uau, isso parece semelhante aos sistemas rudimentares de conversão de fala em texto dos anos 70 e 80. Interfaces cerebrais estão rapidamente deixando o domínio da ficção científica e se tornando realidade. Ainda não sei muito bem como me sentir em relação a isso

    • A Figura 1 não mostra resultados reais, mas uma ilustração dos “objetivos” do artigo
      Os resultados reais estão na Tabela 3 e são muito piores
    • Parece que poderia melhorar muito rapidamente apenas combinando o modelo treinado com um grande modelo de linguagem treinado no idioma que se espera que a pessoa esteja pensando
      Ou seja, seria uma forma de encontrar um equilíbrio entre o processamento de baixo para cima do que o modelo TTS acredita que a pessoa está “pensando” e o processamento de cima para baixo do que o modelo gramatical acredita que uma pessoa média “diria em seguida”, dado o histórico da conversa até agora. Como no neocórtex real
      Pensando bem, se houver um corpus de conversas transcritas dessa pessoa, também daria para treinar o LLM com base nele. Isso corresponderia quase exatamente à função de prever “o que essa pessoa diria neste momento”
      Talvez até seja possível encontrar posições adicionais para pads de EEG que consigam ler as consequências elétricas da ação de AMPAR e NMDAR. Com isso, seria possível distinguir o quanto a pessoa está dependendo, no momento, do seu modelo interno de fala de cima para baixo, ou se está usando o processamento interno de baixo para cima para criar frases estranhas e novas em que nunca pensou antes, e usar essa informação para ajustar os pesos da influência do modelo TTS e do LLM na saída
    • Se você “não sabe como se sentir em relação a isso”, nós podemos ler para você
    • É essencial usar apenas open source ou tecnologia comercial paga de nível profissional
      Com certeza alguém vai lançar uma BCI “gratuita” que vigia o máximo possível
    • Este podcast aborda muito bem o futuro para o qual estamos correndo
      https://www.youtube.com/watch?v=OSV7cxma6_s
      “Com todas essas tecnologias avançando em uma velocidade inimaginável, o futurista Peter Diamandis, que merece sua atenção, vai abalar sua forma de pensar e fazer você imaginar novas possibilidades e oportunidades para a longevidade saudável”
  • Há um trecho dizendo que “não é a primeira tecnologia capaz de traduzir sinais cerebrais em linguagem, mas é a única, entre as que surgiram até agora, que não exige implante cerebral nem acesso a equipamentos completos de MRI”
    Fico me perguntando se, daqui a 10 ou 20 anos, quando a tecnologia de sensores melhorar o suficiente para nem ser mais preciso usar um chapéu, não vai aparecer alguém dizendo algo como: em locais públicos, não há uma expectativa razoável de que seus pensamentos não sejam lidos
    Tecnologias de vigilância em geral tendem a ser normalizadas, e também fico curioso se existe algum limite prático para até onde isso pode ir

    • Acho que, por volta dessa época, vamos começar a usar chapéus de papel-alumínio
    • Mesmo sem leitura de sinais cerebrais, só com processamento de dados agregados um agente centralizado de processamento consegue saber quase tudo sobre você
      Há mais de dez anos havia a história de que o algoritmo do programa de fidelidade da Target identificou a gravidez de uma adolescente antes mesmo de ela contar à família, observando correlações em mudanças de compra, como trocar velas aromáticas por velas sem cheiro
      Se for possível obter redes sociais, rastreamento de rosto e olhar por CCTV, dados do giroscópio do celular, histórico de compras, histórico de buscas e os mesmos dados de seus conhecidos conectados, com um conjunto comparativo de dados amplo o suficiente será possível descobrir todo tipo de segredo oculto
      É parecido com o medo de que “meu celular está ouvindo minhas conversas”. Na prática ele não está ouvindo, mas o que deveria preocupar mais é que, antes de qualquer escuta, ele já consegue traçar com muita precisão o que você acabará dizendo
    • https://en.m.wikipedia.org/wiki/The_Hood_Maker
    • Ainda operamos computadores do mesmo jeito que nos anos 1970, ou seja, com teclado e tela
      Não espero grande coisa
  • Isso é extremamente impressionante e útil, e ao mesmo tempo horrível
    Todo mundo pensou imediatamente em leitura de mentes para interrogatórios, mas e quanto à autorreflexão? Como não conseguimos fazer autoanálise de forma totalmente objetiva, existem várias formas de educação e terapia
    Se pudermos analisar nossos padrões de pensamento fora da própria cabeça, todo tipo de melhoria pode ser possível. Encontrar quais técnicas educacionais são de fato mais eficazes, verificar objetivamente quando você está mais concentrado ou menos concentrado, e apontar exatamente quando pensamentos ansiosos começaram e o que os desencadeou
    Acima de tudo, seria possível fazer isso seletivamente de forma privada, com um parceiro ou em grupo
    Além disso, mesmo hoje é possível usar fMRI como detector de mentiras por varredura cerebral. Ainda assim, há muitas dúvidas sobre sua legitimidade
    https://scholarship.law.columbia.edu/cgi/viewcontent.cgi?art...

    • O método de digitar por 15 minutos todas as manhãs em um arquivo de texto de diário já existe, e é gratuito
    • O medo é uma emoção forte, e sabemos muito pouco sobre o que ganharíamos com isso, mas sabemos bastante sobre o que poderíamos perder
    • Registro automático parece que seria ótimo
      A parte difícil não é só a autorreflexão em si, mas ter que lembrar do que refletir e anotar os acontecimentos para analisá-los depois. Isso supondo que se possa confiar na precisão
    • Não é fácil pensar nas vantagens de pensamentos privados desaparecerem
      É surpreendente que se possa passar direto para as vantagens, mesmo havendo um buraco ético do tamanho do universo nessa questão
      Mas talvez essa seja a natureza dos tecno-otimistas
  • Isso me lembra o Silent Talk da DARPA, de 14 anos atrás
    O objetivo era “permitir a comunicação entre usuários no campo de batalha sem fala vocalizada, por meio da análise de sinais neurais”
    https://www.engadget.com/2009-05-14-darpa-working-on-silent-...

    • O reconhecimento de fala silenciosa também vem sendo pesquisado há tanto tempo quanto isso
  • Isso é extremamente impressionante e útil, e ao mesmo tempo horrível
    Acho que poderia ajudar pacientes com AVC, mas ao mesmo tempo imagino que poderia causar problemas ao expor pensamentos não filtrados

    • Sim. Por isso, em 2200, acho que candidaturas a emprego serão processadas rapidamente analisando diretamente os pensamentos
      Com Neuralink, não há problema. Basta fazer upload direto dos rastros de pensamento
      Mesmo que haja pensamentos errados, não precisa se preocupar. Existem escolas de reabilitação que mudam seu estado mental
      Não se esqueça de que você deve ser feliz. Ficar triste é proibido
      Por enquanto é somente leitura, mas e a escrita?
      Isso também pode abrir novas possibilidades, como uma Matrix da vida real
      Aliás, já ouviu falar de Lightspeed Briefs?
      Claro que a pesquisa em si é excelente e será útil. Só que, no longo prazo, o potencial de abuso político é gigantesco
    • Acho que agências de aplicação da lei e empregadores vão adorar isso
      Para pacientes com síndrome do encarceramento, é um benefício positivo quase inimaginável, mas ao mesmo tempo é o tipo de história que faz pensar: “parem de inventar o Torment Nexus!”
    • Ainda assim, é bom pensar que talvez finalmente possamos falar sobre o que são nossos pensamentos não filtrados, quanto se espera que os controlemos ou refinemos, e como fazer isso de um jeito psicologicamente benéfico
    • Se imaginarmos isso sendo usado em debates de candidatos presidenciais ou para explicar projetos de lei, talvez pudesse melhorar muito a democracia e ajudar as pessoas a saberem no que estão realmente votando
    • Pensamentos não filtrados não estão tão distantes de problemas já existentes, como algumas formas de síndrome de Tourette
  • A menos que eu esteja deixando passar algo grande, uma demonstração de controle às cegas, em que o participante escreve a palavra no papel e depois compara com o resultado, seria convincente
    Infelizmente, a demonstração mostrada na matéria parecia algo que um mágico profissional ou um mentalista também conseguiria fazer
    É verdade que estamos chegando mais perto de interfaces cerebrais, mas há algo estranho nesse caso
    Imagine que, daqui a alguns anos, alguém diga ter inventado um scanner de aeroporto que detecta “pensamentos malignos”. Só que não há como verificar, nem responsabilidade por falsos positivos ou falsos negativos. O resultado é exatamente o que o operador disser
    Se pessoas suficientes aceitarem isso a ponto de não resistirem, e até atacarem quem for detectado, o que é real deixa de importar. Vira apenas um ritual de magia simpática do qual as pessoas participam juntas. Tenho a impressão de que há exemplos de dinâmicas parecidas na memória recente

  • Fico curioso se pensamentos não verbais também seriam possíveis
    Com base em um dataset de sinais ligado a atividades cotidianas, talvez fosse possível descobrir o que um cachorro está pensando ou sonhando
    Gerar uma representação de experiências vividas pelo corpo parece uma tarefa difícil de criar e interpretar direito. Mas talvez datasets de sinais ligados à experiência corporal possam ser anotados de forma mais fácil e robusta com descrições em linguagem usando modelos visão-linguagem
    Então um modelo de leitura da mente de cães poderia prever e produzir essas descrições em linguagem
    Imagine saber especificamente a qual parque seu cachorro quer ir, se ele está sentindo sinais iniciais sutis de doença ou lesão, ou que petisco ele quer que você compre

  • Para referência, o modelo base usado neste artigo tem um bug no código que inflou os resultados de baseline
    O problema está sendo investigado no momento
    https://github.com/duanyiqun/DeWave/issues/1

  • Deixando de lado as implicações horríveis, isso possibilita algo muito legal: comunicação telepática bidirecional
    Você pensa em uma mensagem e pensa em “enviar”, e então ouve a resposta pelos earbuds. Com clonagem de voz, poderia até receber a mensagem na voz de quem enviou
    Para um observador externo, seria totalmente silencioso e invisível

    • Talvez nem earbuds sejam necessários
      Fico muito curioso com os resultados de usar o hardware desse sistema como uma espécie de transdutor. Ou seja, rodar o modelo de machine learning daqui ao contrário, a partir do texto-alvo, e empurrar de volta os sinais elétricos de baixo nível resultantes pelos pads de EEG como sinais de estimulação transcraniana por corrente contínua
      Seria realmente interessante se, como resultado, a pessoa “ouvisse” aquele texto como um pensamento verbal na voz da própria mente
    • Invisível, exceto pelos 72 probes de EEG presos à cabeça
    • Há 20 anos eu jamais teria imaginado que chegaria um dia em que smartphones pareceriam meio entediantes
      Na época, o GameBoy Color era a coisa mais legal do mundo
      Tomb Raider no PsOne parecia alta resolução, alta resolução nem existia, e eu achava que tínhamos chegado ao ápice dos games
      O Apple Pro One tenta espacializar o computador, e nós achamos telepatia algo legal
      Seria bom poder programar com a mente, em intervalos de 10 segundos, enquanto corro na floresta ou faço mergulho
      Seria bom receber uma imagem que outra pessoa criou na mente, fazê-la aparecer diante dos olhos e compartilhar com quem está por perto dizendo: “ei, olha o que a Julia fez”
      Na verdade, isso é exatamente igual ao que já acontece, só que de um jeito mais imediato. Troque o smartphone pela mente e a tela pelo ambiente, e você já está nesse mundo futuro
      Se o que faz parecer legal é a novidade, então talvez voltar a perfurar cartões ou escrever linhas no terminal com ed também seja legal
      Alguns anos atrás, na produção musical, troquei a DAW por dez sintetizadores dos anos 70–84 e um gravador de fita; ficou muito mais legal, e não penso em voltar
      Mas estou produzindo tão rápido quanto antes? Não
      O único motivo pelo qual eu gostaria de programar só com a mente e telas virtuais flutuantes, tirando os poucos dias de encanto da novidade, é este
      Quero trabalhar menos; mais precisamente, quero estar menos no trabalho
      Mas, na prática, vão exigir que eu produza mais trabalho. Vai se tornar obrigatório trabalhar só com a força da mente, com 5 ou 6 telas virtuais ao redor
      E é só isso. Até a próxima nova invenção parecer legal
    • Eu nunca usaria, porque não consigo controlar 100% meus pensamentos
      Por exemplo, pensamentos intrusivos, músicas que ficam tocando na cabeça, segredos e coisas do tipo
    • Cuidado com o que deseja
      As consequências não intencionais dessa tecnologia estarão além da imaginação