BrainGPT transforma pensamentos em texto
(iflscience.com)- Pesquisadores da University of Technology Sydney apresentaram uma tecnologia não invasiva de brain-to-text que converte em texto na tela frases lidas silenciosamente usando apenas ondas cerebrais de EEG
- O modelo de IA DeWave funciona sem implantes cerebrais ou MRI, e o usuário usa um capacete de EEG para registrar a atividade cerebral
- O EEG tem mais ruído do que sinais baseados em implantes, mas registrou cerca de 0,4 na métrica BLEU e mostrou resultados melhores na correspondência de verbos do que de substantivos
- Surgem erros como trocar “the author” por “the man”, mostrando a limitação de escolher palavras semanticamente próximas em vez da palavra exata
- Os pesquisadores acreditam que podem elevar a precisão para 0,9; os resultados foram apresentados na NeurIPS, mas o preprint no ArXiV ainda não passou por revisão por pares
Experimento que lê frases usando apenas EEG
- Pesquisadores do GrapheneX-UTS Human-centric Artificial Intelligence Centre, da University of Technology Sydney, testaram uma abordagem que converte diretamente formas de onda brutas de EEG em linguagem
- Ching-Ten Lin afirmou que este é o primeiro caso a integrar a técnica de codificação discreta (discrete encoding) ao processo de tradução brain-to-text
- Os participantes leram trechos de texto em silêncio, e o modelo de IA DeWave recebeu apenas as ondas cerebrais como entrada para exibir palavras na tela
- O resultado foi selecionado como artigo spotlight na NeurIPS conference, encontro anual de pesquisadores de IA e machine learning
Vantagens do método não invasivo e limitações atuais
- Diferentemente das tecnologias anteriores de conversão de sinais cerebrais em linguagem, este método não exige implantes cerebrais nem equipamentos de MRI
- Pode ser usado sem entradas adicionais, como software de eye-tracking
- Os pesquisadores também consideram possível usá-lo em conjunto com outros equipamentos
- O usuário precisa apenas vestir um capacete que registra a atividade cerebral por EEG
- Os sinais de EEG têm mais ruído do que as informações obtidas por implantes
- A pontuação pela métrica BLEU ficou em cerca de 0,4
- Yiqun Duan explicou que o modelo é mais competente em correspondência de verbos do que de substantivos
- Nos substantivos, havia tendência de aparecerem sinônimos ou palavras semanticamente próximas, como “the man” em vez de “the author”, em vez de uma tradução exata
- Os pesquisadores acreditam que, quando o cérebro processa palavras, termos com significado semelhante podem gerar padrões de ondas cerebrais parecidos
- A meta futura de precisão é 0,9
- 0,9 é um nível comparável ao de programas tradicionais de tradução de idiomas
- O experimento teve 29 participantes, número avaliado como mais de uma ordem de grandeza acima de vários testes com outras técnicas de decodificação
- Os resultados foram apresentados na NeurIPS, e o preprint está disponível no ArXiV
- Ele ainda não passou por revisão por pares
1 comentários
Opiniões do Hacker News
Fiz doutorado em interface cérebro-computador e trabalhei com EEG e eletrodos implantados
Grande parte da pesquisa em BCI se concentra em ajudar pacientes paralisados a se comunicarem novamente
Infelizmente, fora de condições como um laboratório com gaiola de Faraday, dias ou semanas de remoção de ruído e remoção de artefatos de movimento ocular, o EEG não oferece uma relação sinal-ruído suficiente para atingir uma boa velocidade de comunicação
Isso é uma limitação física difícil de superar, pois o campo elétrico do cérebro enfraquece ao sair do crânio. Por exemplo, brinquedos comerciais de “leitura da mente” na verdade funcionam com base em sinais dos músculos da cabeça e dos olhos
Eletrodos implantados oferecem sinais melhores, mas ainda precisam de várias iterações para se tornarem comercialmente viáveis. Depois de alguns meses, o cérebro forma tecido cicatricial ao redor dos eletrodos, degradando o sinal, e a cirurgia cerebral em si obviamente também é bastante arriscada
Testes em humanos exigem aprovação governamental, então os ciclos de iteração também são muito lentos. Se eu tivesse um amigo paralisado que só conseguisse mover os olhos, eu definitivamente focaria em tecnologia de rastreamento ocular. Ela supera de longe todas as BCIs de que já ouvi falar
Também gostaria de saber se você acha que bons algoritmos de IA, como no artigo, podem ajudar a filtrar ou interpretar muito ruído
Por exemplo, passar por um detector de metais ou mexer no celular
Como esperado, uma das maiores fontes de ruído foi mexer no celular conectado à tomada
Acho que algo como um gorro de Faraday para EEG poderia realmente funcionar e, acrescentando vídeo auxiliar em primeira pessoa, os médicos poderiam filtrar bastante ruído
Este artigo, na verdade, parece uma evidência bastante forte de que, à medida que os algoritmos melhoram, o problema da relação sinal-ruído do EEG pode melhorar
Acho que o paciente tinha danos nos nervos na região da coluna. Parecia um avanço promissor, e estou curioso para saber o que você acha
https://actu.epfl.ch/news/thought-controlled-walking-again-a...
Assim como reconstruir o que foi digitado a partir do áudio de uma sala com teclado, não devemos subestimar a capacidade do deep learning de extrair novamente sinais em meio ao ruído
O maior desafio pode ser que o custo de gerar dados de EEG correlacionados com o sinal seja relativamente alto. Por isso, é difícil imaginar alimentar um modelo com milhões de horas de dados de pessoas vendo ou processando objetos conhecidos
Por outro lado, dados de rastreamento ocular logo vão crescer enormemente à medida que se tornarem um componente central de novos hardwares de consumo
Resposta correta: Bob attended the University of Texas at Austin where he graduated, Phi Beta Kappa with a Bachelor’s degree in Latin American Studies in 1973, taking only two and a half years to complete his work, and obtaining generally excel- lent grades
Previsão: was the University of California at Austin in where he studied in Beta Kappa in a degree of degree in history American Studies in 1975. and a one classes a half years to complete the degree. and was a excellent grades
Uau, isso parece semelhante aos sistemas rudimentares de conversão de fala em texto dos anos 70 e 80. Interfaces cerebrais estão rapidamente deixando o domínio da ficção científica e se tornando realidade. Ainda não sei muito bem como me sentir em relação a isso
Os resultados reais estão na Tabela 3 e são muito piores
Ou seja, seria uma forma de encontrar um equilíbrio entre o processamento de baixo para cima do que o modelo TTS acredita que a pessoa está “pensando” e o processamento de cima para baixo do que o modelo gramatical acredita que uma pessoa média “diria em seguida”, dado o histórico da conversa até agora. Como no neocórtex real
Pensando bem, se houver um corpus de conversas transcritas dessa pessoa, também daria para treinar o LLM com base nele. Isso corresponderia quase exatamente à função de prever “o que essa pessoa diria neste momento”
Talvez até seja possível encontrar posições adicionais para pads de EEG que consigam ler as consequências elétricas da ação de AMPAR e NMDAR. Com isso, seria possível distinguir o quanto a pessoa está dependendo, no momento, do seu modelo interno de fala de cima para baixo, ou se está usando o processamento interno de baixo para cima para criar frases estranhas e novas em que nunca pensou antes, e usar essa informação para ajustar os pesos da influência do modelo TTS e do LLM na saída
Com certeza alguém vai lançar uma BCI “gratuita” que vigia o máximo possível
https://www.youtube.com/watch?v=OSV7cxma6_s
“Com todas essas tecnologias avançando em uma velocidade inimaginável, o futurista Peter Diamandis, que merece sua atenção, vai abalar sua forma de pensar e fazer você imaginar novas possibilidades e oportunidades para a longevidade saudável”
Há um trecho dizendo que “não é a primeira tecnologia capaz de traduzir sinais cerebrais em linguagem, mas é a única, entre as que surgiram até agora, que não exige implante cerebral nem acesso a equipamentos completos de MRI”
Fico me perguntando se, daqui a 10 ou 20 anos, quando a tecnologia de sensores melhorar o suficiente para nem ser mais preciso usar um chapéu, não vai aparecer alguém dizendo algo como: em locais públicos, não há uma expectativa razoável de que seus pensamentos não sejam lidos
Tecnologias de vigilância em geral tendem a ser normalizadas, e também fico curioso se existe algum limite prático para até onde isso pode ir
Há mais de dez anos havia a história de que o algoritmo do programa de fidelidade da Target identificou a gravidez de uma adolescente antes mesmo de ela contar à família, observando correlações em mudanças de compra, como trocar velas aromáticas por velas sem cheiro
Se for possível obter redes sociais, rastreamento de rosto e olhar por CCTV, dados do giroscópio do celular, histórico de compras, histórico de buscas e os mesmos dados de seus conhecidos conectados, com um conjunto comparativo de dados amplo o suficiente será possível descobrir todo tipo de segredo oculto
É parecido com o medo de que “meu celular está ouvindo minhas conversas”. Na prática ele não está ouvindo, mas o que deveria preocupar mais é que, antes de qualquer escuta, ele já consegue traçar com muita precisão o que você acabará dizendo
Não espero grande coisa
Isso é extremamente impressionante e útil, e ao mesmo tempo horrível
Todo mundo pensou imediatamente em leitura de mentes para interrogatórios, mas e quanto à autorreflexão? Como não conseguimos fazer autoanálise de forma totalmente objetiva, existem várias formas de educação e terapia
Se pudermos analisar nossos padrões de pensamento fora da própria cabeça, todo tipo de melhoria pode ser possível. Encontrar quais técnicas educacionais são de fato mais eficazes, verificar objetivamente quando você está mais concentrado ou menos concentrado, e apontar exatamente quando pensamentos ansiosos começaram e o que os desencadeou
Acima de tudo, seria possível fazer isso seletivamente de forma privada, com um parceiro ou em grupo
Além disso, mesmo hoje é possível usar fMRI como detector de mentiras por varredura cerebral. Ainda assim, há muitas dúvidas sobre sua legitimidade
https://scholarship.law.columbia.edu/cgi/viewcontent.cgi?art...
A parte difícil não é só a autorreflexão em si, mas ter que lembrar do que refletir e anotar os acontecimentos para analisá-los depois. Isso supondo que se possa confiar na precisão
É surpreendente que se possa passar direto para as vantagens, mesmo havendo um buraco ético do tamanho do universo nessa questão
Mas talvez essa seja a natureza dos tecno-otimistas
Isso me lembra o Silent Talk da DARPA, de 14 anos atrás
O objetivo era “permitir a comunicação entre usuários no campo de batalha sem fala vocalizada, por meio da análise de sinais neurais”
https://www.engadget.com/2009-05-14-darpa-working-on-silent-...
Isso é extremamente impressionante e útil, e ao mesmo tempo horrível
Acho que poderia ajudar pacientes com AVC, mas ao mesmo tempo imagino que poderia causar problemas ao expor pensamentos não filtrados
Com Neuralink, não há problema. Basta fazer upload direto dos rastros de pensamento
Mesmo que haja pensamentos errados, não precisa se preocupar. Existem escolas de reabilitação que mudam seu estado mental
Não se esqueça de que você deve ser feliz. Ficar triste é proibido
Por enquanto é somente leitura, mas e a escrita?
Isso também pode abrir novas possibilidades, como uma Matrix da vida real
Aliás, já ouviu falar de Lightspeed Briefs?
Claro que a pesquisa em si é excelente e será útil. Só que, no longo prazo, o potencial de abuso político é gigantesco
Para pacientes com síndrome do encarceramento, é um benefício positivo quase inimaginável, mas ao mesmo tempo é o tipo de história que faz pensar: “parem de inventar o Torment Nexus!”
A menos que eu esteja deixando passar algo grande, uma demonstração de controle às cegas, em que o participante escreve a palavra no papel e depois compara com o resultado, seria convincente
Infelizmente, a demonstração mostrada na matéria parecia algo que um mágico profissional ou um mentalista também conseguiria fazer
É verdade que estamos chegando mais perto de interfaces cerebrais, mas há algo estranho nesse caso
Imagine que, daqui a alguns anos, alguém diga ter inventado um scanner de aeroporto que detecta “pensamentos malignos”. Só que não há como verificar, nem responsabilidade por falsos positivos ou falsos negativos. O resultado é exatamente o que o operador disser
Se pessoas suficientes aceitarem isso a ponto de não resistirem, e até atacarem quem for detectado, o que é real deixa de importar. Vira apenas um ritual de magia simpática do qual as pessoas participam juntas. Tenho a impressão de que há exemplos de dinâmicas parecidas na memória recente
Fico curioso se pensamentos não verbais também seriam possíveis
Com base em um dataset de sinais ligado a atividades cotidianas, talvez fosse possível descobrir o que um cachorro está pensando ou sonhando
Gerar uma representação de experiências vividas pelo corpo parece uma tarefa difícil de criar e interpretar direito. Mas talvez datasets de sinais ligados à experiência corporal possam ser anotados de forma mais fácil e robusta com descrições em linguagem usando modelos visão-linguagem
Então um modelo de leitura da mente de cães poderia prever e produzir essas descrições em linguagem
Imagine saber especificamente a qual parque seu cachorro quer ir, se ele está sentindo sinais iniciais sutis de doença ou lesão, ou que petisco ele quer que você compre
Para referência, o modelo base usado neste artigo tem um bug no código que inflou os resultados de baseline
O problema está sendo investigado no momento
https://github.com/duanyiqun/DeWave/issues/1
Deixando de lado as implicações horríveis, isso possibilita algo muito legal: comunicação telepática bidirecional
Você pensa em uma mensagem e pensa em “enviar”, e então ouve a resposta pelos earbuds. Com clonagem de voz, poderia até receber a mensagem na voz de quem enviou
Para um observador externo, seria totalmente silencioso e invisível
Fico muito curioso com os resultados de usar o hardware desse sistema como uma espécie de transdutor. Ou seja, rodar o modelo de machine learning daqui ao contrário, a partir do texto-alvo, e empurrar de volta os sinais elétricos de baixo nível resultantes pelos pads de EEG como sinais de estimulação transcraniana por corrente contínua
Seria realmente interessante se, como resultado, a pessoa “ouvisse” aquele texto como um pensamento verbal na voz da própria mente
Na época, o GameBoy Color era a coisa mais legal do mundo
Tomb Raider no PsOne parecia alta resolução, alta resolução nem existia, e eu achava que tínhamos chegado ao ápice dos games
O Apple Pro One tenta espacializar o computador, e nós achamos telepatia algo legal
Seria bom poder programar com a mente, em intervalos de 10 segundos, enquanto corro na floresta ou faço mergulho
Seria bom receber uma imagem que outra pessoa criou na mente, fazê-la aparecer diante dos olhos e compartilhar com quem está por perto dizendo: “ei, olha o que a Julia fez”
Na verdade, isso é exatamente igual ao que já acontece, só que de um jeito mais imediato. Troque o smartphone pela mente e a tela pelo ambiente, e você já está nesse mundo futuro
Se o que faz parecer legal é a novidade, então talvez voltar a perfurar cartões ou escrever linhas no terminal com ed também seja legal
Alguns anos atrás, na produção musical, troquei a DAW por dez sintetizadores dos anos 70–84 e um gravador de fita; ficou muito mais legal, e não penso em voltar
Mas estou produzindo tão rápido quanto antes? Não
O único motivo pelo qual eu gostaria de programar só com a mente e telas virtuais flutuantes, tirando os poucos dias de encanto da novidade, é este
Quero trabalhar menos; mais precisamente, quero estar menos no trabalho
Mas, na prática, vão exigir que eu produza mais trabalho. Vai se tornar obrigatório trabalhar só com a força da mente, com 5 ou 6 telas virtuais ao redor
E é só isso. Até a próxima nova invenção parecer legal
Por exemplo, pensamentos intrusivos, músicas que ficam tocando na cabeça, segredos e coisas do tipo
As consequências não intencionais dessa tecnologia estarão além da imaginação