- Pesquisadores da Universidade de Washington desenvolveram o sistema Target Speech Hearing, que registra um falante quando o usuário apenas olha para a pessoa por 3 a 5 segundos e, mesmo em ambientes barulhentos, reproduz essa voz em tempo real
- Os microfones dos dois lados de fones de ouvido disponíveis no mercado funcionam em conjunto com um computador embarcado onboard; quando o usuário aperta um botão e se volta para o falante, o software de aprendizado de máquina aprende o padrão de voz
- Após o registro, o sistema continua acompanhando a voz mesmo que o ouvinte ou o falante se movam; quanto mais o falante fala, mais dados de treinamento são acumulados, melhorando a capacidade de focar no falante-alvo
- Em um teste com 21 pessoas, os participantes avaliaram a inteligibilidade da fala do falante registrado como, em média, quase duas vezes maior do que no áudio sem filtragem
- Atualmente, só é possível registrar uma pessoa por vez; se vozes altas se misturam na mesma direção, o registro se torna difícil, portanto a expansão para earbuds e aparelhos auditivos fica como uma tarefa futura
Como o Target Speech Hearing funciona
- O Target Speech Hearing da Universidade de Washington é um sistema de IA que permite ao usuário escolher e ouvir apenas a voz de uma pessoa específica em fones de ouvido com cancelamento de ruído
- O usuário usa fones de ouvido comuns equipados com microfones, vira a cabeça na direção da pessoa que está falando e aperta um botão
- As ondas sonoras do falante-alvo precisam chegar simultaneamente aos microfones dos dois lados do headset
- A margem de tolerância é de 16 graus
- Os fones enviam o sinal coletado para um computador embarcado onboard, e o software de aprendizado de máquina aprende o padrão de voz do falante desejado
- Quando o registro termina, o sistema reduz os outros sons ao redor e reproduz em tempo real apenas a voz do falante registrado
- Mesmo que o ouvinte e o falante se movam, ele continua acompanhando a voz registrada
- Se o falante continuar falando, os dados de treinamento aumentam e o sistema consegue focar melhor no falante-alvo
- A equipe de pesquisa apresentou os resultados em 14 de maio na ACM CHI Conference on Human Factors in Computing Systems
- O código do dispositivo de prova de conceito está disponível em LookOnceToHear
- Este sistema ainda não é um produto comercial
Resultados dos testes e limitações atuais
- Em um teste com 21 pessoas, os participantes avaliaram a inteligibilidade do falante registrado como, em média, quase duas vezes maior do que no áudio sem filtragem
- Esta pesquisa se baseia em um trabalho anterior de semantic hearing, no qual o usuário escolhia a categoria de som que queria ouvir e o restante dos sons do ambiente era removido
- O sistema anterior funcionava escolhendo classes específicas de som, como pássaros ou vozes
- O TSH se concentra não em uma categoria de som, mas em um único falante registrado
- Atualmente, o TSH só consegue registrar um falante por vez
- Se outra voz alta vier da mesma direção que o falante-alvo, não é possível registrar o falante
- Se o usuário não ficar satisfeito com a qualidade do áudio, pode repetir o processo de registro para o mesmo falante e melhorar a inteligibilidade
- A equipe de pesquisa pretende, no futuro, expandir o sistema para earbuds e aparelhos auditivos
1 comentários
Opiniões do Hacker News
Se o tamanho diminuir para algo como pequenos protetores auriculares, eu gostaria de usar mesmo sendo uma pessoa sem deficiência auditiva
Pelo menos, segundo o diagnóstico, disseram que não tenho deficiência auditiva, mas agora fico em dúvida se o método do exame é ruim, se eu sou normal e as outras pessoas só fingem ouvir melhor
Com amigos ou em encontros, sempre acabamos indo a restaurantes ou bares barulhentos, e é sempre frustrante quando peço para repetirem porque não ouvi, mas repetem no mesmo tom baixo e eu não ouço de novo
Perder piadas ou comentários de passagem é ainda pior, e vira uma situação do tipo “do que vocês estão rindo? não ouvi, podem repetir umas três vezes?”
Mas todos os audiologistas a que fui disseram que minha audição era normal, e acabei marcando consulta com o especialista considerado o melhor da grande região metropolitana, depois de 1 ano de espera
Depois de um dia inteiro de exames, o especialista disse que tinha “uma notícia boa, uma ruim e uma que era boa e ruim ao mesmo tempo”: a boa era que minha audição era excelente, no nível de uma criança de 5 anos; a ruim era que eu ouvia tão bem que não conseguia separar os sons
Não era que minha audição tivesse piorado, e sim que a capacidade do cérebro de separar sons havia diminuído; a notícia boa e ruim ao mesmo tempo era que, no fim, minha audição vai se deteriorar como a de todo mundo, então por alguns anos eu vou conseguir ouvir melhor em locais públicos
Acho que um dos motivos pelos quais esse problema ficou mais grave é que designers de restaurantes e espaços públicos não se preocupam mais com o ambiente sonoro
A maioria dos bares abertos nos últimos 15 anos tem piso de cimento, quase nenhuma absorção acústica, e parece ter sido projetada com a premissa de que, se seus ouvidos não estiverem zumbindo, você não está se divertindo
Literalmente não dá para manter uma conversa, então não vou mais a esses lugares
Em vez de resolver com um aparelho, recomendo encarar o problema como ele é e resolvê-lo do jeito tradicional, dizendo algo como “não ouvi nada, e vocês provavelmente também não. Isso é uma idiotice, vamos sair daqui”
Esses lugares muitas vezes são projetados para que você sofra se não gritar o tempo todo ou não for insensível ao entorno
Não entendo por que as pessoas vão lá e ainda gastam dinheiro; eu provavelmente não iria nem se me pagassem
Não quero substituir o respeito aos limites uns dos outros por um dispositivo de IA
Dá para ouvir o som do headset mantendo os ouvidos abertos e, quando preciso ouvir com mais clareza, como ao atender uma ligação em um lugar cheio, basta tampar os ouvidos com os dedos
Isso cria dentro do ouvido um efeito parecido com o de uma caixa acústica, deixando o som da condução óssea mais encorpado, e também bloqueia o ruído externo
Se precisar de qualidade plena de fones, é só colocar protetores auriculares; eles também são pequenos e menos chamativos
Não é perfeito, mas gosto do fato de poder alternar suavemente entre “ouvir o headset com os ouvidos abertos” e “bloquear o som e ouvir o headset com muita clareza” usando apenas os dedos ou protetores auriculares
Seria muito legal acoplar um microfone shotgun ao lado. Isto é, se esse for mesmo o nome de um microfone com ângulo de captação estreito
https://www.flareaudio.com/pages/earhd
Quando consigo ver os lábios, isso ajuda muito a interpretar a fala com mais precisão, mesmo que eu não saiba ler lábios
Toda vez que eu pesquisava sobre isso, acabava chegando a associações com autismo ou TDAH, e em 2008, antes de receber um diagnóstico, eu meio que ignorava essa ideia
Hoje tenho diagnóstico de AuDHD
O que os leitores do HN precisam saber é o quanto aparelhos auditivos são caros e ruins
Se você pesquisar os preços, até aparelhos auditivos básicos do tipo “aumentar o volume do som” são absurdamente caros
O pior é que, por interferirem no ouvido, é fácil perder a capacidade de “direcionar” a audição
Ou seja, fica difícil filtrar outras conversas, ruídos etc.
Um bom subproduto do processo em que o Facebook despejou bilhões de dólares em algo provavelmente quase inútil, tentando encontrar uma AR prática e popular, é https://www.projectaria.com/glasses/
É uma plataforma relativamente barata para experimentar interações no estilo de AR e, como tem rastreamento ocular, matriz de microfones e câmera frontal, pode ser modificada com bastante facilidade para virar um microfone direcionável
Meus aparelhos auditivos Phonak alternam programas automaticamente até certo ponto, e também dá para fazer ajustes finos pelo app complementar
Eles funcionam razoavelmente em ambientes barulhentos e me permitem conversar, algo que seria impossível com aparelhos auditivos de uns 10 anos atrás, então sou muito grato
O par custa por volta de 2000 dólares e, felizmente, é coberto pelo sistema nacional de saúde, então pago só 50 dólares mais ou menos uma vez a cada 5 anos. Claro que isso também sai dos impostos
Espero que os avanços em “IA” permitam ir além da simples amplificação e filtragem, separando, reforçando ou reconstruindo vozes em ambientes barulhentos
Por outro lado, queria que desaparecesse a moda de colocar música cada vez mais alta em cafés, restaurantes e bares. É um pesadelo de acessibilidade, especialmente para pessoas com perda auditiva, mas também para as outras
0: https://www.socialstyrelsen.se/en/about-us/healthcare-for-vi...
1: https://www.vox.com/2018/4/18/17168504/restaurants-noise-lev...
Um pequeno cartel controla a oferta, criando incentivo para maximizar lucros em vez de competir com tecnologia melhor
(0) https://www.thebignewsletter.com/p/silencing-the-competition...
Assim você consegue aparelhos auditivos que se ajustem bem a você, sejam os mais baratos e confiáveis
Caso contrário, a perda sensorial começa a causar o problema de filtragem de atenção mencionado acima
Quanto mais tempo você evita a correção auditiva depois que a audição começa a piorar, mais complexos e caros precisam ser os aparelhos para compensar de novo
Isso porque os aparelhos auditivos caros fazem uma aproximação ruim do trabalho que, antes da perda sensorial, era feito pelo cérebro e pelo córtex auditivo
Espera aí, preciso ir marcar um exame de audição
Quando ela ainda era viva, cheguei a pensar em criar algo parecido ao tentar conversar com ela em eventos de família ou lugares públicos
Acho que o motivo de serem caros é a relação com empresas médicas e de saúde, além dos custos maiores por conformidade regulatória
Por exemplo, o mesmo display pode ficar várias vezes mais caro se tiver certificação para uso em instalações médicas
Meus aparelhos auditivos Widex são excelentes. Em situações normais, a qualidade do som é fantástica
A única reclamação real é que eles não são totalmente à prova d’água, então preciso me planejar um pouco antes de sair em dias de chuva
Como pessoa com deficiência auditiva, esse tipo de recurso parece realmente uma dádiva dos céus
Esse recurso deveria ser integrado aos aparelhos auditivos o mais rápido possível. Cale a boca — quer dizer, na verdade continue falando, eu pago
Se for possível isolar vozes individuais, dá para enviá-las ao reconhecimento de fala e colocar legendas em conversas reais. Isso é útil quando a audição piora ainda mais ou desaparece completamente
Mas a latência de ida e volta para a nuvem pode reduzir muito a utilidade ou tornar tudo inútil, então precisamos mesmo de dispositivos móveis capazes de processar localmente
Eles foram descontinuados, mas ainda dá para encontrar unidades recondicionadas
Óculos vestíveis são bem promissores para o caso de uso mencionado, porque evitam o volume e a impressão de grosseria de usar fones de ouvido ao conversar com alguém
Uma forma mais avançada disso provavelmente ajudaria bastante com meu zumbido também
Quando uma pessoa está falando, consigo ouvi-la bem mesmo que fale baixo ou esteja longe, mas, se várias pessoas falam ou há música, não ouço nada
Quando sento em um bar barulhento, é quase impossível entender o que qualquer pessoa está dizendo, exceto as duas mais próximas
Conversas em ambientes comuns geralmente não são problema
Por isso, um recurso que reforçasse a fala da pessoa para quem estou olhando seria realmente incrível
Os Apple AirPods já têm ajuste de som que reage ao ambiente e ao modo, e também oferecem reforço de uma voz específica quando você coloca o celular na frente de quem está falando
Se os AirPods passarem a oferecer reforço direcional de voz diretamente, como nesta pesquisa, isso ajudaria muito as interações sociais em lugares barulhentos
Código: https://github.com/vb000/LookOnceToHear
Parece mais provável que tenha sucesso comercial para o uso oposto
Imagine poder silenciar apenas aquela pessoa que fala alto demais com uma voz irritante numa festa
Em shows, é comum usar protetores auriculares para não destruir os ouvidos; imagine trocar isso por fones in-ear que filtram tudo, deixando apenas o show e as vozes de familiares e amigos
O volume também poderia ser ajustado: quando seu cônjuge falar, só a voz dele ficaria mais alta por cima dos outros sons, enquanto o ruído da multidão permaneceria para manter a atmosfera, mas as conversas comuns das pessoas ao redor seriam removidas
Não sou especialista em machine learning ou IA, mas entendo que isso não é impossível com a tecnologia atual
Haveria limitações de bateria e energia, mas, num show, também faria sentido usar fones com uma faixa passando por trás da cabeça para prendê-los e não perdê-los se caírem
Seria necessário treinar “a sua voz”, mas se a Alexa consegue fazer isso em 10 segundos, um app de celular também deve conseguir
Se saísse por menos de 200 euros para usar no cinema, eu compraria agora mesmo e talvez até voltasse a ir ao cinema
As pessoas usam fones em festas?
Se houvesse uma forma de filtrar esse tipo de pessoa, eu certamente ficaria grato
Trabalhei na Sonos há um tempo, bem antes do desastre atual da atualização do app e do lançamento dos fones
Na primeira tentativa cancelada de desenvolver um produto de fones, avaliamos uma função conceitual parecida: deixar passar seletivamente apenas a voz de uma pessoa específica por meio do chipset de cancelamento ativo de ruído
Não me lembro exatamente de qual abordagem o pessoal de DSP usou. Eu estava mais próximo do hardware de cancelamento ativo de ruído
Mas, na prática, o que eles conseguiam separar era apenas a voz do próprio usuário, porque esse sinal era mais forte do que todos os outros sons
Isso é realmente muito legal. Fico curioso para ver que outras coisas interessantes ainda podem ser feitas com fones
Chipsets de cancelamento ativo de ruído são incrivelmente poderosos, e acho que ainda falta muito para que esse potencial seja totalmente explorado
Ainda não encontrei um produto adequado
O cancelamento de ruído do lado de quem escuta parece ter sido resolvido com isolamento acústico e cancelamento ativo de ruído, mas seria ótimo surgir uma combinação de hardware e software que separasse apenas a minha voz para quem está do outro lado e bloqueasse o ruído, possibilitando trabalho remoto de verdade
Os produtos da Sonos, de modo geral, têm problemas em funcionalidades básicas; por exemplo, quando o Wi-Fi cai e volta, eles não conseguem se reconectar, especialmente se o canal do Wi-Fi mudar nesse intervalo
A solução “técnica” é tirar da tomada e reiniciar, o que nem dá para fazer remotamente
Mesmo quando está conectado ao Wi-Fi e eu quero reiniciar porque o Spotify Connect da Sonos é absurdamente cheio de bugs, isso é impossível
Até com um esp ou algum módulo TI parecido dá para manter a conexão Wi-Fi e fazer reconectar sempre; será que é tão difícil assim para os desenvolvedores de firmware da Sonos fazerem algo tão básico?
Ainda depende da condição de que não haja som ou voz concorrente na mesma posição do falante-alvo
O código open source está em https://github.com/vb000/LookOnceToHear, e o artigo está em https://arxiv.org/abs/2405.06289
Então talvez não seja algo tão distante assim, como em muitos artigos de divulgação científica
Se alguém conseguir fazer funcionar de forma independente, gostaria de ouvir os resultados
Tenho dificuldade para ouvir alguém falando em uma sala cheia, e acho que é porque minha mente tenta captar todos os sons; isso poderia realmente me ajudar muito. Imagino que seja por causa do ADHD
Seria incrível se houvesse uma forma de reduzir bastante todos os sons que não fossem a voz da pessoa com quem estou conversando
Espero que seja só uma questão de tempo até os próprios AirPods conseguirem fazer isso algum dia
Esse recurso seria uma bênção para mim
Em testes auditivos com pequenos bipes, meu resultado é bom, mas tenho muita dificuldade para processar o que as pessoas dizem, especialmente em ambientes cheios
Meu pai tem o mesmo problema
É um recurso potencial de que eu nem sabia que precisava
Uso fones com cancelamento ativo de ruído em casa o tempo todo, e seria muito útil se a voz da minha parceira passasse automaticamente
Provavelmente não a parceira, mas talvez…
Se a voz da sua parceira soa fraca e mal chega aos seus ouvidos, provavelmente é por causa do isolamento passivo dos fones
Ou talvez seja simplesmente a música que você está ouvindo mascarando a voz
O cancelamento ativo de ruído só bloqueia a voz da parceira se essa voz estiver misturada ao ruído de fundo com tom e volume semelhantes, tornando-se algo como ruído branco ou ruído colorido, e o cancelamento ativo de ruído conseguir suprimir o conjunto