1 pontos por GN⁺ 2024-05-30 | 1 comentários | Compartilhar no WhatsApp
  • Pesquisadores da Universidade de Washington desenvolveram o sistema Target Speech Hearing, que registra um falante quando o usuário apenas olha para a pessoa por 3 a 5 segundos e, mesmo em ambientes barulhentos, reproduz essa voz em tempo real
  • Os microfones dos dois lados de fones de ouvido disponíveis no mercado funcionam em conjunto com um computador embarcado onboard; quando o usuário aperta um botão e se volta para o falante, o software de aprendizado de máquina aprende o padrão de voz
  • Após o registro, o sistema continua acompanhando a voz mesmo que o ouvinte ou o falante se movam; quanto mais o falante fala, mais dados de treinamento são acumulados, melhorando a capacidade de focar no falante-alvo
  • Em um teste com 21 pessoas, os participantes avaliaram a inteligibilidade da fala do falante registrado como, em média, quase duas vezes maior do que no áudio sem filtragem
  • Atualmente, só é possível registrar uma pessoa por vez; se vozes altas se misturam na mesma direção, o registro se torna difícil, portanto a expansão para earbuds e aparelhos auditivos fica como uma tarefa futura

Como o Target Speech Hearing funciona

  • O Target Speech Hearing da Universidade de Washington é um sistema de IA que permite ao usuário escolher e ouvir apenas a voz de uma pessoa específica em fones de ouvido com cancelamento de ruído
  • O usuário usa fones de ouvido comuns equipados com microfones, vira a cabeça na direção da pessoa que está falando e aperta um botão
    • As ondas sonoras do falante-alvo precisam chegar simultaneamente aos microfones dos dois lados do headset
    • A margem de tolerância é de 16 graus
  • Os fones enviam o sinal coletado para um computador embarcado onboard, e o software de aprendizado de máquina aprende o padrão de voz do falante desejado
  • Quando o registro termina, o sistema reduz os outros sons ao redor e reproduz em tempo real apenas a voz do falante registrado
    • Mesmo que o ouvinte e o falante se movam, ele continua acompanhando a voz registrada
    • Se o falante continuar falando, os dados de treinamento aumentam e o sistema consegue focar melhor no falante-alvo
  • A equipe de pesquisa apresentou os resultados em 14 de maio na ACM CHI Conference on Human Factors in Computing Systems
  • O código do dispositivo de prova de conceito está disponível em LookOnceToHear
  • Este sistema ainda não é um produto comercial

Resultados dos testes e limitações atuais

  • Em um teste com 21 pessoas, os participantes avaliaram a inteligibilidade do falante registrado como, em média, quase duas vezes maior do que no áudio sem filtragem
  • Esta pesquisa se baseia em um trabalho anterior de semantic hearing, no qual o usuário escolhia a categoria de som que queria ouvir e o restante dos sons do ambiente era removido
    • O sistema anterior funcionava escolhendo classes específicas de som, como pássaros ou vozes
    • O TSH se concentra não em uma categoria de som, mas em um único falante registrado
  • Atualmente, o TSH só consegue registrar um falante por vez
  • Se outra voz alta vier da mesma direção que o falante-alvo, não é possível registrar o falante
  • Se o usuário não ficar satisfeito com a qualidade do áudio, pode repetir o processo de registro para o mesmo falante e melhorar a inteligibilidade
  • A equipe de pesquisa pretende, no futuro, expandir o sistema para earbuds e aparelhos auditivos

1 comentários

 
GN⁺ 2024-05-30
Opiniões do Hacker News
  • Se o tamanho diminuir para algo como pequenos protetores auriculares, eu gostaria de usar mesmo sendo uma pessoa sem deficiência auditiva
    Pelo menos, segundo o diagnóstico, disseram que não tenho deficiência auditiva, mas agora fico em dúvida se o método do exame é ruim, se eu sou normal e as outras pessoas só fingem ouvir melhor
    Com amigos ou em encontros, sempre acabamos indo a restaurantes ou bares barulhentos, e é sempre frustrante quando peço para repetirem porque não ouvi, mas repetem no mesmo tom baixo e eu não ouço de novo
    Perder piadas ou comentários de passagem é ainda pior, e vira uma situação do tipo “do que vocês estão rindo? não ouvi, podem repetir umas três vezes?”

    • Em lugares cheios, eu não conseguia entender ninguém e achei que minha audição estava piorando ao chegar à meia-idade
      Mas todos os audiologistas a que fui disseram que minha audição era normal, e acabei marcando consulta com o especialista considerado o melhor da grande região metropolitana, depois de 1 ano de espera
      Depois de um dia inteiro de exames, o especialista disse que tinha “uma notícia boa, uma ruim e uma que era boa e ruim ao mesmo tempo”: a boa era que minha audição era excelente, no nível de uma criança de 5 anos; a ruim era que eu ouvia tão bem que não conseguia separar os sons
      Não era que minha audição tivesse piorado, e sim que a capacidade do cérebro de separar sons havia diminuído; a notícia boa e ruim ao mesmo tempo era que, no fim, minha audição vai se deteriorar como a de todo mundo, então por alguns anos eu vou conseguir ouvir melhor em locais públicos
      Acho que um dos motivos pelos quais esse problema ficou mais grave é que designers de restaurantes e espaços públicos não se preocupam mais com o ambiente sonoro
      A maioria dos bares abertos nos últimos 15 anos tem piso de cimento, quase nenhuma absorção acústica, e parece ter sido projetada com a premissa de que, se seus ouvidos não estiverem zumbindo, você não está se divertindo
      Literalmente não dá para manter uma conversa, então não vou mais a esses lugares
    • Isso não é um problema individual. É uma escolha coletiva de conversar em ambientes onde mal conseguimos nos ouvir
      Em vez de resolver com um aparelho, recomendo encarar o problema como ele é e resolvê-lo do jeito tradicional, dizendo algo como “não ouvi nada, e vocês provavelmente também não. Isso é uma idiotice, vamos sair daqui”
      Esses lugares muitas vezes são projetados para que você sofra se não gritar o tempo todo ou não for insensível ao entorno
      Não entendo por que as pessoas vão lá e ainda gastam dinheiro; eu provavelmente não iria nem se me pagassem
      Não quero substituir o respeito aos limites uns dos outros por um dispositivo de IA
    • Passei a usar fones de condução óssea demais, e acho impressionante como eles são flexíveis nesse tipo de situação
      Dá para ouvir o som do headset mantendo os ouvidos abertos e, quando preciso ouvir com mais clareza, como ao atender uma ligação em um lugar cheio, basta tampar os ouvidos com os dedos
      Isso cria dentro do ouvido um efeito parecido com o de uma caixa acústica, deixando o som da condução óssea mais encorpado, e também bloqueia o ruído externo
      Se precisar de qualidade plena de fones, é só colocar protetores auriculares; eles também são pequenos e menos chamativos
      Não é perfeito, mas gosto do fato de poder alternar suavemente entre “ouvir o headset com os ouvidos abertos” e “bloquear o som e ouvir o headset com muita clareza” usando apenas os dedos ou protetores auriculares
      Seria muito legal acoplar um microfone shotgun ao lado. Isto é, se esse for mesmo o nome de um microfone com ângulo de captação estreito
    • Existem esses protetores auriculares direcionais passivos
      https://www.flareaudio.com/pages/earhd
    • Tenho transtorno do processamento auditivo, então minha audição em si é realmente boa, mas a sensação é que a voz de alguém falando comigo recebe uma prioridade de interpretação muito menor do que qualquer ruído ao redor
      Quando consigo ver os lábios, isso ajuda muito a interpretar a fala com mais precisão, mesmo que eu não saiba ler lábios
      Toda vez que eu pesquisava sobre isso, acabava chegando a associações com autismo ou TDAH, e em 2008, antes de receber um diagnóstico, eu meio que ignorava essa ideia
      Hoje tenho diagnóstico de AuDHD
  • O que os leitores do HN precisam saber é o quanto aparelhos auditivos são caros e ruins
    Se você pesquisar os preços, até aparelhos auditivos básicos do tipo “aumentar o volume do som” são absurdamente caros
    O pior é que, por interferirem no ouvido, é fácil perder a capacidade de “direcionar” a audição
    Ou seja, fica difícil filtrar outras conversas, ruídos etc.
    Um bom subproduto do processo em que o Facebook despejou bilhões de dólares em algo provavelmente quase inútil, tentando encontrar uma AR prática e popular, é https://www.projectaria.com/glasses/
    É uma plataforma relativamente barata para experimentar interações no estilo de AR e, como tem rastreamento ocular, matriz de microfones e câmera frontal, pode ser modificada com bastante facilidade para virar um microfone direcionável

    • Aparelhos auditivos modernos são bem legais. Eles colocam uma quantidade surpreendente de recursos em um formato minúsculo, e a bateria dura uma semana mesmo usando Bluetooth
      Meus aparelhos auditivos Phonak alternam programas automaticamente até certo ponto, e também dá para fazer ajustes finos pelo app complementar
      Eles funcionam razoavelmente em ambientes barulhentos e me permitem conversar, algo que seria impossível com aparelhos auditivos de uns 10 anos atrás, então sou muito grato
      O par custa por volta de 2000 dólares e, felizmente, é coberto pelo sistema nacional de saúde, então pago só 50 dólares mais ou menos uma vez a cada 5 anos. Claro que isso também sai dos impostos
      Espero que os avanços em “IA” permitam ir além da simples amplificação e filtragem, separando, reforçando ou reconstruindo vozes em ambientes barulhentos
      Por outro lado, queria que desaparecesse a moda de colocar música cada vez mais alta em cafés, restaurantes e bares. É um pesadelo de acessibilidade, especialmente para pessoas com perda auditiva, mas também para as outras
      0: https://www.socialstyrelsen.se/en/about-us/healthcare-for-vi...
      1: https://www.vox.com/2018/4/18/17168504/restaurants-noise-lev...
    • O preço alto não é um problema de tecnologia, é um problema antitruste
      Um pequeno cartel controla a oferta, criando incentivo para maximizar lucros em vez de competir com tecnologia melhor
      (0) https://www.thebignewsletter.com/p/silencing-the-competition...
    • O único conselho sobre aparelhos auditivos é: se você precisa deles, faça o diagnóstico e intervenha cedo
      Assim você consegue aparelhos auditivos que se ajustem bem a você, sejam os mais baratos e confiáveis
      Caso contrário, a perda sensorial começa a causar o problema de filtragem de atenção mencionado acima
      Quanto mais tempo você evita a correção auditiva depois que a audição começa a piorar, mais complexos e caros precisam ser os aparelhos para compensar de novo
      Isso porque os aparelhos auditivos caros fazem uma aproximação ruim do trabalho que, antes da perda sensorial, era feito pelo cérebro e pelo córtex auditivo
      Espera aí, preciso ir marcar um exame de audição
    • Minha avó também tinha todas essas coisas
      Quando ela ainda era viva, cheguei a pensar em criar algo parecido ao tentar conversar com ela em eventos de família ou lugares públicos
      Acho que o motivo de serem caros é a relação com empresas médicas e de saúde, além dos custos maiores por conformidade regulatória
      Por exemplo, o mesmo display pode ficar várias vezes mais caro se tiver certificação para uso em instalações médicas
    • É caro, sim. Meus aparelhos auditivos custaram cerca de 2500 dólares canadenses cada lado, mas dizer que aparelhos auditivos são ruins não bate com a minha experiência
      Meus aparelhos auditivos Widex são excelentes. Em situações normais, a qualidade do som é fantástica
      A única reclamação real é que eles não são totalmente à prova d’água, então preciso me planejar um pouco antes de sair em dias de chuva
  • Como pessoa com deficiência auditiva, esse tipo de recurso parece realmente uma dádiva dos céus
    Esse recurso deveria ser integrado aos aparelhos auditivos o mais rápido possível. Cale a boca — quer dizer, na verdade continue falando, eu pago

    • Se vivermos o suficiente, a maioria de nós vai acabar chegando ao ponto em que você está agora
      Se for possível isolar vozes individuais, dá para enviá-las ao reconhecimento de fala e colocar legendas em conversas reais. Isso é útil quando a audição piora ainda mais ou desaparece completamente
      Mas a latência de ida e volta para a nuvem pode reduzir muito a utilidade ou tornar tudo inútil, então precisamos mesmo de dispositivos móveis capazes de processar localmente
    • Também tenho perda auditiva neurossensorial, e os Bose Hearphones têm recursos parecidos, como cancelamento de ruído direcional, que ajudam bastante
      Eles foram descontinuados, mas ainda dá para encontrar unidades recondicionadas
    • Vale a pena olhar o que a Luxottica está fazendo nessa área
      Óculos vestíveis são bem promissores para o caso de uso mencionado, porque evitam o volume e a impressão de grosseria de usar fones de ouvido ao conversar com alguém

      https://www.cnet.com/health/medical/what-did-you-say-these-e...

  • Uma forma mais avançada disso provavelmente ajudaria bastante com meu zumbido também
    Quando uma pessoa está falando, consigo ouvi-la bem mesmo que fale baixo ou esteja longe, mas, se várias pessoas falam ou há música, não ouço nada

    • Eu também sou parecido. Tenho um pouco de zumbido tipo chiado de rádio em baixa frequência, e conversar em lugares barulhentos, com ruído de fundo e muitas conversas, é difícil
      Quando sento em um bar barulhento, é quase impossível entender o que qualquer pessoa está dizendo, exceto as duas mais próximas
      Conversas em ambientes comuns geralmente não são problema
      Por isso, um recurso que reforçasse a fala da pessoa para quem estou olhando seria realmente incrível
      Os Apple AirPods já têm ajuste de som que reage ao ambiente e ao modo, e também oferecem reforço de uma voz específica quando você coloca o celular na frente de quem está falando
      Se os AirPods passarem a oferecer reforço direcional de voz diretamente, como nesta pesquisa, isso ajudaria muito as interações sociais em lugares barulhentos
  • Código: https://github.com/vb000/LookOnceToHear

  • Parece mais provável que tenha sucesso comercial para o uso oposto
    Imagine poder silenciar apenas aquela pessoa que fala alto demais com uma voz irritante numa festa

    • Se for pensar em algo que possa ser vendido em grande escala de verdade, talvez seja preciso considerar uma “festa” em escala maior
      Em shows, é comum usar protetores auriculares para não destruir os ouvidos; imagine trocar isso por fones in-ear que filtram tudo, deixando apenas o show e as vozes de familiares e amigos
      O volume também poderia ser ajustado: quando seu cônjuge falar, só a voz dele ficaria mais alta por cima dos outros sons, enquanto o ruído da multidão permaneceria para manter a atmosfera, mas as conversas comuns das pessoas ao redor seriam removidas
      Não sou especialista em machine learning ou IA, mas entendo que isso não é impossível com a tecnologia atual
      Haveria limitações de bateria e energia, mas, num show, também faria sentido usar fones com uma faixa passando por trás da cabeça para prendê-los e não perdê-los se caírem
      Seria necessário treinar “a sua voz”, mas se a Alexa consegue fazer isso em 10 segundos, um app de celular também deve conseguir
      Se saísse por menos de 200 euros para usar no cinema, eu compraria agora mesmo e talvez até voltasse a ir ao cinema
    • A função de silenciar pessoas seletivamente apareceu em alguns episódios de Black Mirror
    • Acho que este foi o meu momento mais forte de “ah, devo estar ficando velho”
      As pessoas usam fones em festas?
    • Quando há alguém rindo alto a ponto de doer mesmo a 15 pés de distância, e rindo sem parar três vezes por minuto, isso enlouquece qualquer um
      Se houvesse uma forma de filtrar esse tipo de pessoa, eu certamente ficaria grato
    • O uso criminoso de escutar conversas alheias às escondidas também pode ser bastante útil
  • Trabalhei na Sonos há um tempo, bem antes do desastre atual da atualização do app e do lançamento dos fones
    Na primeira tentativa cancelada de desenvolver um produto de fones, avaliamos uma função conceitual parecida: deixar passar seletivamente apenas a voz de uma pessoa específica por meio do chipset de cancelamento ativo de ruído
    Não me lembro exatamente de qual abordagem o pessoal de DSP usou. Eu estava mais próximo do hardware de cancelamento ativo de ruído
    Mas, na prática, o que eles conseguiam separar era apenas a voz do próprio usuário, porque esse sinal era mais forte do que todos os outros sons
    Isso é realmente muito legal. Fico curioso para ver que outras coisas interessantes ainda podem ser feitas com fones
    Chipsets de cancelamento ativo de ruído são incrivelmente poderosos, e acho que ainda falta muito para que esse potencial seja totalmente explorado

    • Mais ou menos uma vez por ano, desperdiço cerca de um dia procurando earbuds que me permitam trabalhar em ambientes barulhentos sem que esse ruído seja transmitido para chamadas ou reuniões
      Ainda não encontrei um produto adequado
      O cancelamento de ruído do lado de quem escuta parece ter sido resolvido com isolamento acústico e cancelamento ativo de ruído, mas seria ótimo surgir uma combinação de hardware e software que separasse apenas a minha voz para quem está do outro lado e bloqueasse o ruído, possibilitando trabalho remoto de verdade
    • Eu definitivamente não quero aparelhos auditivos da Sonos
      Os produtos da Sonos, de modo geral, têm problemas em funcionalidades básicas; por exemplo, quando o Wi-Fi cai e volta, eles não conseguem se reconectar, especialmente se o canal do Wi-Fi mudar nesse intervalo
      A solução “técnica” é tirar da tomada e reiniciar, o que nem dá para fazer remotamente
      Mesmo quando está conectado ao Wi-Fi e eu quero reiniciar porque o Spotify Connect da Sonos é absurdamente cheio de bugs, isso é impossível
      Até com um esp ou algum módulo TI parecido dá para manter a conexão Wi-Fi e fazer reconectar sempre; será que é tão difícil assim para os desenvolvedores de firmware da Sonos fazerem algo tão básico?
    • Lendo o artigo, nada mudou
      Ainda depende da condição de que não haja som ou voz concorrente na mesma posição do falante-alvo
  • O código open source está em https://github.com/vb000/LookOnceToHear, e o artigo está em https://arxiv.org/abs/2405.06289
    Então talvez não seja algo tão distante assim, como em muitos artigos de divulgação científica
    Se alguém conseguir fazer funcionar de forma independente, gostaria de ouvir os resultados

  • Tenho dificuldade para ouvir alguém falando em uma sala cheia, e acho que é porque minha mente tenta captar todos os sons; isso poderia realmente me ajudar muito. Imagino que seja por causa do ADHD
    Seria incrível se houvesse uma forma de reduzir bastante todos os sons que não fossem a voz da pessoa com quem estou conversando

    • Eu pagaria caro se viesse em um formato discreto como os AirPods
      Espero que seja só uma questão de tempo até os próprios AirPods conseguirem fazer isso algum dia
    • Tenho o mesmo problema. Minha audição é boa, mas conversar com pessoas em um clube ou café movimentado é quase impossível
      Esse recurso seria uma bênção para mim
    • Não conheço muito sobre ADHD ou autismo, mas acho que tenho algum grau de traços autistas, e esse problema é realmente grave
      Em testes auditivos com pequenos bipes, meu resultado é bom, mas tenho muita dificuldade para processar o que as pessoas dizem, especialmente em ambientes cheios
      Meu pai tem o mesmo problema
  • É um recurso potencial de que eu nem sabia que precisava
    Uso fones com cancelamento ativo de ruído em casa o tempo todo, e seria muito útil se a voz da minha parceira passasse automaticamente

    • O oposto também seria bom: a função de deixar silenciosa apenas uma fonte específica
      Provavelmente não a parceira, mas talvez…
    • Cancelamento ativo de ruído não bloqueia vozes
      Se a voz da sua parceira soa fraca e mal chega aos seus ouvidos, provavelmente é por causa do isolamento passivo dos fones
      Ou talvez seja simplesmente a música que você está ouvindo mascarando a voz
      O cancelamento ativo de ruído só bloqueia a voz da parceira se essa voz estiver misturada ao ruído de fundo com tom e volume semelhantes, tornando-se algo como ruído branco ou ruído colorido, e o cancelamento ativo de ruído conseguir suprimir o conjunto
    • Tenho a sensação de que usar cancelamento ativo de ruído em excesso acabará trazendo efeitos colaterais físicos ou fisiológicos em breve, ou algum dia