1 pontos por catch88 7 시간 전 | Ainda não há comentários. | Compartilhar no WhatsApp

Eu não queria deixar uma aba do Telegram aberta o dia inteiro para conversar com um agente local (Hermes/OpenClaw), então criei um avatar para ocupar esse lugar. São duas janelas no estilo videochamada que ficam no monitor (avatar + chat), fazendo com que as respostas do agente sejam "encenadas", em vez de apenas lidas.

  • Não usa GPU em tempo de execução para o avatar. Em vez de inferência em tempo real, ele escolhe e reproduz cerca de 30 clipes pré-renderizados conforme as tags de emoção da saída do LLM. Se for [working], ele coloca óculos e faz anotações; na tag [confirm], aparecem opções de aprovar/cancelar para perguntar antes de uma ação irreversível; código/logs não são lidos em voz alta, mas renderizados como cartões. A GPU fica totalmente reservada para o modelo.

  • Não substitui o agente; conecta-se a ele como um conector. A arquitetura faz o gateway discar para fora para um WebSocket local aberto pelo app, então, do ponto de vista do agente, é apenas mais um canal. O menu de comandos slash do agente também é recebido e exibido como está.

  • Voz bidirecional: Edge TTS (substituível por um mecanismo local) + Silero VAD·faster-whisper.

  • Open core (MIT). Inclui um avatar inicial gratuito, então basta clonar para rodar imediatamente. Como esse avatar em si foi criado apenas com ferramentas locais gratuitas (Animagine XL → HunyuanVideo 1.5 i2v), ele também serve como exemplo que comprova que o método de criação descrito na documentação realmente funciona.

O que aprendi durante o desenvolvimento: é mais difícil do que eu esperava fazer modelos de difusão de vídeo gerarem microexpressões via prompt. O Wan 2.2 5B conseguia um sorriso com a boca bem aberta, mas emoções expressas pelas sobrancelhas, como "preocupado" ou "com raiva", saíam simplesmente sem expressão; ao trocar para o HunyuanVideo 1.5 (destilação em etapas, 8,3B), na mesma placa de 12 GB ele ficou mais rápido e as expressões também saíram corretamente.

No momento, há apenas build para Windows, e não há lip sync em tempo real (um trade-off da abordagem pré-renderizada).

Ainda não há comentários.

Ainda não há comentários.