3 pontos por chessire 3 시간 전 | Ainda não há comentários. | Compartilhar no WhatsApp

É um pipeline que cria short-form de apresentação de cães usando apenas vídeos gravados no celular. Ao inserir vários vídeos brutos do celular e um parágrafo de solicitação em linguagem natural, cerca de 4 minutos depois sai um vídeo vertical 9:16 com legendas e narração. Ele foi projetado para que todo o processo, da detecção ao TTS, rode localmente em um único MacBook.

Vídeo de demonstração

Não é difícil jogar um vídeo em um LLM e gerar uma demo convincente. Em vez disso, defini como objetivo responder a duas perguntas: é possível gerar exatamente o mesmo resultado amanhã, e aquilo que a IA inventou não se mistura com o que foi definido por uma pessoa?

Estrutura

  • O LLM apenas interpreta; a execução é determinística. O Gemma (local) faz apenas julgamentos semânticos, como nomes de ações, decomposição de pedidos de edição e observação de cenas, enquanto pixels, frames e timing ficam todos a cargo de Python/OpenCV/ffmpeg. A mesma entrada gera a mesma saída.
  • Detecção e rastreamento ficam a cargo de YOLO11 + ByteTrack; reidentificação de múltiplos cães usa embeddings DINOv2 + âncora com foto do tutor; e a avaliação de movimento/estaticidade é feita por medição de resíduos na ROI com compensação do movimento da câmera. Eixos que o LLM estruturalmente não consegue enxergar, como movimento em uma imagem estática, não são delegados ao LLM.
  • O TTS é sintetizado localmente com Qwen3-TTS (mlx-audio) e verificado por um gate de CER em ida e volta com Whisper.
  • Legendas inventadas pelo LLM têm suas alegações factuais decompostas e confrontadas com registros de observação do vídeo; se não houver evidência, são reescritas. Legendas escritas diretamente pelo usuário não são verificadas.

Como as decisões foram tomadas

  • Todas as mudanças de modelo e parâmetros foram decididas por avaliação em um golden set rotulado manualmente.
  • Propostas de melhoria que eu acreditava que obviamente melhorariam o resultado foram rejeitadas duas vezes pela avaliação no golden set.

Números

  • 148 testes unitários; acurácia 1,00 na classificação de grupos de ações M4
  • Redução do tempo de geração do ciclo de vida completo de 8 para 4 minutos.

Limitações
O golden set tem 5 a 9 vídeos, um único domínio e foi desenvolvido por uma pessoa. É rigor metodológico, não validação em escala.

Publiquei em série no blog o processo de desenvolvimento.
Está sob licença MIT. Perguntas sobre levar essa metodologia para outros domínios ou sobre cada decisão são bem-vindas.

Ainda não há comentários.

Ainda não há comentários.