É um pipeline que cria short-form de apresentação de cães usando apenas vídeos gravados no celular. Ao inserir vários vídeos brutos do celular e um parágrafo de solicitação em linguagem natural, cerca de 4 minutos depois sai um vídeo vertical 9:16 com legendas e narração. Ele foi projetado para que todo o processo, da detecção ao TTS, rode localmente em um único MacBook.
Não é difícil jogar um vídeo em um LLM e gerar uma demo convincente. Em vez disso, defini como objetivo responder a duas perguntas: é possível gerar exatamente o mesmo resultado amanhã, e aquilo que a IA inventou não se mistura com o que foi definido por uma pessoa?
Estrutura
- O LLM apenas interpreta; a execução é determinística. O Gemma (local) faz apenas julgamentos semânticos, como nomes de ações, decomposição de pedidos de edição e observação de cenas, enquanto pixels, frames e timing ficam todos a cargo de Python/OpenCV/ffmpeg. A mesma entrada gera a mesma saída.
- Detecção e rastreamento ficam a cargo de YOLO11 + ByteTrack; reidentificação de múltiplos cães usa embeddings DINOv2 + âncora com foto do tutor; e a avaliação de movimento/estaticidade é feita por medição de resíduos na ROI com compensação do movimento da câmera. Eixos que o LLM estruturalmente não consegue enxergar, como movimento em uma imagem estática, não são delegados ao LLM.
- O TTS é sintetizado localmente com Qwen3-TTS (mlx-audio) e verificado por um gate de CER em ida e volta com Whisper.
- Legendas inventadas pelo LLM têm suas alegações factuais decompostas e confrontadas com registros de observação do vídeo; se não houver evidência, são reescritas. Legendas escritas diretamente pelo usuário não são verificadas.
Como as decisões foram tomadas
- Todas as mudanças de modelo e parâmetros foram decididas por avaliação em um golden set rotulado manualmente.
- Propostas de melhoria que eu acreditava que obviamente melhorariam o resultado foram rejeitadas duas vezes pela avaliação no golden set.
Números
- 148 testes unitários; acurácia 1,00 na classificação de grupos de ações M4
- Redução do tempo de geração do ciclo de vida completo de 8 para 4 minutos.
Limitações
O golden set tem 5 a 9 vídeos, um único domínio e foi desenvolvido por uma pessoa. É rigor metodológico, não validação em escala.
Publiquei em série no blog o processo de desenvolvimento.
Está sob licença MIT. Perguntas sobre levar essa metodologia para outros domínios ou sobre cada decisão são bem-vindas.
Ainda não há comentários.