1 pontos por belhyun 5 시간 전 | Ainda não há comentários. | Compartilhar no WhatsApp

Olá.

Recentemente, criei uma extensão do Chrome que converte automaticamente tarefas realizadas no navegador em um guia do usuário (SOP).

Diferente do método tradicional de gravação de tela, ela coleta eventos de clique e digitação junto com o contexto do DOM e os reconstrói em etapas de trabalho fáceis de entender.

Atualmente, o pipeline é o seguinte.

Browser Recording → DOM Context Extraction → Solar Pro 3 → AI Validation → Word / PDF / Markdown

A parte mais difícil durante a implementação foi definir "até onde considerar algo como uma única etapa".

Se os eventos do navegador forem registrados como estão, eles ficam detalhados demais; por outro lado, se forem mesclados em excesso, a intenção importante do usuário se perde. No momento, a implementação mescla eventos com base em mudanças no DOM, estado de entrada e transições de página; depois, o Solar Pro 3 gera uma descrição em linguagem natural para cada etapa, e a IA valida novamente a ordem e a existência de omissões.

No momento, a implementação vai até a etapa de geração de documentos, e o próximo experimento é usar o manual gerado como um Task Plan estruturado. O objetivo é evoluir de um documento simples para um workflow executável em que um AI Agent possa entender a tarefa, orientar o usuário ou reproduzir tarefas repetitivas no navegador.

Interaction Segmentation e Task Planning ainda estão sendo aprimorados. Gostaria de ouvir o feedback de quem tiver pesquisas relacionadas ou experiência de implementação.

Ainda não há comentários.

Ainda não há comentários.