1 pontos por GN⁺ 2 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • Reúne guias práticos e exemplos para implementar aplicações com Claude, cobrindo amplamente desde a construção de agentes até RAG, uso de ferramentas, multimodalidade e avaliação
  • Os exemplos de Claude Agent SDK e Managed Agents incluem padrões operacionais como coordenação multiagente, gestão de sessões, implantação, resposta a incidentes, detecção de vulnerabilidades e memória do usuário
  • Oferece memória e compressão de contexto para agentes de longa duração, chamadas programáticas de ferramentas, busca de ferramentas baseada em embeddings e técnicas de subagentes assíncronos
  • É possível conferir exemplos de implementação não só para RAG, geração de SQL, grafos de conhecimento, resumo de documentos e processamento de imagem e áudio, mas também para avaliação, custos, observabilidade e guardrails
  • Abrange implantação com Docker, Modal e Kubernetes, versionamento e rollback de prompts, aprovação humana e análise de custos, podendo ser usado em todo o ciclo de desenvolvimento e operação em produção

Avaliação de agentes e guardrails

Padrões de multiagentes e workflows

  • Orquestração assíncrona de multiagentes: aborda a estrutura de mensagens e ciclo de vida de uma equipe fixa de N agentes que troca mensagens em um hub compartilhado e de subagentes assíncronos criados dinamicamente
  • Multiagentes: coordenação de uma equipe de especialistas: um coordenador lidera um pesquisador de busca na web, um responsável por arquivos e um responsável por preços baseado em regras para redigir uma proposta comercial
    • Inclui o campo multiagent, eventos thread_created e thread_message_received, e limitação de escopo de ferramentas por função
  • Outcomes: agentes que verificam o próprio trabalho: um redator cria um resumo de pesquisa com citações, depois um avaliador stateless verifica URLs e citações e faz correções até passar, formando um loop de avaliação e melhoria
    • Aborda user.define_outcome, eventos span.outcome_evaluation_* e como escrever critérios de avaliação que o avaliador pode executar
  • Workflows básicos: oferece três padrões multi-LLM que trocam custo ou latência por desempenho
  • Avaliador-otimizador: uma LLM gera o resultado e outra LLM fornece feedback de avaliação em uma estrutura iterativa
  • Orquestrador-trabalhadores: uma LLM central delega tarefas dinamicamente e sintetiza os resultados das LLMs trabalhadoras
  • Usando Haiku como subagente: subagentes Haiku extraem relatórios financeiros e o Opus sintetiza os resultados

Claude Agent SDK

  • Agente de pesquisa em uma linha: cria um agente de pesquisa autônomo com Claude Code SDK e WebSearch
  • Agente chief of staff: cria um sistema multiagente com subagentes, hooks, estilo de saída e modo de planejamento
  • Agente de observabilidade: conecta agentes a sistemas externos com um servidor MCP para lidar com monitoramento do GitHub e workflows de CI
  • Agente de confiabilidade de site: diagnostica e recupera incidentes com ferramentas MCP de leitura e escrita, além de redigir relatórios postmortem
  • Migrando do OpenAI Agents SDK: usando um agente de aprovação de custos como exemplo, mapeia ferramentas, guardrails, sessões e handoffs para os elementos básicos do Claude Agent SDK
  • Construindo um navegador de sessões: lista e abre sessões do Agent SDK no disco, além de renomear, etiquetar e criar forks, montando uma barra lateral sem um parser separado de histórico de conversa
  • Agente de detecção de vulnerabilidades: faz threat modeling de um alvo em C e encontra bugs de segurança de memória com ferramentas de arquivo integradas, classificando-os em um relatório estruturado
  • Hospedando o agente: implanta o agente de pesquisa em Docker, Modal e Kubernetes em três etapas, mantendo a mesma imagem de contêiner e interface HTTP

Claude Managed Agents

Memória e gerenciamento de contexto

Uso de ferramentas e integrações externas

Busca, RAG e processamento de conhecimento

Multimodal, voz e documentos

Respostas, raciocínio e prompting

Skills e aplicações de negócios

Padrões de agentes do LlamaIndex e contribuições da comunidade

  • Agente ReAct: cria um agente ReAct com LlamaIndex para executar fluxos de trabalho de raciocínio e ação baseados em ferramentas
  • Estão recebendo contribuições da comunidade para novas ideias de Cookbook, com um guia de contribuição disponível

1 comentários

 
GN⁺ 2 시간 전
Opiniões no Hacker News
  • Sinceramente, quase todos os materiais sobre como usar IA parecem sem sentido. Para saber como fazer, basta perguntar diretamente à IA; e, se for uma forma de usar IA, é só embutir no harness ou esperar que Anthropic/OpenAI implemente, já que costuma ser uma funcionalidade trivial
    Coisas como fluxos de trabalho de agentes, gerenciamento de memória e engenharia de harness também parecem, em grande parte, demonstrações para impressionar

    • Em 2023, diziam que engenharia de prompts seria a nova engenharia de software, então muita gente se dedicou a aprender CoT, ReAct etc.; mas, em 2024, a maior parte disso se tornou desnecessária por causa de modelos de raciocínio e atualizações de harness
      Técnicas ou frameworks de IA mais recentes também são absorvidos ou substituídos em ciclos de 3 meses, então parecem ter pouco valor como investimento
    • À medida que a capacidade dos modelos cresce, eles absorvem por conta própria as ferramentas ao redor; por isso, essas ferramentas têm uma vida útil curta demais. Já vimos o mesmo padrão repetidas vezes
    • A Vercel mostrou que um único arquivo Markdown com instruções claras pode ser mais eficaz do que chamadas de ferramentas, e também apresentou uma forma de usar um índice compactado. Eu também passei várias horas tentando aperfeiçoar chamadas de ferramentas, mas tive resultados parecidos; depois disso, passei a usar apenas Claude.md, Agents.md e, se necessário, Project.md
    • LLMs parecem péssimos em usar outros LLMs dentro de um harness. Se você deixar, eles colocam todo tipo de coisa em arquivos .md e poluem o contexto
      No fim, é preciso fazer o LLM pesquisar esse tipo de material, então talvez sejam materiais mais voltados para LLMs do que para pessoas
    • Quando todo mundo estava exaltando o MCP, skills já tinham se tornado uma alternativa mais eficiente, e o gerenciamento agressivo de contexto também ficou menos importante por causa das janelas de contexto longas e dos recursos de agentes. Se uma técnica for boa, há grande chance de ser incorporada na próxima versão
      Por isso, evito plugins e MCP quando não são indispensáveis e uso prompts completos. Isso me ajudou a evitar impor otimizações antigas aos LLMs e acabar atrapalhando seu progresso
  • As imagens de antes e depois em prompting para estética de front-end chegam a ser ridículas. Parece que ninguém verificou se essa skill realmente melhorou o design

    • Todos os resultados apresentados parecem regressões, não melhorias
    • Muitos guias recomendam cegamente a skill de design de front-end, como um típico culto à carga ao estilo LLM, mas o conteúdo real é diferente do que as pessoas imaginam
    • O site com a estética aplicada parece um keygen do começo dos anos 2000; só faltaria acrescentar música techno
    • O resultado é, de fato, bem constrangedor. Na prática, é algo como “use fundo preto e uma fonte horrivelmente larga”
    • Fico me perguntando se escolheram exemplos que maximizam a diferença entre antes e depois para criar a impressão de que funciona. Pessoalmente, em todos os exemplos, prefiro o design antes da aplicação
  • O resultado de prompting para estética de front-end é sem graça antes da aplicação e sem graça com gradientes adicionados depois

    • Em alguns exemplos, o antes é melhor, e o único que dá para dizer que realmente melhorou é o exemplo do blog
    • Eu até prefiro a versão sem a estética aplicada
    • Também foram adicionados rótulos em maiúsculas, uma característica típica de páginas desenhadas por IA
  • Estou usando as skills do Matt Pocock em casa e elas são muito boas. Elas foram projetadas para serem chamadas diretamente pelo usuário, não acionadas automaticamente, então não ocupam muito contexto só por existirem
    Em vez de excluir o programador do resultado final, elas o incentivam a pensar mais profundamente sobre o resultado. As grill skills ajudam a esclarecer os requisitos reais, e a prototype skill ajuda a explorar partes em que é preciso experimentar diretamente para tomar decisões difíceis

  • O OpenAI Cookbook também é útil. Outros laboratórios de IA também publicam com frequência exemplos e cookbooks no GitHub e no Hugging Face, então vale a pena continuar acompanhando

  • Agentes de codificação apresentam muito mais bugs no front-end do que no back-end, entregando com bem mais frequência funcionalidades quebradas, incompletas ou estranhas. A causa parece ser a diferença de verificabilidade entre as duas áreas, e apenas um conjunto básico de testes não basta
    Abordagens como o gstack de Garry Tan parecem adequadas, mas não sei se já estão maduras o suficiente para adoção. Também há avaliações dizendo que o Gemini 3.5 Flash é melhor que o Opus ou o GPT-5.5 em tarefas de front-end; fico curioso se isso se deve à capacidade multimodal ou ao entendimento do Chrome, e quais seriam as avaliações de usuários reais

    • Pode haver opções combinadas com agentes, como a Front End Design skill do Claude, mas eu ainda não usei diretamente. O Magic Patterns é especialmente bom para gerar protótipos iniciais quando controlado por um agente que conhece suas funcionalidades e limitações
      Para obter resultados criativos, é preciso pedir ativamente, mas ele é bom para design de front-end padrão. Ainda assim, uso apenas para testar ideias, não para adicionar ou modificar funcionalidades arbitrárias
    • Agentes não lidam bem com atualizações assíncronas de estado complexas, porque é difícil representá-las no contexto. Por outro lado, são bons para criar componentes complexos de forma independente ou implementar funcionalidades de baixo acoplamento, como animações
  • Achei que fosse um cookbook de verdade para criar receitas plausíveis e realmente cozinháveis com LLMs, mas parece que ainda não é isso

    • Há mais de um ano cozinho algumas vezes por mês com ajuda de LLMs, e em nove de cada dez vezes dá certo. As receitas médias contidas nos pesos do modelo também costumam ser bem sólidas, e eles são excelentes em substituição de ingredientes, como “não tenho o ingrediente X” ou “transforme em vegetariano”
      Também é divertido receber uma receita e depois pedir uma ou duas vezes “deixe mais gostoso” para ver o resultado
    • Estou aprendendo culinária italiana com o ChatGPT e, tirando algumas tentativas e erros, funciona surpreendentemente bem
    • Cozinhei algumas vezes este ano com o Gemini e foi melhor do que eu esperava. Você pode dizer “tenho estes ingredientes na despensa e quero uma dieta cetogênica” e ir refinando as opções por conversa
    • Eu também esperava uma ferramenta digital de planejamento alimentar
  • Achei que fosse um novo produto para gerar receitas com o Claude

    • Estou usando projetos do Claude para receitas, e ele é excelente para recomendar cardápios e ajustar receitas aos ingredientes que tenho na despensa, então eu também esperava algo assim
    • Na prática, também dá para usar para esse fim
  • Os designs antes e depois da aplicação do cookbook parecem ambos feitos com vibe coding. Não sou designer a ponto de apontar a causa exata, mas a variedade de estilos que o Claude usa parece um tanto limitada
    Talvez especificar com mais detalhes as mudanças necessárias ajude a conter essa tendência

  • Deveriam ter revisado a UI pelo menos uma vez. Nem mesmo um simples espaçamento de tabela ficou correto