- Reúne guias práticos e exemplos para implementar aplicações com Claude, cobrindo amplamente desde a construção de agentes até RAG, uso de ferramentas, multimodalidade e avaliação
- Os exemplos de Claude Agent SDK e Managed Agents incluem padrões operacionais como coordenação multiagente, gestão de sessões, implantação, resposta a incidentes, detecção de vulnerabilidades e memória do usuário
- Oferece memória e compressão de contexto para agentes de longa duração, chamadas programáticas de ferramentas, busca de ferramentas baseada em embeddings e técnicas de subagentes assíncronos
- É possível conferir exemplos de implementação não só para RAG, geração de SQL, grafos de conhecimento, resumo de documentos e processamento de imagem e áudio, mas também para avaliação, custos, observabilidade e guardrails
- Abrange implantação com Docker, Modal e Kubernetes, versionamento e rollback de prompts, aprovação humana e análise de custos, podendo ser usado em todo o ciclo de desenvolvimento e operação em produção
Avaliação de agentes e guardrails
- Reproduzir as pontuações de benchmark de busca agêntica do Claude: reproduz as pontuações de DeepSearchQA e BrowseComp com um harness da Messages API, usando chamadas programáticas de ferramentas, compressão no lado do servidor e orçamento de tarefas
- Fallback de classificador e cobrança no Claude Fable 5: detecta bloqueios do classificador de segurança e alterna para Opus 4.8, cobrindo fallback no lado do servidor ou do cliente SDK, além de streaming e novas mudanças de cobrança
- Avaliação de ferramentas: executa avaliação paralela de agentes para ferramentas de forma independente dos arquivos de tarefa de avaliação
- Construindo avaliações: cria um sistema de avaliação para medir e melhorar o desempenho do Claude em métricas-chave
- Geração de dados de teste sintéticos para templates de prompt: gera casos de teste sintéticos para avaliar e melhorar prompts do Claude
- Construindo um filtro de moderação com Claude: cria um filtro de moderação de conteúdo personalizado definindo regras e categorias no prompt
Padrões de multiagentes e workflows
- Orquestração assíncrona de multiagentes: aborda a estrutura de mensagens e ciclo de vida de uma equipe fixa de N agentes que troca mensagens em um hub compartilhado e de subagentes assíncronos criados dinamicamente
- Multiagentes: coordenação de uma equipe de especialistas: um coordenador lidera um pesquisador de busca na web, um responsável por arquivos e um responsável por preços baseado em regras para redigir uma proposta comercial
- Inclui o campo
multiagent, eventosthread_createdethread_message_received, e limitação de escopo de ferramentas por função
- Inclui o campo
- Outcomes: agentes que verificam o próprio trabalho: um redator cria um resumo de pesquisa com citações, depois um avaliador stateless verifica URLs e citações e faz correções até passar, formando um loop de avaliação e melhoria
- Aborda
user.define_outcome, eventosspan.outcome_evaluation_*e como escrever critérios de avaliação que o avaliador pode executar
- Aborda
- Workflows básicos: oferece três padrões multi-LLM que trocam custo ou latência por desempenho
- Avaliador-otimizador: uma LLM gera o resultado e outra LLM fornece feedback de avaliação em uma estrutura iterativa
- Orquestrador-trabalhadores: uma LLM central delega tarefas dinamicamente e sintetiza os resultados das LLMs trabalhadoras
- Usando Haiku como subagente: subagentes Haiku extraem relatórios financeiros e o Opus sintetiza os resultados
Claude Agent SDK
- Agente de pesquisa em uma linha: cria um agente de pesquisa autônomo com Claude Code SDK e
WebSearch - Agente chief of staff: cria um sistema multiagente com subagentes, hooks, estilo de saída e modo de planejamento
- Agente de observabilidade: conecta agentes a sistemas externos com um servidor MCP para lidar com monitoramento do GitHub e workflows de CI
- Agente de confiabilidade de site: diagnostica e recupera incidentes com ferramentas MCP de leitura e escrita, além de redigir relatórios postmortem
- Migrando do OpenAI Agents SDK: usando um agente de aprovação de custos como exemplo, mapeia ferramentas, guardrails, sessões e handoffs para os elementos básicos do Claude Agent SDK
- Construindo um navegador de sessões: lista e abre sessões do Agent SDK no disco, além de renomear, etiquetar e criar forks, montando uma barra lateral sem um parser separado de histórico de conversa
- Agente de detecção de vulnerabilidades: faz threat modeling de um alvo em C e encontra bugs de segurança de memória com ferramentas de arquivo integradas, classificando-os em um relatório estruturado
- Hospedando o agente: implanta o agente de pesquisa em Docker, Modal e Kubernetes em três etapas, mantendo a mesma imagem de contêiner e interface HTTP
Claude Managed Agents
- Como criar um agente que lembra do usuário: aprende e lembra as preferências do usuário ao longo de várias interações usando o armazenamento Memory
- Como criar um agente de resposta a incidentes de SRE com Claude Managed Agents: quando um alerta é acionado, lê logs e runbooks, encontra a causa raiz, abre um PR de correção e faz o merge após aprovação humana
- Como criar um agente de análise de dados: usa ambiente sandbox e montagem de arquivos para converter CSV em um relatório HTML com gráficos interativos
- Como criar um bot de análise de dados para Slack: ao mencionar o bot com um CSV, gera um relatório de análise na thread e dá suporte a conversas de acompanhamento na mesma sessão
- Tutorial de Managed Agents: melhorando uma suíte de testes com falhas: corrige três bugs no pacote
calc.pyusando criação de agente, ambiente e sessão, montagem de arquivos e loop de eventos em streaming - Tutorial de Managed Agents: configuração para produção: cobre credenciais MCP baseadas em vault, o webhook
session.status_idledpara envolver humanos sem conexão persistente e o CRUD do ciclo de vida de recursos - Tutorial de Managed Agents: versionamento de prompt e rollback: cria a v1 no servidor, avalia com um conjunto de testes rotulado e depois detecta regressão na v2, fixando a sessão na versão 1
- inclui fixação de versão em
agents.updateesessions.create, além de onde o gate de revisão se desloca quando o prompt não é código
- inclui fixação de versão em
Memória e gerenciamento de contexto
- Engenharia de contexto: memória, compactação e remoção de ferramentas: compara quando aplicar, custo e formas de combinar estratégias em agentes de longa duração
- Compactação da memória da sessão: compacta imediatamente a memória de sessão de conversas longas com threading em background e prompt caching
- Compactação automática de contexto: compacta automaticamente o histórico da conversa em fluxos de trabalho de agentes de longa duração para gerenciar o limite de contexto
- Memória e gerenciamento de contexto no Claude Sonnet 4.6: cria agentes com memória persistente com a ferramenta de memória e a edição de contexto do Claude
- Prompt caching especulativo: prepara o cache antecipadamente enquanto o usuário digita a consulta para reduzir o tempo até o primeiro token
- Prompt caching na API do Claude: armazena em cache e reutiliza o contexto do prompt para reduzir custo e tempo de resposta
Uso de ferramentas e integrações externas
- Chamada programática de ferramentas: faz o Claude escrever código de chamada de ferramentas em um ambiente de execução de código para reduzir latência e consumo de tokens
- Busca de ferramentas com embeddings: amplia aplicações com Claude para milhares de ferramentas com busca dinâmica baseada em embeddings semânticos
- Chamadas paralelas de ferramentas no Claude 3.7 Sonnet: ativa chamadas paralelas usando o meta-padrão de ferramentas em lote como solução alternativa
- Escolha de ferramentas: força ou automatiza a escolha de ferramentas do Claude com o parâmetro
tool_choice - Ferramenta de armazenamento de memória combinando Pydantic e uso de ferramentas da Anthropic: cria ferramentas type-safe validadas por modelos Pydantic
- Uso de ferramenta de calculadora no Claude: fornece uma ferramenta de calculadora para operações aritméticas e resolução de problemas matemáticos
- Como criar um agente de atendimento ao cliente com ferramentas no lado do cliente: cria um chatbot que usa ferramentas de consulta de clientes e gerenciamento de pedidos
- Extração de JSON estruturado com Claude e uso de ferramentas: extrai dados JSON estruturados de várias entradas
- Uso do Wolfram Alpha LLM API como ferramenta no Claude: integra a Wolfram Alpha LLM API para consultas computacionais e respostas
- Agente de enriquecimento de inteligência de ameaças: investiga e cruza indicadores de comprometimento de várias fontes de threat intelligence, mapeia para o MITRE ATT&CK e gera relatórios para SIEM e SOAR
Busca, RAG e processamento de conhecimento
- Construindo grafos de conhecimento com Claude: extrai entidades e relações de texto não estruturado e remove duplicatas para oferecer suporte a consultas em grafos multi-hop
- Text-to-SQL com Claude: converte linguagem natural em SQL com RAG, cadeia de pensamento e técnicas de autoaperfeiçoamento
- Melhorando RAG com recuperação contextual: adiciona contexto aos chunks antes dos embeddings e aplica cache de prompt para aumentar a precisão do RAG
- Geração aumentada por recuperação: constrói e otimiza sistemas de RAG com indexação de resumos e reranqueamento
- Classificação com Claude: constrói um sistema de classificação para tickets de seguros usando RAG e cadeia de pensamento
- Citações: fornece citações detalhadas e verificáveis de fontes para consultas baseadas em documentos
- Resumo de conteúdo de páginas web com Claude 3 Haiku: busca conteúdo a partir de URLs e o resume com Claude 3 Haiku
- Criando consultas SQL com Claude: gera SQL a partir de perguntas em linguagem natural fornecendo o contexto do esquema do banco de dados
- Geração aumentada por recuperação com Pinecone: conecta Claude ao banco de dados vetorial Pinecone para implementar RAG e busca semântica
- Construindo um sistema de RAG com Claude 3 e MongoDB: constrói um chatbot Claude·MongoDB que usa notícias de tecnologia como base de conhecimento
- Agente RAG com Claude 3 e LangChain v1: cria um agente RAG com os padrões atualizados do framework de agentes do LangChain v1
- Agentes multi-documento: constrói RAG para grandes coleções de documentos com DocumentAgents e o padrão ReAct
- Pipeline de RAG com LlamaIndex: cria um pipeline básico para recuperação de documentos e perguntas e respostas
- Engine RouterQuery: encaminha consultas para diferentes índices com o
RouterQueryEnginedo LlamaIndex - SubQuestionQueryEngine: decompõe consultas complexas em subperguntas distribuídas por vários documentos
- "Enviando" PDFs para Claude pela API: processa e resume documentos PDF com extração e codificação de texto
- Busca iterativa na Wikipedia com Claude: notebook legado de um fluxo de pesquisa que faz buscas iterativas na Wikipedia com Claude 2
Multimodal, voz e documentos
- Fornecendo uma ferramenta de recorte para melhorar a análise de imagens: amplia áreas específicas de gráficos, documentos e diagramas para análise detalhada
- Usando visão e ferramentas juntas no Claude: combina compreensão de imagem e ferramentas para extrair dados estruturados de imagens como tabelas nutricionais
- Boas práticas para usar a visão do Claude: oferece técnicas e dicas para melhorar o desempenho no processamento de imagens
- Primeiros passos: enviando imagens para Claude: envia imagens para a API do Claude 3 para realizar análise de texto com base em visão
- Transcrição de documentos com Claude: extrai e estrutura texto não estruturado de imagens e PDFs
- Trabalhando com gráficos, tabelas e decks de slides: extrai informações de gráficos, tabelas e apresentações com a visão do Claude
- Multimodal: realiza compreensão e raciocínio sobre imagens com a abstração Anthropic MultiModal LLM do LlamaIndex
- Assistente de voz de baixa latência com ElevenLabs: combina os recursos de fala-para-texto e texto-para-fala da ElevenLabs com Claude
- Transcrevendo áudio com Deepgram e preparando perguntas de entrevista com Anthropic: transcreve áudio e gera perguntas de entrevista com Claude
Respostas, raciocínio e prompting
- Pensamento estendido: usa o pensamento estendido passo a passo do Claude junto com gerenciamento de orçamento
- Pensamento estendido com uso de ferramentas: combina pensamento estendido e ferramentas em fluxos de trabalho de várias etapas
- Prompting para estética de frontend: aborda como escrever prompts para gerar frontends distintos e bem-acabados, evitando estéticas genéricas
- Resumo com Claude: resume documentos jurídicos, incluindo avaliação e técnicas avançadas
- Amostragem de respostas do Claude além do limite máximo de tokens: gera respostas longas que excedem
max_tokenscom prefill e continuação de mensagens - Metaprompt: gera prompts iniciais de trabalho para reduzir o problema da página em branco
- Prompting de “modo JSON” para Claude: obtém saídas JSON confiáveis com técnicas de prompting, sem amostragem restrita
- Processamento em lote com a Message Batches API: processa grandes volumes de requisições de forma assíncrona e reduz os custos em 50%
Skills e aplicações de negócios
- Claude Skills para aplicações financeiras: cria dashboards financeiros e análises de portfólio com Skills de Excel, PowerPoint e PDF
- Criando Skills personalizadas para Claude: cria, implanta e gerencia Skills que expandem fluxos de trabalho específicos da organização
- Introdução ao Claude Skills: usa Skills de Excel, PowerPoint e PDF para geração de documentos, análise de dados e automação de fluxos de trabalho
- Fine-tuning do Claude 3 Haiku no Amazon Bedrock: fornece o procedimento para fazer fine-tuning do Claude 3 Haiku no Amazon Bedrock para tarefas personalizadas
- Cookbook da Admin API de uso e custos: acessa e analisa programaticamente dados de uso e custos da Claude API com a Admin API
Padrões de agentes do LlamaIndex e contribuições da comunidade
- Agente ReAct: cria um agente ReAct com LlamaIndex para executar fluxos de trabalho de raciocínio e ação baseados em ferramentas
- Estão recebendo contribuições da comunidade para novas ideias de Cookbook, com um guia de contribuição disponível
1 comentários
Opiniões no Hacker News
Sinceramente, quase todos os materiais sobre como usar IA parecem sem sentido. Para saber como fazer, basta perguntar diretamente à IA; e, se for uma forma de usar IA, é só embutir no harness ou esperar que Anthropic/OpenAI implemente, já que costuma ser uma funcionalidade trivial
Coisas como fluxos de trabalho de agentes, gerenciamento de memória e engenharia de harness também parecem, em grande parte, demonstrações para impressionar
Técnicas ou frameworks de IA mais recentes também são absorvidos ou substituídos em ciclos de 3 meses, então parecem ter pouco valor como investimento
.mde poluem o contextoNo fim, é preciso fazer o LLM pesquisar esse tipo de material, então talvez sejam materiais mais voltados para LLMs do que para pessoas
Por isso, evito plugins e MCP quando não são indispensáveis e uso prompts completos. Isso me ajudou a evitar impor otimizações antigas aos LLMs e acabar atrapalhando seu progresso
As imagens de antes e depois em prompting para estética de front-end chegam a ser ridículas. Parece que ninguém verificou se essa skill realmente melhorou o design
O resultado de prompting para estética de front-end é sem graça antes da aplicação e sem graça com gradientes adicionados depois
Estou usando as skills do Matt Pocock em casa e elas são muito boas. Elas foram projetadas para serem chamadas diretamente pelo usuário, não acionadas automaticamente, então não ocupam muito contexto só por existirem
Em vez de excluir o programador do resultado final, elas o incentivam a pensar mais profundamente sobre o resultado. As grill skills ajudam a esclarecer os requisitos reais, e a prototype skill ajuda a explorar partes em que é preciso experimentar diretamente para tomar decisões difíceis
O OpenAI Cookbook também é útil. Outros laboratórios de IA também publicam com frequência exemplos e cookbooks no GitHub e no Hugging Face, então vale a pena continuar acompanhando
Agentes de codificação apresentam muito mais bugs no front-end do que no back-end, entregando com bem mais frequência funcionalidades quebradas, incompletas ou estranhas. A causa parece ser a diferença de verificabilidade entre as duas áreas, e apenas um conjunto básico de testes não basta
Abordagens como o gstack de Garry Tan parecem adequadas, mas não sei se já estão maduras o suficiente para adoção. Também há avaliações dizendo que o Gemini 3.5 Flash é melhor que o Opus ou o GPT-5.5 em tarefas de front-end; fico curioso se isso se deve à capacidade multimodal ou ao entendimento do Chrome, e quais seriam as avaliações de usuários reais
Para obter resultados criativos, é preciso pedir ativamente, mas ele é bom para design de front-end padrão. Ainda assim, uso apenas para testar ideias, não para adicionar ou modificar funcionalidades arbitrárias
Achei que fosse um cookbook de verdade para criar receitas plausíveis e realmente cozinháveis com LLMs, mas parece que ainda não é isso
Também é divertido receber uma receita e depois pedir uma ou duas vezes “deixe mais gostoso” para ver o resultado
Achei que fosse um novo produto para gerar receitas com o Claude
Os designs antes e depois da aplicação do cookbook parecem ambos feitos com vibe coding. Não sou designer a ponto de apontar a causa exata, mas a variedade de estilos que o Claude usa parece um tanto limitada
Talvez especificar com mais detalhes as mudanças necessárias ajude a conter essa tendência
Deveriam ter revisado a UI pelo menos uma vez. Nem mesmo um simples espaçamento de tabela ficou correto