Novas ferramentas para criar agentes
(openai.com)- A OpenAI anunciou a Responses API, ferramentas integradas, o Agents SDK e ferramentas de observabilidade para facilitar o desenvolvimento de agentes prontos para produção
- A Responses API combina a simplicidade da Chat Completions API com o uso de ferramentas da Assistants API, permitindo lidar com busca na web, busca em arquivos e uso do computador em um único fluxo
- Para novas integrações, o uso da Responses API é recomendado, e a Assistants API entrará em processo de descontinuação com meta de encerramento em meados de 2026, após atingir paridade de funcionalidades
- As ferramentas integradas oferecem suporte a informações atualizadas da web, busca em grandes volumes de documentos e automação de tarefas no computador com mouse e teclado, mas no caso de computer use a supervisão humana é recomendada, especialmente fora de ambientes de navegador
- Os desenvolvedores podem combinar APIs, ferramentas, SDK e recursos de rastreamento e avaliação em uma única plataforma para criar, implantar e otimizar agentes
Novos componentes para o desenvolvimento de agentes
- A OpenAI vê agentes como sistemas que executam tarefas de forma independente em nome do usuário
- Ao longo do último ano, com a introdução de raciocínio avançado, interações multimodais e novas técnicas de segurança, foi criada a base para lidar com tarefas complexas de múltiplas etapas
- Os clientes têm enfrentado dificuldades para transformar esses recursos em agentes prontos para produção
- É necessária ampla iteração de prompts
- É preciso criar manualmente uma lógica de orquestração personalizada
- Faltam visibilidade suficiente e suporte integrado
- Os componentes anunciados agora são os seguintes
- Responses API: combina a simplicidade da Chat Completions API com os recursos de uso de ferramentas da Assistants API
- Ferramentas integradas: web search, file search, computer use
- Agents SDK: orquestra fluxos de trabalho com agente único e múltiplos agentes
- Ferramentas de observabilidade: rastreiam e inspecionam a execução dos fluxos de trabalho dos agentes
Responses API
- A Responses API é a nova unidade básica de API da OpenAI para criar agentes com as ferramentas integradas da OpenAI
- Combina a simplicidade da Chat Completions com os recursos de uso de ferramentas da Assistants API
- Em uma única chamada da Responses API, é possível usar várias ferramentas e várias interações do modelo para lidar com tarefas mais complexas
- As ferramentas com suporte inicial são as seguintes
- Busca na web
- Busca em arquivos
- Uso do computador
- Também inclui melhorias de usabilidade
- Design unificado baseado em itens
- Polimorfismo mais simples
- Eventos de streaming mais intuitivos
- Helpers do SDK como
response.output_text
- Foi projetada para desenvolvedores que querem combinar modelos da OpenAI e ferramentas integradas em seus apps sem precisar integrar separadamente várias APIs ou fornecedores externos
- Se os dados forem armazenados na OpenAI, fica mais fácil fazer avaliação de desempenho de agentes com recursos de rastreamento e avaliação
- A OpenAI não usa dados empresariais para treinar modelos por padrão, e isso também vale quando os dados estão armazenados na OpenAI
- Já está disponível hoje para todos os desenvolvedores, sem cobrança adicional, e tokens e ferramentas são cobrados pelas tarifas padrão da página de preços
- A documentação inicial está disponível no guia de início rápido da Responses API
Relação com as APIs existentes
- A Chat Completions API continua sendo a API mais amplamente adotada da OpenAI e seguirá com suporte
- Desenvolvedores que não precisam de ferramentas integradas podem continuar usando-a
- Novos modelos para recursos que não dependem de ferramentas integradas nem de múltiplas chamadas de modelo continuarão sendo lançados também para a Chat Completions
- A Responses API é um superconjunto da Chat Completions e oferece o mesmo desempenho, por isso é recomendada para novas integrações
- O feedback beta da Assistants API foi incorporado à Responses API, tornando-a mais flexível, rápida e fácil de usar
- Está em andamento a obtenção de paridade total de funcionalidades entre Assistants API e Responses API, incluindo objetos semelhantes a Assistant, objetos semelhantes a Thread e a ferramenta Code Interpreter
- Quando a paridade de funcionalidades for concluída, a OpenAI planeja anunciar oficialmente a descontinuação da Assistants API
- A meta de encerramento é meados de 2026
- No anúncio de descontinuação, será fornecido um guia de migração para retenção de dados e transferência de aplicações
- Até o anúncio oficial de descontinuação, novos modelos continuarão sendo oferecidos também na Assistants API
- A OpenAI posiciona a Responses API como a direção futura para criar agentes na OpenAI
Ferramentas integradas da Responses API
-
Busca na web
- Os desenvolvedores podem obter respostas rápidas e atualizadas da web com citações claras das fontes
- Na Responses API, a busca na web é oferecida como ferramenta ao usar
gpt-4oegpt-4o-mini, e pode ser combinada com outras ferramentas ou chamadas de função - Nos testes iniciais, os casos de uso apareceram em apps que precisam de informações recentes da web, como assistentes de compras, agentes de pesquisa e agentes de reserva de viagens
- A Hebbia usa a ferramenta de busca na web para ajudar gestoras de ativos, empresas de private equity e crédito e profissionais do direito a extrair rapidamente insights acionáveis de grandes conjuntos de dados públicos e privados
- A busca na web da API é baseada no mesmo modelo usado no ChatGPT search
- No SimpleQA, o GPT‑4o search preview registrou 90% de precisão, e o GPT‑4o mini search preview, 88%
- As respostas de busca na web da API incluem links para fontes como matérias jornalísticas e posts de blog
- Sites e publishers podem optar por aparecer na busca na web da API
- A ferramenta de busca na web está disponível em preview para todos os desenvolvedores na Responses API
- Na Chat Completions API, é possível acessar diretamente os modelos de busca com
gpt-4o-search-previewegpt-4o-mini-search-preview - O preço começa em US$ 30 por 1.000 consultas para GPT‑4o search e US$ 25 por 1.000 consultas para 4o-mini search
-
Busca em arquivos
- A ferramenta aprimorada de file search facilita a busca de informações relevantes em grandes volumes de documentos
- Suporta vários formatos de arquivo, otimização de consultas, filtragem por metadados e reranking personalizado
- Na Responses API, pode ser integrada com apenas algumas linhas de código
- Os casos de uso incluem
- Agentes de suporte ao cliente acessando FAQs
- Assistentes jurídicos consultando rapidamente casos anteriores para profissionais qualificados
- Agentes de programação consultando documentação técnica
- A Navan usa file search em seu agente de viagens com IA para fornecer rapidamente respostas precisas a partir de documentos da base de conhecimento, como políticas de viagem corporativa
- Com otimização de consultas e reranking integrados, é possível montar pipelines de RAG sem ajustes ou configuração adicionais
- Ao manter vector stores dedicados por grupo de usuários, é possível fornecer respostas alinhadas às configurações de conta e aos papéis dos usuários
- file search está disponível para todos os desenvolvedores na Responses API
- O preço de uso é de US$ 2,50 por 1.000 consultas, e o armazenamento de arquivos custa US$ 0,10 por GB por dia, com o primeiro 1 GB grátis
- Também continuará disponível na Assistants API
- Um novo endpoint de busca foi adicionado ao objeto Vector Store API, permitindo consultar diretamente dados que podem ser usados em outros aplicativos e APIs
-
Uso do computador
- A ferramenta computer use é um recurso da Responses API para criar agentes que executam tarefas no computador
- Essa ferramenta é movida pelo modelo Computer-Using Agent (CUA) que viabilizou o Operator
- O modelo em research preview registrou os seguintes resultados de benchmark
- OSWorld: 38,1% em tarefas gerais de uso do computador
- WebArena: 58,1%
- WebVoyager: 87% em interações baseadas na web
- A ferramenta integrada de computer use captura as ações de mouse e teclado geradas pelo modelo
- Os desenvolvedores podem converter essas ações em comandos executáveis em seus próprios ambientes para automatizar tarefas de uso do computador
- Os casos de uso incluem automação de fluxos de trabalho baseados em navegador, como garantia de qualidade de apps web e entrada de dados entre sistemas legados
- A Unify usa a ferramenta computer use em um sistema de crescimento de receita no qual agentes realizam entendimento de intenção, pesquisa de contas e contato com compradores
- O agente também pode aproveitar informações que antes não eram acessíveis por API
- Por exemplo, uma empresa de gestão imobiliária pode verificar por mapas online se um negócio expandiu sua área ocupada
- A Luminai integrou a ferramenta computer use para automatizar fluxos operacionais complexos em grandes empresas com sistemas legados sem APIs e sem dados padronizados
- Em um piloto com uma grande organização de serviços comunitários, automatizou em poucos dias o processamento de inscrições e o procedimento de cadastro de usuários
- O RPA tradicional teria dificuldade para alcançar o mesmo resultado mesmo após meses de tentativa
- Antes de lançar o CUA no Operator, foram realizados extensos testes de segurança e red teaming em três áreas: uso indevido, erros do modelo e riscos de fronteira
- No acesso ao CUA via API, também foram realizadas avaliações adicionais de segurança e red teaming para lidar com o risco de expansão das capacidades do Operator para sistemas operacionais locais
- Também foram adicionadas medidas de mitigação para desenvolvedores
- Verificações de segurança para defesa contra prompt injection
- Prompts de confirmação para tarefas sensíveis
- Ferramentas para ajudar no isolamento de ambiente
- Detecção aprimorada de possíveis violações de política
- Embora as mitigações reduzam os riscos, o modelo ainda pode cometer erros não intencionais, especialmente fora de ambientes de navegador
- O desempenho de 38,1% no OSWorld indica que ainda não há alta confiabilidade para automação de tarefas de sistema operacional, e nesse caso a supervisão humana é recomendada
- Mais detalhes sobre o trabalho de segurança específico da API podem ser vistos no system card atualizado
Agents SDK e orquestração de fluxos de trabalho
- Agentes precisam não apenas de lógica central e acesso a ferramentas, mas também de orquestração de fluxos de trabalho
- O novo Agents SDK open source simplifica a orquestração de fluxos de trabalho com múltiplos agentes
- Ele é uma evolução do SDK experimental Swarm, lançado no ano passado
- Os principais recursos são os seguintes
- Agents: LLMs fáceis de configurar com instruções claras e ferramentas integradas
- Handoffs: transferem o controle de forma inteligente entre agentes
- Guardrails: verificações de segurança configuráveis para validação de entradas e saídas
- Tracing & Observability: visualizam o rastreamento da execução dos agentes para apoiar depuração e otimização de desempenho
- Casos de uso reais aplicáveis incluem automação de suporte ao cliente, pesquisa em várias etapas, geração de conteúdo, revisão de código e prospecção de vendas
- A Coinbase usou o Agents SDK para prototipar e implantar rapidamente o AgentKit, que permite que agentes de IA interajam com carteiras de criptomoedas e atividades onchain
- Em poucas horas, integrou ações personalizadas do Developer Platform SDK em um agente totalmente funcional
- A arquitetura simplificada do AgentKit facilita a adição de novas ações de agente
- A Box criou em poucos dias um agente usando busca na web e Agents SDK para permitir busca, consulta e extração de insights a partir de dados não estruturados internos da Box e de fontes públicas da internet
- Clientes corporativos podem pesquisar não só informações atualizadas, mas também dados internos proprietários de forma compatível com permissões internas e políticas de segurança
- Por exemplo, uma empresa de serviços financeiros pode criar um agente personalizado que combina análises internas de mercado armazenadas na Box com notícias em tempo real e dados econômicos da web
- O Agents SDK funciona com a Responses API e a Chat Completions API
- Também pode ser usado com modelos de outros provedores, desde que ofereçam endpoints de API no estilo Chat Completions
- Pode ser integrado imediatamente a codebases em Python, e o suporte a Node.js será disponibilizado em breve
- No design do Agents SDK, a OpenAI se inspirou no trabalho de Pydantic, Griffe e MkDocs
- A OpenAI pretende continuar desenvolvendo o Agents SDK como um framework open source para que a comunidade possa expandir a abordagem
Direção de expansão da plataforma de agentes
- A OpenAI acredita que os agentes em breve se tornarão um elemento central da força de trabalho, elevando significativamente a produtividade em todos os setores
- Com o aumento da demanda de empresas que querem usar IA em tarefas complexas, o foco está em fornecer componentes para que desenvolvedores e empresas criem sistemas autônomos com impacto real
- O anúncio de agora é o primeiro conjunto de componentes para facilitar a criação, implantação e escalonamento de agentes de IA confiáveis e de alto desempenho
- À medida que as capacidades dos modelos evoluírem para um perfil mais orientado a agentes, a OpenAI pretende continuar investindo em integrações mais profundas em toda a API e em novas ferramentas para ajudar na implantação, avaliação e otimização de agentes em produção
- O objetivo é oferecer uma experiência de plataforma sem fricção para criar agentes capazes de ajudar em uma ampla variedade de tarefas em qualquer setor
1 comentários
Comentários do Hacker News
Não sei o quanto essas mudanças de API ajudam um desenvolvedor que quer integrar a OpenAI a um produto real
As máquinas de estado gerenciadas pelo fornecedor para lidar com conversas, mensagens, passagem de prompts etc. acabam, no meu caso, sendo insuficientes, presumindo demais ou atrapalhando
No fim, acabo usando a Chat Completions API só com saída estruturada ativada e, mesmo ali, consigo fazer uso de ferramentas, conversas recursivas, RAG etc. de forma suficiente
Não vejo valor em entregar o gerenciamento de estado do meu “agente” a terceiros; manter isso localmente dá muito mais autonomia
O ponto central é apenas que você coloca um literal de string em uma caixa-preta e recebe uma nova string, de preferência no formato solicitado, como JSON
Quando você se concentra na ideia de montar a string adequada a cada vez, o resto desaparece, e isso vira algo como criar uma string altamente estruturada a partir do estado de negócio no banco de dados
É basicamente a mesma coisa que renderizar uma página web server-side em PHP; a verdadeira diferença é só a forma de entrega
Ainda não encontrei um framework de agentes que acrescente, por cima de uma simples chamada de geração estruturada, aquilo de que preciso
A maioria das requisições a LLMs deveria ser “entrada de prompt, saída estruturada”, o que também combina com a filosofia Unix de fazer uma coisa bem-feita
Frameworks de agentes são prematuros demais; ainda são só uma camada que abstrai um conjunto de padrões de design que nem é comum ainda
Só deveríamos criar abstrações quando fica claro que todo mundo está reinventando a roda; em agentes, não há roda a inventar, é tudo apenas chamada simples a modelo de linguagem
Costumo dizer que “o modelo de linguagem deve ser a parte menos interessante do código”
A maior parte do tempo deveria ser gasta criando software e ferramentas de verdade, e o LLM deveria ser um pequeno componente do software
Frameworks de agentes, para o meu gosto, aumentam demais a presença do modelo de linguagem na base de código
Até a abstração de function calling da OpenAI alucina parâmetros e schemas, e o próprio JSON Schema é tão verboso que, assim que passa um pouco de 5 chamadas de função bem simples, tudo desmorona completamente
Parece estar empilhando mais coisas sobre uma abstração de caixa-preta que já é quebrada, e isso não é muito útil para aplicações reais
Pode ajudar a criar rapidamente pequenos apps de prova de conceito
É preciso ser ingênuo para construir uma empresa em cima de APIs assim
LLMs vão virar commodity, e a OpenAI não tem escolha senão lutar contra esse destino se quiser justificar sua avaliação e o volume de investimento que continuará sendo necessário
Se você construiu em cima da Assistant API, entenda o recado e seja dono do seu próprio produto, em vez de simplesmente reescrever tudo para a Responses API
Os LLMs de hoje ficam melhores quando encapsulados como caixas-pretas
Por causa do trecho: “Ao usar Chat Completions, o modelo sempre busca informações na web antes de responder. Para fazer modelos como gpt-4o e gpt-4o-mini chamarem web_search_preview como ferramenta apenas quando necessário, migre para a Responses API”
Portar para a nova Responses API não é trivial, e nós já temos histórico, RAG e tudo de que precisamos para assistentes
Desenvolvi vários agentes usando apenas function calling e saídas estruturadas, e eles estão rodando em produção há mais de um ano
Antes, nem chamávamos isso de agente
Isto aqui parece mirar pessoas que já usam frameworks de agentes junto com a API da OpenAI
Há uma boa thread no Twitter em que o projetista da nova API explica o contexto por trás de várias decisões de design: https://twitter.com/athyuttamre/status/1899541471532867821
Também há um link alternativo para quem não está logado no Twitter: https://nitter.net/athyuttamre/status/1899541471532867821
Essas tentativas de agentes de IA parecem errar já no ponto central
Porque tentam substituir pessoas em sistemas existentes, em vez de criar uma nova forma de fazer as coisas
Economia, vida, tudo no fim diz respeito à interação entre pessoas, então isso é fundamentalmente míope
A abordagem atual de agentes de IA parece uma variação da piada em que “uma frase é expandida pela IA em um e-mail longo e convincente, e a IA do destinatário resume aquele e-mail longo de volta para uma frase”
Entendo a utilidade de automatizar tarefas de sistemas existentes, mas a oportunidade real está em eliminar a maior parte desses sistemas
Humanos não são tão ruins assim
Fico me perguntando se criar UIs feitas para humanos com IA e depois fazer outra IA operar essa UI é mesmo o caminho a seguir
Quantos cestos feitos com galhos quebrados à mão você usa?
A história mostra que tudo que pode ser automatizado será automatizado, e tudo que puder ser feito de forma mais barata ou mais rápida também será
Por exemplo, no ecossistema de SaaS B2B, como uma experiência auxiliar de usuário em que usuários avançados dentro de uma organização conseguem criar macros para configurações de clientes e tarefas de gerenciamento de projetos
Quando a abstração, o contexto e o conjunto de usuários são bem limitados, o uso de ferramentas pode ser bastante estável
Algo que chama atenção por estar ausente: Model Context Protocol
https://www.anthropic.com/news/model-context-protocol
Agentes sempre precisam de algum tipo de protocolo de comunicação, e o mundo dos frameworks agênticos é um mar de logos; sem um padrão aberto, fica difícil
Agora estou na Comet, também trabalhei pessoalmente na implementação de MCP e contribuí com o Agent SDK na forma de integração nativa e melhorias na suíte de testes
https://github.com/comet-ml/opik-mcp
https://github.com/openai/openai-agents-python/pull/91
Lançamos a integração recente logo no primeiro dia
https://www.comet.com/docs/opik/tracing/integrations/openai_...
Vejo que o ponto central para onde a OpenAI está indo é oferecer simplicidade aos desenvolvedores por meio de componentes fáceis de usar
Não vou falar de estratégia nem de preços, mas, do ponto de vista de um desenvolvedor, a abordagem simples e modular do SDK e a ausência de firulas foram refrescantes à primeira vista
Isso não é genérico; é para usar chamadas de ferramentas do mcp.run com modelos da OpenAI
Ainda assim, não oferecer suporte direto ao MCP é quase a atitude mais hostil possível aos desenvolvedores e, vindo da OpenAI, não surpreende
Seria muito bom se fosse adicionado
À pergunta “O Agents SDK oferece suporte a conexões MCP? Dá para fornecer ferramentas facilmente a um agente específico por uma conexão cliente-servidor MCP?”, a resposta foi “Como você pode definir as ferramentas que quiser, dá para implementar ferramentas MCP com function calling”
Em resumo, você precisa fazer um pouco de trabalho de encanamento por conta própria
Issue relacionada: https://github.com/openai/openai-agents-python/issues/23
Aqui é o swyx
Tive tempo de ver toda a nova API com antecedência com a equipe de API/DX e fazer perguntas frequentes
https://latent.space/p/openai-agents-platform
O ponto interessante é que agora as respostas são armazenadas gratuitamente por padrão, então dá para abusar da Responses API como se fosse um banco de dados?
Também há perguntas que o pessoal do HN deve gostar
Hiperparâmetros da busca na web, ou seja, como ajustar a profundidade e a largura da busca ao criar um DIY Deep Research
Agora que a OAI passou a oferecer RAG e reranking como parte nativa da Responses API, quando você ainda deve criar seu próprio RAG
Pessoalmente, acho que alguém deveria fazer benchmark do desempenho de RAG da Files API. A impressão da comunidade parece não ter sido muito atualizada desde o lançamento inicial da Assistants API
A diferença entre o Agents SDK e o OAI Swarm é, em linhas gerais, tipos, tracing e LLM substituível
Também fico curioso se os fine-tunings de
search-previewecomputer-use-previewvão ser mesclados ao GPT50 - https://ai.pydantic.dev/
Um dos principais motivos para criar por conta própria esse tipo de ferramenta de busca com IA é ter controle total sobre profundidade e largura, além de poder customizar os loaders para os dados ou sites que você quiser
A busca na web atual não é transparente sobre quais sites não têm texto completo e quais usam apenas snippets
Ter uso de computador e busca na web juntos é claramente poderoso. Em essência, é algo como o Deep Research da OpenAI
O preço não foi divulgado na apresentação
Provavelmente porque sabiam que seria muito caro
Busca na web [0]: GPT‑4o search e 4o-mini search custam, respectivamente, US$ 30 e US$ 25 por 1.000 consultas
Busca em arquivos [1]: US$ 2,50 por 1.000 consultas; armazenamento de arquivos custa US$ 0,10/GB/dia; primeiro 1 GB grátis
Ferramenta de uso do computador (modelo computer-use-preview) [2]: US$ 3 por 1 milhão de tokens de entrada, US$ 12 por 1 milhão de tokens de saída
[0] https://platform.openai.com/docs/pricing#web-search
[1] https://platform.openai.com/docs/pricing#built-in-tools
[2] https://platform.openai.com/docs/pricing#latest-models
Não sei bem em que essa API é melhor do que https://www.anthropic.com/news/model-context-protocol
A motivação parece ter sido mais “como ganhar mais dinheiro” do que “como ser mais útil para os usuários”
Gostei, movimento ousado
Quando o pessoal lento do Google finalmente alcançar, talvez já seja tarde demais para o Google
Também escrevi um script que pesquisa na web e funciona bem razoavelmente. Usa o vercel ai sdk [1]
[0] - https://brave.com/search/api/
[1] - https://gist.github.com/bramses/41e90b27d156590154bcefd4119f...
Criei por conta própria uma versão muito mais simples e poderosa que a Responses API, e ela funciona com todos os provedores de LLM
https://github.com/Anilturaga/aiide
Parece bom, realmente parece muito bom
Há uma frase dizendo: “Planejamos anunciar oficialmente a descontinuação da Assistant API, com encerramento previsto para meados de 2026”
A nova Responses API é um passo na direção certa, incluindo até um recurso integrado de “handoff”
Mas, para casos de uso agentivos, ainda parece um pouco limitada, e faltam guardrails e lógica de máquina de estados oficiais
Eles disseram que “o objetivo é oferecer uma experiência de plataforma fluida para que desenvolvedores possam criar agentes”, então vai ser interessante ver como migrarão para essa plataforma
Acho que veremos fluxos de controle baseados em grafos nos próximos meses
Mesmo hoje já há inúmeras soluções open source, mas a maioria é insuficiente ou acrescenta opacidade e complexidade desnecessárias
Já dava para criar fluxos agentivos combinando chamadas de ferramentas e respostas JSON, mas ainda falta um componente de nível mais alto que ninguém resolveu direito
O avanço do Computer Use mencionado aqui é impressionante, então fico me perguntando se ele já está maduro o suficiente para ser usado em testes de usabilidade
Em geral, se uma UI é difícil para uma IA navegar, será que é razoável ver isso como um sinal de que ela provavelmente também é relativamente difícil para humanos e deve ser simplificada ou melhorada de alguma forma?
A forma como um LLM interage com uma UI é bem diferente da forma como humanos usam uma UI
O Agents SDK linkado está dando 404
Como referência, o MindRoot tem algo parecido com partes de Responses e File Search usando a task API: https://github.com/runvnc/mindroot/blob/main/api.md
Isso pode ser combinado com a ferramenta query_kb do plugin mr_kb e, como permite buscar em várias KBs, talvez seja até melhor que o File Search na prática
Quem quiser ajudar meu programa, criar plugins ou enviar PRs pode entrar em contato à vontade pelo GitHub, e-mail ou Discord/Telegram (runvnc)
Talvez seja porque estou logado