1 pontos por GN⁺ 3 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • A OpenAI elevou o desempenho por dólar da IA empresarial ao refletir ganhos de eficiência em modelos, sistemas de inferência e harnesses de agentes nos preços e na velocidade de processamento
  • A partir de 30 de julho, o preço do Luna cai 80% e o do Terra 20%; na API, por 1 milhão de tokens, o Luna passa a custar $0.20 de entrada e $1.20 de saída, e o Terra $2 de entrada e $12 de saída
  • O Luna oferece desempenho semelhante ao de modelos de ponta de um ano atrás por cerca de 6% do custo por tarefa e com velocidade quase 9 vezes maior; no Agents’ Last Exam, registrou desempenho superior ao do Fable 5 com custo estimado por tarefa cerca de 99% menor
  • O Fast mode do GPT‑5.6 Sol substitui o antigo Priority Processing e oferece velocidade até 2,5 vezes maior que o modo Standard por 2 vezes o preço, mantendo o mesmo nível de inteligência
  • Empresas podem ajustar o equilíbrio entre inteligência, velocidade e custo por meio de avaliações por etapa, usando o Sol para planejamento e resolução de incertezas e o Luna para implementação e testes bem definidos

Redução de preço do Luna e Terra e ganho de velocidade no Sol

  • Os ganhos de eficiência operacional do GPT‑5.6 levaram à redução de preço do Luna e Terra e à melhora na velocidade de processamento da API do Sol
  • O Luna, o modelo mais rápido e barato, fica 80% mais barato, e o Terra, modelo equilibrado para tarefas do dia a dia, fica 20% mais barato
    • Nas assinaturas pagas do Codex e do ChatGPT Work, o uso desses dois modelos também passa a consumir menos créditos
    • O preço das assinaturas e o orçamento de cotas em si não mudam
  • O Luna consegue concluir fluxos de trabalho em várias etapas usando ferramentas, reduzindo o custo operacional de tarefas em grande volume que exigem alta qualidade
  • O preço do Sol não muda

Escolha do modelo de acordo com o resultado esperado

  • Para usar IA de forma eficiente, é preciso equilibrar inteligência, velocidade, confiabilidade e custo de acordo com a importância, o custo do erro, a urgência e a escala da tarefa
    • Mesmo dentro do mesmo fluxo de trabalho, o ponto ideal pode variar em cada etapa
  • O Luna entrega desempenho semelhante ao de modelos que eram de ponta há um ano por cerca de 6% do custo por tarefa e com velocidade quase 9 vezes maior
  • No Agents’ Last Exam, que mede trabalho especializado, ele superou o Fable 5 e reduziu o custo estimado por tarefa em cerca de 99%
  • Empresas podem primeiro definir os resultados necessários e o padrão de qualidade e, por meio de avaliações, separar os casos em que inteligência adicional melhora de fato o resultado daqueles em que processamento de baixo custo entrega a mesma qualidade
    • Em fluxos de trabalho de programação, o Sol pode resolver incertezas e montar o planejamento
    • A implementação de mudanças claramente definidas, a escrita e execução de testes e a avaliação dos resultados podem ficar com o Luna
  • A família GPT‑5.6 amplia as opções para aplicar a inteligência necessária em cada etapa e pagar de acordo com o valor gerado

Ganhos de eficiência do modelo ao agente

  • Os ganhos de eficiência acontecem em conjunto no modelo, no sistema de inferência que executa o modelo e no harness de agentes que conecta ferramentas e contexto
    • Os modelos GPT‑5.6 processam tarefas por caminhos mais diretos
    • O roteamento aprimorado aumenta o aproveitamento do hardware
    • O software de produção otimizado gera tokens com mais eficiência
    • O gerenciamento de contexto aprimorado ajuda os agentes a não repetirem tarefas já concluídas
  • Com os mesmos recursos computacionais, é possível concluir mais trabalho útil, reduzindo tempo, tokens e custo por resultado

Otimizações adicionais apoiadas pelo Sol

  • Em processos conduzidos por humanos, o GPT‑5.6 Sol reescreveu e otimizou de forma autônoma kernels de produção
  • Ele projetou e executou centenas de experimentos para melhorar a geração de tokens e monitorou o treinamento, intervindo quando surgiam problemas
  • O trabalho nos kernels reduziu em 20% o custo de ponta a ponta da oferta do modelo, e os experimentos elevaram a eficiência da geração de tokens em mais de 15%
  • À medida que o desempenho e a autonomia do modelo aumentam, forma-se um ciclo de feedback que acelera a descoberta do próximo ganho de eficiência
  • O processo de engenharia relacionado pode ser visto em Apresentando as melhorias de eficiência do GPT‑5.6

Estratégia de computação para sustentar a escalabilidade

  • Para atender à forte demanda por inteligência, é preciso não só mais recursos computacionais, mas também computação mais produtiva
  • A OpenAI constrói um portfólio de infraestrutura resiliente e aloca cada carga de trabalho ao sistema mais adequado para executá-la
    • Com a redução de preço do Luna e Terra, torna-se mais viável operar tarefas em grande volume em escala maior
    • O Fast mode oferece acesso mais rápido à API para tarefas com Sol em que o tempo de resposta é crítico
  • Fica mais econômico operar em larga escala análises de grandes volumes de documentos, classificação de interações com clientes e tarefas repetitivas de implementação
  • Cargas de trabalho complexas com Sol podem ser processadas mais rapidamente quando a velocidade for importante o bastante para justificar o custo adicional
  • Modelos mais poderosos apoiam melhorias posteriores das equipes técnicas, encurtando o tempo necessário para aumentar o desempenho e reduzir custos

Funcionamento e compatibilidade do Fast mode

  • O Fast mode da API substitui o Priority Processing e corresponde ao /fast do Codex
  • No GPT‑5.6 Sol, ele oferece velocidade até 2,5 vezes maior que o processamento Standard por 2 vezes o preço, sem alterar o nível de inteligência
  • Mantendo compatibilidade retroativa, as requisições de API existentes com a tag priority continuarão funcionando

Disponibilidade e preços da API

  • GPT‑5.6 Terra e Luna continuam disponíveis no ChatGPT Work, Codex e OpenAI API
    • Usuários Free e Go do ChatGPT Work e do Codex podem acessar o Terra
    • Usuários Plus, Pro, Business e Enterprise podem escolher entre Terra e Luna
  • A partir de 30 de julho, os preços da API por 1 milhão de tokens são os seguintes
    • Terra: entrada $2, saída $12
    • Luna: entrada $0.20, saída $1.20
  • Os preços das assinaturas e os orçamentos de cotas do ChatGPT e do Codex permanecem os mesmos, mas os créditos consumidos ao usar Terra e Luna diminuem
  • Na AWS, a mudança de preço será aplicada gradualmente a partir de mais tarde em 30 de julho
  • Os preços completos podem ser consultados em informações de preços da API

1 comentários

 
GN⁺ 3 시간 전
Opiniões no Hacker News
  • A frase de John Wanamaker, “metade do dinheiro gasto em publicidade é desperdiçada, mas não sei qual metade”, se encaixa melhor na escolha de modelos. Sabemos que a maioria das tarefas não precisa de um modelo poderoso, mas distinguir tarefas simples de tarefas difíceis é, por si só, um problema difícil de resolver — e talvez indecidível

    • Não é tão difícil. Primeiro é só encontrar uma biblioteca que resolva razoavelmente o problema da parada, e dá para começar imediatamente
    • Ainda não chegamos ao estágio de rodar 1.000 agentes ao mesmo tempo. Por enquanto, eu mesmo gerencio com atenção as tarefas importantes executadas por agentes, então não há motivo para escolher um modelo abaixo do estado da arte. Em tarefas fora de programação, isso pode mudar
    • Se houver agentes e usuários, é possível executar avaliações para verificar os limites do modelo. O Luna não é o melhor em chamadas de ferramentas, mas, se o problema e as ferramentas forem definidos com clareza, ele chega perto do Gemini 4 Flash por um custo muito menor
    • A perspectiva em https://news.ycombinator.com/item?id=49113236 faz bastante sentido
      O HN poderia operar como um BBS até com hardware dos anos 1970, mas, na prática, faz essencialmente a mesma coisa usando uma CPU com cerca de 10 bilhões de transistores, não cerca de 10 mil, e ninguém se preocupa com isso
  • “A partir de hoje, estamos reduzindo em 80% o custo do GPT‑5.6 Luna, nosso modelo mais rápido e barato” deixa a gente sem palavras. Eu achava que tínhamos entrado em um platô de melhorias de 5% a 10% ao longo de vários meses, mas, com uma mudança tão brusca, fica a dúvida de onde está o piso dos preços

    • Quando a inteligência dos modelos passar a lidar de forma confiável com 90% a 95% do trabalho de conhecimento atual, os pesos serão gravados em silício e a relação preço/desempenho vai melhorar mais 10 vezes
      Clusters dinâmicos de GPUs serão usados para os 5% restantes e para expandir a fronteira do estado da arte, e tarefas que hoje não são feitas por serem difíceis demais para a maioria dos trabalhadores do conhecimento começarão a ser executadas
    • Não dá para saber quanto do preço atual é custo real e quanto é uma estratégia de dominação de mercado subsidiada por investidores. Se a OpenAI estiver confiante em seu caixa, isso pode ser uma tentativa de pressionar a Anthropic, que tem um produto de referência
    • São números impressionantes a ponto de serem difíceis de acreditar. Mesmo que o desempenho seja alguns pontos percentuais menor, se for mais de 80% mais barato que os concorrentes e oferecido por uma empresa americana em uma hyperscaler americana, para a maioria das empresas será difícil justificar outra escolha
    • Significa que o custo caiu 80%, não que a eficiência melhorou 80%. O Luna pode ter sido caro desde o início, e também faltam informações sobre o próprio modelo
      Se for uma melhoria real de eficiência, provavelmente há contrapartidas, como piora de qualidade por quantização agressiva ou compressão de cache KV
    • Mesmo melhorias de 5% a 10% a cada poucos meses já são bastante surpreendentes. Fico curioso sobre a pressão que o Kimi 3 deve estar exercendo dentro da Anthropic, da OpenAI e do Google
      À medida que tokens ficarem mais rápidos e baratos a cada ano, fábricas de IA que imitam equipes de especialistas e um paralelismo muito maior se tornarão realidade
  • É surpreendente terem tornado o Luna, que já era barato e tinha ótimo desempenho, 5 vezes mais barato. No trabalho uso o Sol; em casa, o Luna. A diferença é clara, mas não esmagadora. Depois de um ano de preços subindo continuamente, parece que Luna, Kimi K3 e GLM 5.2 marcaram uma volta à queda

    • É difícil ver isso como parte da mesma tendência do Kimi ou do GLM. O GLM 5.2 foi um grande aumento para os padrões de modelos chineses, e o Kimi K3 subiu ainda mais, aproximando-se dos preços da OpenAI
      Depois de a OpenAI e a Anthropic elevarem preços por vários meses, um laboratório americano fez uma grande redução de preço, então isso parece mais o movimento oposto
    • Como as empresas estão competindo dia e noite para conquistar o mercado, no fim é só uma questão de tempo
    • Tenho dúvidas se o Kimi é realmente barato; na verdade, é um modelo bem caro
    • Para tarefas em que dá para verificar o resultado, como correções de bugs, qualquer modelo pode ser aproveitado desde que se escreva um processo de validação adequado
  • Dizem que “trabalhos em kernels reduziram em 20% o custo ponta a ponta de servir o modelo, e experimentos aumentaram a eficiência de geração de tokens em mais de 15%”. Se o custo de servir o GPT-5.6 caiu 20%, fico me perguntando se isso significa economizar dezenas de bilhões de dólares por mês
    Segundo materiais do IPO da SpaceX, a Anthropic gastou US$ 1,25 bilhão no aluguel da capacidade de inferência de dois data centers Colossus, mas, considerando a capacidade já existente em AWS e outros provedores, não dá para saber que parcela isso representa do total. É bem provável que o custo mensal de inferência da OpenAI também esteja na casa de dezenas de bilhões de dólares, então uma economia de 20% é uma mudança enorme

    • Cerca de dois anos atrás, o Gemini 2.5 ajudou a melhorar kernels próprios e mal chegou a um ganho de eficiência de 1%; agora isso subiu para 20%
    • Imagino alguém colocando no currículo: “reduzi o custo de inferência em 20%, fazendo a empresa economizar dezenas de bilhões de dólares por mês
  • Essa mudança parece a transição da internet discada para a banda larga. Eu já recomendava muito o Luna para pesquisa profunda, e poder executar 5 vezes mais pelo mesmo custo é enorme
    Hoje já rodo 10 agentes em paralelo para gerar hipóteses; imaginar 50 é difícil. Se o custo de executar o mesmo prompt e o mesmo modelo dezenas de vezes ficar baixo, a estatística se torna muito mais interessante e poderosa

    • Tenho curiosidade de saber como exatamente você executa “pesquisa profunda”
    • Gostaria de saber mais sobre geração de hipóteses e o processo de pesquisa. Eu usava o Sol por achar que boas ideias exigem mais capacidade de raciocínio, mas talvez, a partir de certo ponto, quantidade supere qualidade
    • Tenho curiosidade sobre quais tarefas se beneficiam do aumento no número de agentes e quais não
  • O novo preço do Luna foi inesperado, e não parece haver no mercado algo que concorra com essa relação preço/desempenho
    Em apps de produção, a OpenAI agora é claramente a melhor provedora. A API é estável e rica em recursos, e a relação preço/desempenho é excelente em toda a linha de modelos. Por muito tempo usei modelos de pesos abertos, como Kimi K2.5, na Fireworks, mas havia problemas intermitentes, e o mesmo ocorria com Anthropic e Google. A OpenAI é rápida e oferece melhor relação preço/desempenho em praticamente todos os níveis de inteligência

    • A API da OpenAI é muito estável; nem lembro quando foi a última falha ou indisponibilidade
  • Normalmente verifico o gráfico de preço/desempenho do OpenRouter e ativo "Show Pareto" à direita. Em projetos pessoais eu ainda usava o GLM-5.2, mas agora o Luna se tornou a escolha óbvia

    • Fico em dúvida se o OpenRouter já não dava 50% de desconto no Luna e no Terra desde o lançamento. Não sei como esse desconto ficará depois desta redução
    • Pela documentação oficial, o Luna parece mais próximo da antiga linha de modelos Nano; fico curioso se o desempenho em programação é realmente bom
  • A redução de 80% no preço do Luna é muito agressiva. Para a maioria das tarefas que não exigem inteligência de ponta, ele é uma escolha esmagadoramente boa, e há casos em que o Luna se compara ao Opus 5

    • O Luna foi feito para competir com o Haiku; fico curioso em quais tarefas ele é equivalente ao Opus
    • Havia uma diferença perceptível entre o xhigh do Sol e o max do Luna. O Sol entende melhor o prompt, enquanto o Luna precisa de instruções mais específicas e claras
  • Paguei antecipadamente por muitos tokens do DeepSeek v4 flash e, quando terminar de usá-los, quero comprar tokens do Luna por um tempo. Prefiro modelos baratos e rápidos e estou aposentado, então não me importo se às vezes eu perder tempo alternando manualmente para um modelo mais forte

  • É impressionante que o Luna tenha ficado 80% mais barato. Como o custo de computação continua caindo, no ano que vem o uso de API de modelos poderosos pode ficar mais barato que uma assinatura

    • Assinaturas mantêm os usuários presos por mais tempo e geram muito valor para as empresas, então a API não ficará mais barata que a assinatura