- A OpenAI elevou o desempenho por dólar da IA empresarial ao refletir ganhos de eficiência em modelos, sistemas de inferência e harnesses de agentes nos preços e na velocidade de processamento
- A partir de 30 de julho, o preço do Luna cai 80% e o do Terra 20%; na API, por 1 milhão de tokens, o Luna passa a custar $0.20 de entrada e $1.20 de saída, e o Terra $2 de entrada e $12 de saída
- O Luna oferece desempenho semelhante ao de modelos de ponta de um ano atrás por cerca de 6% do custo por tarefa e com velocidade quase 9 vezes maior; no Agents’ Last Exam, registrou desempenho superior ao do Fable 5 com custo estimado por tarefa cerca de 99% menor
- O Fast mode do GPT‑5.6 Sol substitui o antigo Priority Processing e oferece velocidade até 2,5 vezes maior que o modo Standard por 2 vezes o preço, mantendo o mesmo nível de inteligência
- Empresas podem ajustar o equilíbrio entre inteligência, velocidade e custo por meio de avaliações por etapa, usando o Sol para planejamento e resolução de incertezas e o Luna para implementação e testes bem definidos
Redução de preço do Luna e Terra e ganho de velocidade no Sol
- Os ganhos de eficiência operacional do GPT‑5.6 levaram à redução de preço do Luna e Terra e à melhora na velocidade de processamento da API do Sol
- O Luna, o modelo mais rápido e barato, fica 80% mais barato, e o Terra, modelo equilibrado para tarefas do dia a dia, fica 20% mais barato
- Nas assinaturas pagas do Codex e do ChatGPT Work, o uso desses dois modelos também passa a consumir menos créditos
- O preço das assinaturas e o orçamento de cotas em si não mudam
- O Luna consegue concluir fluxos de trabalho em várias etapas usando ferramentas, reduzindo o custo operacional de tarefas em grande volume que exigem alta qualidade
- O preço do Sol não muda
Escolha do modelo de acordo com o resultado esperado
- Para usar IA de forma eficiente, é preciso equilibrar inteligência, velocidade, confiabilidade e custo de acordo com a importância, o custo do erro, a urgência e a escala da tarefa
- Mesmo dentro do mesmo fluxo de trabalho, o ponto ideal pode variar em cada etapa
- O Luna entrega desempenho semelhante ao de modelos que eram de ponta há um ano por cerca de 6% do custo por tarefa e com velocidade quase 9 vezes maior
- No Agents’ Last Exam, que mede trabalho especializado, ele superou o Fable 5 e reduziu o custo estimado por tarefa em cerca de 99%
- Empresas podem primeiro definir os resultados necessários e o padrão de qualidade e, por meio de avaliações, separar os casos em que inteligência adicional melhora de fato o resultado daqueles em que processamento de baixo custo entrega a mesma qualidade
- Em fluxos de trabalho de programação, o Sol pode resolver incertezas e montar o planejamento
- A implementação de mudanças claramente definidas, a escrita e execução de testes e a avaliação dos resultados podem ficar com o Luna
- A família GPT‑5.6 amplia as opções para aplicar a inteligência necessária em cada etapa e pagar de acordo com o valor gerado
Ganhos de eficiência do modelo ao agente
- Os ganhos de eficiência acontecem em conjunto no modelo, no sistema de inferência que executa o modelo e no harness de agentes que conecta ferramentas e contexto
- Os modelos GPT‑5.6 processam tarefas por caminhos mais diretos
- O roteamento aprimorado aumenta o aproveitamento do hardware
- O software de produção otimizado gera tokens com mais eficiência
- O gerenciamento de contexto aprimorado ajuda os agentes a não repetirem tarefas já concluídas
- Com os mesmos recursos computacionais, é possível concluir mais trabalho útil, reduzindo tempo, tokens e custo por resultado
Otimizações adicionais apoiadas pelo Sol
- Em processos conduzidos por humanos, o GPT‑5.6 Sol reescreveu e otimizou de forma autônoma kernels de produção
- Ele projetou e executou centenas de experimentos para melhorar a geração de tokens e monitorou o treinamento, intervindo quando surgiam problemas
- O trabalho nos kernels reduziu em 20% o custo de ponta a ponta da oferta do modelo, e os experimentos elevaram a eficiência da geração de tokens em mais de 15%
- À medida que o desempenho e a autonomia do modelo aumentam, forma-se um ciclo de feedback que acelera a descoberta do próximo ganho de eficiência
- O processo de engenharia relacionado pode ser visto em Apresentando as melhorias de eficiência do GPT‑5.6
Estratégia de computação para sustentar a escalabilidade
- Para atender à forte demanda por inteligência, é preciso não só mais recursos computacionais, mas também computação mais produtiva
- A OpenAI constrói um portfólio de infraestrutura resiliente e aloca cada carga de trabalho ao sistema mais adequado para executá-la
- Com a redução de preço do Luna e Terra, torna-se mais viável operar tarefas em grande volume em escala maior
- O Fast mode oferece acesso mais rápido à API para tarefas com Sol em que o tempo de resposta é crítico
- Fica mais econômico operar em larga escala análises de grandes volumes de documentos, classificação de interações com clientes e tarefas repetitivas de implementação
- Cargas de trabalho complexas com Sol podem ser processadas mais rapidamente quando a velocidade for importante o bastante para justificar o custo adicional
- Modelos mais poderosos apoiam melhorias posteriores das equipes técnicas, encurtando o tempo necessário para aumentar o desempenho e reduzir custos
Funcionamento e compatibilidade do Fast mode
- O Fast mode da API substitui o Priority Processing e corresponde ao
/fastdo Codex - No GPT‑5.6 Sol, ele oferece velocidade até 2,5 vezes maior que o processamento Standard por 2 vezes o preço, sem alterar o nível de inteligência
- Mantendo compatibilidade retroativa, as requisições de API existentes com a tag
prioritycontinuarão funcionando
Disponibilidade e preços da API
- GPT‑5.6 Terra e Luna continuam disponíveis no ChatGPT Work, Codex e OpenAI API
- Usuários Free e Go do ChatGPT Work e do Codex podem acessar o Terra
- Usuários Plus, Pro, Business e Enterprise podem escolher entre Terra e Luna
- A partir de 30 de julho, os preços da API por 1 milhão de tokens são os seguintes
- Terra: entrada $2, saída $12
- Luna: entrada $0.20, saída $1.20
- Os preços das assinaturas e os orçamentos de cotas do ChatGPT e do Codex permanecem os mesmos, mas os créditos consumidos ao usar Terra e Luna diminuem
- Na AWS, a mudança de preço será aplicada gradualmente a partir de mais tarde em 30 de julho
- Os preços completos podem ser consultados em informações de preços da API
1 comentários
Opiniões no Hacker News
A frase de John Wanamaker, “metade do dinheiro gasto em publicidade é desperdiçada, mas não sei qual metade”, se encaixa melhor na escolha de modelos. Sabemos que a maioria das tarefas não precisa de um modelo poderoso, mas distinguir tarefas simples de tarefas difíceis é, por si só, um problema difícil de resolver — e talvez indecidível
O HN poderia operar como um BBS até com hardware dos anos 1970, mas, na prática, faz essencialmente a mesma coisa usando uma CPU com cerca de 10 bilhões de transistores, não cerca de 10 mil, e ninguém se preocupa com isso
“A partir de hoje, estamos reduzindo em 80% o custo do GPT‑5.6 Luna, nosso modelo mais rápido e barato” deixa a gente sem palavras. Eu achava que tínhamos entrado em um platô de melhorias de 5% a 10% ao longo de vários meses, mas, com uma mudança tão brusca, fica a dúvida de onde está o piso dos preços
Clusters dinâmicos de GPUs serão usados para os 5% restantes e para expandir a fronteira do estado da arte, e tarefas que hoje não são feitas por serem difíceis demais para a maioria dos trabalhadores do conhecimento começarão a ser executadas
Se for uma melhoria real de eficiência, provavelmente há contrapartidas, como piora de qualidade por quantização agressiva ou compressão de cache KV
À medida que tokens ficarem mais rápidos e baratos a cada ano, fábricas de IA que imitam equipes de especialistas e um paralelismo muito maior se tornarão realidade
É surpreendente terem tornado o Luna, que já era barato e tinha ótimo desempenho, 5 vezes mais barato. No trabalho uso o Sol; em casa, o Luna. A diferença é clara, mas não esmagadora. Depois de um ano de preços subindo continuamente, parece que Luna, Kimi K3 e GLM 5.2 marcaram uma volta à queda
Depois de a OpenAI e a Anthropic elevarem preços por vários meses, um laboratório americano fez uma grande redução de preço, então isso parece mais o movimento oposto
Dizem que “trabalhos em kernels reduziram em 20% o custo ponta a ponta de servir o modelo, e experimentos aumentaram a eficiência de geração de tokens em mais de 15%”. Se o custo de servir o GPT-5.6 caiu 20%, fico me perguntando se isso significa economizar dezenas de bilhões de dólares por mês
Segundo materiais do IPO da SpaceX, a Anthropic gastou US$ 1,25 bilhão no aluguel da capacidade de inferência de dois data centers Colossus, mas, considerando a capacidade já existente em AWS e outros provedores, não dá para saber que parcela isso representa do total. É bem provável que o custo mensal de inferência da OpenAI também esteja na casa de dezenas de bilhões de dólares, então uma economia de 20% é uma mudança enorme
Essa mudança parece a transição da internet discada para a banda larga. Eu já recomendava muito o Luna para pesquisa profunda, e poder executar 5 vezes mais pelo mesmo custo é enorme
Hoje já rodo 10 agentes em paralelo para gerar hipóteses; imaginar 50 é difícil. Se o custo de executar o mesmo prompt e o mesmo modelo dezenas de vezes ficar baixo, a estatística se torna muito mais interessante e poderosa
O novo preço do Luna foi inesperado, e não parece haver no mercado algo que concorra com essa relação preço/desempenho
Em apps de produção, a OpenAI agora é claramente a melhor provedora. A API é estável e rica em recursos, e a relação preço/desempenho é excelente em toda a linha de modelos. Por muito tempo usei modelos de pesos abertos, como Kimi K2.5, na Fireworks, mas havia problemas intermitentes, e o mesmo ocorria com Anthropic e Google. A OpenAI é rápida e oferece melhor relação preço/desempenho em praticamente todos os níveis de inteligência
Normalmente verifico o gráfico de preço/desempenho do OpenRouter e ativo
"Show Pareto"à direita. Em projetos pessoais eu ainda usava o GLM-5.2, mas agora o Luna se tornou a escolha óbviaA redução de 80% no preço do Luna é muito agressiva. Para a maioria das tarefas que não exigem inteligência de ponta, ele é uma escolha esmagadoramente boa, e há casos em que o Luna se compara ao Opus 5
xhighdo Sol e omaxdo Luna. O Sol entende melhor o prompt, enquanto o Luna precisa de instruções mais específicas e clarasPaguei antecipadamente por muitos tokens do DeepSeek v4 flash e, quando terminar de usá-los, quero comprar tokens do Luna por um tempo. Prefiro modelos baratos e rápidos e estou aposentado, então não me importo se às vezes eu perder tempo alternando manualmente para um modelo mais forte
É impressionante que o Luna tenha ficado 80% mais barato. Como o custo de computação continua caindo, no ano que vem o uso de API de modelos poderosos pode ficar mais barato que uma assinatura