GPT-4.5, vida comercial de 4,5 meses
- O GPT-4.5, o modelo mais caro no lançamento em fevereiro de 2025 (entrada US$ 75/saída US$ 150 por 1M de tokens), foi removido da API antes de completar 5 meses. Foi o modelo de vida mais curta na história da OpenAI, e os desenvolvedores que criaram produtos sobre ele ficaram presos em ciclos de migração
- A lição que o mercado tirou foi "não construa um negócio em cima do modelo de outra pessoa", mas o tema deste texto é que essa lição está apenas meio certa
A camada de modelos está se comoditizando
- No SWE-bench Verified, os 5 modelos no topo estão dentro de uma diferença de 0,4 ponto, mas os preços variam 5 vezes. No mercado como um todo, a diferença entre os tokens mais baratos e os tokens premium de inferência passa de 600 vezes — preço já não é mais um indicador indireto de desempenho
- A distância entre open weights e fronteira fechada, medida por benchmarks públicos, está estável há mais de 18 meses em torno de uma média de 4 meses (8 a 10 meses em benchmarks privados). A diferença é real, mas estreita, previsível e não está aumentando
Quatro riscos de depender de APIs de fronteira
- Variação de preço: o Claude 3.5 Haiku teve aumento de 4 vezes e, um mês depois, uma reversão parcial; o o3 caiu 80% da noite para o dia. Um tokenizer novo pode gerar até 35% mais tokens para o mesmo texto — o problema não é a direção do aumento ou da queda, mas a variância
- Ciclo de descontinuação: em fevereiro de 2026, GPT-4o, 4.1 e o4-mini serão encerrados em lote com cerca de 3 meses de aviso. Surgiu até o termo "prompt drift" para descrever prompts ajustados por um ano que passam a se comportar de forma diferente em um novo modelo
- Absorção pela plataforma: a vulnerabilidade dos wrappers de GPT, quando o provedor incorpora ao próprio produto as funções que o wrapper oferecia
- Regulação: em junho de 2026, o Anthropic Fable 5 ficou suspenso globalmente por 19 dias devido a diretrizes de controle de exportação dos EUA — uma variável que nem o próprio provedor consegue escolher
Os quatro riscos vêm de um único problema: depender de fronteira hospedada por terceiros
- Rodar open source por conta própria elimina variação de preço, descontinuação e suspensão regulatória, e reduz a absorção pela plataforma. Pesos já baixados não são descontinuados nem recolhidos
- O custo, de forma honesta: ao rodar em GPU de consumidor, cerca de US$ 1 por milhão de tokens (depreciação em 3 anos + eletricidade, 30% de utilização), mais caro que a API open weights mais barata (US$ 0,14/US$ 0,28), portanto perde em custo absoluto
- A economia de rodar por conta própria não está na média, mas na variância. Além disso, a API mais barata preserva os dados de entrada para treinamento — o preço oculto do menor custo são os seus dados
Mesmo diagnóstico, prescrição oposta
- O diagnóstico de que um negócio de conteúdo, na escala das big techs, é vulnerável ao depender de APIs de fronteira está correto
- Mas, quando um player pequeno roda open source por conta própria na faixa good-enough, ele corta a própria dependência que cria a vulnerabilidade — fica errado no momento em que se copia o diagnóstico das big techs diretamente para startups pequenas
Não é de graça (4 freios)
- Input comoditizado gera output comoditizado — o moat só vem de distribuição, dados proprietários, integração de domínio, verificação e julgamento, que são ortogonais à IA
- A linha do good-enough se move para cima — se você simplesmente estacionar nessa linha, terá estacionado numa zona de queda de margem
- A fronteira não é o domínio, mas a dificuldade da tarefa: em uma avaliação do NIST, os melhores open weights ficaram praticamente empatados com a fronteira em matemática, mas ficaram mais de 30 pontos atrás em cibersegurança, raciocínio abstrato e codificação agêntica de longo prazo
- Rodar por conta própria exige diretamente capacidade de operação, tuning e verificação, além de responsabilidade de compliance — a dependência não desapareceu; ela se deslocou do provedor da API para a minha própria competência
Conclusão: o ponto decisivo é verificação e julgamento
- Mesmo usando o mesmo modelo aberto, se você entrega a saída diretamente, é uma demo; se coloca fatos, números, fórmulas e identificação atrás de uma camada de verificação, é um produto
- O ponto decisivo em AI Content é o julgamento de engenharia que transforma um modelo barato em um produto confiável, e open source se torna uma arma para quem tem esse julgamento
Este é um texto de autoria própria. Comentários sobre design de stack entre execução local e API são bem-vindos.
Ainda não há comentários.