- Um modelo open source 9B para revisão de catálogos de e-commerce, ajustado por reinforcement learning por cerca de US$ 500, obteve pontuação maior que todas as configurações de modelos de fronteira usando as mesmas ferramentas, imagens e avaliador
- Em um gêmeo digital criado com 177.767 episódios de revisão, o modelo repetiu classificação de produtos, verificação de marca, extração de atributos e decisões de política, aprendendo nos pesos a taxonomia e os critérios de julgamento próprios da empresa
- O modelo treinado com GRPO alcançou 87,3% da pontuação máxima possível, relativamente 13,5% acima dos 76,9% da melhor configuração de fronteira, e 36% acima dos 64,2% do modelo-base sem treinamento
- O custo é de cerca de US$ 0,50 por 1.000 produtos, 40 vezes menor que a configuração de fronteira mais barata e cerca de 340 vezes menor que a mais cara; em escala de 40 milhões de itens por dia, a diferença anual fica em cerca de US$ 7 milhões contra US$ 500 milhões
- A abordagem é adequada para tarefas repetitivas em grande volume cujos resultados podem ser validados por regras, testes e rubricas; fatos que mudam devem ficar em ferramentas de busca, enquanto o modo de julgamento próprio da empresa deve ser aprendido pelo modelo
O modo de operação que separa os resultados dos investimentos em IA
- Desde o lançamento do ChatGPT, o uso de IA se expandiu de tarefas de baixo risco, como resumir documentos e rascunhar e-mails, para desenvolvimento de software, geração de conteúdo e a ideia de um cérebro da empresa (company brain) que conecta conhecimento interno, dados e ferramentas
- Nos dados de clientes da Ramp, as empresas no quartil superior de gastos com IA mais que dobraram a receita entre novembro de 2022 e dezembro de 2025, enquanto empresas sem gastos com IA cresceram cerca de 15% no mesmo período
- Nas organizações que geram resultados, os seguintes modos de operação se repetem
- Redesenho do fluxo de trabalho: não basta adicionar um modelo aos processos existentes; é preciso redesenhar aprovações, revisões, passagens de responsabilidade e pontos de intervenção humana
- Na pesquisa da McKinsey de 2025 com organizações que usam IA generativa, o redesenho de fluxos de trabalho teve a maior correlação com impacto no EBIT, mas apenas 21% das organizações haviam redesenhado ao menos um fluxo
- Incentivo à experimentação: como modelos, ferramentas e melhores práticas mudam rapidamente, é preciso recompensar não só lançamentos bem-sucedidos, mas também experimentos e o compartilhamento de falhas
- Contexto de trabalho personalizado: acesso a dados, controle de acesso por solicitação, busca de evidências relevantes e gestão de janelas de contexto que se tornam mais desiguais quanto maiores ficam viram desafios de engenharia próprios
- Medição de uso e efeito: sem avaliações pontuadas sobre dados próprios, é difícil comprovar desempenho, custo de decisão e impacto na eficiência; métricas autorrelatadas de economia de tempo também podem ser imprecisas
- Redesenho do fluxo de trabalho: não basta adicionar um modelo aos processos existentes; é preciso redesenhar aprovações, revisões, passagens de responsabilidade e pontos de intervenção humana
Método de implantação para “possuir a inteligência”
- A configuração que aparece repetidamente combina modelos open source, dados de trabalho próprios da empresa e reinforcement learning em fluxos de trabalho que podem ser pontuados
- Modelos de fronteira são usados para verificar a possibilidade de automação e estabelecer uma linha de base inicial
- Durante as chamadas, acumulam-se registros de entradas, decisões e correções, que depois viram dados de treinamento para modelos especializados
- Quando se sai do protótipo e se entra em operação em grande volume, custo por chamada e desempenho viram prioridades
- Modelos de fronteira e modelos especializados não se substituem totalmente
- Modelos generalistas como ChatGPT ou Claude podem delegar a modelos especializados partes que exigem conhecimento interno
- Modelos especializados também podem chamar modelos de fronteira em tarefas que exigem alta capacidade generalista
- O modelo trabalha com ferramentas e dados da empresa, uma rubrica (rubric) pontua os resultados, e o sinal de recompensa atualiza o modelo
- Ao repetir dezenas de milhares de tarefas, o julgamento de trabalho se fixa nos pesos
- Fatos que mudam, como preço, estoque e documentos de política, permanecem nas ferramentas
Casos reais de implantação de modelos especializados
- A Bridgewater Associates treinou um modelo open source com rótulos de especialistas em investimento para julgar se artigos, comunicados e e-mails eram relevantes para uma tese de investimento e onde começavam trechos genéricos
- Só com prompts, não foi possível refletir de forma estável os critérios internos de julgamento
- O modelo treinado teve cerca de 30% menos erros que os principais modelos de fronteira e menor custo de inferência
- A Harvey aplicou modelos de pesos abertos e reinforcement learning a tarefas em que erros se acumulam ao longo de várias etapas, como due diligence de transações e redação de memorandos jurídicos
- Em sua rubrica própria, o agente jurídico superou GPT-5.5 e Claude Opus 4.8
- O Intercom Fin Apex foi pós-treinado com bilhões de interações de atendimento ao cliente para melhorar custo por chamada e taxa de resolução em uma escala de cerca de 2 milhões de problemas de clientes por semana
- A Intercom afirma que ele resolve mais problemas que os principais modelos de fronteira e com menor custo operacional
- O processo comum de implantação é criar uma linha de base com um modelo de fronteira cujo prompt e contexto foram otimizados e depois transferir registros de execução e aprendizados para um modelo menor, de propriedade da empresa
Integridade de catálogo e o problema de custo
- Catálogos de e-commerce precisam colocar todos os produtos na taxonomia correta e extrair com precisão, a partir de imagens e descrições, os atributos usados em busca, filtros, recomendações e operações posteriores
- Julgamentos incorretos reduzem a encontrabilidade dos produtos e a qualidade das recomendações, além de deixar passar violações de políticas
- Deixar passar produtos falsificados expõe clientes e marcas a fraudes
- Marcar produtos legítimos em excesso aumenta filas de revisão e o atrito para vendedores
- A escala da tarefa também é grande
- O eBay tem cerca de 2,5 bilhões de itens ativos
- O catálogo da Shopify recebe mais de 10 milhões de atualizações de produtos por dia
- O Walmart estima que precisaria de cerca de 100 vezes mais pessoas se fizesse apenas com humanos o trabalho de catálogo assistido por IA
- 71% dos consumidores dizem já ter devolvido um produto porque o item real era diferente do anúncio
- Para um marketplace de médio porte que processe cerca de 10 milhões de criações e alterações de produtos por dia, a revisão baseada em modelos de fronteira é estimada em cerca de US$ 500 milhões por ano, contra cerca de US$ 10 milhões para um modelo especializado ajustado
- A Shopify usa um modelo aberto ajustado para realizar cerca de 40 milhões de inferências de classificação de produtos por dia, porque APIs comerciais seriam economicamente inviáveis
Trabalho do agente de revisão de catálogo
- Ao revisar um produto, o agente pesquisa a taxonomia, verifica a marca, busca o esquema de atributos da categoria e então confirma uma decisão estruturada
- Se as evidências forem insuficientes ou o risco for alto, encaminha para revisão humana
- O exemplo de luvas de trabalho é processado nesta ordem
- Usa
search_taxonomypara encontrar a categoriaSafety Work Gloves - Usa
lookup_brandpara confirmar que AmazonBasics está registrada, mas não é protegida - Usa
get_attribute_schemapara consultar atributos de marca, cor, material e tamanho - Confirma a decisão
allowedjunto com a classificação e os atributos
- Usa
- O custo de deixar passar uma violação real foi definido como 7 vezes maior que o de um falso positivo, para treinar assimetricamente os dois tipos de erro
Gêmeo digital para treinamento
- Foram construídos 177.767 episódios de revisão usando imagens reais de produtos e anúncios do Amazon Berkeley Objects
- Cada episódio inclui imagem, título, descrição, marca declarada e região
- Violações de política controladas, imagens inconsistentes e alegações de marca conflitantes foram inseridas junto com alegações legítimas como casos negativos difíceis
- Todos os episódios têm uma resposta correta passível de pontuação
- O ambiente usado pelo modelo reproduz o trabalho de um analista real
- Pesquisa cerca de 13.000 categorias
- Verifica se a marca está registrada e protegida
- Busca os atributos exigidos pela categoria escolhida
- Confirma a classificação final, os atributos e a decisão de política
- O avaliador recompensa respostas corretas e penaliza violações omitidas, atributos sem evidência, classificações incorretas e chamadas desnecessárias a ferramentas
- Para que reinforcement learning seja possível, é preciso conseguir repetir falhas e novas tentativas em um ambiente que reproduza listas, ferramentas e custos de decisão do trabalho real
Linha de base com modelos de fronteira
- GPT-5.5, GPT-5.6-sol, Gemini 3.1 Pro, Claude Opus 4.8 e Claude Fable 5 foram comparados em 200 episódios de validação estratificados
- Todos os modelos usaram as mesmas ferramentas, imagens, avaliador e orçamento de turnos
- Foram testados tanto o prompt básico quanto um prompt otimizado com 2.800 caracteres contendo regras de extração, procedimentos de consulta e exemplos
- A melhor configuração de fronteira alcançou 76,9% da pontuação possível, enquanto o modelo 9B treinado com GRPO registrou 87,3%
- A cada episódio, os modelos de fronteira precisam reconstruir no prompt a taxonomia da loja, práticas de estoque, valores de atributos suportados e formas de lidar com exceções
- Instruções otimizadas conseguem compactar parte do conhecimento, mas não foi possível enumerar todas as exceções que afetam a pontuação
- As configurações de fronteira otimizadas convergiram para dentro de 0,1 ponto percentual entre si
- O Gemini, que tinha o melhor desempenho de extração zero-shot, piorou após a aplicação das instruções otimizadas
- As instruções adicionais aumentam o custo de tokens de entrada por chamada em 28% a 55%, dependendo do modelo
- O conhecimento de trabalho colocado no prompt custa a cada chamada, enquanto o conhecimento treinado permanece nos pesos
Treinamento GRPO na faixa de US$ 500
- Para o treinamento, foram alugadas 2 GPUs RTX PRO 6000: uma para gerar rollouts e outra para atualizações de gradiente
- A infraestrutura foi montada com o projeto open source prime-rl
- O treinamento completo levou 1.000 etapas de otimização, cerca de 3,5 dias e aproximadamente US$ 500 em custo de GPU
- Com cerca de 250 etapas e aproximadamente um dia de treinamento, o modelo já superou a faixa dos modelos de fronteira
- As etapas restantes foram usadas para extrair o desempenho máximo
- A pontuação final no benchmark rigoroso foi 0,626, equivalente a 87,3% do teto possível e cerca de 10 pontos percentuais acima da melhor configuração de fronteira
- No monitor de treinamento do W&B, a pontuação subiu de cerca de 0,50 para 0,671 na etapa 1.000
- O monitor usa 2 rollouts de amostra por episódio, por isso a pontuação fica um pouco acima da do harness rigoroso de benchmark
- O modelo-base 9B sem treinamento tinha 64,2% da pontuação máxima; após o ajuste, subiu para 87,3%, uma melhora relativa de cerca de 36%
- O modelo especializado aprende a relação entre taxonomia, ferramentas, políticas e recompensas, concentrando sua capacidade no comportamento de um ambiente específico, em troca de sacrificar capacidade generalista
- Quando surgirem modelos-base open source mais fortes, o mesmo método de treinamento pode ser transferido, e decisões registradas em operação também podem ser destiladas como dados de fine-tuning supervisionado para retreinamentos posteriores
Comparação de custo e qualidade
- O custo de inferência do modelo especializado é de cerca de US$ 0,50 por 1.000 produtos, e o ajuste rende cerca de 23 pontos percentuais a mais que o modelo-base 9B pelo mesmo custo
- As diferenças de custo em relação aos comparáveis são as seguintes
- A configuração de fronteira mais barata, Gemini, custa US$ 19 por 1.000 itens, 40 vezes mais que o modelo especializado
- A mais cara, GPT-5.5-pro, custa US$ 172 por 1.000 itens, cerca de 340 vezes mais
- A configuração com maior pontuação entre os modelos de fronteira custa US$ 34 por 1.000 itens, 68 vezes mais que o modelo especializado
- As instruções de 2.800 caracteres aumentaram o custo medido do GPT-5.5 em cerca de um terço, e esse imposto do prompt se repete em todas as chamadas posteriores
- Processando cerca de 40 milhões de itens por dia, a configuração de US$ 34 por 1.000 itens custaria cerca de US$ 500 milhões por ano, enquanto o modelo especializado de US$ 0,50 custaria cerca de US$ 7 milhões, uma diferença de custo de cerca de 98%
Tarefas adequadas e áreas a evitar
- As tarefas adequadas são trabalhos repetitivos de grande volume que transformam informação em decisão
- Roteamento de tickets
- Extração de campos de documentos
- Verificação de submissões conforme políticas
- Classificação de produtos
- Aprovação ou sinalização de transações
- A condição central é se o acerto ou erro de cada decisão pode ser verificado por regras, esquemas, testes, rubricas ou julgamento de especialistas
- Decisões que podem ser pontuadas podem ser praticadas pelo modelo
- Resultados que só podem ser discutidos sem consenso não podem ser praticados por esse método
- A ferramenta deve ser escolhida conforme frequência e verificabilidade
- Para tarefas frequentes e verificáveis, fine-tuning é adequado
- Para tarefas verificáveis, mas raras, é adequado um modelo de fronteira com prompt otimizado
- Para resultados que não podem ser verificados, deve haver intervenção humana
- Se o núcleo do problema não é julgamento, mas fatos que mudam, geração aumentada por recuperação é adequada independentemente da frequência
- Se uma ou mais das condições abaixo se aplicarem, a tarefa pode ser candidata a fine-tuning
- Custos por chamada e erros ocorrem em volume suficiente para se acumularem como custo real
- Todos os resultados podem ser verificados sem humanos por regras, testes ou rubricas
- Especialistas concordam sobre o critério da resposta correta
- Um modelo competente tem algum sucesso, mas não é consistente o bastante para ser confiável
- A resposta correta não pode surgir por palpite acidental
- A tarefa é composta por várias etapas de raciocínio, chamadas a ferramentas e decisão final
- Ela roda sobre ferramentas, esquemas e políticas próprios
- Cada tipo de erro tem custo diferente
- Dados sensíveis não podem ser enviados a uma infraestrutura fora do controle da empresa
- Ao executar o modelo dentro dos próprios limites, prompts e registros não são enviados a fornecedores externos, e é possível possuir e melhorar conjuntamente modelo, avaliações e dados
Exemplos de modelos especializados em outros setores
- O modelo de produção de software da Cognition, para escrever e corrigir código em produção, supera o GPT-5.5 em benchmarks padrão de programação e transmite 1.000 tokens por segundo
- A AT&T resume 900 mil chamadas de suporte por dia e marca informações pessoais
- Seu desempenho de detecção de informações pessoais é 17% superior ao do GPT-4o
- Ela revisa casos de fraude 12 vezes mais rápido com precisão no nível do GPT-4o e economiza milhões de dólares por ano
- O modelo de matching entre candidatos e vagas do LinkedIn é 4% mais preciso que o modelo GPT que substituiu
- É 75 vezes mais barato que o GPT-4 e 6 vezes mais barato que o GPT-4o
- O modelo de códigos de cobrança médica da Ambience Healthcare é mais preciso que 18 especialistas em um teste de painel gold
- Fica 12 pontos percentuais acima da abordagem baseada em prompt com o4-mini que serviu de base
- O modelo de atendimento telefônico da Phonely alcançou 99,2% de precisão, acima dos 94,7% do GPT-4o
- Foi 73% mais rápido que a configuração anterior com GPT-4o, e um cliente substituiu 350 atendentes humanos em um mês
- O modelo de e-mail e tickets de suporte da OpenPipe alcançou 93% em QA de suporte, superando os 50% do OpenAI o3
- É 64 vezes mais barato e 5 vezes mais rápido que o o3
- O Perplexity Sonar se iguala ao GPT-4o em respostas de busca com fontes, segundo teste cego com usuários
- É 10 vezes mais rápido que o GPT-4o e também mais barato
- O modelo de classificação de antecedentes criminais da Checkr supera o GPT-4 nos casos mais difíceis
- É 5 vezes mais barato e 30 vezes mais rápido que a configuração anterior com GPT-4
- Cada número é um resultado autorrelatado pelas próprias empresas, em relação ao modelo de fronteira que substituíram ou com o qual competiram
2 comentários
Faz parte da psicologia humana preferir entregar tudo para uma pessoa só, que se vira e resolve bem tudo por conta própria, em vez de procurar um especialista para cada caso e delegar só o escopo daquele trabalho
Não é inevitável que, com os LLMs, a função de recompensa acabe sendo desenhada de um jeito que aceite qualquer coisa que joguem neles?
Opiniões no Hacker News
O ponto central que os grandes laboratórios deixam passar é que, para a maioria dos usos, não é necessário ter conhecimento no nível de 50 doutores e capacidade em 12 idiomas, e as restrições de custo são muito mais importantes.
Se modelos de pesos abertos e fine-tuning barato se tornarem comuns, a economia dos modelos gigantescos e da infraestrutura em larga escala financiada por dívida desmorona.
Política ou a narrativa de ameaça chinesa são apenas justificativas superficiais; se modelos menores de pesos abertos virarem o padrão, será difícil para os grandes laboratórios sobreviverem.
A parte realmente cara no fine-tuning é coletar um bom conjunto de dados e, mesmo com dados limpos, é preciso ter capacidade para rodar avaliações e medir qualidade.
Somando custos de engenharia, rotulagem de dados e revisão contínua de qualidade, em muitos usos sai mais barato continuar usando modelos de laboratórios de ponta que já funcionam bem desde o início.
É parecido com o que aconteceu cerca de 10 anos atrás, quando o formato de entrevistas da FAANG se tornou público e todo mundo simplesmente o copiou.
A tese é que o caminho atual de continuar aumentando pesos e jogar hardware no problema é um beco sem saída e que, no fim, como sempre aconteceu na história da IA, voltaremos a algoritmos ajustados ao propósito.
Estou criando o TinyToT para provar que não são necessários tantos parâmetros assim.
Sempre que vejo esse tipo de história, duas coisas me incomodam.
Primeiro, já vi várias vezes estratégias de aproveitar melhor modelos existentes ou simplesmente não fazer nada e esperar produzirem resultados melhores do que retreinar. A comparação não deveria ser com o modelo de ponta atual, mas com o próximo modelo que será lançado enquanto você mantém o modelo ajustado.
Segundo, US$ 500 de custo de treinamento é o item mais barato; geração de dados e manutenção posterior do modelo são muito mais caras. Fico em dúvida sobre quantos casos de uso de fato conseguem criar 177 mil episódios pontuados.
Aqui foi preciso sintetizar isso com o Amazon Berkeley Objects, e o próprio conjunto de dados, que nem precisaria ter sido criado se existisse naturalmente, mostra melhor do que qualquer coisa a dificuldade de aplicar fine-tuning.
Assim como hardware especializado como GPUs continua sendo usado mesmo após avanços das CPUs, modelos especializados provavelmente continuarão superiores a modelos gerais em custo ou resultados.
Se o treinamento inicial custa US$ 500, o treinamento contínuo em si é relativamente barato. Criar novos exemplos conforme os dados mudam é mais caro, mas eles podem ser reutilizados no treinamento do próximo modelo e, de todo modo, algum volume disso é necessário para avaliar mudanças de modelo e de prompt.
No fim, isso nem sempre faz sentido por causa do custo de geração e treinamento de dados ou da falta de dados, e só é adequado para tarefas frequentes e verificáveis, como no gráfico do artigo. Talvez só seja realista para grandes empresas que processam milhões de decisões.
Os custos de manutenção de conjuntos de dados e modelos também estão virando serviços generalistas por meio de startups como Braintrust ou Hugging Face.
Modelos de ponta são muito bons em eliminar o próprio emprego.
Mesmo no GPT, o Luna já resolve 90% dos usos do Sol. O motivo pelo qual a China ainda se dedica tanto à destilação de modelos é a geração de dados de treinamento precisos, e a OpenAI e a Anthropic passaram anos coletando isso evitando problemas legais.
Quanto mais inteligentes os modelos ficam, mais as pessoas migram para alternativas baratas que fazem o trabalho suficientemente bem. Se a precisão já é de 99%, há pouco ganho real em usar um modelo de ponta, e isso parece ser o maior risco para os laboratórios dos EUA.
Para outras tarefas, modelos mais baratos são suficientes.
É parecido com eu não pensar em trocar a TV LCD que comprei por volta de 2018; outras tecnologias são semelhantes.
Tecnologias tendem a substituir novas tecnologias ou penetrar espaços vazios, mas raramente substituem áreas não tecnológicas como interação humana. Mesmo atividades de lazer diante de uma tela em geral caminham para relações parassociais.
Tenho muito interesse em fine-tuning de modelos abertos e estou procurando materiais que eu possa recomendar diretamente; também salvei este texto para ler em detalhe.
Rodei o Nemotron-3-Nano 30B localmente e tenho como alvo modelos de 30 bilhões a 120 bilhões de parâmetros. Mesmo só com o modelo base já dá para gerar valor real, mas acho que, em tarefas especializadas, o treinamento consegue fechar a lacuna final.
Gosto especialmente do fato de o autor pensar no processo inteiro, e pude confirmar a mesma estratégia de caso de uso e geração de valor. Como é um projeto de longo prazo, também pretendo comprar hardware para fine-tuning.
Não li o texto da Ramp, mas parece um caso de erro post hoc. Uma empresa com receita 2x maior tem dinheiro para gastar com IA, enquanto uma empresa com 1,15x talvez simplesmente não tenha
Ajustar modelos de linguagem menores, como LLMs pequenos ou BERT, é algo recomendado desde o início da chegada dos LLMs. As vantagens são claras: execução rápida, controle de toda a composição técnica e melhor adequação a domínios personalizados
Mas, como as APIs de grandes modelos de linguagem ainda são baratas, rápidas o suficiente e continuam melhorando, na prática não há tanto fine-tuning. Isso porque, assim que você investe tempo e dinheiro para lançar um modelo especializado, um novo modelo generalista pode superá-lo
Se um dia a evolução dos LLMs desacelerar ou os preços das APIs ficarem difíceis de bancar, a era do fine-tuning e dos modelos pequenos voltará
Gosto da matriz 2×2 que mostra quando ajustar um modelo e quando usar um modelo de ponta
Ainda assim, não está claro como o avaliador definiu a pontuação de cada episódio. Se foi um modelo de ponta que fez a avaliação, fico curioso se ela continuará válida mesmo depois que o modelo ajustado passar a executar a tarefa melhor do que esse modelo
Primeiro, ajuda destilar a distribuição de probabilidade completa de um fluxo de trabalho específico de domínio a partir de um modelo aberto maior, como o Kimi K3, e depois aplicar ao resultado um pipeline próprio e fechado de aprendizado por reforço. Usamos o GLM 5.2 para criar um modelo privado de 27B para inglês→SQL e obtivemos resultados melhores que o Fable, mas a capacidade de explicação desapareceu
Em áreas altamente especializadas, não é difícil superar modelos de ponta por uma fração mínima do custo. Mesmo sem um pipeline próprio de aprendizado por reforço, só a destilação já permite economizar muito, e um modelo de 27B pode se aproximar de um modelo de 3T nessa tarefa
Porém, provavelmente não funciona para tarefas ambiciosas demais para um modelo especialista
Recentemente, estive mergulhado em pesquisa automática para levar o 3B Foundation Model da Apple ao nível do Sonnet 4.6 em uma tarefa muito específica
Combinando adaptadores de fine-tuning com uma etapa determinística, cheguei a cerca de 90%
O processo completo, incluindo perguntas e respostas, 96 experimentos e linhagem, está documentado em https://alexisrondeau.me/tada/research/FMDiscovery/dashboard...
O gargalo não era o tamanho do modelo, mas uma pessoa que realmente entende o problema definir a função de recompensa
Existem muitas linguagens de programação excelentes para definir soluções, mas fico me perguntando onde está a linguagem para definir problemas com clareza