1 pontos por selene 2 시간 전 | Ainda não há comentários. | Compartilhar no WhatsApp

• Resolvendo a complexidade dos modelos de produção: o sistema de recomendação existente da Netflix dependia de milhares de features criadas manualmente e de uma arquitetura complexa, o que tornava alto o custo de adicionar novos casos de uso; o GenRec, baseado em grandes modelos de linguagem (LLM), foi desenvolvido para substituí-lo.
• Pipeline central do GenRec: o GenRec converte histórico do usuário, metadados de itens e contexto em prompts de linguagem natural (Verbalization) e gera rankings de recomendação combinando um foundation LLM ajustado com dados específicos da Netflix e uma cabeça de pontuação (Scoring Head) com reconhecimento do catálogo.
• Framework de treinamento em duas etapas: na Phase 1, um LLM open source é adaptado ao corpus da Netflix para aprender conteúdo e padrões de comportamento; na Phase 2, é feito pós-treinamento com base em dados de ranking e objetivos de recompensa.
• Introdução da engenharia de contexto: para lidar com restrições de orçamento de tokens, foi aplicada engenharia de contexto que preserva interações de alto sinal, omite eventos de baixo sinal ou comprime comportamentos repetidos, reduzindo significativamente tokens e custos sem degradar a qualidade.
• Função objetivo de ranking ponderada por recompensa: foi usada uma função de perda ponderada por recompensa que reflete proxies de satisfação de longo prazo dos membros e objetivos de negócio (reajuste por tipo de conteúdo e estágio de lançamento), alcançando otimização além de simples cliques.
• Inferência somente de prefill baseada em vLLM: na stack interna de serving de LLM usando vLLM, o sistema roda em modo somente prefill (prefill-only), em vez de decodificação autoregressiva, calculando as pontuações de todo o conjunto de candidatos em um único forward pass e otimizando o custo de serving.
• Resultados de testes A/B online: em um teste A/B de larga escala realizado por quatro semanas com cerca de 10% do tráfego, o GenRec registrou melhorias estatisticamente significativas em métricas online de curto e longo prazo em comparação com o modelo de ranking de produção existente, mesmo usando muito menos dados rotulados da Phase 2 e sinais de entrada.

Ainda não há comentários.

Ainda não há comentários.