1 pontos por GN⁺ 2 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • Trata-se de um modelo multimodal que busca aprender e integrar geração, compreensão e previsão de ações em uma única arquitetura, treinando conjuntamente imagem, vídeo e áudio, com disponibilidade inicial em Early Access a partir do FLUX 3 Video
  • Aprende restrições mútuas entre a estrutura espacial das imagens, a dinâmica temporal e física dos vídeos e as relações entre eventos e sons no áudio, expandindo dados e recursos computacionais com base no Self-Flow
  • Gera vídeos com áudio nativo de até 20 segundos por vez e, em avaliações iniciais, foi preferido em comparações em até 69% contra o Grok Imagine Video, 77% contra o Runway Gen-4.5 e 93% contra o Luma Ray 3.2
  • Suporta síntese e edição de imagens, além de renderização de texto multilíngue, e pode ser usado como modelo de ação robótica ao ajustar um backbone de vídeo pré-treinado com dados limitados específicos por tarefa
  • Video, Image, Action e o FLUX 3 Dev com pesos abertos serão lançados em etapas, com o objetivo de longo prazo de integrar percepção, ação e previsão de linguagem em um único modelo

Um modelo multimodal que aprende a realidade em conjunto

  • O FLUX 3 trata imagem, vídeo e áudio não como elementos separados, mas como resultados da observação da mesma realidade por sensores diferentes
    • A imagem captura a estrutura espacial e as relações em um determinado momento
    • O vídeo restaura a dimensão temporal e revela movimento, dinâmica temporal e leis físicas
    • O áudio mostra fenômenos mecânicos e relações causais acústicas que são difíceis de detectar apenas pela visão
    • A linguagem conecta essas percepções a objetivos, abstrações e instruções
  • Ao aprender múltiplas modalidades em conjunto, é possível aproveitar restrições mútuas como o fato de que sons devem coincidir com colisões, movimentos devem seguir a massa e o futuro deve continuar a partir do passado
  • O FLUX 3 é o primeiro modelo construído apenas com esses princípios e busca uma inteligência visual do mundo real capaz de perceber, prever e agir em ambientes físicos e digitais
  • Os resultados iniciais em criação de conteúdo e IA física mostram o potencial dessa abordagem

Arquitetura unificada baseada em Self-Flow

  • O Self-Flow é uma abordagem para alinhar com eficiência geração e compreensão multimodais em uma única arquitetura base
  • Com base no Self-Flow, o FLUX 3 amplia significativamente o volume de computação e de dados para treinar simultaneamente vídeo, imagem e áudio
  • Na comparação pública, foram usados a Fréchet distance normalizada em 100 pelo critério de Flow Matching para erros de geração por modalidade e a taxa de sucesso de manipulação em 4 grupos de tarefas após fine-tuning

Geração de vídeo e áudio nativo

  • O FLUX 3 pode criar, em uma única geração, diversos vídeos e áudios com até 20 segundos de duração
  • O suporte inclui:
    • geração de texto para vídeo
    • geração de imagem para vídeo, continuando um frame inicial ou usando uma imagem como referência visual
    • geração de vídeo para vídeo, transferindo elementos centrais como um personagem original para novas cenas ou contextos
    • geração contínua de vídeo e áudio, dando sequência ao vídeo e áudio de entrada
    • geração de keyframe-to-video com controle da transição entre cenas especificadas
    • diálogos multilíngues
    • vários estilos visuais e proporções de tela que vão além do formato cinematográfico tradicional
    • encadeamento agentic que conecta clipes individuais em sequências longas com múltiplos takes
    • ampla variedade de estilos, de vídeo de camcorder a animação e filmagem cinematográfica
    • geração de tipografia e design de animação
  • Todas as saídas de vídeo incluem geração de áudio nativo

Avaliação inicial de vídeo

  • A avaliação preliminar foi realizada com clipes de 10 segundos em 720p de texto para vídeo com áudio
  • Nas comparações, a taxa de preferência pelo FLUX 3 foi a seguinte:
    • até 69% em relação ao Grok Imagine Video
    • 60% em relação ao Kling v3 Pro
    • 59% em relação ao Happy Horse v1 e 57% em relação ao Happy Horse 1.1
    • 52% em relação ao Seedance 2.0 e ao Gemini Omni Flash, respectivamente
    • 77% em relação ao Runway Gen-4.5
    • 93% em relação ao Luma Ray 3.2
  • Como o modelo e o harness ao redor dele ainda estão em desenvolvimento, os resultados são preliminares e devem melhorar durante o período de Early Access
  • As áreas atualmente mais fortes incluem captura de expressões humanas, conexão entre eventos físicos e sons, e processamento multilíngue
  • É possível combinar vários clipes mantendo a consistência do personagem ao longo da cena com referência visual, criando sequências de vários minutos
  • O FLUX 3 Video está disponível em Early Access

Síntese e edição de imagens

  • O FLUX 3 pode sintetizar e editar imagens em vários estilos, proporções e resoluções
  • Em avaliações preliminares de uma etapa intermediária de treinamento, houve grande melhora em relação às versões anteriores do FLUX no tratamento de prompts complexos e na geração de texto
  • Ele pode gerar diversos estilos de saída e renderizar texto em vários idiomas com alta precisão
  • Os resultados da avaliação ainda são preliminares e devem ser aprimorados antes do lançamento oficial
  • O Early Access do FLUX 3 Image está previsto para começar nas próximas semanas

Previsão de ações e aprendizado robótico

  • Para expandir a compreensão da realidade para previsão de ações, são usados dois caminhos
    • ampliar o trabalho inicial do Self-Flow para integrar previsão nativa de ações ao próprio FLUX 3
    • usar um backbone de vídeo pré-treinado como base para entender dinâmica e fazer fine-tuning de modelos de ação especializados com dados limitados específicos por tarefa
  • Em parceria com a mimic robotics, parceira inicial de abordagem, foi desenvolvido o FLUX-mimic

Lançamento gradual por funcionalidade

  • Cada funcionalidade será disponibilizada ao longo das próximas semanas e meses, passando por Early Access para um lançamento suave, coleta de feedback e testes rigorosos de segurança
  • Todas derivam do mesmo modelo multimodal baseado em Flow Matching
    • FLUX 3 Video: geração e edição de vídeo e áudio via API e acesso a pesos privados
    • FLUX-mimic·FLUX 3 Action: previsão de ações para parceiros selecionados de pesquisa e comerciais, começando pela mimic robotics
    • FLUX 3 Image: síntese e edição de imagens via API e acesso a pesos privados
    • FLUX 3 Dev: oferta de pesos abertos do backbone multimodal para geração de conteúdo de vídeo, áudio e imagem, além de previsão de ações
  • Mais detalhes técnicos da abordagem base também serão divulgados, e já é possível solicitar Early Access

Integração de percepção, ação e linguagem

  • Entre as aplicações futuras estão edição interativa de imagem e vídeo, simulação, uso de computador e IA física
  • Ao mesmo tempo em que lança gradualmente as funcionalidades atuais, a empresa também está desenvolvendo a próxima geração do modelo
  • O objetivo final é combinar percepção, ação e previsão de linguagem em um único modelo integrado

1 comentários

 
GN⁺ 2 시간 전
Comentários do Hacker News
  • Espero que a versão com pesos abertos seja o estado da arte (SOTA)
    Disseram que, nas próximas semanas ou meses, vão disponibilizar o FLUX 3 Dev, um modelo multimodal para criação de conteúdo e previsão de ações, com pesos abertos, além de divulgar detalhes técnicos da abordagem de base

    • A promessa de pesos abertos é bem-vinda, mas houve comentários de que promessas parecidas no passado não se concretizaram
      Se o modelo de base sair como versão Dev, também é difícil entender só pelo post o que estaria faltando
  • Quase não há exemplos com pessoas, usaram o termo world model de forma meio solta, e embora falem em vídeo de 20 segundos, na prática só mostram jump cuts
    No fim, o ponto principal parece ser sempre “em breve”

    • No /r/stablediffusion há muitos exemplos de vídeo publicados
    • O termo world model, usado em aprendizado por reforço baseado em modelo, agora parece poder se referir até a algo tão simples quanto regressão linear
      Talvez o próprio campo de RL tenha pegado esse termo emprestado das ciências do comportamento, então pode ser melhor simplesmente aceitar isso. É parecido com filósofos e artistas visuais usando mal orientado a objetos, cada um à sua maneira
    • A forma de divulgação foi tão estranha que fiquei me perguntando onde exatamente era para ver os vídeos
  • As reações aqui são surpreendentemente negativas e cínicas, mas para mim o desempenho parece bastante impressionante
    Também existe aquela ideia de que as pessoas negativas sempre são as primeiras a deixar comentários maldosos, então vou observar mais um pouco

    • Seria interessante fazer uma análise de série temporal do humor do HN
      Tenho a sensação de que o clima no HN anda mais negativo ultimamente, e espero estar enganado
    • Há uma boa chance de ser realmente um bom modelo, mas depois de o Qwen-Image-3 mostrar capacidade de criar imagens que parecem renderizadas em LaTeX e de compor vários elementos lado a lado ou com profundidade, fico em dúvida se focar só na qualidade visual é mesmo a direção certa
    • Tenho usado ativamente LLMs de alto desempenho mais recentes para programação e para criar ferramentas de automação, delegando a eles o trabalho pesado de conectar diferentes projetos open source e montar projetos novos
      Se você tiver o ambiente de execução adequado e entender o domínio o suficiente para perceber quando o modelo entrou em raciocínio errado ou produziu resultados sutilmente incorretos, sou bastante otimista. Por outro lado, quando vejo as redes sociais inundadas de imagens e vídeos horríveis gerados por IA, sou bem mais pessimista quanto à utilidade real de geradores totalmente sintéticos de imagem e vídeo. Quando chegam às mãos de milhões de pessoas, parecem ser usados mais para prejudicar do que para beneficiar a sociedade
    • Comparado ao holodeck de Star Trek, isso não é tão interessante
    • Como Martin Scorsese agora participa como conselheiro, a BFL provavelmente continuará se posicionando como um laboratório para cineastas
      Se esse modelo de vídeo estiver em um nível parecido com o Seedance 2.0, o custo será alto demais para geração de conteúdo de baixa qualidade, e ele provavelmente vai entrar no pipeline de VFX de projetos
  • Fico me perguntando se existe algum lugar treinando modelos com dados táteis
    O que mais quero que robôs façam é tocar objetos, mas estão fornecendo só áudio, vídeo e imagens, então um modelo que nunca tocou em nada precisa aprender como fazer contato. Talvez seja por isso que os robôs pareçam hesitar ao tocar objetos

    • Em vez de fornecer dados táteis reais, parece mais rápido simular o contato, e assim o treinamento ocorre muito mais rápido
  • O Flux 2 Dev Klein era, na prática, o melhor modelo entre os que podiam ser usados em hardware comercial comum
    Espero que o Flux 3 inclua um modelo moderno de pesos abertos equivalente; caso contrário, isso será uma grande perda para muitos usuários amadores

  • É o primeiro projeto de IA vindo da Europa que me faz ter grande expectativa

  • Estão contratando em Freiburg im Breisgau, e fico curioso se conseguem atrair talentos bem por lá

    • Freiburg é um lugar muito bonito
      Um amigo que mora lá gosta de pedalar nas montanhas da região, e outro faz esqui cross-country na hora do almoço no inverno
    • Moro perto, e é uma das regiões mais ensolaradas da Alemanha, além de ter uma paisagem excelente
      Não sei sobre o pool de talentos, mas há uma universidade
    • A University of Freiburg é bem conhecida
      É comum startups fora de SF recrutarem em cidades universitárias
    • Há um motivo para as pessoas chamarem o lugar de Flyburg im Nicegau
    • Hoje em dia, não estar nos EUA pode até ser uma vantagem para muitos candidatos em potencial
  • Até começarem a dançar numa sala inundada, achei que fosse vídeo live-action

  • A versão 2.3 foi excelente, e pelos vídeos e avaliações divulgados por quem teve acesso antecipado, este modelo parece que vai ser o novo estado da arte para uso doméstico, então estou muito empolgado

  • Se o modelo precisa aprender a representar os sons do mundo e dos acontecimentos, por diversão eu gostaria que colocassem uma quantidade absurdamente alta de Wilhelm scream no treinamento

    • Se você encaixar um vedante de borracha de forma bruta demais, ele pode acabar gritando, então é melhor manuseá-lo com cuidado