- Trata-se de um modelo multimodal que busca aprender e integrar geração, compreensão e previsão de ações em uma única arquitetura, treinando conjuntamente imagem, vídeo e áudio, com disponibilidade inicial em Early Access a partir do FLUX 3 Video
- Aprende restrições mútuas entre a estrutura espacial das imagens, a dinâmica temporal e física dos vídeos e as relações entre eventos e sons no áudio, expandindo dados e recursos computacionais com base no Self-Flow
- Gera vídeos com áudio nativo de até 20 segundos por vez e, em avaliações iniciais, foi preferido em comparações em até 69% contra o Grok Imagine Video, 77% contra o Runway Gen-4.5 e 93% contra o Luma Ray 3.2
- Suporta síntese e edição de imagens, além de renderização de texto multilíngue, e pode ser usado como modelo de ação robótica ao ajustar um backbone de vídeo pré-treinado com dados limitados específicos por tarefa
- Video, Image, Action e o FLUX 3 Dev com pesos abertos serão lançados em etapas, com o objetivo de longo prazo de integrar percepção, ação e previsão de linguagem em um único modelo
Um modelo multimodal que aprende a realidade em conjunto
- O FLUX 3 trata imagem, vídeo e áudio não como elementos separados, mas como resultados da observação da mesma realidade por sensores diferentes
- A imagem captura a estrutura espacial e as relações em um determinado momento
- O vídeo restaura a dimensão temporal e revela movimento, dinâmica temporal e leis físicas
- O áudio mostra fenômenos mecânicos e relações causais acústicas que são difíceis de detectar apenas pela visão
- A linguagem conecta essas percepções a objetivos, abstrações e instruções
- Ao aprender múltiplas modalidades em conjunto, é possível aproveitar restrições mútuas como o fato de que sons devem coincidir com colisões, movimentos devem seguir a massa e o futuro deve continuar a partir do passado
- O FLUX 3 é o primeiro modelo construído apenas com esses princípios e busca uma inteligência visual do mundo real capaz de perceber, prever e agir em ambientes físicos e digitais
- Os resultados iniciais em criação de conteúdo e IA física mostram o potencial dessa abordagem
Arquitetura unificada baseada em Self-Flow
- O Self-Flow é uma abordagem para alinhar com eficiência geração e compreensão multimodais em uma única arquitetura base
- Com base no Self-Flow, o FLUX 3 amplia significativamente o volume de computação e de dados para treinar simultaneamente vídeo, imagem e áudio
- Na comparação pública, foram usados a Fréchet distance normalizada em 100 pelo critério de Flow Matching para erros de geração por modalidade e a taxa de sucesso de manipulação em 4 grupos de tarefas após fine-tuning
Geração de vídeo e áudio nativo
- O FLUX 3 pode criar, em uma única geração, diversos vídeos e áudios com até 20 segundos de duração
- O suporte inclui:
- geração de texto para vídeo
- geração de imagem para vídeo, continuando um frame inicial ou usando uma imagem como referência visual
- geração de vídeo para vídeo, transferindo elementos centrais como um personagem original para novas cenas ou contextos
- geração contínua de vídeo e áudio, dando sequência ao vídeo e áudio de entrada
- geração de keyframe-to-video com controle da transição entre cenas especificadas
- diálogos multilíngues
- vários estilos visuais e proporções de tela que vão além do formato cinematográfico tradicional
- encadeamento agentic que conecta clipes individuais em sequências longas com múltiplos takes
- ampla variedade de estilos, de vídeo de camcorder a animação e filmagem cinematográfica
- geração de tipografia e design de animação
- Todas as saídas de vídeo incluem geração de áudio nativo
Avaliação inicial de vídeo
- A avaliação preliminar foi realizada com clipes de 10 segundos em 720p de texto para vídeo com áudio
- Nas comparações, a taxa de preferência pelo FLUX 3 foi a seguinte:
- até 69% em relação ao Grok Imagine Video
- 60% em relação ao Kling v3 Pro
- 59% em relação ao Happy Horse v1 e 57% em relação ao Happy Horse 1.1
- 52% em relação ao Seedance 2.0 e ao Gemini Omni Flash, respectivamente
- 77% em relação ao Runway Gen-4.5
- 93% em relação ao Luma Ray 3.2
- Como o modelo e o harness ao redor dele ainda estão em desenvolvimento, os resultados são preliminares e devem melhorar durante o período de Early Access
- As áreas atualmente mais fortes incluem captura de expressões humanas, conexão entre eventos físicos e sons, e processamento multilíngue
- É possível combinar vários clipes mantendo a consistência do personagem ao longo da cena com referência visual, criando sequências de vários minutos
- O FLUX 3 Video está disponível em Early Access
Síntese e edição de imagens
- O FLUX 3 pode sintetizar e editar imagens em vários estilos, proporções e resoluções
- Em avaliações preliminares de uma etapa intermediária de treinamento, houve grande melhora em relação às versões anteriores do FLUX no tratamento de prompts complexos e na geração de texto
- Ele pode gerar diversos estilos de saída e renderizar texto em vários idiomas com alta precisão
- Os resultados da avaliação ainda são preliminares e devem ser aprimorados antes do lançamento oficial
- O Early Access do FLUX 3 Image está previsto para começar nas próximas semanas
Previsão de ações e aprendizado robótico
- Para expandir a compreensão da realidade para previsão de ações, são usados dois caminhos
- ampliar o trabalho inicial do Self-Flow para integrar previsão nativa de ações ao próprio FLUX 3
- usar um backbone de vídeo pré-treinado como base para entender dinâmica e fazer fine-tuning de modelos de ação especializados com dados limitados específicos por tarefa
- Em parceria com a mimic robotics, parceira inicial de abordagem, foi desenvolvido o FLUX-mimic
- é um modelo de vídeo para ação que combina o backbone do FLUX 3 com a sofisticação da mimic em aprendizado de manipulação robótica e sua expertise em implantação em produção
- também foi publicado separadamente um teste da base comum entre IA física e criação de conteúdo em tarefas reais de produção da Audi
Lançamento gradual por funcionalidade
- Cada funcionalidade será disponibilizada ao longo das próximas semanas e meses, passando por Early Access para um lançamento suave, coleta de feedback e testes rigorosos de segurança
- Todas derivam do mesmo modelo multimodal baseado em Flow Matching
- FLUX 3 Video: geração e edição de vídeo e áudio via API e acesso a pesos privados
- FLUX-mimic·FLUX 3 Action: previsão de ações para parceiros selecionados de pesquisa e comerciais, começando pela mimic robotics
- FLUX 3 Image: síntese e edição de imagens via API e acesso a pesos privados
- FLUX 3 Dev: oferta de pesos abertos do backbone multimodal para geração de conteúdo de vídeo, áudio e imagem, além de previsão de ações
- Mais detalhes técnicos da abordagem base também serão divulgados, e já é possível solicitar Early Access
Integração de percepção, ação e linguagem
- Entre as aplicações futuras estão edição interativa de imagem e vídeo, simulação, uso de computador e IA física
- Ao mesmo tempo em que lança gradualmente as funcionalidades atuais, a empresa também está desenvolvendo a próxima geração do modelo
- O objetivo final é combinar percepção, ação e previsão de linguagem em um único modelo integrado
1 comentários
Comentários do Hacker News
Espero que a versão com pesos abertos seja o estado da arte (SOTA)
Disseram que, nas próximas semanas ou meses, vão disponibilizar o FLUX 3 Dev, um modelo multimodal para criação de conteúdo e previsão de ações, com pesos abertos, além de divulgar detalhes técnicos da abordagem de base
Se o modelo de base sair como versão Dev, também é difícil entender só pelo post o que estaria faltando
Quase não há exemplos com pessoas, usaram o termo world model de forma meio solta, e embora falem em vídeo de 20 segundos, na prática só mostram jump cuts
No fim, o ponto principal parece ser sempre “em breve”
Talvez o próprio campo de RL tenha pegado esse termo emprestado das ciências do comportamento, então pode ser melhor simplesmente aceitar isso. É parecido com filósofos e artistas visuais usando mal orientado a objetos, cada um à sua maneira
As reações aqui são surpreendentemente negativas e cínicas, mas para mim o desempenho parece bastante impressionante
Também existe aquela ideia de que as pessoas negativas sempre são as primeiras a deixar comentários maldosos, então vou observar mais um pouco
Tenho a sensação de que o clima no HN anda mais negativo ultimamente, e espero estar enganado
Se você tiver o ambiente de execução adequado e entender o domínio o suficiente para perceber quando o modelo entrou em raciocínio errado ou produziu resultados sutilmente incorretos, sou bastante otimista. Por outro lado, quando vejo as redes sociais inundadas de imagens e vídeos horríveis gerados por IA, sou bem mais pessimista quanto à utilidade real de geradores totalmente sintéticos de imagem e vídeo. Quando chegam às mãos de milhões de pessoas, parecem ser usados mais para prejudicar do que para beneficiar a sociedade
Se esse modelo de vídeo estiver em um nível parecido com o Seedance 2.0, o custo será alto demais para geração de conteúdo de baixa qualidade, e ele provavelmente vai entrar no pipeline de VFX de projetos
Fico me perguntando se existe algum lugar treinando modelos com dados táteis
O que mais quero que robôs façam é tocar objetos, mas estão fornecendo só áudio, vídeo e imagens, então um modelo que nunca tocou em nada precisa aprender como fazer contato. Talvez seja por isso que os robôs pareçam hesitar ao tocar objetos
O Flux 2 Dev Klein era, na prática, o melhor modelo entre os que podiam ser usados em hardware comercial comum
Espero que o Flux 3 inclua um modelo moderno de pesos abertos equivalente; caso contrário, isso será uma grande perda para muitos usuários amadores
É o primeiro projeto de IA vindo da Europa que me faz ter grande expectativa
Estão contratando em Freiburg im Breisgau, e fico curioso se conseguem atrair talentos bem por lá
Um amigo que mora lá gosta de pedalar nas montanhas da região, e outro faz esqui cross-country na hora do almoço no inverno
Não sei sobre o pool de talentos, mas há uma universidade
É comum startups fora de SF recrutarem em cidades universitárias
Até começarem a dançar numa sala inundada, achei que fosse vídeo live-action
A versão 2.3 foi excelente, e pelos vídeos e avaliações divulgados por quem teve acesso antecipado, este modelo parece que vai ser o novo estado da arte para uso doméstico, então estou muito empolgado
Se o modelo precisa aprender a representar os sons do mundo e dos acontecimentos, por diversão eu gostaria que colocassem uma quantidade absurdamente alta de Wilhelm scream no treinamento