TRELLIS - Modelo de geração de malhas 3D
(trellis3d.github.io)- TRELLIS é um modelo generativo que cria ativos 3D a partir de texto ou imagem como condição, combinando a representação latente unificada SLAT com Rectified Flow Transformers para aumentar a qualidade e a flexibilidade da saída
- SLAT representa geometria e textura ao reunir grades 3D esparsas e características visuais multivisão, podendo ser decodificado em Radiance Fields, 3D Gaussians e meshes
- O modelo, com até 2 bilhões de parâmetros, foi treinado em um conjunto de dados com 500 mil ativos 3D e, segundo os autores, entrega qualidade superior a métodos anteriores, incluindo abordagens recentes de escala semelhante
- Além da geração de texto-para-3D e imagem-para-3D, ele oferece geração de variações de ativos 3D existentes e edição de regiões locais, demonstrando operações como remover braços, adicionar armas e trocar pernas
- Os materiais públicos são limitados a fins acadêmicos e de pesquisa, e permanecem limitações como viés potencial do conjunto de dados baseado na internet e a dificuldade de gerar objetos realistas do mundo real
Objetivo e escopo do TRELLIS
- TRELLIS é um modelo generativo 3D nativo voltado a geração 3D escalável e versátil
- A página do projeto é a única página oficial do TRELLIS, e o trabalho aparece como CVPR 2025 Highlight
- O objetivo central é criar ativos 3D de alta qualidade a partir de texto ou imagem como condição, oferecendo vários formatos de saída e recursos de edição
- Código, modelos e dados serão disponibilizados
Representação Structured LATent (SLAT)
- SLAT é uma representação latente 3D unificada para geração 3D de alta qualidade e uso geral
- Ela define vetores latentes locais em voxels ativos que cruzam a superfície do objeto
- Os vetores latentes locais são codificados após renderizar densamente o ativo 3D em várias visualizações e então fundir e processar as características da imagem
- Essas características vêm de um encoder de visão pré-treinado e complementam a estrutura grosseira fornecida pelos voxels ativos para capturar geometria detalhada e propriedades visuais
- Aplicando decodificadores diferentes, é possível converter o SLAT em várias representações 3D
- Radiance Fields
- 3D Gaussians
- meshes
Arquitetura do modelo generativo e treinamento
- TRELLIS é uma grande família de modelos generativos 3D construída sobre o SLAT, usando prompts de texto ou imagens como condição
- O pipeline de geração é dividido em 2 etapas
- Primeiro, gera a estrutura esparsa do SLAT
- Depois, gera os vetores latentes das células não vazias
- O modelo backbone é Rectified Flow Transformers, ajustado para lidar com a esparsidade do SLAT
- A escala de treinamento chega a 2 bilhões de parâmetros e usa um grande conjunto de dados composto por 500 mil objetos 3D diversos
- O resultado são ativos 3D com geometria detalhada e texturas vívidas, que, segundo os autores, superam com folga métodos anteriores
Exemplos de geração e edição, e formatos de saída
- Os exemplos de texto-para-3D usam prompts de texto criados pelo GPT-4
- telefone rotativo vintage de cobre
- casa de tijolos de dois andares com telhado vermelho e cerca
- esfera brilhante sobre um pedestal de pedra
- robô esférico com design dourado e prateado
- Os exemplos de imagem-para-3D usam prompts de imagem criados pelo DALL-E 3
- A aparência e a geometria na página são renderizadas a partir de 3D Gaussians e meshes, respectivamente
- Os arquivos GLB são extraídos ao fazer baking da aparência dos 3D Gaussians sobre a mesh
- Para um ativo 3D fornecido, é possível gerar variações consistentes com o prompt de texto
- textura metálica com acabamento em tinta laranja e branca
- textura semelhante a tecido de tricô em verde e roxo
- textura metálica em estilo de arma medieval com tiras de couro e detalhes azuis
- estrutura high-tech transparente semelhante a vidro
- A manipulação local edita áreas específicas de acordo com um prompt de texto ou imagem
- remoção de braços em um mecha de combate humanoide
- adição de uma arma de feixe gigante
- substituição das pernas por um chassi com esteiras
- É possível compor ativos 3D gerados para criar designs de arte 3D complexos e vívidos
Finalidade de pesquisa e limitações
- TRELLIS é um projeto de pesquisa puro
- O conjunto de dados usado é público e foi revisado para evitar informações de identificação pessoal ou conteúdo nocivo
- Como o conjunto de dados foi coletado na internet, ainda pode haver viés potencial
- O modelo atual tem pontos fortes na geração de ativos 3D em estilo artístico
- Sua capacidade de gerar objetos realistas do mundo real é limitada
- Os materiais da página são fornecidos apenas para fins acadêmicos e de pesquisa na exploração de tecnologias de geração de texto-para-3D e imagem-para-3D
- Não se destina a uso ou aplicação comercial
- O artigo relacionado é o preprint no arXiv Structured 3D Latents for Scalable and Versatile 3D Generation
1 comentários
Opiniões no Hacker News
Uau, é realmente impressionante, mas acho que foi a primeira vez que senti enjoo ao ver conteúdo gerado por IA
É tão bem-feito que parece um asset produzido em massa, de altíssima qualidade e sem alma, e isso me dá uma tristeza
Não quero diminuir a realização em si; na verdade, parece mais que isso anuncia o fim dos assets feitos à mão
Não é tanto que eu sinta pena dos artistas, mas sim de mim mesmo, porque quero justamente a característica de algo ter sido feito por mãos humanas
É pelo mesmo motivo que não gosto muito de jogos com geração procedural. Quero caminhar por um mundo que saiu da cabeça de alguém; se eu quisesse um mundo gerado proceduralmente, existente sem nenhum motivo específico, eu simplesmente sairia e caminharia lá fora
Não quero conteúdo nem pilhas de coisas para fuçar; quero obras de arte que pessoas da minha época fizeram com um propósito, colocando nelas sua visão, ideias, valores, insights e personalidade. Elas nem precisam parecer tão boas assim; basta terem sido feitas com um propósito
Sinceramente, a maioria dos lançamentos recentes parece mais o mesmo gameplay com gráficos atualizados
Mas, se em breve eu também puder fazer esse tipo de coisa, fico curioso para saber o que os grandes estúdios vão preparar para nos fazer voltar
Antes disso, eu quase não saía e ficava principalmente em um quarto relativamente escuro; um dia olhei para o céu e pensei: “uau, essas nuvens parecem nuvens de jogos como Horizon ou Assassin's Creed”
Também fiquei um pouco triste olhando para os assets. Ao ver uma “casa de tijolos de dois andares com telhado vermelho e cerca”, lembrei do exemplo de animação/keyframes do three.js
O exemplo do three.js foi feito à mão por uma pessoa, e havia uma intenção real por trás de cada escolha; já o Trellis parece apenas uma mistura de trabalhos encontrados na internet e em jogos, como se dissesse “puf, está aqui”
Com IA, algum valor vai desaparecer, mas por isso o conteúdo artesanal talvez se torne mais valioso. A questão é se vamos reconhecer esse valor o suficiente para que os artistas consigam se sustentar
https://threejs.org/examples/#webgl_animation_keyframes
Eu sou desse tipo, então acharia bem engraçado se alguém jogasse meu jogo e pensasse que os níveis “brotaram” da minha cabeça, como se eu fosse um artista profundo
Tenho muito orgulho de outras partes do desenvolvimento de jogos, mas meu level design não é uma delas
Quando ela começar a ser usada amplamente, vai surgir uma enxurrada de produtos em massa de baixa qualidade, mas os artistas de verdade que querem criar algo com propósito vão aprender a usar essa tecnologia como um degrau para algo maior
Olhando para pessoas como Martin Nebelong, dá para ver que estão aprendendo a usar IA mantendo o humano no loop
https://x.com/martinnebelong?s=21&t=cTpE-rRbCiocUlN0VaSheQ
É parecido com como o scripting visual, como o Unreal Blueprints, abriu o desenvolvimento de jogos e mods para pessoas que não estavam acostumadas a programar
Então, se for possível obter modelos para colocar em um protótipo sem aprender Blender, Maya etc., tudo bem. Mesmo que fiquem um pouco irregulares e estranhos, pelo menos passa a existir conteúdo
Uau, os resultados são excelentes. Não sou especialista, mas acho que era isso que todo mundo imaginava desde que apareceu a primeira demo de NeRF
Procurando, encontrei até um comentário que escrevi há 5 anos esperando por isso: https://news.ycombinator.com/item?id=22642628
O próximo passo é anexar automaticamente “nós” a imagens 3D para que o modelo possa pivotar ou girar. Aí conteúdo animado e interativo sob demanda vem logo em seguida
Você pode colocar fotos da infância para recriar memórias e adicionar amostras da voz de alguém querido para fazer essa pessoa falar com você. Para aumentar a imersão, é só colocar fones com cancelamento de ruído e entrar em VR
Em breve! Clique aqui para entrar na lista de espera de “Surrender Reality”
Já fiz muita retopologia, e se você riggar esses modelos do jeito que estão, vai ter problemas de sombreamento e deformação de todo tipo. Mesmo sem animação, de perto a triangulação fica bem evidente
Ainda assim, acho que a geração de assets 3D de alta qualidade está logo ali. Bastaria combinar a abordagem vista aqui com remesh quadrilateral por IA baseado em campos de direção estimados e detecção de características, e isso também está ficando assustadoramente bom
Talvez não seja realista treinar uma rede para riggar e animar malhas e configurar cenas inteiras de vídeos arbitrários como “gêmeos digitais”
Ainda assim, se essa configuração for possível, parece que daria para controlar vídeos gerados com muito mais precisão, mantendo o restante intacto
O próximo passo provavelmente está mais próximo de uma topologia simétrica mais normal, mapas UV melhores e rigging automático (FK/IK) para facilitar a animação
Será que os estúdios vão usar essas ferramentas, manter os artistas e criar mais conteúdo com mais rapidez e facilidade, ou vão manter só alguns e cortar os outros 80%, substituindo-os por essa ferramenta?
Até agora, imagens 2D geradas por IA têm iluminação errada e muitos erros. Uma vez que vira uma cena 3D e é renderizada com uma ferramenta gratuita como o Blender, a iluminação fica correta e configurável, e detalhes incorretos podem ser corrigidos facilmente
Já existem ferramentas absurdamente poderosas, e daqui em diante parece que elas vão ficar muito mais poderosas muito mais rápido
Não é perfeito, mas é muito melhor do que a maioria dos geradores de modelos 3D que já usei
Antes, os resultados eram inacreditavelmente ruins; desta vez ficaram acima da média
Agora só falta fornecer um formato de arquivo que eu possa colocar direto no Orca Slicer
Impressionante. Fiz este dirigível low-poly com layer diffusion: https://image.non.io/b3f843be-b1b4-468a-a0ec-9d58b191beee.we...
O resultado é este: https://video.non.io/video-2732101706.mp4
Sinceramente, não está nada mal e está chegando perto do ponto em que daria para usar como asset de jogo
Testei com uma imagem do caça furtivo F-117 da Wikipedia e a saída foi um fracasso total
Não fazia ideia de como os exemplos da página do projeto foram gerados, e a silhueta básica já estava completamente errada
Eu esperava poder enviar imagens de vários ângulos para corrigir, mas não parece haver esse recurso
Se não estava no dataset, dá para relevar. Especialmente por causa do formato anguloso, também parece fácil classificá-lo erroneamente como algo que não é uma aeronave
Não estou falando da qualidade geral do modelo; só acho que o F-117 quase certamente seria um teste injusto
Vi isso postado alguns dias atrás também, mas é uma demo muito impressionante, então gostaria que fosse discutida aqui
https://news.ycombinator.com/item?id=42342557
Dá para ver o potencial, mas as imagens que inseri talvez estivessem muito fora da distribuição de treinamento, porque ele só gerou umas placas planas estranhas
Quando usei imagens de frente, todas deram resultados planos
Depende muito da imagem, mas foi realmente surpreendente ver pelos de animais reproduzidos como uma combinação adequada de malha poligonal e texturas transparentes
Nem os exemplos da página mostravam essa capacidade
https://imgur.com/a/qJp4HNX
AlphaFold é um modelo que gera 3D a partir de sequências proteicas unidimensionais, e sua representação interna de dados é sofisticada e complexa
Já este artigo é interessante porque basicamente voxeliza os dados de entrada e cria o conjunto de treinamento tirando muitas fotos de vários ângulos
Consegui usar isso para ir de uma imagem gerada por IA até uma impressão 3D. Resumi os passos aqui: https://x.com/ryanlanciaux/status/1866163343788007619