1 pontos por GN⁺ 2024-12-10 | 1 comentários | Compartilhar no WhatsApp
  • TRELLIS é um modelo generativo que cria ativos 3D a partir de texto ou imagem como condição, combinando a representação latente unificada SLAT com Rectified Flow Transformers para aumentar a qualidade e a flexibilidade da saída
  • SLAT representa geometria e textura ao reunir grades 3D esparsas e características visuais multivisão, podendo ser decodificado em Radiance Fields, 3D Gaussians e meshes
  • O modelo, com até 2 bilhões de parâmetros, foi treinado em um conjunto de dados com 500 mil ativos 3D e, segundo os autores, entrega qualidade superior a métodos anteriores, incluindo abordagens recentes de escala semelhante
  • Além da geração de texto-para-3D e imagem-para-3D, ele oferece geração de variações de ativos 3D existentes e edição de regiões locais, demonstrando operações como remover braços, adicionar armas e trocar pernas
  • Os materiais públicos são limitados a fins acadêmicos e de pesquisa, e permanecem limitações como viés potencial do conjunto de dados baseado na internet e a dificuldade de gerar objetos realistas do mundo real

Objetivo e escopo do TRELLIS

  • TRELLIS é um modelo generativo 3D nativo voltado a geração 3D escalável e versátil
  • A página do projeto é a única página oficial do TRELLIS, e o trabalho aparece como CVPR 2025 Highlight
  • O objetivo central é criar ativos 3D de alta qualidade a partir de texto ou imagem como condição, oferecendo vários formatos de saída e recursos de edição
  • Código, modelos e dados serão disponibilizados

Representação Structured LATent (SLAT)

  • SLAT é uma representação latente 3D unificada para geração 3D de alta qualidade e uso geral
  • Ela define vetores latentes locais em voxels ativos que cruzam a superfície do objeto
  • Os vetores latentes locais são codificados após renderizar densamente o ativo 3D em várias visualizações e então fundir e processar as características da imagem
  • Essas características vêm de um encoder de visão pré-treinado e complementam a estrutura grosseira fornecida pelos voxels ativos para capturar geometria detalhada e propriedades visuais
  • Aplicando decodificadores diferentes, é possível converter o SLAT em várias representações 3D
    • Radiance Fields
    • 3D Gaussians
    • meshes

Arquitetura do modelo generativo e treinamento

  • TRELLIS é uma grande família de modelos generativos 3D construída sobre o SLAT, usando prompts de texto ou imagens como condição
  • O pipeline de geração é dividido em 2 etapas
    • Primeiro, gera a estrutura esparsa do SLAT
    • Depois, gera os vetores latentes das células não vazias
  • O modelo backbone é Rectified Flow Transformers, ajustado para lidar com a esparsidade do SLAT
  • A escala de treinamento chega a 2 bilhões de parâmetros e usa um grande conjunto de dados composto por 500 mil objetos 3D diversos
  • O resultado são ativos 3D com geometria detalhada e texturas vívidas, que, segundo os autores, superam com folga métodos anteriores

Exemplos de geração e edição, e formatos de saída

  • Os exemplos de texto-para-3D usam prompts de texto criados pelo GPT-4
    • telefone rotativo vintage de cobre
    • casa de tijolos de dois andares com telhado vermelho e cerca
    • esfera brilhante sobre um pedestal de pedra
    • robô esférico com design dourado e prateado
  • Os exemplos de imagem-para-3D usam prompts de imagem criados pelo DALL-E 3
  • A aparência e a geometria na página são renderizadas a partir de 3D Gaussians e meshes, respectivamente
  • Os arquivos GLB são extraídos ao fazer baking da aparência dos 3D Gaussians sobre a mesh
  • Para um ativo 3D fornecido, é possível gerar variações consistentes com o prompt de texto
    • textura metálica com acabamento em tinta laranja e branca
    • textura semelhante a tecido de tricô em verde e roxo
    • textura metálica em estilo de arma medieval com tiras de couro e detalhes azuis
    • estrutura high-tech transparente semelhante a vidro
  • A manipulação local edita áreas específicas de acordo com um prompt de texto ou imagem
    • remoção de braços em um mecha de combate humanoide
    • adição de uma arma de feixe gigante
    • substituição das pernas por um chassi com esteiras
  • É possível compor ativos 3D gerados para criar designs de arte 3D complexos e vívidos

Finalidade de pesquisa e limitações

  • TRELLIS é um projeto de pesquisa puro
  • O conjunto de dados usado é público e foi revisado para evitar informações de identificação pessoal ou conteúdo nocivo
  • Como o conjunto de dados foi coletado na internet, ainda pode haver viés potencial
  • O modelo atual tem pontos fortes na geração de ativos 3D em estilo artístico
  • Sua capacidade de gerar objetos realistas do mundo real é limitada
  • Os materiais da página são fornecidos apenas para fins acadêmicos e de pesquisa na exploração de tecnologias de geração de texto-para-3D e imagem-para-3D
  • Não se destina a uso ou aplicação comercial
  • O artigo relacionado é o preprint no arXiv Structured 3D Latents for Scalable and Versatile 3D Generation

1 comentários

 
GN⁺ 2024-12-10
Opiniões no Hacker News
  • Uau, é realmente impressionante, mas acho que foi a primeira vez que senti enjoo ao ver conteúdo gerado por IA
    É tão bem-feito que parece um asset produzido em massa, de altíssima qualidade e sem alma, e isso me dá uma tristeza
    Não quero diminuir a realização em si; na verdade, parece mais que isso anuncia o fim dos assets feitos à mão
    Não é tanto que eu sinta pena dos artistas, mas sim de mim mesmo, porque quero justamente a característica de algo ter sido feito por mãos humanas
    É pelo mesmo motivo que não gosto muito de jogos com geração procedural. Quero caminhar por um mundo que saiu da cabeça de alguém; se eu quisesse um mundo gerado proceduralmente, existente sem nenhum motivo específico, eu simplesmente sairia e caminharia lá fora
    Não quero conteúdo nem pilhas de coisas para fuçar; quero obras de arte que pessoas da minha época fizeram com um propósito, colocando nelas sua visão, ideias, valores, insights e personalidade. Elas nem precisam parecer tão boas assim; basta terem sido feitas com um propósito

    • Também dá para pensar assim: agora os jogos AAA não vão mais conseguir se diferenciar simplesmente por “ter gráficos incríveis”
      Sinceramente, a maioria dos lançamentos recentes parece mais o mesmo gameplay com gráficos atualizados
      Mas, se em breve eu também puder fazer esse tipo de coisa, fico curioso para saber o que os grandes estúdios vão preparar para nos fazer voltar
    • A frase “se eu quisesse um mundo gerado proceduralmente, existente sem nenhum motivo específico, eu iria lá fora” me lembrou de quando comecei a fazer exercícios ao ar livre alguns anos atrás
      Antes disso, eu quase não saía e ficava principalmente em um quarto relativamente escuro; um dia olhei para o céu e pensei: “uau, essas nuvens parecem nuvens de jogos como Horizon ou Assassin's Creed”
      Também fiquei um pouco triste olhando para os assets. Ao ver uma “casa de tijolos de dois andares com telhado vermelho e cerca”, lembrei do exemplo de animação/keyframes do three.js
      O exemplo do three.js foi feito à mão por uma pessoa, e havia uma intenção real por trás de cada escolha; já o Trellis parece apenas uma mistura de trabalhos encontrados na internet e em jogos, como se dissesse “puf, está aqui”
      Com IA, algum valor vai desaparecer, mas por isso o conteúdo artesanal talvez se torne mais valioso. A questão é se vamos reconhecer esse valor o suficiente para que os artistas consigam se sustentar
      https://threejs.org/examples/#webgl_animation_keyframes
    • Muitos desenvolvedores de jogos odeiam level design, e o motivo de não usarem geração procedural é que ela é difícil, então acabam construindo mundos feitos à mão à força
      Eu sou desse tipo, então acharia bem engraçado se alguém jogasse meu jogo e pensasse que os níveis “brotaram” da minha cabeça, como se eu fosse um artista profundo
      Tenho muito orgulho de outras partes do desenvolvimento de jogos, mas meu level design não é uma delas
    • Não acho que esta tecnologia vá mudar fundamentalmente o campo de competição humano
      Quando ela começar a ser usada amplamente, vai surgir uma enxurrada de produtos em massa de baixa qualidade, mas os artistas de verdade que querem criar algo com propósito vão aprender a usar essa tecnologia como um degrau para algo maior
      Olhando para pessoas como Martin Nebelong, dá para ver que estão aprendendo a usar IA mantendo o humano no loop
      https://x.com/martinnebelong?s=21&t=cTpE-rRbCiocUlN0VaSheQ
    • Para quem não sabe criar assets 3D, é uma ferramenta de prototipagem realmente boa
      É parecido com como o scripting visual, como o Unreal Blueprints, abriu o desenvolvimento de jogos e mods para pessoas que não estavam acostumadas a programar
      Então, se for possível obter modelos para colocar em um protótipo sem aprender Blender, Maya etc., tudo bem. Mesmo que fiquem um pouco irregulares e estranhos, pelo menos passa a existir conteúdo
  • Uau, os resultados são excelentes. Não sou especialista, mas acho que era isso que todo mundo imaginava desde que apareceu a primeira demo de NeRF
    Procurando, encontrei até um comentário que escrevi há 5 anos esperando por isso: https://news.ycombinator.com/item?id=22642628
    O próximo passo é anexar automaticamente “nós” a imagens 3D para que o modelo possa pivotar ou girar. Aí conteúdo animado e interativo sob demanda vem logo em seguida
    Você pode colocar fotos da infância para recriar memórias e adicionar amostras da voz de alguém querido para fazer essa pessoa falar com você. Para aumentar a imersão, é só colocar fones com cancelamento de ruído e entrar em VR
    Em breve! Clique aqui para entrar na lista de espera de “Surrender Reality”

    • O próximo passo é gerar modelos com uma topologia de malha de maior qualidade, que não quebre a malha mesmo com animação e edição
      Já fiz muita retopologia, e se você riggar esses modelos do jeito que estão, vai ter problemas de sombreamento e deformação de todo tipo. Mesmo sem animação, de perto a triangulação fica bem evidente
      Ainda assim, acho que a geração de assets 3D de alta qualidade está logo ali. Bastaria combinar a abordagem vista aqui com remesh quadrilateral por IA baseado em campos de direção estimados e detecção de características, e isso também está ficando assustadoramente bom
    • Intuitivamente, a combinação de um motor 3D com esta tecnologia parece uma solução melhor do que a abordagem atual de renderizar vídeo rasterizado diretamente no espaço latente. Por coincidência, o Sora também foi lançado hoje
      Talvez não seja realista treinar uma rede para riggar e animar malhas e configurar cenas inteiras de vídeos arbitrários como “gêmeos digitais”
      Ainda assim, se essa configuração for possível, parece que daria para controlar vídeos gerados com muito mais precisão, mantendo o restante intacto
    • Não sei exatamente o que “nós” quer dizer aqui. Rotação ou zoom arbitrários só parecem bons em teoria quando você quer uma lazy susan ou uma cabeça de exorcista girando
      O próximo passo provavelmente está mais próximo de uma topologia simétrica mais normal, mapas UV melhores e rigging automático (FK/IK) para facilitar a animação
    • Fico curioso para saber que impacto isso terá sobre artistas 3D em estúdios de desenvolvimento de jogos
      Será que os estúdios vão usar essas ferramentas, manter os artistas e criar mais conteúdo com mais rapidez e facilidade, ou vão manter só alguns e cortar os outros 80%, substituindo-os por essa ferramenta?
    • É útil não só para conteúdo animado e interativo sob demanda, mas também para renderização de imagens estáticas
      Até agora, imagens 2D geradas por IA têm iluminação errada e muitos erros. Uma vez que vira uma cena 3D e é renderizada com uma ferramenta gratuita como o Blender, a iluminação fica correta e configurável, e detalhes incorretos podem ser corrigidos facilmente
      Já existem ferramentas absurdamente poderosas, e daqui em diante parece que elas vão ficar muito mais poderosas muito mais rápido
  • Não é perfeito, mas é muito melhor do que a maioria dos geradores de modelos 3D que já usei
    Antes, os resultados eram inacreditavelmente ruins; desta vez ficaram acima da média
    Agora só falta fornecer um formato de arquivo que eu possa colocar direto no Orca Slicer

  • Impressionante. Fiz este dirigível low-poly com layer diffusion: https://image.non.io/b3f843be-b1b4-468a-a0ec-9d58b191beee.we...
    O resultado é este: https://video.non.io/video-2732101706.mp4
    Sinceramente, não está nada mal e está chegando perto do ponto em que daria para usar como asset de jogo

  • Testei com uma imagem do caça furtivo F-117 da Wikipedia e a saída foi um fracasso total
    Não fazia ideia de como os exemplos da página do projeto foram gerados, e a silhueta básica já estava completamente errada
    Eu esperava poder enviar imagens de vários ângulos para corrigir, mas não parece haver esse recurso

    • O F-117 tem um formato peculiar. Se você não souber como ele é originalmente, extrapolar a partir de uma única vista de um certo ângulo é bem difícil até para uma pessoa
      Se não estava no dataset, dá para relevar. Especialmente por causa do formato anguloso, também parece fácil classificá-lo erroneamente como algo que não é uma aeronave
      Não estou falando da qualidade geral do modelo; só acho que o F-117 quase certamente seria um teste injusto
  • Vi isso postado alguns dias atrás também, mas é uma demo muito impressionante, então gostaria que fosse discutida aqui
    https://news.ycombinator.com/item?id=42342557

  • Dá para ver o potencial, mas as imagens que inseri talvez estivessem muito fora da distribuição de treinamento, porque ele só gerou umas placas planas estranhas

    • Consegui fazer funcionar bem com imagens no estilo de jogo isométrico, vistas de cima, de personagens ou objetos
      Quando usei imagens de frente, todas deram resultados planos
    • Mais uma ferramenta milagrosa. Até você testá-la pessoalmente
  • Depende muito da imagem, mas foi realmente surpreendente ver pelos de animais reproduzidos como uma combinação adequada de malha poligonal e texturas transparentes
    Nem os exemplos da página mostravam essa capacidade
    https://imgur.com/a/qJp4HNX

  • AlphaFold é um modelo que gera 3D a partir de sequências proteicas unidimensionais, e sua representação interna de dados é sofisticada e complexa
    Já este artigo é interessante porque basicamente voxeliza os dados de entrada e cria o conjunto de treinamento tirando muitas fotos de vários ângulos

  • Consegui usar isso para ir de uma imagem gerada por IA até uma impressão 3D. Resumi os passos aqui: https://x.com/ryanlanciaux/status/1866163343788007619

    • É realmente futurista. Você cria uma imagem com palavras e a transforma em um objeto físico em casa, mas o texto em linguagem natural e as imagens que explicam o processo não podem ser lidos por causa de um site quebrado