2 pontos por GN⁺ 3 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • Modelo de geração de imagens de 3ª geração da série Qwen-Image, com o objetivo central de "Real(实)" para ir além de imagens bonitas e ser útil em tarefas de produtividade
  • Processa até 4,5k tokens de entrada, gerando de uma vez layouts ricos em informação, como jornais, storyboards e provas, além de imagens com vários conceitos em paralelo e sobrepostos
  • Renderiza texto de 10 px, fórmulas em LaTeX e anotações manuscritas de forma legível, além de reproduzir texturas finas como poros, cabelos, pele e pinceladas
  • Suporta 12 idiomas, várias fontes, mais de 100 estilos artísticos e interfaces de web, games e livestreaming, podendo também buscar informações recentes na internet e refletí-las na imagem
  • É um modelo que busca expandir a geração de imagens como uma ferramenta de produtividade pronta para implantação em design, criação de conteúdo, educação e e-commerce, incluindo PDF de jornal, storyboard de drama curto e UI complexa

Modelo de 3ª geração em direção ao “Real”

  • Qwen-Image-3.0 é o modelo-base de geração de imagens de 3ª geração da série Qwen-Image
  • A direção central de cada geração é a seguinte
    • Qwen-Image-1.0: Precision
    • Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
    • Qwen-Image-3.0: Real(实)
  • “Real” é composto por três capacidades
    • Conteúdo rico: suporte a entrada de até 4,5k tokens e layouts complexos
    • Detalhes realistas: reprodução de letras de 10 px e elementos minuciosos como poros e cabelos
    • Conhecimento aprofundado: geração com uso de 12 idiomas, várias UIs e conhecimento de mundo
  • O objetivo é fazer a geração de imagens evoluir de “utilizável” para “prática” e de algo “bonito de ver” para algo útil

Conteúdo rico e disposição complexa

  • Em slides de matemática, consegue renderizar em conjunto relações espaciais, símbolos matemáticos, explicações de teoremas e a posição relativa de cada elemento
  • Com instruções de cerca de 3,7k tokens, gera em uma única passada uma grade 3×3 sem juntar várias imagens
    • Cada célula é composta por um infográfico complexo que combina frases em chinês e inglês, fórmulas, gráficos e personagens de quadrinhos
    • Coloca em uma única imagem um quadrinho sobre segurança em túneis, aula de geometria espacial, análise de estilo de 「Chu Shi Biao」, movimento parabólico, parasitologia, diagrama médico de dor torácica direita, teorema de Sylow, controle interno bancário e comparação da estrutura de DNA celular
  • Recebe instruções de até 4,5k tokens e entende/renderiza layouts visuais com alta densidade de informação
  • Escala horizontal

    • Refere-se à capacidade de posicionar vários elementos paralelos em uma única tela
    • Usa justaposição semântica e controle espacial para organizar vários conceitos sem que interfiram entre si
  • Profundidade vertical

    • É a capacidade de decompor significados e expressar, em etapas, interfaces sobrepostas de forma lógica
    • Com uma única instrução, gera uma estrutura multitelas com tela de programação do VSCode, Qwen Chat, WeChat e pôster de café coado manualmente sobrepostos
    • Cada camada mantém o estilo e os detalhes próprios da respectiva UI

De letras pequenas à restauração de pinturas

  • Letras pequenas e composição tipográfica complexa

    • Renderiza letras pequenas de 10 px de forma legível
    • Consegue gerar áreas com muito texto e ilustrações, como em um infográfico de conhecimento sobre tubarão-baleia
    • Reproduz, em uma página de artigo de geometria algébrica, fórmulas em LaTeX, sobrescritos e subscritos, letras gregas, numeração de teoremas, chaves, barras de fração e alinhamento em múltiplas linhas
    • Mantém a legibilidade das fórmulas e do texto principal mesmo em fontes pequenas
    • Combina textura realista de papel com texto denso para gerar imagens em formato de jornal
  • Edição e escrita à mão

    • Pode adicionar anotações manuscritas em vermelho sobre páginas de livro
    • Inclui sublinhados, linhas onduladas, círculos, setas e notas curtas
    • Implementa um estilo natural de escrita à mão, como anotações de aula de um estudante do ensino médio
  • Expressão de textura e restauração

    • Em retratos, descreve elementos minuciosos como poros, cabelos e textura da pele, além de texturas delicadas de outros objetos
    • Restaura pinturas tradicionais danificadas ou parcialmente perdidas de acordo com o estilo original e as pinceladas
    • Em uma pintura de batalha com águia, remove manchas de mofo e marcas de dano, completa partes ausentes e mantém a densidade da tinta, a textura das penas e o equilíbrio da composição

Uso de idioma, UI e conhecimento de mundo

  • Suporta 12 idiomas, várias fontes, mais de 100 estilos artísticos e diversos tipos de interface UI
  • Inclui exemplos de renderização precisa de japonês, coreano e espanhol
  • Pode gerar vários tipos de telas de UI realistas, como páginas web, games e livestreaming
  • Infográficos baseados em conhecimento

    • Mantém o assunto principal de fotos reais de insetos e as expande em infográficos de pesquisa
    • Inclui informações taxonômicas, anotações de características morfológicas, visualizações ampliadas de detalhes e barras de escala
    • Estrutura o resultado no formato de gráfico de pesquisa pronto para uso imediato em publicação acadêmica
  • Uso de informações recentes e IP

    • Além do conhecimento já presente no modelo, também pode se conectar à internet para buscar informações mais recentes
    • Gera uma imagem de previsão do tempo após pesquisar o clima de Hangzhou em 21 de julho
    • Pode localizar personagens de IP específicos e criar imagens com base neles
    • Gera uma cena em que Qi Baishi e Van Gogh apresentam o Qwen-Image-3.0 em uma sala de livestreaming

Expansão para tarefas de produtividade

  • Com base nas três capacidades centrais, oferece suporte a tarefas de alto valor, como PDF de jornal, storyboard de drama curto e interfaces UI complexas
  • O objetivo é conectar a capacidade de geração de imagens a valor de produtividade em mais áreas, como design, criação de conteúdo, educação e e-commerce

1 comentários

 
GN⁺ 3 시간 전
Opiniões no Hacker News
  • Parece estranho empurrar esse tipo de modelo para compras online. Como ele ajusta as roupas para caírem bem no corpo e até deixa a iluminação mais agradável, continua tão difícil quanto antes da adoção saber como a roupa realmente veste e qual é o caimento

    • O objetivo de curto prazo é vender produtos, mas o objetivo de longo prazo mais ambicioso é borrar a fronteira entre publicidade e realidade, mudando as normas culturais para que, no momento da compra, pessoas comuns nem cheguem a se fazer esse tipo de pergunta
      Daqui a 50 anos, talvez a própria “veracidade da publicidade” seja vista como um passado ideal impossível de recuperar
    • O que algumas pessoas querem talvez seja menos IA generativa em si e mais uma transformação de imagem para imagem, do tipo “deixe isto como se tivesse sido fotografado por um fotógrafo competente”
      Mas, em uma plataforma que recebe mil novos produtos por mês, fotos reais com imperfeições provavelmente até ajudam mais na conversão. Em especial, imagens com aparência 3D em que todas as variações de cor parecem idênticas acabam causando rejeição
    • O mesmo acontece em anúncios de móveis usados no Facebook Marketplace. A maioria das imagens é enfeitada por IA como se fosse um catálogo da Pottery Barn, e só no fim aparece uma foto do objeto real, cheio de riscos e danos, largado em uma garagem bagunçada
    • Fica a dúvida se isso será realmente menos distorcido do que o método tradicional, em que um fotógrafo profissional fotografa uma camisa em uma modelo sob iluminação perfeita
  • É curioso que as meta keywords do HTML incluam mais de 100 itens relacionados a conteúdo adulto, como hentai, nudes etc.

    • Essas palavras-chave são aplicadas globalmente até em páginas como https://qwen.ai/usagepolicy, que pedem para não usar o produto em conteúdo sexual
      No console, é possível ver a tag inteira executando document.querySelector('meta[name="keywords"]').content
    • Parece que alguma ferramenta de otimização para mecanismos de busca adicionou meta keywords automaticamente. Talvez tenha coletado termos de busca comuns contendo qwen, incluindo até erros de digitação de gwen ou ben em contextos adultos
    • Não sei que valor a meta tag keywords tem hoje em dia, e ela só acrescenta à página mais de 77 KB de dados inúteis
    • A equipe do Qwen provavelmente também sabe que comunidades de conteúdo adulto adotam rapidamente novos modelos de geração de imagem, como se vê no Civitai. Parece uma estratégia de otimização para mecanismos de busca para expor o modelo em resultados de busca que essas pessoas já consultam
  • Parece ter sido treinado com saídas do GPT Image 1, e o tom amarelado característico é evidente
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...

    • O GPT Image 1 também desenvolveu um tom amarelado sem ter sido treinado com saídas de outros modelos de geração de imagem. Como as pessoas preferem fotos com uma luz suave de pôr do sol e modelos de preferência captam isso facilmente, ao otimizar o apelo estético, todas as imagens acabam ganhando uma leve tonalidade, a menos que isso seja suprimido de propósito
    • Tons amarelos e avermelhados são um problema muito comum, independentemente da origem das fotos de treinamento. Em uma startup de fotografia, mesmo treinando com imagens originais, a tonalidade aparecia, e continuou sendo difícil evitá-la
    • Como imagens geradas por IA já fazem parte da web, com web scraping comum não dá para evitar imagens geradas nos dados de treinamento
  • O árabe no título da imagem principal está claramente quebrado, mas isso não acontece no uso real do modelo. Talvez a imagem principal nem tenha sido gerada pelo Qwen Image 3.0

    • É um bom critério para testar novos modelos. Quando testei o GPT Image 2 e o Nano Banana Pro com tâmil e versículos do Alcorão em árabe, eles geraram corretamente, possivelmente graças ao enorme volume de dados de treinamento
  • Foi dito que são necessários 3.700 tokens para descrever corretamente uma grade 3×3 inteira, mas, como o prompt não foi divulgado, a demonstração perde força

  • Não há nenhuma informação sobre quando e se os pesos serão publicados; fico curioso se isso está escrito em algum outro lugar

    • Os pesos do Qwen-Image-2.0 também não foram publicados, então desta vez parece pouco provável
    • Depois do Z-Image e do primeiro Qwen-Image, eles parecem ter migrado totalmente para modelos fechados. Pelo que se vê nas imagens divulgadas, o Qwen-Image 3.0 parece apenas uma alternativa inferior a modelos proprietários como gpt-image-2 ou nb-pro
    • Se eles publicarem, Cursor, Azure e Amazon é que vão monetizar; então não há muito motivo para isso. A menos que a OpenAI realmente abra algo, as chances são baixas
  • Forneci 2 logotipos reais, uma especificação completa de linguagem visual e 3 capturas de tela da aplicação, mas recebi apenas 3 imagens horríveis, e nenhuma delas se parecia com o logotipo original enviado

  • Testando em chat.qwen.ai, tanto a composição quanto a precisão anatômica nem chegam ao nível do Qwen Image 1. Os resultados saem com três pernas ou olhos brilhantes, com qualidade parecida com a do Microsoft Lens que foi retirado

  • Eu teria gostado de ter modelos assim na época da faculdade. Como aprendiz visual, teria entendido alguns temas com muito mais facilidade por meio de diagramas e ilustrações explicativas do que por textos longos

    • Mas os diagramas gerados são apenas simulacros. Mesmo pedindo um pôster que explique corretamente os componentes de um átomo, em vez de uma representação relacionada a nuvens de probabilidade, sai uma imagem de bolinhas de pingue-pongue vermelhas, azuis e cinzas orbitando em círculos; com sorte, você recebe um diagrama de camadas eletrônicas
      Pedi ao Nano Banana 2 um “pôster infográfico para estudantes de graduação explicando como um átomo funciona” e ele gerou um modelo de Bohr com cara de livro de ciências do ensino fundamental
    • Minha esposa colocou todas as receitas no gerador de imagens do ChatGPT para criar páginas com estilo de revista, e o resultado ficou ótimo. Estamos fazendo um livro de receitas da família para que as crianças saibam quais pratos comiam na infância
  • Ainda há um filtro amarelado espalhado pelas imagens