- Modelo de geração de imagens de 3ª geração da série Qwen-Image, com o objetivo central de "Real(实)" para ir além de imagens bonitas e ser útil em tarefas de produtividade
- Processa até 4,5k tokens de entrada, gerando de uma vez layouts ricos em informação, como jornais, storyboards e provas, além de imagens com vários conceitos em paralelo e sobrepostos
- Renderiza texto de 10 px, fórmulas em LaTeX e anotações manuscritas de forma legível, além de reproduzir texturas finas como poros, cabelos, pele e pinceladas
- Suporta 12 idiomas, várias fontes, mais de 100 estilos artísticos e interfaces de web, games e livestreaming, podendo também buscar informações recentes na internet e refletí-las na imagem
- É um modelo que busca expandir a geração de imagens como uma ferramenta de produtividade pronta para implantação em design, criação de conteúdo, educação e e-commerce, incluindo PDF de jornal, storyboard de drama curto e UI complexa
Modelo de 3ª geração em direção ao “Real”
- Qwen-Image-3.0 é o modelo-base de geração de imagens de 3ª geração da série Qwen-Image
- A direção central de cada geração é a seguinte
- Qwen-Image-1.0: Precision
- Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
- Qwen-Image-3.0: Real(实)
- “Real” é composto por três capacidades
- Conteúdo rico: suporte a entrada de até 4,5k tokens e layouts complexos
- Detalhes realistas: reprodução de letras de 10 px e elementos minuciosos como poros e cabelos
- Conhecimento aprofundado: geração com uso de 12 idiomas, várias UIs e conhecimento de mundo
- O objetivo é fazer a geração de imagens evoluir de “utilizável” para “prática” e de algo “bonito de ver” para algo útil
Conteúdo rico e disposição complexa
- Em slides de matemática, consegue renderizar em conjunto relações espaciais, símbolos matemáticos, explicações de teoremas e a posição relativa de cada elemento
- Com instruções de cerca de 3,7k tokens, gera em uma única passada uma grade 3×3 sem juntar várias imagens
- Cada célula é composta por um infográfico complexo que combina frases em chinês e inglês, fórmulas, gráficos e personagens de quadrinhos
- Coloca em uma única imagem um quadrinho sobre segurança em túneis, aula de geometria espacial, análise de estilo de 「Chu Shi Biao」, movimento parabólico, parasitologia, diagrama médico de dor torácica direita, teorema de Sylow, controle interno bancário e comparação da estrutura de DNA celular
- Recebe instruções de até 4,5k tokens e entende/renderiza layouts visuais com alta densidade de informação
-
Escala horizontal
- Refere-se à capacidade de posicionar vários elementos paralelos em uma única tela
- Usa justaposição semântica e controle espacial para organizar vários conceitos sem que interfiram entre si
-
Profundidade vertical
- É a capacidade de decompor significados e expressar, em etapas, interfaces sobrepostas de forma lógica
- Com uma única instrução, gera uma estrutura multitelas com tela de programação do VSCode, Qwen Chat, WeChat e pôster de café coado manualmente sobrepostos
- Cada camada mantém o estilo e os detalhes próprios da respectiva UI
De letras pequenas à restauração de pinturas
-
Letras pequenas e composição tipográfica complexa
- Renderiza letras pequenas de 10 px de forma legível
- Consegue gerar áreas com muito texto e ilustrações, como em um infográfico de conhecimento sobre tubarão-baleia
- Reproduz, em uma página de artigo de geometria algébrica, fórmulas em LaTeX, sobrescritos e subscritos, letras gregas, numeração de teoremas, chaves, barras de fração e alinhamento em múltiplas linhas
- Mantém a legibilidade das fórmulas e do texto principal mesmo em fontes pequenas
- Combina textura realista de papel com texto denso para gerar imagens em formato de jornal
-
Edição e escrita à mão
- Pode adicionar anotações manuscritas em vermelho sobre páginas de livro
- Inclui sublinhados, linhas onduladas, círculos, setas e notas curtas
- Implementa um estilo natural de escrita à mão, como anotações de aula de um estudante do ensino médio
-
Expressão de textura e restauração
- Em retratos, descreve elementos minuciosos como poros, cabelos e textura da pele, além de texturas delicadas de outros objetos
- Restaura pinturas tradicionais danificadas ou parcialmente perdidas de acordo com o estilo original e as pinceladas
- Em uma pintura de batalha com águia, remove manchas de mofo e marcas de dano, completa partes ausentes e mantém a densidade da tinta, a textura das penas e o equilíbrio da composição
Uso de idioma, UI e conhecimento de mundo
- Suporta 12 idiomas, várias fontes, mais de 100 estilos artísticos e diversos tipos de interface UI
- Inclui exemplos de renderização precisa de japonês, coreano e espanhol
- Pode gerar vários tipos de telas de UI realistas, como páginas web, games e livestreaming
-
Infográficos baseados em conhecimento
- Mantém o assunto principal de fotos reais de insetos e as expande em infográficos de pesquisa
- Inclui informações taxonômicas, anotações de características morfológicas, visualizações ampliadas de detalhes e barras de escala
- Estrutura o resultado no formato de gráfico de pesquisa pronto para uso imediato em publicação acadêmica
-
Uso de informações recentes e IP
- Além do conhecimento já presente no modelo, também pode se conectar à internet para buscar informações mais recentes
- Gera uma imagem de previsão do tempo após pesquisar o clima de Hangzhou em 21 de julho
- Pode localizar personagens de IP específicos e criar imagens com base neles
- Gera uma cena em que Qi Baishi e Van Gogh apresentam o Qwen-Image-3.0 em uma sala de livestreaming
Expansão para tarefas de produtividade
- Com base nas três capacidades centrais, oferece suporte a tarefas de alto valor, como PDF de jornal, storyboard de drama curto e interfaces UI complexas
- O objetivo é conectar a capacidade de geração de imagens a valor de produtividade em mais áreas, como design, criação de conteúdo, educação e e-commerce
1 comentários
Opiniões no Hacker News
Parece estranho empurrar esse tipo de modelo para compras online. Como ele ajusta as roupas para caírem bem no corpo e até deixa a iluminação mais agradável, continua tão difícil quanto antes da adoção saber como a roupa realmente veste e qual é o caimento
Daqui a 50 anos, talvez a própria “veracidade da publicidade” seja vista como um passado ideal impossível de recuperar
Mas, em uma plataforma que recebe mil novos produtos por mês, fotos reais com imperfeições provavelmente até ajudam mais na conversão. Em especial, imagens com aparência 3D em que todas as variações de cor parecem idênticas acabam causando rejeição
É curioso que as meta keywords do HTML incluam mais de 100 itens relacionados a conteúdo adulto, como hentai, nudes etc.
No console, é possível ver a tag inteira executando
document.querySelector('meta[name="keywords"]').contentqwen, incluindo até erros de digitação degwenoubenem contextos adultoskeywordstem hoje em dia, e ela só acrescenta à página mais de 77 KB de dados inúteisParece ter sido treinado com saídas do GPT Image 1, e o tom amarelado característico é evidente
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
O árabe no título da imagem principal está claramente quebrado, mas isso não acontece no uso real do modelo. Talvez a imagem principal nem tenha sido gerada pelo Qwen Image 3.0
Foi dito que são necessários 3.700 tokens para descrever corretamente uma grade 3×3 inteira, mas, como o prompt não foi divulgado, a demonstração perde força
Não há nenhuma informação sobre quando e se os pesos serão publicados; fico curioso se isso está escrito em algum outro lugar
Forneci 2 logotipos reais, uma especificação completa de linguagem visual e 3 capturas de tela da aplicação, mas recebi apenas 3 imagens horríveis, e nenhuma delas se parecia com o logotipo original enviado
Testando em chat.qwen.ai, tanto a composição quanto a precisão anatômica nem chegam ao nível do Qwen Image 1. Os resultados saem com três pernas ou olhos brilhantes, com qualidade parecida com a do Microsoft Lens que foi retirado
Eu teria gostado de ter modelos assim na época da faculdade. Como aprendiz visual, teria entendido alguns temas com muito mais facilidade por meio de diagramas e ilustrações explicativas do que por textos longos
Pedi ao Nano Banana 2 um “pôster infográfico para estudantes de graduação explicando como um átomo funciona” e ele gerou um modelo de Bohr com cara de livro de ciências do ensino fundamental
Ainda há um filtro amarelado espalhado pelas imagens