1 pontos por sjh9714 3 시간 전 | Ainda não há comentários. | Compartilhar no WhatsApp

A maioria dos catálogos de modelos de imagem reúne só os bons resultados. O que realmente faz falta — “isso não funciona” —
não aparece. Por isso rodei 561 imagens, mantive 475 e também publiquei as 65 descartadas, com o motivo da falha.
Tanto as mantidas quanto as descartadas vêm com seeds, então dá para reproduzir exatamente.

Coreano funciona. Mas as palavras que ele erra são sempre erradas do mesmo jeito

No começo, olhando só uma imagem, escrevi que “mesmo pedindo texto em coreano, ele erra”, mas depois de rodar seis testes percebi que era
uma afirmação exagerada. Quatro saíram corretos. “macarrão”, “biblioteca”, “saída 3” (número + coreano) e
“menu recomendado de hoje” (três palavras, seis sílabas).

O comprimento não é a variável. Ele acerta palavras de 2 e de 6 sílabas, mas errou uma de 4 sílabas.

Os dois erros são interessantes. “Macarrão honesto” saiu como “macarrão estático” e, mesmo mudando a seed,
saiu igual (1167746582, 1910572019). O mesmo erro de digitação duas vezes. Não foi sorte da seed;
é um problema daquela palavra. “Restaurante Hanbat” virou algo como “Restaurante Hanbbyot”, uma sílaba que nem existe.

Ambos desmoronaram no batchim, mas “guk”, “neul” e “cheon” também têm batchim e saíram sem problema, então não vou
concluir a causa com base em apenas dois casos.

Portanto, se errar, não fique rolando a seed de novo: mude a frase. Mesmo rodando novamente,
ele erra no mesmo lugar.

Ele desenha os caracteres que você fornece. Não desenha os caracteres que precisa inventar

Durante três lotes, eu achei errado que “a quantidade de strings é o limite”. Para encontrar o limite, aumentei apenas
a quantidade de strings na mesma placa, de 1 para 8, e as oito saíram todas corretas.

A quantidade não era a variável. Revendo as falhas anteriores, o ponto de ruptura fica claro.

  • Cardápio de café: os três itens escritos no prompt saíram corretos; o restante virou CAPEME, CABIELO
  • Linha do tempo: defini apenas o intervalo de anos; os anos apareceram, mas os rótulos falharam
  • Mockup de kanban: como não dei os nomes das colunas, as três colunas viraram “Kanban”

Escreva no prompt, exatamente, todo texto que deve aparecer na tela. Oito não é o limite;
foi só o ponto em que parei de testar.

Ainda assim, fornecer o texto nem sempre basta. Rodei de novo os três casos que tinham falhado, apenas especificando as strings:
no cardápio, as dez linhas saíram corretas; nas lombadas dos livros, 10 de 12; mas no mapa de linhas, 4 de 9. Quando as letras são pequenas e estão giradas em vários ângulos, entra uma segunda limitação.

Escrevi que “mãos geralmente funcionam”, mas retirei isso três horas depois

Fixei a iluminação e o enquadramento, aumentei apenas a dificuldade das mãos em 8 níveis, ampliei em 1,5 a 2 vezes e escrevi que “7 de 8 estão anatomicamente ok”. Era a frase mais provável de se espalhar, por ir contra o senso comum.

Duas horas depois de postar no r/StableDiffusion, veio um comentário: “a de três dedos tem seis dedos.”
Ao ampliar 4 vezes, era verdade. Vinte minutos depois, outra pessoa apontou as mãos sobrepostas:
“essa também está errada, só tem quatro.”

Duas pessoas encontraram 3 erros em 8 imagens fazendo uma coisa que eu não fiz: contaram.

Então derrubei a categoria inteira. Não reavaliei imagem por imagem. A ferramenta que falhou foram meus olhos;
se eu usasse os mesmos olhos para julgar as cinco restantes, cometeria o mesmo erro pela terceira vez.
Movi as 8 imagens, com suas seeds, para a seção de falhas.

Outros resultados medidos

  • Ele conta objetos, mas não atributos. Ovos em “exatamente N unidades” funcionaram de 2 a 8,
    mas “exatamente duas cores” produziu quatro cores. Se dá para apontar um por um, dá para pedir quantidade;
    se você está contando cores, regiões ou fontes de luz, conte o resultado por conta própria.
  • Quando você chama a iluminação pelo nome, o equipamento de iluminação entra na imagem. Nos dois prompts em que escrevi “softbox”,
    o softbox apareceu como sujeito da cena. Escreva o que a luz faz.
  • Mesmo escrevendo “seamless”, não vira tile. De 8 padrões, só 1 se conectou — e mesmo esse
    era de listras verticais, então as bordas coincidiram automaticamente.
  • “straight down” é um pedido, não uma instrução. Em 8 imagens aéreas, cinco vieram em diagonal.
    Se houver algo vertical, como um guindaste ou uma casa, a câmera desce para mostrar aquilo.
  • Comparações de tamanho trocam o sujeito. Pedi “um besouro do tamanho de um pônei” e saiu um pônei com arreios.
    Não havia besouro.
  • Não dá para inserir a mesma pessoa em outra foto. Com strength 0.45, o rosto permanece,
    mas a composição inteira vem junto; com 0.72, vira outra pessoa. Não há um valor intermediário que funcione.
  • Image-to-image não consegue adicionar nem remover objetos. Já a conversão de mídia (foto → guache etc.)
    é estável. Faixa de strength 0.50–0.60.

O custo total foi de US$ 4,54 (fal.ai, US$ 0,008 por megapixel).

README em coreano: https://github.com/sjh9714/awesome-krea-2/blob/main/README_KO.md
Ver todas as imagens: https://sjh9714.github.io/awesome-krea-2/
Receitas de edição extraídas como skill de agente: https://github.com/sjh9714/same-frame

Ainda não há comentários.

Ainda não há comentários.