1 pontos por GN⁺ 3 시간 전 | 1 comentários | Compartilhar no WhatsApp
  • Uma comparação de 1.008 SVGs de 7 modelos de fronteira não encontrou evidências claras de pelicanmaxxing, isto é, aumentar o desempenho para prompts famosos
  • O experimento executou 48 prompts, combinando 8 animais e 6 veículos, 3 vezes por modelo, e usou o GPT-5.6 Luna para avaliar a consistência de animal, veículo e ação em notas de 1 a 5
  • O pelicano ficou em 6º entre 8 animais, a bicicleta em 5º entre 6 veículos, e a combinação pelicano-bicicleta ficou apenas em 42º entre as 48 combinações
  • Mesmo em uma análise de regressão ajustada por dificuldade, os efeitos por laboratório não foram estatisticamente significativos; o único efeito significativo, o efeito de bicicleta do Gemini 3.5 Flash, não passou pela correção para múltiplas comparações
  • Todas as 21 imagens de pelicano-bicicleta apontavam para a direita, mas 60% de todas as imagens também tinham a mesma direção; só este experimento não permite determinar se há SVGmaxxing, isto é, reforço da geração de SVGs em geral

O benchmark do “pelicano andando de bicicleta”

  • Simon Willison testa há anos o mesmo prompt sempre que um grande LLM é lançado: “gere um SVG de um pelicano andando de bicicleta”
  • O teste, que começou como uma brincadeira, tornou-se um benchmark informal famoso de IA, e resultados relacionados também recebem muitos votos positivos em threads do Hacker News que apresentam novos modelos
  • benchmaxxing significa otimizar um modelo de IA para obter pontuações altas em benchmarks populares
  • Como o desempenho dos modelos pode influenciar a escolha dos usuários, foi verificada a possibilidade de laboratórios otimizarem modelos para esse teste específico, algo chamado pelicanmaxxing
  • O código do experimento e o pipeline de processamento de dados estão disponíveis em um repositório no GitHub

Desenho experimental que gerou 1.008 SVGs

  • Foram montados 48 prompts combinando 8 animais e 6 veículos
    • Animais: pelican, flamingo, heron, otter, raccoon, antelope, whale, cat
    • Veículos: bicycle, unicycle, skateboard, scooter, plane, boat
  • Em todos os prompts, apenas o animal e o veículo foram substituídos no texto de Simon Willison
  • Os animais e veículos não foram escolhidos por um procedimento rigoroso, mas a seleção foi feita para produzir diferentes graus de semelhança com o original e de dificuldade
    • flamingo e heron são semelhantes a pelican
    • cat, raccoon e otter foram escolhidos como casos fáceis
    • antelope é difícil, e whale é um caso muito diferente de pelican
  • Por meio do OpenRouter, foram testados os 7 modelos a seguir
    • GPT-5.6 Terra
    • Claude Sonnet 5
    • Gemini 3.5 Flash
    • Grok 4.5
    • Qwen3.7-Max
    • GLM-5.2
    • DeepSeek V4 Pro
  • Para cada prompt, foram geradas 3 amostras com temperature 1.0 e a mesma configuração de esforço de raciocínio, totalizando 1.008 SVGs

Pipeline de renderização, avaliação e extração de características

  • Os resultados gerados foram processados em três etapas
    • Renderização: os SVGs foram convertidos para PNG; quando não havia SVG ou a renderização falhava, a geração era repetida até obter um resultado válido
      • Houve 11 tentativas repetidas ao longo dos 1.008 processos de geração
    • Avaliação: o GPT-5.6 Luna atribuiu notas de 1 a 5 para a consistência do animal, do veículo e da ação
      • Nos rankings de animais e veículos, foram usadas as notas individuais de cada item
      • Quando era necessário um único número por imagem, foi usada a média das três notas, chamada de pontuação do avaliador (judge score)
    • Extração de características: o Gemini 3.1 Flash-Lite registrou o animal e o veículo reconhecidos, a direção do sujeito e elementos da cena
  • A hipótese era que, se um laboratório tivesse treinado para um benchmark específico, a linha do pelicano, a coluna da bicicleta ou a célula pelicano-bicicleta receberiam notas acima do esperado para sua dificuldade intrínseca

Diferenças observadas na comparação visual

  • A grade completa de imagens foi comparada por modelo, mas não foram encontrados casos em que as imagens de pelicano-bicicleta fossem claramente melhores que os outros resultados do mesmo modelo
  • A primeira amostra do GLM-5.2 parecia um pouco melhor, mas no mesmo conjunto também foi gerada uma imagem heron-skateboard de alta qualidade, o que dificultou atribuir o resultado a uma otimização especial
  • Laboratórios que produziram boas imagens de pelicano-bicicleta também tendiam a desenhar bem outras combinações de animais e veículos
  • Como a avaliação visual é difícil de reproduzir e pode variar de pessoa para pessoa, foi acrescentada uma análise quantitativa

Desempenho individual do pelicano e da bicicleta

  • Somando as notas de animais de todos os modelos, o pelicano ficou em entre 8 espécies
    • Abaixo de cat, whale, raccoon, heron e antelope
    • Todos os 7 laboratórios desenharam cat, whale e raccoon melhor que pelican
  • Como o próprio pelicano pode ser mais difícil de desenhar que cat, esse ranking por si só não permite descartar a possibilidade de treinamento específico
  • A bicicleta ficou em penúltimo lugar entre 6 veículos, quase no mesmo nível do plane, que ficou em último
  • Uma bicicleta exige duas rodas alinhadas, um quadro que conecte os dois eixos, guidão, assento e pedais
    • O modelo avaliador considerou que cerca de dois terços das imagens de bicicleta não tinham um desses elementos ou não os conectavam corretamente
  • A bicicleta também é mais difícil que um veículo simples como skateboard, portanto sua posição relativa poderia ser baixa mesmo que houvesse treinamento específico

A ambiguidade criada pelo prompt “plane”

  • Ao usar “plane” em vez de “airplane”, alguns modelos interpretaram a palavra como um plano geométrico, e não como uma aeronave
  • Como resultado, foram geradas imagens em que o animal estava sobre uma superfície plana, em vez de em uma aeronave
  • Casos em que o extrator de características não encontrou veículo algum apareceram apenas em plane
    • Em 25 das 168 imagens de plane, nenhum veículo foi reconhecido
    • Isso não ocorreu com nenhum dos outros 5 veículos
  • 20% das imagens de plane receberam nota 1 ou 2 para veículo
    • Em bicycle, foram 5%
    • Em boat, scooter e skateboard, não houve imagens com nota 1 ou 2

Ranking por combinação e ajuste de dificuldade

  • A combinação pelicano-bicicleta teve desempenho médio em 42º lugar entre 48 combinações
  • Como cada combinação pode ter dificuldade intrínseca diferente, foi aplicada uma análise de regressão com efeitos fixos sobre as 1.008 imagens
    • A fórmula básica é score ~ lab + animal × vehicle
    • Foram adicionados termos de interação por laboratório para pelican, bicycle e pelican-bicycle
    • Foram usados erros-padrão robustos
  • O termo animal × vehicle absorve a dificuldade própria de cada uma das 48 combinações
  • Com os termos de interação por laboratório, foram medidos o ganho específico de benchmark em relação ao laboratório médio e os intervalos de confiança

A regressão não encontrou efeitos significativos

  • Os efeitos de pelicano por laboratório variaram de -0,11 a +0,14 ponto, e nenhum foi estatisticamente significativo
    • O menor valor de p ainda foi 0,25
  • Os efeitos de bicicleta por laboratório variaram de -0,18 ponto no Grok 4.5 (p=0,11) a +0,27 ponto no Gemini 3.5 Flash (p=0,022)
    • As direções dos 7 efeitos se dividiram entre positivas e negativas
    • O único modelo que satisfez p<0,05 foi o Gemini 3.5 Flash
  • Depois de excluir os efeitos de pelicano e bicicleta de cada laboratório, nenhum ganho adicional na combinação específica pelicano-bicicleta satisfez p<0,05
    • O maior efeito positivo foi +0,35 ponto do GLM-5.2, mas com p=0,12
    • Foi o resultado mais próximo de um sinal no experimento, mas permaneceu dentro do intervalo atribuível ao acaso
  • Todos os intervalos de confiança dos efeitos de pelicano e da célula pelicano-bicicleta incluíram 0
  • Ao realizar 21 testes com p<0,05, espera-se cerca de 1 falso positivo apenas por acaso
    • 21 × 0.05 ≈ 1.05, e o único resultado de fato significativo foi o efeito de bicicleta do Gemini
    • O limiar da correção de Bonferroni é 0.05/21 ≈ 0.002, e o p=0,022 do Gemini não passou por ele
  • A largura dos intervalos de confiança foi, em média, de cerca de ±0,6 ponto, de modo que ganhos menores que isso são difíceis de capturar com o experimento

Composição das imagens apontando para a direita

  • Todas as 21 imagens de pelicano-bicicleta geradas pelos 7 laboratórios apontavam para a direita
    • Foi a única combinação entre as 48 em que todas as imagens tiveram a mesma direção
  • No entanto, 60% das 1.008 imagens no total apontavam para a direita, portanto a direção para a direita em si é comum
  • A proporção de direção à direita por veículo foi: scooter 83%, bicycle 81%, skateboard 60%, plane 58%, unicycle 45% e boat 35%
  • A proporção de direção à direita por animal foi: antelope e pelican com 78% cada, heron 77%, whale 65%, flamingo 64%, otter 45%, cat 40% e raccoon 36%
  • Como é difícil desenhar um pelicano ou uma bicicleta de frente, os modelos em geral escolhem composições laterais, o que também reduz imagens com direção ambígua
  • Outras combinações também tiveram alta taxa de concordância de direção
    • antelope-scooter e pelican-scooter tiveram, cada uma, 20 de 21 imagens na mesma direção
    • heron-bicycle teve 19 de 21 imagens na mesma direção
  • O fato de uma das 48 combinações ter 21 imagens todas na mesma direção não basta para considerá-la um outlier especial

Buscando sinais de memorização nos elementos da cena

  • O Gemini 3.1 Flash-Lite extraiu em formato livre os elementos de cena encontrados nas imagens para verificar se uma composição memorizada se repetia
  • Em algumas combinações, certos elementos se repetiram com frequência
    • Todas as imagens flamingo-boat continham um sol
    • 38% das imagens otter-plane tinham um cachecol
    • 38% das imagens cat-bicycle incluíam uma cesta
  • Em pelicano-bicicleta, alguns elementos também apareceram com alta frequência, mas não foi encontrado nenhum padrão de repetição especial que distinguisse a combinação de outras combinações de animal e veículo

Um único modelo avaliador e orçamento limitado

  • Todas as notas foram atribuídas por um único modelo avaliador, o GPT-5.6 Luna, que analisou uma imagem por vez
    • Os critérios de avaliação não foram suficientemente alinhados, e a consistência em uma reavaliação não foi verificada
    • Se o modelo avaliador não julgar desenhos de forma confiável, o valor dos resultados quantitativos diminui
  • Também há a limitação de que o modelo avaliador e o modelo participante GPT-5.6 Terra pertencem à mesma família de produtos
    • Ainda assim, como cada laboratório gerou todas as 48 combinações, mesmo que haja preferência pelo estilo visual de um laboratório específico, a pontuação da grade inteira sobe junto
    • A análise compara diferenças entre combinações dentro de cada laboratório, portanto essa preferência não altera o resultado central
  • Não é possível detectar SVGmaxxing, isto é, a otimização da geração de SVGs como um todo ou de uma categoria como “animais montados em veículos”, em vez de um prompt específico
    • Como o desempenho de todas as células sobe junto, isso não se distingue de um modelo que simplesmente gera bem SVGs
    • Google/DeepMind realiza esse tipo de otimização publicamente
  • O custo total do experimento foi de cerca de US$ 80 em créditos de API
    • Ele foi limitado a 3 amostras por célula, 1 modelo avaliador e 7 modelos participantes
    • Não houve iteração suficiente sobre os prompts e o pipeline, e problemas como “plane” versus “airplane” permaneceram

Não há evidências de otimização para esse prompt específico

  • O pelicano não foi desenhado melhor que outros animais, a bicicleta não teve desempenho superior ao de outros veículos, e nenhum laboratório desenhou essa combinação significativamente melhor do que o esperado a partir de seu desempenho individual com pelicanos e bicicletas
  • O GLM-5.2 registrou o maior ganho na célula específica pelicano-bicicleta, mas o efeito foi pequeno e não estatisticamente significativo
  • O fato de as 21 imagens apontarem todas para a direita chama atenção, mas composições voltadas à direita são comuns no conjunto geral, e outras três combinações também tiveram mais de 90% de concordância
  • Uma forma mais plausível que pelicanmaxxing voltado a um benchmark específico seria o SVGmaxxing, isto é, reforçar a geração de SVGs em geral, mas este experimento não permite determinar quais laboratórios fazem isso

1 comentários

 
GN⁺ 3 시간 전
Opiniões do Hacker News
  • Também fui verificando, quando dava, combinações de outros animais com veículos, e meu sonho era encontrar evidências de que algum laboratório de IA desenhava excepcionalmente bem apenas pelicanos andando de bicicleta.
    A metodologia do Dylan, que gerou 1.008 SVGs com combinações 8×6, é bem mais sólida do que eu imaginava. Mas não encontrei em nenhum modelo um caso em que o pelicano andando de bicicleta saísse visivelmente melhor do que outras combinações.

    • Talvez a otimização não tenha sido só para pelicanos, mas para SVGs em geral. Gerar SVGs complexos pode testar conhecimento geral de programação e noção espacial, então no começo era um bom benchmark; mas, se alguém atacar diretamente só essa tarefa, ela não é tão difícil.
    • Algo parecido aconteceu também no TPC, que criou benchmarks de SQL. Se o desempenho no TPC fosse ruim, você não estava qualificado para competir; se fosse bom, ganhava o direito de participar de avaliações comparativas que lidavam com problemas reais dos clientes.
      Em um mercado congestionado, passar no benchmark é a taxa de entrada, mas otimizações estreitas, como hardcodar apenas uma cena específica sem melhorar problemas adjacentes, são problemáticas. Isso me lembra o benchmark “Quack3” para placas ATI no campo de GPUs.
    • Um teste mais fundamental seria avaliar a geração de desenhos SVG em geral. Seria possível montar um pipeline que coloca descrições em imagens arbitrárias, pede a um LLM para gerar SVGs, rasteriza o resultado e compara com similaridade visual determinística, ou faz outro LLM pontuar a semelhança com o original.
    • Também valeria variar a espécie de ave. O bico-de-sapato ou a garça, que pertencem à mesma ordem Pelecaniformes dos pelicanos, poderiam ser candidatos.
  • É natural que o pelicano na bicicleta olhe para a direita. Como o sistema de transmissão da bicicleta fica à direita, para mostrá-lo sem que o quadro o esconda, acaba-se desenhando a lateral direita; é bem provável que essa composição também esteja refletida nos dados de treinamento.
    Base: https://www.rei.com/c/bikes
    Olhando com atenção, independentemente da direção do animal, todas as bicicletas apontam para a direita, e as duas pernas dos passageiros, exceto a baleia, também ficam do lado direito da bicicleta. Isso sugere uma falta bastante significativa de compreensão prática sobre como uma bicicleta funciona.

  • Toda vez que Simon Willison publicava um SVG, apareciam reações descartando a avaliação com “agora eles com certeza já treinaram nisso”, mas também houve um texto explicando logicamente como esse tipo de treinamento poderia ser detectado com facilidade. Foi bom ver uma análise quantitativa dos resultados de pequenos animais andando de bicicleta.
    https://simonwillison.net/2025/Nov/13/training-for-pelicans-...

    • Há também uma possibilidade mais branda. Antes quase não havia ilustrações de pelicanos andando de bicicleta, mas agora existem materiais desenhados por artistas habilidosos, e, se os laboratórios os coletarem como fazem com outros conteúdos da web, o desempenho pode melhorar.
      Estes resultados mostram que nem mesmo essa melhoria aconteceu ainda. Ao contrário, é possível que o desempenho tenha piorado por aprender com resultados ruins publicados online.
    • Resultados generalizados a partir de um número pequeno de combinações de animais e veículos dificilmente são uma prova forte de que esse material não foi treinado direta ou amplamente.
  • Se a explicação mais plausível é otimização para SVG, então também é preciso discutir o que “otimização” significa aqui. A capacidade de desenhar SVGs melhor é, por si só, uma habilidade útil.

    • Não há nada terrível em laboratórios de IA maximizarem uma habilidade. Benchmarks são, na prática, o único meio de comparar quantitativamente os modelos atuais; portanto, se a otimização para benchmarks incomoda, é melhor contribuir para criar benchmarks melhores.
  • Acrescentei uma variação a um experimento parecido. Verifiquei se o modelo escolheria por conta própria um pelicano andando de bicicleta quando nenhuma ave ou meio de transporte específico fosse indicado.
    Resultado: https://www.modelbias.ai/pelican-on-a-bicycle-test

    • Mesmo sendo um desenho simples, houve alguns resultados esteticamente excelentes de pinguins andando de skate, inclusive em modelos de baixo desempenho. A família Opus parece ter piorado os resultados com o passar do tempo.
    • Como não exige avaliação subjetiva e depende menos da complexidade do animal e do meio de transporte, é mais convincente e robusto do que a análise do texto original.
  • Os dados originais estão disponíveis no GitHub: https://github.com/dylanjcastillo/blog/tree/main/_extras/pel...

  • Fazer um LLM criar SVGs é parecido com pedir a um pintor humano que desenhe enquanto você dita uma lista de coordenadas; é muito difícil e pouco natural. Modelos atuais de geração de imagens conseguem criar facilmente uma bicicleta estruturalmente perfeita e um pelicano realista, mas o resultado é apenas uma imagem raster.
    Falta a etapa de decompor a imagem em caminhos SVG ou comandos de pinceladas para reproduzi-la; para fazer isso direito, é necessária uma compreensão real da estrutura da cena, e a IA ainda é fraca nisso.

    • Um pintor humano excelente consegue visualizar mentalmente o processo de desenho, e isso talvez não seja muito diferente de um LLM construindo SVGs internamente. A Anthropic recentemente chamou esse espaço interno de workspace, e talvez ele só pareça estranho para humanos que não estão acostumados com SVG.
    • Este teste avalia a geração de SVG em si, não raster.
    • Modelos de imagem com suporte a saída de texto, como o Image2, ou modelos de texto de uso geral que leem imagens, como o Claude, conseguem vetorizar imagens raster. Mas a qualidade ainda é baixa, de modo que o resultado feito manualmente no Inkscape por um não especialista é melhor.
  • A partir do momento em que um método de pontuação da saída de LLMs fica conhecido, financiadores e laboratórios começam a prestar atenção nesse indicador e a calibrar seus modelos para ele. No melhor dos casos, eles otimizariam também a geração de pelicanos enquanto melhoram a capacidade geral com SVG, mas, uma vez que a métrica já se tornou conhecida, fica difícil usá-la como uma avaliação independente confiável.