1 comentários

 
GN⁺ 5 시간 전
Comentários do Hacker News
  • Só hoje, esta já é a segunda conversa compartilhada do ChatGPT realmente interessante que vi
    A primeira foi um caso em que a pessoa continuou dizendo “continue” ao ChatGPT e acabou encontrando um contraexemplo para outra conjectura: https://x.com/DmitryRybin1/status/2079904005652893709

    • Para problemas em que um agente provavelmente desistiria, “continue” de fato costuma funcionar. Um LLM não sabe, em essência, o que é impossível
      Em prompts difíceis, costumo escrever algo como “repita este processo até convergir e não haver mais ideias de otimização. Você pode continuar repetindo”, também como uma condição normal de término
    • Em especial, o GPT parecia ter uma tendência maior do que outros modelos a parar no meio da tarefa, e a versão que usei recentemente provavelmente era a 4.X
      Respostas do tipo “cheguei até aqui e o próximo passo também está claro, mas, para continuar, envie uma mensagem sem sentido” se repetiam, o que era bem trabalhoso
    • Digitar apenas “continue”, sem contexto, significa confiar bastante que o LLM evitará erros lógicos sutis e escolherá a abordagem correta
      Mesmo modelos recentes, em tarefas simples de DevOps, às vezes afirmam que um pacote implantado não foi implantado e mudam de posição imediatamente quando o usuário contesta. Se isso é comum, fico em dúvida se, em uma prova matemática complexa, repetir apenas “continue”, sem verificar os resultados, pode levar a uma conclusão válida
    • No passado, o método que funcionou para muitos matemáticos também era exatamente continuar
    • Achei impressionante a parte em que, ao dizer “resultados parciais bastam, então vamos terminar com um contraexemplo completo e incondicional”, ele trabalhou por 88 minutos e 24 segundos e produziu um contraexemplo finito completo
  • Registros de conversas com IA de especialistas que acertam em cheio o ponto são infinitamente interessantes e mostram quanto é possível extrair de um modelo
    Terence Tao também conduz a conversa com força, usando perguntas curtas e incisivas, cheias de terminologia especializada e ferramentas teóricas, de modo parecido com como eu uso LLMs na minha área. O LLM parece ajustar o tom e o nível das respostas ao nível do usuário

    • No fim, “aprender a usar IA” significa primeiro dominar a área do problema
      Como desenvolvo há décadas, consigo usar IA para programação, mas é difícil usá-la em física teórica quando não consigo avaliar as respostas
    • Não entendi o conteúdo matemático, mas as mensagens de Tao eram surpreendentemente parecidas com as conversas que tenho com LLMs
      Em vez de tentar obter o resultado de uma vez, passar por uma exploração passo a passo permite corrigir continuamente a direção, o que é mais eficaz e satisfatório. Pedir tudo de uma vez parece mágico quando funciona, mas, quando falha, é preciso refazer o prompt desde o início
    • Passei por algo parecido com o Claude alguns dias atrás. Mesmo dando requisitos de forma vaga, tudo ia bem, até que ele falhou no ponto central; quando passei a ser mais rigoroso, mesmo depois de o problema ser resolvido, o comportamento mudou dentro do projeto: ele passou a verificar várias coisas com antecedência e a pedir minhas instruções com mais frequência
      É um pouco incômodo, mas vale tolerar se for eficaz
  • A conversa de Terence Tao com o ChatGPT é interessante por dois motivos. O contraexemplo não é uma simples força bruta, mas sim um polinômio com uma estrutura muito específica para produzir o resultado desejado, e as perguntas de Tao também são tão precisas que seria difícil obter as mesmas informações sem formação matemática avançada
    Tao parece entender parte da estrutura do problema e do contraexemplo e então usar a IA para empurrar o restante da exploração

    • Um dos humanos mais brilhantes do mundo faz a pergunta, e o LLM responde no estilo “pensando bem, é realmente simples”, o que lembra um professor ensinando um aluno talentoso e dá uma lição de humildade
    • Existe a piada de que, se você não consegue bons resultados de um modelo, o problema é “falta de habilidade”, mas há alguma verdade nisso. A capacidade de usar IA exige não só a habilidade de criar prompts iterativos que o agente entenda, mas também conhecimento profundo da área para saber o que explorar
      Sem um dos dois, isso pode levar à frustração ou a resultados ainda piores
    • Nos próximos anos, a capacidade de discutir bem a própria área de especialidade com LLMs será uma habilidade humana útil, mas, no fim, até isso deve se diluir
  • É impressionante ver Tao sugerindo simplificações continuamente e sendo conduzido pelo processo de descoberta. Ele se interessa por usar a IA para entender algo, mapeá-lo com eficiência para seu próprio sistema de pensamento e encontrar resultados intermediários mais simples que generalizem ou expliquem o fenômeno
    O que eu mais sentia falta no JPL e na academia eram justamente essas discussões do tipo “e se fosse assim?”

    • A simbiose entre humanos e IA parece ser um valor recém-surgido da IA. Enquanto produzo resultados, como diffs de código, posso continuar julgando o quão sólido está meu sistema de pensamento na etapa atual
      Em especial, posso escolher com que grau de precisão quero entender por conta própria o problema em questão, uma opção que praticamente não existia antes da IA
    • Parece semelhante ao modo como professores de matemática vêm usando alunos de pós-graduação há centenas de anos
  • A terminologia e a notação da matemática são inacreditavelmente densas e difíceis. Em outras áreas de ciência e engenharia, em geral dá para acompanhar com a ajuda do Google ou da Wikipedia, mas a matemática avançada se afasta rápido demais de um nível compreensível no cotidiano
    Mesmo alguém acostumado à área técnica provavelmente se sentiria completamente perdido ao se deparar com matemática difícil

    • Isso vale para quase todas as áreas, incluindo ciência da computação. Muitas pessoas atuam em um nível superficial sem perceber o conhecimento de base que acumularam
      Um engenheiro de software mediano também precisa conhecer inúmeros termos como cache, stack, heap, processo, thread, socket, TCP, HTTP, TLS, deadlock, condição de corrida, atomicidade, event loop, corrotina, transação, replicação, sharding, serialização, DNS etc. Só “cache” pode significar cache de CPU, de página, de navegador, de CDN ou de Redis, e palavras comuns como sessão, handle, pool, buffer, stream e canal mudam de significado conforme o contexto
    • Em uma aula de mecânica quântica, quando apareceu H Psi = E Psi no quadro, todos riram dizendo que bastava “cancelar Psi”, mas um lado era multiplicação e o outro era um operador de multiplicação matricial, então tivemos de aprender uma nova notação
      Também já fiquei confuso por não saber que o negrito em uma variável significava uma matriz
    • A maturidade matemática de que se fala em matemática é parecida com o processo de aprender programação, música ou culinária e passar por várias epifanias que mudam sua perspectiva. Como, na matemática, o próprio raciocínio abstrato é a principal limitação, há mais dessas etapas do que em outras atividades
    • A abstração é essencial. A memória de trabalho humana é muito pequena, então, para raciocinar sobre vários problemas, é preciso criar estruturas hierárquicas em várias camadas, e isso está próximo da essência da matemática
    • A matemática tenta minimizar a ambiguidade mais do que outras áreas. Campos não matemáticos tendem a reutilizar palavras comuns atribuindo-lhes significados especializados, e, especialmente nas ciências sociais e nas humanidades, por não haver símbolos estranhos, não especialistas às vezes nem percebem sua falta de compreensão
  • Não consigo avaliar a matemática em si, mas algumas coisas chamam atenção no comportamento do modelo. Em algumas perguntas ele raciocina, em outras responde diretamente e, às vezes, também contesta apresentando condições ou correções
    Além disso, mesmo alternando por bastante tempo entre perguntas e respostas, leitura de PDFs, escrita de código e raciocínio, ele manteve o tema, e Tao também parece ter considerado a interação produtiva. A evolução dos modelos se parece mais com isso do que com a alta de um número específico em um benchmark

    • A expressão “ainda assim, há um ponto a observar” é uma resposta clichê da geração atual do Codex e do Claude
      Na prática, muitas vezes o conteúdo é tão óbvio que mal dá para chamar de ressalva, mas faz o usuário esperar que exista uma condição importante. Assim como começar sempre dizendo que vai responder “com honestidade”, isso acaba distraindo, então costumo inibir via AGENTS.md
  • O ponto mais surpreendente dessa conversa é que o agente de IA parece um interlocutor em pé de igualdade com Tao, um dos maiores matemáticos modernos
    Tao define a direção, mas ao mesmo tempo aprende e se apoia nas explicações, análises e inferências da IA, dando a sensação de uma cena em que ele discute resultados com um doutorando ou outro professor. Daqui a um ano, ou depois de dois lançamentos de modelos, a IA pode ficar claramente mais forte que Tao

    • Pelo contrário, esta conversa parece uma contraevidência para essa perspectiva. Mesmo que ele tivesse conversado com outra IA, é improvável que tivesse sido tão produtivo quanto a conversa com Tao
      Não sei se isso vai mudar em um ano, mas estou cético porque o horizonte-alvo continua sendo adiado
    • É útil pensar no LLM como um espelho. Se você fala como um matemático especialista, o modelo também responde assim, mas, embora o primeiro prompt de Tao pareça simples, seria difícil para um calouro de faculdade escrevê-lo no mesmo nível
      É o fenômeno oposto aos prompts da época do GPT-3.5 do tipo “você é um matemático profissional”. Como não se diz isso a um especialista de verdade, essa frase acaba, na verdade, revelando ao modelo que o usuário não é especialista
    • Considerando que a mesma IA também ajuda com receitas, diagnóstico de ruídos estranhos no carro, lição de biologia e tradução, talvez já seja possível dizer que ela é mais forte que Tao
      Mesmo olhando só para matemática, por ter essa profundidade em quase todos os subcampos, eu diria que ela já é mais forte
  • O pedido “Como ativei o Pro, você pode continuar procurando uma explicação geométrica de X_3 ~ A3, evitando coordenadas ou construções forçadas?” é a imagem perfeita de um cliente satisfeito com um recurso pago

    • Em tópicos avançados, parece que fazer perguntas bem curtas induz respostas sem rodeios. Somando a isso a ativação do Pro, pode ter melhorado ainda mais
    • É surpreendente que até Terence Tao tenha de pagar para conversar com o ChatGPT. Parece que, na verdade, a OpenAI é que deveria pagar Tao
  • Quatro anos atrás, uma conversa com o ChatGPT era assim: https://i.imgur.com/WPaWgzZ.png
    Vivemos uma época em que dá curiosidade saber até onde isso vai chegar daqui a mais quatro anos

    • Pode ser um futuro surpreendente, mas isto também vale como referência: https://x.com/pronounced_kyle/status/1768852493092680036
    • No Reino Unido a imagem não aparece; fiquei curioso para saber qual é o conteúdo
    • Mostra como afirmações categóricas do tipo “LLMs não raciocinam, só repetem frases básicas, então não ficarão inteligentes nem em 100 anos” envelhecem rapidamente
  • É estranhamente reconfortante que, até numa sessão de ChatGPT de um supergênio, quando um humano escreve uma frase, o LLM responda com três páginas