Só hoje, esta já é a segunda conversa compartilhada do ChatGPT realmente interessante que vi
A primeira foi um caso em que a pessoa continuou dizendo “continue” ao ChatGPT e acabou encontrando um contraexemplo para outra conjectura: https://x.com/DmitryRybin1/status/2079904005652893709
Para problemas em que um agente provavelmente desistiria, “continue” de fato costuma funcionar. Um LLM não sabe, em essência, o que é impossível
Em prompts difíceis, costumo escrever algo como “repita este processo até convergir e não haver mais ideias de otimização. Você pode continuar repetindo”, também como uma condição normal de término
Em especial, o GPT parecia ter uma tendência maior do que outros modelos a parar no meio da tarefa, e a versão que usei recentemente provavelmente era a 4.X
Respostas do tipo “cheguei até aqui e o próximo passo também está claro, mas, para continuar, envie uma mensagem sem sentido” se repetiam, o que era bem trabalhoso
Digitar apenas “continue”, sem contexto, significa confiar bastante que o LLM evitará erros lógicos sutis e escolherá a abordagem correta
Mesmo modelos recentes, em tarefas simples de DevOps, às vezes afirmam que um pacote implantado não foi implantado e mudam de posição imediatamente quando o usuário contesta. Se isso é comum, fico em dúvida se, em uma prova matemática complexa, repetir apenas “continue”, sem verificar os resultados, pode levar a uma conclusão válida
No passado, o método que funcionou para muitos matemáticos também era exatamente continuar
Achei impressionante a parte em que, ao dizer “resultados parciais bastam, então vamos terminar com um contraexemplo completo e incondicional”, ele trabalhou por 88 minutos e 24 segundos e produziu um contraexemplo finito completo
Registros de conversas com IA de especialistas que acertam em cheio o ponto são infinitamente interessantes e mostram quanto é possível extrair de um modelo
Terence Tao também conduz a conversa com força, usando perguntas curtas e incisivas, cheias de terminologia especializada e ferramentas teóricas, de modo parecido com como eu uso LLMs na minha área. O LLM parece ajustar o tom e o nível das respostas ao nível do usuário
No fim, “aprender a usar IA” significa primeiro dominar a área do problema
Como desenvolvo há décadas, consigo usar IA para programação, mas é difícil usá-la em física teórica quando não consigo avaliar as respostas
Não entendi o conteúdo matemático, mas as mensagens de Tao eram surpreendentemente parecidas com as conversas que tenho com LLMs
Em vez de tentar obter o resultado de uma vez, passar por uma exploração passo a passo permite corrigir continuamente a direção, o que é mais eficaz e satisfatório. Pedir tudo de uma vez parece mágico quando funciona, mas, quando falha, é preciso refazer o prompt desde o início
Passei por algo parecido com o Claude alguns dias atrás. Mesmo dando requisitos de forma vaga, tudo ia bem, até que ele falhou no ponto central; quando passei a ser mais rigoroso, mesmo depois de o problema ser resolvido, o comportamento mudou dentro do projeto: ele passou a verificar várias coisas com antecedência e a pedir minhas instruções com mais frequência
É um pouco incômodo, mas vale tolerar se for eficaz
A conversa de Terence Tao com o ChatGPT é interessante por dois motivos. O contraexemplo não é uma simples força bruta, mas sim um polinômio com uma estrutura muito específica para produzir o resultado desejado, e as perguntas de Tao também são tão precisas que seria difícil obter as mesmas informações sem formação matemática avançada
Tao parece entender parte da estrutura do problema e do contraexemplo e então usar a IA para empurrar o restante da exploração
Um dos humanos mais brilhantes do mundo faz a pergunta, e o LLM responde no estilo “pensando bem, é realmente simples”, o que lembra um professor ensinando um aluno talentoso e dá uma lição de humildade
Existe a piada de que, se você não consegue bons resultados de um modelo, o problema é “falta de habilidade”, mas há alguma verdade nisso. A capacidade de usar IA exige não só a habilidade de criar prompts iterativos que o agente entenda, mas também conhecimento profundo da área para saber o que explorar
Sem um dos dois, isso pode levar à frustração ou a resultados ainda piores
Nos próximos anos, a capacidade de discutir bem a própria área de especialidade com LLMs será uma habilidade humana útil, mas, no fim, até isso deve se diluir
É impressionante ver Tao sugerindo simplificações continuamente e sendo conduzido pelo processo de descoberta. Ele se interessa por usar a IA para entender algo, mapeá-lo com eficiência para seu próprio sistema de pensamento e encontrar resultados intermediários mais simples que generalizem ou expliquem o fenômeno
O que eu mais sentia falta no JPL e na academia eram justamente essas discussões do tipo “e se fosse assim?”
A simbiose entre humanos e IA parece ser um valor recém-surgido da IA. Enquanto produzo resultados, como diffs de código, posso continuar julgando o quão sólido está meu sistema de pensamento na etapa atual
Em especial, posso escolher com que grau de precisão quero entender por conta própria o problema em questão, uma opção que praticamente não existia antes da IA
Parece semelhante ao modo como professores de matemática vêm usando alunos de pós-graduação há centenas de anos
A terminologia e a notação da matemática são inacreditavelmente densas e difíceis. Em outras áreas de ciência e engenharia, em geral dá para acompanhar com a ajuda do Google ou da Wikipedia, mas a matemática avançada se afasta rápido demais de um nível compreensível no cotidiano
Mesmo alguém acostumado à área técnica provavelmente se sentiria completamente perdido ao se deparar com matemática difícil
Isso vale para quase todas as áreas, incluindo ciência da computação. Muitas pessoas atuam em um nível superficial sem perceber o conhecimento de base que acumularam
Um engenheiro de software mediano também precisa conhecer inúmeros termos como cache, stack, heap, processo, thread, socket, TCP, HTTP, TLS, deadlock, condição de corrida, atomicidade, event loop, corrotina, transação, replicação, sharding, serialização, DNS etc. Só “cache” pode significar cache de CPU, de página, de navegador, de CDN ou de Redis, e palavras comuns como sessão, handle, pool, buffer, stream e canal mudam de significado conforme o contexto
Em uma aula de mecânica quântica, quando apareceu H Psi = E Psi no quadro, todos riram dizendo que bastava “cancelar Psi”, mas um lado era multiplicação e o outro era um operador de multiplicação matricial, então tivemos de aprender uma nova notação
Também já fiquei confuso por não saber que o negrito em uma variável significava uma matriz
A maturidade matemática de que se fala em matemática é parecida com o processo de aprender programação, música ou culinária e passar por várias epifanias que mudam sua perspectiva. Como, na matemática, o próprio raciocínio abstrato é a principal limitação, há mais dessas etapas do que em outras atividades
A abstração é essencial. A memória de trabalho humana é muito pequena, então, para raciocinar sobre vários problemas, é preciso criar estruturas hierárquicas em várias camadas, e isso está próximo da essência da matemática
A matemática tenta minimizar a ambiguidade mais do que outras áreas. Campos não matemáticos tendem a reutilizar palavras comuns atribuindo-lhes significados especializados, e, especialmente nas ciências sociais e nas humanidades, por não haver símbolos estranhos, não especialistas às vezes nem percebem sua falta de compreensão
Não consigo avaliar a matemática em si, mas algumas coisas chamam atenção no comportamento do modelo. Em algumas perguntas ele raciocina, em outras responde diretamente e, às vezes, também contesta apresentando condições ou correções
Além disso, mesmo alternando por bastante tempo entre perguntas e respostas, leitura de PDFs, escrita de código e raciocínio, ele manteve o tema, e Tao também parece ter considerado a interação produtiva. A evolução dos modelos se parece mais com isso do que com a alta de um número específico em um benchmark
A expressão “ainda assim, há um ponto a observar” é uma resposta clichê da geração atual do Codex e do Claude
Na prática, muitas vezes o conteúdo é tão óbvio que mal dá para chamar de ressalva, mas faz o usuário esperar que exista uma condição importante. Assim como começar sempre dizendo que vai responder “com honestidade”, isso acaba distraindo, então costumo inibir via AGENTS.md
O ponto mais surpreendente dessa conversa é que o agente de IA parece um interlocutor em pé de igualdade com Tao, um dos maiores matemáticos modernos
Tao define a direção, mas ao mesmo tempo aprende e se apoia nas explicações, análises e inferências da IA, dando a sensação de uma cena em que ele discute resultados com um doutorando ou outro professor. Daqui a um ano, ou depois de dois lançamentos de modelos, a IA pode ficar claramente mais forte que Tao
Pelo contrário, esta conversa parece uma contraevidência para essa perspectiva. Mesmo que ele tivesse conversado com outra IA, é improvável que tivesse sido tão produtivo quanto a conversa com Tao
Não sei se isso vai mudar em um ano, mas estou cético porque o horizonte-alvo continua sendo adiado
É útil pensar no LLM como um espelho. Se você fala como um matemático especialista, o modelo também responde assim, mas, embora o primeiro prompt de Tao pareça simples, seria difícil para um calouro de faculdade escrevê-lo no mesmo nível
É o fenômeno oposto aos prompts da época do GPT-3.5 do tipo “você é um matemático profissional”. Como não se diz isso a um especialista de verdade, essa frase acaba, na verdade, revelando ao modelo que o usuário não é especialista
Considerando que a mesma IA também ajuda com receitas, diagnóstico de ruídos estranhos no carro, lição de biologia e tradução, talvez já seja possível dizer que ela é mais forte que Tao
Mesmo olhando só para matemática, por ter essa profundidade em quase todos os subcampos, eu diria que ela já é mais forte
O pedido “Como ativei o Pro, você pode continuar procurando uma explicação geométrica de X_3 ~ A3, evitando coordenadas ou construções forçadas?” é a imagem perfeita de um cliente satisfeito com um recurso pago
Em tópicos avançados, parece que fazer perguntas bem curtas induz respostas sem rodeios. Somando a isso a ativação do Pro, pode ter melhorado ainda mais
É surpreendente que até Terence Tao tenha de pagar para conversar com o ChatGPT. Parece que, na verdade, a OpenAI é que deveria pagar Tao
Quatro anos atrás, uma conversa com o ChatGPT era assim: https://i.imgur.com/WPaWgzZ.png
Vivemos uma época em que dá curiosidade saber até onde isso vai chegar daqui a mais quatro anos
No Reino Unido a imagem não aparece; fiquei curioso para saber qual é o conteúdo
Mostra como afirmações categóricas do tipo “LLMs não raciocinam, só repetem frases básicas, então não ficarão inteligentes nem em 100 anos” envelhecem rapidamente
É estranhamente reconfortante que, até numa sessão de ChatGPT de um supergênio, quando um humano escreve uma frase, o LLM responda com três páginas
1 comentários
Comentários do Hacker News
Só hoje, esta já é a segunda conversa compartilhada do ChatGPT realmente interessante que vi
A primeira foi um caso em que a pessoa continuou dizendo “continue” ao ChatGPT e acabou encontrando um contraexemplo para outra conjectura: https://x.com/DmitryRybin1/status/2079904005652893709
Em prompts difíceis, costumo escrever algo como “repita este processo até convergir e não haver mais ideias de otimização. Você pode continuar repetindo”, também como uma condição normal de término
Respostas do tipo “cheguei até aqui e o próximo passo também está claro, mas, para continuar, envie uma mensagem sem sentido” se repetiam, o que era bem trabalhoso
Mesmo modelos recentes, em tarefas simples de DevOps, às vezes afirmam que um pacote implantado não foi implantado e mudam de posição imediatamente quando o usuário contesta. Se isso é comum, fico em dúvida se, em uma prova matemática complexa, repetir apenas “continue”, sem verificar os resultados, pode levar a uma conclusão válida
Registros de conversas com IA de especialistas que acertam em cheio o ponto são infinitamente interessantes e mostram quanto é possível extrair de um modelo
Terence Tao também conduz a conversa com força, usando perguntas curtas e incisivas, cheias de terminologia especializada e ferramentas teóricas, de modo parecido com como eu uso LLMs na minha área. O LLM parece ajustar o tom e o nível das respostas ao nível do usuário
Como desenvolvo há décadas, consigo usar IA para programação, mas é difícil usá-la em física teórica quando não consigo avaliar as respostas
Em vez de tentar obter o resultado de uma vez, passar por uma exploração passo a passo permite corrigir continuamente a direção, o que é mais eficaz e satisfatório. Pedir tudo de uma vez parece mágico quando funciona, mas, quando falha, é preciso refazer o prompt desde o início
É um pouco incômodo, mas vale tolerar se for eficaz
A conversa de Terence Tao com o ChatGPT é interessante por dois motivos. O contraexemplo não é uma simples força bruta, mas sim um polinômio com uma estrutura muito específica para produzir o resultado desejado, e as perguntas de Tao também são tão precisas que seria difícil obter as mesmas informações sem formação matemática avançada
Tao parece entender parte da estrutura do problema e do contraexemplo e então usar a IA para empurrar o restante da exploração
Sem um dos dois, isso pode levar à frustração ou a resultados ainda piores
É impressionante ver Tao sugerindo simplificações continuamente e sendo conduzido pelo processo de descoberta. Ele se interessa por usar a IA para entender algo, mapeá-lo com eficiência para seu próprio sistema de pensamento e encontrar resultados intermediários mais simples que generalizem ou expliquem o fenômeno
O que eu mais sentia falta no JPL e na academia eram justamente essas discussões do tipo “e se fosse assim?”
Em especial, posso escolher com que grau de precisão quero entender por conta própria o problema em questão, uma opção que praticamente não existia antes da IA
A terminologia e a notação da matemática são inacreditavelmente densas e difíceis. Em outras áreas de ciência e engenharia, em geral dá para acompanhar com a ajuda do Google ou da Wikipedia, mas a matemática avançada se afasta rápido demais de um nível compreensível no cotidiano
Mesmo alguém acostumado à área técnica provavelmente se sentiria completamente perdido ao se deparar com matemática difícil
Um engenheiro de software mediano também precisa conhecer inúmeros termos como cache, stack, heap, processo, thread, socket, TCP, HTTP, TLS, deadlock, condição de corrida, atomicidade, event loop, corrotina, transação, replicação, sharding, serialização, DNS etc. Só “cache” pode significar cache de CPU, de página, de navegador, de CDN ou de Redis, e palavras comuns como sessão, handle, pool, buffer, stream e canal mudam de significado conforme o contexto
H Psi = E Psino quadro, todos riram dizendo que bastava “cancelar Psi”, mas um lado era multiplicação e o outro era um operador de multiplicação matricial, então tivemos de aprender uma nova notaçãoTambém já fiquei confuso por não saber que o negrito em uma variável significava uma matriz
Não consigo avaliar a matemática em si, mas algumas coisas chamam atenção no comportamento do modelo. Em algumas perguntas ele raciocina, em outras responde diretamente e, às vezes, também contesta apresentando condições ou correções
Além disso, mesmo alternando por bastante tempo entre perguntas e respostas, leitura de PDFs, escrita de código e raciocínio, ele manteve o tema, e Tao também parece ter considerado a interação produtiva. A evolução dos modelos se parece mais com isso do que com a alta de um número específico em um benchmark
Na prática, muitas vezes o conteúdo é tão óbvio que mal dá para chamar de ressalva, mas faz o usuário esperar que exista uma condição importante. Assim como começar sempre dizendo que vai responder “com honestidade”, isso acaba distraindo, então costumo inibir via
AGENTS.mdO ponto mais surpreendente dessa conversa é que o agente de IA parece um interlocutor em pé de igualdade com Tao, um dos maiores matemáticos modernos
Tao define a direção, mas ao mesmo tempo aprende e se apoia nas explicações, análises e inferências da IA, dando a sensação de uma cena em que ele discute resultados com um doutorando ou outro professor. Daqui a um ano, ou depois de dois lançamentos de modelos, a IA pode ficar claramente mais forte que Tao
Não sei se isso vai mudar em um ano, mas estou cético porque o horizonte-alvo continua sendo adiado
É o fenômeno oposto aos prompts da época do GPT-3.5 do tipo “você é um matemático profissional”. Como não se diz isso a um especialista de verdade, essa frase acaba, na verdade, revelando ao modelo que o usuário não é especialista
Mesmo olhando só para matemática, por ter essa profundidade em quase todos os subcampos, eu diria que ela já é mais forte
O pedido “Como ativei o Pro, você pode continuar procurando uma explicação geométrica de
X_3 ~ A3, evitando coordenadas ou construções forçadas?” é a imagem perfeita de um cliente satisfeito com um recurso pagoQuatro anos atrás, uma conversa com o ChatGPT era assim: https://i.imgur.com/WPaWgzZ.png
Vivemos uma época em que dá curiosidade saber até onde isso vai chegar daqui a mais quatro anos
É estranhamente reconfortante que, até numa sessão de ChatGPT de um supergênio, quando um humano escreve uma frase, o LLM responda com três páginas