- A próxima grande versão de modelo da OpenAI, versão interna do Astra, gerou novos resultados em 10 problemas em aberto que não tinham avanços centrais havia pelo menos 10 anos, abrangendo de geometria em altas dimensões a complexidade quântica e criptografia baseada em reticulados
- Na busca por soluções, foram usados tokens equivalentes a cerca de US$ 2.000 segundo a tabela de preços da Sol API; depois que humanos prepararam os artigos com o mesmo modelo, o modelo formalizou cada argumento como certificados Lean
- Entre os principais resultados estão a prova da existência de grupos não sofic, a refutação da conjectura de rigidez de Connes, o limite inferior
n⁴/log npara fórmulas aritméticas no cálculo do permanente e um teorema de repetição paralela exponencial para jogos quânticos gerais de dois jogadores - Foram melhoradas as cotas para empacotamento de esferas e códigos binários e esféricos; resolvidas a dificuldade de aproximação por fator polinomial do problema do vetor mais próximo e a conjectura de volume de Ehrhart; e respondidos também os problemas 146, 180 e 183 de Erdős
- A OpenAI afirma que, embora humanos sejam responsáveis pela preparação dos artigos, pela formalização em Lean e pela correção, os argumentos matemáticos foram gerados por IA, portanto não devem ser apresentados como autoria humana e é preciso atribuir honestamente a contribuição da IA
10 resultados gerados pelo Astra
- Para acelerar descobertas de cientistas e matemáticos, a OpenAI oferece gratuitamente seus melhores modelos do ChatGPT a 100 mil pessoas por meio do ChatGPT for Academic Researchers e, durante o desenvolvimento, continua avaliando os modelos com problemas de pesquisa em aberto
- Em maio, a empresa divulgou uma refutação gerada por IA da conjectura da distância unitária de Erdős, descoberta durante a avaliação de um modelo ainda não lançado; desde então, isso levou a pesquisas subsequentes em matemática e ciência da computação teórica
- Os problemas selecionados não tinham avanços em seus resultados centrais havia pelo menos 10 anos, e em sua maioria por muito mais tempo, além de terem recebido atenção considerável das comunidades matemáticas de suas áreas
- A versão interna do Astra encontrou as soluções, e o custo total da busca foi de cerca de US$ 2.000 segundo a tabela de preços da Sol API
- Humanos usaram o mesmo modelo para preparar os argumentos em um artigo
- O modelo formalizou cada argumento como certificados Lean
- Também foi publicada uma explicação do processo de raciocínio do modelo para cada solução
- Os 10 resultados são os seguintes
- Empacotamento de esferas em altas dimensões: reduziu um novo limite superior para a densidade de empacotamento de esferas até o ponto crítico de Cohn–Elkies
- Códigos binários e esféricos: melhorou exponencialmente as cotas para o tamanho máximo de códigos binários em uma distância mínima especificada e obteve resultados semelhantes também para códigos esféricos em altas dimensões
- Grupos não sofic: apresentou uma construção que estabelece a existência de grupos não sofic, resolvendo um problema em aberto central da teoria de grupos
- Conjectura de rigidez de Connes: refutou uma conjectura antiga de que certos grupos são determinados de forma única por suas álgebras de von Neumann
- Complexidade de circuitos aritméticos: obteve novos limites inferiores para calcular o permanente usando circuitos e fórmulas aritméticas; o limite inferior para fórmulas aritméticas é da ordem de
n⁴/log n - Repetição paralela quântica: provou um teorema de repetição paralela exponencial para jogos quânticos gerais de dois jogadores, estendendo um princípio fundamental da teoria clássica da complexidade
- Problema do vetor mais próximo: estabeleceu a dificuldade de aproximação por fator polinomial em um problema central de reticulados ligado à criptografia pós-quântica
- Conjectura de volume de Ehrhart: determinou, em todas as dimensões, o maior volume possível de corpos convexos cujo único ponto de reticulado interno é o centroide
- Números de Ramsey multicoloridos: obteve um limite inferior superexponencial para números de Ramsey triangulares multicoloridos, resolvendo o problema 183 de Erdős
- Conjecturas de teoria extremal dos grafos: resolveu os problemas 146 e 180 de Erdős com resultados sobre conjecturas de compacidade e degeneração
- Entre os trabalhos que vieram após a refutação da conjectura da distância unitária estão contraexemplos para a conjectura soma-produto nos reais, primos de decomposição e o problema de Elekes–Rónyai, necessidade de tempo quadrático para o par mais distante em dimensão superconstante sob a SETH, complexidade de comunicação de incidências ponto-reta sobre os reais e distâncias repetidas em reticulados de Minkowski
Atribuição da pesquisa e o papel da comunidade matemática
- O surgimento de sistemas de IA capazes de contribuir para a pesquisa matemática cria questões difíceis de serem respondidas por uma única empresa de tecnologia, e a OpenAI respeita posições preocupadas com o impacto da IA, incluindo as dos signatários da Declaração de Leiden sobre IA e matemática
- A forma como os resultados foram produzidos deve ser refletida com honestidade na indicação de autoria e atribuição de contribuições
- Apresentar provas geradas integralmente por IA como autoria humana distorce tanto a contribuição do sistema quanto o trabalho intelectual real dos humanos
- Humanos apoiaram a preparação dos artigos e a formalização em Lean e são responsáveis pela correção, mas os argumentos matemáticos em si foram gerados pelo sistema de IA
- A expectativa é que a comunidade matemática examine os resultados, dê contexto a eles e desenvolva as ideias em novas pesquisas e descobertas
- À medida que a IA evolui para se tornar uma colaboradora de pesquisa mais sofisticada, amplo acesso será essencial para que cientistas e matemáticos explorem e definam o futuro de suas áreas
1 comentários
Comentários do Hacker News
A maior reclamação é a falta de transparência sobre todo o experimento e sua configuração. É difícil acreditar que eles simplesmente fizeram o modelo resolver cada um desses 10 problemas uma única vez, então os US$ 2.000 apresentados sem divulgar o desenho experimental completo podem ser mal interpretados como p-hacking.
Eu gostaria de saber o número total de problemas dados ao modelo, a proporção e o custo dos que ele não conseguiu resolver antes de desistir, o número de tentativas por problema e o custo do ambiente de execução, incluindo se houve acesso a clusters de computação.
Também é preciso verificar a possibilidade de a OpenAI ter contratado um pesquisador de combinatória competente para resolver os problemas e usado o modelo apenas de forma acessória.
O mais surpreendente é que este texto nem chegou ao topo da primeira página do HN. Mesmo que seja um resultado incremental em relação ao anterior, isso mostra que já não ficamos tão surpresos com a ideia de a IA produzir avanços importantes em matemática e ciência da computação.
A influência da IA agora é difícil de negar, e quase não restam metas para mover. Da próxima vez, terão de movê-las para fora do estádio.
Quanto mais cedo as pessoas saírem da negação e começarem a tratar isso com seriedade, melhor.
Não sou especialista nas áreas em que a OpenAI afirma ter feito avanços, então não quero menosprezar precipitadamente os resultados, mas me preocupo que a linguagem do blog tenha sido exagerada para fins de marketing.
É verdade que antes não havia uma abordagem computacional que resolvesse esses problemas de forma confiável, mas a questão central é se essas provas acrescentaram novas ideias à matemática ou se foram uma busca em larga escala por combinações adequadas de ferramentas já existentes na literatura.
Quero saber se eram problemas cuja resposta já era intuitiva e cuja prova parecia possível, mas que não valiam o tempo de um especialista, ou se eram essencialmente difíceis e a IA fez mais do que inserir dados em um solucionador gigantesco.
Ou seja, inovação pode ser medida de forma bastante concreta pelo grau em que conecta ideias e áreas antes não conectadas. Puja Ohlhaver apresentou algo sobre isso, e eu também conduzi um experimento que apoiei: https://www.youtube.com/watch?v=guLDNMAOn24
advanced. Pesquisadores em nível de doutorado dedicaram boa parte de suas carreiras a esses problemas, então a expressão é adequada.Uma das previsões iniciais de aceleração rápida por IA era que sistemas capazes de resolver problemas em aberto de matemática avançada também aumentariam drasticamente o desempenho de software por meio de novas descobertas em matemática e ciência da computação.
Os resultados atuais estão no nível da matemática de fronteira que, para humanos, corresponderia aos 100 a 1.000 melhores do mundo, cerca do top 0,00001%, e também há grandes avanços em software, como quando a OpenAI corrigiu problemas de kernels de GPU e melhorou o desempenho em cerca de 15%. O fato de modelos gigantes adquirirem, juntos, capacidades de matemática e engenharia de software impossíveis em pequena escala conecta as duas coisas às leis de escala e à generalização da inteligência.
Ainda assim, vejo hoje como menor do que antes a probabilidade de descobertas em matemática e ciência abrirem diretamente melhorias de desempenho em software. Empresas de tecnologia também colocam doutores em matemática para fazer engenharia de software, não matemática pura, e muitas vezes eles se destacam por inteligência geral, não por descobertas acadêmicas recentes.
Portanto, isto é uma evidência de que os modelos estão melhorando, mas é difícil dizer que estamos às vésperas de uma aceleração explosiva (foom) detonada por uma revolução na matemática de fronteira.
As capacidades de uma IA interna cujo nome nem foi divulgado são impressionantes, mas não há em lugar nenhum sequer um nome de colaborador humano. Alguém ao menos deve ter feito café para esse modelo.
Fico curioso sobre qual teria sido o custo total desta pesquisa, incluindo os salários dos matemáticos e engenheiros.
https://x.com/polynoamial/status/2083470822258467194
Fico imaginando o que acontecerá se empresas como a OpenAI deixarem de divulgar resultados assim e simplesmente começarem a incluí-los nos dados de treinamento.
Mesmo que a ideia seja usá-la em privado para melhorar modelos, o ganho adicional de algumas provas corretas seria mínimo, e é bem provável que elas acabem sendo extraídas do modelo e conhecidas externamente.
Lugares como a OpenAI provavelmente podem permitir que especialistas usem milhões de dólares em tokens. Como não vendem 24 horas por dia todos os seus recursos computacionais, o custo interno fica, em geral, próximo ao custo da eletricidade.
Ainda assim, se os recursos computacionais não estão sendo usados completamente, isso levanta a dúvida sobre se todos os muitos data centers que serão construídos no futuro são realmente necessários.