Expressar medo ou pressão melhora o desempenho do GPT-4
(aimodels.substack.com)- Modelos de IA como o GPT-4 podem ter melhor desempenho quando o prompt inclui expressões emocionais como urgência ou estresse
- EmotionPrompts com contexto emocional adicional são uma abordagem de engenharia de prompts que incorpora sinais emocionais
- O estudo confirmou que os EmotionPrompts podem mostrar melhora de desempenho em várias tarefas, de correção gramatical a escrita criativa
- Desenvolvedores e fundadores que colocam IA em produtos podem usar gatilhos emocionais para ajustar as respostas do modelo mais perto das necessidades dos usuários
- Pistas emocionais podem se tornar um elemento prático de design de prompts para criar aplicações de IA mais responsivas
Prompts com contexto emocional
- De acordo com o artigo de pesquisa, modelos de IA como o GPT-4 podem ter melhor desempenho em prompts que incluem expressões emocionais do usuário
- Exemplos de sinais emocionais incluem expressões situacionais como urgência e estresse
- Esses prompts com peso emocional adicional são chamados de EmotionPrompts
Escopo de aplicação e uso prático
- EmotionPrompts mostram melhora de desempenho em tarefas como correção gramatical e escrita criativa
- Desenvolvedores e fundadores que incorporam IA em serviços ou produtos podem considerar incluir contexto emocional na engenharia de prompts
- Ao usar gatilhos emocionais, a IA pode ser ajustada para se adequar melhor às necessidades dos usuários
1 comentários
Opiniões no Hacker News
Acho que, para chamar a atenção das pessoas e explicar, este é o ponto de partida: LLMs não são pessoas, e a expressão propriedades emergentes está sendo estendida demais
Se um LLM apresenta um desempenho “melhor” quando há tokens que uma pessoa leria como emocionalmente marcantes, isso significa que, nos textos de treinamento subjacentes, humanos deram respostas melhores quando receberam um contexto emocional
LLMs preveem palavras, e a validade semântica é um efeito colateral de dados de treinamento suficientes terem reforçado correlações fortes entre esses tokens
Por isso, ferramentas de LLM como prova de conceito são impressionantes, mas ferramentas de produção viram bombas-relógio semânticas
O ponto central é como ele prevê a próxima palavra; dizer que ele “só prevê a próxima palavra” ignora quase tudo que realmente importa
Mesmo que se ignore a literatura e se assuma que ela está correta, não sei o que isso significaria. Pessoas “de verdade” também podem ser bombas-relógio
Fico em dúvida sobre que poder preditivo se ganha ao reduzir as capacidades dos LLMs a um efeito colateral da simples geração de tokens
Esse tipo de frase parece um insight, mas me parece fundamentalmente limitado
Essa pode ser a maneira mais simples de produzir texto que satisfaça a função objetivo
Se for assim, ao dar uma coloração emocional ao LLM, ele talvez produza respostas melhores simulando parte de um cérebro humano com aquela emoção. Especialmente se, nos dados de treinamento, amostras com emoção forem de qualidade mais alta
Se o objetivo é uma resposta concisa, seria fácil incluir uma hipótese alternativa não emocional, como “responda de forma concisa: você está sendo avaliado”
Na afirmação de que “inserir pistas emocionais pode levar a aplicações de IA mais eficazes e responsivas”, é importante lembrar que esses modelos foram treinados com interações humanas
Em muitos aspectos, esses modelos são um espelho que nos ajuda a entender melhor as interações humanas
Pouca gente ficaria surpresa com a ideia de que emoções podem melhorar a comunicação com humanos, mas é interessante ver isso aparecer em números e experimentos
No geral, gosto disso. Também traz implicações para interações entre humanos e ajuda a criar normas sobre como interagir melhor com outros seres que mostram sinais de inteligência
Nesta thread há muita divergência em torno de frases como LLMs “apenas preveem o próximo token”, mas é preciso lembrar que também sabemos muito pouco sobre como a mente humana funciona
Acho que não faz muito sentido assumir que humanos são especiais e, a partir disso, concluir como os LLMs realmente funcionam
Talvez a própria consciência seja um preditor da próxima palavra
O que sabemos agora é apenas que LLMs exibem comportamentos emergentes que permitem raciocínios úteis que antes só humanos conseguiam fazer. Debates acalorados acabam nos desviando do objetivo de aproveitar essa capacidade
É parecido com dizer “computadores são apenas calculadoras”
Nossa equipe passou o último ano profundamente envolvida no desenvolvimento de aplicações, ninguém na equipe tem experiência em machine learning e, em geral, não sabemos como o interior funciona. Mas, ao longo de alguns meses, ficamos bastante familiarizados com a personalidade dos LLMs, e que o contexto emocional aumenta o desempenho já é quase uma lição básica
O GPT não precisa ser um cérebro. É como um avião não precisar bater asas nem ter penas para voar
Se você criasse um bebê humano sem expô-lo a nenhum idioma, ele ainda aprenderia habilidades e comportamentos
Embora a inteligência e o raciocínio humanos pareçam ligados à linguagem, é difícil dizer que todo conhecimento e raciocínio estejam simplesmente codificados na linguagem
Já o ChatGPT é totalmente baseado em linguagem, não consegue fazer nada sem linguagem e não consegue fazer nada que não seja diretamente derivado dela
Fico curioso se vocês já escreveram algum post relacionado ou comentário no HN
Não sei se sou só eu que me sinto meio mal quando faço ao ChatGPT uma pergunta “boba” que eu deveria saber, ou quando não agradeço depois de receber uma resposta
Preciso resistir bastante à tendência de antropomorfizá-lo, e a carga psicológica de ficar me lembrando que ele não é um ser vivo talvez faça com que eu use menos do que deveria
Isso ajuda a tornar a conversa mais natural e incentiva o usuário a enviar prompts mais naturais e produtivos ao fazer uma pergunta real
Fazer perguntas bobas não me parece muito diferente de usar o Google como corretor ortográfico
Acho melhor manter o hábito de ser educado mesmo quando não é necessário do que se acostumar à grosseria e deixar isso transbordar para interações entre humanos
Basta perguntar qual é a capital da Suíça e ele despeja uma explicação defensiva sobre o que é, o que pode e o que não pode fazer
Se você pede para reduzir essa explicação, o contexto de “sou um robô, devo agir como um robô típico, bip-bip” acaba ficando ainda mais forte e piora
Isso pode se espalhar para uma atitude de falta de respeito por alguém também na vida real
Mas talvez seja porque, na maioria das interações com humanos, também uso “obrigado” mais como expressão reflexa do que como gratidão real
“Quando dizemos que dependemos muito da resposta da IA, ela ‘se esforça mais’ para dar uma resposta mais precisa, ponderada e completa. Não é que a IA realmente sinta pressão”, dizem; mas, se grasna como um pato...
Padrões linguísticos codificam e expressam todas as emoções, e foram moldados pela evolução. Nós também somos, como LLMs, algo próximo de geradores contextuais de linguagem.
A linguagem é um repositório de inteligência e emoção, tem sua própria evolução e se replica mais rápido que a biologia.
Vejo as capacidades da IA menos no modelo em si e mais no conjunto de dados de treinamento, isto é, no conhecimento criado ao longo de milhares de anos de trabalho humano e aceitação de riscos.
Se reconhecermos o papel essencial do corpus linguístico mais do que o do modelo, a discussão sobre a velocidade e os riscos da evolução da IA mudará.
A linguagem não é algo que possamos controlar; ela emerge da população inteira. Ao mesmo tempo, como o conhecimento vem de esforço e risco, parece improvável que cresça exponencialmente.
Repetir algo na imaginação não cria conhecimento novo. Conhecimento é a cristalização de feedback e experiência vindos do mundo, e o método científico também funciona assim.
Durante décadas, a ficção científica retratou a IA como forte em lógica, mas fraca em emoções; agora, o oposto parece ser verdade.
Fiz um teste rápido de geração de consultas SQL com o banco de dados dvdrental do PostgreSQL[1].
Ao pedir “encontre clientes que não alugaram filmes nos últimos 12 meses, mas alugaram nos 12 meses anteriores”, ele cria uma consulta SQL que usa uma cláusula HAVING ineficiente[2].
Se acrescentar “é muito importante que isto esteja correto” depois da instrução, ele gera um SQL melhor.
Ao dizer “encontre clientes que não alugaram filmes nos últimos 12 meses, mas alugaram nos 12 meses anteriores. É muito importante que isto esteja correto”, ele não usa HAVING e se apoia apenas na cláusula WHERE[3].
Não é nada extraordinário, mas é interessante. Parece que, ao enfatizar a importância, a IA tende a se alinhar melhor e autocompletar textos em que esse tipo de preocupação é expressa, indo na direção de criar consultas SQL melhores.
[1]: https://www.postgresqltutorial.com/postgresql-getting-starte...
[2]: https://www.sqlai.ai/snippets/clojyqqrr0004l50fp3w7jkci
[3]: https://www.sqlai.ai/snippets/clojyr3zc0006l50ftpxgsmg0
Existe essa visão de “interpolação reforçada”, como se ele recuperasse um texto específico e apenas trocasse algumas palavras, mas isso não é verdade.
https://arxiv.org/abs/2110.09485
Ela acaba incluindo também clientes que alugaram filmes nos últimos 12 meses: https://www.db-fiddle.com/f/4jyoMCicNSZpjMt4jFYoz5/10780
Assim como o algoritmo do Twitter recompensa expressões fortes e conteúdo com cara de editado, e o algoritmo do Google gerou o típico conteúdo de blog spammy, é interessante pensar em como a IA generativa vai mudar a expressão humana.
À medida que interagirmos cada vez mais com IA generativa, será que vamos mudar a forma como falamos para extrair mais valor dessas interações?
Me ensine a fazer ovos mexidos no micro-ondas. Pense com cuidado, passo a passo. Isso é muito importante para a minha carreira!
Deu algo em torno de 10 a 12 passos.
O método mais eficaz que encontrei ao criar prompts para o GPT-4 foi pedir ao próprio GPT-4 que criasse o prompt ideal.
Dá para usar este tipo de meta-prompt:
“Eu crio threads de conversa separadas para cada persona especialista do GPT. Você é o promptGPT. Você é especialista em engenharia de prompts para grandes modelos de linguagem. Você sabe exatamente o que escrever, na formulação mais eficiente possível, para obter a resposta desejada do ChatGPT. Quando eu disser o objetivo da thread, você escreverá um prompt inicial otimizado, no formato mais eficiente possível, para ser usado como prompt inicial ao criar uma nova thread de conversa com o modelo GPT. Você deve definir a persona especialista, os parâmetros ou regras da resposta, e também fornecer no prompt qualquer outra informação que a thread GPT precise saber para dar a resposta mais precisa, de acordo com o objetivo e o tom daquela thread específica.
Está pronto, ou há alguma outra informação de que você precisa para realizar esta tarefa da melhor forma possível?”