Treinamento de IA do Slack com dados de clientes
(slack.com)- O Slack não desenvolve modelos de IA generativa com dados de clientes, mas em modelos preditivos como recomendação de emoji e de canais, mensagens, conteúdo, arquivos e informações de uso podem ser analisados
- Os modelos globais são projetados para não reproduzir partes dos dados dos clientes, e há controles para impedir que funcionários acessem o conteúdo subjacente durante o desenvolvimento de IA/ML ou processos de análise
- Clientes podem solicitar que os dados do workspace ou da organização sejam excluídos do treinamento dos modelos globais do Slack, e mesmo após a exclusão ainda podem continuar usando os benefícios dos modelos de ML treinados globalmente
- Recomendação de canais, resultados de busca, autocompletar e recomendação de emoji funcionam usando modelos externos, pontuações numéricas, contagens de interações passadas e trechos públicos, de forma a reduzir a exposição de dados de clientes
- Os recursos de IA generativa do Slack usam LLMs de terceiros, mas os dados dos clientes permanecem dentro do limite de confiança do Slack e não são usados para treinar modelos de IA generativa sem opt-in explícito
Princípios de uso de dados em IA/ML do Slack
- Os princípios de desenvolvimento de produto do Slack têm como foco a privacidade e a segurança dos dados dos clientes
- ML e IA são usados como ferramentas para melhorar os produtos do Slack
- O Slack não desenvolve modelos de IA generativa com dados de clientes
- Para desenvolver modelos preditivos como recomendação de emoji e de canais, os seguintes dados podem ser analisados
- Dados de clientes enviados ao Slack: mensagens, conteúdo, arquivos etc.
- Outras informações definidas na política de privacidade e nos contratos com clientes: incluindo informações de uso
Modelos globais e controle de acesso
- O Slack não constrói nem treina modelos amplamente usados por toda a base de clientes de forma que possam reproduzir partes dos dados dos clientes
- Durante o desenvolvimento de modelos de IA/ML ou a análise de dados de clientes, funcionários do Slack não podem acessar o conteúdo subjacente
- O Slack adota várias medidas técnicas para proteger a confidencialidade e a segurança dos dados dos clientes
- Clientes podem fazer opt-out para impedir que seus dados de clientes sejam usados no treinamento dos modelos globais do Slack
- Os dados de clientes de workspaces que fizerem opt-out serão usados apenas para melhorar a experiência daquele workspace
- Os benefícios dos modelos de ML treinados globalmente continuam disponíveis
- Owners de Org ou Workspace, e o Primary Owner, devem enviar para
feedback@slack.coma URL do Workspace/Org com o assuntoSlack Global model opt-out request - O Slack responde quando o processamento da solicitação for concluído
Melhoria do serviço com dados de clientes e outras informações
- As equipes de produto e análise do Slack podem usar dados de clientes e outras informações para desenvolver, atualizar e melhorar o serviço
- Essa personalização e essas melhorias são possíveis no processo de estudar e entender como os usuários interagem com o Slack
- As obrigações de confidencialidade presentes no contrato com clientes do Slack e na Privacy Policy se aplicam a cada cenário
- Os clientes são proprietários de seus próprios dados
- O Slack agrega e separa os dados dos clientes para que, mesmo ao usar esses dados em atualizações do serviço, terceiros não possam identificar um cliente ou uma pessoa específica como fonte da melhoria
- Afiliadas do Slack ou subprocessadores estão incluídos nas exceções
Como os dados são protegidos em cada recurso preditivo
-
Recomendação de canais
- Pode recomendar a entrada em novos canais públicos dentro da empresa
- As recomendações se baseiam em associação a canais, atividade e sobreposição de tópicos
- O modelo aprende com recomendações anteriores e com o fato de o usuário ter entrado ou não no canal
- Um modelo externo, não treinado com mensagens do Slack, avalia a similaridade de tópicos e gera uma pontuação numérica
- O modelo global faz recomendações usando apenas essa pontuação numérica e dados que não são de clientes
-
Resultados de busca
- O modelo de ML de busca identifica resultados relevantes para uma consulta específica e ajuda o usuário a encontrar a informação desejada
- Ele se baseia em resultados de buscas anteriores e no histórico de engajamento
- O modelo é projetado para não conseguir reproduzir consultas de busca nem resultados
-
Autocompletar
- Pode autocompletar consultas de busca ou outros textos
- Por exemplo, se o usuário digitar algumas letras iniciais de
Customer Support, a expressão pode ser completada - As sugestões são feitas localmente e vêm de trechos comuns de mensagens públicas no workspace do usuário
- O algoritmo que seleciona sugestões potenciais aprende globalmente com casos anteriores de conclusões sugeridas e aceitas
- Ele usa regras que pontuam a similaridade entre o texto digitado e a sugestão, e no algoritmo entram apenas pontuações numéricas e contagens de interações passadas
-
Recomendação de emoji
- Pode sugerir emojis de reação com base no conteúdo e no sentimento da mensagem, no uso passado de emojis e na frequência com que certos emojis são usados pela equipe em contextos específicos
- Se reações 🎉 forem comuns para mensagens de parabéns em um determinado canal, o sistema pode sugerir 🎉 também para uma nova mensagem positiva e semelhante
- Um modelo externo, não treinado com mensagens do Slack, pode classificar o sentimento da mensagem
- O modelo do Slack considera apenas a frequência com que mensagens de determinado sentimento foram associadas a emojis específicos naquele workspace para sugerir emojis
Tratamento de dados de clientes em IA generativa
- IA generativa é uma categoria de sistemas de IA capazes de gerar conteúdo, como texto, em resposta aos prompts inseridos pelo usuário
- Essa categoria inclui os grandes modelos de linguagem (LLMs)
- O AI in Slack usa IA generativa e utiliza LLMs de terceiros
- A menos que o cliente dê consentimento explícito de opt-in, os dados de clientes não são usados para treinar modelos de IA generativa
- O AI in Slack usa LLMs prontos, e esses modelos não são atualizados com dados de clientes após a solicitação nem retêm dados de clientes de outra forma
- Esses modelos são hospedados em infraestrutura de provedores de nuvem como a AWS
- Os dados dos clientes permanecem dentro do limite de confiança do Slack, e os provedores de LLM não podem acessar os dados dos clientes
- É possível receber notificações sobre mudanças de subprocessadores na Trust and Compliance webpage
Fontes das respostas de busca do Slack AI
- O recurso de busca do AI in Slack obtém fontes de resposta a partir de recursos internos do Slack e de documentos conectados
- As fontes de busca incluem
- Recursos do Slack: canvas, huddles canvas notes, clip transcripts, text snippets
- Arquivos enviados ao Slack: PDF, email, docx, pptx, Keynote
- Documentos conectados do Google Drive: Docs, Slides
- Documentos do Sharepoint/OnDrive: Word, Powerpoint
- Apps parceiros de armazenamento de arquivos como Box: quando instalados
- O usuário precisa estar autenticado para acessar esses arquivos por meio da integração com o Slack
- Administradores podem desativar todos os resultados de arquivos ou configurar para que arquivos hospedados externamente não sejam usados como fonte
- Mais orientações estão disponíveis no Help Center
1 comentários
Comentários do Hacker News
Entrei em contato com o suporte para fazer opt-out, e a resposta dizia que a solicitação havia sido concluída
O Slack explicou que tem modelos de machine learning em nível de plataforma, como recomendações de canais/emojis e resultados de busca, mas que eles não são criados nem treinados de forma a aprender, memorizar ou reproduzir dados de clientes
O Slack AI é um add-on comprado separadamente e, segundo a empresa, não treina LLMs com dados de clientes; usa LLMs hospedados dentro da infraestrutura AWS do Slack, de modo que os dados não são compartilhados com provedores externos de LLM
Links da política: https://slack.com/trust/data-management/privacy-principles, https://slack.engineering/how-we-built-slack-ai-to-be-secure...
Pelo menos até a próxima atualização dos termos de uso
Foi isso que você fez, imagino?
Se a estrutura é “você pode fazer opt-out para que dados de clientes não sejam usados no treinamento do modelo global do Slack; mesmo assim, os dados do workspace continuam sendo usados apenas para melhorar a experiência daquele workspace, e você ainda recebe os benefícios do modelo global treinado”, então fico pensando por que alguém não faria opt-out
Claro, exceto quem nem sabe que precisa fazer opt-out; fora isso, parece uma escolha em que só se perde
Usuários individuais aparentemente não têm voz sobre como seus próprios dados são usados, e precisam falar com o Workspace Owner
Quando eu for falar com essa pessoa, provavelmente vou pedir que avalie uma plataforma alternativa
No fim vira um jogo de whack-a-mole de opt-out, o método é uma consulta genérica e, ao que parece, mesmo com opt-out eles ainda continuam treinando
Talvez coloquem uma pequena dica em algum lugar quase invisível lá pela página 300 dos termos
Se enxergar o fato de não fazer opt-out como “ajudar a construir um produto melhor”, e já é um produto pelo qual você paga, então se isso puder tornar a próxima versão melhor sem exigir tempo extra seu, por que não?
Você recebe um produto melhor pelo mesmo preço, e a empresa recebe um produto melhor para vender
Pode até ser uma troca em que a empresa ganha mais, mas só porque um lado ganha mais não significa que o outro perde
Se você valoriza muito a privacidade dos dados ou acredita que permitir esse treinamento realmente cria risco de exposição de informações privadas, aí a história muda; nesse caso existe a opção de parar, então cada um pesa o valor entre “produto melhor” e “risco estimado de exposição de informações privadas”
A frase “modelos amplamente usados por todos os clientes não são criados nem treinados de forma a aprender, memorizar ou reproduzir alguns dados de clientes” tem tanta nuance e tanta linguagem de isenção de responsabilidade que inspira mais desconfiança do que confiança
Ela só vale para modelos usados “amplamente por todos os clientes”, então, se não forem amplamente usados ou forem usados só por alguns clientes, a frase inteira deixa de se aplicar
Logicamente, isso soa como uma implicação de que nesses casos os dados poderiam vazar, o que é bem ruim
Essa redação precisa ser corrigida, e quem a escreveu é um risco
Ou seja, os dados de clientes não são usados para treinar “modelos amplamente usados por todos os clientes dessa forma”, mas ainda assim ajudam no treinamento do modelo global
Só que esse problema é maior para nós do que para eles
Se alguém fizer perguntas como se estivesse conversando sobre uma situação muito específica, parece possível que dados confidenciais acabem saindo, mesmo sem serem atribuídos ao nome do cliente
Não é como se alguém não pudesse perguntar a um LLM como uma empresa específica ou aleatória de um determinado setor projetaria alguma coisa
O modelo de recomendação de canais aprende com recomendações anteriores e com o fato de o usuário ter entrado ou não no canal recomendado, mas diz separar dados de clientes e o modelo para proteger a privacidade
Eles explicam que usam um modelo externo, não treinado com mensagens do Slack, para avaliar similaridade de tópicos e gerar uma pontuação numérica, e que o modelo global faz recomendações apenas com essa pontuação e dados que não são de clientes
Na busca, dizem que não treinam com a consulta nem com o texto dos resultados em si, mas com informações contextuais por equipe, como quantas vezes uma mensagem foi clicada na busca ou a sobreposição de palavras entre a consulta e a mensagem recomendada
As sugestões de autocompletar vêm de frases comuns em mensagens públicas do workspace e, no nível global, aprendem com resultados de autocompletar que já foram sugeridos e aceitos, mas dizem que o algoritmo usa apenas pontuações e contagens de interações anteriores
A recomendação de emojis também seguiria essa lógica: usam um modelo externo, não treinado com mensagens do Slack, para classificar o sentimento e consideram apenas a frequência com que mensagens com aquele sentimento e um emoji específico apareceram juntas naquele workspace
Em resumo, para excluir os dados do modelo global, é preciso fazer opt-out
Ao mesmo tempo, dizem de forma ambígua que “os dados não vazam entre workspaces”, o que deixa tudo muito confuso
O certo é usar ferramentas nas quais os dados não possam vazar, e não ferramentas nas quais os dados “não vão” vazar
A frase “ao desenvolver modelos de IA/ML ou analisar dados de clientes, o Slack não pode acessar o conteúdo subjacente. Há várias medidas técnicas para impedir isso” é confusa
“Não pode” é uma formulação forte, mas fico me perguntando como isso seria possível se os modelos de IA podem acessar os dados, mas a própria Slack, Inc não pode
Se não deixei passar nada, isso parece mais “não faz” do que “não consegue fazer”
Provavelmente querem dizer “funcionários da Slack”, mas “Slack” pode incluir os ativos da empresa, agentes, sistemas, computadores, servidores, modelos de IA etc.
Mesmo que a Signal diga “não podemos acessar o conteúdo do usuário”, isso ainda soa como uma formulação frágil e otimista
Quando se ouve “não pode”, a interpretação natural é que ninguém dentro da empresa pode fazer isso dentro dos limites legais
Funcionários da Slack podem desativar essas medidas técnicas, e funcionários da Signal também poderiam lançar uma atualização do app para redirecionar todas as mensagens para outro servidor
Uma formulação melhor seria “os funcionários da Slack não acessam o conteúdo subjacente”
Então parece bem claro que o acesso é possível
Por exemplo, um job em lote de treinamento de modelo pode rodar como um usuário de sistema que acessa dados anotados como “interação”, mas talvez não tenha permissão para acessar dados de “conteúdo”, como corpo de mensagens ou texto de consultas de usuários
Se o job de treinamento tentar fazer uma RPC para buscar esse conteúdo, ele seria barrado, do mesmo jeito que alguém seria barrado ao tentar acessar a DM de outra pessoa sem login
Em empresas grandes, engenheiros ou PMs normalmente não decidem listas de controle de acesso por conta própria; eles pedem permissões de acesso de jobs em lote a algum sistema, e as pessoas que operam esse sistema também seguem as políticas da empresa
É parecido com um bancário que lida com números de conta, mas não pode transferir dinheiro escondido para a própria conta pessoal, ou acabaria sendo pego
Essa frase parece significar algo mais próximo de que, no sistema, não é possível que algum PM da Slack ignore a política para melhorar o OKR do próprio time e treine escondido com dados de clientes que nenhum outro time usa
Claro, a analogia não é perfeita
Um bancário estaria mais para um atendente de suporte ao cliente da Slack, que poderia ver mensagens em nome do cliente com consentimento, e provavelmente não existe na prática uma forma de repassar para um job de treinamento de modelo esse acesso limitado concedido a uma pessoa
Em uma empresa madura, também deveria haver bloqueios para impedir que um funcionário treine um modelo em um notebook qualquer usando permissões de acesso a dados pessoais e depois coloque esse modelo em produção
Em startups, talvez as coisas funcionem assim
O mesmo vale para Telegram e WhatsApp
Dá vontade de manter uma lista de empresas que fazem isso para poder evitá-las
Se você souber de outras empresas que treinam com dados de clientes sem um toggle de opt-out fácil e bem visível, seria bom deixar nos comentários abaixo
Antes, dizia que as informações obtidas em solicitações de suporte técnico seriam usadas apenas para resolver o problema e que, após remover dados pessoais, alguns detalhes técnicos poderiam ser usados para gerar relatórios de bug
Na nova redação, diz que, após remover dados pessoais, certas informações técnicas podem ser usadas para gerar relatórios de bug, e que informações técnicas anonimizadas podem ser enviadas para o Microsoft Azure para usar serviços da OpenAI e melhorar a experiência de suporte técnico
Dizem que informações de identificação pessoal, como nome, telefone, endereço, e-mail, endereço IP e número de série do produto, serão excluídas
Antes eu simplesmente apagava os e-mails de atualização da política de privacidade, mas agora criei o hábito de olhar o diff para ver se enfiaram uma cláusula dessas
O incentivo é forte demais para resistir
https://twitter.com/kepano/status/1688610782509211648
https://twitter.com/kepano/status/1682829662370557952
A lista está vazia
Não vejo como isso pode ser compatível com as leis europeias do direito ao esquecimento
Na verdade, fico pensando se algum desses modelos de IA consegue respeitar esse direito
Se o usuário pedir exclusão, eles vão treinar o modelo inteiro de novo? Duvido muito
Dizem que copyright não existe mais, que não é roubo porque é transformação, que você precisa fazer opt-out antes de treinarem o modelo com a internet inteira, e ainda assim provavelmente nem vão respeitar isso
Dizem que os empregos não vão diminuir nem um pouco, enquanto toda empresa demite 15% imediatamente e força a volta ao escritório para conseguir até mais dados de carros
Vendem a ideia de que você vai virar o melhor programador produtivo com “um truque estranho”, mas na prática parece mais que querem vender isso para indivíduos do que construir eles mesmos um produto lucrativo
O mais grave e perigoso é a informação ser censurada no nível mais baixo antes mesmo de chegar às pontas dos dedos ou aos olhos das pessoas
[0] https://ai.stanford.edu/~kzliu/blog/unlearning
Pelo que sei, se o modelo já foi treinado, não seria necessário apagá-lo por causa de um pedido ligado ao direito ao esquecimento, mas a incerteza jurídica é grande
Pelas decisões recentes sobre GDPR, ainda é bem possível que continue sendo uma violação justamente por ser opt-out, e não opt-in
Imagino que eles provavelmente estejam filtrando todos os dados gerados no EEE
Para mensagens de equipe, vocês realmente deveriam usar uma solução self-hosted como Matrix/Element
Tudo bem não querer manter o próprio hardware dentro da empresa, mas a solução é operar algo com criptografia de ponta a ponta de forma que o provedor de hospedagem não consiga acessar os dados
cryptpad.fr também é um ótimo software
Você recebe o código-fonte (Ruby on Rails) e faz o deploy onde quiser; nós rodamos isso em um droplet da DigitalOcean
Slack, Google, Microsoft e todos os fornecedores de ferramentas SaaS têm um incentivo gigantesco para fazer esse tipo de coisa
Se uma empresa quiser evitar ser comoditizada pelo fornecedor, no fim ela precisa controlar seus próprios dados e sua estratégia de IA
Isso provavelmente significa desligar recursos pequenos, caros e potencialmente capazes de arruinar o negócio, criar uma base de conhecimento central com bom controle de acesso e governança, e então plugar qualquer LLM open source ou black-box de qualquer provedor
Foi por isso que eu queria que a empresa usasse Mattermost self-hosted em vez de Slack
Só como observação, o Windows 11 sincroniza arquivos com os servidores da Microsoft por padrão
Parece aquele negócio de “vamos usar isso só para escolher emoji, e talvez um pouco também numa divertida ferramenta interna de recomendação de ações”
Tipo uma ferramenta que recomenda ações divertidas para comprar com base no fluxo anonimizado e em tempo real dos pensamentos íntimos de centenas de milhares de empresas de tecnologia