- Se a IA generativa não operar com dados confiáveis, também fica difícil confiar nos resultados analíticos, elevando a gestão de dados de uma função de suporte técnico a uma função estratégica central
- No início, os desenvolvedores de aplicações também cuidavam da estrutura dos dados, mas depois os papéis se dividiram entre designers/administradores de banco de dados, CIO e CDO, e a integridade dos dados e um entendimento consistente em toda a empresa se tornaram desafios centrais
- Em dados estruturados, o modelo de dados e o banco de dados são modificados diretamente, mas no ambiente de IA generativa o controle é indireto, por meio da seleção e limpeza do texto que entra no LLM
- Para texto não estruturado, em vez do modelo de dados tradicional, é necessário usar ontologia/taxonomia, combinando isso com o ELDM (modelo lógico de dados corporativo) e atualizando-o continuamente
- À medida que os dados se distribuem entre vários sistemas, PCs e a internet, a centralização física se torna impossível, e a centralização semântica por meio do ELDM passa a ser mais importante
A gestão de dados que começou no trabalho de desenvolvimento de aplicações
- Nos primeiros sistemas computacionais, o desenvolvedor de aplicações definia, além da coleta de requisitos, aderência à metodologia, programação e testes, também os dados que o sistema usaria e sua estrutura
- O design de dados não era uma função corporativa independente, mas uma das várias tarefas incluídas no processo de desenvolvimento
Processamento de transações e o surgimento de funções especializadas em banco de dados
- Com a disseminação dos sistemas de processamento de transações, foi necessário refletir no design do banco de dados o tempo de resposta, a disponibilidade do sistema e a integridade da execução das transações
- Com o surgimento do designer de banco de dados, especializado em lidar com essas exigências, a gestão de dados começou a ser reconhecida como uma atividade independente
- Com o rápido aumento dos bancos de dados transacionais, surgiu a necessidade do administrador de banco de dados para controlar e coordenar vários bancos ao mesmo tempo
Problemas de integridade de dados e o data warehouse
- Como o mesmo elemento de dado passou a ser armazenado repetidamente em inúmeras aplicações interligadas, surgiu o problema de haver valores diferentes em cada local
- O problema das empresas deixou de ser possuir os dados e passou a ser decidir em quais dados confiar
- Apenas adicionar aplicações e tecnologias não resolveu o problema de integridade; ao contrário, ampliou e acelerou o problema
- Em vez de uma correção técnica, passou a ser necessária uma solução arquitetural que separasse dados operacionais e dados analíticos, e daí surgiu o data warehouse
Modelos de dados e o ambiente de dados estruturados
- Para transformar dados operacionais em dados analíticos e em um data warehouse, é necessário um modelo de dados que abstraia os tipos de dados existentes hoje ou necessários no futuro
- Sistemas operacionais e data warehouses são compostos por um ambiente de dados estruturados em que o formato de cada registro é o mesmo e apenas o conteúdo muda
- Os dados estruturados de aplicações, bancos de dados e bancos de dados transacionais são gerenciados por um sistema de gerenciamento de banco de dados (DBMS)
- Como falhas em sistemas transacionais afetam diretamente operações reais e clientes, como em caixas eletrônicos e sistemas de reserva aérea, o valor de sistemas precisos e estáveis e da gestão de dados aumentou
O trabalho do gestor de dados estruturados
- Depois de construir o modelo de dados, ele é mantido e ajustado continuamente de acordo com mudanças na economia, concorrência, tecnologia, legislação e mercado
- No design de banco de dados, seguem-se os princípios de normalização, mas aplica-se o nível necessário de desnormalização para o desempenho do processamento de transações
- O gestor de dados equilibra os objetivos do sistema e os requisitos de desempenho entre normalização e desnormalização
- Escreve-se o DDL que define o banco de dados com base no modelo de dados
- Realiza-se planejamento de capacidade para prever quando o equipamento de processamento transacional chegará ao limite
- Monitora-se continuamente a atividade do banco de dados e o crescimento dos dados
- Quando um problema é encontrado, usa-se controle direto, acessando e corrigindo diretamente o modelo de dados ou o banco de dados correspondente
A expansão dos dados não estruturados/textuais
- Nas empresas, além dos dados estruturados, existe uma ampla quantidade de dados não estruturados/textuais, e há estimativas de que até 90% dos dados corporativos sejam texto
- Como uma parte significativa das informações importantes da empresa existe em forma de texto, a organização de gestão de dados também precisa administrar isso
- Dados estruturados e dados textuais diferem fundamentalmente em estrutura e forma de gestão
Ontologia e taxonomia no ambiente textual
- Em ambientes textuais, é difícil aplicar diretamente o modelo tradicional de dados estruturados
- O papel exercido pelo modelo de dados nos dados estruturados é desempenhado, no ambiente textual, por ontologia/taxonomia (ontology/taxonomy)
- Os dois modelos cumprem funções correspondentes, mas sua estrutura e suas técnicas de gestão são bastante diferentes
- Aplicar diretamente ao texto técnicas de modelagem e gestão de dados estruturados não é adequado e quase não produz resultados práticos
Seleção e limpeza do texto de entrada do LLM
- No ambiente de IA generativa, a tarefa mais importante da gestão de dados é revisar o texto original antes que ele entre no LLM
- É preciso remover textos desnecessários para que conteúdo sem relação com o trabalho da empresa não chegue ao LLM
- Ao remover textos desnecessários, reduz-se a quantidade de dados que precisa ser processada a cada execução de consulta, o que reduz custos
- Mantendo apenas os textos relacionados ao trabalho, fica mais claro o escopo do que o LLM expressa e trata
ELDM e a ligação entre dados estruturados e não estruturados
- No ambiente de IA generativa, o gestor de dados deve conectar a ontologia/taxonomia ao ELDM (Enterprise Logical Data Model) de toda a empresa
- O ELDM é usado para integrar o modelo tradicional de dados estruturados e a ontologia/taxonomia do ambiente textual
- Quando as necessidades operacionais da empresa mudam, a ontologia/taxonomia também deve ser atualizada
Coleta de textos externos e manutenção contínua
- Primeiro, é preciso selecionar um amplo conjunto de textos originais de fontes como a internet
- Depois, segue-se um processo de triagem em duas etapas, refinando novamente, dentro dos textos selecionados, os dados relacionados ao trabalho da empresa
- Como o ambiente de negócios e a situação do mundo continuam mudando, a ontologia/taxonomia precisa ser monitorada e gerida continuamente
- É necessária manutenção iterativa para manter alinhadas as condições alteradas e a taxonomia
Controle indireto sobre o LLM
- O gestor de dados estruturados pode alterar diretamente o modelo de dados e o banco de dados, mas no ambiente de IA generativa não é possível controlar diretamente o próprio LLM da mesma forma
- O meio de controlar os resultados da IA generativa é gerenciar quais textos serão fornecidos ao LLM
- Portanto, a gestão de dados para IA generativa se aproxima mais de um controle indireto por meio da seleção e limpeza dos dados de entrada do que de modificações diretas
Mudanças no papel da gestão de dados dentro da organização
- No início, a gestão de dados era apenas uma entre várias tarefas executadas pelo desenvolvedor de sistemas, sem uma organização ou cargo corporativo separado
- À medida que o processamento de transações se tornou importante, o design de banco de dados foi separado como atividade independente e surgiu o papel do designer de banco de dados
- Com o aumento explosivo dos bancos de dados e dos elementos de dados a gerenciar, o papel do administrador de banco de dados se ampliou
- À medida que cresceu o problema de inconsistência de dados entre vários sistemas, surgiu o CIO (Chief Information Officer), responsável pela integração das informações em nível corporativo
- Com a necessidade de integrar dados estruturados e textuais para entender os dados da empresa como um todo, isso evoluiu para o papel de CDO (Chief Data Officer)
- Quanto mais diversas se tornam as formas de dados, mais aumentam ao mesmo tempo a complexidade e a importância da gestão, assim como as oportunidades de uso e os desafios
Da centralização física à centralização semântica
- Para compreender de forma consistente os dados e seus significados em toda a empresa, é necessário um sistema centralizado de entendimento dos dados
- Nos primórdios da computação, centralização significava centralização física, reunindo bancos de dados em grandes mainframes
- Depois, com a dispersão dos dados entre computadores pessoais, internet e sistemas corporativos, a centralização física se tornou impossível
- Quanto mais distribuídos os dados, maior a necessidade de coordenar, na internet e dentro da empresa, a compreensão de um mesmo objeto com o mesmo significado
- O foco da centralização saiu do local onde os dados são armazenados e passou para o significado e a definição dos dados
- O ELDM é usado como meio de manter centralmente o significado comum dos dados em nível corporativo, mesmo quando os dados existem em vários locais físicos
Ainda não há comentários.