4 pontos por GN⁺ 4 시간 전 | Ainda não há comentários. | Compartilhar no WhatsApp
  • Se a IA generativa não operar com dados confiáveis, também fica difícil confiar nos resultados analíticos, elevando a gestão de dados de uma função de suporte técnico a uma função estratégica central
  • No início, os desenvolvedores de aplicações também cuidavam da estrutura dos dados, mas depois os papéis se dividiram entre designers/administradores de banco de dados, CIO e CDO, e a integridade dos dados e um entendimento consistente em toda a empresa se tornaram desafios centrais
  • Em dados estruturados, o modelo de dados e o banco de dados são modificados diretamente, mas no ambiente de IA generativa o controle é indireto, por meio da seleção e limpeza do texto que entra no LLM
  • Para texto não estruturado, em vez do modelo de dados tradicional, é necessário usar ontologia/taxonomia, combinando isso com o ELDM (modelo lógico de dados corporativo) e atualizando-o continuamente
  • À medida que os dados se distribuem entre vários sistemas, PCs e a internet, a centralização física se torna impossível, e a centralização semântica por meio do ELDM passa a ser mais importante

A gestão de dados que começou no trabalho de desenvolvimento de aplicações

  • Nos primeiros sistemas computacionais, o desenvolvedor de aplicações definia, além da coleta de requisitos, aderência à metodologia, programação e testes, também os dados que o sistema usaria e sua estrutura
  • O design de dados não era uma função corporativa independente, mas uma das várias tarefas incluídas no processo de desenvolvimento

Processamento de transações e o surgimento de funções especializadas em banco de dados

  • Com a disseminação dos sistemas de processamento de transações, foi necessário refletir no design do banco de dados o tempo de resposta, a disponibilidade do sistema e a integridade da execução das transações
  • Com o surgimento do designer de banco de dados, especializado em lidar com essas exigências, a gestão de dados começou a ser reconhecida como uma atividade independente
  • Com o rápido aumento dos bancos de dados transacionais, surgiu a necessidade do administrador de banco de dados para controlar e coordenar vários bancos ao mesmo tempo

Problemas de integridade de dados e o data warehouse

  • Como o mesmo elemento de dado passou a ser armazenado repetidamente em inúmeras aplicações interligadas, surgiu o problema de haver valores diferentes em cada local
  • O problema das empresas deixou de ser possuir os dados e passou a ser decidir em quais dados confiar
  • Apenas adicionar aplicações e tecnologias não resolveu o problema de integridade; ao contrário, ampliou e acelerou o problema
  • Em vez de uma correção técnica, passou a ser necessária uma solução arquitetural que separasse dados operacionais e dados analíticos, e daí surgiu o data warehouse

Modelos de dados e o ambiente de dados estruturados

  • Para transformar dados operacionais em dados analíticos e em um data warehouse, é necessário um modelo de dados que abstraia os tipos de dados existentes hoje ou necessários no futuro
  • Sistemas operacionais e data warehouses são compostos por um ambiente de dados estruturados em que o formato de cada registro é o mesmo e apenas o conteúdo muda
  • Os dados estruturados de aplicações, bancos de dados e bancos de dados transacionais são gerenciados por um sistema de gerenciamento de banco de dados (DBMS)
  • Como falhas em sistemas transacionais afetam diretamente operações reais e clientes, como em caixas eletrônicos e sistemas de reserva aérea, o valor de sistemas precisos e estáveis e da gestão de dados aumentou

O trabalho do gestor de dados estruturados

  • Depois de construir o modelo de dados, ele é mantido e ajustado continuamente de acordo com mudanças na economia, concorrência, tecnologia, legislação e mercado
  • No design de banco de dados, seguem-se os princípios de normalização, mas aplica-se o nível necessário de desnormalização para o desempenho do processamento de transações
    • O gestor de dados equilibra os objetivos do sistema e os requisitos de desempenho entre normalização e desnormalização
  • Escreve-se o DDL que define o banco de dados com base no modelo de dados
  • Realiza-se planejamento de capacidade para prever quando o equipamento de processamento transacional chegará ao limite
  • Monitora-se continuamente a atividade do banco de dados e o crescimento dos dados
  • Quando um problema é encontrado, usa-se controle direto, acessando e corrigindo diretamente o modelo de dados ou o banco de dados correspondente

A expansão dos dados não estruturados/textuais

  • Nas empresas, além dos dados estruturados, existe uma ampla quantidade de dados não estruturados/textuais, e há estimativas de que até 90% dos dados corporativos sejam texto
  • Como uma parte significativa das informações importantes da empresa existe em forma de texto, a organização de gestão de dados também precisa administrar isso
  • Dados estruturados e dados textuais diferem fundamentalmente em estrutura e forma de gestão

Ontologia e taxonomia no ambiente textual

  • Em ambientes textuais, é difícil aplicar diretamente o modelo tradicional de dados estruturados
  • O papel exercido pelo modelo de dados nos dados estruturados é desempenhado, no ambiente textual, por ontologia/taxonomia (ontology/taxonomy)
  • Os dois modelos cumprem funções correspondentes, mas sua estrutura e suas técnicas de gestão são bastante diferentes
  • Aplicar diretamente ao texto técnicas de modelagem e gestão de dados estruturados não é adequado e quase não produz resultados práticos

Seleção e limpeza do texto de entrada do LLM

  • No ambiente de IA generativa, a tarefa mais importante da gestão de dados é revisar o texto original antes que ele entre no LLM
  • É preciso remover textos desnecessários para que conteúdo sem relação com o trabalho da empresa não chegue ao LLM
  • Ao remover textos desnecessários, reduz-se a quantidade de dados que precisa ser processada a cada execução de consulta, o que reduz custos
  • Mantendo apenas os textos relacionados ao trabalho, fica mais claro o escopo do que o LLM expressa e trata

ELDM e a ligação entre dados estruturados e não estruturados

  • No ambiente de IA generativa, o gestor de dados deve conectar a ontologia/taxonomia ao ELDM (Enterprise Logical Data Model) de toda a empresa
  • O ELDM é usado para integrar o modelo tradicional de dados estruturados e a ontologia/taxonomia do ambiente textual
  • Quando as necessidades operacionais da empresa mudam, a ontologia/taxonomia também deve ser atualizada

Coleta de textos externos e manutenção contínua

  • Primeiro, é preciso selecionar um amplo conjunto de textos originais de fontes como a internet
  • Depois, segue-se um processo de triagem em duas etapas, refinando novamente, dentro dos textos selecionados, os dados relacionados ao trabalho da empresa
  • Como o ambiente de negócios e a situação do mundo continuam mudando, a ontologia/taxonomia precisa ser monitorada e gerida continuamente
  • É necessária manutenção iterativa para manter alinhadas as condições alteradas e a taxonomia

Controle indireto sobre o LLM

  • O gestor de dados estruturados pode alterar diretamente o modelo de dados e o banco de dados, mas no ambiente de IA generativa não é possível controlar diretamente o próprio LLM da mesma forma
  • O meio de controlar os resultados da IA generativa é gerenciar quais textos serão fornecidos ao LLM
  • Portanto, a gestão de dados para IA generativa se aproxima mais de um controle indireto por meio da seleção e limpeza dos dados de entrada do que de modificações diretas

Mudanças no papel da gestão de dados dentro da organização

  • No início, a gestão de dados era apenas uma entre várias tarefas executadas pelo desenvolvedor de sistemas, sem uma organização ou cargo corporativo separado
  • À medida que o processamento de transações se tornou importante, o design de banco de dados foi separado como atividade independente e surgiu o papel do designer de banco de dados
  • Com o aumento explosivo dos bancos de dados e dos elementos de dados a gerenciar, o papel do administrador de banco de dados se ampliou
  • À medida que cresceu o problema de inconsistência de dados entre vários sistemas, surgiu o CIO (Chief Information Officer), responsável pela integração das informações em nível corporativo
  • Com a necessidade de integrar dados estruturados e textuais para entender os dados da empresa como um todo, isso evoluiu para o papel de CDO (Chief Data Officer)
  • Quanto mais diversas se tornam as formas de dados, mais aumentam ao mesmo tempo a complexidade e a importância da gestão, assim como as oportunidades de uso e os desafios

Da centralização física à centralização semântica

  • Para compreender de forma consistente os dados e seus significados em toda a empresa, é necessário um sistema centralizado de entendimento dos dados
  • Nos primórdios da computação, centralização significava centralização física, reunindo bancos de dados em grandes mainframes
  • Depois, com a dispersão dos dados entre computadores pessoais, internet e sistemas corporativos, a centralização física se tornou impossível
  • Quanto mais distribuídos os dados, maior a necessidade de coordenar, na internet e dentro da empresa, a compreensão de um mesmo objeto com o mesmo significado
  • O foco da centralização saiu do local onde os dados são armazenados e passou para o significado e a definição dos dados
  • O ELDM é usado como meio de manter centralmente o significado comum dos dados em nível corporativo, mesmo quando os dados existem em vários locais físicos

Ainda não há comentários.

Ainda não há comentários.