Glossário
31 termos da trilha de Engenharia de Dados, cada um com o tema onde ele é explicado por inteiro.
- ABAC
- Acesso decidido por atributos do usuário e do dado no momento da consulta.
- Segurança e privacidade de dados em banco
- ação
- Operação que devolve um valor ao driver ou escreve num destino, e por isso dispara a execução: count, collect, show, write.
- Spark: introdução
- catálogo de dados
- Inventário pesquisável de conjuntos de dados com dono, definição de negócio, classificação de sensibilidade, linhagem e forma de pedir acesso.
- Governança de dados
- Catalyst
- Otimizador de consultas do Spark: analisa a expressão, aplica regras de otimização lógica, gera planos físicos candidatos e escolhe um.
- Spark avançado: DataFrame, tuning e streaming
- checkpoint
- Registro persistente de quais arquivos já foram processados, para que a próxima execução continue de onde parou.
- Databricks: a plataforma
- coluna de dado resgatado
- Coluna onde o leitor guarda os campos que não batem com o schema declarado, para que nada se perca e a mudança de origem fique registrada.
- JSON
- concorrência otimista
- Cada escritor lê a versão atual, faz o trabalho e tenta registrar a próxima versão. Se outro chegou primeiro, ele relê o que mudou e tenta de novo.
- Lakehouse e Delta Lake
- dado pessoal sensível
- Dado sobre origem racial ou étnica, convicção religiosa, opinião política, filiação sindical ou a organização religiosa, filosófica ou política, saúde, vida sexual, além de dado genético ou biométrico ligado a uma pessoa natural.
- Classificação de tipos de dados
- data skew
- Distribuição desigual das chaves, em que uma ou poucas concentram volume desproporcional e caem todas na mesma partição.
- Spark avançado: DataFrame, tuning e streaming
- dependência narrow
- Cada partição de saída depende de no máximo uma partição de entrada.
- Spark: RDD, transformações e ações
- dependência wide
- Uma partição de saída depende de várias partições de entrada, porque a mesma chave precisa se reunir num lugar só.
- Spark: RDD, transformações e ações
- event time
- O momento em que o fato aconteceu: a hora da compra registrada pela maquininha.
- Processamento batch e stream
- grão
- A frase que define o que uma linha da tabela fato representa. "Uma linha por autorização de cartão" é um grão; "dados de cartão" não é.
- Modelagem de dados
- idempotência
- Rodar a mesma task sobre a mesma janela uma ou várias vezes deixa o destino no mesmo estado final.
- Orquestração de pipelines
- linhagem
- Registro de origem e destino de cada tabela e coluna ao longo do pipeline.
- DataOps e observabilidade
- log de transações
- Registro ordenado das operações sobre a tabela — quais arquivos entram e quais saem — que define o estado da tabela em cada versão.
- Formatos de arquivo e formatos de tabela
- partition pruning
- Descarte de partições inteiras antes de abrir qualquer arquivo, com base no filtro da consulta.
- Particionamento de dados
- shuffle
- Redistribuição de dados entre executores, necessária quando a mesma chave precisa terminar no mesmo lugar.
- Spark: introdução
- SLO de dados
- Meta interna e mensurável sobre um dado: por exemplo, a tabela de transações fica pronta até 6h em 99% dos dias úteis.
- Qualidade de dados
- Source of Record
- O sistema onde o dado nasce e que é autoritativo sobre o fato original.
- Arquiteturas de dados
- Source of Truth
- A visão consolidada, tratada e governada que a organização usa para decidir.
- Arquiteturas de dados
- tabela dimensão
- tabela que descreve o contexto do evento e fornece filtros e agrupamentos
- OLAP, OLTP e ETL
- tabela fato
- tabela que guarda os eventos mensuráveis do negócio, com métricas e chaves para as dimensões
- OLAP, OLTP e ETL
- tokenização
- Substituição do valor sensível por um substituto sem significado, reversível apenas por quem tem acesso ao cofre de tokens.
- As zonas de um Data Lake
- transformação
- Operação que devolve outro conjunto distribuído e apenas acrescenta um nó ao plano: filter, select, join, groupBy.
- Spark: introdução
- watermark
- marca do ponto até onde você já leu — um timestamp ou um identificador crescente
- Ingestão e CDC
- window function
- Função que calcula um valor por linha olhando um conjunto de linhas relacionadas (a janela), sem colapsar o resultado como o GROUP BY faz.
- SQL para engenharia de dados
- XSD
- XML Schema Definition: o arquivo que declara a estrutura esperada do documento, com tipos e obrigatoriedade, permitindo rejeitar o que não obedece.
- XML