Pular para o conteúdo

Tema

Glossário

31 termos da trilha de Engenharia de Dados, cada um com o tema onde ele é explicado por inteiro.

ABAC
Acesso decidido por atributos do usuário e do dado no momento da consulta.
Segurança e privacidade de dados em banco
ação
Operação que devolve um valor ao driver ou escreve num destino, e por isso dispara a execução: count, collect, show, write.
Spark: introdução
catálogo de dados
Inventário pesquisável de conjuntos de dados com dono, definição de negócio, classificação de sensibilidade, linhagem e forma de pedir acesso.
Governança de dados
Catalyst
Otimizador de consultas do Spark: analisa a expressão, aplica regras de otimização lógica, gera planos físicos candidatos e escolhe um.
Spark avançado: DataFrame, tuning e streaming
checkpoint
Registro persistente de quais arquivos já foram processados, para que a próxima execução continue de onde parou.
Databricks: a plataforma
coluna de dado resgatado
Coluna onde o leitor guarda os campos que não batem com o schema declarado, para que nada se perca e a mudança de origem fique registrada.
JSON
concorrência otimista
Cada escritor lê a versão atual, faz o trabalho e tenta registrar a próxima versão. Se outro chegou primeiro, ele relê o que mudou e tenta de novo.
Lakehouse e Delta Lake
dado pessoal sensível
Dado sobre origem racial ou étnica, convicção religiosa, opinião política, filiação sindical ou a organização religiosa, filosófica ou política, saúde, vida sexual, além de dado genético ou biométrico ligado a uma pessoa natural.
Classificação de tipos de dados
data skew
Distribuição desigual das chaves, em que uma ou poucas concentram volume desproporcional e caem todas na mesma partição.
Spark avançado: DataFrame, tuning e streaming
data skipping
pular arquivos com base nas estatísticas gravadas
Custo e performance
dependência narrow
Cada partição de saída depende de no máximo uma partição de entrada.
Spark: RDD, transformações e ações
dependência wide
Uma partição de saída depende de várias partições de entrada, porque a mesma chave precisa se reunir num lugar só.
Spark: RDD, transformações e ações
event time
O momento em que o fato aconteceu: a hora da compra registrada pela maquininha.
Processamento batch e stream
grão
A frase que define o que uma linha da tabela fato representa. "Uma linha por autorização de cartão" é um grão; "dados de cartão" não é.
Modelagem de dados
idempotência
Rodar a mesma task sobre a mesma janela uma ou várias vezes deixa o destino no mesmo estado final.
Orquestração de pipelines
linhagem
Registro de origem e destino de cada tabela e coluna ao longo do pipeline.
DataOps e observabilidade
log de transações
Registro ordenado das operações sobre a tabela — quais arquivos entram e quais saem — que define o estado da tabela em cada versão.
Formatos de arquivo e formatos de tabela
partition pruning
Descarte de partições inteiras antes de abrir qualquer arquivo, com base no filtro da consulta.
Particionamento de dados
processing time
O momento em que o motor viu o evento.
Processamento batch e stream
RBAC
Acesso concedido pelo papel do usuário.
Segurança e privacidade de dados em banco
shuffle
Redistribuição de dados entre executores, necessária quando a mesma chave precisa terminar no mesmo lugar.
Spark: introdução
SLO de dados
Meta interna e mensurável sobre um dado: por exemplo, a tabela de transações fica pronta até 6h em 99% dos dias úteis.
Qualidade de dados
Source of Record
O sistema onde o dado nasce e que é autoritativo sobre o fato original.
Arquiteturas de dados
Source of Truth
A visão consolidada, tratada e governada que a organização usa para decidir.
Arquiteturas de dados
tabela dimensão
tabela que descreve o contexto do evento e fornece filtros e agrupamentos
OLAP, OLTP e ETL
tabela fato
tabela que guarda os eventos mensuráveis do negócio, com métricas e chaves para as dimensões
OLAP, OLTP e ETL
tokenização
Substituição do valor sensível por um substituto sem significado, reversível apenas por quem tem acesso ao cofre de tokens.
As zonas de um Data Lake
transformação
Operação que devolve outro conjunto distribuído e apenas acrescenta um nó ao plano: filter, select, join, groupBy.
Spark: introdução
watermark
marca do ponto até onde você já leu — um timestamp ou um identificador crescente
Ingestão e CDC
window function
Função que calcula um valor por linha olhando um conjunto de linhas relacionadas (a janela), sem colapsar o resultado como o GROUP BY faz.
SQL para engenharia de dados
XSD
XML Schema Definition: o arquivo que declara a estrutura esperada do documento, com tipos e obrigatoriedade, permitindo rejeitar o que não obedece.
XML