Fundamentos · tema 1 de 30
O que é Big Data
25 min · 2 vídeos · 10 cards · 1 drill
Por que cai
É a primeira pergunta de quase toda sabatina e serve de termômetro. Quem responde só 'muitos dados' entrega que decorou; quem separa o problema da ferramenta mostra que entende por que a arquitetura mudou.
Pré-teste · 1 de 2
responda antes de verUma tabela de 800 GB de transações consultada uma vez por mês para fechar o balanço. É um caso de Big Data?
Vídeo · português · 22 min
Em uma frase
Big Data é a situação em que volume, velocidade e variedade de dados, juntos, quebram a abordagem de resolver tudo em um banco relacional só.
O termo descreve um problema, não um produto
Essa é a distinção que separa quem decorou de quem entendeu. Ninguém "compra Big Data". O que existe é um perfil de carga que a arquitetura tradicional não atende, e um conjunto de respostas que mudou ao longo do tempo: primeiro Hadoop com HDFS e MapReduce, depois armazenamento de objetos com Spark, hoje formatos de tabela como Delta e Iceberg por cima.
Se a sua definição de Big Data cita uma ferramenta, ela envelhece junto com a ferramenta. Se cita o perfil do problema, ela continua válida.
Os três Vs originais
| V | O que mede | Exemplo no banco |
|---|---|---|
| Volume | Quantidade de dados em repouso e por janela de processamento | Seis anos de extratos que precisam ser recalculados quando uma regra muda |
| Velocidade | Taxa de chegada e prazo para o dado ainda ser útil | Autorização de cartão: decisão de fraude em milissegundos |
| Variedade | Formatos e origens diferentes no mesmo caso de uso | Cadastro relacional, clique no app, áudio de call center e PDF |
Repare que os três aparecem juntos nos casos difíceis. Volume sozinho é um arquivo grande. Velocidade sozinha é uma fila. Variedade sozinha é um problema de parsing. O que estoura a arquitetura é a combinação.
Os dois Vs que vieram depois
Veracidade é a confiabilidade do dado: de onde veio, se está duplicado, se tem valores faltando, se a medição está certa. Sem veracidade, mais dado só produz decisão errada mais rápido. É o V que conversa direto com o módulo de qualidade de dados.
Valor cobra retorno. Guardar custa dinheiro todo mês, e dado que nunca vira decisão é passivo, não ativo. Em banco isso também tem lado regulatório: guardar dado pessoal sem finalidade é risco de LGPD, não é precaução.
Por que a arquitetura mudou
Durante décadas a saída para "os dados cresceram" foi escalar verticalmente: comprar uma máquina maior. Isso esbarra em dois tetos. O físico, porque existe um limite de CPU, memória e disco por máquina. E o econômico, porque o preço do servidor grande cresce mais rápido que a capacidade dele.
Escalar horizontalmente troca uma máquina cara por muitas comuns, e traz junto os problemas que definem a engenharia de dados moderna: como dividir o dado entre máquinas (particionamento), como sobreviver à falha de uma delas (replicação) e como coordenar o processamento (MapReduce ontem, Spark hoje).
Como responder isso em voz alta
Uma estrutura que funciona: comece pela definição em uma frase, cite os três Vs com um exemplo cada, explique por que a escala vertical parou de resolver, acrescente veracidade e valor ligando ao negócio, e feche com um caso bancário concreto. Leva cerca de noventa segundos e cobre tudo que a rubrica procura.
Se quiser outro ângulo
Como cai na sabatina
“Todo problema com muitos dados é um problema de Big Data?”
Erros comuns
- Tratar Big Data como sinônimo de Hadoop ou Spark. Os Vs descrevem o problema; a ferramenta é a resposta, e ela muda com a década.
- Achar que volume sozinho define Big Data. Um terabyte parado num arquivo é só um arquivo grande; o que quebra é volume com velocidade e variedade juntos.
- Esquecer veracidade e valor. São os dois Vs que ligam a discussão técnica ao negócio, e é neles que a banca separa quem já trabalhou com dado sujo.
- Usar arquitetura distribuída onde um Postgres bem indexado resolveria. Custo e complexidade sobem, e a banca pergunta justamente isso.
Flashcards
Card 1 de 10
0 certos · 0 a reverDrill
É Big Data ou é engenharia tradicional?
Para cada cenário, decida se o perfil de carga exige arquitetura distribuída ou se um banco relacional bem cuidado resolve. Responda antes de abrir a resposta.
1.Relatório regulatório mensal sobre 900 GB de transações estruturadas.
2.Score de fraude em cada autorização de cartão, com resposta em até 200 ms, sobre 40 mil eventos por segundo no pico.
3.Visão única do cliente juntando cadastro, cliques no app, áudio de call center e documentos digitalizados.
4.Cadastro de 12 milhões de clientes consultado por CPF pelo aplicativo.
5.Reprocessar 6 anos de extratos para recalcular um indicador depois de mudar a regra.
Quiz · 1 de 2
Qual afirmação descreve melhor a relação entre Big Data e Hadoop?
Explique para um gerente
Explique para um gerente por que o banco não resolve o relatório de fraude só comprando um servidor maior.
Responda em voz alta antes de seguir. Se travar numa palavra técnica, é sinal de que ainda não entendeu essa parte.
Perguntas de sabatina deste tema
- · O que é Big Data e por que o termo existe, se bancos já lidavam com muitos dados há décadas?
- · Um time quer montar um cluster Spark para processar 200 GB de dados estruturados que hoje rodam num Postgres em 15 minutos. O que você diria?
Para ir além