Pular para o conteúdo

Fundamentos · tema 1 de 30

O que é Big Data

25 min · 2 vídeos · 10 cards · 1 drill

Por que cai

É a primeira pergunta de quase toda sabatina e serve de termômetro. Quem responde só 'muitos dados' entrega que decorou; quem separa o problema da ferramenta mostra que entende por que a arquitetura mudou.

Pré-teste · 1 de 2

responda antes de ver

Uma tabela de 800 GB de transações consultada uma vez por mês para fechar o balanço. É um caso de Big Data?

Confiança:

Vídeo · português · 22 min

Ataca justamente a confusão entre volume e Big Data, que é o erro que a banca procura. Assista pensando em como você defenderia a diferença em voz alta.

Em uma frase

Big Data é a situação em que volume, velocidade e variedade de dados, juntos, quebram a abordagem de resolver tudo em um banco relacional só.

O termo descreve um problema, não um produto

Essa é a distinção que separa quem decorou de quem entendeu. Ninguém "compra Big Data". O que existe é um perfil de carga que a arquitetura tradicional não atende, e um conjunto de respostas que mudou ao longo do tempo: primeiro Hadoop com HDFS e MapReduce, depois armazenamento de objetos com Spark, hoje formatos de tabela como Delta e Iceberg por cima.

Se a sua definição de Big Data cita uma ferramenta, ela envelhece junto com a ferramenta. Se cita o perfil do problema, ela continua válida.

Os três Vs originais

VO que medeExemplo no banco
VolumeQuantidade de dados em repouso e por janela de processamentoSeis anos de extratos que precisam ser recalculados quando uma regra muda
VelocidadeTaxa de chegada e prazo para o dado ainda ser útilAutorização de cartão: decisão de fraude em milissegundos
VariedadeFormatos e origens diferentes no mesmo caso de usoCadastro relacional, clique no app, áudio de call center e PDF

Repare que os três aparecem juntos nos casos difíceis. Volume sozinho é um arquivo grande. Velocidade sozinha é uma fila. Variedade sozinha é um problema de parsing. O que estoura a arquitetura é a combinação.

Os dois Vs que vieram depois

Veracidade é a confiabilidade do dado: de onde veio, se está duplicado, se tem valores faltando, se a medição está certa. Sem veracidade, mais dado só produz decisão errada mais rápido. É o V que conversa direto com o módulo de qualidade de dados.

Valor cobra retorno. Guardar custa dinheiro todo mês, e dado que nunca vira decisão é passivo, não ativo. Em banco isso também tem lado regulatório: guardar dado pessoal sem finalidade é risco de LGPD, não é precaução.

Por que a arquitetura mudou

Durante décadas a saída para "os dados cresceram" foi escalar verticalmente: comprar uma máquina maior. Isso esbarra em dois tetos. O físico, porque existe um limite de CPU, memória e disco por máquina. E o econômico, porque o preço do servidor grande cresce mais rápido que a capacidade dele.

Escalar horizontalmente troca uma máquina cara por muitas comuns, e traz junto os problemas que definem a engenharia de dados moderna: como dividir o dado entre máquinas (particionamento), como sobreviver à falha de uma delas (replicação) e como coordenar o processamento (MapReduce ontem, Spark hoje).

Como responder isso em voz alta

Uma estrutura que funciona: comece pela definição em uma frase, cite os três Vs com um exemplo cada, explique por que a escala vertical parou de resolver, acrescente veracidade e valor ligando ao negócio, e feche com um caso bancário concreto. Leva cerca de noventa segundos e cobre tudo que a rubrica procura.

Se quiser outro ângulo

Versão curta, boa para revisar na véspera ou se o primeiro vídeo já cobriu o que você precisava.

Como cai na sabatina

Todo problema com muitos dados é um problema de Big Data?

Erros comuns

  • Tratar Big Data como sinônimo de Hadoop ou Spark. Os Vs descrevem o problema; a ferramenta é a resposta, e ela muda com a década.
  • Achar que volume sozinho define Big Data. Um terabyte parado num arquivo é só um arquivo grande; o que quebra é volume com velocidade e variedade juntos.
  • Esquecer veracidade e valor. São os dois Vs que ligam a discussão técnica ao negócio, e é neles que a banca separa quem já trabalhou com dado sujo.
  • Usar arquitetura distribuída onde um Postgres bem indexado resolveria. Custo e complexidade sobem, e a banca pergunta justamente isso.

Flashcards

Card 1 de 10

0 certos · 0 a rever

Drill

É Big Data ou é engenharia tradicional?

Para cada cenário, decida se o perfil de carga exige arquitetura distribuída ou se um banco relacional bem cuidado resolve. Responda antes de abrir a resposta.

  1. 1.Relatório regulatório mensal sobre 900 GB de transações estruturadas.

  2. 2.Score de fraude em cada autorização de cartão, com resposta em até 200 ms, sobre 40 mil eventos por segundo no pico.

  3. 3.Visão única do cliente juntando cadastro, cliques no app, áudio de call center e documentos digitalizados.

  4. 4.Cadastro de 12 milhões de clientes consultado por CPF pelo aplicativo.

  5. 5.Reprocessar 6 anos de extratos para recalcular um indicador depois de mudar a regra.

Quiz · 1 de 2

Qual afirmação descreve melhor a relação entre Big Data e Hadoop?

Explique para um gerente

Explique para um gerente por que o banco não resolve o relatório de fraude só comprando um servidor maior.

Responda em voz alta antes de seguir. Se travar numa palavra técnica, é sinal de que ainda não entendeu essa parte.

Perguntas de sabatina deste tema

  • · O que é Big Data e por que o termo existe, se bancos já lidavam com muitos dados há décadas?
  • · Um time quer montar um cluster Spark para processar 200 GB de dados estruturados que hoje rodam num Postgres em 15 minutos. O que você diria?
Responder no simulado

Para ir além