Arquiteturas de alto desempenho · tema 19 de 23
Ingestão e análise de dados: Kinesis, Glue, EMR e Lake Formation
35 min · 2 vídeos · 14 cards · 1 drill
Por que cai
O guia da SAA-C03 tem uma tarefa só para isto (3.5, ingestão e transformação de alto desempenho) e quem vem de infraestrutura costuma chutar. As questões seguem um roteiro fixo: a frequência do dado escolhe entre fluxo e lote, a palavra 'consumidor próprio' separa Data Streams de Firehose, 'converter CSV em Parquet' aponta Glue, e 'Spark ou Hadoop' aponta EMR.
Pré-teste · 1 de 2
responda antes de verUma aplicação gera eventos de clique continuamente. A empresa quer que eles cheguem ao S3 em até um minuto, em Parquet, sem escrever nem manter código de consumo. Qual serviço atende com menor esforço operacional?
Vídeo · português · 5 min
Em uma frase
A questão descreve como o dado chega (a cada segundo, a cada hora, uma vez só) e o que precisa acontecer com ele (entregar, transformar, governar, consultar). Cada trecho aponta um serviço, e o conjunto vira a alternativa certa.
O roteiro em quatro decisões
- 1Frequência: eventos contínuos são fluxo (Kinesis); arquivos periódicos são lote (S3, Glue, DataSync).
- 2Entrada: quem precisa ler o fluxo? Ninguém em especial, só entregar: Firehose. Consumidores próprios, vários leitores ou reler: Data Streams.
- 3Transformação: sem servidor e sob demanda: Glue. Spark, Hadoop, Hive ou controle do cluster no enunciado: EMR.
- 4Consumo: SQL sobre o S3: Athena. Painel: QuickSight. Permissão por tabela e coluna: Lake Formation.
Fluxo: Data Streams ou Firehose
Os dois se chamam Kinesis e a prova conta com a confusão.
| Kinesis Data Streams | Kinesis Data Firehose | |
|---|---|---|
| Quem lê | Consumidores que você escreve (Lambda, KCL, EMR) | Ninguém: o serviço entrega no destino |
| Latência | Tempo real, registro a registro | Quase tempo real: lotes de segundos a minutos |
| Retenção | 24 horas a 365 dias; dá para reler | Nenhuma: entrega e esquece |
| Escala | Shards (provisionado) ou sob demanda | Automática |
| Transformação | No consumidor | Lambda no caminho e conversão para Parquet ou ORC |
| Pista no enunciado | 'Vários consumidores', 'reprocessar', 'tempo real' | 'Entregar no S3 ou Redshift', 'menor esforço' |
O padrão que mais aparece é Data Streams na entrada e Firehose na saída: os eventos entram no fluxo, uma aplicação lê em tempo real e o Firehose lê o mesmo fluxo para gravar a cópia histórica no S3. Quando o enunciado só pede a cópia histórica, Firehose sozinho basta.
Transformação: Glue ou EMR
Glue é o serviço de integração sem servidor: o crawler descobre o schema dos arquivos, o Data Catalog guarda as tabelas, e o job roda Spark sob demanda. A tarefa clássica é converter CSV ou JSON em Parquet particionado, que é o que faz consulta no Athena ficar rápida e barata.
EMR é o cluster gerenciado de Hadoop, Spark, Hive e afins. Ele ganha quando o enunciado nomeia o framework, cita bibliotecas próprias ou pede controle do cluster. Se nada disso aparece e o pedido é "menor esforço operacional", a resposta é Glue.
Lote e migração: DataSync e Storage Gateway
Arquivo que nasce fora da AWS chega por DataSync: transferência gerenciada, agendável e verificada entre local (ou outra nuvem) e S3, EFS ou FSx. Sem banda para o volume, entra Snow. Quando a aplicação local precisa continuar enxergando os arquivos como se fossem dela, com o dado morando na AWS, o serviço é Storage Gateway, que é acesso, não transferência.
Governar e consultar
Um data lake na prova é sempre a mesma pilha: S3 guardando em zonas, Glue Data Catalog com as tabelas, Lake Formation dando permissão por banco, tabela e coluna, Athena consultando em SQL e QuickSight mostrando o painel. Política de bucket protege objeto; coluna é Lake Formation.
Como responder o cenário
Leia a frequência primeiro: ela elimina metade das alternativas. Depois procure quem lê o dado: se a resposta é "ninguém, só guardar", é Firehose ou Glue. Por fim confira os adjetivos do pedido: "menor esforço" favorece o serviço sem servidor; "controle" ou o nome de um framework favorece EMR e Data Streams.
Se quiser outro ângulo1 vídeo
Como cai na sabatina
“Sensores enviam eventos a cada segundo; a empresa quer guardá-los no S3 em Parquet com o MENOR esforço operacional. O que usar?”
Erros comuns
- Propor Kinesis Data Streams quando o enunciado só quer entregar o fluxo no S3 ou no Redshift. Data Streams exige escrever e operar consumidores; se ninguém precisa processar registro a registro, Firehose entrega sozinho e é a resposta de menor esforço.
- Propor Firehose quando o enunciado pede vários consumidores lendo o mesmo fluxo em paralelo, ou reprocessar registros das últimas horas. Firehose entrega e esquece; retenção e leitura por aplicação própria são Data Streams.
- Escolher EMR para converter arquivos de formato. Glue é sem servidor e faz isso com um job; EMR só ganha quando o enunciado cita Spark, Hadoop, Hive ou controle do cluster.
- Usar SQS para ingestão de telemetria. Fila entrega cada mensagem a um consumidor e apaga; fluxo mantém a ordem por chave e permite vários leitores. 'Eventos por segundo, em ordem, para análise' é Kinesis.
- Resolver permissão por coluna com política de bucket. Política de bucket enxerga objeto, não coluna; permissão por tabela e coluna sobre o data lake é Lake Formation.
- Transferir terabytes de um servidor local com um script de cópia para o S3. Transferência recorrente e gerenciada entre local e AWS é DataSync; acesso contínuo de aplicação local a arquivos no S3 é Storage Gateway.
Flashcards
Card 1 de 14
0 certos · 0 a reverDrill
Qual serviço a frase do enunciado pede?
Para cada pedido, diga o serviço que a prova espera.
1.Entregar o fluxo de logs no S3 em Parquet, sem escrever consumidor.
2.Três aplicações diferentes precisam ler o mesmo fluxo de eventos em paralelo e reprocessar as últimas horas.
3.Converter todo dia os CSV que chegam ao S3 para Parquet e catalogar as tabelas.
4.Rodar um pipeline em Spark já existente, com bibliotecas próprias, sobre petabytes.
5.Analistas de um departamento só podem ver algumas colunas das tabelas do data lake.
6.Copiar 200 TB de um NAS local para o S3, toda semana, com verificação.
Quiz · 1 de 5
Uma empresa de logística recebe a posição de milhares de veículos várias vezes por segundo. Um painel precisa mostrar a posição atual quase em tempo real e, ao mesmo tempo, uma aplicação antifraude precisa analisar cada evento com regras próprias. As duas leituras devem ser independentes. Qual solução atende?
Explique para um gerente
Explique em um minuto a diferença entre Kinesis Data Streams e Kinesis Data Firehose usando a imagem de uma esteira de fábrica: quem tira as peças da esteira em cada caso?
Se travar numa palavra técnica, é sinal de que ainda não entendeu essa parte.
Prefiro falar em voz alta
00:00
Toque para gravar, ou responda em voz alta sem gravar