Além da ementa · tema 26 de 30
AWS para engenharia de dados
35 min · 2 vídeos · 14 cards · 2 drill
Por que cai
A stack do time é AWS mais Databricks, então a banca vai testar se você sabe onde cada serviço encaixa e quanto ele custa. A pergunta de custo do Athena é quase certa, porque separa quem já pagou a conta de quem só leu a documentação.
Pré-teste · 1 de 2
responda antes de verUma consulta no Athena varreu 2 TB para retornar um resumo de um único dia. Qual é a hipótese mais provável?
Vídeo · português · 10 min
Em uma frase
Na AWS, um pipeline de dados é S3 como camada de persistência, Glue como catálogo e motor de transformação, um motor de consulta escolhido pelo padrão de uso, e IAM amarrando quem pode o quê.
S3: a base de tudo
O S3 guarda objetos, não tabelas. Isso é a força — armazenamento barato e desacoplado do processamento — e a fonte dos problemas.
- Classes de armazenamento: Standard para dado quente, Intelligent-Tiering quando o padrão de acesso é imprevisível, Standard-IA e One Zone-IA para acesso raro, e as famílias Glacier para arquivamento, com custo e latência de recuperação crescentes.
- Lifecycle: regra que move ou expira objeto por idade. Extrato bruto sai do Standard em 90 dias, vai para Glacier em um ano e expira no fim do prazo legal de retenção — que em banco é definido por norma, não por preferência [verificar prazo aplicável ao seu caso].
- Organização por prefixo:
zona/dominio/tabela/data_ref=2026-03-11/. O formatocoluna=valoré o que permite ao motor fazer poda de partição. - Consistência: o S3 oferece leitura consistente após escrita para operações de objeto. O que não se atualiza sozinho é o catálogo: partição nova no S3 continua invisível para o Athena até ser registrada.
Glue: catálogo, crawler e jobs
O Data Catalog é o metastore: schema, formato, localização no S3 e lista de partições. Athena, Spark e Redshift Spectrum leem a mesma definição a partir dele.
O crawler inspeciona um caminho no S3, infere schema e registra ou atualiza a tabela. Útil na chegada de dado de terceiro; perigoso como fonte única de verdade de schema, porque inferência erra tipo.
Os jobs são Spark gerenciado, para ETL sem manter cluster.
Athena: SQL sobre o S3
Serverless: você não dimensiona nada, e a cobrança padrão é por volume de dados varridos [verificar preço por TB na região usada].
Reduzir a conta é reduzir bytes lidos:
- 1Particionar pela coluna que você filtra, e registrar a partição no catálogo
- 2Gravar em formato colunar (Parquet) com compressão
- 3Projetar colunas: SELECT explícito em vez de SELECT estrela
- 4Compactar arquivos pequenos para reduzir sobrecarga
EMR: quando ainda usar
Quando você precisa de controle: versão específica de Spark, ecossistema Hadoop, bibliotecas nativas, ajuste fino de tipos de instância, uso agressivo de spot, carga longa em que o custo por hora compensa. Se nada disso é requisito, Glue ou Databricks entregam o mesmo Spark com menos operação.
Redshift
Warehouse colunar e distribuído, para consulta recorrente e concorrente sobre dado modelado. Spectrum deixa o Redshift consultar dados que continuam no S3, permitindo juntar tabela do warehouse com histórico no lake.
Distribution key define como as linhas se distribuem entre os nós, e a escolha certa evita redistribuir dados no JOIN. Sort key define a ordem física dos blocos, e a escolha certa permite pular blocos inteiros no filtro.
Athena, Redshift e EMR: quando cada um
| Athena | Redshift | EMR | |
|---|---|---|---|
| Modelo | Serverless, sob demanda | Cluster provisionado (ou serverless) | Cluster que você configura |
| Cobrança típica | Por dados varridos | Por capacidade ligada | Por hora de instância |
| Melhor para | SQL ad hoc e esporádico sobre o lake | Painel e consulta recorrente com concorrência alta | Processamento pesado e customizado em Spark |
| Pior para | Consulta repetitiva de alto volume, que fica cara por varredura | Uso esporádico, que paga cluster ocioso | Time pequeno, por causa do custo operacional |
Lake Formation, Kinesis, Lambda e Step Functions
Lake Formation concede permissão fina sobre o lake — por banco, tabela, coluna, linha e tag — aplicada de forma consistente aos motores de consulta. É o que permite liberar a tabela de clientes ao marketing sem a coluna de CPF, em vez de duplicar uma versão mascarada.
Kinesis Data Streams é o streaming gerenciado: shard no lugar de partição, chave de partição com o mesmo papel do Kafka, retenção configurável.
Lambda cobre tarefa curta orientada a evento: validar arquivo que chegou, disparar job, publicar métrica. Step Functions orquestra os passos como máquina de estados, com retry e tratamento de erro declarativos — alternativa ao Airflow quando o fluxo é todo de serviços AWS.
IAM para dados
Role é a identidade que o job assume. Policy é o documento que diz quais ações são permitidas sobre quais recursos. Menor privilégio é conceder apenas o que aquele job usa: um prefixo específico do bucket, as ações de leitura e escrita necessárias, nada além.
Se quiser outro ângulo
Como cai na sabatina
“Uma consulta no Athena custou caro. O que você olha primeiro?”
Erros comuns
- Achar que Athena cobra por tempo de consulta. A cobrança padrão é por volume de dados varridos, então otimizar é reduzir bytes lidos, não segundos gastos.
- Criar partição no S3 e esquecer de registrar no catálogo. Sem MSCK REPAIR, ALTER TABLE ADD PARTITION, crawler ou partition projection, o Athena não enxerga a partição e continua varrendo tudo.
- Escolher Redshift para consulta exploratória esporádica sobre o lake. Você paga cluster ligado o tempo todo para um uso que o Athena atenderia sob demanda.
- Usar EMR por hábito onde Glue ou Databricks resolveriam. EMR entrega controle do cluster e da versão do Spark, e cobra isso em operação e tuning.
- Tratar Lake Formation como sinônimo de bucket policy. Ele dá permissão fina por tabela, coluna e linha sobre o catálogo, coisa que política de S3 não expressa.
- Anexar policy larga na role do job para destravar o deploy. Menor privilégio é requisito em banco, e a banca pergunta como você restringiria depois.
- Guardar arquivo pequeno demais no S3. Milhares de arquivos de poucos KB destroem a performance do Athena e do Spark por sobrecarga de listagem e abertura.
Flashcards
Card 1 de 14
0 certos · 0 a reverDrill
Escolha o serviço para o cenário
Para cada necessidade, escolha o serviço principal. Prepare uma frase dizendo o que você descarta e por quê.
1.Analista quer investigar uma reclamação rodando SQL ad hoc sobre seis meses de arquivos Parquet no lake, poucas vezes por semana.
2.Painel de risco consultado por 200 usuários ao longo do dia, sobre modelo dimensional estável, com exigência de tempo de resposta previsível.
3.Descobrir automaticamente o schema de arquivos novos que o parceiro deposita no S3 e registrar a tabela para os demais motores.
4.Capturar eventos de autorização de cartão em fluxo contínuo, com alta vazão, para alimentar o motor de fraude.
5.Liberar a tabela de clientes para o time de marketing sem expor CPF e sem duplicar a tabela.
6.Rodar um job Spark de reprocessamento de dois anos que exige uma versão específica do Spark e uso agressivo de instâncias spot.
7.Encadear validação de arquivo, disparo de job e notificação, tudo com serviços AWS e sem manter servidor de orquestração.
Drill
Athena caro: o que você mexe primeiro?
Ordene mentalmente por impacto sobre bytes varridos. Para cada ação, diga se ela reduz muito, pouco ou nada o custo.
1.Particionar a tabela por data de referência e filtrar por essa coluna.
2.Converter os arquivos de CSV para Parquet comprimido.
3.Trocar SELECT estrela por lista explícita de colunas.
4.Adicionar LIMIT 100 ao final da consulta.
5.Compactar milhares de arquivos pequenos em arquivos maiores.
6.Executar a mesma consulta num horário de menor movimento.
Quiz · 1 de 2
Qual é a diferença essencial entre Athena e Redshift?
Explique para um gerente
Explique para um analista de negócio por que a mesma consulta no Athena pode custar dez vezes mais dependendo de como o arquivo foi gravado no S3.
Responda em voz alta antes de seguir. Se travar numa palavra técnica, é sinal de que ainda não entendeu essa parte.
Perguntas de sabatina deste tema
- · Uma consulta no Athena custou caro. O que você olha primeiro?
- · Desenhe o pipeline na AWS para levar as transações de cartão do core até um painel de fraude, dizendo qual serviço faz o quê e como você trata segurança.
Para ir além