Arquiteturas resilientes · tema 8 de 18
Alta disponibilidade e tolerância a falhas
30 min · 2 vídeos · 11 cards · 1 drill
Por que cai
É a base do domínio de 26%, e onde nasce a resposta padrão da prova: se o enunciado fala em falha, a alternativa certa quase sempre distribui em mais de uma zona de disponibilidade. Sem saber o que é zona, região e serviço de escopo regional, você não distingue a alternativa que resolve da que só parece resolver.
Pré-teste · 1 de 2
responda antes de verUma aplicação roda em uma única instância EC2. O requisito novo é continuar disponível se uma zona de disponibilidade falhar. Qual mudança atende?
Vídeo · português · 11 min
Em uma frase
Zona é a unidade de falha isolada; região é o conjunto de zonas. A resposta padrão do Domínio 2 é distribuir em mais de uma zona; a região extra só entra quando o enunciado fala em perder a região inteira.
O mapa da infraestrutura
região— Área geográfica com várias zonas de disponibilidade, como sa-east-1 (São Paulo). Você escolhe a região por latência, custo, serviços disponíveis e exigência legal de onde o dado mora. zona de disponibilidade— Um ou mais data centers dentro de uma região, com energia, refrigeração e rede independentes. Separados o bastante para um desastre local não atingir dois; próximos o bastante para replicação síncrona.Essa distância é uma decisão de engenharia que tem consequência direta na prova: como as zonas estão a poucos milissegundos umas das outras, dá para replicar de forma síncrona entre elas. É por isso que RDS Multi-AZ não perde transação, e é por isso que o mesmo truque não funciona entre regiões distantes, onde a replicação é assíncrona e existe janela de perda.
Além das zonas, a rede tem os pontos de presença (borda), onde vivem CloudFront e Route 53. Eles servem desempenho e roteamento, não redundância de computação.
Três palavras que a prova separa
| Conceito | Pergunta que responde | Custo típico | Mecanismo |
|---|---|---|---|
| Alta disponibilidade | Continua no ar se um componente cair? | Moderado | Redundância em mais de uma zona, failover automático |
| Tolerância a falhas | Continua sem NENHUMA interrupção nem perda? | Alto | Redundância total, capacidade de sobra |
| Recuperação de desastres | Se eu perder tudo, em quanto tempo volto e quanto perco? | Depende da estratégia | Backup, réplica ou ambiente em outra região; medido por RTO e RPO |
Alta disponibilidade aceita a interrupção curta do failover. Tolerância a falhas não aceita nenhuma, e paga por isso. Quando o enunciado diz "sem interrupção" ou "sem perder nenhuma transação", ele está pedindo a segunda, e a alternativa mais barata provavelmente não atende.
Escopo do recurso: onde ele vive
Esta é a tabela que mais economiza tempo na prova:
| Escopo | Recursos | O que isso implica |
|---|---|---|
| Zona | Instância EC2, volume EBS, sub-rede, NAT Gateway | Morre com a zona. Redundância é trabalho seu |
| Região | S3, DynamoDB, SQS, SNS, Lambda, ELB, Aurora | A AWS já replica entre zonas. Sua decisão é entre regiões |
| Global | IAM, Route 53, CloudFront, Organizations | Não pertence a região nenhuma |
Por que "pelo menos duas zonas" é quase sempre a resposta
Uma instância vive em uma zona e não migra sozinha. Um volume EBS idem. Se a zona cai, tudo que estava só nela cai junto. Distribuir em duas zonas é a mudança mais barata que transforma "cai" em "continua com metade da capacidade" — e, com Auto Scaling, em "continua e repõe".
A matemática ajuda a entender a insistência: componentes necessários em série multiplicam disponibilidades. Um balanceador de 99,99%, instâncias de 99,95% e um banco único de 99,95% resultam em cerca de 99,89%, pior que qualquer um deles. Redundância em cada camada é o que inverte essa conta.
Responsabilidade compartilhada
A AWS entrega zonas isoladas e serviços regionais já redundantes. Usar mais de uma zona é decisão sua. Nenhuma arquitetura vira resiliente porque está na nuvem; ela vira resiliente porque alguém distribuiu a capacidade. Quando uma alternativa diz "a AWS já garante isso" para um recurso de zona, ela está errada.
Como responder o cenário
Pergunte o que está falhando: instância (mais instâncias, Auto Scaling), zona (mais zonas), região (DR, e qual estratégia), dado (backup e replicação). Depois confira o escopo dos recursos citados: metade dos distratores propõe algo que o escopo não permite. Por fim, aplique a palavra do enunciado: "sem interrupção" pede mais que "continuar disponível", e "menor custo" impede subir para multirregião sem que ela tenha sido pedida.
Se quiser outro ângulo1 vídeo
Como cai na sabatina
“A aplicação precisa continuar disponível se um data center inteiro falhar. O que muda na arquitetura?”
Erros comuns
- Tratar região e zona de disponibilidade como sinônimos. Região é a área geográfica; zona é um ou mais data centers isolados dentro dela. Multi-AZ protege contra falha de data center; multirregião protege contra falha da região inteira.
- Achar que multirregião é sempre melhor. Custa mais, adiciona latência de replicação e complexidade. A prova pune resposta acima do requisito: se o enunciado fala em falha de AZ, a resposta multirregião está errada.
- Confundir alta disponibilidade com tolerância a falhas. Alta disponibilidade aceita uma interrupção curta durante o failover; tolerância a falhas não perde nada, e custa bem mais.
- Esquecer que uma instância EC2 vive em uma única zona. Ela não migra sozinha: o que dá disponibilidade é ter várias, em zonas diferentes, atrás de um balanceador.
- Achar que S3, DynamoDB e Lambda precisam de configuração para serem resilientes na região. Eles já replicam entre zonas por desenho; o que exige decisão é a proteção entre regiões.
- Ignorar o modelo de responsabilidade compartilhada. A AWS entrega zonas isoladas; usar mais de uma é trabalho do arquiteto, não acontece por padrão.
Flashcards
Card 1 de 11
0 certos · 0 a reverDrill
Zona, região ou global?
Para cada recurso, diga o escopo dele.
1.Volume EBS anexado a uma instância.
2.Bucket S3.
3.Zona hospedada do Route 53.
4.Sub-rede de uma VPC.
5.Usuário e role do IAM.
6.Fila do SQS.
Quiz · 1 de 4
Uma aplicação web roda em duas instâncias EC2 na mesma zona de disponibilidade, atrás de um Application Load Balancer. Durante uma falha dessa zona, a aplicação ficou indisponível. Qual mudança resolve o problema com o MENOR esforço?
Explique para um gerente
Explique em um minuto para alguém de negócio a diferença entre 'o site não cai' e 'se tudo cair, eu volto em duas horas', e por que custam coisas diferentes.
Se travar numa palavra técnica, é sinal de que ainda não entendeu essa parte.
Prefiro falar em voz alta
00:00
Toque para gravar, ou responda em voz alta sem gravar