Pular para o conteúdo

Tema

Arquiteturas resilientes · tema 8 de 18

Alta disponibilidade e tolerância a falhas

30 min · 2 vídeos · 11 cards · 1 drill

Por que cai

É a base do domínio de 26%, e onde nasce a resposta padrão da prova: se o enunciado fala em falha, a alternativa certa quase sempre distribui em mais de uma zona de disponibilidade. Sem saber o que é zona, região e serviço de escopo regional, você não distingue a alternativa que resolve da que só parece resolver.

Pré-teste · 1 de 2

responda antes de ver

Uma aplicação roda em uma única instância EC2. O requisito novo é continuar disponível se uma zona de disponibilidade falhar. Qual mudança atende?

Quanta certeza você tem?

Vídeo · português · 11 min

Onze minutos para fixar o mapa: região, zona e a distância física entre elas. Assista prestando atenção em por que as zonas são separadas mas próximas; é isso que permite replicação síncrona sem latência proibitiva.

Em uma frase

Zona é a unidade de falha isolada; região é o conjunto de zonas. A resposta padrão do Domínio 2 é distribuir em mais de uma zona; a região extra só entra quando o enunciado fala em perder a região inteira.

O mapa da infraestrutura

regiãoÁrea geográfica com várias zonas de disponibilidade, como sa-east-1 (São Paulo). Você escolhe a região por latência, custo, serviços disponíveis e exigência legal de onde o dado mora. zona de disponibilidadeUm ou mais data centers dentro de uma região, com energia, refrigeração e rede independentes. Separados o bastante para um desastre local não atingir dois; próximos o bastante para replicação síncrona.

Essa distância é uma decisão de engenharia que tem consequência direta na prova: como as zonas estão a poucos milissegundos umas das outras, dá para replicar de forma síncrona entre elas. É por isso que RDS Multi-AZ não perde transação, e é por isso que o mesmo truque não funciona entre regiões distantes, onde a replicação é assíncrona e existe janela de perda.

Além das zonas, a rede tem os pontos de presença (borda), onde vivem CloudFront e Route 53. Eles servem desempenho e roteamento, não redundância de computação.

Três palavras que a prova separa

ConceitoPergunta que respondeCusto típicoMecanismo
Alta disponibilidadeContinua no ar se um componente cair?ModeradoRedundância em mais de uma zona, failover automático
Tolerância a falhasContinua sem NENHUMA interrupção nem perda?AltoRedundância total, capacidade de sobra
Recuperação de desastresSe eu perder tudo, em quanto tempo volto e quanto perco?Depende da estratégiaBackup, réplica ou ambiente em outra região; medido por RTO e RPO

Alta disponibilidade aceita a interrupção curta do failover. Tolerância a falhas não aceita nenhuma, e paga por isso. Quando o enunciado diz "sem interrupção" ou "sem perder nenhuma transação", ele está pedindo a segunda, e a alternativa mais barata provavelmente não atende.

Escopo do recurso: onde ele vive

Esta é a tabela que mais economiza tempo na prova:

EscopoRecursosO que isso implica
ZonaInstância EC2, volume EBS, sub-rede, NAT GatewayMorre com a zona. Redundância é trabalho seu
RegiãoS3, DynamoDB, SQS, SNS, Lambda, ELB, AuroraA AWS já replica entre zonas. Sua decisão é entre regiões
GlobalIAM, Route 53, CloudFront, OrganizationsNão pertence a região nenhuma

Por que "pelo menos duas zonas" é quase sempre a resposta

Uma instância vive em uma zona e não migra sozinha. Um volume EBS idem. Se a zona cai, tudo que estava só nela cai junto. Distribuir em duas zonas é a mudança mais barata que transforma "cai" em "continua com metade da capacidade" — e, com Auto Scaling, em "continua e repõe".

A matemática ajuda a entender a insistência: componentes necessários em série multiplicam disponibilidades. Um balanceador de 99,99%, instâncias de 99,95% e um banco único de 99,95% resultam em cerca de 99,89%, pior que qualquer um deles. Redundância em cada camada é o que inverte essa conta.

Responsabilidade compartilhada

A AWS entrega zonas isoladas e serviços regionais já redundantes. Usar mais de uma zona é decisão sua. Nenhuma arquitetura vira resiliente porque está na nuvem; ela vira resiliente porque alguém distribuiu a capacidade. Quando uma alternativa diz "a AWS já garante isso" para um recurso de zona, ela está errada.

Como responder o cenário

Pergunte o que está falhando: instância (mais instâncias, Auto Scaling), zona (mais zonas), região (DR, e qual estratégia), dado (backup e replicação). Depois confira o escopo dos recursos citados: metade dos distratores propõe algo que o escopo não permite. Por fim, aplique a palavra do enunciado: "sem interrupção" pede mais que "continuar disponível", e "menor custo" impede subir para multirregião sem que ela tenha sido pedida.

Se quiser outro ângulo1 vídeo
Complementar, e resolve uma confusão real: o nome da zona (us-east-1a) é diferente em cada conta. Não cai direto na prova, mas evita conclusões erradas quando você comparar arquiteturas entre contas.

Como cai na sabatina

A aplicação precisa continuar disponível se um data center inteiro falhar. O que muda na arquitetura?

Erros comuns

  • Tratar região e zona de disponibilidade como sinônimos. Região é a área geográfica; zona é um ou mais data centers isolados dentro dela. Multi-AZ protege contra falha de data center; multirregião protege contra falha da região inteira.
  • Achar que multirregião é sempre melhor. Custa mais, adiciona latência de replicação e complexidade. A prova pune resposta acima do requisito: se o enunciado fala em falha de AZ, a resposta multirregião está errada.
  • Confundir alta disponibilidade com tolerância a falhas. Alta disponibilidade aceita uma interrupção curta durante o failover; tolerância a falhas não perde nada, e custa bem mais.
  • Esquecer que uma instância EC2 vive em uma única zona. Ela não migra sozinha: o que dá disponibilidade é ter várias, em zonas diferentes, atrás de um balanceador.
  • Achar que S3, DynamoDB e Lambda precisam de configuração para serem resilientes na região. Eles já replicam entre zonas por desenho; o que exige decisão é a proteção entre regiões.
  • Ignorar o modelo de responsabilidade compartilhada. A AWS entrega zonas isoladas; usar mais de uma é trabalho do arquiteto, não acontece por padrão.

Flashcards

Card 1 de 11

0 certos · 0 a rever

Drill

Zona, região ou global?

Para cada recurso, diga o escopo dele.

  1. 1.Volume EBS anexado a uma instância.

  2. 2.Bucket S3.

  3. 3.Zona hospedada do Route 53.

  4. 4.Sub-rede de uma VPC.

  5. 5.Usuário e role do IAM.

  6. 6.Fila do SQS.

Quiz · 1 de 4

Uma aplicação web roda em duas instâncias EC2 na mesma zona de disponibilidade, atrás de um Application Load Balancer. Durante uma falha dessa zona, a aplicação ficou indisponível. Qual mudança resolve o problema com o MENOR esforço?

Explique para um gerente

Explique em um minuto para alguém de negócio a diferença entre 'o site não cai' e 'se tudo cair, eu volto em duas horas', e por que custam coisas diferentes.

Se travar numa palavra técnica, é sinal de que ainda não entendeu essa parte.

Prefiro falar em voz alta

00:00

Toque para gravar, ou responda em voz alta sem gravar

Para ir além3 artigos