DEV Community

César Augusto de Fázio
César Augusto de Fázio

Posted on

OCI Full Stack Disaster Recovery: Como Funciona, Pré-Requisitos e Custos

O que é o OCI Full Stack Disaster Recovery?

O OCI Full Stack Disaster Recovery é um serviço gerenciado da Oracle Cloud Infrastructure que orquestra a transição de aplicações, máquinas virtuais, bancos de dados, armazenamento e componentes de rede entre regiões OCI. Ele automatiza fluxos de failover, switchover e testes de DR sem exigir a reconstrução manual da infraestrutura na região de destino.

Se você trabalha com nuvem em algum grau, você já sabe: Data centers caem. Nós já vimos em 2025 o prejuízo das empresas quando o AWS e o Azure caíram.

Para evitar que sua infraestrutura fique indisponível até o data center se recuperar, a Oracle criou o OCI Full Stack Disaster Recovery (DR), um serviço gerenciado da Oracle Cloud Infrastructure para recuperação de desastres de ponta a ponta.

Ele automatiza a transição de VMs, bancos de dados, armazenamento e rede entre regiões da OCI com um único clique ou automaticamente, sem exigir servidores especializados ou reconstrução do zero.

Benefícios do OCI Full Stack Disaster Recovery Descrição
Integração Nativa Integra-se nativamente a Compute, Storage, Load Balancer, Bancos OCI e OKE.
Automação Inteligente Gera planos de DR automaticamente e executa pré-verificações para garantir a recuperação.
Flexível e Extensível Suporta qualquer topologia e aceita personalização via scripts shell com OCI Compute Run Command ou funções serverless via OCI Functions.
Serverless Serviço totalmente gerenciado, dispensando servidores dedicados para a operação.

Pré-Requisitos do OCI Full Stack Disaster Recovery

Para usar o OCI Full Stack Disaster Recovery, você precisa ter em mãos o seguinte:

Categoria Pré-requisito / Componente Descrição
Conta e Acesso Conta OCI Ativa Modelo Universal Credits ou Pay As You Go ativado.
Conta e Acesso Políticas IAM Políticas de IAM necessárias configuradas para permitir a execução e gestão do Full Stack DR.
Infraestrutura DR DR Protection Groups (DRPG) Um DRPG na região primária e outro na região standby, com o link de pareamento (peer link) estabelecido.
Infraestrutura DR Plano de DR Plano de recuperação de desastres da aplicação criado diretamente no OCI Full Stack DR.
Infraestrutura DR Scripts Personalizados Scripts para atender requisitos específicos que vão além da automação padrão do Plano.
Rede e Aplicação Aplicação Pronta Aplicação já instalada, configurada e em funcionamento no ambiente OCI.
Rede e Aplicação Infraestrutura Básica VCNs, Load Balancers e infraestrutura de rede e de banco de dados devidamente configurados.
Rede e Aplicação Automação com Resource Manager (Melhor Prática) Uso do OCI Resource Manager para clonar infraestrutura de rede e bancos via Stacks Terraform.
Replicação de Dados Replicação Ativa da Camada de Dados e Armazenamento Replicação ativa configurada antes da adição ao DRPG.

1. Uma conta OCI usando Universal Credits ou Pay As You Go

O OCI Full Stack Disaster Recovery não está disponível no Always Free.

2. Camada de Infraestrutura e Dados

O OCI Full-Stack Disaster Recovery não cria rede para você. As VCNs, sub-redes, security lists e Load Balancers (públicos ou internos) já devem existir na região standby com os mesmos CIDRs e regras. A melhor prática é utilizar o OCI Resource Manager.

Seu plano de DR também precisa incluir a atualização do DNS (público ou privado). Lembre-se de usar de configurar o OCI DNS Traffic Management de antemão. Da mesma forma, a reconfiguração do Load Balancer para apontar para os novos IPs das VMs na região standby. O FSDR não faz isso automaticamente; você precisa criar etapas customizadas ou usar o OCI DNS Traffic Management com políticas de failover.

Além disso, ele não replica dados. Ele apenas movimenta a infraestrutura. Portanto, antes de configurar o DRPG, sua camada de dados já deve estar replicando ativamente:

  • Block Volumes: Use Cross-Region Volume Group Replication (replicação em grupo, pois aplicações geralmente usam múltiplos volumes).
    • Se você usa NFS ou File Storage, lembre-se de que o OCI Full-Stack Disaster Recovery não replica o OCI File Storage. Você precisará de um script para montar ou usar replicação via OCI Replication para File Systems.
  • Oracle Exadata/BaseDB: Use Oracle Data Guard com standby físico na região alvo.
  • Autonomous Database: Use Autonomous Data Guard (que já é ativado com um clique e replicação automática).

3. Políticas IAM habilitadas

O OCI Full Stack DR opera com Dynamic Groups (para identificar a entidade do serviço e as VMs) e Políticas IAM de escopo abrangente para gerenciar os recursos da infraestrutura durante os planos de DR.

Você pode encontrar a documentação completa de políticas para Dynamics Groups neste link e a documentação de políticas IAM dos recursos do OCI Full Stack Resource Manager aqui.

É importante implementar essas políticas IAM do OCI como globais na Tenancy. Isso garante que as permissões funcionem simultaneamente na região primária e na região de standby sem a necessidade de duplicar políticas por região.

Contudo, leve em consideração que o limite de políticas no OCI é de 500 declarações por hierarquia de compartimento, da Tenancy até qualquer compartimento folha. Este é um limite máximo que não pode ser aumentado; se você tiver muitas declarações na Tenancy, talvez seja interessante utilizar essas políticas de forma duplicada na região primária e na região de standby.

4. Sua Aplicação e o Oracle Cloud Agent

A aplicação deve estar instalada e funcionando na região primária. Na região standby, ela pode estar ou não instalada (se você usar o Resource Manager para clonar, ela será instalada na hora do failover). Porém, é uma boa prática deixar as VMs standby ligadas (mas com os serviços parados) para testar a infraestrutura.

Não esqueça de habilitar Oracle Cloud Agent nas VMs para que o Full Stack DR consiga executar comandos e scripts no nível do sistema operacional; isso será importante a seguir.

5. Preparação de Scripts Personalizados e de DNS

Para automações customizadas fora do escopo padrão, o Full Stack DR se integra nativamente ao OCI Compute Run Command (execução direta no SO do agente) e ao OCI Functions (para chamadas de API ou orquestrações Serverless).

Considere também que a atualização de registros DNS e o direcionamento de tráfego de redes externas não ocorrem de forma automática pelo FSDR. Adicione etapas customizadas no plano para alterar registros no OCI DNS Management ou reconfigurar Load Balancers.

  • Steering Policies (Políticas de Direcionamento): Configure regras do tipo Failover ou Load Balancing.
  • Health Checks: O OCI DNS Traffic Management monitora a saúde da região primária. Se ela ficar indisponível, o tráfego é direcionado automaticamente para os IPs públicos ou balanceadores de carga da região de DR.

6. DR Protection Group

Antes de gerar o Plano de DR propriamente dito, você precisa criar um DRPG na região primária e outro na região standby, estabelecendo o pareamento. É essa relação que permite ao Full Stack DR enxergar os recursos dos dois lados.

É nesta etapa que você mapeia os “Membros” (members). Você também deve criar os buckets replicados no Object Storage, VMs, bancos de dados, talvez um load balancer e uma instância de integração Oracle (OIC) na região standby, estabelecendo o emparelhamento (peering) entre as duas regiões.

Se você usou o OCI Resource Manager para mapear a stack, esse é o momento de usar. Este é o momento em que o OCI Disaster Recovery Plan aprende como funciona cada recurso.

7. Disaster Recovery Plan

Este plano não é seu pdf com todos os passos a serem seguidos, e sim o conjunto de instruções (runbook) que o OCI Disaster Recovery Plan seguirá. O plano inicial (Failover, Switchover ou Drill) é gerado automaticamente pelo serviço com base nos membros adicionados ao DRPG dentro da sua região de Standby. A partir daí, você insere os passos customizados.

  • Switchover: Transição planejada e controlada para manutenção ou migração.
  • Failover: Recuperação emergencial não planejada em caso de queda da região primária.
  • Drill (Simulação): Execução de testes em redes isoladas sem impactar a produção.

Assista mais sobre criação de planos aqui (em inglês).

8. DR Drills

O FSDR permite testar o plano sem impactar a produção, desde que você crie uma VCN isolada para o teste. Com isso, você pode validar seus scripts sem causar downtime.

Existe um Switchover de Teste Mandatório. Quando ele é realizado, acontece uma interrupção planejada, pois os recursos são movidos para a Região 2. Isso valida a transição e transforma a Região 1 na nova região Standby (e também contará com uma DRPG própria). Você pode reverter o Switchover depois.

9. Manutenção Contínua e Operações de Rotina

Após a implementação, o objetivo é garantir que as configurações do DR permaneçam alinhadas com as alterações no ambiente de produção.

Periodicamente, verificações automáticas de pré-requisitos identificam drifts (divergências) de configuração sem afetar a produção. Ainda assim, é recomendado que se faça regularmente DR Drills para validar novos recursos e programar switchovers para testar a continuidade da aplicação.

Precificação do OCI Full Stack Disaster Recovery

O custo do serviço Full Stack DR é baseado na capacidade alocada (OCPUs, ECPUs ou pacotes de mensagens do OIC) nos recursos pertencentes aos grupos de proteção de DR. A cobrança é feita por hora com base nos recursos configurados, independentemente de estarem em execução ou parados.

  • Compute (Instâncias Movidas / Moving): Cobrado com base nas OCPUs alocadas apenas na região primária.
  • Compute (Instâncias Não-movidas / Non-moving): Cobrado com base nas OCPUs alocadas nas regiões primária e standby.
  • Bancos de Dados Oracle: Como Autonomous Database, Base Database, Exadata Database Service, etc. A cobrança é baseada em OCPU ou ECPU.
  • MySQL HeatWave Database: Cobrado com base em ECPU.
  • Oracle Integration (OIC): Cobrado com base no número de pacotes de mensagens.
  • Oracle Kubernetes Engine (OKE): Cobrado com base no número total de OCPUs dos nós do cluster em ambas as regiões .

Não há custo adicional do serviço Full Stack DR para recursos como armazenamento (Block, File, Object) e rede/load balancers, embora você continue pagando pelo consumo normal desses serviços na OCI.

Diferença entre Quick DR e Full Stack Disaster Recovery

Existem duas formas de se preparar para DRs no OCI: QuickDR e Full Stack. A diferença entre eles é que o OCI Full Stack Disaster Recovery é o serviço completo e abrangente, enquanto o QuickDR simplifica a configuração de DR para máquinas virtuais.

Característica OCI Full Stack Disaster Recovery QuickDR
Escopo Tudo: Compute, Banco de Dados, Load Balancer, OKE, Storage, etc. OCI Compute (VMs)
Objetivo Automação total e granular para sistemas complexos. Configuração rápida e simples.
Nível de Automação Permite automação completa com planos de DR altamente personalizáveis, incluindo scripts e funções próprias. Automatiza as tarefas mais comuns, como criação de grupos de proteção, replicação de volumes e geração de planos de DR iniciais.
Recursos Suportados Suporta dezenas de serviços da OCI, como Oracle Databases, Autonomous Databases, Load Balancers, OKE, etc. Suporta armazenamento em blocos (boot e block volumes) e recursos de rede (VNICs) que a VM depende.
Ponto de Acesso Configurado e gerenciado por meio do serviço dedicado "Full Stack Disaster Recovery" no console da OCI. Ativado diretamente na página de detalhes de uma instância de computação no console da OCI.

Quando usar cada um?

Use o QuickDR se você precisa proteger rapidamente uma ou mais VMs, quer uma configuração de DR (do tipo "Pilot Light", como nesta documentação) simplificada e deseja minimizar a complexidade e o tempo de configuração inicial.

Use o Full Stack DR "completo" se sua aplicação depende de muitos recursos (como bancos de dados, load balancers, armazenamento de arquivos), ou se você precisa de um controle mais granular, planos de DR altamente personalizados.

Conclusão

Ter um plano de recuperação de desastres impresso em PDF não salva a sua operação quando o data center cai. Com o OCI Full Stack Disaster Recovery, você não precisa mais passar por aquele caos operacional e o pânico de fazer tudo manualmente durante uma queda de infraestrutura.

O OCI Full Stack Disaster Recovery acaba com isso. Ele automatiza a transição de toda a sua estrutura (computação, bancos de dados, etc.) seguindo planos que você já deixou prontos. A velocidade de recuperação aumenta e, de quebra, você elimina aqueles erros manuais que sempre acontecem nos piores momentos do failover ou switchover.

Perguntas Frequentes (FAQ)

O OCI Full Stack DR garante as métricas de RPO e RTO?

O serviço automatiza a execução do plano e reduz drasticamente o RTO (Tempo de Recuperação). No entanto, o RPO (Ponto de Recuperação) depende diretamente da frequência e do tipo de replicação configurada na camada de dados (como Data Guard ou Cross-Region Volume Replication).

É possível executar testes de DR sem afetar o ambiente de produção?

Sim. O serviço oferece a funcionalidade de DR Drill (Start Drill / Stop Drill). Essa opção executa o plano de recuperação em uma VCN isolada na região standby, permitindo validar scripts e verificar a integridade do ambiente sem interromper a operação primária.

O Full Stack DR suporta recuperação entre Tenancies distintas?

Não. Atualmente, os Grupos de Proteção de DR (DRPGs) e seus respectivos planos devem pertencer à mesma Tenancy OCI, operando entre regiões comerciais ou governamentais pareadas.

O OCI Full Stack DR suporta recuperação entre nuvens distintas em nuvem híbrida?

Não.O OCI Full Stack Disaster Recovery é projetado para gerenciar a recuperação de desastres entre regiões ou domínios de disponibilidade dentro da própria Oracle Cloud Infrastructure. Contudo, a Oracle disse em seu FAQ que esta funcionalidade está planejada para o futuro.

Como funciona a alteração de tráfego de rede durante um failover?

O Full Stack Disaster Recovery orquestra a subida das instâncias (VMs) e bancos de dados, mas a alteração de tráfego público deve ser tratada via etapas customizadas no plano. Isso inclui a atualização de zonas no OCI DNS Traffic Management ou chamadas via API para alterar os endpoints dos Load Balancers. A própria rede deveria ter um manifesto Terraform ou um Stack do OCI Resource Manager.

Onde ficam os planos de recuperação de desastres (DRPG)?

Por design, os planos de DR são criados na região standby. Durante um Switchover, a nova região standby também adquire um plano.

Top comments (0)