Voltar ao Lab
🖥️

Proxmox VE Cluster

Cluster de alta disponibilidade, armazenamento ZFS e virtualização corporativa

O cluster Proxmox VE é a base da infraestrutura virtualizada do laboratório. Composto por três nós físicos (srv02, pve03, srv04) e um servidor de backup dedicado (PBS), oferece um ambiente completo para estudos de alta disponibilidade, armazenamento definido por software com ZFS, replicação entre hosts, migração ao vivo de máquinas virtuais e containers LXC, além de gerenciamento centralizado por interface web unificada. Todo o ambiente foi projetado para reproduzir cenários reais de administração de clusters em produção, permitindo validar configurações de quorum, failover, backup e recuperação de desastres antes de aplicá-las em ambientes corporativos.

Especificações do Cluster

Relação dos nós que compõem o cluster Proxmox e suas funções na arquitetura de alta disponibilidade

CPU RAM Storage (ZFS) Função no Cluster
srv02 2× Intel Xeon E5-2683 v4 (32C/64T) 128 GB DDR4 ECC NVMe 1,02 TB + SSD 512 GB + SSD 120 GB + HDD 500 GB + HDD 4 TB + HDD 2 TB (8,15 TB) Nó principal — maior capacidade, hospeda VMs de produção e serviços críticos
pve03 AMD Ryzen 5 5600 (6C/12T) 64 GB DDR4 NVMe 1,02 TB + 2× HDD 500 GB (2,02 TB) Nó de capacidade média — redundância de cargas de trabalho e failover
srv04 Intel Xeon E5-2620 v2 (6C/12T) 16 GB DDR3 ECC NVMe 256 GB + SSD 64 GB (320 GB) Nó de borda — serviços leves, quorum e storage replicado
PBS Intel Xeon E5504 (4C/4T) 24 GB DDR3 ECC SSD 120 GB + 2× HDD 2 TB (4,12 TB) Proxmox Backup Server — backup dedicado de VMs e CTs

Arquitetura do Cluster

Como os componentes se integram para oferecer alta disponibilidade e resiliência

🔄

Corosync e Pvecm

O cluster utiliza o Corosync como mecanismo de comunicação entre os nós, garantindo troca de mensagens em tempo real sobre o estado de cada membro. O pvecm gerencia a filiação ao cluster, a votação de quorum e a eleição de nós coordenadores. Com três nós no cluster, o sistema suporta a falha de um nó sem perder quorum. O Proxmox Backup Server (PBS) atua como servidor de backup dedicado fora do cluster, garantindo que as cópias de segurança não sejam afetadas por problemas de quorum.

💾

Storage ZFS Replicado

Cada nó utiliza pools ZFS para armazenamento local com snapshots, compressão lz4 e checksum de dados. A replicação entre nós é feita por jobs agendados que transferem snapshots incrementais via zfs send/receive, garantindo cópias consistentes das VMs e containers em pelo menos dois nós simultaneamente.

Live Migration e HA

A migração ao vivo de VMs entre nós ocorre sem interrupção de serviço, utilizando replicação de memória e disco em tempo real. O serviço de High Availability monitora continuamente a saúde dos nós e, em caso de falha, reinicia automaticamente as máquinas virtuais em outro nó disponível, respeitando políticas de afinidade e prioridade.

📦

Ceph (Observação)

Embora o cluster atual não utilize Ceph como storage compartilhado, a arquitetura foi planejada para permitir futura integração com Ceph FS ou RBD. No momento, o armazenamento é baseado exclusivamente em ZFS local com replicação entre nós, modelo que oferece simplicidade operacional e ótimo desempenho para o porte do laboratório.

A comunicação entre os nós acontece por uma rede dedicada de gerenciamento com switches gerenciáveis 2.5GbE, garantindo baixa latência para tráfego de replicação e migração. O Proxmox Backup Server (PBS) complementa a estratégia de backup com desduplicação global, compressão e verificação de integridade periódica.

Principais Funcionalidades

Recursos implementados e validados no ambiente do cluster

🛡️

Alta Disponibilidade

Cluster multi-nó com failover automático de VMs e serviços críticos entre os nós do cluster. Testes de resiliência simulam falhas de hardware e rede para validar o comportamento do cluster em cenários reais.

💿

Storage ZFS

Pool de armazenamento ZFS com snapshots, compressão, checksum de integridade e replicação entre nós via zfs send/receive. Gerenciamento de datasets, reservas e quotas para controle de capacidade.

🚀

Live Migration

Migração a quente de VMs entre hosts sem interrupção de serviço, com replicação de memória e armazenamento em tempo real. Ideal para manutenção programada sem janela de indisponibilidade.

📀

Backup Automatizado

Estratégia de backup com snapshots incrementais, replicação para nós secundários e integração com PBS para desduplicação global, compressão e verificação periódica de integridade.

🌐

Gerenciamento Centralizado

Interface web unificada do Proxmox VE para gerenciamento de VMs, containers LXC, storage, rede, usuários, permissões e monitoramento de desempenho em tempo real.

🐧

Containers LXC

Virtualização a nível de sistema operacional com containers LXC, oferecendo leveza e desempenho próximo ao bare-metal. Ideal para serviços como DNS, DHCP, web servers e bancos de dados leves.

Tecnologias

Ferramentas e tecnologias envolvidas na operação do cluster Proxmox

Clusterização de servidores com Proxmox VE e gerenciamento centralizado por interface web Armazenamento definido por software com ZFS, snapshots e compressão lz4 Replicação de storage entre nós utilizando zfs send/receive com snapshots incrementais Alta disponibilidade com failover automático e recuperação de quorum Migração ao vivo de máquinas virtuais entre hosts sem interrupção de serviço Virtualização completa com KVM/QEMU para sistemas Linux e Windows Virtualização leve com containers LXC para serviços de rede e aplicações Estratégia de backup com snapshots, replicação e Proxmox Backup Server Gerenciamento de rede bridge, VLAN trunking e bonds para alta disponibilidade de link Monitoramento de desempenho com métricas em tempo real e alertas configuráveis Automação de tarefas com scripts Bash e hooks do Proxmox VE Troubleshooting de cluster: diagnóstico de quorum, logs do corosync e recovery de nós Documentação técnica de arquitetura e procedimentos operacionais do cluster

Filosofia de Aprendizado

"Um cluster se prova na falha, não no projeto. Foi simulado desastre atrás de desastre neste laboratório — nó que cai, storage que corrompe, link que morre — para que cada recuperação ensinasse algo que nenhum tutorial entrega. É errando o quorum que se aprende a valorizar o voto."

Este projeto faz parte do Laboratório de Infraestrutura. Explore a visão geral do ambiente para entender como o cluster se integra com redes, segurança, automação e energia.

🏗️ Ver Laboratório Completo