Voltar ao Lab
🏗️

High-Level Design (HLD)

Arquitetura de alto nível da infraestrutura — visão executiva, blocos funcionais e decisões de design

Este documento apresenta a arquitetura de alto nível (HLD) do laboratório de infraestrutura, descrevendo a visão geral dos componentes, suas interconexões e as decisões fundamentais de design que orientaram a construção do ambiente. O HLD é o ponto de partida para qualquer profissional que queira compreender a estrutura macro do laboratório antes de mergulhar nos detalhes de implementação (LLD), nos diagramas de topologia ou no inventário de equipamentos.

Visão Executiva

Propósito, escopo e objetivos da infraestrutura

O laboratório foi projetado para reproduzir, em escala reduzida, um ambiente de data center corporativo com foco em alta disponibilidade, virtualização, redes segmentadas, segurança da informação, automação e infraestrutura de energia. Diferente de um home lab convencional, este ambiente foi planejado com critérios de engenharia — cada componente foi selecionado por sua relevância para ambientes de produção real, não por conveniência ou custo.

A infraestrutura conta com ~88 vCPUs, ~188 GiB de RAM e ~13 TiB de armazenamento distribuídos em 3 hosts formando um cluster Proxmox VE com alta disponibilidade. O ambiente opera 24 máquinas virtuais e 15 containers LXC, executando serviços reais de produção como FreePBX (telefonia IP), TrueNAS (storage ZFS), Wazuh (SIEM), Home Assistant (automação residencial), AzureCast (streaming de mídia) e EasyPanel (painel web de hospedagem), além de um domínio Windows Server com Active Directory, DNS, DHCP, IIS e GPO.

A infraestrutura elétrica é sustentada por um sistema solar com inversor Growatt SPF 5000 ES e bateria Dyness DL5.0C (LiFePO4), garantindo autonomia estendida e operação contínua mesmo durante variações da rede elétrica. O objetivo principal é validar arquiteturas, testar cenários de falha, documentar procedimentos operacionais e gerar conhecimento aplicável a ambientes corporativos de missão crítica. A integração entre os subsistemas — virtualização, redes, segurança, monitoramento, energia — permite simular incidentes reais e testar estratégias de recuperação sem impacto em produção.

Diagrama de Blocos Funcionais

Macro visão dos subsistemas e suas interconexões

🌐 Camada de Acesso e Edge
  • Provedor de internet via fibra óptica (link principal)
  • 4G/LTE como link de failover automático
  • Mikrotik RouterBOARD como roteador de borda — NAT, firewall, QoS, balanceamento de carga
  • Sophos XG Firewall — inspeção profunda de pacotes, IPS/IDS, filtragem web, VPN SSL/IPSec
🔀 Camada de Rede e Distribuição
  • Switches gerenciáveis 2.5GbE com suporte a VLAN trunking e link aggregation
  • Rede de gerenciamento dedicada — tráfego de administração e cluster
  • Rede de serviços — servidores e aplicações
  • Rede corporativa segmentada — VLANs por departamento
  • Rede DMZ para serviços expostos com isolamento rigoroso
  • VPN IPSec para interconexão com ambientes externos
🖥️ Camada de Computação e Virtualização
  • Cluster Proxmox VE com 3 nós físicos — HA, live migration, quorum
  • Armazenamento ZFS local com replicação entre nós via snapshots incrementais
  • Máquinas virtuais KVM/QEMU para sistemas Linux e Windows
  • Containers LXC para serviços leves (DNS, DHCP, web servers, bancos de dados)
  • Docker e Docker Compose para aplicações containerizadas
🛡️ Camada de Segurança
  • SIEM Wazuh — correlação de eventos, detecção de ameaças, conformidade
  • Hardening de servidores Linux — iptables/nftables, fail2ban, SELinux
  • Políticas de firewall Sophos — segmentação, controle de aplicações, filtragem web
  • Monitoramento de logs centralizado com análise forense
  • VPN com autenticação multifator para acesso remoto administrativo
📊 Camada de Observabilidade
  • Grafana e Prometheus — métricas em tempo real e dashboards centralizados
  • Correlação de logs de servidores, rede e segurança
  • Sistema de alertas proativos para falhas, thresholds e anomalias
  • Monitoramento de energia — inversor Growatt e bateria Dyness via BMS
⚡ Camada de Infraestrutura de Energia
  • Inversor solar Growatt — alimentação contínua dos equipamentos de TI
  • Banco de baterias Dyness com BMS — gerenciamento inteligente de carga e descarga
  • Autonomia calculada para operação ininterrupta durante variações da rede elétrica
  • Proteção elétrica — DPS, disjuntores, aterramento dedicado e estabilizador
  • Monitoramento integrado ao dashboard de observabilidade da infraestrutura

Decisões de Arquitetura

Justificativas técnicas para as principais escolhas de design

🎯

Proxmox VE sobre alternativas

Escolhido por oferecer virtualização completa (KVM) e leve (LXC) na mesma plataforma, com cluster nativo, storage ZFS integrado e sem custo de licenciamento. Alternativas como VMware vSphere foram descartadas por restrições de licenciamento e hardware compatível.

💾

ZFS como storage principal

Selecionado por recursos avançados de integridade de dados (checksum), snapshots instantâneos, compressão transparente, replicação nativa e gerenciamento de pools flexível. A alternativa Ceph foi considerada mas exigiria mais nós para desempenho adequado.

🔒

Firewall dedicado (Sophos)

Firewall stateful com inspeção de aplicações, IPS/IDS integrado e VPN SSL simplificam a segurança de perímetro. Separar o firewall do roteador (Mikrotik) segue a prática de segurança de defesa em camadas.

Energia solar + bateria vs. UPS tradicional

A combinação inversor Growatt + bateria Dyness oferece autonomia estendida (horas) comparada a UPS convencionais (minutos), além de eficiência energética e sustentabilidade. O BMS garante ciclos de carga inteligentes que prolongam a vida útil das baterias.

📡

Segmentação de rede rígida

VLANs com inter-VLAN routing controlado por firewall garantem isolamento entre subsistemas. A rede de gerenciamento é fisicamente separada (switch dedicado) para evitar que tráfego de serviço comprometa a administração do cluster.

🔍

SIEM Wazuh como plataforma de segurança

Open source, sem custo de licenciamento, com correlação de eventos, integração com MITRE ATT&CK, hardening assessment e alertas em tempo real. Alternativa open source ao Splunk para ambientes com orçamento restrito mas exigência de compliance.

Fluxos Principais

Como o tráfego e os dados fluem entre os subsistemas

🌍 Fluxo de Acesso Externo → Serviços
  • Usuário acessa serviço via domínio público → DNS aponta para IP público do firewall Sophos
  • Sophos inspeciona pacote, aplica regras de firewall e IPS/IDS
  • Se aprovado, encaminha para DMZ via NAT — tráfego nunca toca a rede interna diretamente
  • Serviço na DMZ responde → Sophos reescreve e retorna ao usuário
🔄 Fluxo de Migração de VM (Live Migration)
  • Administrador inicia migração pela interface web do Proxmox
  • Cluster sincroniza memória e disco da VM entre nó origem e destino via rede de gerenciamento dedicada
  • Durante a migração, a VM continua operando sem interrupção
  • Ao finalizar, a VM é ativada no nó destino e desativada na origem — zero downtime
📊 Fluxo de Monitoramento
  • Agentes (Prometheus node_exporter, Wazuh agent) em cada servidor coletam métricas e logs
  • Dados são enviados para os servidores centrais de monitoramento via rede de gerenciamento
  • Grafana consulta Prometheus e exibe dashboards em tempo real
  • Alertas são disparados quando thresholds são violados — notificações via Telegram/WhatsApp/e-mail
⚡ Fluxo de Energia
  • Inversor Growatt converte energia solar (CC → CA) e alimenta o quadro elétrico do laboratório
  • Bateria Dyness armazena excedente e fornece energia quando a geração solar é insuficiente
  • BMS monitora tensão, corrente, temperatura e estado de carga das células
  • Dados do inversor e BMS são lidos por script e enviados ao Prometheus para monitoramento integrado

Serviços em Produção

Serviços reais hospedados na infraestrutura

📞

FreePBX

VOIP/Telefonia — central telefônica IP com ramais, filas, URA e integração com operadoras SIP.

💾

TrueNAS

Storage ZFS iSCSI — armazenamento redundante com snapshots, replicação e compartilhamento NFS/SMB.

🛡️

Wazuh

SIEM Open Source — correlação de eventos, detecção de ameaças, hardening assessment e integração MITRE ATT&CK.

🏠

Home Assistant

Automação Residencial — integração com inversor Growatt, BMS Dyness, sensores e dispositivos IoT.

🎬

AzureCast

Streaming de Mídia — servidor de mídia com transmissão ao vivo, gravação e gerenciamento de conteúdo.

🌐

EasyPanel

Painel de Gerenciamento Web — hospedagem e gerenciamento de sites, bancos de dados e e-mails.

🐳

Docker Host

Portainer + n8n — orquestração de containers e automação de fluxos com integração low-code.

🪟

Windows Server AD

Active Directory + GPO — controle de domínio, DNS, DHCP, IIS e políticas de grupo centralizadas.

🔒

Nginx Proxy Reverso

SSL/TLS — terminação HTTPS, proxy reverso para serviços internos e balanceamento de carga.

📡

Pi-hole + Unbound

DNS — filtragem de anúncios e DNS recursivo com cache local para toda a rede.

Princípios de Design

Critérios que guiaram cada decisão de arquitetura

Defesa em profundidade — múltiplas camadas de segurança sobrepostas (firewall de borda, firewall interno, hardening de SO, SIEM) Alta disponibilidade por design — nenhum componente crítico é ponto único de falha, com redundância em cluster, storage e link de internet Observabilidade nativa — todo subsistema exporta métricas e logs para a plataforma central de monitoramento Infraestrutura imutável — servidores são provisionados com scripts e documentados, não configurados manualmente Custo consciente — escolhas tecnológicas priorizam soluções open source e hardware com melhor relação custo-benefício para o porte do ambiente Documentação como requisito — todo componente e procedimento é documentado antes de ser colocado em operação Resiliência energética — autonomia de energia dimensionada para operação contínua durante eventos de falta de energia elétrica Evolução planejada — arquitetura modular permite expansão ou substituição de subsistemas sem refatoração completa

Roadmap

Próximos passos e evolução planejada da infraestrutura

🚀

Curtíssimo prazo (30 dias)

Documentação completa de todos os serviços (HLD/LLD finalizados). Automação de provisionamento com Ansible ou script bash.

📈

Curto prazo (60 dias)

Expansão de storage com TrueNAS dedicado (mais 2× HDD 4TB). Implementação de backup offsite criptografado.

📊

Médio prazo (90 dias)

Dashboard de capacidade preditiva (Grafana + ML). Migração de VMs legado para containers LXC/Docker.

🎯

Longo prazo (180 dias)

Expansão do cluster Proxmox com 4º nó (maior capacidade). Upgrade para 10GbE no backbone. Integração com nuvem (backup híbrido).

Filosofia de Projeto

"Arquitetura de infraestrutura não é sobre o que funciona hoje — é sobre o que continua funcionando quando algo falha amanhã. Cada decisão neste HLD foi tomada considerando o cenário de falha: se o link de internet cair, se um nó do cluster morrer, se o storage corromper, se a energia acabar. Um design de alto nível que não considera a falha como hipótese não é um projeto de engenharia — é uma aposta."

Este é o primeiro documento da série de documentação técnica. Explore o LLD para os detalhes de implementação ou veja a topologia completa da infraestrutura.