Dimensionar um servidor para machine learning é diferente de dimensionar para aplicações web ou bancos de dados. A GPU domina o orçamento, mas cada componente — CPU, RAM, storage, fonte — precisa estar na medida certa para não criar gargalos. Este guia mostra como calcular cada item.
A Adentro projeta servidores para ML considerando seu modelo, volume de dados e crescimento esperado.
Os componentes e seus papéis no ML
Em um servidor de ML, cada componente tem uma função específica. O gargalo mais comum não é a GPU — é o pipeline de dados que alimenta a GPU.
| Componente | Papel no ML | Gargalo se subdimensionado |
|---|---|---|
| GPU | Executa forward/backward pass | Treinamento lento, VRAM insuficiente |
| CPU | Data loading, tokenização, augmentation | GPU ociosa esperando dados |
| RAM | Buffer de dataset em memória | Swap para disco, throughput despenca |
| NVMe | Dataset, checkpoints, pesos | I/O wait, GPU ociosa |
| PCIe | Transferência CPU↔GPU | Transferência lenta de batches |
Como dimensionar a CPU para ML
Número de cores: mais é melhor, até certo ponto
O PyTorch DataLoader e TensorFlow Dataset usam workers paralelos para pré-processar dados enquanto a GPU treina. A regra prática: 4 CPU cores por GPU é o mínimo. Para 4 GPUs, 16–24 cores físicos são adequados. Para 8 GPUs com datasets pesados (imagens de alta resolução, áudio), 32–64 cores físicos garantem que a GPU nunca fique ociosa.
Escolhas recomendadas em 2026
- Entry (1–2 GPUs, PME): AMD Ryzen 9 7950X (16C/32T) ou Intel Core i9-14900K — excelente relação custo/performance, suporta DDR5 e PCIe 5.0
- Mid-market (4 GPUs): AMD EPYC 9354 (32C, 12 canais DDR5) ou Intel Xeon w9-3595X (60C)
- Enterprise (8+ GPUs): AMD EPYC 9654 (96C, dual socket) ou Intel Xeon w9-3595X em configuração dual-socket
PCIe — não ignore a geração
GPUs modernas (A100, H100, L40S) usam PCIe 4.0 ×16, que oferece 32 GB/s de bandwidth bidirecional. Algumas placas já suportam PCIe 5.0 (64 GB/s). Um servidor com PCIe 3.0 limita o bandwidth em 16 GB/s por slot — suficiente para inferência, mas pode criar gargalo em treinamento com batches grandes. Verifique a geração de PCIe do servidor antes de comprar.
Quanto de RAM para ML
A regra dos 2×
Instale no mínimo o dobro da VRAM total em RAM do sistema:
- 1× RTX 4090 (24 GB VRAM) → mínimo 48 GB RAM, recomendado 64 GB
- 2× A100 40 GB (80 GB VRAM total) → mínimo 160 GB RAM, recomendado 256 GB
- 8× H100 80 GB (640 GB VRAM total) → mínimo 1 TB RAM, recomendado 1,5–2 TB
DDR5 vs DDR4
Para servidores novos, DDR5 é obrigatório — oferece bandwidth 50–80% superior ao DDR4 e suporte nativo nos processadores AMD EPYC Genoa/Turin e Intel Xeon 4ª geração. Esse bandwidth extra é especialmente importante quando múltiplos workers de CPU alimentam múltiplas GPUs simultaneamente.
ECC: não é opcional para produção
Memória ECC (Error-Correcting Code) detecta e corrige erros de bit espontâneos. Em treinamentos longos (24–72 horas), um único erro de memória pode corromper gradientes e invalidar o treinamento inteiro. Processadores Xeon e EPYC suportam ECC nativamente. Ryzen/Core i9 não suportam ECC — outra razão para usar plataforma enterprise em treinamentos longos.
Storage: velocidade acima de capacidade
Throughput primeiro, capacidade depois
O critério principal para storage em ML não é quanto cabe, mas quão rápido os dados chegam à CPU. Uma GPU processando ImageNet precisa de ~2–4 GB/s de leitura sustentada. Um NVMe PCIe Gen4 lê a 7 GB/s — suficiente para 1–2 GPUs. Para 4+ GPUs, considere RAID-0 de NVMes ou storage em rede de alta velocidade (NFS-oRDMA sobre 100 GbE).
Tiered storage: a configuração mais eficiente
- Tier 0 — NVMe fast (2–4 TB): SO, ambiente Conda/venv, modelo em uso, dataset do experimento atual. Velocidade de pico.
- Tier 1 — NVMe capacity (8–16 TB): datasets processados, checkpoints recentes, modelos disponíveis. Boa velocidade, maior capacidade.
- Tier 2 — NAS / HDD (50–200 TB): datasets brutos, versões antigas de modelos, arquivos históricos. Baixo custo por TB.
Configurações recomendadas por porte
Config Entry — PME (R$ 80.000–180.000)
| Componente | Especificação |
|---|---|
| GPU | 1–2× RTX 4090 (24 GB) ou 1× L40S (48 GB) |
| CPU | AMD Ryzen 9 7950X ou Intel Core i9-14900K |
| RAM | 64–128 GB DDR5 |
| Storage | 2 TB NVMe Gen4 + 8 TB SATA SSD |
| Uso | Inferência modelos 7B–13B, fine-tuning LoRA, RAG |
Config Mid-Market (R$ 500.000–1.200.000)
| Componente | Especificação |
|---|---|
| GPU | 4× A100 80 GB ou 4× L40S 48 GB |
| CPU | AMD EPYC 9354 (32C) ou Intel Xeon w9-3595X |
| RAM | 512 GB DDR5 ECC registrada |
| Storage | 2× 4 TB NVMe Gen4 (RAID-0) + 30 TB NAS |
| Uso | Fine-tuning modelos 70B, inferência multi-modelo, pipelines de visão |
Checklist de compra do servidor de ML
- ✅ Slots PCIe 4.0/5.0 suficientes para todas as GPUs planejadas
- ✅ Fonte de alimentação calculada: TDP das GPUs + CPU + discos + 20% de margem
- ✅ Chassis tem airflow adequado para as GPUs (resfriamento passivo precisa de fluxo de ar garantido)
- ✅ RAM é ECC registrada (se usando plataforma Xeon/EPYC)
- ✅ Slots de RAM suficientes para expansão futura (não usar todos os slots no dia 1)
- ✅ IPMI/iDRAC configurado para gerenciamento remoto
- ✅ No-break dimensionado para o consumo total do servidor
- ✅ Contrato de suporte hardware com SLA definido (tempo de troca de peça)
Perguntas frequentes
Posso usar um servidor de gaming para ML?
Para prototipagem sim. Para produção, não. Servidores de gaming (desktops com Core i9 e RTX 4090) não têm fonte redundante, memória ECC, IPMI para gerenciamento remoto, certificação para rack nem suporte empresarial. Um servidor tower enterprise entry-level (Dell T550, HP ML350) com hardware similar custa 30–50% a mais, mas oferece todos esses recursos críticos para ambiente de produção.
Quantos workers de DataLoader devo configurar?
A regra mais usada é num_workers = número de CPU cores / número de GPUs. Para um servidor com 16 cores e 2 GPUs, use 8 workers por GPU. Monitore a utilização da GPU com nvidia-smi — se ela ficar abaixo de 85% durante treinamento, adicione workers. Se o sistema começar a usar muito RAM ou swap, reduza workers.
NVLink muda o dimensionamento de RAM?
NVLink conecta a VRAM de múltiplas GPUs em um pool único (disponível em A100 e H100 via NVSwitch). Com NVLink, dois A100 80 GB aparecem como 160 GB de VRAM unificados. Isso permite rodar modelos maiores sem model parallelism explícito. Mas a RAM do sistema ainda precisa seguir a regra 2× da VRAM total — NVLink não muda o dimensionamento de RAM.
Qual fonte de alimentação para um servidor com 4× A100?
Cada A100 tem TDP de 400W. Quatro A100 = 1.600W só em GPUs. Somando CPU (250W), RAM (100W), discos (100W) e overhead, o consumo total chega a 2.200–2.500W. A fonte deve ter capacidade de pelo menos 3.000W com redundância dupla (2× 1.600W em configuração 2+0 ou 2× 3.000W em 1+1). Fontes platinum (94% eficiência) reduzem o calor gerado e a conta de energia.


