Como dimensionar servidor para machine learning: CPU, RAM e storage 2026

Como dimensionar servidor para machine learning — guia 2026

Dimensionar um servidor para machine learning é diferente de dimensionar para aplicações web ou bancos de dados. A GPU domina o orçamento, mas cada componente — CPU, RAM, storage, fonte — precisa estar na medida certa para não criar gargalos. Este guia mostra como calcular cada item.

Quer um dimensionamento personalizado?

A Adentro projeta servidores para ML considerando seu modelo, volume de dados e crescimento esperado.

Ver hub de IA →

Os componentes e seus papéis no ML

Em um servidor de ML, cada componente tem uma função específica. O gargalo mais comum não é a GPU — é o pipeline de dados que alimenta a GPU.

Componente Papel no ML Gargalo se subdimensionado
GPU Executa forward/backward pass Treinamento lento, VRAM insuficiente
CPU Data loading, tokenização, augmentation GPU ociosa esperando dados
RAM Buffer de dataset em memória Swap para disco, throughput despenca
NVMe Dataset, checkpoints, pesos I/O wait, GPU ociosa
PCIe Transferência CPU↔GPU Transferência lenta de batches

Como dimensionar a CPU para ML

Número de cores: mais é melhor, até certo ponto

O PyTorch DataLoader e TensorFlow Dataset usam workers paralelos para pré-processar dados enquanto a GPU treina. A regra prática: 4 CPU cores por GPU é o mínimo. Para 4 GPUs, 16–24 cores físicos são adequados. Para 8 GPUs com datasets pesados (imagens de alta resolução, áudio), 32–64 cores físicos garantem que a GPU nunca fique ociosa.

Escolhas recomendadas em 2026

  • Entry (1–2 GPUs, PME): AMD Ryzen 9 7950X (16C/32T) ou Intel Core i9-14900K — excelente relação custo/performance, suporta DDR5 e PCIe 5.0
  • Mid-market (4 GPUs): AMD EPYC 9354 (32C, 12 canais DDR5) ou Intel Xeon w9-3595X (60C)
  • Enterprise (8+ GPUs): AMD EPYC 9654 (96C, dual socket) ou Intel Xeon w9-3595X em configuração dual-socket

PCIe — não ignore a geração

GPUs modernas (A100, H100, L40S) usam PCIe 4.0 ×16, que oferece 32 GB/s de bandwidth bidirecional. Algumas placas já suportam PCIe 5.0 (64 GB/s). Um servidor com PCIe 3.0 limita o bandwidth em 16 GB/s por slot — suficiente para inferência, mas pode criar gargalo em treinamento com batches grandes. Verifique a geração de PCIe do servidor antes de comprar.

Quanto de RAM para ML

A regra dos 2×

Instale no mínimo o dobro da VRAM total em RAM do sistema:

  • 1× RTX 4090 (24 GB VRAM) → mínimo 48 GB RAM, recomendado 64 GB
  • 2× A100 40 GB (80 GB VRAM total) → mínimo 160 GB RAM, recomendado 256 GB
  • 8× H100 80 GB (640 GB VRAM total) → mínimo 1 TB RAM, recomendado 1,5–2 TB

DDR5 vs DDR4

Para servidores novos, DDR5 é obrigatório — oferece bandwidth 50–80% superior ao DDR4 e suporte nativo nos processadores AMD EPYC Genoa/Turin e Intel Xeon 4ª geração. Esse bandwidth extra é especialmente importante quando múltiplos workers de CPU alimentam múltiplas GPUs simultaneamente.

ECC: não é opcional para produção

Memória ECC (Error-Correcting Code) detecta e corrige erros de bit espontâneos. Em treinamentos longos (24–72 horas), um único erro de memória pode corromper gradientes e invalidar o treinamento inteiro. Processadores Xeon e EPYC suportam ECC nativamente. Ryzen/Core i9 não suportam ECC — outra razão para usar plataforma enterprise em treinamentos longos.

Storage: velocidade acima de capacidade

Throughput primeiro, capacidade depois

O critério principal para storage em ML não é quanto cabe, mas quão rápido os dados chegam à CPU. Uma GPU processando ImageNet precisa de ~2–4 GB/s de leitura sustentada. Um NVMe PCIe Gen4 lê a 7 GB/s — suficiente para 1–2 GPUs. Para 4+ GPUs, considere RAID-0 de NVMes ou storage em rede de alta velocidade (NFS-oRDMA sobre 100 GbE).

Tiered storage: a configuração mais eficiente

  • Tier 0 — NVMe fast (2–4 TB): SO, ambiente Conda/venv, modelo em uso, dataset do experimento atual. Velocidade de pico.
  • Tier 1 — NVMe capacity (8–16 TB): datasets processados, checkpoints recentes, modelos disponíveis. Boa velocidade, maior capacidade.
  • Tier 2 — NAS / HDD (50–200 TB): datasets brutos, versões antigas de modelos, arquivos históricos. Baixo custo por TB.

Configurações recomendadas por porte

Config Entry — PME (R$ 80.000–180.000)

Componente Especificação
GPU 1–2× RTX 4090 (24 GB) ou 1× L40S (48 GB)
CPU AMD Ryzen 9 7950X ou Intel Core i9-14900K
RAM 64–128 GB DDR5
Storage 2 TB NVMe Gen4 + 8 TB SATA SSD
Uso Inferência modelos 7B–13B, fine-tuning LoRA, RAG

Config Mid-Market (R$ 500.000–1.200.000)

Componente Especificação
GPU 4× A100 80 GB ou 4× L40S 48 GB
CPU AMD EPYC 9354 (32C) ou Intel Xeon w9-3595X
RAM 512 GB DDR5 ECC registrada
Storage 2× 4 TB NVMe Gen4 (RAID-0) + 30 TB NAS
Uso Fine-tuning modelos 70B, inferência multi-modelo, pipelines de visão

Checklist de compra do servidor de ML

  • ✅ Slots PCIe 4.0/5.0 suficientes para todas as GPUs planejadas
  • ✅ Fonte de alimentação calculada: TDP das GPUs + CPU + discos + 20% de margem
  • ✅ Chassis tem airflow adequado para as GPUs (resfriamento passivo precisa de fluxo de ar garantido)
  • ✅ RAM é ECC registrada (se usando plataforma Xeon/EPYC)
  • ✅ Slots de RAM suficientes para expansão futura (não usar todos os slots no dia 1)
  • ✅ IPMI/iDRAC configurado para gerenciamento remoto
  • ✅ No-break dimensionado para o consumo total do servidor
  • ✅ Contrato de suporte hardware com SLA definido (tempo de troca de peça)

Perguntas frequentes

Posso usar um servidor de gaming para ML?

Para prototipagem sim. Para produção, não. Servidores de gaming (desktops com Core i9 e RTX 4090) não têm fonte redundante, memória ECC, IPMI para gerenciamento remoto, certificação para rack nem suporte empresarial. Um servidor tower enterprise entry-level (Dell T550, HP ML350) com hardware similar custa 30–50% a mais, mas oferece todos esses recursos críticos para ambiente de produção.

Quantos workers de DataLoader devo configurar?

A regra mais usada é num_workers = número de CPU cores / número de GPUs. Para um servidor com 16 cores e 2 GPUs, use 8 workers por GPU. Monitore a utilização da GPU com nvidia-smi — se ela ficar abaixo de 85% durante treinamento, adicione workers. Se o sistema começar a usar muito RAM ou swap, reduza workers.

NVLink muda o dimensionamento de RAM?

NVLink conecta a VRAM de múltiplas GPUs em um pool único (disponível em A100 e H100 via NVSwitch). Com NVLink, dois A100 80 GB aparecem como 160 GB de VRAM unificados. Isso permite rodar modelos maiores sem model parallelism explícito. Mas a RAM do sistema ainda precisa seguir a regra 2× da VRAM total — NVLink não muda o dimensionamento de RAM.

Qual fonte de alimentação para um servidor com 4× A100?

Cada A100 tem TDP de 400W. Quatro A100 = 1.600W só em GPUs. Somando CPU (250W), RAM (100W), discos (100W) e overhead, o consumo total chega a 2.200–2.500W. A fonte deve ter capacidade de pelo menos 3.000W com redundância dupla (2× 1.600W em configuração 2+0 ou 2× 3.000W em 1+1). Fontes platinum (94% eficiência) reduzem o calor gerado e a conta de energia.

O que você acha?

Artigos relacionados

Solicitar contato

Converse com time de vendas!

Ajudamos sua empresa a modernizar continuamente sua infraestrutura de TI, garantir a resiliência dos seus dados e conduzir uma migração segura e estratégica para a nuvem.

Your benefits:
O que acontece a seguir?
1

Reunião para entender seu desafio

2

Realizaremos um diagnóstico do seu ambiente de TI

3

Apresentação da proposta e criação de ambiente de teste

Falar com especialista em soluções de TI
v3 Solicitar contato v3 (#18) (#20)
+55