Custo de GPU para IA: quanto custa rodar modelos de linguagem em 2026

Custo de GPU para IA — tabela de precos e TCO 2026

Antes de montar qualquer infraestrutura de IA, é preciso entender os custos reais — não só o preço da GPU na nota fiscal, mas o custo total de propriedade ao longo de 3–5 anos, incluindo energia, espaço, refrigeração e manutenção. Este artigo quebra todos esses números.

Calcule o TCO da sua infraestrutura

Compare compra vs cloud no simulador TCO da Adentro — resultado em minutos.

Calcular TCO →

Preço das principais GPUs para IA em 2026

Os preços abaixo são referências de mercado para hardware novo. O câmbio USD/BRL impacta diretamente esses valores — as cotações flutuam ±15% ao longo do ano.

GPU VRAM Preço (R$) R$/GB VRAM
RTX 4090 24 GB R$ 18.000 R$ 750
L40S 48 GB R$ 110.000 R$ 2.291
A100 40 GB 40 GB R$ 140.000 R$ 3.500
A100 80 GB 80 GB R$ 190.000 R$ 2.375
H100 80 GB 80 GB R$ 500.000 R$ 6.250

O custo da GPU é só 40–60% do custo total do servidor. Somando servidor base (CPU, RAM, fonte, chassi), storage NVMe, switches de rede e a GPU, o valor total de um servidor com 2× L40S pode chegar a R$ 380.000–450.000.

Custo por hora na cloud GPU

Para treinamento pontual ou experimentação, alugar GPU na cloud é mais econômico do que comprar. Os principais provedores em 2026:

Instância GPU On-demand (USD/h) Spot/Preemptible (USD/h)
AWS g4dn.xlarge T4 (16 GB) $0,526 $0,16
AWS p3.2xlarge V100 (16 GB) $3,06 $0,92
AWS p4d.24xlarge 8× A100 40 GB $32,77 $9,83
GCP a3-highgpu-8g 8× H100 80 GB $49,36 $14,81
Lambda Cloud H100 H100 SXM5 80 GB $2,49

Dica: provedores especializados em GPU cloud (Lambda Labs, Vast.ai, RunPod) costumam ser 30–50% mais baratos que AWS/GCP/Azure para GPU pura, sem o overhead de outros serviços.

Custo total de propriedade — TCO 3 anos

A comparação justa entre comprar e alugar precisa considerar todos os custos ao longo do tempo:

Exemplo: servidor com 4× L40S (4× 48 GB = 192 GB VRAM)

Item Compra própria Cloud (AWS on-demand equiv.)
Hardware (Capex) R$ 620.000
Energia (3 anos, R$ 0,80/kWh) R$ 95.000
Manutenção / suporte (3 anos) R$ 45.000
Cloud GPU (3 anos uso contínuo) R$ 2.800.000+
TCO 3 anos R$ 760.000 R$ 2.800.000

Para uso contínuo (24/7), a compra própria amortiza em aproximadamente 10–14 meses de uso.

Como calcular custo por token gerado

Para inferência de LLMs, a métrica de negócio mais relevante é o custo por token — quanto custa gerar um token de resposta para o usuário final.

Fórmula simplificada:

Custo/hora do servidor = (Energia kWh × R$ 0,80) + (Capex GPU / (horas vida útil)) + manutenção
Tokens/hora = throughput (tok/s) × 3.600
Custo/1.000 tokens = (Custo/hora) / (Tokens/hora) × 1.000

Exemplo prático com L40S servindo Llama 3 70B Q4:

  • Throughput: ~50 tokens/segundo (batch de 4 usuários)
  • Tokens/hora: 180.000
  • Custo/hora do servidor: ~R$ 12 (energia + amortização)
  • Custo por 1.000 tokens: ~R$ 0,067

Comparando com OpenAI GPT-4o (US$ 0,005/1k tokens de output = ~R$ 0,028 em nov/2026), o custo de inferência local com L40S é comparável em escala — e sem os custos de privacidade de dados.

Perguntas frequentes

Consigo reduzir custo comprando GPU usada?

Sim, mas com cautela. GPUs de data center usadas (A100, V100) aparecem no mercado após contratos de cloud expirarem. O desconto pode ser 30–50% do preço novo, mas você perde garantia do fabricante. Avalie sempre o histórico de horas de uso (disponível via nvidia-smi para GPUs NVIDIA). Para projetos de IA não-críticos, é uma opção válida. Para produção com SLA, prefira novo.

O custo de energia é mesmo significativo?

Sim — em muitos projetos, a energia representa 10–20% do TCO total em 3 anos. Uma GPU H100 SXM5 tem TDP de 700W; um servidor com 8× H100 consome 6–8 kW só em GPUs. A 24/7, isso são R$ 4.000–5.500 por mês só em energia. Essa conta cresce linearmente com o número de GPUs.

Leasing de GPU é uma opção viável?

Sim. Alguns fornecedores oferecem leasing de servidores GPU com prazo de 24–36 meses, permitindo Opex em vez de Capex. A Adentro oferece modalidade de cloud privada gerenciada que funciona de forma similar: hardware dedicado ao cliente com pagamento mensal, suporte e atualização de hardware ao final do contrato.

Qual a vida útil de uma GPU de data center?

GPUs de data center como A100 e H100 são projetadas para 5+ anos de operação contínua. Na prática, a maioria das empresas substitui em 3–4 anos por motivos de desempenho (novas gerações chegam com 2–3× mais throughput) do que por falha. O valor residual de uma GPU A100 após 3 anos ainda pode ser 30–40% do valor original.

Posso deduzir o custo de GPU do imposto de renda da empresa?

Sim. GPUs para uso empresarial são ativos imobilizados e podem ser depreciados — a Receita Federal permite depreciação acelerada de equipamentos de TI em 5 anos (20% ao ano pelo método linear). Consulte seu contador para a melhor estratégia entre depreciação acelerada e expensing direto, que pode variar conforme o regime tributário da empresa.

O que você acha?

Artigos relacionados

Solicitar contato

Converse com time de vendas!

Ajudamos sua empresa a modernizar continuamente sua infraestrutura de TI, garantir a resiliência dos seus dados e conduzir uma migração segura e estratégica para a nuvem.

Your benefits:
O que acontece a seguir?
1

Reunião para entender seu desafio

2

Realizaremos um diagnóstico do seu ambiente de TI

3

Apresentação da proposta e criação de ambiente de teste

Falar com especialista em soluções de TI
v3 Solicitar contato v3 (#18) (#20)
+55