*, *::before, *::after { box-sizing: border-box; }
:root {
–orange: #F47721;
–dark: #0F1117;
–text: #1A1D2E;
–text2: #4A5070;
–card: #F8F9FC;
–border: #D8DCE8;
–green: #1A7F4B;
–yellow: #8B6A00;
–red: #B91C1C;
–blue: #1D4ED8;
–radius: 8px;
–font: -apple-system, BlinkMacSystemFont, “Segoe UI”, system-ui, sans-serif;
–mono: “SF Mono”, “Fira Code”, Menlo, Consolas, monospace;
}
body { font-family: var(–font); color: var(–text); line-height: 1.65; max-width: 780px; margin: 0 auto; padding: 0 20px 80px; }
h1 { font-size: 2rem; font-weight: 800; line-height: 1.2; margin: 0 0 .5rem; text-wrap: balance; }
h2 { font-size: 1.3rem; font-weight: 700; margin: 2.5rem 0 .75rem; line-height: 1.3; }
h3 { font-size: 1.05rem; font-weight: 700; margin: 1.75rem 0 .5rem; }
p { margin: 0 0 1rem; }
ul, ol { margin: 0 0 1rem; padding-left: 1.4rem; }
li { margin-bottom: .4rem; }
strong { font-weight: 700; }
code { font-family: var(–mono); font-size: .85em; background: #EEF0F8; padding: 1px 5px; border-radius: 3px; }
a { color: var(–orange); text-decoration: none; }
a:hover { text-decoration: underline; }
.breadcrumb { font-size: .78rem; color: var(–text2); margin-bottom: 1.5rem; }
.breadcrumb a { color: var(–text2); }
.breadcrumb span { margin: 0 .4rem; }
.meta-bar { display: flex; gap: 16px; flex-wrap: wrap; align-items: center; font-size: .78rem; color: var(–text2); margin-bottom: 2rem; padding-bottom: 1rem; border-bottom: 1px solid var(–border); }
.meta-bar .author { font-weight: 600; color: var(–text); }
.lead { font-size: 1.1rem; color: var(–text2); line-height: 1.65; margin-bottom: 1.5rem; }
/* CTA */
.cta-box { background: linear-gradient(135deg, #FFF3E8 0%, #FFF8F0 100%); border: 1px solid rgba(244,119,33,.3); border-left: 4px solid var(–orange); border-radius: var(–radius); padding: 18px 20px; margin: 2rem 0; }
.cta-box p { margin: 0 0 .5rem; font-size: .9rem; }
.cta-box p:last-child { margin: 0; }
.cta-btn { display: inline-block; background: var(–orange); color: #fff; padding: 10px 20px; border-radius: 6px; font-weight: 700; font-size: .88rem; text-decoration: none; margin-top: 10px; }
.cta-btn:hover { background: #D96A1E; text-decoration: none; }
/* TOC */
.toc { background: var(–card); border: 1px solid var(–border); border-radius: var(–radius); padding: 18px 22px; margin: 2rem 0; }
.toc h2 { margin: 0 0 .75rem; font-size: 1rem; }
.toc ol { margin: 0; padding-left: 1.2rem; }
.toc li { margin-bottom: .3rem; font-size: .88rem; }
.toc a { color: var(–text2); }
/* Tables */
.tbl-wrap { overflow-x: auto; margin: 1.5rem 0; border-radius: var(–radius); border: 1px solid var(–border); }
table { width: 100%; border-collapse: collapse; font-size: .85rem; }
th { background: #EEF0F8; padding: 9px 12px; text-align: left; font-weight: 700; font-size: .78rem; text-transform: uppercase; letter-spacing: .04em; color: var(–text2); border-bottom: 1px solid var(–border); white-space: nowrap; }
td { padding: 9px 12px; border-bottom: 1px solid var(–border); vertical-align: top; }
tbody tr:last-child td { border-bottom: none; }
tbody tr:nth-child(even) td { background: #FAFBFE; }
td.num { font-variant-numeric: tabular-nums; text-align: right; font-family: var(–mono); font-size: .82rem; }
td.hl { background: rgba(244,119,33,.06) !important; font-weight: 600; }
.ok { color: var(–green); font-weight: 700; }
.warn{ color: var(–yellow); font-weight: 700; }
.no { color: var(–red); font-weight: 700; }
/* Callouts */
.note { padding: 13px 16px; border-radius: var(–radius); margin: 1.5rem 0; display: flex; gap: 10px; align-items: flex-start; font-size: .88rem; line-height: 1.55; }
.note-warn { background: #FFFBEB; border-left: 4px solid #D97706; }
.note-info { background: #EFF6FF; border-left: 4px solid #3B82F6; }
.note-tech { background: #F0FDF4; border-left: 4px solid #16A34A; }
.note span:first-child { font-size: 1.1rem; flex-shrink: 0; }
.note p { margin: 0; }
/* Tier cards */
.tier-grid { display: grid; grid-template-columns: repeat(auto-fit, minmax(200px, 1fr)); gap: 14px; margin: 1.5rem 0; }
.tier-card { background: var(–card); border: 1px solid var(–border); border-radius: var(–radius); padding: 16px; position: relative; overflow: hidden; }
.tier-card.featured { border-color: var(–orange); }
.tier-card.featured::before { content: “Mais popular”; position: absolute; top: 8px; right: -20px; background: var(–orange); color: #fff; font-size: .65rem; font-weight: 700; padding: 3px 28px; transform: rotate(35deg); letter-spacing: .06em; }
.tier-name { font-weight: 700; font-size: 1rem; margin-bottom: 4px; }
.tier-gpu { font-size: .8rem; color: var(–text2); margin-bottom: 12px; }
.tier-price { font-size: 1.4rem; font-weight: 800; color: var(–orange); margin-bottom: 12px; line-height: 1; }
.tier-price span { font-size: .75rem; font-weight: 400; color: var(–text2); }
.tier-feat { list-style: none; padding: 0; margin: 0; }
.tier-feat li { font-size: .8rem; padding: 4px 0; border-top: 1px solid var(–border); display: flex; justify-content: space-between; }
.tier-feat li:first-child { border-top: none; }
/* Break-even chart (CSS) */
.breakeven { background: var(–card); border: 1px solid var(–border); border-radius: var(–radius); padding: 20px; margin: 1.5rem 0; }
.breakeven-title { font-weight: 700; font-size: .9rem; margin-bottom: 14px; }
.be-bars { display: flex; flex-direction: column; gap: 10px; }
.be-row { display: flex; align-items: center; gap: 10px; font-size: .82rem; }
.be-label { min-width: 120px; color: var(–text2); }
.be-bar-wrap { flex: 1; background: var(–border); border-radius: 4px; height: 22px; position: relative; overflow: hidden; }
.be-bar { height: 100%; border-radius: 4px; display: flex; align-items: center; padding-left: 8px; font-size: .75rem; font-weight: 700; color: #fff; white-space: nowrap; transition: width .3s; }
.be-bar.cloud { background: #64748B; }
.be-bar.dedicated { background: var(–orange); }
.be-val { min-width: 80px; text-align: right; font-variant-numeric: tabular-nums; font-family: var(–mono); font-size: .8rem; }
/* Checklist */
.checklist { list-style: none; padding: 0; }
.checklist li { padding: .4rem 0 .4rem 1.8rem; position: relative; border-bottom: 1px solid var(–border); font-size: .9rem; }
.checklist li::before { content: “✓”; position: absolute; left: 0; color: var(–green); font-weight: 700; }
.checklist li:last-child { border-bottom: none; }
/* FAQ */
.faq { margin: 1.5rem 0; }
.faq-item { border-bottom: 1px solid var(–border); }
.faq-q { font-weight: 700; font-size: .95rem; padding: 14px 0 10px; cursor: pointer; display: flex; justify-content: space-between; align-items: center; }
.faq-q::after { content: “+”; font-size: 1.2rem; color: var(–orange); flex-shrink: 0; }
.faq-item.open .faq-q::after { content: “−”; }
.faq-a { display: none; font-size: .88rem; color: var(–text2); padding-bottom: 14px; line-height: 1.6; }
.faq-item.open .faq-a { display: block; }
.divider { border: none; border-top: 1px solid var(–border); margin: 2rem 0; }
.source { font-size: .72rem; color: var(–text2); margin-top: -.5rem; margin-bottom: 1rem; }
.related-grid { display: grid; grid-template-columns: 1fr 1fr; gap: 12px; margin: 1.5rem 0; }
.related-card { border: 1px solid var(–border); border-radius: var(–radius); padding: 12px 14px; }
.related-card a { font-weight: 600; font-size: .9rem; color: var(–text); display: block; margin-bottom: 4px; }
.related-card span { font-size: .78rem; color: var(–text2); }
/* Tag cloud */
.tag { display: inline-block; background: #EEF0F8; border-radius: 4px; padding: 2px 8px; font-size: .75rem; color: var(–text2); margin: 2px; }
@media (max-width: 600px) {
h1 { font-size: 1.5rem; }
.related-grid { grid-template-columns: 1fr; }
.tier-grid { grid-template-columns: 1fr; }
}
/* Dark mode */
@media (prefers-color-scheme: dark) {
:root:not([data-theme=”light”]) {
–text: #E8ECF5; –text2: #9AA0BC; –card: #1C2030; –border: #2A2F45;
}
body { background: #0F1117; }
code { background: #22273A; }
th { background: #1C2030; }
tbody tr:nth-child(even) td { background: rgba(255,255,255,.02); }
.toc { background: #1C2030; }
.note-warn { background: #2D2000; }
.note-info { background: #0A1628; }
.note-tech { background: #0A1F12; }
.tier-card { background: #1C2030; }
.related-card { background: #1C2030; }
.breakeven { background: #1C2030; }
.cta-box { background: linear-gradient(135deg, #2D1A08 0%, #3D2410 100%); }
.tag { background: #22273A; }
}
[data-theme=”light”] body { background: #fff; }
[data-theme=”dark”] body { background: #0F1117; }
Quanto custa uma GPU dedicada por mês?
·
Revisão técnica: [Revisor]
·
Publicado em agosto de 2026
·
Atualizado em agosto de 2026
·
⏱ 11 min de leitura
O custo mensal de uma GPU dedicada varia de algumas centenas a dezenas de milhares de reais — dependendo do modelo da GPU, da quantidade de VRAM, do SLA de suporte e se o hardware é compartilhado ou exclusivo. Esta página explica o que compõe esse custo, compara com cloud GPU sob demanda e ajuda você a estimar qual opção é mais econômica para o seu cenário.
Quer um preço exato para o seu cenário?
Informe o modelo de IA, o número de usuários e a carga esperada. Nossa equipe dimensiona a GPU e apresenta uma proposta com custo mensal.
1. O que é GPU dedicada (e o que não é)
Uma GPU dedicada para IA é um servidor físico com uma ou mais GPUs NVIDIA de datacenter (T4, L4, L40S, A100 ou H100) reservado exclusivamente para um único cliente. Diferente de instâncias de cloud pública — onde a GPU é alocada sob demanda e compartilhada entre múltiplos workloads — uma GPU dedicada oferece recursos garantidos, sem contenção de vizinhos e sem variação de desempenho.
O modelo de GPU dedicada existe em três formatos principais:
- Servidor dedicado em datacenter próprio do provedor: hardware físico exclusivo hospedado em uma instalação com energia, refrigeração e conectividade gerenciadas. Custo fixo mensal.
- Colocation com hardware próprio: o cliente compra a GPU e a hospeda em um datacenter parceiro. Custo variável (hosting + energia + suporte).
- GPU dedicada em nuvem privada: bare-metal em nuvem com isolamento garantido. Disponível em alguns provedores de cloud brasileiros e internacionais.
GPU dedicada ≠ GPU cloud sob demanda: instâncias como AWS p3 ou Azure NCv3 são virtualizadas — múltiplas VMs competem pelo mesmo hardware físico. GPU dedicada significa hardware físico reservado. A diferença se reflete tanto no desempenho (sem contenção) quanto no custo (sem overhead de virtualização e sem custo por hora de uso ocioso).
2. O que define o preço mensal de uma GPU dedicada
O preço mensal de uma GPU dedicada é composto por múltiplos fatores. Entender cada um permite negociar melhor e comparar propostas de fornecedores diferentes:
| Fator | Impacto no preço | Como varia |
|---|---|---|
| Modelo da GPU | 40–70% do custo | T4 < L4 < L40S < A100 < H100 |
| Quantidade de GPUs | Linear + desconto | 2 GPUs costam menos de 2× o preço de 1 |
| CPU e RAM do servidor | 10–20% | Mais núcleos e RAM aumentam o custo base |
| Storage (tipo e capacidade) | 5–15% | NVMe PCIe 4.0 + 4 TB > SATA SSD 1 TB |
| Banda de rede (Mbps) | 5–10% | 100 Mbps vs 1 Gbps; tráfego incluído vs. medido |
| SLA de disponibilidade | 5–15% | 99,5% vs. 99,9% vs. 99,95% |
| Suporte técnico | 10–20% | Business hours vs. 24×7; resposta 4h vs. 1h |
| Prazo do contrato | Desconto 10–25% | Mensal > trimestral > anual > bienal |
Preços em BRL variam com câmbio: GPUs NVIDIA são cotadas em dólares. Provedores brasileiros repassam variação cambial ou precificam em BRL com margem de proteção. Contratos de médio e longo prazo geralmente incluem cláusula de reajuste. Confirme sempre a política de reajuste antes de assinar.
3. Tiers de custo por modelo de GPU
O custo de acesso a GPU para IA na Adentro varia conforme o modelo e o regime de uso. A tabela abaixo mostra o preço por hora no modelo on-demand (sem compromisso mensal) e o custo equivalente para uso integral de 720h/mês — referência para comparar com um contrato mensal dedicado, que oferece desconto adicional.
- VRAM24 GB
- 720h/mêsR$ 2.880–5.760
- Adequado para7–13B INT8, RAG leve
- Obs.sem ECC — dev/teste
- VRAM48 GB · ECC
- 720h/mêsR$ 5.760–10.080
- Adequado para13–34B FP16, fine-tuning
- Usuários simul.até ~50
- VRAM80 GB · ECC
- 720h/mêsR$ 7.200–12.960
- Adequado para70B FP16, produção exigente
- Usuários simul.escala horizontal
- VRAM80 GB · ECC
- 720h/mêsR$ 10.800–20.160
- Adequado para70B+ FP16, treinamento
- Banda memória3.350 GB/s
Preços on-demand Adentro Data Center, agosto de 2026. Contratos mensais dedicados têm desconto — solicite proposta. Preço de compra da GPU (CAPEX): RTX 4090 R$12.000–18.000 · L40S R$50.000–80.000 · A100 R$80.000–150.000 · H100 R$200.000–350.000 por unidade.
Escassez de GPU afeta preços: H100 e A100 têm oferta limitada globalmente. Preços de mercado flutuam com demanda. Contratos de longo prazo geralmente travam o preço e garantem disponibilidade. GPUs de geração anterior (T4, A100) têm disponibilidade mais estável.
4. Cloud GPU sob demanda vs. GPU dedicada: comparativo de custo
A escolha entre cloud GPU sob demanda (AWS, Azure) e GPU dedicada depende principalmente do padrão de uso: quanto tempo por mês a GPU fica realmente ativa. A tabela compara os três provedores em BRL, com câmbio de referência de R$5,80/USD.
| GPU | AWS¹ (BRL/h) | Azure¹ (BRL/h) | Adentro² (BRL/h) | Adentro 720h/mês |
|---|---|---|---|---|
| RTX 4090 24GB | —³ | —³ | R$ 4–8 | R$ 2.880–5.760 |
| L40S 48GB | R$ 8,70–14,50 | R$ 9,00–15,10 | R$ 8–14 | R$ 5.760–10.080 |
| A100 80GB | R$ 11,60–20,30 | R$ 19,10–22,50 | R$ 10–18 | R$ 7.200–12.960 |
| H100 SXM 80GB | R$ 17,40–31,90 | R$ 20,30–35,50 | R$ 15–28 | R$ 10.800–20.160 |
¹ AWS/Azure on-demand us-east-1/eastus, agosto de 2026, convertidos a R$5,80/USD. Instâncias de referência: g6.xlarge (L40S-equiv.), p4d.24xlarge (A100), p5.48xlarge (H100) na AWS; NCads A100 v4 e NDmH100v5 na Azure. ² Adentro Data Center, preços on-demand em BRL, agosto de 2026. Contratos mensais dedicados têm desconto — solicite proposta. ³ RTX 4090 é GPU de workstation sem equivalente direto em cloud pública — disponível apenas na Adentro.
O que o comparativo não mostra
Preço por hora de instância cloud não captura todos os custos reais:
- Tráfego de saída (egress): AWS e Azure cobram por GB de dados saindo da região — custos invisíveis que crescem com o volume de uso da IA.
- Storage: modelos grandes (70B+) precisam de volumes de armazenamento persistente que têm cobrança separada.
- Overhead de orquestração: gerenciar instâncias spot, on-demand e reservadas exige tempo de engenharia.
- Previsibilidade de latência: instâncias cloud compartilham infra física com outros clientes — throughput pode variar durante picos de demanda.
5. Quando a GPU dedicada fica mais barata
A regra prática: se sua aplicação usa a GPU por mais de 50–60% do mês (360–430 horas), GPU dedicada tende a ser mais econômica. Se o uso é esporádico — testes, protótipos, picos sazonais — cloud sob demanda é mais flexível.
On-demand calculado à taxa média de R$6/h (dentro do range Adentro R$4–8/h). Contrato dedicado mensal tem desconto sobre o valor 720h — o break-even ocorre tipicamente entre 50–65% de utilização mensal. Não inclui egress, storage adicional ou suporte gerenciado.
Para aplicações 24×7: chatbots, APIs de inferência em produção e pipelines de RAG que rodam continuamente têm utilização próxima de 100% — GPU dedicada quase sempre é mais econômica. Além do custo, a ausência de fila de spot e a latência previsível são vantagens adicionais.
6. O que costuma estar incluído (e o que não está)
| Item | Geralmente incluso | Geralmente adicional |
|---|---|---|
| Hardware (GPU + CPU + RAM) | ✓ | — |
| Energia e refrigeração | ✓ | — |
| Conectividade (uplink) | ✓ (100 Mbps–1 Gbps) | Upgrades de banda |
| Storage base (OS + dados) | ✓ (geralmente 480 GB–2 TB NVMe) | Volumes adicionais |
| Sistema operacional | ✓ (Ubuntu LTS geralmente) | Windows Server tem custo extra |
| Drivers NVIDIA + CUDA | ✓ (na maioria) | — |
| Monitoramento de hardware | Varia por provedor | Em alguns casos |
| Backup dos dados | ✗ (raramente) | Geralmente adicional |
| Framework de inferência (vLLM, etc.) | ✗ | Gerenciado pelo cliente |
| Suporte ao modelo de IA | ✗ | Serviço gerenciado separado |
| IPs públicos adicionais | 1 IP incluso | IPs adicionais |
GPU como serviço gerenciado: alguns provedores oferecem “GPU gerenciada” — onde além do hardware, o provedor instala e mantém o framework de inferência (vLLM, Ollama), configura endpoints de API compatíveis com OpenAI e monitora o serviço. Isso agrega custo mas reduz carga operacional interna.
7. Como reduzir o custo sem perder desempenho
Escolha a GPU certa para o modelo
Pagar por uma H100 para rodar Llama 3 8B INT8 é desperdício. Use a tabela de VRAM para escolher a menor GPU que acomoda seu modelo com margem adequada de KV cache. Veja o guia completo em VRAM para IA.
Quantize o modelo
Quantização INT8 ou Q4_K_M pode reduzir os requisitos de VRAM pela metade, permitindo usar uma GPU menor (e mais barata). Para modelos de 7–13B, INT8 com degradação mínima de qualidade é uma boa opção de custo-benefício.
Contrate com prazo maior
Contratos anuais geralmente têm desconto de 15–25% em relação ao mês a mês. Se a aplicação está em produção com uso estável, contratos de 12–24 meses reduzem o custo mensal efetivo.
Compartilhe a GPU entre workloads
Se você tem múltiplas aplicações de IA com picos em momentos diferentes, é possível rodar múltiplos modelos menores na mesma GPU (com VRAM suficiente). Por exemplo: um modelo de chat em FP16 (14 GB) e um modelo de embedding (1–2 GB) convivem em uma L4 de 24 GB.
Avalie o custo total (não só o hardware)
Inclua na conta: bandwidth, storage adicional, backup, custo de engenharia para gerenciar a infraestrutura e suporte técnico. Às vezes uma GPU um nível acima, com suporte gerenciado incluso, custa menos no total do que uma GPU mais barata com alto overhead operacional.
Quer uma simulação de custo para o seu caso?
Compartilhe o modelo, o número de usuários e o contexto esperado. Nossa equipe dimensiona a GPU, calcula o custo mensal e compara com as alternativas de cloud.
8. Checklist antes de contratar uma GPU dedicada
- Modelo de IA definido: parâmetros, precisão e VRAM necessária calculados
- Número de usuários simultâneos no pico estimado (P95)
- Taxa de utilização mensal estimada (horas/mês) para justificar dedicada vs. cloud
- SLA de disponibilidade definido: 99,5% ou 99,9%? Qual o impacto de 1h de downtime?
- Suporte: business hours ou 24×7? Qual o tempo máximo aceitável de resposta?
- Política de reajuste contratual (câmbio, inflação, índice de revisão)
- Backup dos dados do modelo e das conversas: incluso ou adicional?
- Conectividade verificada: upstream para os usuários finais; latência aceitável
- Conformidade de dados: onde o dado do usuário fica fisicamente? LGPD considerada?
- Plano de saída: o que acontece ao término do contrato? Portabilidade dos dados?
- Referências do provedor: outros clientes com workload similar?
- POC (Proof of Concept) realizada com dados e carga reais antes de assinar
Conteúdos relacionados
Perguntas frequentes
{
“@context”: “https://schema.org”,
“@graph”: [
{
“@type”: “Article”,
“headline”: “Quanto custa uma GPU dedicada por mês?”,
“description”: “Saiba o que define o custo mensal de uma GPU dedicada para IA: modelo, VRAM, suporte e SLA. Compare com cloud GPU e veja quando cada opção é mais econômica.”,
“url”: “https://adentro.com.br/gpu-dedicada-preco-mensal/”,
“datePublished”: “2026-08-07”,
“dateModified”: “2026-08-07”,
“publisher”: {
“@type”: “Organization”,
“name”: “Adentro”,
“url”: “https://adentro.com.br”
},
“inLanguage”: “pt-BR”
},
{
“@type”: “BreadcrumbList”,
“itemListElement”: [
{“@type”:”ListItem”,”position”:1,”name”:”Adentro”,”item”:”https://adentro.com.br”},
{“@type”:”ListItem”,”position”:2,”name”:”Blog”,”item”:”https://adentro.com.br/blog/”},
{“@type”:”ListItem”,”position”:3,”name”:”Infraestrutura para IA”,”item”:”https://adentro.com.br/infraestrutura-para-inteligencia-artificial/”},
{“@type”:”ListItem”,”position”:4,”name”:”GPU dedicada: preço mensal”,”item”:”https://adentro.com.br/gpu-dedicada-preco-mensal/”}
]
},
{
“@type”: “FAQPage”,
“mainEntity”: [
{
“@type”: “Question”,
“name”: “Qual o custo mínimo de uma GPU dedicada para IA no Brasil?”,
“acceptedAnswer”: {
“@type”: “Answer”,
“text”: “Em provedores internacionais, GPUs entry-level (NVIDIA T4) partem de USD 400–700/mês. No Brasil, custos de câmbio, infraestrutura local e impostos impactam o valor final. Solicite uma proposta com seu cenário específico para um valor preciso.”
}
},
{
“@type”: “Question”,
“name”: “Vale a pena GPU dedicada para uma startup em fase inicial?”,
“acceptedAnswer”: {
“@type”: “Answer”,
“text”: “Em fase de desenvolvimento, cloud GPU ou CPU com modelo quantizado é mais econômico. GPU dedicada faz sentido quando o produto está em produção com utilização superior a 50% do mês.”
}
},
{
“@type”: “Question”,
“name”: “Como calcular o custo por token em uma GPU dedicada?”,
“acceptedAnswer”: {
“@type”: “Answer”,
“text”: “Custo por token = custo mensal da GPU ÷ total de tokens gerados no mês. Exemplo: GPU a USD 600/mês gerando 10 tok/s por 720h = 259M tokens → USD 0,0000023 por token.”
}
}
]
}
]
}
document.querySelectorAll(‘.faq-q’).forEach(q => {
q.addEventListener(‘click’, () => q.parentElement.classList.toggle(‘open’));
});