*, *::before, *::after { box-sizing: border-box; }
:root {
–orange: #F47721;
–text: #1A1D2E;
–text2: #4A5070;
–card: #F8F9FC;
–border: #D8DCE8;
–green: #1A7F4B;
–yellow: #8B6A00;
–red: #B91C1C;
–radius: 8px;
–font: -apple-system, BlinkMacSystemFont, “Segoe UI”, system-ui, sans-serif;
–mono: “SF Mono”, “Fira Code”, Menlo, Consolas, monospace;
}
body { font-family: var(–font); color: var(–text); line-height: 1.65; max-width: 780px; margin: 0 auto; padding: 0 20px 80px; }
h1 { font-size: 2rem; font-weight: 800; line-height: 1.2; margin: 0 0 .5rem; text-wrap: balance; }
h2 { font-size: 1.3rem; font-weight: 700; margin: 2.5rem 0 .75rem; line-height: 1.3; }
h3 { font-size: 1.05rem; font-weight: 700; margin: 1.75rem 0 .5rem; }
p { margin: 0 0 1rem; }
ul, ol { margin: 0 0 1rem; padding-left: 1.4rem; }
li { margin-bottom: .4rem; }
strong { font-weight: 700; }
code { font-family: var(–mono); font-size: .84em; background: #EEF0F8; padding: 2px 6px; border-radius: 3px; white-space: nowrap; }
pre { font-family: var(–mono); font-size: .82em; background: #1A1D2E; color: #E8ECF5; padding: 14px 16px; border-radius: var(–radius); overflow-x: auto; margin: 1rem 0; line-height: 1.6; }
a { color: var(–orange); text-decoration: none; }
a:hover { text-decoration: underline; }
.breadcrumb { font-size: .78rem; color: var(–text2); margin-bottom: 1.5rem; }
.breadcrumb a { color: var(–text2); }
.breadcrumb span { margin: 0 .4rem; }
.meta-bar { display: flex; gap: 16px; flex-wrap: wrap; font-size: .78rem; color: var(–text2); margin-bottom: 2rem; padding-bottom: 1rem; border-bottom: 1px solid var(–border); }
.meta-bar .author { font-weight: 600; color: var(–text); }
.lead { font-size: 1.1rem; color: var(–text2); line-height: 1.65; margin-bottom: 1.5rem; }
.cta-box { background: linear-gradient(135deg,#FFF3E8,#FFF8F0); border: 1px solid rgba(244,119,33,.3); border-left: 4px solid var(–orange); border-radius: var(–radius); padding: 18px 20px; margin: 2rem 0; }
.cta-box p { margin: 0 0 .5rem; font-size: .9rem; }
.cta-btn { display: inline-block; background: var(–orange); color: #fff; padding: 10px 20px; border-radius: 6px; font-weight: 700; font-size: .88rem; text-decoration: none; margin-top: 10px; }
.cta-btn:hover { background: #D96A1E; text-decoration: none; }
.toc { background: var(–card); border: 1px solid var(–border); border-radius: var(–radius); padding: 18px 22px; margin: 2rem 0; }
.toc h2 { margin: 0 0 .75rem; font-size: 1rem; }
.toc ol { margin: 0; padding-left: 1.2rem; }
.toc li { margin-bottom: .3rem; font-size: .88rem; }
.toc a { color: var(–text2); }
.tbl-wrap { overflow-x: auto; margin: 1.5rem 0; border-radius: var(–radius); border: 1px solid var(–border); }
table { width: 100%; border-collapse: collapse; font-size: .85rem; }
th { background: #EEF0F8; padding: 9px 12px; text-align: left; font-weight: 700; font-size: .78rem; text-transform: uppercase; letter-spacing: .04em; color: var(–text2); border-bottom: 1px solid var(–border); white-space: nowrap; }
td { padding: 9px 12px; border-bottom: 1px solid var(–border); vertical-align: top; }
tbody tr:last-child td { border-bottom: none; }
tbody tr:nth-child(even) td { background: #FAFBFE; }
td.num { font-variant-numeric: tabular-nums; text-align: right; font-family: var(–mono); font-size: .82rem; }
.ok { color: var(–green); font-weight: 700; }
.warn { color: var(–yellow); font-weight: 700; }
.crit { color: var(–red); font-weight: 700; }
.note { padding: 13px 16px; border-radius: var(–radius); margin: 1.5rem 0; display: flex; gap: 10px; align-items: flex-start; font-size: .88rem; line-height: 1.55; }
.note-warn { background: #FFFBEB; border-left: 4px solid #D97706; }
.note-info { background: #EFF6FF; border-left: 4px solid #3B82F6; }
.note-tech { background: #F0FDF4; border-left: 4px solid #16A34A; }
.note span:first-child { font-size: 1.1rem; flex-shrink: 0; }
.note p { margin: 0; }
/* Metric severity grid */
.metric-grid { display: grid; grid-template-columns: repeat(auto-fit, minmax(200px, 1fr)); gap: 12px; margin: 1.5rem 0; }
.metric-card { background: var(–card); border: 1px solid var(–border); border-radius: var(–radius); padding: 14px 16px; }
.metric-name { font-weight: 700; font-size: .88rem; margin-bottom: 6px; }
.metric-thr { display: flex; flex-direction: column; gap: 4px; }
.metric-row { display: flex; justify-content: space-between; font-size: .78rem; padding: 3px 6px; border-radius: 3px; }
.metric-row.ok { background: rgba(26,127,75,.08); }
.metric-row.warn { background: rgba(139,106,0,.08); }
.metric-row.crit { background: rgba(185,28,28,.08); }
.stack-diagram { background: var(–card); border: 1px solid var(–border); border-radius: var(–radius); padding: 16px 18px; margin: 1.5rem 0; }
.stack-diagram .title { font-weight: 700; font-size: .88rem; margin-bottom: 12px; }
.stack-layer { display: flex; align-items: center; gap: 10px; padding: 8px 12px; border-radius: 6px; margin-bottom: 6px; font-size: .82rem; }
.stack-layer:last-child { margin-bottom: 0; }
.stack-layer .icon { font-size: 1rem; flex-shrink: 0; width: 24px; text-align: center; }
.stack-layer .label { font-weight: 600; min-width: 120px; }
.stack-layer .desc { color: var(–text2); }
.sl-1 { background: rgba(244,119,33,.08); }
.sl-2 { background: rgba(29,78,216,.07); }
.sl-3 { background: rgba(26,127,75,.07); }
.sl-4 { background: rgba(139,106,0,.07); }
.checklist { list-style: none; padding: 0; }
.checklist li { padding: .4rem 0 .4rem 1.8rem; position: relative; border-bottom: 1px solid var(–border); font-size: .9rem; }
.checklist li::before { content: “✓”; position: absolute; left: 0; color: var(–green); font-weight: 700; }
.checklist li:last-child { border-bottom: none; }
.faq { margin: 1.5rem 0; }
.faq-item { border-bottom: 1px solid var(–border); }
.faq-q { font-weight: 700; font-size: .95rem; padding: 14px 0 10px; cursor: pointer; display: flex; justify-content: space-between; align-items: center; }
.faq-q::after { content: “+”; font-size: 1.2rem; color: var(–orange); flex-shrink: 0; }
.faq-item.open .faq-q::after { content: “−”; }
.faq-a { display: none; font-size: .88rem; color: var(–text2); padding-bottom: 14px; line-height: 1.6; }
.faq-item.open .faq-a { display: block; }
.divider { border: none; border-top: 1px solid var(–border); margin: 2rem 0; }
.source { font-size: .72rem; color: var(–text2); margin-top: -.5rem; margin-bottom: 1rem; }
.related-grid { display: grid; grid-template-columns: 1fr 1fr; gap: 12px; margin: 1.5rem 0; }
.related-card { border: 1px solid var(–border); border-radius: var(–radius); padding: 12px 14px; }
.related-card a { font-weight: 600; font-size: .9rem; color: var(–text); display: block; margin-bottom: 4px; }
.related-card span { font-size: .78rem; color: var(–text2); }
@media (max-width:600px) { h1{font-size:1.5rem;} .related-grid,.metric-grid{grid-template-columns:1fr;} }
@media (prefers-color-scheme: dark) {
:root:not([data-theme=”light”]) { –text:#E8ECF5; –text2:#9AA0BC; –card:#1C2030; –border:#2A2F45; }
body { background:#0F1117; }
code { background:#22273A; color:#E8ECF5; }
th { background:#1C2030; }
tbody tr:nth-child(even) td { background:rgba(255,255,255,.02); }
.toc,.metric-card,.related-card,.stack-diagram { background:#1C2030; }
.note-warn{background:#2D2000;} .note-info{background:#0A1628;} .note-tech{background:#0A1F12;}
.cta-box{background:linear-gradient(135deg,#2D1A08,#3D2410);}
}
[data-theme=”light”] body{background:#fff;}
[data-theme=”dark”] body{background:#0F1117;}
Como monitorar GPU em produção para aplicações de IA
Revisão técnica: [Revisor]·
Publicado em agosto de 2026·
⏱ 12 min de leitura
Uma GPU com throughput caindo silenciosamente, VRAM crescendo até o limite ou temperatura em throttling pode derrubar um serviço de IA sem nenhum alerta. Este guia cobre as métricas essenciais, as ferramentas certas — de nvidia-smi ao stack Prometheus + Grafana — e os thresholds de alerta que separam uma operação reativa de uma operação confiável.
Infraestrutura de GPU sem monitoramento é infraestrutura de risco.
A Adentro entrega GPU dedicada com monitoramento incluído — DCGM, alertas e dashboard disponíveis desde o primeiro dia.
1. Por que monitorar GPU diferente de CPU/RAM
Ferramentas padrão de monitoramento de servidor (Zabbix, Datadog host agent, Nagios) não coletam métricas de GPU. Uma GPU pode estar em throttling térmico — entregando metade do throughput nominal — enquanto o servidor aparece “verde” em todas as métricas de CPU e rede.
Três características da GPU tornam o monitoramento específico necessário:
- Memória não paginável: ao contrário da RAM, VRAM não tem swap. Quando a aplicação tenta alocar mais do que o disponível, o processo termina com OOM (Out of Memory) — sem degradação gradual, sem aviso prévio.
- Throttling térmico silencioso: GPUs reduzem o clock automaticamente quando a temperatura ultrapassa o limite. O throughput cai sem nenhum erro — só os tokens por segundo diminuem.
- Gargalo de largura de banda de memória: em inferência de LLMs, o gargalo raramente é computação (TFLOPS) — é a largura de banda de memória. Uma GPU ocupada em termos de utilização pode ter throughput real baixo se a largura de banda de memória estiver saturada.
2. As 8 métricas essenciais de GPU para IA
3. Thresholds por modelo de GPU NVIDIA
| GPU | VRAM total | Temp. throttling | TDP | VRAM alerta (85%) | VRAM crítico (95%) |
|---|---|---|---|---|---|
| RTX 4090 | 24 GB | 83°C | 450 W | 20,4 GB | 22,8 GB |
| L40S | 48 GB | 88°C | 350 W | 40,8 GB | 45,6 GB |
| A100 80GB | 80 GB | 80°C | 400 W | 68 GB | 76 GB |
| H100 SXM | 80 GB | 83°C | 700 W | 68 GB | 76 GB |
Temperaturas de throttling: NVIDIA GPU specifications (developer.nvidia.com). TDP: especificações oficiais NVIDIA, agosto de 2026. Thresholds de VRAM são recomendações operacionais — não limites técnicos.
4. nvidia-smi: comandos essenciais
O nvidia-smi é instalado com os drivers NVIDIA e é o ponto de partida para qualquer diagnóstico de GPU. Funciona em todos os sistemas com driver NVIDIA instalado, sem dependências adicionais.
Visão geral instantânea
nvidia-smi
Monitoramento contínuo (atualiza a cada 1 segundo)
nvidia-smi dmon -s pucvmet -d 1
Flags: p=power, u=utilization, c=pcie, v=vram, m=memory bandwidth, e=ecc, t=temperature.
Saída em formato CSV para logging
nvidia-smi --query-gpu=timestamp,name,temperature.gpu,utilization.gpu, utilization.memory,memory.used,memory.free,power.draw --format=csv,noheader,nounits -l 5 >> /var/log/gpu-metrics.csv
Verificar throttling ativo
nvidia-smi -q -d CLOCK | grep -A5 "Clocks Throttle Reasons"
Saída Active: Yes em qualquer razão indica throttling. As causas mais comuns em produção são HW Thermal Slowdown (temperatura) e HW Power Brake Slowdown (consumo).
nvidia-smi não é suficiente para produção: o comando lê métricas por polling — intervalos curtos sobrecarregam o driver; intervalos longos perdem picos. Para produção, use DCGM (seção 5) que exporta métricas com resolução de 1s sem overhead.
5. NVIDIA DCGM: métricas para produção
O NVIDIA Data Center GPU Manager (DCGM) é a ferramenta oficial para monitoramento de GPUs em datacenter. Ele exporta métricas via endpoint Prometheus (/metrics) sem o overhead de polling do nvidia-smi.
Instalação (Ubuntu/Debian)
curl -fsSL https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/cuda-keyring_1.1-1_all.deb -O dpkg -i cuda-keyring_1.1-1_all.deb apt-get update && apt-get install -y datacenter-gpu-manager systemctl enable nvidia-dcgm && systemctl start nvidia-dcgm
Exportador Prometheus
# dcgm-exporter — exporter oficial NVIDIA docker run -d --gpus all --rm -p 9400:9400 nvcr.io/nvidia/k8s/dcgm-exporter:latest
Métricas DCGM mais relevantes para IA
| Métrica DCGM | O que mede | Unidade |
|---|---|---|
DCGM_FI_DEV_GPU_UTIL |
Utilização da GPU | % |
DCGM_FI_DEV_MEM_COPY_UTIL |
Utilização da memória (largura de banda) | % |
DCGM_FI_DEV_FB_USED |
VRAM usada | MiB |
DCGM_FI_DEV_FB_FREE |
VRAM livre | MiB |
DCGM_FI_DEV_GPU_TEMP |
Temperatura da GPU | °C |
DCGM_FI_DEV_POWER_USAGE |
Consumo atual de energia | W |
DCGM_FI_DEV_SM_CLOCK |
Clock dos Streaming Multiprocessors | MHz |
DCGM_FI_DEV_MEM_CLOCK |
Clock de memória | MHz |
DCGM_FI_DEV_TOTAL_ENERGY_CONSUMPTION |
Energia total consumida | mJ |
DCGM_FI_DEV_ECC_SBE_VOL_TOTAL |
Erros ECC single-bit (corrigíveis) | contagem |
DCGM_FI_DEV_ECC_DBE_VOL_TOTAL |
Erros ECC double-bit (não corrigíveis) | contagem |
Fonte: NVIDIA DCGM Documentation (docs.nvidia.com/datacenter/dcgm/), agosto de 2026.
Erros ECC em produção: erros ECC single-bit (SBE) são normais e corrigíveis automaticamente. Erros ECC double-bit (DBE) indicam falha de hardware — o processo que estava usando a memória afetada pode corromper dados silenciosamente. Um DBE deve acionar alerta imediato e investigação de hardware.
6. Stack Prometheus + Grafana para GPU
Configuração mínima do Prometheus (prometheus.yml)
scrape_configs:
- job_name: 'dcgm'
static_configs:
- targets: ['localhost:9400']
scrape_interval: 15s
- job_name: 'vllm' # métricas do framework de inferência
static_configs:
- targets: ['localhost:8000']
metrics_path: '/metrics'
scrape_interval: 10s
Dashboard Grafana recomendado
O dashboard oficial NVIDIA DCGM está disponível no Grafana Labs com ID 12239. Importe diretamente em Dashboards → Import → ID 12239. Ele inclui painéis para utilização, VRAM, temperatura, clock e energia de todas as GPUs detectadas.
7. Alertas: o que notificar e quando
Alertas em excesso causam fadiga — equipes param de responder. Organize por severidade:
| Métrica | Threshold | Severidade | Ação recomendada |
|---|---|---|---|
| VRAM usada | >90% por >5min | Warning | Investigar crescimento de KV cache; verificar memory leaks |
| VRAM usada | >97% | Critical | Risco de OOM iminente — reiniciar serviço ou reduzir carga |
| Temperatura GPU | >80°C por >10min | Warning | Verificar refrigeração; reduzir carga se necessário |
| Temperatura GPU | >85°C | Critical | Throttling ativo — escalar para outra instância |
| Throughput (tok/s) | Queda >30% vs baseline por >3min | Warning | Investigar throttling, carga, ou problema no framework |
| Fila de requisições | >20 por >2min | Warning | Escalar ou ativar rejeição com erro 429 |
| ECC double-bit error | Qualquer ocorrência | Critical | Falha de hardware confirmada — isolar GPU imediatamente |
| GPU utilization | <5% por >15min (horário de pico) | Warning | Possível travamento do processo de inferência |
Exemplo de regra Prometheus (alerting rule)
groups:
- name: gpu_alerts
rules:
- alert: GPUVRAMCritical
expr: |
(DCGM_FI_DEV_FB_USED / (DCGM_FI_DEV_FB_USED + DCGM_FI_DEV_FB_FREE)) > 0.97
for: 1m
labels:
severity: critical
annotations:
summary: "GPU {{ $labels.gpu }} VRAM acima de 97%"
description: "VRAM em {{ $value | humanizePercentage }} — risco de OOM"
- alert: GPUTemperatureWarning
expr: DCGM_FI_DEV_GPU_TEMP > 80
for: 10m
labels:
severity: warning
annotations:
summary: "GPU {{ $labels.gpu }} temperatura elevada"
description: "Temperatura: {{ $value }}°C por mais de 10 minutos"
8. Métricas de aplicação: vLLM e frameworks
Além das métricas de hardware, frameworks de inferência como vLLM expõem métricas específicas da aplicação que complementam o monitoramento de GPU.
Métricas nativas do vLLM
O vLLM expõe um endpoint Prometheus em /metrics (porta 8000 por padrão). As métricas mais relevantes:
| Métrica vLLM | O que mede |
|---|---|
vllm:num_requests_running |
Requisições em processamento simultâneo na GPU |
vllm:num_requests_waiting |
Requisições na fila aguardando GPU |
vllm:gpu_cache_usage_perc |
% do KV cache usado (VRAM alocada para contextos ativos) |
vllm:prompt_tokens_total |
Total de tokens de prompt processados |
vllm:generation_tokens_total |
Total de tokens gerados |
vllm:time_to_first_token_seconds |
Histograma de TTFT |
vllm:time_per_output_token_seconds |
Tempo por token gerado (inverse de tok/s) |
vllm:request_success_total |
Total de requisições concluídas com sucesso |
Fonte: documentação oficial vLLM (docs.vllm.ai/en/latest/serving/metrics.html), agosto de 2026.
KV cache usage como proxy de carga real: vllm:gpu_cache_usage_perc é uma das métricas mais úteis para entender a carga real de inferência. Quando ultrapassa 90%, o vLLM começa a preemptar requisições — o que aumenta latência. Monitore junto com VRAM total para entender se o gargalo é o modelo ou os contextos ativos.
9. Checklist de observabilidade para GPU em produção
- Driver NVIDIA instalado e
nvidia-smifuncionando - DCGM instalado e exportando métricas em :9400/metrics
- Prometheus configurado com scrape do DCGM e do framework (vLLM/Ollama)
- Grafana com dashboard GPU Overview importado (ID 12239)
- Dashboard de aplicação: TTFT, tokens/s, fila, KV cache usage
- Alerta de VRAM crítico (>95%) configurado com routing de oncall
- Alerta de temperatura (>80°C por 10min) configurado
- Alerta de ECC double-bit error configurado como P0
- Alerta de throughput (>30% queda vs baseline) configurado
- Baseline de throughput documentada (tokens/s em carga normal)
- Retenção de métricas definida (mínimo 30 dias para análise de tendência)
- Runbook documentado: o que fazer em cada alerta crítico
- Teste mensal de alertas: simular condição e verificar notificação
Conteúdos relacionados
Perguntas frequentes
nvidia-smi -q -d CLOCK | grep -A5 "Clocks Throttle Reasons". Se aparecer HW Thermal Slowdown: Active: Yes, a GPU está reduzindo o clock por temperatura. Verifique também a métrica DCGM_FI_DEV_SM_CLOCK — uma queda significativa do clock base confirma throttling. A temperatura acima de 80–83°C (dependendo do modelo) é o gatilho mais comum.scrape_interval: 5s especificamente para o job DCGM. Frequências abaixo de 5s não são recomendadas — o overhead de scrape começa a competir com a GPU.{
“@context”: “https://schema.org”,
“@graph”: [
{
“@type”: “Article”,
“headline”: “Como monitorar GPU em produção para aplicações de IA”,
“description”: “Métricas essenciais, thresholds, nvidia-smi, DCGM, Prometheus e Grafana para monitoramento de GPU em produção com aplicações de IA.”,
“url”: “https://adentro.com.br/monitoramento-gpu/”,
“datePublished”: “2026-08-09”,
“dateModified”: “2026-08-09”,
“publisher”: { “@type”: “Organization”, “name”: “Adentro”, “url”: “https://adentro.com.br” },
“inLanguage”: “pt-BR”
},
{
“@type”: “BreadcrumbList”,
“itemListElement”: [
{“@type”:”ListItem”,”position”:1,”name”:”Adentro”,”item”:”https://adentro.com.br”},
{“@type”:”ListItem”,”position”:2,”name”:”Blog”,”item”:”https://adentro.com.br/blog/”},
{“@type”:”ListItem”,”position”:3,”name”:”Infraestrutura para IA”,”item”:”https://adentro.com.br/infraestrutura-para-inteligencia-artificial/”},
{“@type”:”ListItem”,”position”:4,”name”:”Monitoramento de GPU”,”item”:”https://adentro.com.br/monitoramento-gpu/”}
]
},
{
“@type”: “FAQPage”,
“mainEntity”: [
{
“@type”: “Question”,
“name”: “Como saber se minha GPU está em throttling térmico?”,
“acceptedAnswer”: { “@type”: “Answer”, “text”: “Execute nvidia-smi -q -d CLOCK | grep -A5 ‘Clocks Throttle Reasons’. Se aparecer ‘HW Thermal Slowdown: Active: Yes’, a GPU está reduzindo o clock por temperatura.” }
},
{
“@type”: “Question”,
“name”: “O que é um erro ECC e quando se preocupar?”,
“acceptedAnswer”: { “@type”: “Answer”, “text”: “Single-bit errors (SBE) são corrigidos automaticamente e são normais. Double-bit errors (DBE) indicam falha física — a GPU deve ser isolada imediatamente para diagnóstico.” }
},
{
“@type”: “Question”,
“name”: “A Adentro oferece monitoramento junto com GPU dedicada?”,
“acceptedAnswer”: { “@type”: “Answer”, “text”: “Sim. Infraestruturas GPU da Adentro incluem monitoramento DCGM, temperatura, consumo e alertas. Dashboard Grafana disponível desde o primeiro dia.” }
}
]
}
]
}
document.querySelectorAll(‘.faq-q’).forEach(q => q.addEventListener(‘click’, () => q.parentElement.classList.toggle(‘open’)));