Como monitorar GPU em produção para aplicações de IA

Monitoramento de GPU para IA: métricas, ferramentas e alertas [2026]

*, *::before, *::after { box-sizing: border-box; }
:root {
–orange: #F47721;
–text: #1A1D2E;
–text2: #4A5070;
–card: #F8F9FC;
–border: #D8DCE8;
–green: #1A7F4B;
–yellow: #8B6A00;
–red: #B91C1C;
–radius: 8px;
–font: -apple-system, BlinkMacSystemFont, “Segoe UI”, system-ui, sans-serif;
–mono: “SF Mono”, “Fira Code”, Menlo, Consolas, monospace;
}
body { font-family: var(–font); color: var(–text); line-height: 1.65; max-width: 780px; margin: 0 auto; padding: 0 20px 80px; }
h1 { font-size: 2rem; font-weight: 800; line-height: 1.2; margin: 0 0 .5rem; text-wrap: balance; }
h2 { font-size: 1.3rem; font-weight: 700; margin: 2.5rem 0 .75rem; line-height: 1.3; }
h3 { font-size: 1.05rem; font-weight: 700; margin: 1.75rem 0 .5rem; }
p { margin: 0 0 1rem; }
ul, ol { margin: 0 0 1rem; padding-left: 1.4rem; }
li { margin-bottom: .4rem; }
strong { font-weight: 700; }
code { font-family: var(–mono); font-size: .84em; background: #EEF0F8; padding: 2px 6px; border-radius: 3px; white-space: nowrap; }
pre { font-family: var(–mono); font-size: .82em; background: #1A1D2E; color: #E8ECF5; padding: 14px 16px; border-radius: var(–radius); overflow-x: auto; margin: 1rem 0; line-height: 1.6; }
a { color: var(–orange); text-decoration: none; }
a:hover { text-decoration: underline; }
.breadcrumb { font-size: .78rem; color: var(–text2); margin-bottom: 1.5rem; }
.breadcrumb a { color: var(–text2); }
.breadcrumb span { margin: 0 .4rem; }
.meta-bar { display: flex; gap: 16px; flex-wrap: wrap; font-size: .78rem; color: var(–text2); margin-bottom: 2rem; padding-bottom: 1rem; border-bottom: 1px solid var(–border); }
.meta-bar .author { font-weight: 600; color: var(–text); }
.lead { font-size: 1.1rem; color: var(–text2); line-height: 1.65; margin-bottom: 1.5rem; }
.cta-box { background: linear-gradient(135deg,#FFF3E8,#FFF8F0); border: 1px solid rgba(244,119,33,.3); border-left: 4px solid var(–orange); border-radius: var(–radius); padding: 18px 20px; margin: 2rem 0; }
.cta-box p { margin: 0 0 .5rem; font-size: .9rem; }
.cta-btn { display: inline-block; background: var(–orange); color: #fff; padding: 10px 20px; border-radius: 6px; font-weight: 700; font-size: .88rem; text-decoration: none; margin-top: 10px; }
.cta-btn:hover { background: #D96A1E; text-decoration: none; }
.toc { background: var(–card); border: 1px solid var(–border); border-radius: var(–radius); padding: 18px 22px; margin: 2rem 0; }
.toc h2 { margin: 0 0 .75rem; font-size: 1rem; }
.toc ol { margin: 0; padding-left: 1.2rem; }
.toc li { margin-bottom: .3rem; font-size: .88rem; }
.toc a { color: var(–text2); }
.tbl-wrap { overflow-x: auto; margin: 1.5rem 0; border-radius: var(–radius); border: 1px solid var(–border); }
table { width: 100%; border-collapse: collapse; font-size: .85rem; }
th { background: #EEF0F8; padding: 9px 12px; text-align: left; font-weight: 700; font-size: .78rem; text-transform: uppercase; letter-spacing: .04em; color: var(–text2); border-bottom: 1px solid var(–border); white-space: nowrap; }
td { padding: 9px 12px; border-bottom: 1px solid var(–border); vertical-align: top; }
tbody tr:last-child td { border-bottom: none; }
tbody tr:nth-child(even) td { background: #FAFBFE; }
td.num { font-variant-numeric: tabular-nums; text-align: right; font-family: var(–mono); font-size: .82rem; }
.ok { color: var(–green); font-weight: 700; }
.warn { color: var(–yellow); font-weight: 700; }
.crit { color: var(–red); font-weight: 700; }
.note { padding: 13px 16px; border-radius: var(–radius); margin: 1.5rem 0; display: flex; gap: 10px; align-items: flex-start; font-size: .88rem; line-height: 1.55; }
.note-warn { background: #FFFBEB; border-left: 4px solid #D97706; }
.note-info { background: #EFF6FF; border-left: 4px solid #3B82F6; }
.note-tech { background: #F0FDF4; border-left: 4px solid #16A34A; }
.note span:first-child { font-size: 1.1rem; flex-shrink: 0; }
.note p { margin: 0; }
/* Metric severity grid */
.metric-grid { display: grid; grid-template-columns: repeat(auto-fit, minmax(200px, 1fr)); gap: 12px; margin: 1.5rem 0; }
.metric-card { background: var(–card); border: 1px solid var(–border); border-radius: var(–radius); padding: 14px 16px; }
.metric-name { font-weight: 700; font-size: .88rem; margin-bottom: 6px; }
.metric-thr { display: flex; flex-direction: column; gap: 4px; }
.metric-row { display: flex; justify-content: space-between; font-size: .78rem; padding: 3px 6px; border-radius: 3px; }
.metric-row.ok { background: rgba(26,127,75,.08); }
.metric-row.warn { background: rgba(139,106,0,.08); }
.metric-row.crit { background: rgba(185,28,28,.08); }
.stack-diagram { background: var(–card); border: 1px solid var(–border); border-radius: var(–radius); padding: 16px 18px; margin: 1.5rem 0; }
.stack-diagram .title { font-weight: 700; font-size: .88rem; margin-bottom: 12px; }
.stack-layer { display: flex; align-items: center; gap: 10px; padding: 8px 12px; border-radius: 6px; margin-bottom: 6px; font-size: .82rem; }
.stack-layer:last-child { margin-bottom: 0; }
.stack-layer .icon { font-size: 1rem; flex-shrink: 0; width: 24px; text-align: center; }
.stack-layer .label { font-weight: 600; min-width: 120px; }
.stack-layer .desc { color: var(–text2); }
.sl-1 { background: rgba(244,119,33,.08); }
.sl-2 { background: rgba(29,78,216,.07); }
.sl-3 { background: rgba(26,127,75,.07); }
.sl-4 { background: rgba(139,106,0,.07); }
.checklist { list-style: none; padding: 0; }
.checklist li { padding: .4rem 0 .4rem 1.8rem; position: relative; border-bottom: 1px solid var(–border); font-size: .9rem; }
.checklist li::before { content: “✓”; position: absolute; left: 0; color: var(–green); font-weight: 700; }
.checklist li:last-child { border-bottom: none; }
.faq { margin: 1.5rem 0; }
.faq-item { border-bottom: 1px solid var(–border); }
.faq-q { font-weight: 700; font-size: .95rem; padding: 14px 0 10px; cursor: pointer; display: flex; justify-content: space-between; align-items: center; }
.faq-q::after { content: “+”; font-size: 1.2rem; color: var(–orange); flex-shrink: 0; }
.faq-item.open .faq-q::after { content: “−”; }
.faq-a { display: none; font-size: .88rem; color: var(–text2); padding-bottom: 14px; line-height: 1.6; }
.faq-item.open .faq-a { display: block; }
.divider { border: none; border-top: 1px solid var(–border); margin: 2rem 0; }
.source { font-size: .72rem; color: var(–text2); margin-top: -.5rem; margin-bottom: 1rem; }
.related-grid { display: grid; grid-template-columns: 1fr 1fr; gap: 12px; margin: 1.5rem 0; }
.related-card { border: 1px solid var(–border); border-radius: var(–radius); padding: 12px 14px; }
.related-card a { font-weight: 600; font-size: .9rem; color: var(–text); display: block; margin-bottom: 4px; }
.related-card span { font-size: .78rem; color: var(–text2); }
@media (max-width:600px) { h1{font-size:1.5rem;} .related-grid,.metric-grid{grid-template-columns:1fr;} }
@media (prefers-color-scheme: dark) {
:root:not([data-theme=”light”]) { –text:#E8ECF5; –text2:#9AA0BC; –card:#1C2030; –border:#2A2F45; }
body { background:#0F1117; }
code { background:#22273A; color:#E8ECF5; }
th { background:#1C2030; }
tbody tr:nth-child(even) td { background:rgba(255,255,255,.02); }
.toc,.metric-card,.related-card,.stack-diagram { background:#1C2030; }
.note-warn{background:#2D2000;} .note-info{background:#0A1628;} .note-tech{background:#0A1F12;}
.cta-box{background:linear-gradient(135deg,#2D1A08,#3D2410);}
}
[data-theme=”light”] body{background:#fff;}
[data-theme=”dark”] body{background:#0F1117;}

Como monitorar GPU em produção para aplicações de IA

Por [Autor]·
Revisão técnica: [Revisor]·
Publicado em agosto de 2026·
⏱ 12 min de leitura

Uma GPU com throughput caindo silenciosamente, VRAM crescendo até o limite ou temperatura em throttling pode derrubar um serviço de IA sem nenhum alerta. Este guia cobre as métricas essenciais, as ferramentas certas — de nvidia-smi ao stack Prometheus + Grafana — e os thresholds de alerta que separam uma operação reativa de uma operação confiável.

Infraestrutura de GPU sem monitoramento é infraestrutura de risco.

A Adentro entrega GPU dedicada com monitoramento incluído — DCGM, alertas e dashboard disponíveis desde o primeiro dia.

Conhecer GPU dedicada Adentro


1. Por que monitorar GPU diferente de CPU/RAM

Ferramentas padrão de monitoramento de servidor (Zabbix, Datadog host agent, Nagios) não coletam métricas de GPU. Uma GPU pode estar em throttling térmico — entregando metade do throughput nominal — enquanto o servidor aparece “verde” em todas as métricas de CPU e rede.

Três características da GPU tornam o monitoramento específico necessário:

  • Memória não paginável: ao contrário da RAM, VRAM não tem swap. Quando a aplicação tenta alocar mais do que o disponível, o processo termina com OOM (Out of Memory) — sem degradação gradual, sem aviso prévio.
  • Throttling térmico silencioso: GPUs reduzem o clock automaticamente quando a temperatura ultrapassa o limite. O throughput cai sem nenhum erro — só os tokens por segundo diminuem.
  • Gargalo de largura de banda de memória: em inferência de LLMs, o gargalo raramente é computação (TFLOPS) — é a largura de banda de memória. Uma GPU ocupada em termos de utilização pode ter throughput real baixo se a largura de banda de memória estiver saturada.

2. As 8 métricas essenciais de GPU para IA

🔴 Utilização de GPU (%)
Normal60–90%
Atenção>95% contínuo
Crítico100% + fila crescendo

💾 VRAM usada (GB)
Normal<85% da total
Atenção85–95%
Crítico>95% (risco OOM)

🌡️ Temperatura (°C)
Normal<75°C
Atenção75–83°C
Crítico>83°C (throttling)

⚡ Consumo de energia (W)
Normal<TDP declarado
AtençãoPróximo ao TDP
CríticoPower throttling ativo

🚀 Tokens/s (throughput)
NormalDentro do SLA
AtençãoQueda >20% da baseline
CríticoQueda >50% da baseline

⏱ TTFT — Time to First Token
Normal<500ms
Atenção500ms–2s
Crítico>2s (fila saturada)

📊 Tamanho da fila
Normal0–5 requisições
Atenção5–20
Crítico>20 (escalar ou rejeitar)

🔧 Clock de memória (MHz)
NormalClock base da GPU
AtençãoQueda >10%
CríticoQueda >30% (throttling)

3. Thresholds por modelo de GPU NVIDIA

GPU VRAM total Temp. throttling TDP VRAM alerta (85%) VRAM crítico (95%)
RTX 4090 24 GB 83°C 450 W 20,4 GB 22,8 GB
L40S 48 GB 88°C 350 W 40,8 GB 45,6 GB
A100 80GB 80 GB 80°C 400 W 68 GB 76 GB
H100 SXM 80 GB 83°C 700 W 68 GB 76 GB

Temperaturas de throttling: NVIDIA GPU specifications (developer.nvidia.com). TDP: especificações oficiais NVIDIA, agosto de 2026. Thresholds de VRAM são recomendações operacionais — não limites técnicos.

4. nvidia-smi: comandos essenciais

O nvidia-smi é instalado com os drivers NVIDIA e é o ponto de partida para qualquer diagnóstico de GPU. Funciona em todos os sistemas com driver NVIDIA instalado, sem dependências adicionais.

Visão geral instantânea

nvidia-smi

Monitoramento contínuo (atualiza a cada 1 segundo)

nvidia-smi dmon -s pucvmet -d 1

Flags: p=power, u=utilization, c=pcie, v=vram, m=memory bandwidth, e=ecc, t=temperature.

Saída em formato CSV para logging

nvidia-smi --query-gpu=timestamp,name,temperature.gpu,utilization.gpu,
utilization.memory,memory.used,memory.free,power.draw 
--format=csv,noheader,nounits -l 5 >> /var/log/gpu-metrics.csv

Verificar throttling ativo

nvidia-smi -q -d CLOCK | grep -A5 "Clocks Throttle Reasons"

Saída Active: Yes em qualquer razão indica throttling. As causas mais comuns em produção são HW Thermal Slowdown (temperatura) e HW Power Brake Slowdown (consumo).

⚠️

nvidia-smi não é suficiente para produção: o comando lê métricas por polling — intervalos curtos sobrecarregam o driver; intervalos longos perdem picos. Para produção, use DCGM (seção 5) que exporta métricas com resolução de 1s sem overhead.

5. NVIDIA DCGM: métricas para produção

O NVIDIA Data Center GPU Manager (DCGM) é a ferramenta oficial para monitoramento de GPUs em datacenter. Ele exporta métricas via endpoint Prometheus (/metrics) sem o overhead de polling do nvidia-smi.

Instalação (Ubuntu/Debian)

curl -fsSL https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/cuda-keyring_1.1-1_all.deb -O
dpkg -i cuda-keyring_1.1-1_all.deb
apt-get update && apt-get install -y datacenter-gpu-manager
systemctl enable nvidia-dcgm && systemctl start nvidia-dcgm

Exportador Prometheus

# dcgm-exporter — exporter oficial NVIDIA
docker run -d --gpus all --rm 
  -p 9400:9400 
  nvcr.io/nvidia/k8s/dcgm-exporter:latest

Métricas DCGM mais relevantes para IA

Métrica DCGM O que mede Unidade
DCGM_FI_DEV_GPU_UTIL Utilização da GPU %
DCGM_FI_DEV_MEM_COPY_UTIL Utilização da memória (largura de banda) %
DCGM_FI_DEV_FB_USED VRAM usada MiB
DCGM_FI_DEV_FB_FREE VRAM livre MiB
DCGM_FI_DEV_GPU_TEMP Temperatura da GPU °C
DCGM_FI_DEV_POWER_USAGE Consumo atual de energia W
DCGM_FI_DEV_SM_CLOCK Clock dos Streaming Multiprocessors MHz
DCGM_FI_DEV_MEM_CLOCK Clock de memória MHz
DCGM_FI_DEV_TOTAL_ENERGY_CONSUMPTION Energia total consumida mJ
DCGM_FI_DEV_ECC_SBE_VOL_TOTAL Erros ECC single-bit (corrigíveis) contagem
DCGM_FI_DEV_ECC_DBE_VOL_TOTAL Erros ECC double-bit (não corrigíveis) contagem

Fonte: NVIDIA DCGM Documentation (docs.nvidia.com/datacenter/dcgm/), agosto de 2026.

ℹ️

Erros ECC em produção: erros ECC single-bit (SBE) são normais e corrigíveis automaticamente. Erros ECC double-bit (DBE) indicam falha de hardware — o processo que estava usando a memória afetada pode corromper dados silenciosamente. Um DBE deve acionar alerta imediato e investigação de hardware.

6. Stack Prometheus + Grafana para GPU

Arquitetura de monitoramento recomendada
🖥️
GPU + DCGM Exporter
Coleta métricas em :9400/metrics a cada 1s sem overhead

📦
Prometheus
Scrape a cada 15s, retenção 15 dias, alerting rules

📊
Grafana
Dashboards: GPU Overview + LLM Throughput + Alertas

🔔
Alertmanager
Roteamento: Slack / PagerDuty / e-mail por severidade

Configuração mínima do Prometheus (prometheus.yml)

scrape_configs:
  - job_name: 'dcgm'
    static_configs:
      - targets: ['localhost:9400']
    scrape_interval: 15s

  - job_name: 'vllm'          # métricas do framework de inferência
    static_configs:
      - targets: ['localhost:8000']
    metrics_path: '/metrics'
    scrape_interval: 10s

Dashboard Grafana recomendado

O dashboard oficial NVIDIA DCGM está disponível no Grafana Labs com ID 12239. Importe diretamente em Dashboards → Import → ID 12239. Ele inclui painéis para utilização, VRAM, temperatura, clock e energia de todas as GPUs detectadas.

7. Alertas: o que notificar e quando

Alertas em excesso causam fadiga — equipes param de responder. Organize por severidade:

Métrica Threshold Severidade Ação recomendada
VRAM usada >90% por >5min Warning Investigar crescimento de KV cache; verificar memory leaks
VRAM usada >97% Critical Risco de OOM iminente — reiniciar serviço ou reduzir carga
Temperatura GPU >80°C por >10min Warning Verificar refrigeração; reduzir carga se necessário
Temperatura GPU >85°C Critical Throttling ativo — escalar para outra instância
Throughput (tok/s) Queda >30% vs baseline por >3min Warning Investigar throttling, carga, ou problema no framework
Fila de requisições >20 por >2min Warning Escalar ou ativar rejeição com erro 429
ECC double-bit error Qualquer ocorrência Critical Falha de hardware confirmada — isolar GPU imediatamente
GPU utilization <5% por >15min (horário de pico) Warning Possível travamento do processo de inferência

Exemplo de regra Prometheus (alerting rule)

groups:
  - name: gpu_alerts
    rules:
      - alert: GPUVRAMCritical
        expr: |
          (DCGM_FI_DEV_FB_USED / (DCGM_FI_DEV_FB_USED + DCGM_FI_DEV_FB_FREE)) > 0.97
        for: 1m
        labels:
          severity: critical
        annotations:
          summary: "GPU {{ $labels.gpu }} VRAM acima de 97%"
          description: "VRAM em {{ $value | humanizePercentage }} — risco de OOM"

      - alert: GPUTemperatureWarning
        expr: DCGM_FI_DEV_GPU_TEMP > 80
        for: 10m
        labels:
          severity: warning
        annotations:
          summary: "GPU {{ $labels.gpu }} temperatura elevada"
          description: "Temperatura: {{ $value }}°C por mais de 10 minutos"

8. Métricas de aplicação: vLLM e frameworks

Além das métricas de hardware, frameworks de inferência como vLLM expõem métricas específicas da aplicação que complementam o monitoramento de GPU.

Métricas nativas do vLLM

O vLLM expõe um endpoint Prometheus em /metrics (porta 8000 por padrão). As métricas mais relevantes:

Métrica vLLM O que mede
vllm:num_requests_running Requisições em processamento simultâneo na GPU
vllm:num_requests_waiting Requisições na fila aguardando GPU
vllm:gpu_cache_usage_perc % do KV cache usado (VRAM alocada para contextos ativos)
vllm:prompt_tokens_total Total de tokens de prompt processados
vllm:generation_tokens_total Total de tokens gerados
vllm:time_to_first_token_seconds Histograma de TTFT
vllm:time_per_output_token_seconds Tempo por token gerado (inverse de tok/s)
vllm:request_success_total Total de requisições concluídas com sucesso

Fonte: documentação oficial vLLM (docs.vllm.ai/en/latest/serving/metrics.html), agosto de 2026.

KV cache usage como proxy de carga real: vllm:gpu_cache_usage_perc é uma das métricas mais úteis para entender a carga real de inferência. Quando ultrapassa 90%, o vLLM começa a preemptar requisições — o que aumenta latência. Monitore junto com VRAM total para entender se o gargalo é o modelo ou os contextos ativos.

9. Checklist de observabilidade para GPU em produção

  • Driver NVIDIA instalado e nvidia-smi funcionando
  • DCGM instalado e exportando métricas em :9400/metrics
  • Prometheus configurado com scrape do DCGM e do framework (vLLM/Ollama)
  • Grafana com dashboard GPU Overview importado (ID 12239)
  • Dashboard de aplicação: TTFT, tokens/s, fila, KV cache usage
  • Alerta de VRAM crítico (>95%) configurado com routing de oncall
  • Alerta de temperatura (>80°C por 10min) configurado
  • Alerta de ECC double-bit error configurado como P0
  • Alerta de throughput (>30% queda vs baseline) configurado
  • Baseline de throughput documentada (tokens/s em carga normal)
  • Retenção de métricas definida (mínimo 30 dias para análise de tendência)
  • Runbook documentado: o que fazer em cada alerta crítico
  • Teste mensal de alertas: simular condição e verificar notificação

Conteúdos relacionados


Perguntas frequentes

Como saber se minha GPU está em throttling térmico?
Execute nvidia-smi -q -d CLOCK | grep -A5 "Clocks Throttle Reasons". Se aparecer HW Thermal Slowdown: Active: Yes, a GPU está reduzindo o clock por temperatura. Verifique também a métrica DCGM_FI_DEV_SM_CLOCK — uma queda significativa do clock base confirma throttling. A temperatura acima de 80–83°C (dependendo do modelo) é o gatilho mais comum.

O que é um erro ECC e quando se preocupar?
ECC (Error-Correcting Code) é um mecanismo de correção de erros de memória. Single-bit errors (SBE) são corrigidos automaticamente e são normais em operação prolongada — apenas monitore a tendência de crescimento. Double-bit errors (DBE) não podem ser corrigidos e indicam falha física de hardware: a GPU deve ser isolada imediatamente para diagnóstico. GPUs de datacenter (A100, H100, L40S) têm ECC obrigatório; RTX 4090 não tem suporte ECC nativo.

Qual a frequência ideal de scrape do Prometheus para GPU?
15 segundos é o padrão adequado para a maioria dos casos — captura tendências e anomalias sem sobrecarregar o exportador. Para alertas de VRAM crítico (onde segundos importam), use scrape_interval: 5s especificamente para o job DCGM. Frequências abaixo de 5s não são recomendadas — o overhead de scrape começa a competir com a GPU.

Como monitorar GPU em Kubernetes?
Use o NVIDIA GPU Operator, que instala automaticamente driver, DCGM Exporter e plugin de device no cluster. O Operator configura o scrape do Prometheus via ServiceMonitor (se kube-prometheus-stack estiver instalado). O dashboard Grafana 12239 funciona igualmente em ambientes Kubernetes com métricas expostas via DCGM.

A Adentro oferece monitoramento junto com GPU dedicada?
Sim. Infraestruturas GPU da Adentro incluem monitoramento de hardware (DCGM), temperatura, consumo e alertas por e-mail e Slack. Dashboard Grafana com as métricas essenciais disponível desde o primeiro dia. Para monitoramento de aplicação (vLLM, throughput, TTFT), a integração com o stack de observabilidade do cliente é suportada via endpoint Prometheus padrão.

{
“@context”: “https://schema.org”,
“@graph”: [
{
“@type”: “Article”,
“headline”: “Como monitorar GPU em produção para aplicações de IA”,
“description”: “Métricas essenciais, thresholds, nvidia-smi, DCGM, Prometheus e Grafana para monitoramento de GPU em produção com aplicações de IA.”,
“url”: “https://adentro.com.br/monitoramento-gpu/”,
“datePublished”: “2026-08-09”,
“dateModified”: “2026-08-09”,
“publisher”: { “@type”: “Organization”, “name”: “Adentro”, “url”: “https://adentro.com.br” },
“inLanguage”: “pt-BR”
},
{
“@type”: “BreadcrumbList”,
“itemListElement”: [
{“@type”:”ListItem”,”position”:1,”name”:”Adentro”,”item”:”https://adentro.com.br”},
{“@type”:”ListItem”,”position”:2,”name”:”Blog”,”item”:”https://adentro.com.br/blog/”},
{“@type”:”ListItem”,”position”:3,”name”:”Infraestrutura para IA”,”item”:”https://adentro.com.br/infraestrutura-para-inteligencia-artificial/”},
{“@type”:”ListItem”,”position”:4,”name”:”Monitoramento de GPU”,”item”:”https://adentro.com.br/monitoramento-gpu/”}
]
},
{
“@type”: “FAQPage”,
“mainEntity”: [
{
“@type”: “Question”,
“name”: “Como saber se minha GPU está em throttling térmico?”,
“acceptedAnswer”: { “@type”: “Answer”, “text”: “Execute nvidia-smi -q -d CLOCK | grep -A5 ‘Clocks Throttle Reasons’. Se aparecer ‘HW Thermal Slowdown: Active: Yes’, a GPU está reduzindo o clock por temperatura.” }
},
{
“@type”: “Question”,
“name”: “O que é um erro ECC e quando se preocupar?”,
“acceptedAnswer”: { “@type”: “Answer”, “text”: “Single-bit errors (SBE) são corrigidos automaticamente e são normais. Double-bit errors (DBE) indicam falha física — a GPU deve ser isolada imediatamente para diagnóstico.” }
},
{
“@type”: “Question”,
“name”: “A Adentro oferece monitoramento junto com GPU dedicada?”,
“acceptedAnswer”: { “@type”: “Answer”, “text”: “Sim. Infraestruturas GPU da Adentro incluem monitoramento DCGM, temperatura, consumo e alertas. Dashboard Grafana disponível desde o primeiro dia.” }
}
]
}
]
}

document.querySelectorAll(‘.faq-q’).forEach(q => q.addEventListener(‘click’, () => q.parentElement.classList.toggle(‘open’)));

Na mídia

Histórias de sucesso

Solicitar contato

Converse com time de vendas!

Ajudamos sua empresa a modernizar continuamente sua infraestrutura de TI, garantir a resiliência dos seus dados e conduzir uma migração segura e estratégica para a nuvem.

Your benefits:
O que acontece a seguir?
1

Reunião para entender seu desafio

2

Realizaremos um diagnóstico do seu ambiente de TI

3

Apresentação da proposta e criação de ambiente de teste

Falar com especialista em soluções de TI
v3 Solicitar contato v3 (#18) (#20)
+55