Hospedar um LLM (Large Language Model) na própria infraestrutura é cada vez mais viável para empresas que precisam de privacidade, controle de custo e conformidade com a LGPD. Este guia apresenta os custos reais de 2026 para hospedar modelos como Llama 3, Mistral e Qwen — com estimativas por tamanho de modelo e comparativo com APIs externas.
O que significa hospedar um LLM
Hospedar um LLM significa manter o modelo rodando em infraestrutura própria ou dedicada, em vez de consumir APIs de terceiros como OpenAI, Anthropic ou Google. Você controla o modelo, os dados, o custo e a conformidade. As principais vantagens são: privacidade total dos dados, previsibilidade de custo, possibilidade de fine-tuning e ausência de lock-in com um provedor externo.
Hospede seu LLM com segurança no Brasil
A Adentro oferece infraestrutura GPU dedicada para LLMs, com colocation nacional e suporte técnico especializado em ML/AI. Dados no Brasil, sem compartilhamento de hardware.
LLMs open-source mais hospedados em 2026
- Llama 3 8B / 70B / 405B (Meta) — open-source, excelente custo-benefício, forte em português
- Mistral 7B / Mixtral 8×7B (Mistral AI) — europeu, LGPD-friendly, ótimo para tarefas especializadas
- Qwen 2.5 72B (Alibaba) — forte em multilíngue e português, boa performance em raciocínio
- DeepSeek R1 / V3 — alto desempenho em raciocínio, open-weights
- Gemma 2 27B (Google) — licença comercial permissiva, bem otimizado para inferência
Requisitos de hardware por tamanho de modelo
| Modelo | VRAM (FP16) | VRAM (INT4) | GPU recomendada (produção) | Tokens/seg |
|---|---|---|---|---|
| 7B parâmetros | 16 GB | 4 GB | RTX 4090 24GB | 40–80 |
| 13B parâmetros | 28 GB | 7 GB | A100 40GB | 25–50 |
| 34B parâmetros | 70 GB | 18 GB | 2× L40S 48GB | 15–30 |
| 70B parâmetros | 140 GB | 35 GB | 2× H100 80GB | 20–40 |
| 405B parâmetros | 810 GB | 200 GB | 8× H100 SXM | 5–15 |
Custo mensal estimado de hospedagem
Modelo 7B (ex: Llama 3 8B, Mistral 7B) — uso contínuo 24/7
- Cloud GPU on-demand (1× RTX 4090): R$ 2.880–5.760/mês
- Servidor dedicado em colocation: R$ 5.000–8.000/mês (TCO completo)
Modelo 70B (ex: Llama 3 70B, Qwen 72B) — uso contínuo 24/7
- Cloud GPU on-demand (2× H100): R$ 21.600–40.320/mês
- Servidor dedicado em colocation: R$ 10.000–18.000/mês (TCO completo)
- API equivalente (GPT-4o a USD 15/1M tokens): varia — pode superar R$ 50.000/mês em uso intensivo
API externa vs. LLM hospedado
| Fator | API Externa | LLM Hospedado |
|---|---|---|
| Custo em baixo volume | ✅ Menor | ❌ CAPEX não se justifica |
| Custo em alto volume | ❌ Explosivo | ✅ Previsível e menor |
| Privacidade dos dados | ❌ Saem da empresa | ✅ Ficam internos |
| Fine-tuning e customização | ⚠️ Limitada | ✅ Total |
| Conformidade LGPD | ⚠️ Complexa | ✅ Simplificada |
| Tempo de implantação | ✅ Horas | ⚠️ Dias a semanas |
Ponto de equilíbrio em volume de tokens
Para modelos equivalentes ao GPT-4o (custo ~USD 15/1M tokens de saída), o break-even com hospedagem de um Llama 3 70B em colocation é aproximadamente 5–10 milhões de tokens por mês. Acima desse volume, hospedar o modelo próprio é quase sempre mais econômico.
Para empresas com dados confidenciais, o imperativo de segurança e LGPD justifica a hospedagem própria mesmo em volumes menores — o break-even financeiro é secundário ao risco regulatório.
Stack tecnológico recomendado
- Serving:
vLLM(alto throughput, PagedAttention),Ollama(simples, dev),TGI(Text Generation Inference) - Orquestração: Kubernetes com NVIDIA Device Plugin para GPUs como recurso gerenciado
- Monitoramento: Prometheus + Grafana com DCGM Exporter (métricas GPU: utilização, temperatura, VRAM)
- Armazenamento de modelos: MinIO (S3-compatible) ou NFS de alta velocidade
- API Gateway: LiteLLM (proxy OpenAI-compatible), Kong ou Traefik com rate limiting
Leia também
Calcule o TCO com a ferramenta Adentro
Use a Calculadora de TCO da Adentro para simular o custo de hospedar um LLM ao longo de 36 meses — comparando API externa, cloud GPU e servidor dedicado com base no seu volume real de tokens e especificações de modelo.
Pronto para hospedar seu LLM com privacidade e previsibilidade?
A Adentro oferece infraestrutura GPU dedicada para LLMs no Brasil — do hardware ao suporte, do colocation ao monitoramento.
Perguntas frequentes
Quanto custa hospedar o Llama 3 70B em produção?
Cloud GPU on-demand: R$ 21.600–40.320/mês (2× H100 80GB, 24/7). Servidor dedicado em colocation: R$ 10.000–18.000/mês — economia de 30–50%.
Hospedar LLM próprio é mais barato que usar a API do ChatGPT?
Para volumes acima de 5–10 milhões de tokens/mês sim. Abaixo desse volume, a API é mais conveniente e acessível.
Qual é o melhor framework para servir LLMs em produção?
vLLM é o padrão para alto throughput (PagedAttention). Para data centers NVIDIA, TGI e Triton são alternativas robustas. Para volumes menores, Ollama simplifica o deployment.
LLM hospedado no Brasil atende à LGPD?
Sim — e é uma das principais vantagens. Com LLM em infraestrutura própria no Brasil, os dados não saem do país nem vão para APIs externas. Isso simplifica o compliance LGPD e o trabalho do DPO.
Quanta VRAM preciso para hospedar Mistral 7B?
Em FP16 são necessários ~16 GB — RTX 4090 (24GB) ou A100 40GB. Em INT4, o modelo cabe em ~4 GB de VRAM.
Qual o throughput esperado de um LLM 70B em produção?
Em 2× H100 80GB NVLink com vLLM: 20–40 tokens/segundo em batch size 1. Com batching contínuo, o throughput efetivo pode alcançar 200–500 tokens/segundo dependendo da carga.


