Plataformas & Tecnologias
Cloud Computing AWS Microsoft Oracle Kubernetes IA
Governança & Operação
FinOps Compliance Redes
Recursos & Ferramentas
Comparativos Cloud por setor Calculadoras Whitepapers
Início » Conteúdos » LLM on-premises: como rodar modelos de IA dentro da sua empresa

LLM on-premises: como rodar modelos de IA dentro da sua empresa

Rodar um modelo de linguagem dentro da sua própria infraestrutura deixou de ser exclusividade de laboratórios de pesquisa. Com modelos open source de qualidade crescente e ferramentas simples de deploy, qualquer empresa com hardware adequado consegue ter um LLM privado — sem dado sair, sem custo por token, sem dependência de API externa.

Por que rodar LLM localmente

A decisão de não usar APIs externas (OpenAI, Anthropic, Google) pode parecer contra-intuitiva, mas faz sentido em vários cenários:

Privacidade e LGPD. Quando os dados que alimentam o modelo são sensíveis — prontuários médicos, contratos, dados de clientes — enviá-los para APIs de terceiros exige base legal clara e revisão dos termos de uso do provedor. On-premises elimina essa preocupação: o dado nunca sai.

Custo a longo prazo. Modelos via API cobram por token. Para usos intensivos — geração de documentos, suporte ao cliente em alto volume, análise de dados em lote — o custo mensal pode facilmente superar o investimento em hardware próprio em 12 a 18 meses.

Disponibilidade sem dependência. APIs externas têm outages, mudanças de preço, mudanças de modelo e limites de rate. On-premises elimina todas essas variáveis.

Latência controlada. Dependendo da rede e do hardware, inferência local pode ter latência menor do que chamadas para APIs externas, especialmente para respostas longas.

Modelos open source: o que existe hoje

O ecossistema de modelos open source evoluiu muito. Alguns que valem atenção:

Modelo Tamanhos Pontos fortes Ideal para
Llama 3 (Meta) 8B, 70B Qualidade geral alta, boa base para fine-tuning Uso geral, chatbots, análise
Mistral / Mixtral 7B, 8x7B (MoE) Eficiente, boa relação tamanho/qualidade Tarefas de texto, classificação
Phi-3 (Microsoft) 3.8B, 14B Muito eficiente para o tamanho Hardware limitado, edge
Gemma 2 (Google) 2B, 9B, 27B Licença permissiva, boa qualidade Uso comercial, fine-tuning
Qwen 2.5 (Alibaba) 7B, 72B Forte em múltiplos idiomas e código Contextos multilíngues

Para português do Brasil especificamente, modelos maiores (acima de 13B) tendem a ter melhor desempenho. Modelos menores funcionam bem para tarefas estruturadas, mas podem ter qualidade menor em geração livre em português.

Ferramentas para rodar LLMs

Ollama é o ponto de entrada mais simples. Com um comando, você baixa e roda um modelo:

ollama pull llama3
ollama run llama3

Ollama expõe uma API REST local compatível com a API da OpenAI, o que facilita integração com aplicações existentes. Ideal para desenvolvimento e uso individual.

vLLM é a escolha certa para produção. Oferece throughput muito maior que Ollama graças ao PagedAttention (gestão eficiente de memória KV cache), suporte a batching contínuo e compatibilidade com múltiplas GPUs. É o que você usa quando tem requisições em volume.

LM Studio é uma interface gráfica para Mac/Windows, ideal para quem quer experimentar modelos sem linha de comando. Não é para produção, mas acelera muito a avaliação de modelos.

Requisitos de hardware: o mínimo para cada tamanho

A regra geral é que cada bilhão de parâmetros em float16 ocupa cerca de 2 GB de VRAM. Com quantização (int4 ou int8), você reduz esse número significativamente — com alguma perda de qualidade.

Modelo VRAM necessária (float16) VRAM com quantização int4 RAM sistema
7B parâmetros ~14 GB ~4–5 GB 16 GB
13B parâmetros ~26 GB ~8–9 GB 32 GB
70B parâmetros ~140 GB ~40–45 GB 64 GB+

Para modelos de 7B com quantização, uma GPU RTX 4080 (16 GB VRAM) ou NVIDIA T4 já são suficientes. Para 13B sem quantização, você precisa de A100 40 GB ou similar. Para 70B, são necessárias múltiplas GPUs ou GPUs com HBM (A100 80 GB, H100).

É possível rodar modelos em CPU com ferramentas como llama.cpp, mas a velocidade de geração fica muito abaixo do utilizável em produção — entre 1 e 5 tokens por segundo, vs 30–100 tokens/segundo com GPU.

O que esperar de qualidade

Honestidade aqui é importante. Modelos open source chegaram muito perto de modelos proprietários em muitas tarefas, mas ainda existe uma diferença em casos específicos:

Tarefa Open source (Llama 3 70B) GPT-4 / Claude
Respostas em inglês Excelente Excelente
Respostas em português Boa Muito boa
Raciocínio complexo Boa Muito boa
Código Muito boa Muito boa
Seguir instruções longas Boa Muito boa

Para a maioria dos casos de uso corporativos — responder perguntas sobre documentos internos, resumir textos, classificar, extrair informação estruturada — modelos de 13B ou 70B entregam qualidade muito satisfatória.

Casos de uso ideais para LLM local

  • Chatbot sobre documentos internos (com RAG): políticas, manuais, contratos — sem dado sair
  • Suporte ao cliente com base de conhecimento privada
  • Geração de documentos em alto volume (relatórios, e-mails, resumos)
  • Análise de dados não estruturados internos
  • Assistente de código para desenvolvimento interno
  • Classificação e extração de informação de grandes volumes de texto

A Adentro pode fornecer infraestrutura com GPU dedicada para hospedar LLMs on-premises com SLA, segurança e conformidade LGPD — sem dado sair do seu ambiente.

Nesta página