IA Self-Hosted

Qual modelo de IA cabe na sua VPS? Entenda a quantização

"Esse modelo roda na minha VPS?" A resposta depende de dois números — o tamanho do modelo e o nível de quantização — e de quanta RAM você tem. Depois deste guia você vai bater o olho num modelo e saber se ele cabe.

O que são "parâmetros" (o tamanho do modelo)

Modelos são medidos em parâmetros: 1B, 7B, 13B, 70B — onde "B" é bilhão. Grosso modo, mais parâmetros = mais "conhecimento" e capacidade, porém mais memória e mais lentidão. Os tamanhos comuns:

  • 1B–3B — pequenos, rápidos, ótimos para tarefas simples e CPU.
  • 7B–8B — o ponto ideal para self-hosting: capazes e ainda leves quando quantizados.
  • 13B–34B — mais capazes, pesados para CPU.
  • 70B+ — poderosos, território de GPU com muita VRAM.

O que é quantização (o truque que viabiliza tudo)

Por padrão, os pesos do modelo são números de alta precisão (16 bits), o que ocupa muita memória. A quantização reduz essa precisão — para 8, 5 ou 4 bits — encolhendo drasticamente o tamanho do modelo, com uma perda de qualidade geralmente pequena.

Você verá rótulos como Q4_K_M, Q5_K_M, Q8_0. Na prática:

Quantização Tamanho Qualidade Uso
Q8 Maior Quase igual ao original Se sobra RAM
Q5 Médio Muito boa Bom equilíbrio
Q4 Menor Boa O mais usado em self-hosting

O formato mais comum para rodar em CPU é o GGUF, usado por ferramentas como o Ollama. O Q4_K_M costuma ser o melhor equilíbrio entre tamanho e qualidade — o ponto de partida recomendado.

Quanta RAM cada modelo pede (a regra prática)

O modelo precisa caber na memória. Uma estimativa útil para modelos quantizados em Q4:

Modelo RAM aproximada (Q4)
1B–3B ~1–3 GB
7B–8B ~5–6 GB
13B ~9–10 GB
34B ~20+ GB
70B ~40+ GB

Além dos pesos, reserve folga para o sistema, o contexto (o tamanho do que você manda de uma vez) e outros apps. Regra segura: tenha alguns GB de RAM a mais do que o modelo pede.

Como escolher (passo a passo)

  1. Veja sua RAM disponível. Ex.: numa VPS com 8 GB, depois do sistema sobram ~6 GB úteis.
  2. Escolha um tamanho que caiba com folga. Com ~6 GB, um 7B–8B em Q4 é o alvo natural.
  3. Comece no Q4_K_M. Se sobrar memória e você quiser mais qualidade, suba para Q5.
  4. Teste a velocidade. Em CPU, valide se os tokens por segundo atendem seu caso. Para automação e resumo, quase sempre atendem.

E o contexto (a "janela")?

Além dos pesos, a janela de contexto (quantos tokens o modelo processa de uma vez) também consome memória — quanto maior o texto de entrada, mais RAM. Se você vai processar documentos longos, considere essa folga extra. Para RAG, isso importa; veja chatbot com seus documentos.

Resumo para decidir rápido

RAM da VPS  ->  modelo alvo (Q4)
 ~4 GB      ->  1B a 3B
 ~8 GB      ->  7B a 8B   (sweet spot)
 ~16 GB     ->  13B
 32 GB+     ->  34B (em CPU, lento; melhor GPU)

Mais RAM, modelos melhores

Em IA self-hosted na CPU, a RAM é o que decide qual modelo você roda. Uma VPS com boa memória abre a porta para modelos mais capazes:

👉 Ver planos de VPS

Escolhido o modelo, rode com o Ollama e entenda o hardware no guia de CPU vs GPU.

Compartilhar:

Pronto para hospedar seu próximo projeto?

VPS com painel pré-instalado em 1 clique. Ativação imediata.

Ver planos VPS