"Esse modelo roda na minha VPS?" A resposta depende de dois números — o tamanho do modelo e o nível de quantização — e de quanta RAM você tem. Depois deste guia você vai bater o olho num modelo e saber se ele cabe.
O que são "parâmetros" (o tamanho do modelo)
Modelos são medidos em parâmetros: 1B, 7B, 13B, 70B — onde "B" é bilhão. Grosso modo, mais parâmetros = mais "conhecimento" e capacidade, porém mais memória e mais lentidão. Os tamanhos comuns:
- 1B–3B — pequenos, rápidos, ótimos para tarefas simples e CPU.
- 7B–8B — o ponto ideal para self-hosting: capazes e ainda leves quando quantizados.
- 13B–34B — mais capazes, pesados para CPU.
- 70B+ — poderosos, território de GPU com muita VRAM.
O que é quantização (o truque que viabiliza tudo)
Por padrão, os pesos do modelo são números de alta precisão (16 bits), o que ocupa muita memória. A quantização reduz essa precisão — para 8, 5 ou 4 bits — encolhendo drasticamente o tamanho do modelo, com uma perda de qualidade geralmente pequena.
Você verá rótulos como Q4_K_M, Q5_K_M, Q8_0. Na prática:
| Quantização | Tamanho | Qualidade | Uso |
|---|---|---|---|
| Q8 | Maior | Quase igual ao original | Se sobra RAM |
| Q5 | Médio | Muito boa | Bom equilíbrio |
| Q4 | Menor | Boa | O mais usado em self-hosting |
O formato mais comum para rodar em CPU é o GGUF, usado por ferramentas como o Ollama. O Q4_K_M costuma ser o melhor equilíbrio entre tamanho e qualidade — o ponto de partida recomendado.
Quanta RAM cada modelo pede (a regra prática)
O modelo precisa caber na memória. Uma estimativa útil para modelos quantizados em Q4:
| Modelo | RAM aproximada (Q4) |
|---|---|
| 1B–3B | ~1–3 GB |
| 7B–8B | ~5–6 GB |
| 13B | ~9–10 GB |
| 34B | ~20+ GB |
| 70B | ~40+ GB |
Além dos pesos, reserve folga para o sistema, o contexto (o tamanho do que você manda de uma vez) e outros apps. Regra segura: tenha alguns GB de RAM a mais do que o modelo pede.
Como escolher (passo a passo)
- Veja sua RAM disponível. Ex.: numa VPS com 8 GB, depois do sistema sobram ~6 GB úteis.
- Escolha um tamanho que caiba com folga. Com ~6 GB, um 7B–8B em Q4 é o alvo natural.
- Comece no Q4_K_M. Se sobrar memória e você quiser mais qualidade, suba para Q5.
- Teste a velocidade. Em CPU, valide se os tokens por segundo atendem seu caso. Para automação e resumo, quase sempre atendem.
E o contexto (a "janela")?
Além dos pesos, a janela de contexto (quantos tokens o modelo processa de uma vez) também consome memória — quanto maior o texto de entrada, mais RAM. Se você vai processar documentos longos, considere essa folga extra. Para RAG, isso importa; veja chatbot com seus documentos.
Resumo para decidir rápido
RAM da VPS -> modelo alvo (Q4)
~4 GB -> 1B a 3B
~8 GB -> 7B a 8B (sweet spot)
~16 GB -> 13B
32 GB+ -> 34B (em CPU, lento; melhor GPU)
Mais RAM, modelos melhores
Em IA self-hosted na CPU, a RAM é o que decide qual modelo você roda. Uma VPS com boa memória abre a porta para modelos mais capazes:
Escolhido o modelo, rode com o Ollama e entenda o hardware no guia de CPU vs GPU.

