Antes, rodar um modelo de linguagem local era um pesadelo de dependências e configuração. O Ollama mudou isso: baixar e conversar com um modelo virou um comando. Ele é a porta de entrada da IA self-hosted — e roda na sua VPS.
O que é o Ollama
Ollama é uma ferramenta open source que empacota tudo que um LLM precisa para rodar localmente: o modelo, o runtime e uma API. Você não lida com bibliotecas nem drivers — instala o Ollama, "puxa" um modelo e usa. Ele cuida de baixar a versão quantizada certa e servir o modelo.
Instalando na VPS
A instalação é direta. Numa VPS Linux, o método oficial é um script de instalação; via Docker, é um contêiner (veja o guia de Docker). Depois de instalado, rodar um modelo é literalmente isto:
ollama run llama3.2
O comando baixa o modelo (na primeira vez) e abre um chat no terminal. Pronto — você está conversando com um LLM que roda no seu servidor, sem enviar nada para fora.
Escolhendo o modelo (o que cabe em CPU)
O Ollama tem uma biblioteca com muitos modelos abertos. Numa VPS de CPU, o segredo é escolher modelos pequenos e quantizados:
| Modelo (exemplos) | Porte | Cabe em CPU? |
|---|---|---|
| Phi, Gemma pequeno, Llama 1B–3B | Pequeno | Sim, tranquilo |
| Mistral 7B, Llama 8B, Qwen 7B (quantizados) | Médio-pequeno | Sim, com RAM suficiente |
| 13B–34B | Médio | Pesado em CPU; melhor com GPU |
| 70B+ | Grande | GPU obrigatória |
Regra prática de RAM: um modelo quantizado precisa de memória suficiente para carregar seus pesos mais uma folga para o contexto. Modelos de 7–8B quantizados costumam pedir alguns GB de RAM. Veja detalhes em qual modelo cabe na sua VPS.
Dica: comece com um modelo pequeno para validar o fluxo, depois suba de tamanho até onde a RAM (e a paciência com a velocidade em CPU) permitir.
Usando por API (o pulo do gato)
O Ollama não é só chat no terminal — ele expõe uma API HTTP local. Isso significa que suas aplicações, scripts e automações podem chamar o modelo como se fosse um serviço. Um exemplo de chamada:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Resuma este texto em 3 tópicos: ..."
}'
É assim que você pluga a IA local no Open WebUI, em automações do n8n ou num chatbot com seus documentos (RAG).
Boas práticas
- Priorize RAM — é o recurso que mais limita a IA em CPU.
- Não exponha a API à internet sem proteção — coloque um proxy reverso com autenticação/HTTPS na frente se precisar de acesso remoto.
- Um modelo por vez na memória — cada modelo carregado ocupa RAM; evite manter vários grandes ativos.
- Gerencie o disco — modelos ocupam vários GB cada; monitore o espaço.
- Ajuste as expectativas de velocidade — em CPU, a resposta sai token a token, mais devagar que numa GPU. Para muitos usos (resumo, automação, chat interno) é perfeitamente aceitável.
Sua IA local em minutos
O Ollama é o jeito mais rápido de ter um LLM rodando no seu servidor. Precisa apenas de uma VPS com RAM:
Instalado o Ollama, dê a ele uma cara de ChatGPT com o Open WebUI.

