IA Self-Hosted

Ollama: rodar modelos de linguagem locais na sua VPS

Antes, rodar um modelo de linguagem local era um pesadelo de dependências e configuração. O Ollama mudou isso: baixar e conversar com um modelo virou um comando. Ele é a porta de entrada da IA self-hosted — e roda na sua VPS.

O que é o Ollama

Ollama é uma ferramenta open source que empacota tudo que um LLM precisa para rodar localmente: o modelo, o runtime e uma API. Você não lida com bibliotecas nem drivers — instala o Ollama, "puxa" um modelo e usa. Ele cuida de baixar a versão quantizada certa e servir o modelo.

Instalando na VPS

A instalação é direta. Numa VPS Linux, o método oficial é um script de instalação; via Docker, é um contêiner (veja o guia de Docker). Depois de instalado, rodar um modelo é literalmente isto:

ollama run llama3.2

O comando baixa o modelo (na primeira vez) e abre um chat no terminal. Pronto — você está conversando com um LLM que roda no seu servidor, sem enviar nada para fora.

Escolhendo o modelo (o que cabe em CPU)

O Ollama tem uma biblioteca com muitos modelos abertos. Numa VPS de CPU, o segredo é escolher modelos pequenos e quantizados:

Modelo (exemplos) Porte Cabe em CPU?
Phi, Gemma pequeno, Llama 1B–3B Pequeno Sim, tranquilo
Mistral 7B, Llama 8B, Qwen 7B (quantizados) Médio-pequeno Sim, com RAM suficiente
13B–34B Médio Pesado em CPU; melhor com GPU
70B+ Grande GPU obrigatória

Regra prática de RAM: um modelo quantizado precisa de memória suficiente para carregar seus pesos mais uma folga para o contexto. Modelos de 7–8B quantizados costumam pedir alguns GB de RAM. Veja detalhes em qual modelo cabe na sua VPS.

Dica: comece com um modelo pequeno para validar o fluxo, depois suba de tamanho até onde a RAM (e a paciência com a velocidade em CPU) permitir.

Usando por API (o pulo do gato)

O Ollama não é só chat no terminal — ele expõe uma API HTTP local. Isso significa que suas aplicações, scripts e automações podem chamar o modelo como se fosse um serviço. Um exemplo de chamada:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2",
  "prompt": "Resuma este texto em 3 tópicos: ..."
}'

É assim que você pluga a IA local no Open WebUI, em automações do n8n ou num chatbot com seus documentos (RAG).

Boas práticas

  • Priorize RAM — é o recurso que mais limita a IA em CPU.
  • Não exponha a API à internet sem proteção — coloque um proxy reverso com autenticação/HTTPS na frente se precisar de acesso remoto.
  • Um modelo por vez na memória — cada modelo carregado ocupa RAM; evite manter vários grandes ativos.
  • Gerencie o disco — modelos ocupam vários GB cada; monitore o espaço.
  • Ajuste as expectativas de velocidade — em CPU, a resposta sai token a token, mais devagar que numa GPU. Para muitos usos (resumo, automação, chat interno) é perfeitamente aceitável.

Sua IA local em minutos

O Ollama é o jeito mais rápido de ter um LLM rodando no seu servidor. Precisa apenas de uma VPS com RAM:

👉 Ver planos de VPS

Instalado o Ollama, dê a ele uma cara de ChatGPT com o Open WebUI.

Compartilhar:

Pronto para hospedar seu próximo projeto?

VPS com painel pré-instalado em 1 clique. Ativação imediata.

Ver planos VPS