Rodando modelos de IA leves e chatbots no VPS
A inteligência artificial generativa virou parte do dia a dia das empresas. Mas dá para rodar IA em um VPS comum, sem GPU? A resposta é: sim, com modelos pequenos — e o VPS também é excelente para hospedar chatbots que usam APIs de IA.
Dois caminhos
1. Modelo local no VPS
O modelo roda no próprio servidor.
- ✅ Dados não saem do servidor (privacidade, LGPD);
- ✅ Sem custo por token;
- ⚠️ Em CPU, só modelos pequenos (geralmente até alguns bilhões de parâmetros, quantizados) têm velocidade aceitável;
- ⚠️ Exige bastante RAM.
2. VPS como orquestrador de APIs
O VPS hospeda o chatbot, a lógica, o banco de dados e as integrações, e chama uma API de IA externa.
- ✅ Acesso aos modelos mais capazes;
- ✅ VPS pequeno é suficiente;
- ⚠️ Custo por uso e dados enviados ao provedor da API.
Muitos projetos combinam os dois: modelo local para tarefas simples e sensíveis, API para tarefas complexas.
Rodando modelos locais com Ollama
O Ollama simplifica o download e a execução de modelos abertos.
curl -fsSL https://ollama.com/install.sh | sh
ollama pull llama3.2:3b # exemplo de modelo pequeno
ollama run llama3.2:3b
Verifique a licença de cada modelo antes de usá-lo comercialmente.
Por padrão, a API do Ollama escuta em 127.0.0.1:11434 — mantenha assim e exponha apenas via proxy autenticado, se necessário.
Quanto de RAM?
Como referência aproximada, modelos quantizados em 4 bits ocupam algo em torno de 0,5 a 0,7 GB de RAM por bilhão de parâmetros, mais uma margem para contexto e sistema:
| Modelo (quantizado) | RAM aproximada |
|---|---|
| 1–3B parâmetros | 2–4 GB |
| 7–8B parâmetros | 6–8 GB |
Em CPU, espere respostas mais lentas do que em GPU. Mais vCPUs ajudam; disco NVMe acelera o carregamento do modelo na memória.
Interface de chat: Open WebUI
O Open WebUI oferece uma interface estilo ChatGPT para o Ollama (e para APIs compatíveis com OpenAI):
docker run -d --name open-webui --restart unless-stopped \
-p 127.0.0.1:3000:8080 \
--add-host=host.docker.internal:host-gateway \
-e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
-v open-webui:/app/backend/data \
ghcr.io/open-webui/open-webui:main
Para o container acessar o Ollama no host, configure o Ollama para escutar também na interface da rede Docker (variável
OLLAMA_HOST), sem expô-lo à internet — mantenha o firewall bloqueando a porta 11434 externamente.
Coloque um proxy reverso com HTTPS na frente e crie a conta de administrador no primeiro acesso.
Casos de uso práticos
- Chatbot de atendimento com base de conhecimento da empresa (RAG);
- Resumo e classificação de e-mails, tickets e documentos;
- Assistente interno com documentos que não podem sair da empresa;
- Automação com n8n, usando nós de IA com Ollama ou APIs;
- Bots de WhatsApp, Telegram e Discord com respostas inteligentes.
RAG: IA com os seus dados
RAG (Retrieval-Augmented Generation) busca trechos relevantes dos seus documentos e os entrega ao modelo junto com a pergunta. Você precisa de:
- Um modelo de embeddings (pode rodar no Ollama);
- Um banco vetorial (pgvector no PostgreSQL, Qdrant, Chroma);
- A aplicação que junta tudo (Open WebUI, n8n, LangChain, LlamaIndex).
Dicas
- Comece com modelos pequenos e aumente conforme a necessidade;
- Monitore o uso de RAM — modelos grandes demais causam swap e lentidão extrema;
- Limite o acesso: interfaces de IA abertas podem ser abusadas;
- Para cargas pesadas de IA local, considere servidores com GPU.
Conclusão
Um VPS é uma ótima base para chatbots, automações com IA e modelos pequenos rodando localmente, com dados no Brasil.Comece com um VPS-NVME-BR da VittHost e use o cupom SP-VITT20 para ganhar 20% de desconto na primeira fatura enquanto a promoção estiver ativa.