Tutoriais

Rodando modelos de IA leves e chatbots no VPS

Rodando modelos de IA leves e chatbots no VPS

A inteligência artificial generativa virou parte do dia a dia das empresas. Mas dá para rodar IA em um VPS comum, sem GPU? A resposta é: sim, com modelos pequenos — e o VPS também é excelente para hospedar chatbots que usam APIs de IA.

Dois caminhos

1. Modelo local no VPS

O modelo roda no próprio servidor.

  • ✅ Dados não saem do servidor (privacidade, LGPD);
  • ✅ Sem custo por token;
  • ⚠️ Em CPU, só modelos pequenos (geralmente até alguns bilhões de parâmetros, quantizados) têm velocidade aceitável;
  • ⚠️ Exige bastante RAM.

2. VPS como orquestrador de APIs

O VPS hospeda o chatbot, a lógica, o banco de dados e as integrações, e chama uma API de IA externa.

  • ✅ Acesso aos modelos mais capazes;
  • ✅ VPS pequeno é suficiente;
  • ⚠️ Custo por uso e dados enviados ao provedor da API.

Muitos projetos combinam os dois: modelo local para tarefas simples e sensíveis, API para tarefas complexas.

Rodando modelos locais com Ollama

O Ollama simplifica o download e a execução de modelos abertos.

curl -fsSL https://ollama.com/install.sh | sh
ollama pull llama3.2:3b     # exemplo de modelo pequeno
ollama run llama3.2:3b

Verifique a licença de cada modelo antes de usá-lo comercialmente.

Por padrão, a API do Ollama escuta em 127.0.0.1:11434 — mantenha assim e exponha apenas via proxy autenticado, se necessário.

Quanto de RAM?

Como referência aproximada, modelos quantizados em 4 bits ocupam algo em torno de 0,5 a 0,7 GB de RAM por bilhão de parâmetros, mais uma margem para contexto e sistema:

Modelo (quantizado) RAM aproximada
1–3B parâmetros 2–4 GB
7–8B parâmetros 6–8 GB

Em CPU, espere respostas mais lentas do que em GPU. Mais vCPUs ajudam; disco NVMe acelera o carregamento do modelo na memória.

Interface de chat: Open WebUI

O Open WebUI oferece uma interface estilo ChatGPT para o Ollama (e para APIs compatíveis com OpenAI):

docker run -d --name open-webui --restart unless-stopped \
  -p 127.0.0.1:3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
  -v open-webui:/app/backend/data \
  ghcr.io/open-webui/open-webui:main

Para o container acessar o Ollama no host, configure o Ollama para escutar também na interface da rede Docker (variável OLLAMA_HOST), sem expô-lo à internet — mantenha o firewall bloqueando a porta 11434 externamente.

Coloque um proxy reverso com HTTPS na frente e crie a conta de administrador no primeiro acesso.

Casos de uso práticos

  • Chatbot de atendimento com base de conhecimento da empresa (RAG);
  • Resumo e classificação de e-mails, tickets e documentos;
  • Assistente interno com documentos que não podem sair da empresa;
  • Automação com n8n, usando nós de IA com Ollama ou APIs;
  • Bots de WhatsApp, Telegram e Discord com respostas inteligentes.

RAG: IA com os seus dados

RAG (Retrieval-Augmented Generation) busca trechos relevantes dos seus documentos e os entrega ao modelo junto com a pergunta. Você precisa de:

  • Um modelo de embeddings (pode rodar no Ollama);
  • Um banco vetorial (pgvector no PostgreSQL, Qdrant, Chroma);
  • A aplicação que junta tudo (Open WebUI, n8n, LangChain, LlamaIndex).

Dicas

  • Comece com modelos pequenos e aumente conforme a necessidade;
  • Monitore o uso de RAM — modelos grandes demais causam swap e lentidão extrema;
  • Limite o acesso: interfaces de IA abertas podem ser abusadas;
  • Para cargas pesadas de IA local, considere servidores com GPU.

Conclusão

Um VPS é uma ótima base para chatbots, automações com IA e modelos pequenos rodando localmente, com dados no Brasil.Comece com um VPS-NVME-BR da VittHost e use o cupom SP-VITT20 para ganhar 20% de desconto na primeira fatura enquanto a promoção estiver ativa.

Compartilhar:

Pronto para hospedar seu próximo projeto?

VPS com painel pré-instalado em 1 clique. Ativação imediata.

Ver planos VPS