Ollama: O Que É, Como Funciona e Como Usar com OpenClaw

Ollama é uma ferramenta gratuita para baixar e executar modelos de IA localmente no Windows, macOS ou Linux. Depois de instalar um modelo como Llama, Qwen ou Mistral, você conversa com a IA e conecta aplicativos ao servidor local sem pagar API por token. Com o OpenClaw, esse modelo local pode responder no WhatsApp, Telegram e outros canais, executar automações e processar dados sem enviá-los a Claude, GPT ou Gemini.

Resposta rápida sobre Ollama

PerguntaResposta direta
Ollama é grátis?Sim. O programa e os modelos disponíveis para ele podem ser usados sem cobrança por token; hardware e energia continuam sendo custos reais.
Funciona sem internet?Sim, depois de baixar o Ollama e o modelo. Canais como WhatsApp ainda precisam de internet.
Precisa de GPU?Não para testar modelos pequenos, mas uma GPU melhora muito a velocidade.
Qual modelo usar primeiro?Qwen2.5 7B ou Llama 3.1 8B são pontos de partida práticos para máquinas com 8–16 GB de RAM.
Os dados ficam privados?O prompt pode ficar no seu ambiente quando o fluxo usa apenas Ollama local; integrações externas, logs e canais precisam de controles próprios.
Funciona com OpenClaw?Sim. O OpenClaw se conecta ao servidor do Ollama, normalmente em localhost:11434.

O que é Ollama e como funciona?

O Ollama gerencia o download, a execução e a API de modelos de linguagem grandes (LLMs) no seu computador ou servidor. Em vez de mandar cada prompt para uma empresa de IA na nuvem, o aplicativo fala com um processo local. Para usuários do OpenClaw, isso traz três vantagens principais: controle sobre onde o texto é processado, custo zero de API e possibilidade de trabalhar offline após o download inicial.

O fluxo é simples: você instala o Ollama, baixa um modelo com ollama pull, inicia o servidor local e aponta o OpenClaw para ele. O OpenClaw continua responsável por canais, memória, ferramentas, aprovações e automações; o Ollama fornece o modelo que interpreta e gera o texto.

Essa opção é especialmente relevante para quem lida com dados sensíveis — advogados processando casos confidenciais, clínicas organizando informações internas, empresas com dados regulados pela LGPD ou qualquer situação em que enviar conteúdo a uma API externa não seja aceitável. Por isso, o Ollama aparece nos casos de uso do OpenClaw sempre que o tema é controle de dados, sigilo ou custo previsível.

A contrapartida é real: modelos locais podem ter qualidade inferior aos modelos de ponta na nuvem, exigem hardware adequado e costumam ser mais lentos. Modelos como Qwen2.5, Llama 3.1 e Mistral atendem bem tarefas estruturadas, resumos, classificação e parte do trabalho com código, mas precisam ser testados antes de executar ações críticas. Para comparar esse equilíbrio com Claude, GPT e Gemini, veja o comparativo completo de modelos.

Características Principais

Processamento local: O modelo roda no seu hardware e o prompt não precisa ser enviado a um provedor de IA. Isso reduz exposição externa, mas conformidade também depende de canais, integrações, logs, acesso e retenção de dados.

Custo zero de API: Sem cobranças por token ou por chamada. O único custo é o hardware e a energia elétrica.

Funcionamento offline: Funciona sem conexão à internet após o download inicial do modelo. Útil para ambientes com restrições de rede ou viagens.

Variedade de modelos: O Ollama suporta dezenas de modelos — Llama, Qwen, Mistral, CodeLlama, Phi, Gemma e muitos outros. Você escolhe o modelo mais adequado para cada caso de uso.

Controle total: Você controla qual versão do modelo usa, como configura os parâmetros e onde os dados são armazenados.

Vantagens

  • Processamento local — prompts não precisam ir para uma API de IA externa
  • Sem custo de API
  • Funciona offline após download
  • Sem limites de uso (rate limits)
  • Total controle sobre o modelo e os dados

Desvantagens

  • Qualidade inferior aos modelos de ponta (Claude, GPT-4) em tarefas complexas
  • Requer hardware potente (GPU dedicada recomendada)
  • Mais lento que APIs na nuvem
  • Modelos maiores exigem muito RAM/VRAM
  • Configuração inicial mais complexa

Como Funciona

O Ollama roda um servidor local (por padrão em localhost:11434) com uma API que outros aplicativos podem chamar. O OpenClaw se conecta a esse servidor como se conecta a um provedor remoto, mas o processamento do modelo ocorre no seu hardware. Dados ainda podem sair do ambiente se o workflow usar canais, buscas ou integrações externas.

Instalação

Instalar o Ollama

# Linux e macOS
curl -fsSL https://ollama.ai/install.sh | sh

# Windows
# Baixe o instalador em ollama.ai/download

Baixar um Modelo

# Modelo básico (mais leve)
ollama pull llama3

# Modelo maior e melhor
ollama pull llama3.1:70b

# Modelo especializado em código
ollama pull codellama

# Raciocínio forte em hardware comum (recomendado para começar)
ollama pull qwen2.5

# Código de alta qualidade
ollama pull qwen2.5-coder

# Modelo equilibrado (alternativa)
ollama pull mixtral

Verificar que Está Funcionando

# Listar modelos instalados
ollama list

# Testar o modelo
ollama run llama3 "Olá, tudo bem?"

# Verificar servidor
curl http://localhost:11434/api/tags

Configuração no OpenClaw

Configuração Básica

agents:
  defaults:
    model:
      primary: "ollama/llama3"

Configuração Completa

# config.yaml
provider: ollama

ollama:
  base_url: http://localhost:11434
  model: llama3.1:70b

  # Temperatura
  temperature: 0.7

  # Contexto (em tokens)
  num_ctx: 8192

Multi-Modelo: Ollama para Dados Sensíveis

Use Ollama apenas para dados sensíveis, mantendo Claude para o restante:

models:
  default: claude-3-5-sonnet    # Uso geral
  local: ollama/llama3.1        # Dados confidenciais
  code: ollama/codellama        # Código privado
"Use modelo local: analise esse contrato confidencial"
"Use modelo code: revise esse código com dados de produção"

Modelos Recomendados

ModeloRAM MínimaMelhor Para
llama3 (8B)8GBUso geral básico, testes
llama3.1 (8B)8GBUso geral com melhor tool calling
llama3.1 (70B)40GB RAM ou 24GB VRAMMelhor qualidade local
qwen2.5 (7B)8GBÓtimo raciocínio e custo-benefício
qwen2.5-coder (7B)8GBCódigo — alternativa forte ao CodeLlama
mixtral (8x7B)24GBBom equilíbrio qualidade/velocidade
codellama8GBCódigo, programação
phi-34GBHardware muito limitado

Recomendação para começar: qwen2.5 (7B) ou llama3.1:8b — ambos rodam em hardware comum (8GB de RAM), têm bom suporte a tool calling e qualidade adequada para tarefas básicas e intermediárias. Para código privado, qwen2.5-coder é a escolha atual mais forte.

Requisitos de Hardware

Mínimo (experiência limitada)

  • 8GB RAM
  • CPU moderna (i7/Ryzen 7 ou superior)
  • SSD com 10GB livres por modelo

Recomendado (experiência satisfatória)

  • 16GB RAM (32GB para modelos 70B)
  • GPU NVIDIA com 8GB+ VRAM
  • SSD rápido

Ideal (experiência próxima a APIs na nuvem)

  • 32GB+ RAM
  • GPU NVIDIA com 16-24GB VRAM (RTX 3090, RTX 4090, A100)
  • Modelos 70B+ rodando inteiramente na GPU

Nota sobre GPUs: Sem GPU, os modelos rodam na CPU — funciona, mas é muito mais lento. Com GPU NVIDIA (CUDA), a velocidade melhora dramaticamente. GPUs AMD funcionam com suporte experimental.

Casos de Uso Ideais

Dados de saúde (médicos, clínicas): Prontuários, diagnósticos e informações de pacientes nunca devem sair do ambiente controlado. Com Ollama, você mantém conformidade com o sigilo médico e com a LGPD para dados de saúde.

Dados jurídicos (advogados, escritórios): Estratégias de caso, documentos confidenciais e informações de clientes ficam no seu servidor. Sem risco de violação do sigilo profissional por terceiros.

Propriedade intelectual (empresas de tecnologia): Código fonte, algoritmos proprietários e segredos industriais não precisam ser enviados para APIs externas para análise.

Ambientes sem internet: Locais com restrições de rede, data centers isolados ou situações de contingência onde a internet não está disponível.

Limitações para Uso com OpenClaw

Tool calling: Modelos locais têm suporte variável a tool calling. O Llama 3.1 e o Qwen2.5 têm suporte razoável, mas podem ser menos confiáveis que Claude ou GPT-4 em workflows com muitas ferramentas encadeadas.

Contexto: Modelos locais tipicamente têm contexto menor (4K-32K tokens por padrão, configurável). Para documentos muito longos, você pode precisar fragmentar o conteúdo.

Velocidade: Mesmo com GPU, modelos 70B são mais lentos que APIs na nuvem. Para automações que precisam de resposta rápida, isso pode ser um limitador.

Qualidade: Para tarefas criativas, análise complexa ou decisões estratégicas, a diferença de qualidade em relação a Claude Opus ou GPT-4 ainda é perceptível. Para tarefas estruturadas e bem definidas, a diferença é menor.

FAQ

O que é Ollama?

Ollama é um programa que facilita baixar, executar e acessar modelos de IA no próprio computador ou servidor. Ele fornece comandos simples, como ollama pull e ollama run, além de uma API local que ferramentas como o OpenClaw podem usar.

Como funciona o Ollama?

O Ollama baixa os arquivos do modelo escolhido e executa a inferência no seu hardware. Por padrão, outros aplicativos acessam o modelo pelo endereço http://localhost:11434. O prompt é processado localmente, sem cobrança por token de uma API de IA externa.

O Ollama funciona em Windows?

Sim. O Ollama tem instalador para Windows disponível em ollama.ai/download. O suporte a GPU (CUDA) também funciona no Windows.

Quais modelos têm melhor tool calling local?

Llama 3.1 (especialmente o 70B), Qwen2.5 e Mistral/Mixtral têm o melhor suporte a tool calling entre os modelos locais disponíveis. Para use cases críticos, teste antes de adotar em produção.

Posso usar Ollama em um servidor da empresa?

Sim. Instale o Ollama no servidor, configure para aceitar conexões da rede local e aponte o OpenClaw para o endereço do servidor em vez de localhost. Isso permite que múltiplos usuários compartilhem o modelo.

O Ollama funciona em Mac com chip Apple Silicon?

Sim, e com ótima performance. Os chips M1, M2 e M3 Pro/Max têm memória unificada que permite rodar modelos grandes de forma eficiente sem GPU separada. Um Mac com 16GB de RAM unificada roda o Llama 3.1 8B e o Qwen2.5 7B com velocidade satisfatória.

Como atualizar um modelo para a versão mais recente?

ollama pull llama3.1  # Baixa a versão mais recente
ollama rm llama3.1:old  # Remove versão antiga se necessário

Usar Ollama já garante conformidade com a LGPD?

Usar Ollama evita enviar prompts a uma API de modelo externa quando todo o fluxo permanece local, mas não elimina outros riscos de exposição. A conformidade com a LGPD também depende de controles de acesso, canais, integrações, logs, políticas de retenção e base legal para o tratamento. Leia o guia completo de LGPD para uma avaliação mais ampla.

O Ollama é realmente grátis? Tem algum custo escondido?

Sim, o Ollama é gratuito e não cobra licença nem uso por token. Os custos reais são o hardware, o consumo de energia, o armazenamento dos modelos e, se você optar por hospedar fora de casa, a VPS ou GPU em nuvem. Também confira a licença específica de cada modelo antes do uso comercial.

Qual modelo Ollama devo usar com 8 GB ou 16 GB de RAM?

Com 8 GB de RAM, comece por um modelo pequeno e quantizado, como Phi ou uma variante de 3B–7B. Com 16 GB, Qwen2.5 7B e Llama 3.1 8B são opções mais confortáveis. Feche aplicativos pesados, teste a latência e reduza o contexto se houver falta de memória. Para automações com ferramentas, priorize um modelo que tenha bom suporte a tool calling.

Próximos Passos