Pular para o conteúdo
Ferramentas

Como Rodar IA Localmente com Ollama: Guia

O Ollama transformou a instalação de modelos de IA em algo tão simples quanto instalar qualquer outro app. Esse guia cobre do zero ao setup completo com VS

Por que isso é importante

Como Rodar IA Localmente com Ollama: Guia. O Ollama transformou a instalação de modelos de IA em algo tão simples quanto instalar qualquer outro app. Esse guia cobre do zero ao setup completo com VS Code e Cursor integrados.

Resumo

Instale o Ollama em 2 minutos, baixe um modelo com 'ollama pull deepseek-coder-v2' e integre ao VS Code com a extensão Continue. Funciona offline, sem API key, sem custo recorrente. Llama 3.3 pra conversas gerais, Qwen Coder pra código.

Contexto

Antes do Ollama, rodar um modelo de IA localmente exigia configurar ambientes Python, baixar pesos manualmente e lidar com CUDA. Com o Ollama, em 2026 o processo inteiro leva menos de 5 minutos.

Rodar IA localmente tem vantagens que modelos na nuvem não conseguem dar: privacidade total, sem limite de uso, sem custo por token, funciona offline. Pra quem trabalha com código de cliente ou em ambientes corporativos com restrição de dados, isso muda tudo.

O Ollama é a ferramenta que popularizou esse processo. Em vez de você gerenciar arquivos de modelo, dependências e configurações de hardware, o Ollama faz tudo isso por baixo dos panos. Você instala como qualquer outro app e chama os modelos como se fossem comandos de terminal.

Por Que Rodar Localmente

A primeira razão é privacidade. Quando você manda código pra GPT-4o ou Claude, esse código passa por servidores da OpenAI e Anthropic. Pra código proprietário, tokens de API que às vezes aparecem em prompts, ou arquivos de configuração sensíveis, isso é um risco real. Rodando localmente, nada sai da sua máquina.

A segunda é custo. A API do Claude Sonnet custa em torno de U$ 3 por milhão de tokens de entrada. Se você usa IA pra código 8 horas por dia, isso acumula. Rodar localmente tem custo zero de API — você paga só pela eletricidade e pelo hardware que já tem.

Ollama: O Que E

O Ollama é uma ferramenta open source que gerencia modelos de linguagem localmente. Ele padroniza o processo de baixar, armazenar e executar modelos — seja qual for a arquitetura por baixo. Você não precisa saber se o modelo usa llama.cpp ou mlx ou PyTorch; o Ollama abstrai tudo isso.

Ele expõe uma API REST local em localhost:11434 que segue o mesmo formato da API da OpenAI. Isso significa que qualquer ferramenta que suporta OpenAI — como Continue, Cursor, ou qualquer cliente de chat — funciona com o Ollama trocando só a URL base. Sem reescrever nada.

Instalando no Mac, Linux e Windows

  1. Mac: baixe o instalador em ollama.com ou rode 'brew install ollama' se usar Homebrew
  2. Linux: 'curl -fsSL https://ollama.com/install.sh | sh' — instala e registra como serviço automaticamente
  3. Windows: baixe o instalador .exe em ollama.com — funciona no Windows 10/11 com WSL2 ou nativo
  4. Verifique a instalação: 'ollama --version' no terminal
  5. Baixe o primeiro modelo: 'ollama pull qwen2.5-coder:7b' (modelo pequeno, 4.7GB)
  6. Teste: 'ollama run qwen2.5-coder:7b' e escreva um prompt

Por que isso é importante

Primeiros Prompts

O fluxo mais simples é via terminal: 'ollama run nome-do-modelo'. Você entra numa sessão interativa onde digita prompts e recebe respostas. Funciona bem pra testar modelos rápido, mas pra uso real no dia a dia você vai querer uma interface melhor.

Pra ter uma interface web tipo ChatGPT apontando pro Ollama local, instale o Open WebUI: é um projeto open source que roda num container Docker e conecta automaticamente no Ollama. Você tem histórico de conversas, upload de arquivos, seleção de modelo — tudo que o ChatGPT tem, mas rodando 100% local.

bash
# Instalar Open WebUI via Docker
docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  --restart always \
  ghcr.io/open-webui/open-webui:main

# Acesse em http://localhost:3000

Melhores Modelos pra Codigo

qwen2.5-coder:7b

Menor e mais rápido. Roda bem em máquinas com 8GB RAM. Ótimo pra completar funções, explicar código e debug simples. Tamanho: 4.7GB.

qwen2.5-coder:32b

Versão maior, melhor qualidade. Precisa de 20GB de RAM. Qualidade que rivaliza com modelos pagos pra tarefas de código complexas. Tamanho: 19GB.

deepseek-coder-v2:16b

Boa opção se você quer alternativa ao Qwen. 16B parâmetros, bom custo-benefício de hardware vs qualidade. Tamanho: 9GB.

llama3.3:70b

O melhor pra conversas gerais e arquitetura de código. Precisa de 40GB+ de RAM. Pra quem tem Mac M2/M3 com 64GB ou Linux com placa gráfica potente. Tamanho: 43GB.

Integrando com VS Code e Cursor

A extensão Continue (continue.dev) é a ponte entre o VS Code ou Cursor e o Ollama. Depois de instalar a extensão, você edita o arquivo de configuração pra apontar pro servidor local. Em menos de 5 minutos você tem autocomplete e chat de IA dentro do editor, completamente offline.

json
// .continue/config.json
{
  "models": [
    {
      "title": "Qwen Coder Local",
      "provider": "ollama",
      "model": "qwen2.5-coder:7b",
      "apiBase": "http://localhost:11434"
    },
    {
      "title": "Llama 3.3 Local",
      "provider": "ollama",
      "model": "llama3.3:70b",
      "apiBase": "http://localhost:11434"
    }
  ],
  "tabAutocompleteModel": {
    "title": "Qwen Autocomplete",
    "provider": "ollama",
    "model": "qwen2.5-coder:7b"
  }
}

Ollama vs API de Nuvem: Quando Usar Cada Um?

Ollama local vence quando você precisa de privacidade, trabalha offline, tem uso alto de tokens ou quer sem custo recorrente. API de nuvem vence quando você quer os modelos mais potentes (Claude Opus, GPT-4o), precisa de contexto muito longo (100K+), ou sua máquina não tem hardware suficiente pra rodar modelos grandes.

A combinação que funciona melhor na prática: Ollama com Qwen Coder 7B pra autocomplete e tarefas rápidas durante o dia (zero latência de rede, zero custo), e a API do Claude ou DeepSeek via OpenRouter pra problemas maiores que precisam de mais capacidade.

Meu Setup Local

No meu Mac M3 Pro com 36GB de RAM, rodo o Qwen 2.5 Coder 7B pra autocomplete via Continue no Cursor, e deixo o Llama 3.3 70B pra quando preciso de uma segunda opinião em arquiteturas maiores. O Qwen 7B responde em menos de 1 segundo e o Llama 70B leva uns 3-4 segundos pra primeiros tokens.

Pra contexto muito longo (revisar um PR inteiro ou analisar uma codebase nova), ainda uso o Gemini Flash 2.0 pelo chat web — nenhum modelo local que eu conseguia rodar iguala o contexto de 1M tokens do Gemini. Mas pra 90% do trabalho cotidiano, o setup local resolve.

Funciona em PC Fraco?

Depende do que você chama de fraco. Com 8GB de RAM dá pra rodar o Qwen Coder 7B, que já é útil. Com 16GB você consegue o 14B, que é visivelmente melhor. Abaixo de 8GB de RAM, os modelos ficam lentos demais pra uso real — seria melhor usar as interfaces web gratuitas dos modelos em nuvem.

CPU-only funciona, mas a velocidade de geração é bem mais lenta que com GPU. Em Intel i7 de 8ª geração, o Qwen 7B gera uns 8-12 tokens por segundo na CPU — dá pra usar, mas é perceptivelmente mais lento que com aceleração de GPU ou chip Apple.

Checklist Final

  • Instale o Ollama e teste com 'ollama run qwen2.5-coder:7b' antes de configurar o editor
  • Use 'ollama list' pra ver os modelos baixados e 'ollama ps' pra ver o que está rodando
  • Configure o Continue no VS Code ou Cursor pra usar o modelo local
  • Monitore uso de RAM com Activity Monitor (Mac) ou Task Manager (Windows) ao rodar modelos
  • Modelos ficam em ~/. ollama/models — reserve espaço em disco (10-50GB dependendo dos modelos)
  • Use 'ollama stop nome-do-modelo' pra liberar RAM quando não usar mais

O Ollama funciona sem conexao com internet?

Sim, depois de baixar os modelos ele roda completamente offline. A única exceção é quando você roda 'ollama pull' pra baixar um novo modelo — aí precisa de internet. Mas uma vez que o modelo está na máquina, você pode desligar o wi-fi e continuar usando normalmente.

Se você quer ter acesso tanto a modelos locais quanto a modelos em nuvem numa interface só, o guia do OpenRouter explica como centralizar tudo numa API unificada.

Pra entender quais modelos gratuitos valem mais a pena no Ollama, veja o ranking completo dos melhores modelos de IA gratuitos pra programar em 2026.