Ollama: Como Rodar LLMs Localmente Sem Pagar
Rodar IA no seu próprio computador sem pagar nada e sem mandar seus dados pra nuvem nenhuma. Com o Ollama, isso é não só possível — é surpreendentemente
TL;DR
Rodar IA no seu próprio computador sem pagar nada e sem mandar seus dados pra nuvem nenhuma. Com o Ollama, isso é não só possível — é surpreendentemente fácil. Aqui vai o guia completo do setup até a integração com IDEs.
Tem uma parada que me incomodava muito quando comecei a usar IA pra programar: mandar meu código pra uma nuvem que eu não controlo. Código proprietário, variáveis de ambiente, lógica de negócio — tudo indo pra servers de terceiros. Pra projetos pessoais tanto faz, mas pra cliente? Complicado.
Aí descobri o Ollama e percebi que dá pra ter um setup de IA muito bom rodando 100% na sua máquina. Sem pagar nada. Sem mandar dado pra lugar nenhum. E o setup é ridiculamente simples.
O que é o Ollama e por que usar
Ollama é uma ferramenta open source que baixa, gerencia e roda modelos de linguagem (LLMs) localmente no seu computador. Funciona como um runtime local pra modelos de IA — tipo um Docker pra LLMs.
Você digita um comando no terminal, ele baixa o modelo e fica rodando como um servidor local. Qualquer ferramenta que aceita API compatível com OpenAI pode se conectar. Simples assim.
Por que rodar IA localmente
- Privacidade total — seu código nunca sai da sua máquina
- Zero custo mensal — sem tokens, sem planos, sem surpresas na fatura
- Funciona offline — no avião, no café sem wifi, em qualquer lugar
- Sem rate limits — rode quantas requisições quiser, o limite é o hardware
- Controle total — escolha o modelo, ajuste parâmetros, crie modelos customizados
Requisitos de hardware
Antes de instalar, vamos falar de hardware. Modelos de IA são pesados, e o desempenho depende diretamente do que sua máquina tem debaixo do capô.
Modelos 7-8B (DeepSeek Coder 6.7B, CodeGemma 7B)
Modelos leves, bons pra autocomplete e tarefas simples de código.
+ Prós
- • Rodam em qualquer máquina moderna com 8GB de RAM
- • Resposta rápida mesmo sem GPU dedicada
- • Ocupam 4-5GB de disco
- • Ideais pra notebooks e máquinas mais modestas
− Contras
- • Qualidade de código inferior aos modelos maiores
- • Contexto limitado (4-8K tokens)
- • Erram mais em lógica complexa
Modelos 13-34B (DeepSeek Coder V2 16B, Qwen 2.5 Coder 32B)
Sweet spot de qualidade vs recursos. Onde a maioria dos devs vai se dar melhor.
+ Prós
- • Qualidade de código muito boa — perto de modelos cloud
- • Contexto maior (16-32K tokens)
- • Bom pra geração, review e debugging
- • Performance excelente com GPU ou Apple Silicon
− Contras
- • Precisam de 16-32GB de RAM
- • Ocupam 10-20GB de disco
- • Mais lentos sem GPU dedicada
Modelos 70B+ (Llama 3.3 70B, DeepSeek V3 distilled)
Top de linha em qualidade. Precisam de máquina robusta.
+ Prós
- • Qualidade comparável a modelos cloud premium
- • Contexto amplo e raciocínio sofisticado
- • Excelentes pra debugging complexo e arquitetura
− Contras
- • Exigem 32-64GB de RAM
- • Ocupam 40-70GB de disco
- • Lentos sem GPU de pelo menos 24GB VRAM
- • Inviáveis na maioria dos notebooks
Apple Silicon brilha aqui
Se você tem um Mac com M1, M2, M3 ou M4, parabéns — sua máquina é provavelmente a melhor opção pra IA local. A memória unificada (CPU e GPU compartilham a mesma RAM) significa que um MacBook com 32GB roda modelos de 34B com folga. O M3 Max com 64GB roda o Llama 70B numa boa.
Instalação passo a passo
macOS
# Opção 1: Homebrew (recomendado)
brew install ollama
# Opção 2: Download direto
# Acesse ollama.com e baixe o .dmg
# Iniciar o servidor
ollama serve
# Em outro terminal, baixar e rodar um modelo
ollama run deepseek-coder-v2:16bWindows
# Opção 1: Instalador nativo
# Baixe em ollama.com/download/windows
# Execute o .exe e siga o wizard
# Opção 2: Via WSL2 (se você já usa)
wsl
curl -fsSL https://ollama.com/install.sh | sh
# Depois de instalar, no terminal:
ollama serve
ollama run deepseek-coder-v2:16bLinux
# Instalação com script oficial
curl -fsSL https://ollama.com/install.sh | sh
# Detecta GPU NVIDIA/AMD automaticamente
# Iniciar o servidor
ollama serve
# Baixar e rodar modelo
ollama run deepseek-coder-v2:16bMelhores modelos locais pra programar
Nem todo modelo que roda local é bom pra código. Testei vários e separei os que realmente valem a pena pra desenvolvimento.
DeepSeek Coder V2 (16B)
O melhor custo-benefício pra código local. Arquitetura MoE com 2.4B parâmetros ativos, roda liso com 16GB de RAM. Score de 90.2% no HumanEval. Excelente pra geração, completar e refatorar código em praticamente qualquer linguagem.
Qwen 2.5 Coder (32B)
O mais completo pra quem tem 32GB+ de RAM. Score de 92.7% no HumanEval. Muito bom pra gerar testes, explicar código e fazer reviews. Suporte a 128K tokens de contexto, dá pra analisar arquivos enormes.
Llama 3.3 (70B)
Top de linha open source. Score de 88.7% no HumanEval. Generalista, mas com capacidade de código impressionante. Precisa de 40GB de RAM mínimo. No Mac com 64GB de memória unificada, roda com tokens/s bem aceitáveis.
CodeGemma (7B)
Modelo leve do Google otimizado pra código. 7B de parâmetros, roda em qualquer máquina com 8GB. Ideal pra autocomplete e tarefas rápidas. Não é pra geração complexa, mas pra o dia a dia de completar código funciona muito bem.
Mixtral 8x7B
Modelo MoE da Mistral com 46.7B de parâmetros totais mas só 12.9B ativos. Roda com 24GB de RAM e entrega qualidade superior ao tamanho aparente. Bom pra raciocínio e debugging.
Integrando Ollama com seu IDE
O Ollama expõe uma API local na porta 11434 que é compatível com o formato OpenAI. Isso significa que qualquer ferramenta que suporta a API da OpenAI se conecta ao Ollama com uma mudança de URL.
# Verificar se o Ollama tá rodando
curl http://localhost:11434/api/tags
# Testar uma geração
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-coder-v2:16b",
"messages": [{"role": "user", "content": "Escreva um quicksort em Python"}]
}'- No Cursor: Settings → Models → Custom. Base URL: http://localhost:11434/v1. Modelo: deepseek-coder-v2:16b
- No Continue: config.json → adicione provider 'ollama' com apiBase http://localhost:11434
- No OpenCode: export OLLAMA_HOST=http://localhost:11434 e use --provider ollama
- No VS Code com extensão Ollama: instale a extensão e ela detecta o Ollama automaticamente
Performance: local vs cloud
Vamos ser honestos: modelos locais não são tão rápidos quanto a cloud na maioria dos cenários. Mas a diferença pode ser menor do que você imagina, especialmente no hardware certo.
Benchmarks reais (tokens por segundo)
- DeepSeek Coder V2 16B no M3 Pro (36GB): ~35 tokens/s — mais que suficiente pra uso interativo
- Qwen 2.5 Coder 32B no M3 Max (64GB): ~25 tokens/s — fluente pra chat e geração
- Llama 3.3 70B no M3 Max (64GB): ~12 tokens/s — usável, mas nota-se a lentidão em respostas longas
- DeepSeek Coder V2 16B na RTX 4090 (24GB): ~55 tokens/s — voando
- Cloud (GPT-4, Claude): ~50-80 tokens/s dependendo da carga do servidor
Pra contexto: leitura humana é ~3-4 palavras por segundo, ou uns 4-5 tokens/s. Qualquer coisa acima de 15 tokens/s já é fluente o bastante pra você não notar lag na resposta. Pra autocomplete, até 10 tokens/s funciona bem porque as respostas são curtas.
Privacidade e quando isso importa
Pra projetos pessoais e open source, a privacidade não é um fator decisivo. Mas pra trabalho corporativo, código de clientes e projetos com NDA, rodar IA local pode ser um requisito — não uma escolha.
Com Ollama, zero bytes do seu código saem da sua rede. Não precisa convencer o time de compliance que 'a OpenAI não vai treinar com os nossos dados'. Simplesmente não tem dado saindo. Argumento irrefutável.
FAQ — Perguntas frequentes
Quanto de RAM precisa pra rodar Ollama?
Modelos 7B: 8GB mínimo (16GB recomendado). Modelos 13-16B: 16GB mínimo. Modelos 32-34B: 32GB mínimo. Modelos 70B: 64GB+ ou GPU com 24GB+ VRAM. Regra geral: o modelo ocupa em RAM ~60% do tamanho do arquivo em disco.
Ollama funciona no Windows?
Sim. Tem instalador nativo pra Windows com suporte a GPUs NVIDIA e AMD. Também funciona via WSL2 com performance boa. No Mac com Apple Silicon o desempenho é o melhor entre todas as plataformas.
Qual o melhor modelo local pra programar?
DeepSeek Coder V2 16B é o melhor pra a maioria das máquinas. Se tem 32GB+, o Qwen 2.5 Coder 32B entrega qualidade muito próxima de modelos cloud. O Llama 3.3 70B é o top, mas precisa de hardware pesado.
Dá pra usar Ollama junto com Cursor?
Dá pra usar sem problema. Configure o base URL como http://localhost:11434/v1 no Cursor e os modelos locais aparecem como opção. Funciona offline depois que o modelo tá baixado.
Perguntas frequentes
Quanto de RAM precisa pra rodar Ollama?
Depende do modelo. Modelos de 7B precisam de 8GB de RAM no mínimo (16GB recomendado). Modelos de 13B pedem 16GB e modelos de 34B+ precisam de 32GB ou mais. GPU dedicada ajuda muito na velocidade mas não é obrigatória.
Ollama funciona no Windows?
Sim. Desde a versão 0.1.17, o Ollama tem instalador nativo pra Windows com suporte a GPU NVIDIA e AMD. Também funciona via WSL2. No Mac com Apple Silicon o desempenho é excelente graças à memória unificada.
Qual o melhor modelo local pra programar?
Pra a maioria dos devs, DeepSeek Coder V2 (16B) ou Qwen 2.5 Coder (32B) são os melhores em custo-benefício de qualidade vs hardware necessário. Se a máquina aguenta, o Llama 3.3 70B é o melhor modelo open source disponível.
Dá pra usar Ollama junto com o Cursor?
Sim. O Ollama expõe uma API local compatível com OpenAI em http://localhost:11434. Configure essa URL como base no Cursor e os modelos locais ficam disponíveis como qualquer outro modelo. Sem internet necessária.