Ollama: Como Rodar IA Local no Seu Computador
O Ollama transforma qualquer computador com hardware razoavel em um servidor de IA local. Sem internet, sem API key, sem custo por token — voce instala uma vez
Todo desenvolvedor ja pensou: 'e se eu pudesse rodar IA no meu proprio computador?' Privacidade total, zero custo por token, funciona sem internet. O problema era que configurar isso era uma dor de cabeca enorme — baixar pesos, gerenciar dependencias, configurar CUDA, criar servidor...
O Ollama resolveu isso. Com dois comandos voce tem um servidor de IA rodando localmente, com qualquer modelo que voce quiser. Llama, Mistral, DeepSeek, CodeLlama, Qwen — todos rodando no seu hardware, offline, gratuito.
Nesse tutorial vou do zero ao setup completo: instalacao, escolha de modelos pelo seu hardware, integracao com VSCode e terminal, e quando faz sentido usar local vs nuvem. Mas se voce quer uma alternativa sem precisar de hardware proprio, veja o combo OpenCode + Antigravity com 150 modelos gratis na nuvem.
Por Que Rodar IA Localmente
Tres razoes principais levam devs para o Ollama: privacidade, custo e disponibilidade offline.
Privacidade e a mais forte. Quando voce manda codigo para Claude ou GPT-4, esse codigo sai do seu computador e vai para servidores de outra empresa. Para projetos com NDA, codigo proprietario ou dados sensiveis, isso pode ser um problema real ou ate uma violacao contratual.
Custo a longo prazo tambem faz diferenca. Usar Claude Sonnet o dia todo custa $15-30 por dia facilmente se voce for intenso. O Ollama tem custo zero depois de pagar o hardware. Pra quem ja tem uma maquina decente, e gratuito imediatamente.
Disponibilidade offline e util em contextos especificos: aviao, cliente sem internet, lab sem rede externa. Com Ollama configurado voce nunca fica travado por falta de conexao.
Quando local NAO e melhor
O Ollama transforma qualquer computador com hardware razoavel em um servidor de IA local. Sem internet, sem API key, sem custo por token — voce instala uma vez e usa para sempre.
Requisitos de Hardware
Antes de baixar qualquer modelo, e importante entender o que seu hardware aguenta. O gargalo e sempre a memoria — RAM se voce usa CPU, VRAM se voce usa GPU.
8GB RAM / 6GB VRAMEntry Level
Limite maximo: modelos 7B. Funciona bem com Llama 3.2 7B, Mistral 7B, Phi-3 Mini, Gemma 2 9B. Qualidade razoavel para tarefas simples. Resposta leva 2-5 segundos por mensagem em CPU.
16GB RAM / 12GB VRAMRecomendado
Modelos ate 13B confortavelmente. Llama 3.1 8B roda rapido. Code Llama 13B e uma opcao solida. Em GPU com 12GB de VRAM a velocidade e excelente — resposta em menos de 1 segundo por token.
32GB RAM / 24GB VRAMPower User
Modelos ate 30B rodam bem. DeepSeek Coder 33B e uma opcao excelente nessa faixa. Qualidade muito proxima dos modelos de nuvem para tarefas de codigo. RTX 3090/4090 se enquadram aqui.
64GB+ RAM / Apple Silicon M2+Top Performance
Modelos de 70B ficam acessiveis. Llama 3.3 70B roda em macs com M2 Pro/Max/Ultra gracias a memoria unificada. Qualidade excelente, quase equivalente a modelos cloud de segunda linha.
Apple Silicon merece mencao especial. O M1, M2 e M3 usam memoria unificada — CPU e GPU compartilham o mesmo pool. Um MacBook Pro M3 Max com 48GB aguenta modelos de 30B com velocidade boa. E muito melhor do que um PC com 16GB de RAM e placa de video dedicada com 8GB de VRAM separados.
Instalando o Ollama
- Instale o OllamamacOS: brew install ollama ou baixe o instalador em ollama.ai. Linux: curl -fsSL https://ollama.ai/install.sh | sh. Windows: baixe o .exe no site oficial e execute.
- Verifique a instalacaoAbra o terminal e rode: ollama --version. Deve aparecer algo como 'ollama version 0.4.x'. Se aparecer, ta instalado corretamente.
- Baixe seu primeiro modeloExecute: ollama pull llama3.2. Esse e o modelo mais balanceado para quem tem 8-16GB. O download e de uns 4-8GB dependendo da versao.
- Teste no terminalRode: ollama run llama3.2. Vai abrir um chat interativo no terminal. Digite qualquer pergunta e veja a resposta. Para sair, digite /bye ou Ctrl+D.
- Inicie o servidor (para uso com ferramentas)Execute: ollama serve. Isso inicia um servidor HTTP na porta 11434. Agora qualquer ferramenta pode se conectar via http://localhost:11434 com API compativel com OpenAI.
# Verificar modelos instalados
ollama list
# Ver modelo em execucao
ollama ps
# Baixar modelos especificos para codigo
ollama pull codellama:13b
ollama pull deepseek-coder-v2
ollama pull qwen2.5-coder:7b
# Testar API REST diretamente
curl http://localhost:11434/api/generate \
-d '{"model": "llama3.2", "prompt": "Explica async/await em 3 linhas"}'Melhores Modelos para Codigo
Nem todo modelo local e bom para codigo. Alguns sao treinados especificamente para programacao, outros sao generalistas. Aqui os que realmente valem no dia a dia.
DeepSeek Coder V2Melhor para Codigo
O melhor modelo de codigo open source disponivel no Ollama. Treinado em 6 trilhoes de tokens de codigo. Excelente para completions, refatoracao e debug. Requer 16GB+ de RAM. Instala com: ollama pull deepseek-coder-v2
Qwen 2.5 Coder 7BMelhor por Tamanho
Modelo da Alibaba focado em codigo. Surpreendentemente bom para o tamanho. Funciona em 8GB de RAM. Muito bom para linguagens menos comuns como Go, Rust e Kotlin. Instala com: ollama pull qwen2.5-coder:7b
Code Llama 13BClassico
O classico da Meta especialmente treinado para programacao. Suporta mais de 20 linguagens com qualidade consistente. Bom para FIM (fill-in-the-middle), que e o que autocomplete usa. Instala com: ollama pull codellama:13b
Llama 3.3 70BMelhor Geral
Nao focado em codigo mas muito capaz. Para quem tem hardware para rodar (64GB+), esse modelo resolve quase tudo. Bom para explicacoes, revisao de arquitetura e codigo geral. Instala com: ollama pull llama3.3:70b
Integrando com Continue.dev no VSCode
O Continue.dev e a forma mais simples de usar Ollama no VSCode. Com o servidor Ollama rodando, a configuracao e minima.
{
"models": [
{
"title": "DeepSeek Coder (Local)",
"provider": "ollama",
"model": "deepseek-coder-v2"
},
{
"title": "Llama 3.2 (Local)",
"provider": "ollama",
"model": "llama3.2"
}
],
"tabAutocompleteModel": {
"title": "Qwen Coder 7B (Local)",
"provider": "ollama",
"model": "qwen2.5-coder:7b"
}
}Nao precisa de API key. O Continue.dev detecta o Ollama automaticamente se ele estiver rodando na porta padrao. Se voce mudar a porta, adicione 'apiBase': 'http://localhost:PORTA' na config.
Integrando com OpenCode
O OpenCode tem suporte nativo ao Ollama. Alem de usar modelos locais, voce pode misturar local e nuvem no mesmo setup.
{
"provider": {
"ollama": {
"baseURL": "http://localhost:11434"
}
},
"model": "ollama/deepseek-coder-v2"
}No terminal com OpenCode configurado, voce troca entre modelo local e nuvem com /model. Da pra comecar o dia no Ollama e quando aparecer um problema dificil trocar para Claude sem sair da ferramenta.
Performance: Local vs Nuvem
A pergunta que todo mundo faz: qual e mais rapido? Depende do hardware.
Em CPU puro, o Llama 7B gera uns 5-15 tokens por segundo. Claude na nuvem gera 50-100 tokens por segundo. Ou seja, para respostas longas a nuvem e muito mais rapida em CPU.
Em GPU ou Apple Silicon a historia muda. Um MacBook Pro M3 com o Llama 3.3 70B gera 15-25 tokens por segundo — comparavel a muitas APIs de nuvem. Uma RTX 4090 com Qwen 2.5 Coder 7B gera 80-120 tokens por segundo. Mais rapido que a nuvem.
Local vs Nuvem: comparativo real
Ollama Local (GPU/Apple Silicon)
+ Prós
- • Zero latencia de rede
- • Custo zero por uso
- • Privacidade total
- • Sem rate limits
− Contras
- • Qualidade inferior em tarefas complexas
- • Custo inicial de hardware
- • Consome energia e RAM
Claude / GPT-4 na Nuvem
+ Prós
- • Qualidade superior em tarefas difíceis
- • Sem custo de hardware
- • Sempre atualizado
− Contras
- • Custo por token
- • Codigo sai do seu computador
- • Depende de internet
Configurando Inicio Automatico
Chato ter que lembrar de iniciar o Ollama toda vez. Da pra configurar para iniciar automaticamente com o sistema.
# macOS: criar servico launchd
cat > ~/Library/LaunchAgents/com.ollama.server.plist << 'EOF'
<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE plist PUBLIC "-//Apple//DTD PLIST 1.0//EN" "http://www.apple.com/DTDs/PropertyList-1.0.dtd">
<plist version="1.0">
<dict>
<key>Label</key>
<string>com.ollama.server</string>
<key>ProgramArguments</key>
<array>
<string>/usr/local/bin/ollama</string>
<string>serve</string>
</array>
<key>RunAtLoad</key>
<true/>
</dict>
</plist>
EOF
launchctl load ~/Library/LaunchAgents/com.ollama.server.plist
# Linux: habilitar servico systemd
sudo systemctl enable ollama
sudo systemctl start ollamaProximo Passo
Com Ollama instalado e funcionando, voce tem a base para um setup de IA completamente local. Mas rodar modelo local e so uma das opcoes. Para uma visao completa das melhores ferramentas de IA para desenvolvimento, confere o ranking dos melhores modelos para codigo em 2026.
E se voce quer comparar o setup local com alternativas gratuitas na nuvem, o OpenCode com Antigravity e outra opcao excelente que nao exige hardware proprio.
Perguntas frequentes
Preciso de internet para usar o Ollama?
Apenas para baixar os modelos pela primeira vez. Depois de feito o download, tudo roda completamente offline. Seu codigo nunca sai do computador.
Qual o hardware minimo para rodar Ollama?
Para modelos de 7B parametros voce precisa de pelo menos 8GB de RAM. Para 13B precisa de 16GB. Para 70B precisa de 64GB ou uma GPU com VRAM suficiente. Apple Silicon (M1/M2/M3) e excelente por usar memoria unificada.
Ollama funciona com Windows?
Sim, o Ollama tem suporte nativo a Windows 10 e 11. Funciona com NVIDIA e AMD GPUs no Windows. O instalador e simples e nao requer configuracao adicional.
Por Que Rodar IA Localmente
Tres razoes principais levam devs para o Ollama: privacidade, custo e disponibilidade offline. Privacidade e a mais forte. Quando voce manda codigo para Claude ou GPT-4, esse codigo sai do seu computador e vai para servidores de outra empresa. Para projetos com NDA, codigo proprietario ou dados sensiveis, isso pode ser um problema real ou ate uma violacao contratual. Custo a longo prazo tambem faz diferenca. Usar Claude Sonnet o dia todo custa $15-30 por dia facilmente se voce for intenso. O Ollama tem custo zero depois de pagar o hardware. Pra quem ja tem uma maquina decente, e gratuito imediatamente.