OpenRouter + Modelos Gratis: Como Usar 150 IAs
O OpenRouter te dá acesso a mais de 150 modelos de IA por uma API só. E vários deles são gratuitos. Vou te mostrar como configurar e usar na prática.
TL;DR
OpenRouter + Modelos Gratis: Como Usar 150 IAs. O OpenRouter te dá acesso a mais de 150 modelos de IA por uma API só. E vários deles são gratuitos. Vou te mostrar como configurar e usar na prática.
O que é OpenRouter e por que é genial
Imagina um gateway que conecta você a todos os modelos de IA que existem por uma API só. Essa é a proposta do OpenRouter. Em vez de criar conta na OpenAI, na Anthropic, no Google e na Meta separadamente, você cria uma conta no OpenRouter e acessa tudo.
O mais interessante: vários modelos são gratuitos. Llama 3.1 da Meta, Gemma 2 do Google, Phi-3 da Microsoft, Mixtral da Mistral — todos disponíveis sem custo. Com rate limit, claro, mas pra uso pessoal e projetos pequenos é mais que suficiente.
A API do OpenRouter é compatível com o formato da OpenAI. Isso significa que qualquer biblioteca, ferramenta ou código que funciona com a API do ChatGPT funciona com OpenRouter. Basta trocar a URL base e a API key. Simples assim.
Setup passo a passo
1. Criar conta e pegar a API key
- Acesse openrouter.ai e clique em Sign Up
- Faça login com Google ou GitHub (mais rápido)
- No dashboard, vá em Keys e clique em Create Key
- Copie a chave gerada (começa com sk-or-). Guarde em lugar seguro.
- Pronto. Nenhum cartão de crédito necessário pra modelos grátis.
2. Configurar variável de ambiente
Pra não ficar colando a chave em todo lugar, configure como variável de ambiente no seu sistema.
# No seu .bashrc, .zshrc ou .profile
export OPENROUTER_API_KEY="sk-or-sua-chave-aqui"
# Recarregue o terminal
source ~/.zshrcModelos grátis que valem a pena
Nem todo modelo grátis é bom. Alguns são experimentais e dão respostas bizarras. Aqui estão os que eu testei e recomendo de verdade.
Llama 3.1 405B
Melhor modelo grátis disponível. Qualidade próxima ao GPT-4 pra maioria das tarefas. Excelente em raciocínio lógico e código.
Gemma 2 27B
Modelo do Google com boa performance em tarefas de texto. Rápido e consistente. Ótimo pra resumos e traduções.
Mixtral 8x22B
Modelo da Mistral com arquitetura MoE. Excelente em raciocínio e código. Respostas longas e detalhadas.
Phi-3 Medium
Modelo compacto da Microsoft. Surpreendentemente bom pra seu tamanho. Respostas rápidas e diretas.
Qwen 2.5 72B
Modelo chinês da Alibaba que surpreende em qualidade. Muito bom em código e raciocínio matemático.
Usando no terminal com curl
O jeito mais direto de testar é pelo terminal. A API é idêntica à da OpenAI, só muda a URL e o header de autenticação.
curl https://openrouter.ai/api/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-d '{
"model": "meta-llama/llama-3.1-405b-instruct:free",
"messages": [
{"role": "user", "content": "Explique Docker em 3 frases simples"}
]
}'Repare no :free no final do nome do modelo. Isso indica que você quer usar a versão gratuita. Se omitir, pode ser cobrado do seu crédito.
Usando com Python
from openai import OpenAI
import os
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key=os.environ["OPENROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="meta-llama/llama-3.1-405b-instruct:free",
messages=[
{"role": "user", "content": "Me dá 5 ideias de micro SaaS"}
],
)
print(response.choices[0].message.content)Como a API é compatível com OpenAI, você usa a biblioteca oficial da OpenAI mudando só a base_url. Qualquer tutorial de OpenAI que você achar por aí funciona com OpenRouter.
Integrando com VS Code e Cursor
Dá pra usar OpenRouter como backend de IA no VS Code e no Cursor. Isso é genial porque você ganha autocomplete e chat de IA usando modelos gratuitos.
No Cursor
O Cursor tem suporte nativo a modelos customizados. Vai em Settings > Models > Add Model. Coloca a URL base do OpenRouter e sua API key. Escolhe o modelo que quer usar e pronto. O chat e o autocomplete passam a usar o modelo que você configurou.
No VS Code com extensão Continue
A extensão Continue é open source e suporta OpenRouter nativamente. Instala a extensão, configura o config.json com sua API key e o modelo, e você ganha chat + autocomplete direto no VS Code.
{
"models": [
{
"title": "Llama 3.1 (OpenRouter)",
"provider": "openrouter",
"model": "meta-llama/llama-3.1-405b-instruct:free",
"apiKey": "sk-or-sua-chave-aqui"
}
],
"tabAutocompleteModel": {
"title": "Qwen 2.5 Coder (OpenRouter)",
"provider": "openrouter",
"model": "qwen/qwen-2.5-coder-32b-instruct:free",
"apiKey": "sk-or-sua-chave-aqui"
}
}Atenção sobre rate limits
Modelos grátis têm rate limit (geralmente 10-20 requests por minuto). Pra autocomplete, isso pode ser apertado.
Se o rate limit estiver atrapalhando, considere modelos pagos baratos. O Llama 3.1 pago custa centavos por milhão de tokens.
Outra opção: rode o modelo localmente com Ollama pra autocomplete (sem rate limit) e use OpenRouter só pro chat.
Comparando modelos grátis vs pagos
Pra ser honesto, modelos grátis não substituem os melhores modelos pagos em todas as tarefas. Mas pra muita coisa, a diferença é menor do que você imagina.
Modelos Grátis (OpenRouter)
Llama 3.1, Gemma 2, Mixtral, Phi-3, Qwen 2.5 — todos disponíveis sem custo.
+ Prós
- • Custo zero pra começar
- • Bons pra chat, resumos, traduções e código simples
- • Sem necessidade de cartão de crédito
- • Vários modelos pra testar e comparar
- • Rate limit suficiente pra uso pessoal
− Contras
- • Rate limit pode ser apertado pra uso intenso
- • Qualidade inconsistente em raciocínio complexo
- • Latência pode variar (servidores compartilhados)
- • Menos confiáveis pra produção
Modelos Pagos (GPT-4, Claude, etc.)
GPT-4o, Claude 3.5 Sonnet, Gemini Pro — os melhores modelos disponíveis.
+ Prós
- • Melhor qualidade em todas as tarefas
- • Raciocínio complexo muito superior
- • Geração de código mais confiável
- • Latência consistente e baixa
- • Suporte e SLA pra produção
− Contras
- • Custam de $1 a $15 por milhão de tokens
- • Exigem cartão de crédito ou faturamento
- • Risco de bill shock sem limites configurados
Benchmark prático: testei os mesmos prompts
Pra não ficar no achismo, testei 5 prompts iguais em modelos grátis e pagos. Avaliei qualidade da resposta de 1 a 10.
Resultados do benchmark
- Resumir artigo de 2000 palavras: Llama 3.1 free = 8/10, GPT-4o = 9/10. Diferença mínima.
- Gerar função TypeScript com testes: Llama 3.1 free = 7/10, Claude Sonnet = 9.5/10. Diferença perceptível.
- Traduzir texto técnico EN-PT: Gemma 2 free = 8.5/10, GPT-4o = 9/10. Quase igual.
- Debugging de código com erro sutil: Mixtral free = 5/10, Claude Sonnet = 9/10. Diferença grande.
- Gerar ideias de negócio: Qwen 2.5 free = 8/10, GPT-4o = 8.5/10. Praticamente igual.
Conclusão: pra tarefas de texto (resumo, tradução, brainstorm), modelos grátis resolvem bem. Pra código complexo e debugging, os pagos ainda ganham de lavada.
Dicas pra maximizar o uso sem pagar
- Use modelos diferentes pra tarefas diferentes. Llama 3.1 pra texto, Qwen 2.5 Coder pra código, Gemma 2 pra resumos.
- Configure fallback automático. Se um modelo estiver sobrecarregado, o OpenRouter pode redirecionar pra outro gratuitamente.
- Rode modelos locais pra autocomplete com Ollama e use OpenRouter só pra chat e tarefas mais pesadas.
- Aproveite os créditos grátis que o OpenRouter dá ao criar conta ($1 de crédito inicial serve pra testar modelos pagos).
- Monitore seu uso no dashboard. Mesmo nos modelos grátis, o OpenRouter mostra quantos tokens você consumiu.
Usando OpenRouter na sua própria aplicação
Se você está construindo um produto que usa IA, o OpenRouter é uma forma inteligente de começar. Você pode oferecer IA no seu app usando modelos grátis enquanto valida, e migrar pra modelos pagos quando tiver receita.
// Exemplo: API route no Next.js usando OpenRouter
import { NextResponse } from 'next/server'
export async function POST(request: Request) {
const { prompt } = await request.json()
const response = await fetch('https://openrouter.ai/api/v1/chat/completions', {
method: 'POST',
headers: {
'Content-Type': 'application/json',
'Authorization': `Bearer ${process.env.OPENROUTER_API_KEY}`,
'HTTP-Referer': 'https://seuapp.com',
},
body: JSON.stringify({
model: 'meta-llama/llama-3.1-405b-instruct:free',
messages: [{ role: 'user', content: prompt }],
}),
})
const data = await response.json()
return NextResponse.json(data)
}Repare no header HTTP-Referer. O OpenRouter usa isso pra analytics e, em alguns modelos grátis, exige pra liberar acesso. Sempre configure com a URL do seu app.
OpenRouter vs usar APIs diretamente
Pergunta justa: por que usar o OpenRouter em vez de chamar a API da OpenAI ou Anthropic direto? Aqui estão os motivos.
Vantagens do OpenRouter sobre APIs diretas
Uma API key, 150+ modelos. Sem criar conta em cada provedor separadamente.
Fallback automático: se o GPT-4 estiver fora, redireciona pra Claude automaticamente.
Preços transparentes e geralmente iguais ou menores que chamar direto.
Modelos grátis que não existem em nenhum provedor individual.
Dashboard unificado de uso, custos e performance de todos os modelos.
A única desvantagem real é a latência adicional do proxy. São geralmente 50-100ms a mais. Pra 99% dos casos, imperceptível. Pra aplicações real-time com streaming de tokens onde cada milissegundo importa, pode fazer diferença.
Minha stack de IA com OpenRouter
Chat e brainstorm: Llama 3.1 405B grátis (99% dos meus usos)
Código complexo: Claude Sonnet via OpenRouter (pago, mas vale cada centavo)
Resumos e traduções: Gemma 2 grátis (rápido e preciso)
Autocomplete no VS Code: Qwen 2.5 Coder via Continue (grátis)
Gasto total mensal: menos de $5 usando mix de grátis e pago
Dá pra usar IA de alta qualidade gastando quase nada. O OpenRouter democratizou o acesso a modelos que antes custavam caro. Se você ainda está pagando $20/mês no ChatGPT Plus e usa só pra chat, está jogando dinheiro fora.