Pular para o conteúdo
Automação

n8n: transcrever áudio e imagem do WhatsApp

Automatize a transcrição de áudios e análise de imagens do WhatsApp integrando Evolution, N8n e OpenAI – descubra na prática como transformar mídias em texto e informação pronta

Por que isso é importante

Para transcrever áudio e analisar imagem do WhatsApp com n8n e OpenAI: receba a mídia no webhook (Evolution ou Cloud API), converta base64 → arquivo (Convert to File), envie áudio ao Whisper/transcribe e imagem ao GPT-4o vision, e unifique a saída em uma propriedade content. Separe ramos com Switch; sem binário válido a transcrição falha. Custo escala por minuto de áudio — revalide a tabela OpenAI no dia.

Por que isso é importante

Para transcrever áudio e analisar imagem do WhatsApp com n8n e OpenAI: receba a mídia no webhook (Evolution ou Cloud API), converta base64 → arquivo (Convert to File), envie áudio ao Whisper/transcribe e imagem ao GPT-4o vision, e unifique a saída em uma propriedade content. Separe ramos com Switch; sem binário válido a transcrição falha. Custo escala por minuto de áudio — revalide a tabela OpenAI no dia.

Kilobytes falam mais alto que palavras. A integração começa quando o Evolution armazena
e disponibiliza o áudio recebido pelo WhatsApp. Para n8n transcrever áudio WhatsApp, você captura esse áudio já
em base64 – um formato ideal para transportar o áudio sem perder nenhuma informação de
mídia no caminho.

Base64 e binary: linha de montagem da mídia

Toda a manipulação do áudio e da imagem dentro do workflow gira em torno do base64. Em
vez de trabalhar apenas com links, transportar a mídia convertida em base64 evita erros
de permissionamento, problemas de acesso externo e garante integridade do dado. O
Evolution pode até fornecer já em base64, mas manualmente trazer esse dado te dá total
controle do fluxo – e menos dor de cabeça quando surge bug de fluxo.

JSON do WhatsApp: payload, identifiers e mídia

Toda mensagem do WhatsApp chega ao workflow do N8n como um JSON estruturado: ele carrega
identifiers, payload com a mídia em base64, url original, instance do servidor e a
vitrine de metadados. É essencial saber editar e manipular JSON no N8n, adaptando o
template para que o caminho dos dados nunca quebre – principalmente IDs de mensagem,
chaves da API e endpoints dinâmicos.

Atenção

Cuidado: se o workflow do N8n tentar processar uma mídia inexistente ou mal
referenciada, o processo falha silenciosamente. Sempre garanta o envio concreto do
áudio/imagem no teste e não confie só no payload de testes automáticos.

Convert to File: do base64 ao Whisper

Após capturar o áudio em base64, converta o dado para um arquivo real (.ogg para áudio e
.jpg para imagem). A OpenAI só processa arquivos – nunca base64 puro! O N8n permite a
conversão com nó de manipulação de arquivo, basta apontar para o payload base64 e o
destino final do arquivo, já definindo nome (audio.ogg, image.jpg) e o tipo correto
(mimetype) da mídia.

Atenção

Erros de nome e mimetype são comuns e, quando acontecem, travam tudo sem máximo
feedback: sempre valide o nome final do arquivo no output do node, principalmente
porque a OpenAI só aceita padrões rígidos.

Views e execuções: debug do fluxo de mídia

Pinar execuções, copiar para editor e atualizar manualmente o fluxo são práticas
obrigatórias para evitar retrabalho e testar todas as ramificações do seu automation. O
N8n mostra na hora a conversão base64, o arquivo criado e permite visualizar o resultado
dos dados enviados à OpenAI antes da próxima etapa.

Transcrição com Whisper: áudio vira texto

Basta passar o arquivo .ogg para o nó de Transcription da OpenAI no N8n: a IA
automaticamente traduz áudio em texto, mantendo contexto e sem comandos extras. O
segredo é ter o nó já preparado pra receber sempre o content na saída, padronizando o
output até para diferentes caminhos do workflow.

Atenção

Ao automatizar o recebimento e transcrição, toda mensagem de áudio do WhatsApp será
convertida em texto sem perda de contexto. Otimize para nunca depender de ouvinte
humano.

Visão com GPT-4o: imagem vira insight

Da mesma forma que o áudio, envie a imagem em formato de arquivo do N8n direto para o
endpoint de análise de imagens da OpenAI. Usando o modelo GPT-4o, extraia descrições
detalhadas da foto, pronto para alimentar assistentes, triagens ou scripts de automação.
A saída chega formatada como texto descritivo, também dentro da struct "content" –
pronta para uso em integração e resposta automática.

Atenção

Erros de conversão imagem-base64 para arquivo são frequentes se a extensão ou mimetype
estiverem incorretos; revise antes de enviar (image.jpg ou image/jpeg).

Um pipeline para áudio e imagem (mesmo Switch)

Concentre todo o output do processo em uma única propriedade: "content". Assim, qualquer
mídia recebida – áudio, imagem ou texto puro – terminará o fluxo pronta para utilização,
sem precisar reescrever lógica para cada tipo de input.

Custo em R$: ordem de grandeza por 100 áudios

Use a tabela oficial da OpenAI (Transcription) e multiplique pela duração média do seu nicho. Em ago/2026, a faixa pública para transcrição em arquivo fica perto de US$0,003–0,006 por minuto (ex.: gpt-4o-mini-transcribe ~US$0,003/min; whisper-1 / gpt-4o-transcribe ~US$0,006/min). Confirme sempre em openai.com/api/pricing — o preço muda.

Exemplo didático (não cotação de contrato): 100 áudios × 1 minuto médio × US$0,006 = US$0,60. Com câmbio ilustrativo ~R$5,50/USD, isso é ~R$3,30 só de STT. Se a média for 2 minutos, dobre. Some GPT-4o (visão ou resumo) só nos casos com imagem/texto longo — é outra linha da fatura.

Hospedagem: n8n self-host/VPS + Evolution amortizados no mês (ex.: R$40–120/mês de VPS, conforme provedor) divididos pelo volume. Em lote baixo, o fixo domina; em lote alto, a API domina. Não invente free-tier Groq eterno — só compare se você já tiver conta e cotas reais.

  • Meça duração média real (10 áudios do nicho) antes de precificar serviço.
  • Cotação cliente = STT + LLM + VPS/mês + margem — separado por linha.
  • Revalide o $/min na página OpenAI no dia do orçamento.

API oficial Meta vs Evolution: risco e quando usar

Cloud API (oficial Meta) e Evolution (não-oficial / WhatsApp Web-style) não são intercambiáveis em compliance. Para receita e conta que não pode cair, prefira a API oficial com Business Manager, templates e janela de 24h. Evolution acelera protótipo e laboratório — com risco maior de ban e mudança de protocolo.

No n8n, o payload muda: oficial traz wamid e estrutura Cloud; Evolution costuma entregar base64/URL de mídia via webhook próprio. Documente no README do workflow qual caminho está ativo e o que falta para migrar.

Cloud API (oficial Meta)

Caminho de compliance para receita e conta que não pode cair.

+ Prós

  • • Templates aprovados, BM e opt-in
  • • Janela 24h e políticas claras
  • • Melhor para cliente pagante sério

− Contras

  • • Setup mais lento (BM + templates)
  • • Payload Cloud (wamid) diferente do Evolution

Evolution (não-oficial)

QR/setup rápido para MVP e laboratório — com risco maior de ban.

+ Prós

  • • Protótipo rápido via QR/webhook
  • • Ótimo para validar fluxo de mídia

− Contras

  • • ToS e estabilidade piores
  • • Planeje migração para Cloud API se houver receita

Regra prática: protótipo ok em Evolution; cliente pagante sério → planeje Cloud API.

Fallback: mensagem sem mídia ou tipo inesperado

Implemente ramificações para lidar com mensagens que não sejam áudio, imagem ou texto,
prevendo o fallback para tratar erros e caminhos vazios. Ter um padrão de fallback evita
que a automação pare silenciosamente ou perca informações críticas.

Testar com áudio e imagem reais (Evolution)

Copiar, adaptar e clonar etapas do workflow (CTRL+C, CTRL+V com pequenas modificações de
tipo ou nome) é a estratégia mais eficiente para acelerar a prototipagem e criar novas
rotas de automação. Melhore continuamente cada nó, e mantenha o controle do output para
garantir que nenhuma informação saia do padrão.

Atenção

Faça simulações reais enviando áudios e imagens novas do WhatsApp no Evolution; só
assim você detecta gargalos, conflitos e bugs antes de ir para produção automatizada.

Próximos passos: do workflow ao atendimento

Automatizar a transcrição e análise de mídia no WhatsApp não é dom de programador
sênior: é método, repetição e paciência. Implemente seu fluxo, ajuste nos detalhes,
repita testes reais. Cada erro poupa horas de debug no futuro.

Atenção

Assista o passo a passo prático e todos os segredos em vídeo no canal Dev Doido – se
inscreva para não cometer os mesmos erros e subir seu workflow para outro nível:
youtube.com/@DevDoido

Fontes

Revisão em agosto de 2026. Nomes de modelo (ex.: GPT-4o) e preços de áudio/visão mudam — confira a documentação oficial antes de orçar produção. Tutorial de integração, não garantia de custo por minuto.

Documentação n8n. OpenAI Speech to text. OpenAI Vision.

Perguntas frequentes

Como transcrever áudio do WhatsApp com n8n e OpenAI?

Receba o áudio via webhook (Evolution ou Cloud API), converta para binário e envie ao speech-to-text (Whisper/OpenAI). Depois devolva o texto na conversa ou grave no CRM.

Dá para analisar imagem no mesmo fluxo n8n?

Sim: separe o ramo de imagem (MIME/tamanho) e use um modelo vision como GPT-4o. Não misture áudio e imagem no mesmo nó sem Switch.

Preciso da Evolution API ou da API oficial do WhatsApp?

Os dois funcionam no padrão webhook → n8n. Para produção e compliance, prefira a Cloud API oficial; Evolution é comum em labs e self-host.

O áudio precisa vir em base64 no n8n?

Em vários setups Evolution o payload vem em base64: use Convert to File antes do Whisper. Sem binário válido, a transcrição falha.

Continue explorando

Perguntas frequentes

Como transcrever áudio do WhatsApp com n8n e OpenAI?

Receba o áudio via webhook (Evolution ou Cloud API), converta para binário e envie ao speech-to-text (Whisper/OpenAI). Depois devolva o texto na conversa ou grave no CRM.

Dá para analisar imagem no mesmo fluxo n8n?

Sim: separe o ramo de imagem (MIME/tamanho) e use um modelo vision como GPT-4o. Não misture áudio e imagem no mesmo nó sem Switch.

Preciso da Evolution API ou da API oficial do WhatsApp?

Os dois funcionam no padrão webhook → n8n. Para produção e compliance, prefira a Cloud API oficial; Evolution é comum em labs e self-host.

O áudio precisa vir em base64 no n8n?

Em vários setups Evolution o payload vem em base64: use Convert to File antes do Whisper. Sem binário válido, a transcrição falha.