SSD Nodes Learn Hosting plans →
Guias Matt ConnorPor Matt Connor

IA gratuita no n8n: Ollama local ou API com plano grátis

Há dois tipos de IA gratuita no n8n: um modelo seu com Ollama na mesma VPS, ou um plano grátis como o da Gemini API. Veja cotas, uso dos dados e quando vale pagar.

Qual IA gratuita você pode usar no n8n?

Para ter IA gratuita no n8n, existem dois caminhos. O primeiro é rodar um modelo seu com o Ollama, na mesma VPS (servidor virtual privado) do n8n: não há cobrança por chamada, mas o modelo consome RAM e tempo de CPU (processador). O segundo é o plano gratuito de uma API (interface de programação de aplicações) hospedada, como a Gemini API do Google: nada roda no seu servidor, mas há limite de pedidos por dia, e o provedor pode usar o que você envia.

Essa diferença importa porque o n8n self-hosted é grátis, mas o nó AI Agent não traz modelo nenhum. Ele só organiza o trabalho. Quem gera o texto é um sub-nó de modelo de chat, e é esse sub-nó que decide quem recebe os seus dados e quanto isso custa. Se você ainda está escolhendo a edição do n8n, o que a edição Community gratuita do n8n inclui e o que fica no Enterprise responde essa parte. Este guia trata só do modelo.

Os dois tipos de grátis, lado a lado

Modelo local com Ollama. O Ollama baixa um LLM (modelo de linguagem grande) e o serve por uma API HTTP na porta 11434. O n8n fala com essa API pelo sub-nó Ollama Chat Model. Os prompts nunca saem da sua VPS. O custo é físico: o modelo inteiro precisa caber na RAM, e numa VPS sem GPU cada resposta é calculada pela CPU, por isso demora. Quanto de memória cada tamanho de modelo exige está explicado em qual tamanho de LLM cabe na RAM da sua VPS. Faça essa conta antes de escolher o plano da VPS.

Plano gratuito de API hospedada. Você cria uma chave, cola numa credencial do n8n e usa o sub-nó do provedor. A resposta chega rápido porque roda no hardware do provedor. O custo aqui é outro: cotas pequenas e, em vários planos, a permissão para o provedor ler ou reutilizar os seus prompts.

Nenhum dos dois é grátis no sentido de custo zero. Um cobra em hardware. O outro cobra em limites e em dados.

O que os planos gratuitos de API oferecem em outubro de 2026

Cotas de plano gratuito mudam sem aviso. Os números abaixo foram lidos nas páginas oficiais em 3 de outubro de 2026. Confira de novo antes de construir algo em cima deles.

Gemini API, do Google

A página de cotas e preços do Gemini CLI, em geminicli.com, lista o que vem com uma chave da Gemini API no plano gratuito: no máximo 250 pedidos por usuário por dia, e acesso só aos modelos Flash. Os limites por modelo da própria API aparecem no Google AI Studio, na página de limites do seu projeto, e mudam com frequência. No n8n, a chave entra numa credencial do Google Gemini, e o sub-nó é o Google Gemini Chat Model.

O ponto sensível são os dados. Os Termos Adicionais da Gemini API dizem que, nos serviços não pagos (o Google AI Studio e a cota gratuita da API), o Google usa o conteúdo enviado e as respostas geradas para melhorar e desenvolver os seus produtos e as suas tecnologias de aprendizado de máquina. Os mesmos termos dizem que revisores humanos podem ler, anotar e processar as entradas e as saídas da API. O Google afirma que desvincula esses dados da sua conta e da sua chave antes da revisão. Mesmo assim, um texto de cliente enviado pela cota gratuita pode ser lido por uma pessoa.

Para quem está na Europa, a regra é diferente. Os termos dizem que, para usuários no EEE (Espaço Econômico Europeu), na Suíça ou no Reino Unido, as regras de uso de dados dos serviços pagos valem para tudo, inclusive para a cota gratuita. Dizem também que só serviços pagos podem ser usados quando você oferece uma aplicação cliente da API a usuários nessas regiões. Portanto, em Portugal, um workflow que atende clientes precisa da camada paga. Ativar o faturamento num projeto também muda a classificação: a partir daí, todo o uso desse projeto é tratado como pago no que diz respeito aos dados, e todo o consumo passa a ser cobrado.

Groq

A página de limites da Groq mostra, no plano gratuito, para o modelo openai/gpt-oss-20b: 30 pedidos por minuto, 1.000 pedidos por dia, 8.000 tokens por minuto e 200.000 tokens por dia. A página de dados da Groq diz que, por padrão, ela não guarda os dados das requisições de inferência. A exceção é uma retenção temporária de até 30 dias para confiabilidade do sistema e monitoramento de abuso. Essa página não fala sobre treino de modelos, então leia os termos de serviço antes de enviar dados pessoais. No n8n, o sub-nó é o Groq Chat Model.

OpenRouter

O OpenRouter dá acesso a modelos com o sufixo :free. Sem créditos comprados, o limite é de 20 pedidos por minuto e 50 por dia. Depois de comprar pelo menos 10 dólares em créditos, o limite diário sobe para 1.000. Atrás do OpenRouter há vários provedores, e alguns podem treinar modelos com os seus prompts. Nas configurações de privacidade da conta existe uma opção separada para modelos gratuitos, que bloqueia esses provedores. Ajuste essa opção antes do primeiro teste. No n8n, o sub-nó é o OpenRouter Chat Model.

Para testar uma ideia com dados de exemplo, esses planos bastam. Para dados de clientes, leia a política de cada provedor antes de ligar o workflow, e não depois.

LGPD e RGPD: quando o plano grátis vira um problema

No Brasil vale a LGPD (Lei Geral de Proteção de Dados Pessoais). Em Portugal vale o RGPD (Regulamento Geral sobre a Proteção de Dados). As duas leis tratam de dados pessoais: um nome, um e-mail, um telefone, o texto de um chamado de suporte. Um workflow que resume e-mails de clientes envia esses dados ao provedor do modelo a cada execução.

Se o provedor pode usar esse conteúdo para melhorar os próprios modelos, você está repassando dados pessoais para uma finalidade que o seu cliente não aceitou. Pela lei, quem precisa justificar esse repasse é você, como controlador dos dados. Isto não é aconselhamento jurídico. É o motivo pelo qual a pergunta "o plano grátis usa os meus prompts?" precisa de resposta antes de o workflow tocar em dados reais.

Com o Ollama na sua VPS, a pergunta muda. O dado continua no seu servidor, no país que você escolheu. A responsabilidade de proteger esse servidor continua sendo sua.

Como rodar n8n e Ollama na mesma VPS com Docker Compose

Os passos abaixo partem de uma VPS com Docker e o plugin Compose já instalados. Se você ainda não tem isso, o guia de instalação do n8n numa VPS com Docker e HTTPS cobre a instalação do Docker e o certificado TLS (transport layer security) para o seu domínio. Aqui o foco é colocar o Ollama ao lado do n8n.

Crie uma pasta e um arquivo compose.yaml. As versões estão fixadas: n8nio/n8n:2.41.6 era a versão estável do n8n, e ollama/ollama:0.35.1 a versão mais recente do Ollama, em 3 de outubro de 2026. Fixar a tag significa que um docker compose pull nunca troca a versão sem você decidir.

mkdir -p ~/n8n-ia && cd ~/n8n-ia
nano compose.yaml
services:
  n8n:
    image: n8nio/n8n:2.41.6
    restart: unless-stopped
    ports:
      - "127.0.0.1:5678:5678"
    environment:
      - GENERIC_TIMEZONE=America/Sao_Paulo
      - TZ=America/Sao_Paulo
    volumes:
      - n8n_data:/home/node/.n8n
    networks:
      - ia
    depends_on:
      - ollama

  ollama:
    image: ollama/ollama:0.35.1
    restart: unless-stopped
    volumes:
      - ollama_data:/root/.ollama
    networks:
      - ia

networks:
  ia:

volumes:
  n8n_data:
  ollama_data:

Duas decisões deste arquivo precisam de explicação.

O serviço ollama não tem seção ports. A API do Ollama não tem autenticação, então qualquer pessoa que alcance a porta 11434 pode usar o seu modelo e a sua CPU. Sem ports, a porta só existe dentro da rede ia. O n8n está na mesma rede, e o DNS interno do Docker resolve o nome ollama para o contêiner certo.

O n8n escuta só em 127.0.0.1, ou seja, não fica exposto na internet. Você acessa o editor por um túnel SSH. Para abrir o n8n ao público com um domínio, siga o guia de HTTPS citado acima. Em Portugal, troque America/Sao_Paulo por Europe/Lisbon.

Suba os serviços e confira o resultado:

docker compose up -d
docker compose ps
docker compose logs n8n | tail -n 5

docker compose ps deve listar os dois serviços com o status Up. O log do n8n deve conter a linha Editor is now accessible via:. Se o serviço n8n aparece reiniciando sem parar, leia o log completo com docker compose logs n8n, porque a causa aparece ali.

No seu computador, abra o túnel e depois acesse http://localhost:5678 no navegador para criar a conta de administrador:

ssh -L 5678:127.0.0.1:5678 usuario@IP_DA_VPS

Baixe um modelo e meça a velocidade da sua CPU

O contêiner do Ollama começa vazio. Baixe um modelo pequeno para validar a ligação:

docker compose exec ollama ollama pull llama3.2:3b
docker compose exec ollama ollama list
docker compose exec ollama ollama show llama3.2:3b

O llama3.2:3b serve aqui só como exemplo para testar o caminho completo. Não é uma recomendação. Para escolher o modelo do seu caso, veja como rodar o Ollama numa VPS e escolher o modelo.

O ollama show imprime um bloco Capabilities. Se tools aparece nesse bloco, o Ollama aceita enviar definições de ferramentas para esse modelo. O nó AI Agent depende disso para chamar ferramentas. Mas tools na lista só garante que o pedido é aceito. Não garante que o modelo escolhe a ferramenta certa. Isso só um teste mostra, e o teste está mais abaixo.

Agora meça a velocidade na sua própria VPS:

docker compose exec ollama ollama run --verbose llama3.2:3b 'Explique em duas frases o que é o n8n.'

Com --verbose, o Ollama imprime estatísticas no fim da resposta. A linha eval rate mostra quantos tokens por segundo a sua CPU gerou. Anote esse número. Ele muda com o tamanho do modelo, com o tamanho do prompt, com o número de vCPUs e com a carga do servidor, por isso este guia não publica um valor. O número que importa é o da sua VPS.

Se o comando falha com model requires more system memory, o modelo não cabe na RAM livre. A mensagem mostra quanto ele pede e quanto há disponível. Escolha um modelo menor ou um plano com mais memória.

Por padrão, o Ollama descarrega o modelo da memória depois de 5 minutos sem uso. A próxima chamada recarrega o modelo do disco, e a primeira resposta fica mais lenta. Num workflow que roda de hora em hora, você vai ver esse atraso em toda execução. A solução está em como manter o modelo do Ollama carregado na memória.

Por que a credencial do Ollama no n8n não pode usar localhost

A credencial Ollama do n8n vem preenchida com http://localhost:11434. Dentro do contêiner do n8n, localhost é o próprio contêiner do n8n. Nada escuta na porta 11434 ali dentro, então a conexão é recusada. O endereço certo usa o nome do serviço do Compose.

  1. No n8n, crie uma credencial nova e procure por Ollama.
  2. Em Base URL, troque http://localhost:11434 por http://ollama:11434.
  3. Deixe o campo API Key vazio. Ele só serve para um Ollama remoto atrás de um proxy com autenticação.
  4. Salve. O n8n testa a conexão ao salvar.

Se o teste falha com connect ECONNREFUSED seguido de 127.0.0.1:11434 ou ::1:11434, a Base URL ainda aponta para localhost. Se a mensagem é getaddrinfo ENOTFOUND ollama ou getaddrinfo EAI_AGAIN ollama, o nome ollama não existe na rede do n8n. Isso acontece quando o Ollama foi iniciado em outro projeto Compose, ou sem a rede ia.

Como ligar o AI Agent ao Ollama Chat Model

  1. Crie um workflow novo e adicione o gatilho When chat message received.
  2. Adicione o nó AI Agent depois do gatilho.
  3. No conector Chat Model do AI Agent, adicione o sub-nó Ollama Chat Model, escolha a credencial criada e o modelo llama3.2:3b.
  4. No conector Tool, adicione a ferramenta Calculator.
  5. Clique em Open chat e envie uma mensagem.

A lista de modelos do sub-nó vem do próprio Ollama. Se ela aparece vazia, nenhum modelo foi baixado no contêiner ollama. Volte ao ollama pull.

Para testar a chamada de ferramenta, pergunte algo que exige a calculadora, como "Quanto é 48213 vezes 977?". Depois abra o log de execução do nó AI Agent. Se o modelo usou a ferramenta, você vê uma chamada à Calculator com a conta como entrada. Se ele respondeu direto, com um número errado, ignorou a ferramenta. Se a execução falha com uma mensagem que termina em does not support tools, o modelo não tem essa capacidade. Confirme com ollama show e troque de modelo.

O comportamento varia entre modelos, e varia até entre execuções do mesmo modelo. Rode o seu workflow real várias vezes antes de confiar nele. Para montar um agente com memória e mais ferramentas, veja como montar um AI Agent no n8n com ferramentas e memória.

O prompt de um agente é longo, porque inclui a descrição de cada ferramenta e o histórico da conversa. Se ele passa da janela de contexto configurada, o Ollama corta o começo do prompt, e o modelo perde instruções. Procure truncating input prompt em docker compose logs ollama. A correção está em como ajustar a janela de contexto do Ollama com num_ctx. Se as chamadas expiram antes da resposta chegar, leia o que fazer quando o Ollama demora demais e a chamada expira.

Um atalho: o self-hosted AI starter kit do n8n

A equipe do n8n mantém um repositório que junta n8n, Ollama, Qdrant e PostgreSQL num só Compose. Ele não tem tags de versão, e o README diz que o kit serve para projetos de prova de conceito e não está totalmente otimizado para produção. Se quiser usar o kit, fixe um commit, para que um clone feito amanhã não traga outro arquivo:

git clone https://github.com/n8n-io/self-hosted-ai-starter-kit.git
cd self-hosted-ai-starter-kit
git checkout 662bd8892476b41d9084417a569cc84013354674
cp .env.example .env
nano .env
docker compose --profile cpu up

Esse commit, de 23 de julho de 2026, era o mais recente em 3 de outubro de 2026. Troque as senhas no .env antes do up. Abra também o docker-compose.yml e veja as tags de imagem. Se alguma for móvel, como latest, fixe uma versão você mesmo.

Qual IA gratuita escolher para o seu n8n

  • Ollama na sua VPS para workflows privados e de pouco volume, que podem esperar a resposta: classificar e-mails internos durante a noite, resumir documentos da equipe. O dado fica no seu servidor, e o custo é um plano com RAM suficiente.
  • Um plano gratuito de API para experimentar: validar uma ideia em uma tarde, com dados fictícios. No Brasil, não use dados de clientes sem ler a política do provedor. Em Portugal, com clientes, a cota gratuita da Gemini API não é permitida.
  • Uma API paga quando o workflow carrega dados de clientes ou precisa de resposta rápida. Nos termos pagos da Gemini API, o conteúdo não é usado para melhorar os produtos do Google.
  • Os dois juntos quando só uma parte do workflow é sensível. Cada AI Agent no n8n tem o seu próprio sub-nó de modelo, então a etapa que lê dados pessoais pode usar o Ollama e o resto pode usar uma API.

FAQ

Qual é a IA gratuita mais fácil de ligar ao n8n?

Um plano gratuito de API hospedada, como o da Gemini API, é o mais rápido: você cria a chave, cola na credencial e escolhe o sub-nó Google Gemini Chat Model. Em 3 de outubro de 2026, a página de cotas do Gemini CLI listava 250 pedidos por usuário por dia, só com modelos Flash. O Ollama exige mais trabalho na instalação, mas não tem cota diária e mantém os prompts no seu servidor.

Por que o n8n não consegue conectar ao Ollama em localhost?

Quando o n8n roda em Docker, localhost dentro do contêiner é o próprio n8n, e nada escuta na porta 11434 ali. O resultado é um erro connect ECONNREFUSED. Coloque os dois serviços na mesma rede do Compose e use o nome do serviço na Base URL da credencial, por exemplo http://ollama:11434.

Posso usar o plano grátis da Gemini API com dados de clientes?

Fora da Europa, os termos da Gemini API dizem que o conteúdo enviado pela cota gratuita é usado para melhorar os produtos do Google e pode ser lido por revisores humanos. Com dados pessoais, isso é um repasse que você precisa justificar pela LGPD. No EEE, na Suíça e no Reino Unido, os termos exigem serviços pagos quando você oferece a aplicação a usuários nessas regiões, o que inclui clientes em Portugal.

Quanta RAM preciso para rodar o Ollama junto com o n8n?

Depende do modelo. O modelo inteiro precisa caber na RAM livre, somado ao que o n8n e o sistema já usam. Se não couber, o Ollama falha com model requires more system memory e mostra quanto pede e quanto há livre. Calcule o tamanho do modelo antes de escolher o plano da VPS, e meça a velocidade com ollama run --verbose.