Guia prático

IA grátis para usar localmente

Rodar IA localmente garante soberania total de dados, elimina limites de mensagens e funciona 100% offline. Para desenvolvedores, permite criar APIs locais compatíveis com a OpenAI e RAG seguro em documentos confidenciais.

Modelos de IA local ainda são limitados e podem estar desatualizados em relação aos modelos de nuvem. Evite usá-los para decisões sobre saúde, finanças, questões jurídicas ou outros assuntos sensíveis — para esses casos, prefira fontes confiáveis ou profissionais qualificados.

Opções para começar

IA local / self-hosted

Ollama

Servidor e ferramenta de linha de comando para rodar LLMs e modelos multimodais no seu próprio computador com API compatível com a OpenAI.

Grátis: 100% grátis e de código aberto (MIT) — sem assinaturas, cotas ou telemetria forçada; o único limite é o har…

Open source / localPT
IA local / self-hosted

LM Studio

Ambiente visual para baixar, testar e conversar com modelos GGUF locais no Windows, Mac e Linux com servidor local de 1 clique.

Grátis: Totalmente gratuito para uso pessoal e offline — sem contas obrigatórias, sem mensalidade e sem envio de da…

Open source / localPT
IA local / self-hosted

Jan

Cliente de chat open-source para rodar modelos de IA 100% offline, com motor llama.cpp e servidor local embutido.

Grátis: 100% gratuito e de código aberto (AGPLv3) — sem contas, telemetria intrusiva ou limites artificiais de uso.

Open source / localPT
Famílias de modelos abertos

Llama

Família de LLMs open-weight da Meta (Llama 3.x / 4): roda localmente via Ollama/LM Studio ou em provedores de nuvem.

Grátis: Pesos disponíveis no Hugging Face / repositórios oficiais para download gratuito. Uso local ilimitado (só h…

Open source / localPT
Famílias de modelos abertos

Gemma

Família open-weight do Google DeepMind (Gemma 3 / 4): modelos compactos e multimodais para rodar localmente ou em Vertex / AI Studio.

Grátis: Pesos gratuitos no Kaggle, Hugging Face e Google AI. Uso local ilimitado. A geração Gemma 4 passou a ser di…

Open source / localPT
Famílias de modelos abertos

Mistral

Família open-weight da Mistral AI (Mistral Small/Nemo, Mixtral, Codestral…): ótima relação qualidade × tamanho para rodar localmente.

Grátis: Pesos Apache 2.0 (na maioria das variantes abertas) no Hugging Face / Ollama. Uso local ilimitado. O chat w…

Open source / localPT
Famílias de modelos abertos

Phi

Família de SLMs da Microsoft (Phi-3 / Phi-4): modelos pequenos e capazes para CPU/GPU modesta, com pesos no Hugging Face e Azure.

Grátis: Pesos open-weight gratuitos (licença MIT nas linhas Phi-3/4 publicadas). Uso local ilimitado. Azure AI pode…

Open source / localPT
Chatbots e assistentes

DeepSeek

Modelos abertos de raciocínio e linguagem geral da DeepSeek (R1, V3.x e V4), distribuídos sob licença permissiva MIT.

Grátis: Chat web e aplicativo gratuitos, com limites de uso. Pesos abertos no Hugging Face sob licença MIT para exe…

FreemiumPT
Chatbots e assistentes

Qwen

Família de modelos da Alibaba (geração Qwen 3.6) com chat web gratuito e variantes especializadas em código (Qwen-Coder), também disponíveis para rodar localmente.

Grátis: Qwen Chat (chat.qwen.ai) gratuito para conversar e pedir código. Variantes open-weight (ex.: Qwen 3.6, Qwen…

GrátisPT
Transcrição, TTS e tradução

Whisper

Modelo de reconhecimento de fala para transcrição multilíngue e tradução de fala para inglês.

Grátis: Código e pesos sob licença MIT; pode rodar localmente ou em infraestrutura própria. Consulte o site oficial…

Open source / localPT
Geração de imagem

Stable Diffusion

Família de modelos de geração de imagens com variantes usadas em ferramentas locais e serviços.

Grátis: Pesos de variantes disponíveis e serviços de inferência. Consulte o site oficial para os limites gratuitos…

Open source / localPT
Geração de imagem

FLUX

Família de modelos abertos de difusão latente de última geração com variantes schnell (Apache 2.0) e dev.

Grátis: O modelo FLUX.1 schnell é 100% de código aberto sob licença Apache 2.0 (uso comercial liberado e gratuito p…

Open source / localPT

Quanto de memória (RAM e VRAM) você precisa?

Para rodar modelos de linguagem no seu computador sem travamentos, o fator mais importante é a memória de execução livre (RAM do sistema ou VRAM dedicada da sua placa de vídeo), não o espaço do seu SSD.

Sua configuraçãoTamanho ideal (Q4)O que esperar na prática
8 GB RAM (ou Mac M1/M2/M3)1B a 3B (ex: Qwen 3.6 4B, Gemma 4 4B)Memória no limite. Feche outros aplicativos pesados (navegador com muitas abas) e mantenha conversas curtas.
16 GB RAM (ou Mac com 16 GB)3B a 8B (ex: Qwen 3.6 8B, Gemma 4 12B)Ponto de partida ideal. Bom equilíbrio entre velocidade, raciocínio em português e síntese de textos.
32 GB+ RAM8B a 14B (ex: Qwen 3.6 14B)Capacidade de carregar documentos e códigos maiores. A velocidade dependerá da força da CPU/GPU.
6 a 8 GB VRAM dedicada (NVIDIA/AMD)3B a 8B Q4Respostas muito velozes (15 a 40 tokens/s). Deixe 1 GB livre para a exibição do Windows/monitor.
12 a 16 GB VRAM dedicada8B a 14B Q4Desempenho de nível profissional para tarefas de programação e análise densa de documentos.

💡 Três regras de ouro antes de baixar um modelo:

  • Armazenamento em SSD não é memória RAM: Ter 1 TB de SSD livre significa apenas que você tem espaço para guardar arquivos, não que o seu computador aguenta rodar um modelo de 70B em tempo de execução.
  • Não some RAM e VRAM: Dividir camadas de um modelo entre GPU e CPU costuma ser muito mais lento do que rodar um modelo menor (ex: 8B) que caiba 100% na VRAM da placa de vídeo.
  • Prefira modelos com final "Instruct" ou "Chat" e formato ".gguf": Modelos marcados como "Base" são voltados para treino de desenvolvedores e não sabem manter um diálogo coerente.
🎓 Ver Ementa do Curso Prático de IA Local (16h-24h) ➔📖 Ler Guia Técnico Completo de Hardware e Modelos GGUF ➔

Como escolher

Para chat visual imediato e testes de modelos GGUF, escolha o LM Studio ou Jan. Para automações, terminal e endpoints locais de desenvolvimento, prefira o Ollama. Para áudio offline, use Whisper; para imagens, Stable Diffusion ou FLUX.

Para ver o catálogo completo com mais opções e filtros, confira a categoria IA local / self-hosted.

Os planos e limites podem mudar. Abra a ficha de cada ferramenta e confirme a oferta atual no site oficial antes de depender dela para um projeto.