Skip to main content
PromptQuorum
Início/LLMs locais/Instalar LM Studio: configuração de interface gráfica para macOS, Windows e Linux
Getting Started

Instalar LM Studio: configuração de interface gráfica para macOS, Windows e Linux

·7 min de leitura·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

LM Studio é um aplicativo de desktop que permite explorar, baixar e executar LLMs locais por meio de uma interface gráfica, sem necessidade de comandos no terminal. Funciona no macOS, Windows e Linux, e inclui uma interface de chat integrada e um servidor local compatível com OpenAI.

LM Studio é um aplicativo de desktop que permite explorar, baixar e executar LLMs locais por meio de uma interface gráfica, sem necessidade de comandos no terminal. Funciona no macOS, Windows e Linux, e inclui uma interface de chat integrada e um servidor local compatível com OpenAI. O LM Studio suporta qualquer modelo GGUF quantizado do Hugging Face.

Instalar LM Studio: configuração de interface gráfica para macOS, Windows e Linux

Key Takeaways

  • LM Studio é a maneira mais fácil de executar LLMs locais — sem terminal, sem Python.
  • Baixe em lmstudio.ai, instale, pesquise um modelo (ex.: Llama 3.2 3B Q4), baixe e converse.
  • Inclui servidor local compatível com OpenAI — use como substituto da API do ChatGPT.
  • Funciona no macOS (Apple Silicon e Intel), Windows e Linux.
  • Requer: 8 GB RAM mínimo, 8 GB de espaço em disco para o primeiro modelo.

O LM Studio é um aplicativo de desktop gratuito para macOS, Windows e Linux que permite explorar, baixar e conversar com qualquer modelo GGUF quantizado do Hugging Face por meio de uma interface gráfica, sem comandos de terminal e com um servidor local compatível com OpenAI integrado.

Se você não quer usar a linha de comando, o LM Studio é a forma de apontar e clicar para rodar modelos de IA no seu próprio computador. Baixe o app, procure um modelo pelo nome dentro dele, clique em baixar e comece a conversar -- todo o processo leva menos de 5 minutos e inclui um servidor integrado para que outros apps também possam usá-lo.

O que é o LM Studio?

LM Studio é um aplicativo de desktop gratuito que facilita o download e execução de LLMs locais sem linha de comando.

Funcionalidades principais: interface de chat integrada, biblioteca de modelos do Hugging Face, servidor local compatível com OpenAI (porta 1234), suporte a múltiplas plataformas (macOS, Windows, Linux).

Requisitos do sistema

ComponenteMínimoRecomendado
RAM8 GB16 GB+
Espaço em disco8 GB (modelo 7B)50 GB+
GPUNenhuma (CPU-only)8 GB VRAM
macOSmacOS 13+Apple Silicon (M1+)
WindowsWindows 10 64-bitWindows 11 com GPU NVIDIA

Como baixar e instalar o LM Studio

  1. 1
    Acesse lmstudio.ai no navegador.
  2. 2
    Clique em Download e selecione sua plataforma (macOS, Windows, Linux).
  3. 3
    Abra o arquivo baixado e siga as instruções de instalação.
  4. 4
    Inicie o LM Studio — a janela principal aparece com a barra de pesquisa de modelos.
Fluxo de instalação do LM Studio: baixe em lmstudio.ai, instale no macOS, Windows ou Linux, procure um modelo GGUF no Hugging Face, escolha a quantização Q4_K_M (~4,5 GB) e comece a conversar em 5-30 segundos.
Fluxo de instalação do LM Studio: baixe em lmstudio.ai, instale no macOS, Windows ou Linux, procure um modelo GGUF no Hugging Face, escolha a quantização Q4_K_M (~4,5 GB) e comece a conversar em 5-30 segundos.

Como buscar e baixar um modelo no LM Studio

Use a aba de busca (ícone de lupa na barra lateral esquerda) para encontrar modelos:

  1. 1
    Clique na aba Search na barra lateral esquerda.
  2. 2
    Digite o nome de um modelo -- por exemplo "llama 3.1" ou "phi-3 mini".
  3. 3
    O LM Studio exibe os modelos GGUF correspondentes do Hugging Face, com tamanho de arquivo e opções de quantização.
  4. 4
    Selecione um nível de quantização. Para 8 GB de RAM: escolha Q4_K_M (~4,5 GB para um modelo 7B). Para 16 GB de RAM: Q5_K_M ou Q6_K oferecem melhor qualidade.
  5. 5
    Clique na seta de download. O progresso aparece na aba Downloads.
Guia de quantização por RAM no LM Studio: 8 GB de RAM comportam Q4_K_M (~4,5 GB, ~1% de perda de qualidade); 16 GB de RAM comportam Q5_K_M ou Q6_K (~5,7-6,5 GB, quase sem perdas), com folga para contexto de 8K+ tokens.
Guia de quantização por RAM no LM Studio: 8 GB de RAM comportam Q4_K_M (~4,5 GB, ~1% de perda de qualidade); 16 GB de RAM comportam Q5_K_M ou Q6_K (~5,7-6,5 GB, quase sem perdas), com folga para contexto de 8K+ tokens.

Como começar a conversar com um modelo no LM Studio

  1. 1
    Clique na aba Chat (ícone de balão de fala) na barra lateral esquerda.
  2. 2
    No topo da janela de chat, clique no menu suspenso de seleção de modelo e escolha o modelo baixado.
  3. 3
    O LM Studio carrega o modelo na memória -- isso leva de 5 a 30 segundos, dependendo do tamanho do modelo e do hardware.
  4. 4
    Digite sua mensagem no campo de entrada na parte inferior e pressione Enter ou clique em Enviar.
  5. 5
    A resposta do modelo é transmitida token a token. A velocidade de geração aparece na barra de status na parte inferior da janela.

Como ajustar as configurações do modelo no LM Studio

O painel direito na aba Chat expõe os principais parâmetros de inferência:

  • Temperature (padrão 0,8): controla a aleatoriedade da resposta. Valores mais baixos (0,1-0,4) produzem saídas mais focadas e previsíveis. Valores mais altos (0,8-1,2) produzem saídas mais variadas e criativas.
  • Context Length (padrão 4096 tokens): o histórico máximo de conversa que o modelo consegue processar. Um contexto maior usa mais RAM. A maioria dos modelos 7B suporta de 4096 a 8192 tokens.
  • GPU Layers (macOS/Linux/Windows com GPU): quantas camadas do modelo são descarregadas para a GPU. Defina o máximo para a inferência mais rápida se sua GPU tiver VRAM suficiente.
  • System Prompt: uma instrução persistente adicionada antes de cada conversa. Use isso para definir o papel ou o comportamento do modelo.

Como ativar o servidor local do LM Studio

O LM Studio inclui um servidor local que imita a API da OpenAI. Qualquer aplicativo compatível com a OpenAI pode usar seu modelo local por meio deste servidor:

  1. 1
    Clique na aba Local Server (ícone "<->") na barra lateral esquerda.
  2. 2
    Selecione um modelo no menu suspenso na parte superior.
  3. 3
    Clique em "Start Server". O servidor inicia em http://localhost:1234.
  4. 4
    Seu aplicativo deve definir `base_url = "http://localhost:1234/v1"` e usar qualquer string como chave de API (o servidor aceita qualquer valor).

Conectar ao LM Studio via linha de comando

bash
# O LM Studio inclui um servidor local compatível com OpenAI
# Inicie-o via Menu → Local Server → Start Server
# Então use com qualquer cliente OpenAI:

curl http://localhost:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"messages": [{"role": "user", "content": "Olá!"}], "model": "local-model"}'

LM Studio ou Ollama: qual usar?

FatorLM StudioOllama
InterfaceApp de desktop gráficoTerminal + API
Fonte de modelosHugging Face (qualquer GGUF)Biblioteca Ollama (curada, ~200)
Porta da APIlocalhost:1234localhost:11434
GerenciamentoNavegador GUI c/ tamanhoComandos CLI (pull, list, rm)
AutomaçãoLimitada (focada em GUI)Forte (scripts, Docker, CI)
Ideal paraIniciantes, usuários de GUIDesenvolvedores, automação

Solução de problemas comuns do LM Studio

O LM Studio mostra "Not enough memory to load model"

O modelo requer mais RAM do que a disponível. Feche outros aplicativos para liberar memória ou selecione uma quantização menor (Q3_K_S em vez de Q4_K_M). Regra geral: multiplique o tamanho do arquivo do modelo por 1,2 para estimar a RAM necessária. Um arquivo de 4,5 GB precisa de ~5,4 GB de RAM livre.

O modelo gera texto muito devagar (menos de 5 tokens/seg)

O modelo está rodando totalmente na CPU. Verifique GPU Layers no painel direito -- se mostrar 0, sua GPU não está sendo usada. No macOS, o LM Studio ativa o Metal (GPU) automaticamente para Apple Silicon. No Windows/Linux com NVIDIA, verifique se o driver está atualizado e aumente GPU Layers para o valor máximo exibido.

Não encontro um modelo específico na busca do LM Studio

O LM Studio busca arquivos GGUF no Hugging Face. Se um modelo não aparecer, tente buscar diretamente pelo nome do repositório do Hugging Face (ex.: "bartowski/Llama-3.1-8B-Instruct-GGUF"). Alguns modelos mais recentes podem ainda não estar indexados.

O servidor local retorna erros "model not found"

É necessário carregar um modelo na aba Local Server antes que o servidor possa responder. Abra a aba Local Server, selecione um modelo no menu suspenso e clique em Start Server. O nome do modelo nas requisições de API pode ser qualquer string -- o LM Studio usa o modelo atualmente carregado.

Erros comuns ao instalar o LM Studio

  • Não alocar RAM suficiente do sistema para o modelo selecionado nas configurações do LM Studio.
  • Usar um modelo pré-quantizado que ainda é grande demais para a VRAM da sua GPU.
  • Esperar respostas instantâneas de modelos grandes em sistemas somente CPU -- o tempo de resposta será de 10 a 30 segundos.

Fontes

  • Site oficial do LM Studio -- Downloads e documentação
  • Hugging Face Model Hub -- Amplo catálogo de modelos quantizados GGUF
  • GitHub do LM Studio -- Código-fonte e discussões da comunidade

Perguntas frequentes sobre LM Studio

O LM Studio é gratuito?

Sim, o LM Studio é gratuito para uso pessoal. Requer uma licença comercial para uso em produção em contextos empresariais.

LM Studio ou Ollama — qual devo usar?

LM Studio para iniciantes que preferem GUI. Ollama para usuários avançados que preferem linha de comando e integração com API. Ambos são gratuitos e executam os mesmos modelos.

Posso usar o LM Studio em português?

A interface do LM Studio está em inglês, mas você pode conversar com os modelos em qualquer idioma, incluindo português. Escolha modelos multilíngues como Aya 8B ou Qwen para melhor suporte ao PT-BR.

Quais são os requisitos mínimos do LM Studio?

Mínimo: 8 GB de RAM, macOS 13.6, Windows 10 ou Ubuntu 22.04. GPU não é obrigatória -- Macs com Apple Silicon e GPUs NVIDIA/AMD são suportados para aceleração.

Qual quantização usar no LM Studio com 8 GB de RAM?

Q4_K_M é a quantização recomendada para sistemas com 8 GB de RAM. Ela oferece o melhor equilíbrio entre qualidade do modelo e uso de memória para modelos 7B (~4,5 GB de arquivo).

O LM Studio inclui uma API compatível com a OpenAI?

Sim. Ative a aba Local Server no LM Studio para iniciar uma API compatível com a OpenAI em http://localhost:1234. Qualquer app que use o SDK da OpenAI pode se conectar usando essa URL como base_url.

Posso usar o LM Studio no Linux?

Sim. Baixe o arquivo .AppImage em lmstudio.ai. Torne-o executável com chmod +x LM-Studio-*.AppImage e execute-o. Não é necessária instalação no sistema -- ele roda como um app portátil.

Como encontro e baixo modelos no LM Studio?

Clique na aba Search (lupa) na barra lateral, busque pelo nome do modelo (ex.: "llama 3.1"), selecione um nível de quantização (Q4_K_M para 8 GB de RAM) e clique na seta de download.

Nota sobre informações de terceiros

Este artigo faz referência a modelos de IA, benchmarks, preços e licenças de terceiros. O cenário da IA muda rapidamente. Pontuações de benchmark, termos de licença, nomes de modelos e preços de API podem mudar entre o momento em que foi escrito e quando você está lendo. Antes de tomar decisões de implantação ou conformidade com base neste artigo, verifique os dados atuais na fonte oficial de cada fornecedor: fichas de modelos do Hugging Face para licenças e benchmarks, sites dos fornecedores para preços de API e EUR-Lex para o texto atual do GDPR e da Lei de IA da UE.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs