Skip to main content
PromptQuorum
Início/LLMs locais/VPN e IA local: tudo o que você precisa saber
Privacy & Business

VPN e IA local: tudo o que você precisa saber

·7 min de leitura·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

Membros remotos da equipe podem acessar o servidor LLM local via VPN corporativa sem expô-lo à internet pública. VPN + regras de firewall substituem a assinatura de API na nuvem para equipes distribuídas.

Membros remotos da equipe podem acessar o servidor LLM local via VPN corporativa sem expô-lo à internet pública. VPN + regras de firewall substituem a assinatura de API na nuvem para equipes distribuídas. Este guia cobre configuração, impacto no desempenho e considerações de segurança.

VPN e IA local: tudo o que você precisa saber

Key Takeaways

  • WireGuard é a escolha recomendada: 5-10 ms de latência, configuração em 30 min, 4.000 linhas de código (auditável).
  • OpenVPN é a alternativa: 15 ms de latência, 2 horas de configuração, baseado em certificados.
  • Split tunneling garante que apenas o tráfego do LLM passe pela VPN — o restante usa a internet local do usuário.
  • LGPD/ANPD: a VPN mantém os dados pessoais no hardware da organização durante o trânsito. Documente o fluxo de dados para conformidade.
  • Alternativa sem servidor: Cloudflare Tunnel não expõe IP público, mas cria dependência de fornecedor.

Membros remotos da equipe podem acessar um servidor LLM local via VPN corporativa sem expô-lo à internet pública, permitindo que regras de VPN e firewall substituam uma assinatura de API na nuvem para equipes distribuídas.

Se sua equipe roda um modelo local em um servidor compartilhado, mas trabalha em locais diferentes, uma VPN é a forma de dar acesso a todos sem abrir o servidor para toda a internet. É a mesma abordagem que empresas usam para ferramentas internas -- conecte-se à VPN, e o servidor LLM parece estar na sua rede local, mesmo do outro lado do mundo.

Protocolos VPN: WireGuard vs OpenVPN

Recurso
WireGuard
OpenVPN
RecursoWireGuardOpenVPN
Latência~5ms de overhead~15ms de overhead
Complexidade de configuraçãoSimples (30 min)Complexa (2 horas)
Tamanho do código4.000 LOC (auditável)400K+ LOC (complexo)
AutenticaçãoChave públicaCertificados + chaves
Split tunneling✓ Nativo✓ Requer configuração
VPN corporativa (AD/SAML)Limitado (autenticação manual)Melhor (suporte a RADIUS)
RecomendaçãoUse esteAlternativa se não houver WireGuard

Configuração: servidor VPN na rede LLM

  1. 1
    Instale o WireGuard no servidor VPN (VM Linux na mesma LAN do servidor LLM).
  2. 2
    Gere as chaves: chave privada (segredo do lado do servidor), chaves públicas (distribuídas aos clientes).
  3. 3
    Regra de firewall: permita UDP 51820 (porta padrão do WireGuard) de entrada vindo da internet.
  4. 4
    Configuração do cliente: cada usuário recebe um arquivo .conf com chave privada, endpoint do servidor e IPs permitidos.
  5. 5
    Software cliente: app desktop do WireGuard (Mac, Windows, Linux) ou móvel (iOS, Android).
  6. 6
    Teste: o usuário conecta a VPN, faz ping no servidor LLM (deve responder) e executa a inferência via API.

Impacto no desempenho

Latência: o WireGuard adiciona 5-10 ms. A inferência do LLM já leva 10-100 ms/token, então o impacto é <5% perceptível.

Throughput: limitado pela sua conexão de internet (ex.: 100 Mbps de internet residencial = 12 MB/s = suficiente para LLM).

Exemplo: enviar um prompt de 10KB + receber uma resposta de 5KB = 15KB no total. A 100 Mbps = ~1 ms de latência de rede (insignificante).

Overhead de criptografia: CPUs modernas têm instruções AES-NI. Criptografia/descriptografia a 500 Mbps+ por núcleo.

Split Tunneling (acesso somente ao LLM, não à internet)

Por padrão, a VPN roteia TODO o tráfego (internet + LLM) pelo túnel corporativo.

Isso pode deixar a navegação na internet lenta enquanto o usuário utiliza o LLM.

Split tunneling = apenas o tráfego do LLM passa pela VPN, o tráfego de internet vai direto.

Exemplo de split tunneling no WireGuard: `AllowedIPs = 10.0.0.0/24` (apenas a rede do LLM).

Trade-off: internet mais rápida, mas menos supervisão de segurança (o usuário pode exfiltrar dados fora da VPN).

Recomendação: split tunneling para os usuários (melhor experiência). Monitore com detecção de endpoint (CrowdStrike, SentinelOne).

Fortalecimento de segurança

  • Firewall: permita que apenas o servidor VPN se comunique com o servidor LLM. Descarte todo o restante do tráfego.
  • Rotacione chaves: a cada 6 meses, regenere as chaves dos clientes. Ao desligar usuários, revogue suas chaves imediatamente.
  • Registro: registre as conexões VPN (quem, quando, por quanto tempo). Audite trimestralmente.
  • Senhas: o servidor VPN deve usar apenas chaves SSH (sem autenticação por senha). SSH sem senha via par de chaves.
  • Fail closed: se a VPN cair, o cliente não consegue acessar a internet (a menos que o split tunneling esteja ativado).

Solução de problemas de acesso remoto

Não consegue conectar: verifique as regras de firewall no roteador (UDP 51820 aberto?). Verifique se o serviço WireGuard está rodando (`wg show`).

Inferência lenta: verifique a latência (`ping 10.0.0.1` dentro da VPN, deve ser <20ms). Verifique a largura de banda da internet (`iperf3`).

Timeout de API: a conexão VPN caiu. Verifique os logs (`journalctl -u wg-quick@wg0`). Reinicie o WireGuard.

Um usuário não consegue acessar, outros conseguem: verifique a chave pública do usuário na configuração do servidor. Regenere o par de chaves.

Perguntas frequentes

Posso acessar meu servidor LLM local remotamente sem VPN?

Sim, mas não é recomendado para uso empresarial. Você pode usar o Cloudflare Tunnel (sem exposição de IP público) ou um proxy reverso com autenticação. Para dados sensíveis, VPN + firewall é a arquitetura de menor risco.

WireGuard ou OpenVPN para acesso ao LLM local?

WireGuard para novos setups: menor latência (5-10 ms vs 15 ms), mais simples de configurar e auditar (4.000 vs 400.000+ linhas de código). OpenVPN se sua organização já tem infraestrutura OpenVPN existente.

Usar VPN afeta a velocidade de inferência do LLM?

A VPN afeta apenas a latência de rede (5-15 ms adicionais), não a velocidade de inferência do modelo. O throughput de tokens/seg é determinado pela GPU/CPU local, não pela rede. Para respostas longas, a diferença é imperceptível.

Como configurar split tunneling para o servidor LLM?

No WireGuard: adicione `AllowedIPs = 192.168.1.0/24` (substitua pelo IP do servidor LLM) em vez de `0.0.0.0/0`. Isso garante que apenas o tráfego para o servidor LLM passe pela VPN — o restante usa a conexão local do usuário.

A VPN para LLM local é compatível com LGPD?

A VPN em si não é um requisito da LGPD, mas garante que dados pessoais sejam transmitidos de forma segura entre o usuário remoto e o servidor. A LGPD e a ANPD exigem medidas técnicas adequadas para proteger dados em trânsito — a VPN com criptografia ponta-a-ponta atende a esse requisito.

Posso usar uma VPN corporativa (Okta, Azure)?

Sim, é melhor para equipes grandes. Mas requer integração (RADIUS, SAML). O WireGuard é mais simples para equipes com menos de 20 usuários.

Fontes

  • Documentação oficial do WireGuard e guia de início rápido
  • Documentação da comunidade OpenVPN e OpenVPN Access Server
  • NIST Cybersecurity Framework: melhores práticas de VPN

Nota sobre informações de terceiros

Este artigo faz referência a modelos de IA, benchmarks, preços e licenças de terceiros. O cenário da IA muda rapidamente. Pontuações de benchmark, termos de licença, nomes de modelos e preços de API podem mudar entre o momento em que foi escrito e quando você está lendo. Antes de tomar decisões de implantação ou conformidade com base neste artigo, verifique os dados atuais na fonte oficial de cada fornecedor: fichas de modelos do Hugging Face para licenças e benchmarks, sites dos fornecedores para preços de API e EUR-Lex para o texto atual do GDPR e da Lei de IA da UE.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs