Skip to main content
PromptQuorumPromptQuorum
/고급 로컬 LLM/방화벽 뒤 로컬 AI: 2026 오프라인 배포 가이드
Overview & Reference

방화벽 뒤 로컬 AI: 2026 오프라인 배포 가이드

·12분 분량·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

인터넷이 연결된 기기에서 Ollama, Q4_K_M 모델 파일, 토크나이저 설정 파일을 다운로드하십시오. USB, SSD 또는 내부 네트워크 공유를 통해 오프라인 환경으로 전송하십시오. 초기 다운로드 이후에는 인터넷 연결이 필요하지 않습니다.

기업 방화벽 뒤 또는 에어갭(air-gapped) 환경에서 로컬 AI를 실행하려면 인터넷 접속이 끊기기 전에 모든 의존성을 다운로드해야 합니다. 토크나이저 설정 파일, 채팅 템플릿, 양자화된 모델 조각 하나만 누락되어도 아무런 경고 없이 실행이 중단됩니다. 이 가이드는 배포 전 전체 체크리스트, Ollama와 llama.cpp를 위한 단계별 오프라인 워크플로, 데이터 레지던시 규정이 적용되는 조직을 위한 하드웨어 권장 사항을 제공합니다.

슬라이드 덱: 방화벽 뒤 로컬 AI: 2026 오프라인 배포 가이드

이 기사의 대화형 슬라이드 덱입니다.

아래 슬라이드를 탐색하거나 오프라인 참조용으로 PDF를 다운로드하십시오. 참조 카드 다운로드(PDF)

방화벽 뒤 로컬 AI: 2026 오프라인 배포 가이드

핵심 요점

  • 연결된 기기에서 모두 다운로드하십시오: Ollama 바이너리, 모델 GGUF, 토크나이저 설정, RAG 의존성 파일
  • USB SSD, 내부 네트워크 공유, 또는 에어갭 노트북으로 전송하십시오. 클라우드 동기화에 의존하지 마십시오
  • OLLAMA_MODELS 환경 변수를 오프라인 모델 디렉터리로 설정하십시오
  • Qwen3 14B Q4_K_M(9.5 GB)이 오프라인 기본값으로 권장됩니다. 16 GB 통합 메모리에서 실행 가능합니다
  • NAS 용량 계획: 7B 모델당 20 GB, 14B 모델당 50 GB, 32B 모델당 100 GB(Q4_K_M 기준)
  • 데이터 컴플라이언스: 로컬 추론은 모델 출처와 무관하게 데이터 레지던시 요구 사항을 충족합니다

사전 체크리스트 — 연결 해제 전 다운로드

에어갭 환경으로 전환하기 전에 연결된 기기에서 각 항목을 확인하십시오.

  1. 1
    Ollama 바이너리 — 운영 체제(Linux x86_64, macOS arm64, Windows)에 맞는 버전을 ollama.com에서 다운로드하십시오. ≥0.3.0 버전을 권장합니다.
  2. 2
    모델 GGUF 파일 — 연결된 기기에서 ollama pull qwen2.5:14b-instruct-q4_K_M을 실행하십시오. 모델은 ~/.ollama/models/에 캐시됩니다.
  3. 3
    토크나이저 + 채팅 템플릿 — Ollama 사용 시 모델 매니페스트와 함께 포함되므로 별도 다운로드가 필요하지 않습니다.
  4. 4
    llama.cpp 바이너리 (llama.cpp 사용 시) — github.com/ggerganov/llama.cpp/releases에서 사전 컴파일된 릴리스를 다운로드하십시오.
  5. 5
    임베딩 모델 (오프라인 RAG용) — ollama pull nomic-embed-text 또는 mxbai-embed-large
  6. 6
    벡터 데이터베이스 바이너리 (오프라인 RAG용) — Chroma standalone, Qdrant 바이너리 또는 SQLite+sqlite-vss(Python 설치 불필요)
  7. 7
    Python 휠 파일 (Python 도구 사용 시) — pip download --no-deps.whl 파일을 다운로드하여 전송하십시오.
  8. 8
    검증 해시 — 각 GGUF 파일에 sha256sum을 실행하여 전송 전 손상 여부를 확인하십시오.

연결된 기기에서 실행할 다운로드 명령어

전송 전에 인터넷이 연결된 기기에서 다음 명령어를 모두 실행하십시오. 모델 태그는 필요에 따라 변경하십시오.

  • ollama pull qwen2.5:14b-instruct-q4_K_M — 9.5 GB, 권장 기본값
  • ollama pull qwen2.5:7b-instruct-q4_K_M — 5.5 GB, VRAM이 적은 기기용
  • ollama pull nomic-embed-text — 274 MB, 오프라인 RAG 임베딩용
  • ollama pull deepseek-r1:7b — 5.5 GB, 수학·추론 중심 사용 사례용
  • 모델 파일 위치: Linux/macOS는 ~/.ollama/models/, Windows는 %USERPROFILE%\.ollama\models
  • llama.cpp 사용 시: HuggingFace에서 GGUF를 직접 다운로드하고 전송 전 SHA256을 검증하십시오

Ollama 에어갭 워크플로

파일을 오프라인 기기로 전송한 후 다음 절차를 따르십시오.

  1. 1
    연결된 기기의 ~/.ollama/ 디렉터리 전체를 오프라인 호스트의 동일 경로로 복사하십시오.
  2. 2
    Ollama 바이너리를 설치하십시오: chmod +x ollama && sudo mv ollama /usr/local/bin/
  3. 3
    모델 디렉터리를 설정하십시오: export OLLAMA_MODELS=/오프라인/ollama/models 경로
  4. 4
    서버를 시작하십시오: ollama serve — 로그에서 네트워크 호출 없이 시작되는지 확인하십시오.
  5. 5
    오프라인 테스트: ollama run qwen2.5:14b — 외부 URL 접속 없이 즉시 응답해야 합니다.
  6. 6
    LAN 접속을 위한 전체 인터페이스 바인딩: OLLAMA_HOST=0.0.0.0:11434 ollama serve

llama.cpp 에어갭 워크플로

llama.cpp는 바이너리와 GGUF 파일만 있으면 완전히 독립 실행됩니다. 런타임 의존성이 없습니다.

  • 사전 컴파일된 바이너리와 GGUF 파일을 오프라인 기기로 전송하십시오.
  • 실행: ./llama-server -m ./qwen2.5-14b-instruct-q4_K_M.gguf --port 8080
  • --no-mmap 플래그는 네트워크 공유에서 실행 시 메모리 맵 I/O를 비활성화합니다.
  • NVIDIA GPU에서 레이어 오프로드: --n-gpu-layers 35, Apple Silicon에서 전체 오프로드: --n-gpu-layers -1
  • OpenAI 호환 API는 http://localhost:8080/v1에서 제공됩니다. 모든 OpenAI SDK와 호환됩니다.

오프라인 모델 라이브러리를 위한 NAS 용량 계획

소규모 팀의 모델 라이브러리는 일반적으로 다양한 크기의 모델 3~6개로 구성됩니다. 구매 전에 스토리지를 계획하십시오.

  • 모델 스토리지 권장 NAS: Synology DS923+, 4 TB 드라이브 4개 RAID 5 구성(사용 가능 용량 약 12 TB)
  • 모델 2~3개 라이브러리의 최솟값: 2 TB SSD(단일 기기 배포는 휴대용 드라이브로 충분)
  • NFS를 통해 NAS를 추론 서버에 마운트하고 OLLAMA_MODELS를 NFS 경로로 설정하십시오
모델Q4_K_M 크기Q8_0 크기필요 VRAM
Qwen3 7B5.5 GB8.5 GB8 GB
Qwen3 14B9.5 GB15 GB12 GB
Qwen3 32B20.5 GB34 GB24 GB
Qwen3 72B46 GB75 GB48 GB
nomic-embed-text0.27 GB0.5 GB1 GB

데이터 레지던시 컴플라이언스

많은 조직이 민감한 데이터를 로컬에서 처리·보관하도록 요구하는 규정을 준수해야 합니다. 로컬 추론은 이러한 의무 이행을 크게 단순화합니다.

  • 데이터 레지던시: 로컬 추론은 모델 출처와 무관하게 데이터가 자체 하드웨어 밖으로 나가지 않음을 보장합니다. 이는 대부분의 업종별 데이터 레지던시 요구 사항을 충족합니다.
  • 모델 출처: 모델 공급업체와 버전을 문서화하면 내부 컴플라이언스 감사가 용이해집니다. Qwen3(Alibaba), DeepSeek(DeepSeek AI)은 관리 연속성이 문서화된 모델의 예입니다.
  • 공개 서비스형 AI: 배포가 외부 사용자에게 접근 가능한 경우(순수 내부용이 아닌 경우), 해당 관할권에서 적용되는 통지 의무를 확인하십시오. 직원만 사용하는 내부·오프라인 배포는 일반적으로 적용 범위 밖입니다.
  • 네트워크 격리 검증: iptables 또는 방화벽 규칙을 사용하여 추론 서버에서 외부 연결이 없음을 확인하고 컴플라이언스 기록으로 문서화하십시오.
  • 감사 로그: Ollama는 기본적으로 프롬프트-응답 쌍을 기록하지 않습니다. 내부 데이터 거버넌스 정책에 따라 미들웨어를 추가하십시오. 로그는 항상 로컬에 저장하고 클라우드로 전송하지 마십시오.

오프라인 RAG 설정

완전 오프라인 검색 증강 생성(RAG)에는 로컬 LLM + 로컬 임베딩 모델 + 로컬 벡터 데이터베이스가 필요합니다.

  1. 1
    임베딩 모델: 연결된 기기에서 ollama pull nomic-embed-text를 실행하십시오. Ollama 모델 디렉터리의 나머지 파일과 함께 전송하십시오.
  2. 2
    벡터 데이터베이스: Chroma는 단독 바이너리로 실행 가능합니다(Python 불필요). 또는 Qdrant 바이너리나 sqlite-vss 확장이 포함된 SQLite를 사용하십시오.
  3. 3
    문서 수집: LangChain 또는 LlamaIndex를 오프라인 상태로 사용하십시오(연결 해제 전에 휠 파일을 설치하십시오). 문서 로더를 로컬 파일로 지정하고 웹 크롤링은 하지 마십시오.
  4. 4
    쿼리 흐름: 문서 → 로컬 nomic-embed-text 임베딩 → 로컬 벡터 DB에서 상위 k개 청크 검색 → 로컬 Qwen3으로 전달 → 응답. 외부 호출 없음.
  5. 5
    테스트: 전체 RAG 쿼리 사이클 동안 tcpdump -i any -n port 443으로 HTTPS 트래픽이 없는지 확인하십시오.

자주 묻는 질문

Ollama는 오프라인 실행 시 네트워크 호출을 합니까?

기본적으로 Ollama는 로컬에 캐시된 모델을 서빙할 때 네트워크 호출을 하지 않습니다. ollama.com은 모델 다운로드 또는 업데이트 시에만 접속합니다. 로컬 캐시와 함께 OLLAMA_MODELS를 설정하고 ollama serve를 실행하면 외부 연결이 발생하지 않습니다.

NAS 마운트 경로에서 Qwen3 72B를 실행할 수 있습니까?

가능합니다. 다만 모델 로드 시 NFS 지연으로 인해 로딩 시간이 10~30초 더 소요됩니다. 로드 완료 후 추론 성능은 스토리지 속도가 아닌 GPU/CPU의 VRAM에만 의존합니다.

오프라인에서 한국어를 잘 처리하는 가장 작은 모델은 무엇입니까?

Qwen3 7B Q4_K_M(VRAM 5.5 GB)입니다. 한국어를 네이티브 토크나이저로 처리하며, RTX 3060에서 50~80 tok/s로 일관된 응답을 생성합니다.

내부 오프라인 배포에 규제 보안 평가가 필요합니까?

일반적으로 필요하지 않습니다. 대부분의 AI 규제는 공개 서비스에 적용됩니다. 직원만 사용하는 내부 배포는 일반적으로 적용 범위 밖입니다. 구체적인 상황에 대해서는 컴플라이언스 전문가에게 문의하십시오.

llama.cpp는 시스템 의존성 없이 실행 가능합니까?

Linux에서는 사전 컴파일된 바이너리가 GLIBC 2.28 이상을 필요로 합니다(Ubuntu 20.04 이상에는 표준 포함). macOS arm64에서는 바이너리가 독립 실행됩니다. Windows CUDA 빌드는 CUDA 런타임 DLL이 필요합니다.

에어갭 환경에서 모델을 어떻게 업데이트합니까?

연결된 기기에서 업데이트된 GGUF를 다운로드하고 SHA256 해시를 검증한 후 USB/SSD로 전송하여 모델 디렉터리의 기존 GGUF를 교체하십시오. Ollama 서버를 재시작하여 새 파일을 인식시키십시오.

← 고급 로컬 LLM으로 돌아가기