Key Takeaways
- AI 에이전트 = LLM + 도구 + 루프. LLM이 사용할 도구를 결정하고, 실행하고, 결과를 관찰한 후, 다음 행동을 결정합니다.
- LangGraph는 로컬 또는 클라우드 LLM을 사용하는 에이전트 워크플로를 구축하기 위한 프레임워크입니다.
- 핵심 구성 요소: LLM(Ollama), 도구(웹 검색, 코드 실행, 파일 접근), 메모리(대화 기록), 계획(추론 루프).
- 로컬 에이전트는 클라우드보다 느리지만(LLM 추론에 시간이 소요됨) 개인 정보 보호와 커스터마이징이 가능합니다.
- 2026년 4월 기준으로, 로컬 에이전트는 속도보다 추론이 중요한 작업에 가장 적합합니다.
AI 에이전트는 어떻게 작동합니까?
에이전트는 다음 루프를 따릅니다: (1) 상태/컨텍스트 관찰, (2) LLM이 최적 행동 추론, (3) 행동 실행(도구 호출), (4) 결과 관찰, (5) 완료될 때까지 반복.
예시: "코딩 작업에서 Llama 3.2 vs Qwen 3을 비교해라"는 작업을 받은 리서치 에이전트.
- 관찰: 작업 수신.
- 추론: 벤치마크를 찾고, HumanEval 점수를 검색해야 함.
- 행동: web_search 도구를 사용하여 "Llama 3.2 HumanEval benchmark" 검색.
- 관찰: 점수가 포함된 텍스트 검색됨.
- 행동: "Qwen 3 HumanEval" 검색.
- 추론: 두 모델 모두 확인됨. Qwen이 더 빠르고, Llama가 더 범용적임.
- 최종 행동: 답변 합성 후 반환.
AI 에이전트는 LLM을 사용하여 다음에 호출할 도구를 결정하고, 결과를 관찰한 후, 작업이 완료될 때까지 다시 결정을 반복하는 프로그램입니다.
💡Tip: 체인과의 핵심 차이점은 에이전트가 LLM의 출력을 사용하여 다음에 일어날 일을 *결정*한다는 것이며, 미리 정해진 경로를 따르지 않는다는 점입니다.
에이전트와 체인의 차이점은 무엇입니까?
에이전트는 런타임에 동적으로 결정을 내리고, 체인은 미리 정해진 순서를 따릅니다. 작업에 추론이나 오류 복구가 필요한 경우 에이전트를 사용하고, 고정적이고 예측 가능한 워크플로에는 체인을 사용하십시오.
| Aspect | Chains | Agents |
|---|---|---|
| 의사결정 | 미리 정해진 순서 | 동적, LLM이 결정 |
| 루프 | 루프 없음 | 추론 루프 (완료까지 반복) |
| 오류 복구 | 수동 오류 처리 | LLM이 실패에서 복구 가능 |
| 사용 사례 | 고정 워크플로 (요약 → 이메일) | 복잡한 추론 (리서치, 자동화) |
| 복잡도 | 단순하고 예측 가능 | 복잡하고 예측하기 어려운 동작 |
📌Note: 에이전트는 각 단계에서 LLM이 결정을 내려야 하기 때문에 체인보다 느리고 예측하기 어렵습니다. 속도가 중요하고 워크플로가 미리 알려진 경우에는 체인을 사용하십시오.
LangGraph 아키텍처는 어떻게 작동합니까?
LangGraph는 에이전트를 노드(상태)와 엣지(전환)를 갖춘 유향 비순환 그래프(DAG)로 정의합니다.
- 상태: 에이전트가 보유하는 정보(컨텍스트, 관찰, 결정).
- 노드: 상태를 처리하는 함수(LLM 추론, 도구 실행).
- 엣지: 노드 간 전환(LLM 출력에 따른 조건부).
- 도구: LLM이 호출할 수 있는 함수(웹 검색, 코드 실행, 데이터베이스 쿼리).
LangGraph는 각 결정 박스에서 LLM이 어느 화살표를 따를지 결정하고, 문제가 생기면 다시 돌아올 수 있는 순서도와 같습니다.
에이전트는 어떤 도구를 사용할 수 있습니까?
에이전트의 능력은 전적으로 도구, 즉 세상과 상호작용하기 위해 호출할 수 있는 함수에 의해 정의됩니다. 의사결정 마비를 방지하기 위해 에이전트당 5–10개의 도구로 제한하십시오.
- 웹 검색: 인터넷에서 정보를 검색합니다(DuckDuckGo, Google, Bing).
- 코드 실행: Python 코드를 실행하고 결과를 반환합니다.
- 파일 작업: 파일 읽기/쓰기, 디렉토리 목록 조회.
- 데이터베이스 쿼리: 로컬 또는 원격 데이터베이스를 쿼리합니다.
- 문서 검색: RAG 벡터 데이터베이스에서 문서를 검색합니다.
- 계산기: 산술 및 기호 수학을 수행합니다.
- 이메일: 메시지를 전송합니다(주의하여 사용, 권한 확인 필요).
- API 호출: 외부 서비스와 상호작용합니다.
⚠️Warning: 도구가 너무 많으면 LLM이 혼란스러워집니다 — 단계별 지연이 증가하고 에이전트가 잘못된 도구를 선택하는 빈도가 높아집니다. 3–5개의 핵심 도구로 시작하십시오.
🛠️Practice: 각 도구 설명을 50단어 이내로 작성하고 정확히 언제 사용하는지 명시하십시오. 명확한 설명은 LLM이 올바른 도구를 선택하는 데 도움이 됩니다.
에이전트는 어떻게 추론하고 계획합니까?
에이전트의 추론 능력은 LLM 모델 크기와 프롬프트 품질에 따라 달라집니다.
- 소형 모델(3-7B): 제한된 추론 능력. 결정론적 작업(도구 조회, 분류)에 가장 적합합니다.
- 중형 모델(13-30B): 적절한 추론 능력. 2-3단계 추론 체인을 처리할 수 있습니다.
- 대형 모델(70B+): 강력한 추론 능력. 다단계 계획으로 복잡한 문제를 해결할 수 있습니다.
프롬프팅 기법: 사고의 연쇄(CoT)는 에이전트가 결정하기 전에 단계별로 생각하는 데 도움이 됩니다. 추론 성능을 테스트하기 전에 Ollama가 설치되어 실행 중인지 확인하십시오.
❌ 나쁜 프롬프트
“당신은 유용한 AI 어시스턴트입니다. 사용자가 리서치를 요청할 것입니다. 최선을 다하십시오.”
✅ 좋은 프롬프트
“당신은 리서치 에이전트입니다. 각 작업마다: (1) 2~3개의 하위 질문으로 분해하고, (2) web_search 도구로 각각 검색하고, (3) 결과를 종합하고, (4) 출처를 인용하십시오. 도구 호출 전 항상 추론을 설명하십시오. 최대 10단계.”
# Example: CoT reasoning prompt for agent
system_prompt = """
You are a research agent. Break complex tasks into steps:
1. Identify what information you need
2. Call appropriate tools to gather information
3. Analyze results and determine next steps
4. Return the final answer with sources
Always reason step-by-step before calling tools.
"""🔍Insight: 사고의 연쇄 프롬프트는 에이전트에 잘 작동합니다 — 명시적인 단계별 추론은 LLM이 더 나은 도구 선택을 하는 데 도움이 됩니다.
⚠️Warning: 일반적인 "도움이 되는 어시스턴트" 프롬프트는 자율 에이전트에 실패합니다. 명시적인 단계 제한, 출력 형식 규칙, 도구 추론 지침이 필요합니다.
가장 잘 작동하는 로컬 에이전트 패턴은 무엇입니까?
다섯 가지 패턴이 대부분의 로컬 에이전트 사용 사례를 커버합니다. 주요 필요가 추론, 코드 실행, 계획, 대화, 또는 자동화인지에 따라 선택하십시오.
- 리서치 에이전트: 문서와 웹을 검색하고 결과를 합성합니다.
- 코드 에이전트: 코드를 작성하고 실행하여 문제를 해결합니다.
- 계획 에이전트: 복잡한 작업을 하위 작업으로 분해하고 다른 에이전트에 위임합니다.
- 대화형 에이전트: 메모리를 유지하고, 질문에 답하며, 피드백으로부터 학습합니다.
- 워크플로 자동화: 이메일을 읽고, 작업을 실행하며, 확인을 전송합니다.
가장 흔한 에이전트 구현 실수는 무엇입니까?
대부분의 로컬 에이전트 실패는 다섯 가지 근본 원인으로 추적됩니다: 도구 과부하, 모호한 도구 설명, 무한 루프, 누락된 오류 처리, 모델 크기 불일치.
- 도구 과부하: 에이전트가 너무 많은 옵션으로 혼란스러워집니다. 5-10개의 관련 도구로 제한하십시오.
- 빈약한 도구 설명: 설명이 모호하면 LLM이 도구를 올바르게 사용하지 못합니다. 명확하고 구체적인 설명을 작성하십시오.
- 무한 루프: 에이전트가 추론 루프에 갇힐 수 있습니다. 최대 반복 제한을 추가하십시오(예: 10단계).
- 오류 처리 부재: 도구 호출이 실패할 수 있습니다. 에이전트가 실패를 우아하게 처리하도록 하십시오.
- 소형 모델 사용: 3B 모델은 복잡한 에이전트에 충분히 추론하지 못합니다. 자율 에이전트에는 13B+ 모델을 사용하십시오.
⚠️Warning: 가장 큰 실수는 하드 반복 제한 없이 에이전트를 배포하는 것입니다. LLM이 막히면 에이전트가 무한 루프에 빠질 수 있습니다. 항상 max_iterations를 10–20으로 설정하십시오.
로컬 AI 에이전트에 관한 자주 묻는 질문
🛠️Practice: 프로덕션에 배포하기 전에 먼저 최대 반복 횟수를 제한하여(예: 5단계) 에이전트를 테스트하여 버그를 찾아내십시오.
클라우드 에이전트와 로컬 에이전트의 속도 차이는 얼마나 됩니까?
클라우드 에이전트: 추론 단계당 약 1초. 로컬 에이전트: 모델 크기와 하드웨어에 따라 단계당 약 3–5초. 로컬 추론은 지연을 추가하지만 API 비용을 없애고 모든 데이터를 자체 하드웨어에 보관합니다.
로컬 에이전트가 인터넷에 접근할 수 있습니까?
예, web_search 도구를 제공하면 가능합니다. 에이전트는 다른 함수를 호출하는 것과 동일한 방식으로 그 도구를 호출합니다. 인기 있는 옵션으로는 DuckDuckGo 검색 API와 구조화된 결과를 위한 SerpAPI가 있습니다.
에이전트가 파일 삭제와 같은 문제를 일으키지 않도록 어떻게 보장할 수 있습니까?
엄격한 파일 시스템 및 네트워크 권한이 있는 Docker 컨테이너 내에서 도구를 실행하십시오. 감사 추적을 위해 모든 도구 호출과 입출력을 로깅하십시오. 파괴적인 행동(파일 삭제, 이메일 전송) 전에 확인 단계를 추가하십시오.
여러 에이전트를 병렬로 실행할 수 있습니까?
예. FastAPI와 같은 비동기 프레임워크를 사용하여 동시 에이전트 요청을 처리하십시오. 각 요청은 자체 대화 상태를 가집니다. 각 병렬 에이전트는 자체 LLM 추론 스레드가 필요하므로 VRAM이 동시에 실행할 수 있는 수를 제한합니다.
로컬 AI 에이전트를 실행하는 데 필요한 최소 하드웨어는 무엇입니까?
신뢰할 수 있는 자율 추론을 위해 13B+ 파라미터 모델이 권장됩니다. 양자화된 13B 모델에는 최소 16GB RAM과 바람직하게는 8GB+ VRAM의 GPU가 필요합니다. CPU 전용 하드웨어에서는 추론 단계당 5–15초를 예상하십시오.
일반 LangChain 대신 LangGraph를 언제 사용해야 합니까?
워크플로에 루프, 조건부 분기, 또는 도구 실패에서의 복구가 필요한 경우 LangGraph를 사용하십시오. 일반 LangChain은 결정 지점이 없는 선형 파이프라인(단계 A → B → C)에 잘 작동합니다. 에이전트가 실패한 단계 후에 재시도하거나 다시 추론해야 하는 경우, LangGraph의 그래프 구조가 이를 깔끔하게 처리합니다.
LangGraph와 LangChain은 같은 것입니까?
아닙니다. LangChain은 체인과 파이프라인을 구축하기 위한 범용 LLM 툴킷입니다. LangGraph는 에이전트와 상태 저장 워크플로를 위해 특별히 LangChain 위에 구축된 별도의 프레임워크입니다 — 신뢰할 수 있는 추론 루프에 필요한 그래프 구조(노드, 엣지, 상태)를 추가합니다.
로컬 에이전트는 도구를 몇 개나 가져야 합니까?
에이전트를 5–10개의 도구로 제한하십시오. 옵션이 너무 많으면 LLM이 올바른 도구를 선택하는 데 어려움을 겪고 단계별 지연이 증가합니다. 3–5개의 핵심 도구로 시작하고 특정 기능 부족에 부딪혔을 때만 확장하십시오. 각 도구 설명을 50단어 이내로 작성하고 정확히 언제 사용하는지 명시하십시오.
빠른 정보
- 로컬 에이전트 지연: 추론 단계당 약 3–5초(클라우드 에이전트의 약 1초 대비)
- 최소 모델: 신뢰할 수 있는 자율 다단계 에이전트를 위한 13B+ 파라미터
- 도구 제한: 에이전트당 5–10개 도구 — 10개를 초과하면 의사결정 품질 저하
- 최대 반복: 무한 루프 방지를 위해 10–20단계의 하드 캡 설정
- 하드웨어: 양자화된 7B 모델에 8GB+ VRAM; 13B 에이전트에 16GB+
- CPU에서의 추론 지연: 13B에서 단계당 5–15초(Ollama 기본값)
지역별 맥락 및 배포 규정
로컬 에이전트는 EU의 GDPR 규제 워크플로의 기본 선택입니다. 에이전트가 개인 데이터(고객 기록, 의료 파일, 법적 문서)를 처리할 때, 로컬 추론은 데이터를 자체 인프라 내에 유지하고 클라우드 제공업체와의 데이터 처리 계약 없이 GDPR 제25조 및 제32조를 충족합니다.
일본에서는 2022년 개정된 개인정보 보호법(APPI)이 국경 간 데이터 전송을 제한합니다. 온프레미스에서 실행되는 로컬 에이전트는 추가적인 규제 부담 없이 민감한 고객 데이터를 처리하는 기업에 대해 기본적으로 APPI 요건을 충족합니다.
중국에서는 2021년 데이터 보안법과 개인정보 보호법(PIPL)이 특정 범주의 데이터가 중국 국경 내에 머물도록 요구합니다. Qwen3 또는 기타 로컬 호스팅 모델을 사용하는 로컬 에이전트는 클라우드 추론이 충족하지 못하는 이러한 데이터 거주 요건을 충족합니다.
출처
- LangGraph 문서 — LangGraph 에이전트 프레임워크의 공식 저장소 및 문서.
- LangChain 에이전트 문서 — 도구 통합 패턴이 포함된 LangChain의 에이전트 모듈 가이드.
- ReAct: 언어 모델에서 추론과 행동의 시너지 (Yao et al., 2022) — LangGraph 에이전트에서 사용되는 관찰-추론-행동 루프를 소개한 기초 논문.
