Key Takeaways
- Apple Intelligence는 3계층 하이브리드입니다 — 온디바이스 AFM Core(순수 Apple, Google 전혀 없음), Private Cloud Compute(Apple 서버), AFM 3 Cloud Pro(Google Cloud의 Nvidia GPU, Gemini로 정제).
- iPhone의 온디바이스 모델은 순수 Apple입니다 — AFM Core / AFM 3 Core Advanced는 20B 스파스로, Instruction-Following Pruning을 통해 프롬프트당 1–4B 파라미터를 활성화합니다.
- Gemini는 교사 신호이지 런타임이 아닙니다 — Apple의 클라우드 모델은 Gemini 출력을 활용하여 정제되었으며, Gemini 자체가 기기에서 실행되는 것은 아닙니다.
- 자체 호스팅 로컬 LLM은 Apple이 제공할 수 없는 제어권을 부여합니다 — 오픈 가중치, 원하는 양자화, 모든 도구, 완전 오프라인, 모델 교체 가능.
- WWDC 2026(6월 8일, Tim Cook의 마지막 기조연설): 6개 OS 베타, iCloud 기록이 연동된 전용 Siri 앱, HomePad를 위한 homeOS 프리뷰.
- EU/GDPR: 온디바이스 = 기본적으로 데이터 상주; Cloud Pro는 Google Cloud(미국)로 라우팅되어 Chapter V 이전 문제 발생 가능.
WWDC 2026에서 Apple이 발표한 것
WWDC 2026은 6월 8일 Tim Cook CEO의 마지막 기조연설로 개막하였습니다. 핵심 발표는 AI 전략의 재편이었습니다: iCloud 연동 대화 기록을 갖춘 새로운 전용 Siri 앱, 6개 OS 베타 출시(iOS 27, iPadOS 27, macOS 27, watchOS 27, tvOS 27, visionOS 27 — 정식 출시 목표 2026년 가을), 그리고 차세대 HomePad 스마트홈 허브를 위한 homeOS 개발자 프리뷰.
AI 레이어는 Apple Intelligence로 명명되며, 현재 Google과 Gemini 기술을 활용하여 공동 개발되고 있습니다. 온디바이스 모델(AFM Core / AFM 3 Core Advanced)은 Apple 고유의 모델입니다. 클라우드 모델(AFM 3 Cloud Pro)은 Gemini 출력을 활용하여 정제되었으며 Google Cloud의 Nvidia GPU에서 실행됩니다.
WWDC 2026에서 Apple은 Apple Intelligence를 3계층 하이브리드로 발표하였습니다: 온디바이스 AFM 모델(순수 Apple), Private Cloud Compute(Apple 서버), Google Cloud의 Nvidia GPU에서 실행되는 AFM 3 Cloud Pro(Gemini로 정제).
Apple Intelligence는 Apple의 온디바이스 AI입니다. 받아쓰기, 빠른 답장 등 단순 작업은 iPhone 칩에서 완전히 처리되어 기기를 벗어나지 않습니다. 더 어려운 작업은 Apple 운영 클라우드 서버로 전송될 수 있습니다. 가장 복잡한 추론은 Google 클라우드 서버에서 실행되는 Apple 모델로 전송되며, 이 모델은 Google의 Gemini를 일부 활용하여 훈련되었습니다.
3계층 아키텍처: 무엇이 어디서 실행되는가
Apple Intelligence는 복잡도에 따라 각 작업을 3계층 중 하나로 라우팅합니다. 어떤 계층이 작업을 처리하느냐에 따라 프라이버시 수준이 결정됩니다.
| 계층 | 실행 위치 | 처리 작업 | Google 관여 여부 |
|---|---|---|---|
| 온디바이스 | Apple Silicon 칩(AFM Core / AFM 3 Core Advanced) | 받아쓰기, 화면 인식, 개인 컨텍스트 조회, 빠른 작업 | 없음 — 순수 Apple. Google 코드, Gemini, 또는 검색 미관여 |
| Private Cloud Compute(PCC) | Apple Silicon 서버(증명 및 코드 감사 완료) | 기기 연산 능력을 초과하는 중간 난이도 작업 | 없음 — 제3자 데이터 접근 없음 |
| Cloud Pro | Google Cloud의 Nvidia GPU(AFM 3 Cloud Pro) | 고난도 세계 지식 작업 및 복잡한 추론 | 있음 — Google Cloud 인프라; 모델은 Gemini 출력을 활용하여 정제 |
Gemini는 교사이지 런타임이 아닙니다
WWDC 2026에서 가장 오해받는 부분은 Google과의 관계입니다. Apple은 'Gemini로 훈련됨'과 'Gemini 자체임'을 구분합니다. 온디바이스 모델인 AFM Core와 AFM 3 Core Advanced는 Apple 고유의 모델이며 Google 관여가 전혀 없습니다. 온디바이스 상호작용은 Google로 전달되지 않습니다.
클라우드 모델(AFM 3 Cloud Pro)은 다릅니다. Google Cloud의 Nvidia GPU에서 실행됩니다. Apple은 이 모델이 Gemini 출력을 활용하여 정제되었다고 밝히고 있습니다 — Gemini 출력이 훈련 신호로 사용된 지식 증류 단계입니다. 결과물은 Apple 고유의 모델이지만, Google 인프라에서 호스팅됩니다.
보고됨(미확인): 파트너십 규모는 연간 약 10억 달러; 클라우드 모델은 약 1.2T 파라미터로 알려져 있습니다. Apple은 고난도 작업을 위해 자체 Private Cloud Compute 하드웨어를 먼저 시도하였으나 속도가 너무 느려 Google Cloud 계약으로 이어진 것으로 알려져 있습니다.
Gemini는 지식 증류를 통해 Apple의 AFM 3 Cloud Pro를 훈련하였으며, 온디바이스 Apple 모델에는 Google 관여가 없고 iPhone 상호작용은 Google로 전달되지 않습니다.
Apple 온디바이스 모델 vs 자체 호스팅 로컬 LLM
Apple의 온디바이스 모델과 자체 호스팅 오픈 가중치 LLM은 모두 로컬 하드웨어에서 처리하지만, 차이가 상당합니다:
| Apple AFM 3 Core Advanced(온디바이스) | 자체 호스팅 로컬 LLM(Qwen / Llama / Gemma) | |
|---|---|---|
| 모델 크기 | 20B 스파스; 프롬프트당 1–4B 파라미터 활성화(Instruction-Following Pruning) | 선택 가능: 3B–70B+ |
| 제어권 | Apple OS에 종속; 사용자 교체 불가 | 완전: 모든 모델, 모든 양자화, 모든 도구 |
| 오프라인 기능 | 온디바이스 계층은 오프라인 가능; 고난도 작업은 클라우드로 라우팅 | 원할 경우 완전 오프라인 가능 |
| 프라이버시 | 온디바이스 계층은 강력; 클라우드 계층은 요청을 처리 | 절대적 — 기기를 벗어나는 데이터 없음 |
| 개방성 | 폐쇄 가중치; Apple 전용 에코시스템 | 오픈 가중치; 검사 및 파인튜닝 가능 |
| 모델 컷오프 / 업데이트 | Apple이 출시 일정 제어 | 업데이트 또는 교체 시점을 직접 결정 |
사용자에게 갖는 의미: 실전 프라이버시
실질적인 질문은 내 데이터가 기기에 머무는지 여부입니다. 그 답은 전적으로 어떤 계층이 해당 작업을 처리하느냐에 달려 있습니다. Apple은 어느 정도의 투명성을 제공하지만, 특정 요청이 어떤 계층을 사용하는지 직접 관찰할 수는 없습니다.
| 요청 내용 | 어떤 계층? | 기기를 벗어나는가? | Google Cloud에 접촉하는가? |
|---|---|---|---|
| 받아쓰기, 타이머 설정, 빠른 답장 | 온디바이스 | 아니오 | 아니오 |
| 긴 이메일 스레드 요약 | PCC 또는 Cloud Pro | 예 | 가능성 있음(Cloud Pro) |
| 복잡한 리서치 또는 창작 글쓰기 | Cloud Pro | 예 | 예 |
| Ollama를 통한 자체 호스팅 LLM | 사용자 기기 | 절대 없음 | 절대 없음 |
온디바이스 계층을 보장할 수 없다면 Apple Intelligence에 의료 기록, 법적 문서, 기밀 사업 데이터를 사용하지 마십시오. 검증된 데이터 상주를 위해서는 자체 호스팅 로컬 LLM이 유일하게 확인된 옵션입니다.
개발자와 기업에게 갖는 의미
WWDC 2026의 개발자 발표는 모델 품질보다 표면 영역에 관한 것입니다. Apple은 Apple Intelligence가 서드파티 앱을 호출할 수 있도록 App Intents를 확장하고 있습니다 — 단, 명시적으로 선언된 액션과 데이터 구조를 통해서만 가능합니다. Siri는 UI를 스크레이핑하지 않으며, 선언된 인텐트를 호출합니다.
이것은 GEO(Generative Engine Optimization)와 기능적으로 유사합니다. AI 검색 크롤러를 위한 콘텐츠 구조화 대신, OS 모델에 앱이 노출하는 액션 표면을 구조화하는 것입니다. 세분화된 App Intents를 선언한 앱은 Apple Intelligence 결과에 표시되며, 그렇지 않은 앱은 표시되지 않습니다.
EU/GDPR 규제를 받는 기업의 경우: 온디바이스 계층은 기본적으로 데이터 상주를 제공하며, 단순 작업에 대한 GDPR 제32조 의무를 충족할 수 있습니다. Cloud Pro 계층은 미국의 Google Cloud로 라우팅되어, 모든 미국 클라우드 서비스에 적용되는 것과 동일한 Chapter V 국경 간 이전 문제를 발생시킵니다. 법무팀은 Apple Intelligence가 해당 워크로드에서 DPIA 범위에 해당하는지 평가해야 합니다.
솔직한 평가
Apple은 약 10억 기기 소유자에게 '프라이빗 온디바이스 AI'를 주류 기대치로 만들었습니다 — 로컬 우선 전제의 이러한 검증은 중요합니다. 그러나 Apple Intelligence는 일부 Google이 뒷받침하는 폐쇄 가중치 하이브리드 시스템입니다: 로컬 AI 마인드셋으로의 관문이지, 자체 모델 운영의 대체물이 아닙니다.
프라이버시가 주된 동기라면 3계층 아키텍처는 실질적인 주의사항을 내포합니다: 클라우드 계층이 요청을 처리하고, Cloud Pro 계층은 미국 기반 Google Cloud 인프라에서 실행되며, 가중치, 라우팅 로직, 업데이트 일정 중 어느 것도 사용자가 제어하지 못합니다.
자체 하드웨어에서 실행하는 자체 호스팅 로컬 LLM(Qwen, Llama, Gemma) — 이것만이 환경을 벗어나는 데이터가 없음을 검증할 수 있는 유일한 아키텍처입니다. Apple의 온디바이스 계층은 일상적인 작업에서 간극을 상당히 좁히지만, 'Apple을 신뢰하라'는 요건은 사라지지 않습니다.
EU 사용자의 경우: 온디바이스는 단순 작업에서 데이터 상주를 제공합니다. Google Cloud로 라우팅되는 복잡한 작업의 경우, 다른 미국 클라우드 서비스와 동일한 GDPR Chapter V 분석이 적용됩니다.
자주 묻는 질문
Apple Intelligence는 로컬 LLM입니까?
정확히 그렇지는 않습니다. Apple Intelligence는 3계층 하이브리드입니다. 단순 작업은 온디바이스 모델(AFM Core / AFM 3 Core Advanced)을 사용하며, 이는 Apple Silicon에서 실행되어 기기를 벗어나지 않습니다. 중간 난이도 작업은 Apple의 Private Cloud Compute 서버로 전송됩니다. 복잡한 작업은 Google Cloud의 Nvidia GPU에서 실행되는 AFM 3 Cloud Pro로 전송됩니다. 첫 번째 계층만이 진정한 로컬 모델에 해당합니다.
Apple이 내 iPhone에서 Gemini를 사용합니까?
아닙니다. 온디바이스 모델인 AFM Core와 AFM 3 Core Advanced는 Apple 고유의 모델이며 Google 관여가 전혀 없습니다. Gemini는 클라우드 모델(AFM 3 Cloud Pro) 훈련에 교사 신호로 사용되었지만, Gemini 자체가 기기에서 실행되는 것은 아닙니다. 온디바이스 Apple Intelligence 상호작용은 Google로 전달되지 않습니다.
내 데이터가 Google로 전송됩니까?
Google Cloud의 Nvidia GPU에서 실행되는 Cloud Pro 계층(AFM 3 Cloud Pro)으로 라우팅된 작업에 한해서만 해당됩니다. 단순 온디바이스 작업은 기기를 벗어나지 않습니다. 중간 난이도 작업은 Apple의 Private Cloud Compute로 전송됩니다(Google 아님). 복잡한 추론 작업은 Google Cloud 인프라로 전송됩니다. Apple은 Google이 데이터를 저장하지 않는다고 밝히고 있지만, 미국 기반 인프라가 관여됩니다.
Apple의 온디바이스 모델 크기는 얼마입니까?
Apple의 AFM 3 Core Advanced는 20B 스파스 모델로, Instruction-Following Pruning을 사용하여 프롬프트당 1–4B 파라미터만 활성화합니다. 이를 통해 일반적인 일상 작업에서 경쟁력을 유지하면서도 iPhone 및 Mac 칩에서 실행할 수 있을 만큼 메모리 효율적입니다.
Apple Intelligence 대신 자체 로컬 LLM을 실행할 수 있습니까?
예. Ollama(무료, 크로스 플랫폼)를 사용하면 오픈 가중치 모델(Qwen, Llama, Gemma)을 자체 하드웨어에서 완전히 실행할 수 있습니다. Apple Intelligence와 달리 자체 호스팅 LLM은 완전 오프라인이며, 검사 및 파인튜닝이 가능한 오픈 가중치를 사용하고, Apple이나 Google의 인프라를 통해 라우팅되지 않습니다. 시작하려면 로컬 LLM이란 무엇인가?를 참조하십시오.
Apple Intelligence는 EU/GDPR 준수에 충분히 프라이빗합니까?
온디바이스 계층은 강력한 데이터 상주를 제공합니다 — 데이터는 Apple Silicon 칩을 벗어나지 않으며, 단순 작업에 대한 GDPR 제32조를 충족할 가능성이 있습니다. Cloud Pro 계층은 Google Cloud(미국 기반)로 라우팅되어 GDPR Chapter V 국경 간 이전 문제를 발생시킵니다. 민감한 개인정보를 처리하는 EU 기업은 DPIA를 수행하고 어떤 Apple Intelligence 작업이 온디바이스에 머무는지 클라우드로 라우팅되는지 확인해야 합니다.
WWDC 2026 이후 Siri가 오프라인으로 작동합니까?
받아쓰기, 빠른 답장, 화면 인식 등 온디바이스 작업의 경우 예, Siri는 인터넷 없이 작동합니다. Private Cloud Compute 또는 Cloud Pro가 필요한 작업은 연결이 필요합니다. Apple은 모든 시나리오에서 어떤 작업이 어떤 계층으로 라우팅되는지 공개적으로 문서화하지 않고 있습니다.
homeOS와 HomePad는 무엇입니까?
homeOS는 스마트홈 허브 기기를 위해 WWDC 2026에서 프리뷰된 새로운 OS입니다. Apple은 차세대 HomePad와 연계된 개발자 프리뷰를 공개하였습니다. HomePad의 사양과 출시 일정은 WWDC 2026에서 발표되지 않았습니다.
