지난 2년간 AI를 쓴다는 건 곧 내 문장을 남의 컴퓨터로 보낸다는 뜻이었다. 프롬프트를 입력하면 데이터센터로 넘어가 거대한 모델이 답하고, 그 답이 되돌아왔다. 그런데 2025년과 2026년, 조용한 변화가 찾아왔다. 그 일의 일부가 이제 손안의 기기나 책상 위 노트북에서, 아무것도 밖으로 내보내지 않고 처리된다. 애플, 구글, 마이크로소프트, 퀄컴은 모두 로컬에서 도는 모델을 기반으로 한 소비자용 또는 개발자용 기능을 실제로 출시했고, 이제 모든 스마트폰과 노트북 발표회는 'NPU(신경망 처리 장치)'를 마치 새 시대의 화소 수처럼 내세운다.
솔깃한 약속이다. 즉각적인 응답, 네트워크 불필요, 사용할 때마다 나가는 클라우드 요금 없음, 그리고 내 데이터가 기기 밖으로 나가지 않는다는 것. 하지만 마케팅은 갈라 봐야 할 세 가지를 뭉뚱그린다. 실제로 사람들 손에 출시된 것과 키노트 무대에서 시연된 것은 다르다. 벤치마크나 사양표와, 배터리로 돌아가는 기기에서의 실사용 품질은 다르다. 그리고 제조사의 주장과, 독립적으로 검증된 동작은 다르다. 이 세 개의 이음매를 계속 눈에 보이게 두면, 온디바이스 AI 이야기는 과장 광고나 반작용식 냉소보다 훨씬 또렷해지고 훨씬 쓸모 있어진다.
'온디바이스'가 실제로 뜻하는 것
로컬에서 도는 모델을 소형 언어 모델(SLM)이라 부르는데, 그 이름 속 '소형'은 빈말이 아니다. 채팅 어시스턴트 뒤의 클라우드 모델은 매개변수(파라미터)가 수천억 개 단위다. 온디바이스 모델은 수십억 개 단위, 즉 한 자릿수 십억대다. 애플의 온디바이스 파운데이션 모델은 약 30억 개 매개변수다 [출처: Apple Machine Learning Research, 2025]. 윈도우 Copilot+ PC에서 도는 마이크로소프트의 파이 실리카(Phi Silica)는 Phi-3.5-mini 계열에서 파생된 모델이다 [출처: Windows Experience Blog, 2024]. 이것이 애초에 가능하다는 가장 명확한 공개 증거인 마이크로소프트의 연구용 모델 Phi-3-mini는 38억 개 매개변수이며, 압축하면 아이폰에서 그대로 구동된다 [출처: Phi-3 Technical Report, arXiv, 2024].
이런 축소를 가능하게 하는 두 가지 공학 기법이 있는데, 서로 구분해 두는 편이 좋다. 양자화는 모델의 수치를 더 낮은 정밀도로 저장한다. 16비트에서 4비트, 심지어 2비트까지 낮춰 메모리를 대폭 줄이고 연산을 빠르게 하되, 약간의 정확도를 내준다. 애플의 모델은 가중치당 2비트를 쓰며, 모델이 그 거칠음을 견디도록 양자화 인식 훈련(QAT)으로 학습시켰다 [출처: Apple Machine Learning Research, 2025]. Phi-3-mini는 4비트로 양자화하면 약 1.8GB를 차지하고, 아이폰 A16 칩에서 완전 오프라인으로 초당 12토큰 이상을 생성한다 [출처: Phi-3 Technical Report, arXiv, 2024]. 증류는 또 다른 기법이다. 한 모델을 압축하는 대신, 더 작은 '학생' 모델이 더 큰 '교사' 모델을 흉내 내도록 학습시켜 진짜로 더 작은 새 모델을 만든다. 오늘날 출시되는 SLM 계열은 이 둘을 함께 쓴다.
저 1.8GB라는 숫자가 이야기 전체를 압축해서 보여 준다. 한때 서버 GPU 랙이 필요했던 모델이 이제 스마트폰의 메모리 예산 안에 들어간다. 마법이 아니라, 정밀도와 폭을 내주고 그만한 크기를 얻은 것이다.
2025년에 실제로 출시된 것
이 층위가 온디바이스 AI를 헛된 약속과 갈라놓는 지점이니, 오늘 실제 사용자와 개발자가 손댈 수 있는 것을 구체적으로 짚을 만하다.
애플은 2025년 가을 iOS 26에 파운데이션 모델 프레임워크를 실어, 개발자가 온디바이스 30억 매개변수 모델에 직접 접근하게 했다. 추론은 무료다. 사용할 때마다 나가는 클라우드 요금이 없고, 오프라인에서 작동하며, 데이터는 기기에 남는다 [출처: Apple Machine Learning Research, 2025]. 구글은 2025년 5월, 제미나이 나노(Gemini Nano) 기반의 ML Kit GenAI API를 안드로이드 개발자에게 출시했다. 시스템의 AICore를 통해 돌며, 입력·추론·출력이 모두 로컬에서 처리되어 인터넷이 필요 없고 호출당 비용도 없다 [출처: Android Developers Blog, 2025]. 마이크로소프트는 Copilot+ PC의 NPU에 파이 실리카를 올려 'Click to Do'나 워드·아웃룩 안의 온디바이스 다시쓰기·요약 같은 기능을 구동하며, 개발자 API는 2025년 1월에 뒤따랐다 [출처: Windows Experience Blog, 2024]. 그리고 퀄컴은 2025년 9월, 3나노 공정의 스냅드래곤 8 엘리트 젠 5를 발표했는데, 헥사곤 NPU가 이전 세대보다 AI에서 약 37% 빠르다고 밝혔다 [출처: GSMArena, 2025].
이 출시 제품들의 공통점에 주목하자. 모두 열린 채팅봇이 아니라 과제 한정형이다. 구글의 온디바이스 API는 명시적으로 네 가지 좁은 작업, 즉 요약·교정·다시쓰기·이미지 설명뿐이다 [출처: Android Developers Blog, 2025]. 애플의 모델은 범용 어시스턴트가 아니라 앱 기능을 만드는 부품으로 제공된다. 이것이 출시된 현실이며, '어디서나, 로컬에서 돌아가는 AI'라는 키노트식 인상보다 의도적으로 더 좁다.
벤치마크·사양표 대 배터리로 도는 기기
바로 여기서 마케팅과 측정된 경험이 갈라지며, 이 간극이야말로 독자가 이해할 가장 중요한 지점이다.
NPU부터 보자. 모든 Copilot+ PC는 40 TOPS 이상, 즉 초당 수십조 회 연산이 가능한 NPU를 갖춰야 한다 [출처: Windows Experience Blog, 2024]. 이는 최대 처리량 사양이고, 어마어마하게 들린다. 하지만 최대 연산 횟수가 곧 만들어진 단어는 아니다. 같은 급의 하드웨어에서 파이 실리카는 첫 토큰을 약 230밀리초 만에 내놓고, 이후 초당 약 20토큰까지 생성한다 [출처: Windows Experience Blog, 2024]. 픽셀 9 프로에서 제미나이 나노는 입력을 초당 약 510토큰으로 읽지만, 답은 초당 약 11토큰으로 쓴다 [출처: Android Developers Blog, 2025]. 이 출력 속도는 두 문장짜리 요약에는 충분히 쓸 만하고, 긴 글에는 눈에 띄게 느리다. 40 TOPS 넘는 사양과 초당 11토큰이라는 현실은 둘 다 참이다. 다만 서로 다른 질문에 답할 뿐이다.
품질 점수에서도 같은 간극이 나타난다. Phi-3-mini는 표준 지식 벤치마크인 MMLU에서 69%를 기록했고, 저자들은 이를 훨씬 큰 모델에 필적한다고 표현한다 [출처: Phi-3 Technical Report, arXiv, 2024]. 실제로 대단한 성취지만, 벤치마크 평균이 곧 열린 영역에서의 신뢰성은 아니다. 이 분야 전체에서 가장 정직한 문장은 애플에게서 나온다. 자사의 온디바이스 모델이 "범용 세계 지식을 다루는 채팅봇으로 설계되지 않았다"고 못 박은 것이다 [출처: Apple Machine Learning Research, 2025]. 다시 읽어 보자. 그 모델을 출시한 회사가, 이걸 만물박사로 여기지 말라고 말하고 있다. 벤치마크 대 현실의 간극을, 제조사가 스스로 밝힌 셈이다.
배터리와 발열은 이 모든 것의 밑바탕에 깔려 있다. 온디바이스 추론이 애초에 가능한 이유는 이 작업에서 NPU가 CPU보다 훨씬 전력 효율이 높기 때문이다. 마이크로소프트는 파이 실리카가 같은 작업을 CPU에서 돌릴 때보다 전력을 약 56% 덜 쓴다고 측정했다 [출처: Windows Experience Blog, 2024]. 바로 그 효율 덕에 스마트폰이 몇 분 만에 방전되지 않고 모델을 돌릴 수 있다. 하지만 효율적이라는 것이 공짜라는 뜻은 아니다. 지속적인 텍스트 생성은 여전히 전력을 소모하고 열을 낸다. 제조사가 이 모델들이 시도할 일에 상한을 두는 현실적 이유 하나가 이것이다.
그 상한은 명시돼 있다. 구글은 자사 온디바이스 요약기가 약 4,000토큰 미만 입력에서 가장 잘 작동하며, 교정과 다시쓰기는 256토큰 미만의 짧은 글을 위한 것이라고 밝힌다 [출처: Android Developers Blog, 2025]. 자의적인 선이 아니라, 배터리로 도는 소형 모델이 좋은 결과를 내는 지점의 정직한 경계다.
주장 대 검증된 것
세 번째 이음매가 가장 물렁하다. 검증 가능한 공학이 마케팅 수식어로 번지는 지점이기 때문이다. '데이터가 기기에 남는다'는 대표적 프라이버시 주장이고, 진짜 로컬 추론이라면 이는 구조에서 따라 나온다. 모델이 스마트폰에서 돌고 네트워크가 꺼져 있다면 문장은 밖으로 나가지 않는다 [출처: Android Developers Blog, 2025]. 시스템이 어떻게 만들어졌는지로부터 따져 볼 수 있으니, 여러 주장 중 가장 단단하다.
더 조심해야 할 것들도 있다. 퀄컴은 스냅드래곤 8 엘리트 젠 5를, '사용자 데이터가 기기에 남는' 가운데 지속적인 온디바이스 학습을 하는 '에이전트형 AI'를 가능케 한다고 소개한다 [출처: GSMArena, 2025]. 'GPT-3.5에 필적한다'는 특정 시험 세트에 근거한 벤치마크 주장이지, 당신의 그 질문에 대한 약속이 아니다 [출처: Phi-3 Technical Report, arXiv, 2024]. 어느 경우든 믿을 만한 핵심은 들여다볼 수 있는 부분, 즉 모델이 어디서 도는지, 어떻게 양자화됐는지, 초당 몇 토큰을 실측으로 내는지이지, 그 둘레에 감긴 수식어가 아니다. 좋은 습관 하나. 구조는 믿고, 마케팅은 걷어 내라.
하이브리드라는 현실: 로컬 온리가 아니라 로컬 우선
이 변화를 가장 깔끔하게 오해하는 길은 클라우드가 사라진다고 상상하는 것이다. 사라지지 않는다. 지배적인 실제 구조는 계층형이다. 소형 로컬 모델이 흔하고 지연에 민감하거나 사적인 작업을 처리하고, 더 어려운 요청은 클라우드의 큰 모델로 넘어간다.
애플의 출시 설계가 가장 분명한 예다. 온디바이스 30억 매개변수 모델이 감당할 수 있는 것을 처리하고, 더 무거운 요청은 애플 실리콘 서버에서 도는 더 큰 서버 모델로 넘어간다. 이 서버 모델은 병렬 트랙 전문가 혼합(PT-MoE) 구조로, 애플이 '프라이빗 클라우드 컴퓨트'라 부르는 환경에서 돈다 [출처: Apple Machine Learning Research, 2025]. 구글과 마이크로소프트도 같은 형태를 따른다. 좁은 작업은 제미나이 나노나 파이 실리카로 로컬에서 돌고, 무거운 일은 여전히 클라우드 제미나이나 코파일럿으로 간다. 그래서 2026년의 스마트폰이 '온디바이스 AI'를 광고할 때, 정직한 번역은 대개 '모든 걸 스마트폰에서'가 아니라 '클라우드 대비책을 둔 로컬 우선'이다. 이는 눈속임이 아니라, 30억 매개변수 모델과 최전선 클라우드 모델이 잘하는 일이 서로 다르다는 사실에 대한 합리적인 공학적 답이다.
소형 로컬 모델이 할 수 있는 것과 없는 것
층위를 걷어 내면 실용적인 그림이 남는다. 온디바이스 SLM이 잘하는 것은 경계가 분명하고 값진 일들이다. 문서 요약, 교정과 다시쓰기, 접근성을 위한 이미지 설명, 구조 추출, 요청 라우팅, 도구 호출 등이며, 이 모두를 낮은 지연으로, 오프라인으로, 데이터를 어디로도 보내지 않고 해낸다. 지금 실제 제품에 실려 나오는 진짜 기능들이고, 이 범주에서는 클라우드를 오가는 것보다 로컬 모델이 더 나은 선택인 경우가 많다.
신뢰할 만하게 하지 못하는 것도 그만큼 중요하다. 이들은 범용 세계 지식 채팅봇이 아니며 — 애플이 대놓고 그렇게 말한다 [출처: Apple Machine Learning Research, 2025] — 긴 맥락 추론에 약하고, 열린 영역 정확도에서 최전선 클라우드 모델을 따라가지 못한다. 30억 매개변수짜리 스마트폰 모델에게 수천억 매개변수 클라우드 어시스턴트를 대신하라고 요구하는 건, 애초에 잘못된 것을 요구하는 일이다.
무엇을 지켜볼까
온디바이스 AI를 대하는 쓸모 있는 태도는 '이제 다 로컬이다'라는 과장도, '결국 눈속임'이라는 냉소도 아니다. 2025년에 진짜 무언가가 출시됐고, 그 범위 안에서 정말로 쓸모 있다.
잡음을 가르는 세 가지 질문이 있다. 첫째, 어떤 기능이 출시된 OS·SDK·칩에 실려 있는가, 아니면 시연과 로드맵인가. 둘의 간극에 실망이 산다. 둘째, 어떤 숫자가 최대 사양(TOPS, 벤치마크 평균)을 말하는가, 아니면 실제로 전달되는 경험(실제 기기에서, 제조사 자신의 과제 상한 안에서의 초당 토큰)을 말하는가. 40 TOPS NPU와 초당 11토큰짜리 답은 둘 다 정직하지만 서로 다른 것을 가리킨다. 셋째, 어떤 주장이 들여다볼 수 있는 구조(모델이 어디서 도는지, 어떻게 양자화됐는지)에 관한 것인가, 아니면 '에이전트형'이나 'GPT-4에 필적'같은 마케팅 수식어인가. 온디바이스 AI를 그 한계 안에서 검증 가능하게 하는 일로 판단하면, 주머니 속 그 기술은 광고가 비추는 것보다 작고, 회의론자가 허락하는 것보다 쓸모 있다는 사실이 드러난다.