← 게시글
이 글을 다른 언어로
Technology

주머니 속 AI, 온디바이스 모델은 실제로 무엇을 하나

Jayden

생활데이터랩에서 근로·임금 계산기와 공공데이터 지역 정보를 관리하고, 기술·산업·정책 이슈를 분석합니다.

발행

핵심 요약

  • 2025년, 온디바이스 AI는 시연 단계를 벗어났다. 애플은 iOS 26에 파운데이션 모델 프레임워크를, 구글은 제미나이 나노 기반 ML Kit GenAI API를 출시했고, 마이크로소프트는 Copilot+ PC의 NPU에 파이 실리카를 올렸다.
  • 출시된 것들은 하나같이 열린 채팅봇이 아니라 과제 한정형이다. 구글의 온디바이스 API가 다루는 작업은 요약·교정·다시쓰기·이미지 설명, 딱 네 가지다.
  • 소형 모델이 스마트폰에 들어가는 대가는 정밀도와 폭이다. 애플의 온디바이스 모델은 양자화 인식 훈련으로 가중치당 2비트를 쓰고, Phi-3-mini는 4비트로 양자화하면 약 1.8GB를 차지한다.
  • 최대 사양과 실사용 경험은 서로 다른 질문에 답한다. Copilot+ PC는 40 TOPS 이상의 NPU를 갖춰야 하지만, 픽셀 9 프로에서 제미나이 나노가 답을 쓰는 속도는 초당 약 11토큰이다.
  • 실제로 지배적인 구조는 '로컬 온리'가 아니라 '클라우드 대비책을 둔 로컬 우선'이다. 작은 로컬 모델이 흔하고 지연에 민감하거나 사적인 일을 맡고, 더 어려운 요청은 여전히 클라우드의 큰 모델로 넘어간다.

지난 2년간 AI를 쓴다는 건 곧 내 문장을 남의 컴퓨터로 보낸다는 뜻이었다. 프롬프트를 입력하면 데이터센터로 넘어가 거대한 모델이 답하고, 그 답이 되돌아왔다. 그런데 2025년과 2026년, 조용한 변화가 찾아왔다. 그 일의 일부가 이제 손안의 기기나 책상 위 노트북에서, 아무것도 밖으로 내보내지 않고 처리된다. 애플, 구글, 마이크로소프트, 퀄컴은 모두 로컬에서 도는 모델을 기반으로 한 소비자용 또는 개발자용 기능을 실제로 출시했고, 이제 모든 스마트폰과 노트북 발표회는 'NPU(신경망 처리 장치)'를 마치 새 시대의 화소 수처럼 내세운다.

솔깃한 약속이다. 즉각적인 응답, 네트워크 불필요, 사용할 때마다 나가는 클라우드 요금 없음, 그리고 내 데이터가 기기 밖으로 나가지 않는다는 것. 하지만 마케팅은 갈라 봐야 할 세 가지를 뭉뚱그린다. 실제로 사람들 손에 출시된 것과 키노트 무대에서 시연된 것은 다르다. 벤치마크나 사양표와, 배터리로 돌아가는 기기에서의 실사용 품질은 다르다. 그리고 제조사의 주장과, 독립적으로 검증된 동작은 다르다. 이 세 개의 이음매를 계속 눈에 보이게 두면, 온디바이스 AI 이야기는 과장 광고나 반작용식 냉소보다 훨씬 또렷해지고 훨씬 쓸모 있어진다.

'온디바이스'가 실제로 뜻하는 것

로컬에서 도는 모델을 소형 언어 모델(SLM)이라 부르는데, 그 이름 속 '소형'은 빈말이 아니다. 채팅 어시스턴트 뒤의 클라우드 모델은 매개변수(파라미터)가 수천억 개 단위다. 온디바이스 모델은 수십억 개 단위, 즉 한 자릿수 십억대다. 애플의 온디바이스 파운데이션 모델은 약 30억 개 매개변수다 [출처: Apple Machine Learning Research, 2025]. 윈도우 Copilot+ PC에서 도는 마이크로소프트의 파이 실리카(Phi Silica)는 Phi-3.5-mini 계열에서 파생된 모델이다 [출처: Windows Experience Blog, 2024]. 이것이 애초에 가능하다는 가장 명확한 공개 증거인 마이크로소프트의 연구용 모델 Phi-3-mini는 38억 개 매개변수이며, 압축하면 아이폰에서 그대로 구동된다 [출처: Phi-3 Technical Report, arXiv, 2024].

이런 축소를 가능하게 하는 두 가지 공학 기법이 있는데, 서로 구분해 두는 편이 좋다. 양자화는 모델의 수치를 더 낮은 정밀도로 저장한다. 16비트에서 4비트, 심지어 2비트까지 낮춰 메모리를 대폭 줄이고 연산을 빠르게 하되, 약간의 정확도를 내준다. 애플의 모델은 가중치당 2비트를 쓰며, 모델이 그 거칠음을 견디도록 양자화 인식 훈련(QAT)으로 학습시켰다 [출처: Apple Machine Learning Research, 2025]. Phi-3-mini는 4비트로 양자화하면 약 1.8GB를 차지하고, 아이폰 A16 칩에서 완전 오프라인으로 초당 12토큰 이상을 생성한다 [출처: Phi-3 Technical Report, arXiv, 2024]. 증류는 또 다른 기법이다. 한 모델을 압축하는 대신, 더 작은 '학생' 모델이 더 큰 '교사' 모델을 흉내 내도록 학습시켜 진짜로 더 작은 새 모델을 만든다. 오늘날 출시되는 SLM 계열은 이 둘을 함께 쓴다.

저 1.8GB라는 숫자가 이야기 전체를 압축해서 보여 준다. 한때 서버 GPU 랙이 필요했던 모델이 이제 스마트폰의 메모리 예산 안에 들어간다. 마법이 아니라, 정밀도와 폭을 내주고 그만한 크기를 얻은 것이다.

2025년에 실제로 출시된 것

이 층위가 온디바이스 AI를 헛된 약속과 갈라놓는 지점이니, 오늘 실제 사용자와 개발자가 손댈 수 있는 것을 구체적으로 짚을 만하다.

애플은 2025년 가을 iOS 26에 파운데이션 모델 프레임워크를 실어, 개발자가 온디바이스 30억 매개변수 모델에 직접 접근하게 했다. 추론은 무료다. 사용할 때마다 나가는 클라우드 요금이 없고, 오프라인에서 작동하며, 데이터는 기기에 남는다 [출처: Apple Machine Learning Research, 2025]. 구글은 2025년 5월, 제미나이 나노(Gemini Nano) 기반의 ML Kit GenAI API를 안드로이드 개발자에게 출시했다. 시스템의 AICore를 통해 돌며, 입력·추론·출력이 모두 로컬에서 처리되어 인터넷이 필요 없고 호출당 비용도 없다 [출처: Android Developers Blog, 2025]. 마이크로소프트는 Copilot+ PC의 NPU에 파이 실리카를 올려 'Click to Do'나 워드·아웃룩 안의 온디바이스 다시쓰기·요약 같은 기능을 구동하며, 개발자 API는 2025년 1월에 뒤따랐다 [출처: Windows Experience Blog, 2024]. 그리고 퀄컴은 2025년 9월, 3나노 공정의 스냅드래곤 8 엘리트 젠 5를 발표했는데, 헥사곤 NPU가 이전 세대보다 AI에서 약 37% 빠르다고 밝혔다 [출처: GSMArena, 2025].

이 출시 제품들의 공통점에 주목하자. 모두 열린 채팅봇이 아니라 과제 한정형이다. 구글의 온디바이스 API는 명시적으로 네 가지 좁은 작업, 즉 요약·교정·다시쓰기·이미지 설명뿐이다 [출처: Android Developers Blog, 2025]. 애플의 모델은 범용 어시스턴트가 아니라 앱 기능을 만드는 부품으로 제공된다. 이것이 출시된 현실이며, '어디서나, 로컬에서 돌아가는 AI'라는 키노트식 인상보다 의도적으로 더 좁다.

벤치마크·사양표 대 배터리로 도는 기기

바로 여기서 마케팅과 측정된 경험이 갈라지며, 이 간극이야말로 독자가 이해할 가장 중요한 지점이다.

NPU부터 보자. 모든 Copilot+ PC는 40 TOPS 이상, 즉 초당 수십조 회 연산이 가능한 NPU를 갖춰야 한다 [출처: Windows Experience Blog, 2024]. 이는 최대 처리량 사양이고, 어마어마하게 들린다. 하지만 최대 연산 횟수가 곧 만들어진 단어는 아니다. 같은 급의 하드웨어에서 파이 실리카는 첫 토큰을 약 230밀리초 만에 내놓고, 이후 초당 약 20토큰까지 생성한다 [출처: Windows Experience Blog, 2024]. 픽셀 9 프로에서 제미나이 나노는 입력을 초당 약 510토큰으로 읽지만, 답은 초당 약 11토큰으로 쓴다 [출처: Android Developers Blog, 2025]. 이 출력 속도는 두 문장짜리 요약에는 충분히 쓸 만하고, 긴 글에는 눈에 띄게 느리다. 40 TOPS 넘는 사양과 초당 11토큰이라는 현실은 둘 다 참이다. 다만 서로 다른 질문에 답할 뿐이다.

품질 점수에서도 같은 간극이 나타난다. Phi-3-mini는 표준 지식 벤치마크인 MMLU에서 69%를 기록했고, 저자들은 이를 훨씬 큰 모델에 필적한다고 표현한다 [출처: Phi-3 Technical Report, arXiv, 2024]. 실제로 대단한 성취지만, 벤치마크 평균이 곧 열린 영역에서의 신뢰성은 아니다. 이 분야 전체에서 가장 정직한 문장은 애플에게서 나온다. 자사의 온디바이스 모델이 "범용 세계 지식을 다루는 채팅봇으로 설계되지 않았다"고 못 박은 것이다 [출처: Apple Machine Learning Research, 2025]. 다시 읽어 보자. 그 모델을 출시한 회사가, 이걸 만물박사로 여기지 말라고 말하고 있다. 벤치마크 대 현실의 간극을, 제조사가 스스로 밝힌 셈이다.

배터리와 발열은 이 모든 것의 밑바탕에 깔려 있다. 온디바이스 추론이 애초에 가능한 이유는 이 작업에서 NPU가 CPU보다 훨씬 전력 효율이 높기 때문이다. 마이크로소프트는 파이 실리카가 같은 작업을 CPU에서 돌릴 때보다 전력을 약 56% 덜 쓴다고 측정했다 [출처: Windows Experience Blog, 2024]. 바로 그 효율 덕에 스마트폰이 몇 분 만에 방전되지 않고 모델을 돌릴 수 있다. 하지만 효율적이라는 것이 공짜라는 뜻은 아니다. 지속적인 텍스트 생성은 여전히 전력을 소모하고 열을 낸다. 제조사가 이 모델들이 시도할 일에 상한을 두는 현실적 이유 하나가 이것이다.

그 상한은 명시돼 있다. 구글은 자사 온디바이스 요약기가 약 4,000토큰 미만 입력에서 가장 잘 작동하며, 교정과 다시쓰기는 256토큰 미만의 짧은 글을 위한 것이라고 밝힌다 [출처: Android Developers Blog, 2025]. 자의적인 선이 아니라, 배터리로 도는 소형 모델이 좋은 결과를 내는 지점의 정직한 경계다.

주장 대 검증된 것

세 번째 이음매가 가장 물렁하다. 검증 가능한 공학이 마케팅 수식어로 번지는 지점이기 때문이다. '데이터가 기기에 남는다'는 대표적 프라이버시 주장이고, 진짜 로컬 추론이라면 이는 구조에서 따라 나온다. 모델이 스마트폰에서 돌고 네트워크가 꺼져 있다면 문장은 밖으로 나가지 않는다 [출처: Android Developers Blog, 2025]. 시스템이 어떻게 만들어졌는지로부터 따져 볼 수 있으니, 여러 주장 중 가장 단단하다.

더 조심해야 할 것들도 있다. 퀄컴은 스냅드래곤 8 엘리트 젠 5를, '사용자 데이터가 기기에 남는' 가운데 지속적인 온디바이스 학습을 하는 '에이전트형 AI'를 가능케 한다고 소개한다 [출처: GSMArena, 2025]. 'GPT-3.5에 필적한다'는 특정 시험 세트에 근거한 벤치마크 주장이지, 당신의 그 질문에 대한 약속이 아니다 [출처: Phi-3 Technical Report, arXiv, 2024]. 어느 경우든 믿을 만한 핵심은 들여다볼 수 있는 부분, 즉 모델이 어디서 도는지, 어떻게 양자화됐는지, 초당 몇 토큰을 실측으로 내는지이지, 그 둘레에 감긴 수식어가 아니다. 좋은 습관 하나. 구조는 믿고, 마케팅은 걷어 내라.

하이브리드라는 현실: 로컬 온리가 아니라 로컬 우선

이 변화를 가장 깔끔하게 오해하는 길은 클라우드가 사라진다고 상상하는 것이다. 사라지지 않는다. 지배적인 실제 구조는 계층형이다. 소형 로컬 모델이 흔하고 지연에 민감하거나 사적인 작업을 처리하고, 더 어려운 요청은 클라우드의 큰 모델로 넘어간다.

애플의 출시 설계가 가장 분명한 예다. 온디바이스 30억 매개변수 모델이 감당할 수 있는 것을 처리하고, 더 무거운 요청은 애플 실리콘 서버에서 도는 더 큰 서버 모델로 넘어간다. 이 서버 모델은 병렬 트랙 전문가 혼합(PT-MoE) 구조로, 애플이 '프라이빗 클라우드 컴퓨트'라 부르는 환경에서 돈다 [출처: Apple Machine Learning Research, 2025]. 구글과 마이크로소프트도 같은 형태를 따른다. 좁은 작업은 제미나이 나노나 파이 실리카로 로컬에서 돌고, 무거운 일은 여전히 클라우드 제미나이나 코파일럿으로 간다. 그래서 2026년의 스마트폰이 '온디바이스 AI'를 광고할 때, 정직한 번역은 대개 '모든 걸 스마트폰에서'가 아니라 '클라우드 대비책을 둔 로컬 우선'이다. 이는 눈속임이 아니라, 30억 매개변수 모델과 최전선 클라우드 모델이 잘하는 일이 서로 다르다는 사실에 대한 합리적인 공학적 답이다.

소형 로컬 모델이 할 수 있는 것과 없는 것

층위를 걷어 내면 실용적인 그림이 남는다. 온디바이스 SLM이 잘하는 것은 경계가 분명하고 값진 일들이다. 문서 요약, 교정과 다시쓰기, 접근성을 위한 이미지 설명, 구조 추출, 요청 라우팅, 도구 호출 등이며, 이 모두를 낮은 지연으로, 오프라인으로, 데이터를 어디로도 보내지 않고 해낸다. 지금 실제 제품에 실려 나오는 진짜 기능들이고, 이 범주에서는 클라우드를 오가는 것보다 로컬 모델이 더 나은 선택인 경우가 많다.

신뢰할 만하게 하지 못하는 것도 그만큼 중요하다. 이들은 범용 세계 지식 채팅봇이 아니며 — 애플이 대놓고 그렇게 말한다 [출처: Apple Machine Learning Research, 2025] — 긴 맥락 추론에 약하고, 열린 영역 정확도에서 최전선 클라우드 모델을 따라가지 못한다. 30억 매개변수짜리 스마트폰 모델에게 수천억 매개변수 클라우드 어시스턴트를 대신하라고 요구하는 건, 애초에 잘못된 것을 요구하는 일이다.

무엇을 지켜볼까

온디바이스 AI를 대하는 쓸모 있는 태도는 '이제 다 로컬이다'라는 과장도, '결국 눈속임'이라는 냉소도 아니다. 2025년에 진짜 무언가가 출시됐고, 그 범위 안에서 정말로 쓸모 있다.

잡음을 가르는 세 가지 질문이 있다. 첫째, 어떤 기능이 출시된 OS·SDK·칩에 실려 있는가, 아니면 시연과 로드맵인가. 둘의 간극에 실망이 산다. 둘째, 어떤 숫자가 최대 사양(TOPS, 벤치마크 평균)을 말하는가, 아니면 실제로 전달되는 경험(실제 기기에서, 제조사 자신의 과제 상한 안에서의 초당 토큰)을 말하는가. 40 TOPS NPU와 초당 11토큰짜리 답은 둘 다 정직하지만 서로 다른 것을 가리킨다. 셋째, 어떤 주장이 들여다볼 수 있는 구조(모델이 어디서 도는지, 어떻게 양자화됐는지)에 관한 것인가, 아니면 '에이전트형'이나 'GPT-4에 필적'같은 마케팅 수식어인가. 온디바이스 AI를 그 한계 안에서 검증 가능하게 하는 일로 판단하면, 주머니 속 그 기술은 광고가 비추는 것보다 작고, 회의론자가 허락하는 것보다 쓸모 있다는 사실이 드러난다.

타임라인

  1. 마이크로소프트 연구진이 Phi-3 기술 보고서를 공개한다. 38억 매개변수 모델을 4비트로 양자화하면 약 1.8GB를 차지하며, 아이폰 A16에서 완전 오프라인으로 구동된다.

    Phi-3 Technical Report (arXiv) (새 탭에서 열림)
  2. 마이크로소프트가 파이 실리카를 상세히 밝힌다. Phi-3.5-mini 계열에서 파생돼 Copilot+ PC의 NPU에서 도는 모델이며, 해당 PC는 40 TOPS 이상의 NPU를 갖춰야 한다.

    Windows Experience Blog (새 탭에서 열림)
  3. 파이 실리카 개발자 API가 뒤따라 공개돼 윈도우 앱 개발자에게 온디바이스 모델이 열린다. 'Click to Do', 워드·아웃룩 안의 다시쓰기·요약 기능도 같은 모델을 쓴다.

    Windows Experience Blog (새 탭에서 열림)
  4. 구글이 제미나이 나노 기반 ML Kit GenAI API를 안드로이드 개발자에게 출시한다. 시스템의 AICore를 통해 입력·추론·출력이 모두 로컬에서 처리되어 인터넷이 필요 없고 호출당 비용도 없다.

    Android Developers Blog (새 탭에서 열림)
  5. 애플이 파운데이션 모델 갱신 내용을 공개한다. 약 30억 매개변수의 온디바이스 모델을 가중치당 2비트로 돌리고, 더 큰 PT-MoE 서버 모델은 프라이빗 클라우드 컴퓨트에서 돌린다. 그리고 온디바이스 모델이 범용 세계 지식을 다루는 채팅봇으로 설계되지 않았다고 못 박는다.

    Apple Machine Learning Research (새 탭에서 열림)
  6. 파운데이션 모델 프레임워크가 iOS 26에 정식 탑재돼 개발자가 온디바이스 모델에 직접 접근하게 된다. 추론은 무료이고, 오프라인에서 작동하며, 데이터는 기기에 남는다.

    Apple Machine Learning Research (새 탭에서 열림)
  7. 퀄컴이 3나노 공정의 스냅드래곤 8 엘리트 젠 5를 발표한다. 헥사곤 NPU가 이전 세대보다 AI에서 약 37% 빠르다는 것이 회사 설명이다.

    GSMArena (새 탭에서 열림)

분석 인사이트

'출시됐는가'가 첫 번째 체이고, 이 체는 촘촘하다

실망은 키노트 무대에서 시연된 것과 실제 OS·SDK·칩에 실려 나온 것 사이의 간극에서 생긴다. iOS 26의 파운데이션 모델 프레임워크, 구글의 ML Kit GenAI API, Copilot+ PC의 파이 실리카, 퀄컴의 스냅드래곤 8 엘리트 젠 5는 모두 그 선을 넘었다. 이 체를 먼저 대면 온디바이스 AI를 둘러싼 논쟁의 상당 부분은 시작도 하기 전에 정리된다.

'소형'은 수식어가 아니라 자릿수의 문제다

클라우드 채팅 모델은 매개변수가 수천억 개 단위지만, 온디바이스 모델은 한 자릿수 십억대다. 애플의 모델은 약 30억, 이 일이 가능하다는 가장 명확한 공개 증거인 Phi-3-mini는 38억이다. 이 규모 차이가 무료·오프라인·호출당 비용 없는 추론을 가능하게 하는 동시에, 열린 영역에서의 신뢰성을 불가능하게 만든다.

최대 연산 횟수는 만들어진 단어가 아니다

Copilot+ PC는 40 TOPS 이상을 넘겨야 하고, 그 숫자는 어마어마하게 들린다. 같은 급 하드웨어에서 파이 실리카는 첫 토큰을 약 230밀리초 만에 내놓고 이후 초당 약 20토큰까지 생성하며, 픽셀 9 프로의 제미나이 나노는 초당 약 11토큰으로 답을 쓴다. 두 숫자 모두 정직하다. 다만 하나는 실리콘의 천장을, 다른 하나는 사용자가 실제로 읽어 내려가는 속도를 잰다.

제조사가 스스로 밝힌 상한이 가장 믿을 만한 숫자다

구글은 자사 온디바이스 요약기가 약 4,000토큰 미만 입력에서 가장 잘 작동하고, 교정과 다시쓰기는 256토큰 미만의 짧은 글을 위한 것이라고 밝힌다. 애플은 자사 온디바이스 모델이 범용 세계 지식 채팅봇으로 설계되지 않았다고 못 박는다. 그 기능을 파는 회사가 직접 그은 선이므로, 어떤 벤치마크 평균보다 실제 역량을 가늠하는 데 단단한 기준이 된다.

로컬 온리가 아니라 로컬 우선 + 클라우드 대비책

계층형 설계는 타협이 아니라 핵심이다. 작은 로컬 모델이 흔하고 지연에 민감하거나 사적인 일을 처리하고, 더 어려운 요청은 훨씬 큰 클라우드 모델 — 애플의 프라이빗 클라우드 컴퓨트 속 PT-MoE 서버 모델이나 클라우드 제미나이·코파일럿 — 로 넘어간다. 2026년의 '온디바이스 AI' 문구를 '모든 걸 스마트폰에서'로 읽는 것이 이 변화에 대한 가장 흔한 오해다.

비교

층위 A — 실제로 출시된 것과, 그 범위가 얼마나 좁은지 (제조사 발표, 2024~2025)
제조사출시된 것밝혀진 과제 범위
애플파운데이션 모델 프레임워크, iOS 26에 정식 탑재(2025년 가을)약 30억 매개변수 온디바이스 모델 위에 앱 기능을 만드는 부품 — 범용 어시스턴트가 아님을 명시
구글제미나이 나노 기반 ML Kit GenAI API, 안드로이드 개발자 대상(2025년 5월)요약·교정·다시쓰기·이미지 설명, 좁은 네 가지 작업
마이크로소프트Copilot+ PC의 NPU에 올린 파이 실리카, 개발자 API는 2025년 1월'Click to Do', 워드·아웃룩 안의 온디바이스 다시쓰기·요약
퀄컴3나노 공정 스냅드래곤 8 엘리트 젠 5(2025년 9월)기능이 아니라 실리콘 — 헥사곤 NPU가 이전 세대보다 AI에서 약 37% 빠르다는 것이 회사 설명
층위 B — 최대 사양 대 실사용 경험. 각 수치는 원문의 표현(약·이상·까지)을 그대로 옮겼다. 제조사·기기·측정 기준이 서로 달라 수치끼리 직접 비교할 수 없다.
발표된 수치어떤 종류의 숫자인가알려 주지 않는 것
40 TOPS 이상 — 모든 Copilot+ PC가 갖춰야 하는 NPU 기준(Windows Experience Blog, 2024)인증 하한이자 최대 처리량 사양특정 모델이 실제로 초당 몇 단어를 만드는지
첫 토큰까지 약 230밀리초, 파이 실리카(Windows Experience Blog, 2024)해당 급 하드웨어에서 측정된 지연긴 답변의 나머지가 얼마나 걸리는지
초당 약 20토큰까지, 파이 실리카(Windows Experience Blog, 2024)상한 — 원문 표현이 '~까지'다지속 부하·발열·낮은 배터리에서의 속도
입력 초당 약 510토큰, 출력 초당 약 11토큰, 픽셀 9 프로의 제미나이 나노(Android Developers Blog, 2025)한 기기에서의 측정값이며, 읽기와 쓰기는 별개 작업다른 스마트폰이나 다른 작업에서도 같은 속도가 나는지
초당 12토큰 이상, 아이폰 A16의 Phi-3-mini, 완전 오프라인(Phi-3 Technical Report, 2024)출시 소비자 기능이 아닌 연구용 모델의 하한그 하한 위 어디에 실제 속도가 놓이는지
MMLU 69%, Phi-3-mini(Phi-3 Technical Report, 2024)표준 지식 시험에서의 벤치마크 평균시험 세트 밖, 열린 영역에서의 신뢰성
층위 C — 주장 대 독립적으로 확인 가능한 것
주장근거의 종류어디까지 검증되는가
"데이터가 기기에 남는다"(Android Developers Blog, 2025)구조에서 따라 나옴 — 모델이 AICore를 통해 로컬에서 돌고 인터넷이 필요 없다단단함 — 시스템 구성에서 따져 볼 수 있고, 네트워크를 끄고 확인할 수 있다
지속적 온디바이스 학습을 하는 '에이전트형 AI'(퀄컴, GSMArena 인용, 2025)출시 시점의 제조사 제품 설명물렁함 — 측정 가능한 사양이 아니라 마케팅 수식어에 가깝다
"GPT-3.5에 필적"(Phi-3 Technical Report, 2024)특정 시험 세트에 근거한 벤치마크 주장한정적 — 그 시험 세트에서는 참이지만, 당신의 그 질문에 대한 약속은 아니다
"범용 세계 지식을 다루는 채팅봇으로 설계되지 않았다"(Apple Machine Learning Research, 2025)모델을 출시한 회사가 스스로 밝힌 한계넷 중 가장 강함 — 파는 쪽이 역량이 아니라 경계를 말하고 있다

진행 과정

  1. 출시 여부부터 확인한다

    오늘 살 수 있는 OS·SDK·칩에 실려 있는가, 아니면 키노트 시연과 로드맵인가.

  2. 밝혀진 과제 범위를 읽는다

    출시된 온디바이스 기능은 설계상 좁다. 구글은 네 가지 작업을 명시했고, 애플은 어시스턴트가 아니라 부품을 제공한다.

  3. 최대 사양과 실제 속도를 갈라 본다

    TOPS와 벤치마크 평균은 천장을 말한다. 제조사 자신의 과제 상한 안에서 실제 기기가 내는 초당 토큰이 경험을 말한다.

  4. 제조사가 밝힌 상한을 찾아본다

    요약은 약 4,000토큰 미만, 다시쓰기는 256토큰 미만 같은 입력 한도가 배터리로 도는 모델이 좋은 결과를 내는 경계다.

  5. 모델이 어디서 돌고 어떻게 압축됐는지 묻는다

    추론이 어디서 일어나는지, 가중치당 몇 비트인지는 들여다볼 수 있는 사실이고, 프라이버시 주장은 결국 여기에 기댄다.

  6. 수식어는 걷어 낸다

    '에이전트형', 'GPT-3.5에 필적' 같은 포장은 틀이나 시험 세트에 관한 주장이다. 들여다볼 수 있는 부분으로 판단한다.

출처

  1. Apple Machine Learning Research — Updates to Apple's On-Device and Server Foundation Language Models (2025-06-09).원문 보기 (새 탭에서 열림)
  2. Android Developers Blog — On-device GenAI features with ML Kit and Gemini Nano (2025-05-20).원문 보기 (새 탭에서 열림)
  3. Windows Experience Blog — Phi Silica, small but mighty on-device SLM (2024-12-06).원문 보기 (새 탭에서 열림)
  4. Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone (arXiv:2404.14219, 2024).원문 보기 (새 탭에서 열림)
  5. GSMArena — Qualcomm Snapdragon 8 Elite Gen 5 features and specs (2025-09-25).원문 보기 (새 탭에서 열림)

태그

  • #on-device-ai
  • #small-language-models
  • #edge-ai
  • #npu
  • #quantization
  • #ai-privacy
주머니 속 AI, 온디바이스 모델은 실제로 무엇을 하나 | 생활데이터랩