온디바이스

MLX로 iPhone에서 Qwen 3.5 4B 실행하기

2026년 9월 29일 업데이트 · 읽는 시간 6분 · ORVENA LABS

노트북에서 Qwen을 실행해 봤다면 이 모델 계열은 이미 익숙할 것입니다. 이 글은 iPhone에서 Qwen을 실행하는 구체적인 설정을 다룹니다. 어떤 변형인지, 어떻게 양자화했는지, 메모리와 저장 공간이 얼마나 필요한지, 턴과 턴 사이에 런타임이 무엇을 하는지, 그리고 40억 파라미터 모델이 캘린더에 연결되었을 때 할 수 있는 것과 없는 것을 설명합니다.

Orvena는 iPhone 15 Pro 이상에서 무료입니다. 모델은 휴대폰 자체에서 실행됩니다. 다운로드

모델

Qwen 3.5 4B는 Alibaba Qwen 팀이 만든 소형 Qwen 3.5 모델 중 하나로(이 계열에는 0.8B, 2B, 9B 크기도 있습니다), 2026년 초 Apache 2.0 라이선스로 공개되었습니다. 파라미터는 약 40억 개이고, 이미지를 읽을 수 있는 비전 인코더, 기본으로 켜져 있는 추론(thinking) 모드, 262,144 토큰의 기본 컨텍스트를 갖추고 있으며, 도구 호출을 위한 학습도 되어 있습니다. Alibaba는 201개 언어와 방언을 지원한다고 밝힙니다. 휴대폰에서 가장 중요한 두 가지 특성은 도구 호출과 크기입니다. 8 GB 메모리에서 여유 있게 돌아가는 모델로는 대략 이 정도가 최대입니다.

Orvena는 단일 리비전에 고정된 mlx-community/Qwen3.5-4B-4bit를 다운로드합니다. 다운로드는 파일 10개, 총 3.06 GB이며 그중 가중치가 3.03 GB입니다. 앱에서는 이를 반올림해 "3.1 GB"로 표시합니다. 두 번째 옵션인 "Qwen 3.5 4B Mixed"는 가장 민감한 레이어 일부(임베딩, MLP down projection의 절반, 일부 attention value projection)를 8비트로, 나머지를 4비트로 유지합니다. 크기는 3.57 GB이고, 4비트 양자화의 영향이 가장 먼저 드러나는 도구 호출 인수를 더 정확하게 만들어 냅니다. 두 모델은 '모델' 페이지에서 전환할 수 있습니다.

4비트를 쓰는 이유

가중치당 16비트라면 40억 개 파라미터는 약 8 GB로, 휴대폰 메모리 전체에 해당합니다. 4비트에서는 가중치가 디스크에서 약 3 GB, 메모리에서는 그보다 조금 더 차지하므로, iOS와 앱, 그리고 모델이 답하는 동안 필요한 작업 메모리를 위한 여유가 남습니다. 하드웨어 요구 사항이 있는 이유가 바로 이것입니다. Orvena는 처음 실행할 때 휴대폰의 물리 메모리를 확인하고, 약 8 GB 미만이면 다운로드를 제공하지 않습니다. 이 조건을 갖춘 휴대폰은 iPhone 15 Pro와 15 Pro Max, 16e를 포함한 모든 iPhone 16, 그리고 iPhone 17과 17e입니다. iPhone Air와 17 Pro 모델은 12 GB입니다. Apple은 Apple Intelligence 지원 기기로 iPhone 18 Pro, 18 Pro Max, iPhone Duo도 꼽습니다. 어떤 휴대폰이든 최종 판단은 설정 과정의 메모리 확인이 내립니다.

런타임

추론(inference)은 Apple이 자사 실리콘을 위해 만든 배열 프레임워크인 MLX에서 Swift 바인딩을 통해 실행됩니다. 모델은 휴대폰의 통합 메모리를 사용해 GPU에서 실행되므로 프로세서 간에 가중치를 복사할 필요가 없습니다. 한 번 로드된 가중치는 턴과 턴 사이에도 메모리에 남아 있으며, iOS가 메모리 경고를 보내면 캐시는 비워지지만 모델은 그대로 남습니다.

두 가지 캐시 덕분에 휴대폰은 순수 처리량으로 짐작하는 것보다 빠르게 느껴집니다. 모델이 로드될 때 Orvena는 프롬프트의 고정된 부분, 즉 시스템 프롬프트와 도구 설명을 미리 계산해 그 상태를 보관하므로, 새 대화에서 그 토큰 비용을 다시 치르지 않습니다. 대화 안에서는 키-값 캐시가 턴에서 턴으로 이어지므로, 각 답변은 전체 기록이 아니라 최근 메시지와 도구 결과만 읽으면 됩니다.

휴대폰에서는 컨텍스트 윈도우가 모델의 전체 262k 대신 16,384 토큰으로 제한됩니다. 대화로 치면 영어 기준 약 12,000단어 분량입니다. 이렇게 제한하는 이유는 휴대폰에서는 긴 프롬프트를 읽는 과정이 느리고, 긴 컨텍스트를 위한 캐시가 메모리를 바닥내기 때문입니다. 대화가 윈도우를 넘어서면 Orvena는 가장 최근의 온전한 턴을 유지하고, 가장 오래된 턴은 요약하지 않고 제외합니다. 도구 결과 하나가 너무 커서 들어가지 않으면 "The latest tool result is too large for this model's context window. Try a narrower request."(최근 도구 결과가 이 모델의 컨텍스트 윈도우에 비해 너무 큽니다. 범위를 좁혀 요청해 보세요)라고 표시합니다.

샘플링은 추론이 켜져 있으면 답변 전체에 temperature 1.0과 top-p 0.95를, 추론이 꺼져 있으면 temperature 0.7과 top-p 0.8을 사용합니다.

추론 모드

Qwen 3.5는 하지 말라고 하지 않는 한 답하기 전에 추론합니다. Orvena는 이 추론에 토큰 예산을 둡니다. 8 GB 휴대폰에서는 288 토큰, 12 GB 휴대폰에서는 576 토큰이며, 저전력 모드에서는 그 절반입니다. 예산이 다 떨어지면 앱이 모델에게 추론을 마치고 답변을 시작하도록 강제하므로, 어려운 질문 때문에 한없이 멈춰 있는 일은 없습니다. '모델' 페이지에는 '자동'과 '끔' 두 가지 설정이 있고, '설정'의 '고급'에서는 128에서 2,048 토큰 사이의 사용자 지정 예산을 추가할 수 있습니다. 추론은 이동 시간에 따라 달라지는 알람처럼 여러 단계를 거치는 도구 작업에서 가장 도움이 되며, 몇 초가 더 걸립니다. 간단한 사실 질문에는 '끔'이 눈에 띄게 빠릅니다.

도구 호출

도구는 JSON 함수 스키마로 모델에 설명되고, 모델 자체의 채팅 템플릿이 이를 프롬프트에 렌더링하므로, 모델은 학습된 형식 그대로 호출을 내보냅니다. Orvena는 도구를 단계적으로 공개해 프롬프트를 작게 유지합니다. 모델은 몇 가지 핵심 도구와 짧은 요약으로 시작한 뒤, 캘린더, 미리 알림, 지도, 건강 등 필요한 스킬을 불러오고, 그다음에야 전체 스키마를 봅니다. 요청 하나에 모델 라운드는 최대 32번까지 돌 수 있습니다. 모든 호출은 선언된 스키마와 대조해 검사되며, 선언되지 않은 이름을 호출하거나 인수 형식이 잘못되면 조용히 버리지 않고, 모델이 읽고 고칠 수 있는 오류로 돌려보냅니다.

결과가 중요한 계산은 모델이 아니라 도구가 합니다. 제시간에 어딘가에 도착하도록 알람을 요청하면 이동 도구가 출발 시각을 계산하고, 모델은 그 결과를 전달할 뿐입니다.

속도

Orvena에 대해 공개된 벤치마크는 아직 없습니다. 텍스트는 작성되는 대로 스트리밍되고, 짧은 답변의 첫 단어는 1~2초 안에 나타납니다. 체감되는 부분은 두 가지입니다. 휴대폰에서는 프롬프트를 읽는 과정이 가장 부담이 크기 때문에 대화가 길수록 답변이 시작되기까지 더 오래 걸리고, 추론이 켜져 있으면 눈에 보이는 멈춤이 생깁니다.

언어와 이미지

모델은 사용자가 쓰는 언어로 답합니다. 짧은 메시지에서도 이것이 안정적으로 되도록 Orvena는 Apple의 온디바이스 언어 인식기로 각 메시지의 언어를 감지하고, 그 언어를 명시하는 런타임 메모를 덧붙입니다. 이 메모는 모델이 돌려주는 모든 내용에서 제거되므로 사용자에게는 보이지 않습니다. 첨부한 사진은 휴대폰에서 비전 인코더를 거칩니다.

Mac에서 Qwen을 실행하는 것과 비교

Mac에서는 더 큰 Qwen 3.5 크기를 고를 수 있고, 그쪽이 더 강력한 모델입니다. 휴대폰에서는 현재 4B가 현실적인 상한입니다. 휴대폰이 더해 주는 것은 모델을 둘러싼 모든 것입니다. 캘린더, 미리 알림, 알람, 사진, 건강 요약, 지도, 그리고 모델이 수행한 모든 동작을 읽고 실행 취소할 수 있는 기록입니다. 휴대폰에서 더 큰 모델을 쓰고 싶다면 Premium이 iOS 27에서 키 설정이 필요 없는 Apple의 Private Cloud Compute(비공개 클라우드 컴퓨팅)나, 자신의 키로 쓰는 OpenRouter 모델을 추가하며, Orvena는 대화가 기기를 떠나기 전에 동의를 구합니다.

자주 묻는 질문

Orvena는 어떤 Qwen 변형을 다운로드하나요?

기본은 고정된 리비전의 mlx-community/Qwen3.5-4B-4bit이며, 파일 10개에 3.06 GB입니다. 도구 호출을 더 정확하게 하고 싶다면 '모델' 페이지에서 4비트와 8비트를 섞은 3.57 GB 변형을 선택할 수 있습니다.

내가 가진 GGUF나 MLX 모델을 불러올 수 있나요?

아니요. 다운로드 카탈로그에는 두 항목이 있으며, 각 항목은 목록에 올라가기 전에 실제 기기에서 도구 루프 테스트를 거칩니다. iOS 27에서는 '모델' 페이지에 iOS에 기본 제공되는 Apple Intelligence도 있습니다. Orvena는 범용 모델 실행기가 아니라 어시스턴트입니다.

가중치는 어디에서 받고, 검증을 거치나요?

Orvena의 미러에서 받으며, Hugging Face를 대체 경로로 씁니다. 모든 파일은 모델을 활성화하기 전에 고정된 크기와 SHA-256 해시로 검사됩니다. 다운로드는 백그라운드에서 진행되고, 중단되면 이어서 받으며, iCloud 백업에서 제외됩니다.

내 데이터가 Qwen 학습에 쓰이나요?

아니요. 모델은 휴대폰에서 실행됩니다. 입력하거나 말한 내용은 Alibaba에도 Orvena에도 전송되지 않습니다. 도구는 필요한 것만 해당 서비스로 보냅니다. 예를 들어 웹 검색어는 DuckDuckGo로 갑니다. 대화가 휴대폰을 떠나는 것은 직접 Private Cloud Compute를 선택하거나 클라우드 모델을 연결한 경우뿐입니다.

휴대폰 속 Qwen 3.5 4B, 내 캘린더와 함께.

Orvena는 App Store에서 iPhone 15 Pro 이상용으로 무료입니다. 3.1 GB 다운로드는 한 번이면 되고, 모델은 휴대폰에서 실행됩니다.

App Store에서 다운로드