Как запустить Qwen 3.5 4B на iPhone с помощью MLX
Если вы запускаете Qwen на ноутбуке, это семейство вам уже знакомо. Здесь описано, как конкретно запустить Qwen на iPhone: какой вариант, как он квантован, сколько памяти и места ему нужно, что делает среда выполнения между репликами и что модель на четыре миллиарда параметров может и чего не может, когда она подключена к вашему календарю.
Модель
Qwen 3.5 4B входит в число небольших моделей Qwen 3.5 от команды Qwen компании Alibaba (в семействе есть также размеры 0.8B, 2B и 9B), опубликованных в начале 2026 года под лицензией Apache 2.0. У неё около четырёх миллиардов параметров, энкодер изображений, благодаря которому она умеет читать картинки, режим размышлений, включённый по умолчанию, нативное контекстное окно на 262 144 токена и обучение вызову инструментов. Alibaba заявляет поддержку 201 языка и диалекта. На телефоне важнее всего два свойства: вызов инструментов и размер. Это примерно самая большая модель, которая с запасом помещается в 8 GB памяти.
Orvena загружает mlx-community/Qwen3.5-4B-4bit, закреплённую на одной ревизии. Загрузка состоит из десяти файлов общим объёмом 3,06 GB, из которых веса занимают 3,03 GB; приложение округляет это до "3,1 GB". Второй вариант, "Qwen 3.5 4B Mixed", хранит часть самых чувствительных слоёв (эмбеддинги, половину понижающих проекций MLP и некоторые value-проекции внимания) в восьми битах, а остальное в четырёх. Он занимает 3,57 GB и даёт более точные аргументы вызовов инструментов, а именно там четырёхбитное квантование сказывается первым. Переключаться между ними можно в разделе «Модели».
Почему четыре бита
При шестнадцати битах на вес четыре миллиарда параметров занимают около 8 GB, то есть всю память телефона. При четырёх битах веса занимают около 3 GB на диске и немного больше в памяти, и остаётся место для iOS, приложения и рабочей памяти, которая нужна модели во время ответа. Отсюда и аппаратное требование: при первом запуске Orvena проверяет физическую память телефона и не предлагает загрузку, если её меньше примерно 8 GB. Столько памяти есть у iPhone 15 Pro и 15 Pro Max, у всех iPhone 16, включая 16e, а также у iPhone 17 и 17e. У iPhone Air и моделей 17 Pro 12 GB. Apple также называет iPhone 18 Pro, 18 Pro Max и iPhone Duo среди устройств с Apple Intelligence; на любом телефоне решает проверка памяти во время настройки.
Среда выполнения
Инференс выполняется через MLX, фреймворк Apple для работы с массивами на её собственных чипах, с помощью привязок для Swift. Модель работает на GPU и использует объединённую память телефона, поэтому веса не копируются между процессорами. После загрузки веса остаются в памяти между репликами; предупреждение iOS о нехватке памяти очищает кэши, но не модель.
Благодаря двум кэшам телефон кажется быстрее, чем можно было бы ожидать по его чистой производительности. Когда модель загружается, Orvena заранее вычисляет неизменную часть промпта, то есть системный промпт и описания инструментов, и сохраняет это состояние, поэтому новой беседе не приходится снова платить за эти токены. Внутри беседы кэш ключей и значений переносится от реплики к реплике, так что для каждого ответа нужно прочитать только ваше последнее сообщение и результаты инструментов, а не всю историю.
Контекстное окно на телефоне ограничено 16 384 токенами вместо полных 262k модели. Это около 12 000 слов беседы, а ограничение нужно потому, что на телефоне медленнее всего идёт чтение длинного промпта, а память заканчивается именно из-за кэша длинного контекста. Когда беседа выходит за пределы окна, Orvena оставляет последние реплики целиком и отбрасывает самые старые, а не пересказывает их кратко. Если один результат инструмента слишком велик и не помещается, приложение сообщает: "The latest tool result is too large for this model's context window. Try a narrower request." (последний результат инструмента слишком велик для контекстного окна этой модели, попробуйте сузить запрос).
Параметры сэмплирования: температура 1,0 и top-p 0,95 для всего ответа, когда размышление включено, и температура 0,7 и top-p 0,8, когда оно выключено.
Режим размышлений
Qwen 3.5 рассуждает перед ответом, если ей не сказать обратного. Orvena выделяет на эти рассуждения бюджет токенов: 288 токенов на телефоне с 8 GB и 576 на телефоне с 12 GB, а в режиме энергосбережения вдвое меньше. Когда бюджет заканчивается, приложение заставляет модель закрыть размышления и начать ответ, поэтому сложный вопрос не может зависнуть бесконечно. В разделе «Модели» есть два варианта, «Автоматически» и «Выкл.», а в Настройках в разделе «Дополнительно» можно задать свой бюджет от 128 до 2 048 токенов. Размышление помогает больше всего в многошаговых задачах с инструментами, например когда будильник зависит от времени в пути, и стоит нескольких секунд; на быстрый фактический вопрос с вариантом «Выкл.» ответ приходит заметно быстрее.
Вызов инструментов
Инструменты описываются для модели как JSON-схемы функций и вставляются в промпт собственным шаблоном чата модели, поэтому модель выдаёт вызовы в том формате, на котором её обучали. Orvena держит промпт компактным, раскрывая инструменты постепенно: модель начинает с нескольких базовых инструментов и кратких описаний, затем загружает нужный навык (календарь, напоминания, карты, здоровье и так далее) и только после этого видит полные схемы. Один запрос может потребовать до 32 обращений к модели. Каждый вызов проверяется по объявленной схеме; вызов необъявленного имени или с некорректными аргументами возвращается модели как ошибка, которую она может прочитать и исправить, а не отбрасывается молча.
Важные вычисления выполняют инструменты, а не модель. Когда вы просите будильник, чтобы успеть куда-то вовремя, инструмент времени в пути рассчитывает, когда нужно выйти, а модель только сообщает результат.
Скорость
Опубликованного бенчмарка для Orvena пока нет. Текст появляется по мере генерации, а первые слова короткого ответа видны уже через секунду-две. Заметно другое: в длинной беседе ответ начинается позже, потому что на телефоне дороже всего обходится чтение промпта, а размышление добавляет видимую паузу.
Языки и изображения
Модель отвечает на том языке, на котором вы пишете. Чтобы это надёжно работало и для коротких сообщений, Orvena определяет язык каждого сообщения с помощью распознавателя языка Apple, работающего на устройстве, и добавляет служебную пометку с этим языком; пометка удаляется из всего, что модель пишет в ответ, поэтому вы её никогда не видите. Прикреплённые фото обрабатывает энкодер изображений на телефоне.
По сравнению с запуском Qwen на Mac
На Mac можно выбрать более крупные модели Qwen 3.5, и они сильнее. На телефоне практический потолок сегодня составляет 4B. Зато телефон добавляет всё, что окружает модель: ваш календарь, напоминания, будильники, фото, сводки здоровья, карты и журнал каждого действия модели, который можно прочитать и отменить. Если вам нужна модель побольше прямо с телефона, Premium добавляет Private Cloud Compute от Apple в iOS 27 без настройки ключа или любую модель OpenRouter с вашим собственным ключом, а Orvena спрашивает согласия, прежде чем беседа покинет устройство.
Частые вопросы
Какой вариант Qwen загружает Orvena?
По умолчанию mlx-community/Qwen3.5-4B-4bit с закреплённой ревизией, 3,06 GB в десяти файлах. В разделе «Модели» доступен смешанный вариант с четырьмя и восемью битами, 3,57 GB, для более точных вызовов инструментов.
Можно ли загрузить свою модель GGUF или MLX?
Нет. В каталоге загрузок две позиции, и каждая перед добавлением проходит тесты цикла вызова инструментов на реальных устройствах. В iOS 27 раздел «Модели» также предлагает Apple Intelligence, встроенную в iOS. Orvena задумана как ассистент, а не как универсальная среда для запуска моделей.
Откуда берутся веса и проверяются ли они?
С зеркала Orvena, а запасным источником служит Hugging Face. Каждый файл сверяется с закреплённым размером и хешем SHA-256, прежде чем модель будет активирована. Загрузка идёт в фоне, продолжается после прерывания и исключена из резервной копии iCloud.
Используются ли мои данные для обучения Qwen?
Нет. Модель работает на вашем телефоне. Ничего из того, что вы пишете или говорите, не отправляется ни в Alibaba, ни в Orvena. Инструмент отправляет своему сервису только то, что ему нужно, например поисковый запрос в DuckDuckGo, а беседа покидает телефон, только если вы сами выберете Private Cloud Compute или подключите облачную модель.
Orvena бесплатна в App Store для iPhone 15 Pro и новее. Модель объёмом 3,1 GB загружается один раз и работает на телефоне.
Скачать в App Store