Як запустити Qwen 3.5 4B на iPhone з MLX
Якщо ви запускаєте Qwen на ноутбуці, ця родина моделей вам уже знайома. Тут описано конкретне налаштування, яке дає змогу запустити Qwen на iPhone: який варіант, як його квантизовано, скільки пам'яті й місця він потребує, що робить середовище виконання між репліками і що модель на чотири мільярди параметрів уміє, а чого не вміє, коли її під'єднано до вашого календаря.
Модель
Qwen 3.5 4B є однією з малих моделей Qwen 3.5 від команди Qwen з Alibaba (у родині є також розміри 0,8B, 2B і 9B), опублікованою на початку 2026 року за ліцензією Apache 2.0. Вона має близько чотирьох мільярдів параметрів, візуальний енкодер, завдяки якому читає зображення, режим міркування, увімкнений за умовчанням, нативний контекст на 262 144 токени й навчання для виклику інструментів. Alibaba заявляє про підтримку 201 мови й діалекту. На телефоні найважливіші дві властивості: виклик інструментів і розмір. Це приблизно найбільша модель, яка з запасом працює у 8 GB пам'яті.
Orvena завантажує mlx-community/Qwen3.5-4B-4bit, закріплену на одній ревізії. Завантаження складається з десяти файлів загальним обсягом 3,06 GB, з яких ваги займають 3,03 GB; застосунок округлює це до "3,1 GB". Другий варіант, "Qwen 3.5 4B Mixed", зберігає деякі з найчутливіших шарів (ембедінги, половину понижувальних проєкцій MLP і частину проєкцій значень в механізмі уваги) у восьми бітах, а решту в чотирьох. Він займає 3,57 GB і дає точніші аргументи викликів інструментів, а саме там чотирибітна квантизація дається взнаки першою. Перемикатися між ними можна на сторінці «Моделі».
Чому чотири біти
При шістнадцяти бітах на вагу чотири мільярди параметрів займають близько 8 GB, а це вся пам'ять телефона. При чотирьох бітах ваги займають близько 3 GB на диску й трохи більше в пам'яті, і лишається місце для iOS, застосунку й робочої пам'яті, яка потрібна моделі під час відповіді. Звідси й апаратна вимога: під час першого запуску Orvena перевіряє фізичну пам'ять телефона й не пропонує завантаження, якщо її менше приблизно 8 GB. Стільки пам'яті мають iPhone 15 Pro і 15 Pro Max, кожен iPhone 16, включно з 16e, а також iPhone 17 і 17e. iPhone Air і моделі 17 Pro мають 12 GB. Apple також називає iPhone 18 Pro, 18 Pro Max та iPhone Duo серед пристроїв для Apple Intelligence; на будь-якому телефоні все вирішує перевірка пам'яті під час налаштування.
Середовище виконання
Інференс працює через MLX, фреймворк Apple для роботи з масивами на її власних чипах, з прив'язками для Swift. Модель працює на GPU з уніфікованою пам'яттю телефона, тож ваги не копіюються між процесорами. Після завантаження ваги залишаються в пам'яті між репліками; попередження iOS про нестачу пам'яті очищає кеші, але не модель.
Завдяки двом кешам телефон здається швидшим, ніж можна було б очікувати від його чистої продуктивності. Коли модель завантажується, Orvena обчислює незмінну частину промпту, тобто системний промпт і описи інструментів, і зберігає цей стан, тож нова розмова не платить за ці токени знову. У межах розмови кеш ключів і значень переноситься від репліки до репліки, тож для кожної відповіді модель читає лише ваше останнє повідомлення й результати інструментів, а не всю історію.
Контекстне вікно на телефоні обмежено 16 384 токенами замість повних 262k моделі. Це близько 12 000 слів розмови, а обмеження існує тому, що на телефоні найбільше часу забирає читання довгого промпту, а кеш для довгого контексту вичерпує пам'ять. Коли розмова виходить за межі вікна, Orvena залишає найновіші цілі репліки й відкидає найстаріші, не підсумовуючи їх. Якщо один результат інструмента завеликий, щоб поміститися, вона повідомляє: "The latest tool result is too large for this model's context window. Try a narrower request." (останній результат інструмента завеликий для контекстного вікна моделі, спробуйте вужчий запит).
Семплінг: температура 1,0 і top-p 0,95 для всієї відповіді, коли міркування ввімкнено, і температура 0,7 і top-p 0,8, коли його вимкнено.
Режим міркування
Qwen 3.5 міркує перед відповіддю, якщо їй не сказати інакше. Orvena дає цьому міркуванню бюджет токенів: 288 токенів на телефоні з 8 GB і 576 на телефоні з 12 GB, удвічі менше в режимі економії заряду. Коли бюджет вичерпано, застосунок змушує модель завершити міркування й почати відповідь, тож складне запитання не може зависнути безкінечно. На сторінці «Моделі» є два варіанти, «Автоматично» і «Вимкнено», а в «Параметрах», у розділі «Розширені», можна задати власний бюджет від 128 до 2 048 токенів. Міркування найбільше допомагає в багатокрокових завданнях з інструментами, наприклад з будильником, що залежить від часу в дорозі, і забирає кілька секунд; для швидкого фактичного запитання «Вимкнено» помітно швидше.
Виклик інструментів
Інструменти описуються для моделі як JSON-схеми функцій і вставляються в промпт власним шаблоном чату моделі, тож модель видає виклики у форматі, на якому її навчали. Orvena тримає промпт компактним, розкриваючи інструменти поступово: модель починає з кількох базових інструментів і коротких описів, потім завантажує потрібну навичку (календар, нагадування, карти, здоров'я тощо) і лише тоді бачить повні схеми. Один запит може зайняти до 32 раундів моделі. Кожен виклик перевіряється на відповідність оголошеній схемі; виклик неоголошеного інструмента чи з некоректними аргументами повертається моделі як помилка, яку вона може прочитати й виправити, а не відкидається мовчки.
Важливу арифметику виконують інструменти, а не модель. Коли ви просите будильник, щоб вчасно кудись дістатися, інструмент маршрутів обчислює, коли треба виходити, а модель лише повідомляє результат.
Швидкість
Опублікованого бенчмарку для Orvena поки немає. Текст виводиться потоком у міру написання, і перші слова короткої відповіді з'являються за секунду-дві. Ви помітите, що в довгій розмові відповідь починається пізніше, бо на телефоні найдорожче коштує читання промпту, а міркування додає помітну паузу.
Мови й зображення
Модель відповідає тією мовою, якою ви пишете. Щоб це надійно працювало й з короткими повідомленнями, Orvena визначає мову кожного повідомлення за допомогою розпізнавача мови Apple на пристрої й додає службову примітку з назвою мови; примітка вилучається з усього, що модель пише у відповідь, тож ви її ніколи не бачите. Прикріплені фото обробляє візуальний енкодер на телефоні.
Порівняно із запуском Qwen на Mac
На Mac можна вибрати більші розміри Qwen 3.5, і це сильніші моделі. На телефоні практична стеля сьогодні 4B. Натомість телефон додає все, що є навколо моделі: ваш календар, нагадування, будильники, фото, зведення здоров'я, карти й запис кожної дії моделі, який можна прочитати й скасувати. Якщо з телефона потрібна більша модель, Premium додає Private Cloud Compute від Apple в iOS 27 без жодного ключа для налаштування або будь-яку модель OpenRouter з вашим власним ключем, і Orvena запитує згоди, перш ніж будь-яка розмова залишить пристрій.
Поширені запитання
Який варіант Qwen завантажує Orvena?
За умовчанням mlx-community/Qwen3.5-4B-4bit на закріпленій ревізії, 3,06 GB у десяти файлах. На сторінці «Моделі» доступний змішаний чотири- й восьмибітний варіант обсягом 3,57 GB для точніших викликів інструментів.
Чи можна завантажити власну модель GGUF або MLX?
Ні. У каталозі завантажень два варіанти, і кожен, перш ніж з'явитися в списку, проходить тести циклу інструментів на фізичних пристроях. В iOS 27 сторінка «Моделі» також пропонує Apple Intelligence, вбудовану в iOS. Orvena є асистентом, а не універсальною програмою для запуску моделей.
Звідки беруться ваги і чи їх перевіряють?
Із дзеркала Orvena, а резервним джерелом є Hugging Face. Кожен файл звіряється із закріпленим розміром і хешем SHA-256, перш ніж модель буде активовано. Завантаження відбувається у фоні, відновлюється після переривання й не потрапляє до резервної копії iCloud.
Чи використовуються мої дані для навчання Qwen?
Ні. Модель працює на вашому телефоні. Нічого з того, що ви пишете чи кажете, не надсилається ні Alibaba, ні Orvena. Інструмент надсилає своєму сервісу те, що йому потрібно, наприклад пошуковий запит до DuckDuckGo, а ваша розмова залишає телефон, лише якщо ви самі виберете Private Cloud Compute або під'єднаєте хмарну модель.
Orvena безкоштовна в App Store для iPhone 15 Pro і новіших. Завантаження на 3,1 GB відбувається один раз, а модель працює на телефоні.
Завантажити в App Store