Как Qwen 3.5 4B работи на iPhone с MLX
Ако пускате Qwen на лаптоп, вече познавате семейството. Това е конкретната конфигурация, с която Qwen работи на iPhone: кой вариант, как е квантизиран, колко памет и място за съхранение изисква, какво прави средата за изпълнение между репликите и какво може и какво не може модел с четири милиарда параметъра, щом бъде свързан с календара ви.
Моделът
Qwen 3.5 4B е един от малките модели Qwen 3.5 на екипа Qwen в Alibaba (семейството има и размери 0.8B, 2B и 9B), публикуван в началото на 2026 г. под лиценза Apache 2.0. Има около четири милиарда параметъра, визуален енкодер, с който може да чете изображения, режим на мислене, включен по подразбиране, собствен контекст от 262 144 токена и обучение за извикване на инструменти. Alibaba посочва 201 езика и диалекта. На телефон най-важни са две от свойствата му, извикването на инструменти и размерът: това е приблизително най-големият модел, който работи с резерв в 8 GB памет.
Orvena изтегля mlx-community/Qwen3.5-4B-4bit, фиксиран към една конкретна ревизия. Изтеглянето е десет файла с общ размер 3,06 GB, от които теглата са 3,03 GB; приложението закръгля това до "3,1 GB". Втората опция, "Qwen 3.5 4B Mixed", държи някои от най-чувствителните слоеве (ембедингите, половината от down проекциите в MLP и част от value проекциите в attention слоевете) на осем бита, а останалите на четири. Тя е 3,57 GB и дава по-точни аргументи при извикване на инструменти, а именно там квантизацията с четири бита се проявява първо. Можете да превключвате между двете на страницата "Модели".
Защо четири бита
При шестнадесет бита на тегло четири милиарда параметъра заемат около 8 GB, колкото е цялата памет на телефона. При четири бита теглата са около 3 GB на диска и малко повече в паметта, което оставя място за iOS, приложението и работната памет, от която моделът се нуждае, докато отговаря. Това е причината за хардуерното изискване: Orvena проверява физическата памет на телефона при първото стартиране и не предлага изтеглянето, ако тя е под около 8 GB. Телефоните с толкова памет са iPhone 15 Pro и 15 Pro Max, всеки iPhone 16, включително 16e, както и iPhone 17 и 17e. iPhone Air и моделите 17 Pro имат 12 GB. Apple посочва също iPhone 18 Pro, 18 Pro Max и iPhone Duo за Apple Intelligence; на всеки телефон решението взема проверката на паметта при настройката.
Средата за изпълнение
Изводът минава през MLX, рамката на Apple за работа с масиви, създадена за собствените ѝ чипове, чрез обвивките ѝ за Swift. Моделът работи на GPU с обединената памет на телефона, така че тегла не се копират между процесорите. След като се заредят, теглата остават в паметта между репликите; предупреждение за памет от iOS изчиства кешовете, но не и модела.
Два кеша правят телефона по-бърз, отколкото би подсказала суровата му производителност. Когато моделът се зареди, Orvena изчислява фиксираната част от подканата, т.е. системната подкана и описанията на инструментите, и запазва това състояние, така че нов разговор не плаща отново за тези токени. В рамките на разговора кешът ключ-стойност се пренася от реплика на реплика, така че всеки отговор трябва да прочете само последното ви съобщение и резултатите от инструментите, а не цялата история.
Контекстният прозорец е ограничен до 16 384 токена на телефона вместо пълните 262k на модела. Това са около 12 000 думи разговор, а ограничението съществува, защото четенето на дълга подкана е бавната част на телефона, а кешът за дълъг контекст е това, което изчерпва паметта. Когато разговорът надрасне прозореца, Orvena запазва последните цели реплики и изпуска най-старите, вместо да ги обобщава. Ако един резултат от инструмент е твърде голям, за да се побере, съобщението е "The latest tool result is too large for this model's context window. Try a narrower request." (последният резултат от инструмент е твърде голям за контекстния прозорец на модела; опитайте с по-тясна заявка).
Семплирането е с температура 1,0 и top-p 0,95 за целия отговор, когато мисленето е включено, и с температура 0,7 и top-p 0,8, когато е изключено.
Режим на мислене
Qwen 3.5 разсъждава, преди да отговори, освен ако не му бъде казано друго. Orvena дава на това разсъждение бюджет от токени: 288 токена на телефон с 8 GB и 576 на телефон с 12 GB, наполовина в режим Пестене на енергия. Когато бюджетът се изчерпи, приложението принуждава модела да приключи мисленето и да започне отговора, така че труден въпрос не може да блокира безкрайно. Страницата "Модели" има две настройки, "Автоматично" и "Изкл.", а в Настройки, "Разширени", може да се зададе и персонализиран бюджет между 128 и 2 048 токена. Мисленето помага най-много при многостъпкови задачи с инструменти, например аларма, която зависи от времето за пътуване, и струва няколко секунди; за бърз фактически въпрос "Изкл." е осезаемо по-бързо.
Извикване на инструменти
Инструментите се описват на модела като JSON схеми на функции и се вмъкват в подканата чрез собствения чат шаблон на модела, така че моделът извиква инструменти във формата, с който е обучен. Orvena поддържа подканата малка, като разкрива инструментите постепенно: моделът започва с няколко основни инструмента и кратки обобщения, след това зарежда умението, което му трябва (календар, напомняния, карти, здраве и т.н.), и едва тогава вижда пълните схеми. Една заявка може да отнеме до 32 кръга на модела. Всяко извикване се проверява спрямо обявената схема; извикване на необявено име или с неправилни аргументи се връща на модела като грешка, която той може да прочете и поправи, вместо да бъде тихо пренебрегнато.
Изчисленията, които имат значение, се правят от инструменти, а не от модела. Когато поискате аларма, с която да стигнете навреме някъде, инструментът за пътуване изчислява кога трябва да тръгнете, а моделът само съобщава резултата.
Скорост
Все още няма публикуван бенчмарк за Orvena. Текстът се показва, докато се генерира, а първите думи на кратък отговор се появяват до секунда-две. Ще забележите, че при дълъг разговор отговорът започва по-късно, защото четенето на подканата е скъпата част на телефона, и че мисленето добавя видима пауза.
Езици и изображения
Моделът отговаря на езика, на който пишете. За да е това надеждно и при кратки съобщения, Orvena разпознава езика на всяко съобщение с езиковия разпознавател на Apple на устройството и добавя служебна бележка, която го посочва; бележката се премахва от всичко, което моделът пише в отговор, така че никога не я виждате. Прикачените снимки минават през визуалния енкодер на телефона.
В сравнение с Qwen на Mac
На Mac можете да изберете по-големите размери на Qwen 3.5 и те са по-силни модели. На телефон 4B засега е практическият таван. Това, което телефонът добавя, е всичко около модела: календарът, напомнянията, алармите, снимките, здравните обобщения, картите и запис на всяко действие на модела, който можете да прочетете и отмените. Ако искате по-голям модел от телефона си, Premium добавя Private Cloud Compute на Apple в iOS 27, без ключ за настройване, или всеки модел от OpenRouter с ваш собствен ключ, а Orvena иска съгласие, преди разговор да напусне устройството.
Често задавани въпроси
Кой вариант на Qwen изтегля Orvena?
По подразбиране mlx-community/Qwen3.5-4B-4bit с фиксирана ревизия, 3,06 GB в десет файла. Смесен вариант с четири и осем бита, 3,57 GB, е достъпен на страницата "Модели" за по-точни извиквания на инструменти.
Мога ли да заредя собствен GGUF или MLX модел?
Не. Каталогът за изтегляне има два записа и всеки от тях минава тестове на цикъла с инструменти на физически устройства, преди да бъде включен. На iOS 27 страницата "Модели" предлага и Apple Intelligence, който е вграден в iOS. Orvena е асистент, а не универсална среда за изпълнение на модели.
Откъде идват теглата и проверяват ли се?
От огледалния сървър на Orvena, с Hugging Face като резервен източник. Всеки файл се проверява спрямо фиксирания размер и SHA-256 хеш, преди моделът да бъде активиран. Изтеглянето върви във фонов режим, продължава, ако бъде прекъснато, и е изключено от резервното копие в iCloud.
Използват ли се данните ми за обучение на Qwen?
Не. Моделът работи на телефона ви. Нищо, което пишете или казвате, не се изпраща до Alibaba или до Orvena. Инструментът изпраща нужното до собствената си услуга, например заявка за търсене в уеб до DuckDuckGo, а разговорът ви напуска телефона само ако изберете Private Cloud Compute или сами свържете облачен модел.
Orvena се предлага безплатно в App Store за iPhone 15 Pro и по-нови модели. Изтеглянето от 3,1 GB става веднъж, а моделът работи на телефона.
Изтеглете от App Store