Az eszközön

A Qwen 3.5 4B futtatása iPhone-on MLX-szel

FRISSÍTVE: 2026. SZEPTEMBER 29. · 6 PERC OLVASÁS · ORVENA LABS

Ha laptopon futtatod a Qwent, a modellcsaládot már ismered. Ez a Qwen iPhone-on való futtatásának konkrét beállítása: melyik változat, hogyan van kvantálva, mennyi memória és tárhely kell hozzá, mit csinál a futtatókörnyezet két kör között, és mire képes, illetve mire nem egy négymilliárd paraméteres modell, ha a naptáradhoz kapcsolódik.

Az Orvena ingyenes iPhone 15 Pro és újabb készülékekre. A modell magán a telefonon fut. Letöltés

A modell

A Qwen 3.5 4B az Alibaba Qwen csapatának egyik kis Qwen 3.5 modellje (a családban 0,8B-s, 2B-s és 9B-s méret is van), amely 2026 elején jelent meg Apache 2.0 licenccel. Nagyjából négymilliárd paramétere van, képi kódolója, amellyel képeket tud olvasni, alapból bekapcsolt gondolkodási módja, 262 144 tokenes natív kontextusa, és eszközhívásra is tanították. Az Alibaba 201 nyelvet és nyelvjárást sorol fel. Telefonon a két legfontosabb tulajdonság az eszközhívás és a méret: nagyjából ez a legnagyobb modell, amely bőven elfér 8 GB memóriában.

Az Orvena az mlx-community/Qwen3.5-4B-4bit modellt tölti le, egyetlen rögzített revízióra kötve. A letöltés tíz fájl, összesen 3,06 GB, ebből a súlyok 3,03 GB-ot tesznek ki; az app ezt "3,1 GB"-ra kerekíti. A második lehetőség, a "Qwen 3.5 4B Mixed" néhány legérzékenyebb réteget (a beágyazásokat, az MLP down-projekciók felét és néhány attention value-projekciót) nyolc biten tart, a többit négy biten. Mérete 3,57 GB, és pontosabb argumentumokat ad az eszközhívásokban, márpedig a négybites kvantálás hatása éppen ott jelentkezik először. A kettő között a Modellek képernyőn válthatsz.

Miért négy bit

Súlyonként tizenhat biten négymilliárd paraméter nagyjából 8 GB, vagyis a telefon teljes memóriája. Négy biten a súlyok körülbelül 3 GB-ot foglalnak a tárhelyen és valamivel többet a memóriában, így marad hely az iOS-nek, az appnak és annak a munkamemóriának, amelyre a modellnek válaszadás közben szüksége van. Ezért van hardverkövetelmény: az Orvena az első indításkor ellenőrzi a telefon fizikai memóriáját, és nagyjából 8 GB alatt nem kínálja fel a letöltést. Ennyi memóriája az iPhone 15 Pro és a 15 Pro Max, minden iPhone 16, a 16e-t is beleértve, valamint az iPhone 17 és a 17e készüléknek van. Az iPhone Air és a 17 Pro modellek 12 GB-osak. Az Apple felsorolja az Apple Intelligence-hez az iPhone 18 Pro, a 18 Pro Max és az iPhone Duo modellt is; bármelyik telefonon a beállítás közbeni memóriaellenőrzés dönt.

A futtatókörnyezet

Az inferencia az MLX-en, az Apple saját chipjeihez készült tömbkeretrendszerén fut, a Swift-kötéseken keresztül. A modell a GPU-n fut a telefon egyesített memóriájával, így a súlyokat nem kell processzorok között másolni. Betöltés után a súlyok a körök között is a memóriában maradnak; az iOS memóriafigyelmeztetése a gyorsítótárakat üríti, a modellt nem.

Két gyorsítótár miatt tűnik a telefon gyorsabbnak, mint amit a nyers átviteli sebessége sejtetne. A modell betöltésekor az Orvena kiszámítja a prompt rögzített részét, vagyis a rendszerpromptot és az eszközleírásokat, és megőrzi ezt az állapotot, így egy új beszélgetésnek nem kell újra megfizetnie ezeknek a tokeneknek az árát. Egy beszélgetésen belül a kulcs-érték gyorsítótár körről körre megmarad, így minden válasznál csak a legutóbbi üzenetedet és az eszközeredményeket kell beolvasni, nem a teljes előzményt.

A kontextusablak a telefonon 16 384 tokenre van korlátozva a modell teljes 262k-s ablaka helyett. Ez nagyjából 12 000 szónyi beszélgetés, és a korlát azért létezik, mert telefonon a hosszú prompt beolvasása a lassú rész, és a hosszú kontextus gyorsítótára az, ami kimeríti a memóriát. Ha egy beszélgetés túlnő az ablakon, az Orvena a legutóbbi teljes köröket tartja meg, a legrégebbieket pedig kihagyja ahelyett, hogy összefoglalná őket. Ha egyetlen eszközeredmény túl nagy ahhoz, hogy beleférjen, ezt írja ki: "The latest tool result is too large for this model's context window. Try a narrower request." (a legutóbbi eszközeredmény túl nagy a modell kontextusablakához, próbálj szűkebb kérést).

Bekapcsolt gondolkodásnál a mintavétel a teljes válaszra 1,0-s hőmérséklettel és 0,95-ös top-p értékkel történik, kikapcsolt gondolkodásnál 0,7-es hőmérséklettel és 0,8-as top-p értékkel.

Gondolkodási mód

A Qwen 3.5 válaszadás előtt gondolkodik, hacsak nem kérik, hogy ne tegye. Az Orvena ennek tokenkeretet szab: 8 GB-os telefonon 288, 12 GB-oson 576 tokent, Alacsony fogyasztású módban ennek a felét. Ha a keret elfogy, az app arra kényszeríti a modellt, hogy zárja le a gondolkodást és kezdje el a választ, így egy nehéz kérdés nem akadhat el a végtelenségig. A Modellek képernyőn két beállítás van, Automatikus és Ki, a Beállítások Speciális részében pedig egyéni keret is megadható 128 és 2 048 token között. A gondolkodás a többlépéses eszközös feladatoknál segít a legtöbbet, például egy utazási időtől függő ébresztésnél, és néhány másodpercbe kerül; egy gyors ténykérdésnél a Ki beállítás érezhetően gyorsabb.

Eszközhívás

Az eszközök JSON-függvénysémaként jutnak el a modellhez, és a modell saját csevegősablonja illeszti őket a promptba, így a modell abban a formátumban adja ki a hívásokat, amelyre tanították. Az Orvena fokozatos feltárással tartja kicsiben a promptot: a modell néhány alapeszközzel és rövid összefoglalókkal indul, aztán betölti a szükséges képességet (naptár, emlékeztetők, térképek, egészség és így tovább), és csak ekkor látja a teljes sémákat. Egy kérés legfeljebb 32 modellkört vehet igénybe. Minden hívást összevet a deklarált sémával; a nem deklarált névre irányuló vagy hibás argumentumú hívás hibaként kerül vissza a modellhez, amelyet az el tud olvasni és ki tud javítani, ahelyett, hogy csendben elveszne.

A fontos számításokat eszközök végzik, nem a modell. Ha olyan ébresztést kérsz, amellyel időben odaérsz valahova, az utazási eszköz kiszámítja az indulási időt, a modell pedig csak közli.

Sebesség

Az Orvenáról még nincs publikált teljesítménymérés. A szöveg írás közben jelenik meg, és egy rövid válasz első szavai egy-két másodpercen belül látszanak. Azt fogod észrevenni, hogy egy hosszú beszélgetésnél tovább tart, mire a válasz elindul, mert telefonon a prompt beolvasása a drága rész, és hogy a gondolkodás látható szünetet okoz.

Nyelvek és képek

A modell azon a nyelven válaszol, amelyen írsz. Hogy ez rövid üzeneteknél is megbízható legyen, az Orvena az Apple eszközön futó nyelvfelismerőjével megállapítja minden üzenet nyelvét, és egy futásidejű megjegyzést fűz hozzá, amely megnevezi azt; a megjegyzést eltávolítja mindenből, amit a modell visszaír, így sosem látod. A csatolt fotókat a telefonon dolgozza fel a képi kódoló.

Összevetés a Qwen Macen való futtatásával

Macen választhatod a nagyobb Qwen 3.5 méreteket, és azok erősebb modellek. Telefonon ma a 4B a gyakorlati plafon. Amit a telefon hozzátesz, az minden, ami a modell körül van: a naptárad, az emlékeztetőid, az ébresztőid, a fotóid, az egészségügyi összesítőid, a térképek, és a modell minden műveletének nyilvántartása, amelyet elolvashatsz és visszavonhatsz. Ha a telefonodról nagyobb modellt szeretnél, a Premium iOS 27 rendszeren hozzáadja az Apple Private Cloud Compute szolgáltatását, beállítandó kulcs nélkül, vagy bármely OpenRouter-modellt a saját kulcsoddal, és az Orvena hozzájárulást kér, mielőtt bármely beszélgetés elhagyná a készüléket.

Gyakori kérdések

Melyik Qwen-változatot tölti le az Orvena?

Alapértelmezés szerint az mlx-community/Qwen3.5-4B-4bit modellt, rögzített revízión, 3,06 GB-ot tíz fájlban. A Modellek képernyőn egy vegyes, négy- és nyolcbites változat (3,57 GB) is elérhető a pontosabb eszközhívásokhoz.

Betölthetem a saját GGUF- vagy MLX-modellemet?

Nem. A letöltési katalógusban két tétel van, és mindegyiket fizikai eszközökön futó eszközhurok-tesztekkel próbálják ki, mielőtt felkerül a listára. iOS 27 rendszeren a Modellek képernyő az iOS-be épített Apple Intelligence modellt is kínálja. Az Orvena asszisztens, nem általános modellfuttató.

Honnan jönnek a súlyok, és ellenőrzik őket?

Az Orvena tükörszerveréről, tartalékként a Hugging Face-ről. Aktiválás előtt minden fájlt összevet a rögzített mérettel és SHA-256 hash-sel. A letöltés a háttérben fut, megszakadás után folytatódik, és kimarad az iCloud-mentésből.

Felhasználják az adataimat a Qwen tanításához?

Nem. A modell a telefonodon fut. Semmi, amit begépelsz vagy kimondasz, nem jut el sem az Alibabához, sem az Orvena csapatához. Egy eszköz annyit küld el a saját szolgáltatásának, amennyire szüksége van, például egy webes keresési kifejezést a DuckDuckGónak, a beszélgetésed pedig csak akkor hagyja el a telefont, ha a Private Cloud Compute szolgáltatást választod, vagy saját magad csatlakoztatsz egy felhőmodellt.

Qwen 3.5 4B a telefonon, a naptáraddal.

Az Orvena ingyenes az App Store-ban iPhone 15 Pro és újabb készülékekre. A 3,1 GB-os letöltés egyszer történik meg, és a modell a telefonon fut.

Letöltés az App Store-ból