Kako poganjati Qwen 3.5 4B v telefonu iPhone z MLX
Če Qwen poganjate na prenosniku, to družino modelov že poznate. Tukaj je konkretna postavitev, s katero Qwen teče v telefonu iPhone: katera različica, kako je kvantizirana, koliko pomnilnika in prostora potrebuje, kaj izvajalno okolje počne med izmenjavami ter kaj model s štirimi milijardami parametrov zmore in česa ne, ko je povezan z vašim koledarjem.
Model
Qwen 3.5 4B je eden od manjših modelov Qwen 3.5, ki jih razvija ekipa Qwen pri Alibabi (družina ima tudi velikosti 0.8B, 2B in 9B), objavljen v začetku leta 2026 pod licenco Apache 2.0. Ima približno štiri milijarde parametrov, vizualni kodirnik, s katerim bere slike, način razmišljanja, ki je privzeto vklopljen, izvorno kontekstno okno 262.144 žetonov, poleg tega pa je naučen klicanja orodij. Alibaba navaja 201 jezik in narečje. V telefonu sta najpomembnejši lastnosti klici orodij in velikost: to je približno največji model, ki v 8 GB pomnilnika teče z rezervo.
Orvena prenese mlx-community/Qwen3.5-4B-4bit, vezan na točno določeno revizijo. Prenos obsega deset datotek s skupno velikostjo 3,06 GB, od tega uteži 3,03 GB; aplikacija to zaokroži na "3,1 GB". Druga možnost, "Qwen 3.5 4B Mixed", nekatere najobčutljivejše plasti (vdelave, polovico projekcij MLP down in nekatere projekcije vrednosti v pozornosti) ohrani v osmih bitih, preostale pa v štirih. Obsega 3,57 GB in daje natančnejše argumente pri klicih orodij, kjer se kvantizacija na štiri bite pokaže najprej. Med obema lahko preklapljate na strani Modeli.
Zakaj štirje biti
Pri šestnajstih bitih na utež štiri milijarde parametrov zasedejo približno 8 GB, kar je ves pomnilnik telefona. Pri štirih bitih uteži na disku zasedejo približno 3 GB, v pomnilniku pa malo več, tako da ostane prostor za iOS, aplikacijo in delovni pomnilnik, ki ga model potrebuje med odgovarjanjem. Od tod zahteva glede strojne opreme: Orvena ob prvem zagonu preveri fizični pomnilnik telefona in pod približno 8 GB prenosa ne ponudi. Telefoni, ki ga imajo, so iPhone 15 Pro in 15 Pro Max, vsi iPhone 16, vključno s 16e, ter iPhone 17 in 17e. iPhone Air in modeli 17 Pro imajo 12 GB. Apple za Apple Intelligence navaja tudi iPhone 18 Pro, 18 Pro Max in iPhone Duo; pri vsakem telefonu odloči preverjanje pomnilnika med začetno nastavitvijo.
Izvajalno okolje
Sklepanje poteka prek MLX, Applovega ogrodja za računanje s polji na lastnih čipih, z vezavami za Swift. Model teče na grafičnem procesorju z združenim pomnilnikom telefona, zato se uteži med procesorji ne kopirajo. Ko so uteži naložene, med izmenjavami ostanejo v pomnilniku; opozorilo iOS o pomanjkanju pomnilnika počisti predpomnilnike, modela pa ne.
Dva predpomnilnika poskrbita, da se telefon zdi hitrejši, kot bi nakazovala njegova surova prepustnost. Ko se model naloži, Orvena izračuna nespremenljivi del poziva, sistemski poziv in opise orodij, ter to stanje ohrani, tako da novemu pogovoru teh žetonov ni treba znova obdelati. Znotraj pogovora se predpomnilnik ključev in vrednosti prenaša iz izmenjave v izmenjavo, zato mora vsak odgovor prebrati le vaše zadnje sporočilo in rezultate orodij, ne celotne zgodovine.
Kontekstno okno je v telefonu omejeno na 16.384 žetonov namesto polnih 262k, ki jih zmore model. To je približno 12.000 besed pogovora, omejitev pa obstaja, ker je branje dolgega poziva v telefonu počasen del, predpomnilnik za dolg kontekst pa je tisto, kar izčrpa pomnilnik. Ko pogovor preseže okno, Orvena ohrani najnovejše cele izmenjave in izpusti najstarejše, namesto da bi jih povzela. Če posamezen rezultat orodja ne gre v okno, prikaže "The latest tool result is too large for this model's context window. Try a narrower request." (zadnji rezultat orodja je prevelik za kontekstno okno tega modela, poskusite z ožjo zahtevo).
Vzorčenje uporablja temperaturo 1,0 in top-p 0,95 za ves odgovor, ko je razmišljanje vklopljeno, ter temperaturo 0,7 in top-p 0,8, ko je izklopljeno.
Način razmišljanja
Qwen 3.5 pred odgovorom razmišlja, razen če mu rečete, naj ne. Orvena temu razmišljanju določi proračun žetonov: 288 žetonov v telefonu z 8 GB in 576 v telefonu z 12 GB, v načinu nizke porabe pa polovico tega. Ko se proračun izteče, aplikacija model prisili, da razmišljanje zaključi in začne odgovor, zato se težko vprašanje ne more zatakniti za nedoločen čas. Stran Modeli ima dve nastavitvi, Samodejno in Izklopljeno, v Nastavitvah v razdelku Napredno pa lahko nastavite proračun po meri med 128 in 2.048 žetoni. Razmišljanje najbolj pomaga pri večkoračnih nalogah z orodji, na primer pri alarmu, ki je odvisen od časa potovanja, in stane nekaj sekund; za hitro vprašanje o dejstvih je Izklopljeno opazno hitrejše.
Klici orodij
Orodja so modelu opisana kot sheme funkcij JSON, v poziv pa jih vstavi modelova lastna predloga za klepet, zato model klice oddaja v obliki, na kateri je bil učen. Orvena poziv ohranja majhen, ker orodja razkriva postopoma: model začne z nekaj osnovnimi orodji in kratkimi povzetki, nato naloži veščino, ki jo potrebuje, na primer koledar, opomnike, zemljevide ali zdravje, in šele takrat vidi celotne sheme. Zahteva lahko porabi do 32 krogov modela. Vsak klic se preveri glede na deklarirano shemo; klic orodja, ki ni deklarirano, ali klic z napačno oblikovanimi argumenti se modelu vrne kot napaka, ki jo lahko prebere in popravi, namesto da bi ga Orvena tiho zavrgla.
Računanje, ki je pomembno, opravijo orodja, ne model. Ko prosite za alarm, s katerim boste nekam prišli pravočasno, orodje za potovanje izračuna čas odhoda, model pa ga le sporoči.
Hitrost
Za aplikacijo Orvena še ni objavljenih meritev hitrosti. Besedilo se prikazuje sproti, med pisanjem, prve besede kratkega odgovora pa se pojavijo v sekundi ali dveh. Opazili boste, da dolg pogovor potrebuje več časa, preden se odgovor začne, ker je branje poziva v telefonu drag del, in da razmišljanje doda viden premor.
Jeziki in slike
Model odgovarja v jeziku, v katerem pišete. Da bi bilo to zanesljivo tudi pri kratkih sporočilih, Orvena z Applovim prepoznavalnikom jezika v napravi zazna jezik vsakega sporočila in doda opombo, ki ga navaja; opomba se odstrani iz vsega, kar model napiše nazaj, zato je nikoli ne vidite. Priložene fotografije gredo skozi vizualni kodirnik v telefonu.
V primerjavi z zagonom modela Qwen na računalniku Mac
Na računalniku Mac lahko izberete večje velikosti Qwen 3.5, ki so močnejši modeli. V telefonu je 4B danes praktična zgornja meja. Telefon pa doda vse okoli modela: vaš koledar, opomnike, alarme, fotografije, zdravstvene povzetke, zemljevide in zapis vsakega dejanja modela, ki ga lahko preberete in razveljavite. Če želite v telefonu večji model, Premium doda Applov Private Cloud Compute v iOS 27, brez nastavljanja ključa, ali kateri koli model OpenRouter z vašim lastnim ključem, Orvena pa vpraša za soglasje, preden kateri koli pogovor zapusti napravo.
Pogosta vprašanja
Katero različico modela Qwen prenese Orvena?
Privzeto mlx-community/Qwen3.5-4B-4bit na točno določeni reviziji, 3,06 GB v desetih datotekah. Na strani Modeli je za natančnejše klice orodij na voljo mešana štiri- in osembitna različica velikosti 3,57 GB.
Ali lahko naložim svoj model GGUF ali MLX?
Ne. Katalog prenosov ima dva vnosa in vsak je, preden se pojavi na seznamu, preizkušen s testi zanke orodij na fizičnih napravah. V iOS 27 stran Modeli ponuja tudi Apple Intelligence, ki je vgrajena v iOS. Orvena je asistent, ne splošen izvajalnik modelov.
Od kod prihajajo uteži in ali so preverjene?
Z zrcalnega strežnika aplikacije Orvena, s Hugging Face kot rezervo. Vsaka datoteka se pred aktivacijo modela preveri glede na vnaprej določeno velikost in zgoščeno vrednost SHA-256. Prenos poteka v ozadju, po prekinitvi se nadaljuje in je izključen iz varnostnih kopij iCloud.
Ali se moji podatki uporabljajo za učenje modela Qwen?
Ne. Model teče v vašem telefonu. Nič, kar natipkate ali izgovorite, se ne pošlje ne družbi Alibaba ne razvijalcu aplikacije Orvena. Orodje svoji storitvi pošlje, kar potrebuje, na primer poizvedbo za spletno iskanje v DuckDuckGo, vaš pogovor pa telefon zapusti le, če izberete Private Cloud Compute ali sami povežete oblačni model.
Orvena je brezplačna v trgovini App Store za iPhone 15 Pro in novejše. Prenos velikosti 3,1 GB se opravi enkrat, model pa teče v telefonu.
Prenesite iz trgovine App Store