Qwen 3.5 4B käitamine iPhone'is MLX-iga
Kui käitad Qweni sülearvutis, tunned seda mudeliperet juba. See on konkreetne seadistus, millega Qwen iPhone'is töötab: milline variant, kuidas see on kvantiseeritud, kui palju mälu ja salvestusruumi see vajab, mida käituskeskkond vestlusvoorude vahel teeb ning mida nelja miljardi parameetriga mudel suudab ja mida mitte, kui see on sinu kalendriga ühendatud.
Mudel
Qwen 3.5 4B on üks Alibaba Qweni meeskonna väikestest Qwen 3.5 mudelitest (perre kuuluvad ka suurused 0,8B, 2B ja 9B), mis avaldati 2026. aasta alguses Apache 2.0 litsentsi all. Sellel on umbes neli miljardit parameetrit, nägemiskooder, mis laseb tal pilte lugeda, vaikimisi sisse lülitatud mõtlemisrežiim ja algne kontekstipikkus 262 144 tokenit ning see on treenitud tööriistu välja kutsuma. Alibaba loetleb 201 keelt ja murret. Telefonis on kõige olulisemad kaks omadust tööriistakutsed ja suurus: see on umbes suurim mudel, mis töötab 8 GB mälus veel varuga.
Orvena laadib alla mudeli mlx-community/Qwen3.5-4B-4bit, mis on lukustatud ühele revisjonile. Allalaadimine koosneb kümnest failist kogumahuga 3,06 GB, millest kaalud moodustavad 3,03 GB; rakendus näitab ümardatult "3,1 GB". Teine valik, "Qwen 3.5 4B Mixed", hoiab osa kõige tundlikumaid kihte (manused, pooled MLP allaprojektsioonid ja osa tähelepanu väärtusprojektsioone) kaheksa bitiga ja ülejäänu nelja bitiga. See on 3,57 GB ja annab täpsemad tööriistakutsete argumendid, sest just seal annab nelja biti kvantiseerimine end esimesena tunda. Nende kahe vahel saad valida Mudelite lehel.
Miks neli bitti
Kuueteistkümne biti juures kaalu kohta võtavad neli miljardit parameetrit umbes 8 GB, mis on kogu telefoni mälu. Nelja biti juures on kaalud kettal umbes 3 GB ja mälus veidi rohkem, mis jätab ruumi iOS-ile, rakendusele ja töömälule, mida mudel vastamise ajal vajab. Sellest tuleneb riistvaranõue: Orvena kontrollib esimesel käivitamisel telefoni füüsilist mälu ega paku allalaadimist, kui seda on vähem kui umbes 8 GB. Sellise mäluga telefonid on iPhone 15 Pro ja 15 Pro Max, kõik iPhone 16 mudelid, kaasa arvatud 16e, ning iPhone 17 ja 17e. iPhone Airil ja 17 Pro mudelitel on 12 GB. Apple loetleb funktsiooni Apple Intelligence jaoks ka iPhone 18 Pro, 18 Pro Maxi ja iPhone Duo; igal telefonil otsustab seadistamise ajal tehtav mälukontroll.
Käituskeskkond
Järeldamine käib MLX-i kaudu, mis on Apple'i massiiviraamistik Apple'i enda kiipidele (Apple silicon), ja Swifti liideste kaudu. Mudel töötab GPU-l telefoni ühtse mäluga, nii et kaale ei kopeerita protsessorite vahel. Kui kaalud on laaditud, jäävad need voorude vahel mällu; iOS-i mäluhoiatus tühjendab vahemälud, kuid mitte mudelit.
Kaks vahemälu panevad telefoni tunduma kiiremana, kui tema toores läbilaskevõime lubaks arvata. Mudeli laadimisel arvutab Orvena ette viiba fikseeritud osa (süsteemiviiba ja tööriistade kirjeldused) ning hoiab selle oleku alles, nii et uus vestlus ei pea nende tokenite eest uuesti maksma. Vestluse sees kantakse võtme-väärtuse vahemälu voorust vooru edasi, nii et iga vastus peab lugema ainult sinu viimast sõnumit ja tööriistade tulemusi, mitte kogu ajalugu.
Kontekstiaken on telefonis piiratud 16 384 tokeniga, mitte mudeli täie 262k-ga. See on umbes 12 000 sõna vestlust. Piir on vajalik, sest pika viiba lugemine on telefonis aeglane ja pika konteksti vahemälu on see, mis mälu otsa lõpetab. Kui vestlus kasvab aknast suuremaks, hoiab Orvena alles viimased terved voorud ja jätab vanimad välja, selle asemel et neist kokkuvõtet teha. Kui üksik tööriista tulemus on mahtumiseks liiga suur, näitab Orvena teadet "The latest tool result is too large for this model's context window. Try a narrower request." (viimane tööriista tulemus ei mahu selle mudeli kontekstiaknasse, proovi kitsamat päringut).
Kui mõtlemine on sees, on tokenite valimisel kogu vastuse jaoks temperatuur 1,0 ja top-p 0,95; kui mõtlemine on väljas, on temperatuur 0,7 ja top-p 0,8.
Mõtlemisrežiim
Qwen 3.5 arutleb enne vastamist, kui talle ei öelda teisiti. Orvena annab sellele arutlusele tokenieelarve: 8 GB telefonis 288 tokenit ja 12 GB telefonis 576, energiasäästurežiimis (Low Power Mode) pool sellest. Kui eelarve saab otsa, sunnib rakendus mudelit mõtlemise lõpetama ja vastust alustama, nii et raske küsimus ei saa lõputult takerduda. Mudelite lehel on kaks valikut, Automaatne ja Väljas, ning Seadete jaotis Täpsemalt lisab kohandatud eelarve vahemikus 128 kuni 2 048 tokenit. Mõtlemine aitab kõige rohkem mitmesammuliste tööriistaülesannete puhul, näiteks kui äratus sõltub reisiajast, ja võtab paar sekundit; kiire faktiküsimuse puhul on Väljas märgatavalt kiirem.
Tööriistakutsed
Tööriistu kirjeldatakse mudelile JSON-funktsiooniskeemidena ja mudeli enda vestlusmall lisab need viipa, nii et mudel väljastab kutsed vormingus, millega teda treeniti. Orvena hoiab viiba väikesena, avades tööriistu järk-järgult: mudel alustab mõne põhitööriista ja lühikeste kokkuvõtetega, laadib seejärel vajaliku oskuse, näiteks kalendri, meeldetuletused, kaardid või tervise, ja alles siis näeb täielikke skeeme. Üks päring võib võtta kuni 32 mudelivooru. Iga kutset kontrollitakse deklareeritud skeemi vastu; kutse deklareerimata nimele või vigaste argumentidega tagastatakse mudelile veana, mida ta saab lugeda ja parandada, selle asemel et see vaikselt kõrvale jätta.
Olulised arvutused teevad tööriistad, mitte mudel. Kui palud äratust, mis viib sind õigeks ajaks kohale, arvutab reisitööriist väljumisaja ja mudel ainult edastab selle.
Kiirus
Orvena kohta pole veel avaldatud võrdlustesti. Tekst ilmub jooksvalt ja lühikese vastuse esimesed sõnad ilmuvad sekundi või kahe jooksul. Küll aga märkad, et pika vestluse puhul kulub enne vastuse algust rohkem aega, sest viiba lugemine on telefonis kulukas osa, ja et mõtlemine lisab nähtava pausi.
Keeled ja pildid
Mudel vastab selles keeles, milles sa kirjutad. Et see lühikeste sõnumite puhul usaldusväärselt töötaks, tuvastab Orvena iga sõnumi keele Apple'i seadmesisese keeletuvastajaga ja lisab käitusaja märkuse, kus keel on kirjas; märkus eemaldatakse kõigest, mida mudel tagasi kirjutab, nii et sa ei näe seda kunagi. Lisatud fotod töötleb telefonis nägemiskooder.
Võrreldes Qweni käitamisega Macis
Macis saad valida suuremaid Qwen 3.5 suurusi ja need on tugevamad mudelid. Telefonis on 4B praegu praktiline lagi. Telefon lisab aga kõik, mis on mudeli ümber: sinu kalendri, meeldetuletused, äratused, fotod, tervisekokkuvõtted, kaardid ja kirje igast mudeli tehtud toimingust, mida saad lugeda ja tagasi võtta. Kui tahad telefonist suuremat mudelit, lisab Premium iOS 27-s Apple'i teenuse Private Cloud Compute, mida pole vaja seadistada, või mis tahes OpenRouteri mudeli sinu enda võtmega, ja Orvena küsib nõusolekut enne, kui ükski vestlus seadmest lahkub.
Korduma kippuvad küsimused
Millise Qweni variandi Orvena alla laadib?
Vaikimisi mlx-community/Qwen3.5-4B-4bit lukustatud revisjoniga, 3,06 GB kümnes failis. Segatud nelja- ja kaheksabitine variant mahuga 3,57 GB on täpsemate tööriistakutsete jaoks saadaval Mudelite lehel.
Kas saan laadida oma GGUF- või MLX-mudeli?
Ei. Allalaadimiskataloogis on kaks kirjet ja kumbagi testitakse enne loetellu lisamist päris seadmetel tööriistatsükli testidega. iOS 27-s pakub Mudelite leht ka funktsiooni Apple Intelligence, mis on iOS-i sisse ehitatud. Orvena on assistent, mitte üldine mudelite käitaja.
Kust kaalud tulevad ja kas neid kontrollitakse?
Orvena peegelserverist, varuvariandina Hugging Face'ist. Iga faili kontrollitakse enne mudeli aktiveerimist lukustatud suuruse ja SHA-256 räsi vastu. Allalaadimine käib taustal, jätkub katkestuse korral ja on iCloudi varukoopiast välja jäetud.
Kas minu andmeid kasutatakse Qweni treenimiseks?
Ei. Mudel töötab sinu telefonis. Midagi, mida kirjutad või ütled, ei saadeta Alibabale ega Orvenale. Tööriist saadab oma teenusele selle, mida vajab, näiteks veebiotsingu päringu DuckDuckGo-le, ja sinu vestlus lahkub telefonist ainult siis, kui valid ise teenuse Private Cloud Compute või ühendad pilvemudeli.
Orvena on App Store'is tasuta iPhone 15 Pro ja uuemate mudelite jaoks. 3,1 GB allalaadimine toimub ühe korra ja mudel töötab telefonis.
Laadi alla App Store'ist