Qwen 3.5 4B:n ajaminen iPhonessa MLX:llä
Jos ajat Qwenia kannettavalla, tunnet mallisarjan jo. Tämä on konkreettinen kokoonpano Qwenin ajamiseen iPhonessa: mikä versio, miten se on kvantisoitu, kuinka paljon muistia ja tallennustilaa se vaatii, mitä ajoympäristö tekee vuorojen välillä ja mitä neljän miljardin parametrin malli osaa ja mitä ei, kun se on yhdistetty kalenteriisi.
Malli
Qwen 3.5 4B on yksi Alibaban Qwen-tiimin pienistä Qwen 3.5 -malleista (sarjassa on myös 0,8B-, 2B- ja 9B-koot), ja se julkaistiin alkuvuodesta 2026 Apache 2.0 -lisenssillä. Siinä on noin neljä miljardia parametria, kuvaenkooderi, jonka ansiosta se lukee kuvia, oletuksena päällä oleva ajattelutila, 262 144 tokenin natiivi konteksti ja koulutus työkalukutsuja varten. Alibaba ilmoittaa tuetuiksi 201 kieltä ja murretta. Puhelimessa tärkeimmät ominaisuudet ovat työkalukutsut ja koko: tämä on suunnilleen suurin malli, joka toimii väljästi 8 GB:n muistissa.
Orvena lataa mallin mlx-community/Qwen3.5-4B-4bit yhteen revisioon lukittuna. Lataus on kymmenen tiedostoa, yhteensä 3,06 GB, josta painojen osuus on 3,03 GB; sovellus pyöristää tämän 3,1 gigatavuun. Toinen vaihtoehto, "Qwen 3.5 4B Mixed", pitää osan herkimmistä kerroksista (upotukset, puolet MLP:n alasprojektioista ja osan huomiomekanismin arvoprojektioista) kahdeksassa bitissä ja loput neljässä. Se on 3,57 GB ja tuottaa tarkempia argumentteja työkalukutsuihin, ja juuri niissä neljän bitin kvantisointi näkyy ensimmäisenä. Voit vaihtaa näiden kahden välillä Mallit-sivulla.
Miksi neljä bittiä
Kuudellatoista bitillä painoa kohden neljä miljardia parametria vie noin 8 GB, eli puhelimen koko muistin. Neljällä bitillä painot vievät levyllä noin 3 GB ja muistissa hieman enemmän, jolloin tilaa jää iOS:lle, sovellukselle ja työmuistille, jota malli tarvitsee vastatessaan. Siitä laitevaatimus johtuu: Orvena tarkistaa puhelimen fyysisen muistin ensimmäisellä käynnistyskerralla eikä tarjoa latausta, jos muistia on alle noin 8 GB. Sitä on iPhone 15 Prossa ja 15 Pro Maxissa, jokaisessa iPhone 16 -mallissa 16e mukaan lukien sekä iPhone 17:ssä ja 17e:ssä. iPhone Airissa ja 17 Pro -malleissa on 12 GB. Apple listaa Apple Intelligencelle myös iPhone 18 Pron, 18 Pro Maxin ja iPhone Duon; puhelimesta riippumatta ratkaisevaa on käyttöönoton aikainen muistitarkistus.
Ajoympäristö
Inferenssi ajetaan MLX:llä, joka on Applen omille siruilleen tekemä taulukkolaskennan kehys, Swift-sidosten kautta. Malli toimii GPU:lla puhelimen yhteismuistissa, joten painoja ei kopioida prosessorien välillä. Latauksen jälkeen painot pysyvät muistissa vuorojen välillä; iOS:n muistivaroitus tyhjentää välimuistit mutta ei mallia.
Kaksi välimuistia saa puhelimen tuntumaan nopeammalta kuin sen raaka suoritusteho antaisi olettaa. Kun malli latautuu, Orvena laskee kehotteen kiinteän osan, eli järjestelmäkehotteen ja työkalujen kuvaukset, ja säilyttää sen tilan, joten uuden keskustelun ei tarvitse käsitellä niitä tokeneita uudelleen. Keskustelun sisällä avain-arvovälimuisti (key-value cache) siirtyy vuorosta toiseen, joten jokaisen vastauksen tarvitsee lukea vain viimeisin viestisi ja työkalutulokset, ei koko historiaa.
Kontekstiikkuna on puhelimessa rajattu 16 384 tokeniin mallin täyden 262k:n sijaan. Se on noin 12 000 sanaa keskustelua, ja raja on olemassa, koska pitkän kehotteen lukeminen on puhelimessa hidas vaihe ja pitkän kontekstin välimuisti on se, mikä kuluttaa muistin loppuun. Kun keskustelu kasvaa ikkunaa suuremmaksi, Orvena säilyttää viimeisimmät kokonaiset vuorot ja jättää vanhimmat pois sen sijaan, että tiivistäisi ne. Jos yksittäinen työkalutulos on liian suuri mahtuakseen, se näyttää viestin "The latest tool result is too large for this model's context window. Try a narrower request." (viimeisin työkalutulos ei mahdu mallin kontekstiikkunaan, kokeile rajatumpaa pyyntöä).
Näytteenotossa käytetään koko vastauksen ajan lämpötilaa 1,0 ja top-p-arvoa 0,95, kun ajattelu on päällä, ja lämpötilaa 0,7 ja top-p-arvoa 0,8, kun ajattelu on pois päältä.
Ajattelutila
Qwen 3.5 päättelee ennen vastaamista, ellei sitä kielletä. Orvena antaa päättelylle token-budjetin: 288 tokenia 8 GB:n puhelimessa ja 576 tokenia 12 GB:n puhelimessa, virransäästötilassa puolet siitä. Kun budjetti loppuu, sovellus pakottaa mallin lopettamaan ajattelun ja aloittamaan vastauksen, joten vaikea kysymys ei voi jumittaa loputtomiin. Mallit-sivulla on kaksi asetusta, Automaattinen ja Pois, ja Asetusten kohta Lisäasetukset lisää mukautetun budjetin, joka voi olla 128 ja 2 048 tokenin välillä. Ajattelu auttaa eniten monivaiheisissa työkalutehtävissä, esimerkiksi matka-ajasta riippuvassa herätyksessä, ja maksaa muutaman sekunnin; nopeaan faktakysymykseen Pois on selvästi nopeampi.
Työkalukutsut
Työkalut kuvataan mallille JSON-funktioskeemoina, ja mallin oma keskustelupohja (chat template) muotoilee ne kehotteeseen, joten malli tuottaa kutsut siinä muodossa, jolla se on koulutettu. Orvena pitää kehotteen pienenä paljastamalla työkalut vähitellen: malli aloittaa muutamalla ydintyökalulla ja lyhyillä tiivistelmillä, lataa sitten tarvitsemansa taidon, kuten kalenterin, muistutukset, kartat tai terveyden, ja näkee vasta sitten täydet skeemat. Pyyntöön voi kulua enintään 32 mallikierrosta. Jokainen kutsu tarkistetaan ilmoitettua skeemaa vasten; kutsu, jonka nimeä ei ole ilmoitettu tai jonka argumentit ovat virheellisiä, palautetaan mallille virheenä, jonka se voi lukea ja korjata, eikä sitä hylätä hiljaa.
Tärkeät laskutoimitukset tekee työkalu, ei malli. Kun pyydät herätystä, jonka avulla ehdit perille ajoissa, matkatyökalu laskee lähtöajan ja malli vain kertoo sen.
Nopeus
Orvenalle ei ole vielä julkaistua suorituskykytestiä. Teksti virtaa näytölle sitä mukaa kuin se kirjoitetaan, ja lyhyen vastauksen ensimmäiset sanat ilmestyvät sekunnin tai kahden sisällä. Huomaat, että pitkässä keskustelussa vastauksen alkaminen kestää kauemmin, koska kehotteen lukeminen on puhelimessa raskas vaihe, ja että ajattelu lisää näkyvän tauon.
Kielet ja kuvat
Malli vastaa sillä kielellä, jolla kirjoitat. Jotta tämä toimisi luotettavasti myös lyhyissä viesteissä, Orvena tunnistaa jokaisen viestin kielen Applen laitteella toimivalla kielentunnistimella ja lisää ajonaikaisen huomautuksen, joka kertoo kielen; huomautus poistetaan kaikesta, mitä malli kirjoittaa takaisin, joten et näe sitä koskaan. Liitetyt kuvat kulkevat kuvaenkooderin läpi puhelimessa.
Verrattuna Qwenin ajamiseen Macilla
Macilla voit valita suurempia Qwen 3.5 -kokoja, ja ne ovat vahvempia malleja. Puhelimessa 4B on tällä hetkellä käytännön yläraja. Puhelin tuo lisäksi kaiken, mikä mallin ympärillä on: kalenterisi, muistutukset, herätykset, kuvat, terveysyhteenvedot, kartat ja kirjanpidon jokaisesta mallin tekemästä toiminnosta, jonka voit lukea ja perua. Jos haluat puhelimeesi suuremman mallin, Premium lisää iOS 27:ssä Applen Private Cloud Computen, jota varten ei tarvitse määrittää avainta, tai minkä tahansa OpenRouter-mallin omalla avaimellasi, ja Orvena pyytää suostumuksen ennen kuin yksikään keskustelu lähtee laitteelta.
Usein kysyttyä
Minkä Qwen-version Orvena lataa?
Oletuksena mallin mlx-community/Qwen3.5-4B-4bit lukittuna revisiona: 3,06 GB kymmenessä tiedostossa. Neljää ja kahdeksaa bittiä yhdistävä versio, 3,57 GB, on saatavilla Mallit-sivulla tarkempia työkalukutsuja varten.
Voinko ladata oman GGUF- tai MLX-mallin?
Et voi. Latausluettelossa on kaksi vaihtoehtoa, ja kumpikin testataan työkalusilmukkatesteillä oikeilla laitteilla ennen kuin se lisätään luetteloon. iOS 27:ssä Mallit-sivulla on tarjolla myös Apple Intelligence, joka on sisäänrakennettu iOS:ään. Orvena on avustaja, ei yleiskäyttöinen mallien ajoalusta.
Mistä painot tulevat, ja tarkistetaanko ne?
Orvenan peilipalvelimelta, ja varalla on Hugging Face. Jokainen tiedosto tarkistetaan lukittua kokoa ja SHA-256-tiivistettä vasten ennen kuin malli otetaan käyttöön. Lataus tapahtuu taustalla, jatkuu keskeytyksen jälkeen ja on rajattu iCloud-varmuuskopioinnin ulkopuolelle.
Käytetäänkö tietojani Qwenin kouluttamiseen?
Ei. Malli toimii puhelimessasi. Mitään kirjoittamaasi tai sanomaasi ei lähetetä Alibaballe eikä Orvenalle. Työkalu lähettää tarvitsemansa omalle palvelulleen, esimerkiksi verkkohaun hakulausekkeen DuckDuckGolle, ja keskustelusi lähtee puhelimesta vain, jos valitset Private Cloud Computen tai yhdistät itse pilvimallin.
Orvena on ilmainen App Storessa iPhone 15 Prolle ja uudemmille. 3,1 GB:n lataus tehdään kerran, ja malli toimii puhelimessa.
Lataa App Storesta